行业洞察

谁在引用你:第三方提及占 85.8% 的实测,与 Google 首次公开的 AI 曝光口径

· 云途 GEO编辑部 · 约 7 分钟

先说结论:AI 引用正从「你说什么」转向「谁在说你」

过去一个月,GEO 领域有三件事指向同一方向:AI 引用的胜负手,正从「品牌自己讲了什么」转向「站外有谁在替你说话」。

9 月 7 日,一份 arXiv 复现实验证明,「塞引用、塞统计数字、塞引文」在控制变量后无正向效果。9 月 14 日,Search Engine Land 公布两组 GEO 实验,775 条人工记录的引用事件里第三方来源占压倒多数。9 月 16 日前后,Google 在 Search Console 上线生成式 AI 效果报告,第一次把「你有没有出现在 AI 答案里」变成站长可查的第一方数据。

再往前一个月:8 月中旬 ChatGPT 引用来源结构突变,Reddit 在 ChatGPT Search 中的份额四天内下滑 86.4%。平台没发公告、没处罚谁,只是换了检索方式。

新数据一:Google 第一次把「AI 曝光」摆上台面

2026 年 9 月中旬起,Google Search Console 向全球开放「生成式 AI 效果报告」:页面出现在 AI Overviews、AI Mode 和 Discover 的 AI 摘要中多少次,可按页面、国家、设备、日期看趋势。

分量在于「第一方数据」。此前判断一个站有没有被 AI 引用,只能靠第三方工具反推或自建探针问模型,样本和口径都不在自己手里。

三个限制必须说清:只有曝光没有点击;AI Overviews 与 AI Mode 合并统计,不能反推形态;按页面聚合与按站点聚合的总数可以不同,两者都不算错。John Mueller 也公开表示,它追求的不是「精确的位置真相」,而是「对站长有用」。

同时上线的还有退出开关:站长可让内容不参与 AI 引用,Google 明确说不影响常规搜索排名——对以获客为目的的企业站,退出的代价远大于收益。

新数据二:775 条引用事件里,第三方占了 85.8%

9 月 14 日 Search Engine Land 刊登的两组背靠背实验,作者人工在多平台反复跑同一批商业意图关键词,逐条记录答案里出现的来源,合计 775 条引用事件。

实验一:一个有品牌基础的顾问客户,15 个词、4 个平台,按平台约 148 / 96 / 87 / 64 条。一个扎眼细节:单篇发在第三方测评站的清单类文章,一个来源就贡献 190 条引用,比其他所有来源加起来还多。

实验二(冷启动):一个 SaaS 服务商从零基线起步,30 天、15 个词、6 个平台,记录到 437 条来源提及——第三方清单类文章 85.8%,品牌官网上的同类文章 14.0%,新闻稿 0.2%;自有页面拿到第一条引用花了 18 天,比任何第三方来源都慢。

两个易被忽略的观察:一是极端集中,三个来源占了 437 条中的 342 条(约 78%);二是衰减,约一半被引来源 30 天内掉出引用集合。边界:小样本、自报、单赛道,不能当市场平均线。

新数据三:ChatGPT 换了检索方式,Reddit 引用四天跌 86.4%

8 月的这件事最能说明平台机制变动有多致命。

8 月 8 日,ChatGPT 的查询扇出(query fan-out)变形:后台检索中使用 site: 定点检索(去问某个特定域名)的比例一天内从约 0.37% 跳到 16.8%,每次回答的后台搜索次数从 1.08 升到 1.83——它不再广撒网看全网在说什么,而是点名去问几个它信得过的站。

PromptWatch 的日度追踪显示,Reddit 在 ChatGPT Search 引用中的份额,从 7 月 18 日–8 月 7 日的 3.83% 跌到 8 月 14–17 日的 0.52%,跌幅 86.4%;同期文档与帮助中心类页面的占比升到约三成。

但这是引擎特定的:同一批数据里 Reddit 在 Google AI Mode 仍占约 4.4%–4.5%,在 ChatGPT 与 Perplexity 里却是零——它不是被降权,而是被某个引擎的检索路径绕开。

含义:不要把任何「曾经管用的渠道」当资产,它的权重由检索架构决定,不由内容质量决定。

为什么自有内容从「主引擎」退成「入场券」

传统 SEO 里,自有内容通常贡献自然曝光的四到六成;而上述两组 GEO 实验里,自有站点内容是个位数份额。

机制层面,9 月 7 日那份 arXiv 复现实验给了两个数字:「引用权威、加统计数字、加引文」在控制变量后合并检验无正向效果;「与查询无关的页面质量分」与实际被引用可见度的相关系数只有 0.114(几乎不相关),纳入「查询相关性」后升到约 0.37。内容写得再规范,跟用户实际在问的问题对不上,AI 就不会引用你。

引擎行为层面,当 ChatGPT 用 site: 定点去问「某个页面怎么说」时,天然偏向结构清晰、观点单一、能被整段摘走的页面:官方文档、产品说明、FAQ、对比清单;含糊的长文和结构松散的论坛帖都吃亏。

但结论绝不是「不用做自有内容」。它仍承担两件不可替代的事:底稿作用——第三方要准确介绍你,需要一个口径统一、可核查的源头;以及承接品牌词与直接搜索。

两个容易踩的坑:平台分化,和没有消费者的「标准」

第一个坑是把所有平台当一个平台。信源池分层已很明显:豆包偏向字节生态(头条、抖音),腾讯元宝对微信公众号、视频号有天然优先,文心一言以百家号、百度百科为基本盘,DeepSeek 看重官网事实与权威媒体,Kimi 偏好逻辑完整的长文,千问偏向决策框架。同一页内容很难同时满足所有平台,正确做法是按平台分渠道铺,并先测出目标问题下 AI 已经在引用谁。

第二个坑是迷信 llms.txt。2026 年的实测不太好看:SE Ranking 抓取约 30 万域名后发现,采用率约 10%,而它与是否被 AI 引用之间没有可测量的关系——把它从引用预测模型里拿掉,模型准确率反而上升。日志证据更直接:5 亿次以上 AI 机器人访问里只有 408 次请求了 /llms.txt。Google 早在 2025 年 7 月就表示不支持该文件。

务实结论:它成本低、风险低,有开发者工具链场景可以做,但绝不能替代语义化 HTML、准确的结构化数据、正确放行的 robots.txt,以及真的在更新的 sitemap。

回到我们自己的站:自测数据说明了什么

我们正在卖 GEO 服务,自己的站就是最硬的案例。

今天(2026-09-23)的外部只读自测结果:核心页 7/7 返回 200,平均响应 0.15 秒;线上首页出现本地部署指纹 20260921a,本地与线上一致;sitemap 共 20 条 URL,其中文章 7 篇,本地 7 篇文章 7/7 全部被收录;robots.txt 的 Sitemap 指向 https://www.yunroad.cn/sitemap.xml;抽查的 canonical 全部指向 www。

三条判断。一,基础盘干净:无死链、无重复 host、canonical 统一、sitemap 与内容同步——这是「入场券」级别的东西,我们做到了。二,入场券不等于引用:全站只有 20 条 URL、7 篇文章,几乎全是自有内容;对照那组实验的结构(第三方 85.8% vs 自有 14.0%),我们几乎 100% 押在增长最慢的一侧。三,官方基线可以抓了:Search Console 的 AI 报告是目前唯一能拿到「我们有没有被 AI 展示过」第一方数字的地方,应尽快记基线并与探针交叉验证。

可以马上做的四件事

第一,先画「答案地形图」。把 15 个最贴近成交的问题在 ChatGPT、Gemini、Perplexity、豆包、元宝、DeepSeek 上各跑一遍,记录答案里出现的来源 URL,50 到 75 次查询后模式会自己浮现。

第二,定向争取第三方提及,而不是泛泛发稿。优先争取那些已经在该问题下被引用过的来源(行业榜单、测评站、垂直媒体)——实验二里第三方清单贡献 85.8% 提及,新闻稿只贡献 0.2%。

第三,自有页面只承担两件事:给第三方一个可核查的底稿,以及承接品牌词与直接搜索。把核心页做成「一个问题一段、首句给答案、事实可摘取、带明确更新时间」的形态,收益比多写十篇更确定。

第四,把刷新周期写进流程。约一半被引来源 30 天内掉出,AI 引用不是一次性工程,按季度检查「我们还在不在那些答案里」。

常见问题

第三方提及占 85.8%,这个数字所有行业通用吗?

不是。它来自 2026 年 9 月 14 日 Search Engine Land 刊登的两组实验中第二组:一个零基线 SaaS 服务商、30 天、15 个商业意图词、6 个平台,共记录 437 条来源提及,其中第三方清单类文章占 85.8%、品牌自有文章占 14.0%、新闻稿占 0.2%。这是小样本、自报、单赛道结果,不能当行业平均线。它说明的是一个方向性判断:在品牌几乎没有 AI 可见度时,站外来源往往先于自有内容产生引用信号。

Google Search Console 的 AI 效果报告能替代自建可见度探针吗?

不能,两者互补。该报告只覆盖 Google 自己的生成式功能(AI Overviews、AI Mode 和 Discover 中的 AI 摘要),只提供曝光数、没有点击数据,也不覆盖 ChatGPT、豆包、元宝等站外平台。它的价值在于提供第一方基准:至少能确认自己有没有被 Google 的 AI 展示过。自建探针则覆盖多平台、能看到答案原文和具体引用来源,两者交叉验证,结论才稳。

既然自有内容只占一小部分引用,是不是可以少写官网内容?

不建议。自有内容仍承担两件不可替代的作用:一是作为对外表述的底稿,第三方要准确介绍你、引用你,需要一个口径统一、可核查的源头;二是承接品牌词和直接搜索。2026 年 9 月 14 日那组实验里,自有页面的问题不是没用,而是慢——它拿到第一条引用花了 18 天,比第三方来源都晚。合理做法是保留自有内容的投入,同时把新增预算的一部分转向争取第三方提及。