一、先说结论:GEO 的评分尺子换了,不是变细了
2026 年 9 月下旬这一周,GEO 行业同时收到三组彼此独立的新证据。它们不是同一件事的三种说法,而是三个不同环节的实测结论,合起来只指向一句话:GEO 的评分尺子换了一套。
第一组来自学术界。SIGIR 2026 收录的论文《What Gets Cited: Competitive GEO in AI Answer Engines》做了 252,000 次受控双源对照实验:在六个大模型上,每次只让两份候选文档在一个变量上产生差异,然后看模型把哪一份排在引用的第一位。结论是四项因素在所有模型上一致胜出——主题相关性、在模型已收到的候选列表中的位次、明确写出的价格、以及近期的时间戳;而「完整性提示」和「信任线索」只有较小的次级增益,纯粹的排版与格式美化「几乎没有稳定影响」。作者在摘要里直接写了那句被反复引用的话:实质推动引用,排版不能。
第二组来自平台侧监测。第三方监测机构 Peec AI 在 9 月 21 日发布图表数据,称 Google 在 AI Overview 答案中「大幅增加」了外链,携带至少一条外部链接的 AI Overview 占比从接近 0% 拉升到 25% 以上;Search Engine Roundtable 于 9 月 23 日转述,并罕见地公开说明作者自己「觉得这个数字不太对」,同时披露了对 Peec AI 的一笔小额投资。这组数字目前只有单一来源,我们把它登记为待核,不作为结论使用。
第三组来自排名与引用的解耦测量。Moz 分析约四万个查询后给出,Google AI Mode 中约 88% 的引用链接并不出现在同一查询的自然搜索结果里;Ahrefs 的对照统计则显示,AI Overview 引用与自然结果前十的重合率在七个月内从 76% 掉到约 38%。两个数字口径不同、方向一致:排名与「被引用」是两套逻辑。
把三组证据叠在一起,对做 GEO 的人只有一个实际含义:过去两年被反复兜售的那套「优化页面外观让它看起来更 AI 友好」的动作,正在被系统性证伪;而真正决定胜负的东西,回到了内容本身能不能回答那个具体问题。
二、被实测证伪的三个老技巧
第一个,是结构化数据的「引用杠杆」定位。必须把两件事分开讲,否则很容易说错:Schema 依然是好技术实践,Organization、Article 这类实体标记能帮助机器确认「这一页在讲谁」;但把它当作提升 AI 引用率的杠杆,已经被实测否定。Ahrefs 追踪了 1,885 个在 2025 年 8 月至 2026 年 3 月之间新增 JSON-LD 的页面,对照约 4,000 个匹配样本,结果是 Google AI Mode 变动 2.4%、ChatGPT 变动 2.2%,两者与零在统计上无法区分,AI Overviews 一侧甚至下降了 4.6%;四种统计方法结论一致。另一个方向的测试更直接:searchVIU 发现没有任何引擎能抽取只存在于 JSON-LD 里的价格,因为检索管线在嵌入之前就把 script 标签剥掉了。
第二个,是 llms.txt。这项在 9 月中旬已被我们记录为「按无效处理」,本轮补上了更硬的证据:Ahrefs 对 137,000 个域名的服务器日志研究显示,97% 的 llms.txt 文件收到零次请求,且没有任何引擎在文档里声明会读取它。Google 自己的表态更直白——llms.txt 对 Google 搜索既非必需,也不产生正面或负面的排名影响。
第三个,是「加引文、加统计、加专家语录」这套原始 GEO 打法。这套建议来自 2023 年底 KDD 的那篇开创性论文,当时测得的增益是:引用使页面在答案中的占比提升 27.7%、统计提升 32.8%、引语提升 42.6%。2026 年 7 月发表的新研究《Scoring Without the Engine》用今天的模型、在十个引擎(含三个不同版本的 GPT-5)上复现同一实验,三项的效应量分别是 −0.0009、−0.0002 与 −0.0101,基本等于零。
三、一个必须讲清的边界:证伪的是「杠杆」,不是「价值」
这里有一个极容易讲错、也极容易被同行拿来反驳的边界,必须写清楚。
SIGIR 那篇论文的实验设计,是「把两份候选文档预先放进模型的上下文,再看它先引谁」。这是检索之后(post-retrieval)的偏好测试,它绕开了抓取、索引、嵌入与召回这一整层。所以它能证明的只有一件事:当引擎已经把你和竞品都拿到手之后,靠改排版赢不了那场对照。它不能证明的是:你该怎么进入那个候选集。原文作者自己在讨论里也把这条边界写明了。
这两层的分工,换算成可执行的动作就是:如果你的品牌在答案里压根没出现,先修可抓取性、可索引性与第三方清单里的存在感,而不是去调 H2 层级;如果你已经在答案里、但输给了竞品,那才轮到检查主题贴合度、有没有把价格与规格明写、页面日期是不是真的新。
同样要打折的还有那组平台的实测数字。Ahrefs 与 Moz 的 88%、38% 是第三方测量,不是官方口径;Peec AI 那张从 0% 到 25% 的图,只有一家在做,样本量、时间窗、查询类型、国别都没有公开,而且发布者与被报道方存在投资关系。这类数字能当方向看,不能写进客户报告当事实。
四、对照我们自己的站点自测:一个「数据齐全但结构失衡」的样本
行业数字之外,更硬的是我们自己的数。云途 AI营销每天用只读脚本对 www.yunroad.cn 做一次外部自测,结果原样记入台账,不做修饰。
2026 年 9 月 25 日这一次的快照要点是:核心页 7/7 返回 200,平均 0.20 秒;线上首页部署指纹与本地一致;robots.txt 的 Sitemap 指向 www;抽查 canonical 2/2 指向 www;sitemap 共 20 条 URL,其中文章 7 篇,而本地已有 9 篇,即已收录 7/9。最后这一项是本次唯一的关注项,原因是本地新写的第 8、9 篇还没上传,线上 articles.json 仍是旧版——这属于上传节奏问题,不是站点故障。
把这个快照和上面三组证据放在一起,会看到一个很典型的失衡结构:我们自己的站,技术体检是全绿的,结构化数据完整,canonical 与 robots 口径干净,但这些「卫生指标」恰好正是本轮被证伪的那一类杠杆。而真正决定能否被引用的那一侧——站外第三方信源的数量与等级——我们的数字非常薄:全站 20 条 URL、9 篇自有内容,几乎 100% 押在自有侧,而多个独立研究都指向同一个区间:AI 引用里第三方来源占八成以上,购买类场景下品牌自有页占比只有个位数。
这与我们台账里那条结论完全吻合:结构问题重于产量问题。多写一篇自有文章,边际收益远低于在第三方清单站、行业目录、垂直问答里拿到一个位置。
五、探针实测的独有价值:各平台「回带来源」的能力差五倍
行业研究给的是通用结论,云途自己的 GEO 探针给的是各家平台的真实差异,这部分数据外部拿不到,也是我们报告里最硬的一页。
我们在一批同口径样本上统计过各平台独立回带被引来源链接的能力:通义千问 100%、Kimi 100%、文心 87%、豆包 84%、智谱 77%、元宝 55%,而 DeepSeek 只有 6.5%。这组数字的直接含义是:做引用源体检时,必须把不联网、只产生「记忆」的平台剔除出去,否则会把「这家引擎不回带来源」误读成「我没有被引用」。
第二个数字是方差。同一批提示词重复采样,单次结果之间波动约 38%;外部研究给出的量级相同——同一批 AI Mode 查询重复三次,URL 重叠率只有 9.2%,其中 21.2% 完全零重叠。但同一批研究也给了我们一个可用的出口:在「品牌名称是否被提及」这一层,稳定度是 67.4%,比 URL 层高出一个量级。所以对外报告的主指标应该取「提及率」,而不是「引用了哪个 URL」。
把这两条合起来,就是我们给客户做 GEO 检测的口径底线:标明采样次数与最小样本量,剔除不回带来源的平台,主指标取品牌提及率,把 URL 引用作为辅助证据而不是结论。
六、按平台分配内容资产,而不是一套内容打全部
第三个变化来自信源结构的平台差异。第三方统计给出的平台偏好差异相当大:ChatGPT 的引用来源高度集中,维基百科在前十来源里占约 47.9%,Reddit 约 11.3%,其余是 Forbes、G2 这类参考与评测站;Google AI Overviews 的分布则平得多,Reddit 约 21.0%、YouTube 约 18.8%、Quora 约 14.3%、LinkedIn 约 13.0%;Perplexity 更极端,Reddit 在前十来源里约占 46.7%,评测与点评类站点合计占比明显高于另两个平台。
每条答案愿意给几个引用位,差异同样大:ChatGPT 约 96% 的回答给出引用、平均约 5 个来源;Gemini 约 82% 的回答给出引用、平均约 8 个;Claude 只有约 55% 的回答给出引用,是三家里最低的。这意味着,「被点名」的机会总量与平台流量份额并不成正比——单看流量份额分配资源,会系统性错过那些更愿意引用你的平台。
另外两个机制细节也值得记下来。ChatGPT 的检索走 Bing 索引,站点若被 WAF 或 CDN 按 user-agent 拦掉了 OAI-SearchBot、GPTBot,会静默地整站出局,且这个故障不会报错,只能靠主动排查。Perplexity 是实时检索,对近期更新的页面有明显偏好,新内容从上线到首次被引用的周期比另两家短得多。
所以正确的做法是按「资产类型 → 平台」映射,而不是反过来:定义与规范类页面主要服务 ChatGPT;第三方评测、真实用户讨论与对比页主要服务 Perplexity 和 Google AI Overviews;视频与专业社区内容主要服务 Google 侧;而所有平台的共同底座是同一套结构——小标题下第一句就是 40 到 60 字的自包含答案,关键结论配具体数字与日期,问答写成能独立摘取的段落。
七、云途 AI营销的调整:停三件事,加两件事
把上面五节收敛成我们自己的动作清单。
要停的三件事。第一,停止把结构化数据当作引用率杠杆来卖。Schema 继续维护,因为它帮助实体识别、也帮助机器正确读数,但不能再写进方案里作为「提升引用率」的手段——那已经有对照实验否定了。第二,停止在页面上做「AI 友好格式」的表演式调整。加粗答案句、堆砌装饰性 FAQ 区块、把段落切得更碎,这类改动在新的对照实验里几乎没有稳定增益,把它们放进交付清单只会抬高成本、拉低可信度。第三,停止用一套内容覆盖全部平台。三个平台的来源结构差异是结构性的,不是细节。
要加的两件事。第一,把预算从「给自己写」挪到「去别人那儿被写」。我们的站现在 20 条 URL、9 篇自有内容,站外信源几乎为零,而所有独立研究都指向第三方来源占 AI 引用八成以上。具体动作是接着推进已经列入待办的「答案地形图」:选 15 个真实商业意图词,在 6 个平台上逐条记录答案引用了哪些域名,先把「该去谁那儿被引」这张表做出来,再谈内容生产。第二,把「过程指标」写进交付物。用品牌提及率、来源结构分布、以及采样次数与最小样本量说明,替代任何形式的排名或流量承诺——这既是测量学的要求,也和国内已发布的 GEO 团体标准口径一致。
还有一条属于站点侧的具体待办:本地第 8、9 篇文章尚未上传,线上 sitemap 仍是 7 篇,需要先把 articles.json 传上去,再访问一次 sitemap 重建入口,让新文章进入索引。这件事不影响机制判断,但影响我们自己的「自证样本」是否完整。
八、给企业主的四条可执行建议
如果读者是自己的企业主、正在判断要不要做 GEO、或正在验收服务商,可以按下面四条自查。
第一,先问「我在答案里出现了吗」,再问「为什么没被引用」。这是两个不同的问题,对应两套完全不同的修法:不在答案里,先查抓取与索引(尤其 ChatGPT 侧的 Bing 收录与爬虫放行)、再查第三方清单的存在感;在答案里但输给竞品,再查主题贴合度、价格与规格是否明写、页面日期是否真的新。顺序颠倒会白花钱。
第二,警惕一切「保证被引用」「确保收录」「霸屏」的承诺。国内已发布的 GEO 团体标准明确把这类承诺列为禁项,并把黑帽操作、虚假效果承诺列入一票否决。合规的交付只能承诺过程指标。
第三,看服务商的自证材料时,重点看三样:检测是否分平台出具、是否给了采样次数与样本量、是否愿意把原始问答记录开放给客户自己复算。只给截图和周报的,无法验收。
第四,接受一个不讨喜的事实:GEO 不是把官网做漂亮就能拿到的东西。官网决定 AI 对你的认知下限——事实准不准确;第三方权威来源决定认知上限——你在行业里被怎么描述。两者缺一,都会让优化停在一个很低的天花板上。
常见问题
结构化数据对 AI 引用到底还有没有用?
要分两件事讲:Schema 依然是好技术实践,Organization、Article 这类实体标记能帮助机器确认这一页在讲谁;但把它当作提升 AI 引用率的杠杆已经被实测否定——Ahrefs 追踪 1,885 个新增 JSON-LD 的页面、对照约 4,000 个样本,结果是 Google AI Mode 变动 2.4%、ChatGPT 变动 2.2%,两者与零在统计上无法区分。
SIGIR 2026 那项 252,000 次对照实验,结论应该怎么用?
它能证明的只有一件事:当引擎已经把你和竞品都拿到手之后,靠改排版赢不了那场对照。实验测出四项因素在所有模型上一致胜出——主题相关性、候选列表中的位次、明确写出的价格、近期的时间戳。它不能证明你该怎么进入那个候选集,所以要先用它修「已经在答案里却输给竞品」的问题,而不是用它解释「为什么我压根没出现」。
为什么你们报告的主指标是品牌提及率,而不是引用链接数?
因为两者的稳定度差一个量级。同一批 AI Mode 查询重复三次,URL 重叠率只有 9.2%,其中 21.2% 完全零重叠;而我们自己探针实测的单次采样方差约 38%。但同一批研究显示,品牌名称层面的稳定度是 67.4%。所以主指标取提及率,URL 引用作为辅助证据,并且必须附采样次数与最小样本量说明。