一、先说结论:这一周有两件事,此前从未发生过
2026 年 9 月的第三周,GEO 这门生意同时收到了两份来自外部的约束,而且都不是厂商自说自话。
第一件来自海外。宾夕法尼亚大学与东北大学的研究者完成的一项预注册随机对照田野实验,在 9 月 21 日被 Search Engine Journal 报道:研究者把 1,100 名真实用户的搜索行为追踪了七天,其中一组被强制使用 Google AI Mode,结果这一组跳出到外部网站的比例下降了 18.8 个百分点。这是我们第一次看到「引用不等于点击」被因果实验、而不是观测数据证明。
第二件来自国内。9 月 14 日,中国商务广告协会提出并归口、AI 营销应用工作委员会组织制定的《生成式引擎优化(GEO)》五项团体标准,正式通过全国团体标准信息平台审核并公布。这是我国互联网广告服务行业首份系统性的 GEO 标准,41 家单位、75 位行业专家参与制定。
两件事指向同一个结论:GEO 的交付口径要改了。过去我们卖的是「排名」和「推荐率截图」,接下来要交付的是可计量的可见度,以及能留下来的资产。
二、引用不等于点击:第一个随机对照实验给出了因果证据
这项实验的设计值得完整说一遍,因为它和以往所有 GEO 研究都不一样。研究者招募了 1,444 人,最终追踪了其中 1,100 人的搜索行为七天,并用浏览器扩展记录浏览历史与搜索结果页快照,随后收集到 956 份实验后问卷。参与者被随机分入三组:第一组隐藏 AI Overviews 并把 AI Mode 请求重定向回普通搜索;第二组保持 Google 默认行为;第三组的所有搜索强制进入 AI Mode。
核心结果以「强制 AI Mode」对照「默认搜索」:
外链点击率下降 18.8 个百分点,95% 置信区间为 −22.2 到 −15.3;
每天搜索会话数减少 0.92 次;
单次会话时长增加 0.43 分钟,也就是停留更久、点击更少;
转向 Bing、DuckDuckGo 或 Yahoo 的用户比例上升 11.2 个百分点;
对 Google 所提供信息的信任度下降。
反向那一组同样关键:隐藏 AI Overviews 之后,用户点击外部网站的比率上升了 8.8 个百分点,而用户对搜索体验的评价没有出现可测量的下降。论文标题是《AI in Search Reduces Publisher Referrals Without Improving User Experience: Experimental Evidence》,由 Wang、Gleason、Bart、Wilson、Metaxa 完成,受美国国家科学基金会资助,作者声明无利益冲突。
必须同时说清它的局限,否则结论会被误用:强制 AI Mode 属于「全量采用」的压力测试,实验期自然使用 AI Mode 的比例只有约 0.6%,所以 18.8 个百分点是实验效应,不是对所有站点明天的预测;另外隐藏 AI Overviews 那一组只成功了 51.1%,因为 Google 在实验中途改动了 AI Overviews 的页面结构,导致扩展的识别逻辑失效,因此更干净的估计值来自 AI Mode 那一侧。
对我们的实操含义很直接:把「出现在 AI 答案里」当成增长指标,需要拆成三层分开计量——曝光、外链点击、转化,这三者不是一回事。
三、Google 把 AI Overview 里的链接改道 AI Mode
几乎与上述论文被报道同一时间,产品层面也出现了一个变化。9 月 21 日,SEO 从业者 Gagan Ghotra 在 X 上发布视频,显示 AI Overviews 答案底部的链接外观正常,点击后却不是打开外部网页,而是打开 AI Mode 里的追问。Search Engine Roundtable 的 Barry Schwartz 于 9 月 22 日报道了这一测试。
这意味着「引用泄漏」被产品化了:控件看起来还是链接,目的地换成了 Google 自己的答案界面。把它和上一节的实验放在一起看,两件事的指向完全一致——引用只是一种曝光,不是流量入口的保证。
所以在我们给客户的报告里,「被引用了」这句话后面必须紧跟一句「但这不等于你获得了访问」。如果报告里只有前者、没有后者,客户迟早会自己发现落差,而那时损失的是信任。
四、国内第一次有了尺子:9 月 14 日首份 GEO 团体标准
五项标准分别是:T/CAACCHINA 001-2026《第 1 部分:通论及术语与定义》、002-2026《第 2 部分:服务商评估规范》、003-2026《第 3 部分:计价、评估与测量规范》、004-2026《第 4 部分:可信语料规范》、005-2026《第 5 部分:服务流程合规与安全要求》。五部分既独立成篇又相互咬合,覆盖 GEO 服务的全生命周期。
制定过程本身是可追溯的:2026 年 3 月 27 日召开制定工作座谈会确立起草方向,3 月末立项获批,4 月 29 日召开第一次全员会议,4 月至 7 月分头起草与交叉评审,7 月 28 日至 8 月 30 日公开征求意见并收到 38 家企业、13 位专家共 174 条修改建议,9 月 9 日通过技术审查,9 月 10 日报批,9 月 14 日正式公布。
最有价值的一点在于,这套标准第一次在团标体系内定义了检索增强生成(RAG)、语义相关性、向量检索、可信语料这批前置术语,也第一次把「黑帽 GEO」和「语料投毒」写成了需要被明确排除的负面概念。一门生意从「各说各的」走到「术语统一」,通常意味着它开始被当作正经采购品类看待了。
五、标准里最该抄下来的一段:引用决策五大信号
第 1 部分提出了两个结构性框架,我建议同行直接抄进自己的方法论文档。
第一个是 GEO 四层技术框架:L1 技术基础层、L2 内容质量层、L3 平台适配层、L4 品牌心智层。它把「技术能不能抓」和「品牌能不能被记住」放在同一条链路上,避免了把 GEO 简化成排版技巧。
第二个更实用——生成式 AI 引用决策五大信号:语义相关性、信息增益、实体一致性、品牌权威性、内容质量。其中「信息增益」这个词值得单独拎出来:它把「你有别人没有的事实」写成了引用因子的正式条目。这正是我们一直主张的「一手实测数据优先」被制度化表达了一次。
第 2 部分把服务商划分为六个类型:内容生产型、信源建设型、技术平台型、策略咨询型、数据监测型、综合服务型,并给出企业资质与合规、技术与数据能力、服务交付能力、质量保障体系、行业实践与声誉五大评估维度。客户按这套表来挑服务商,我们自己也该按这套表来检查自己属于哪一型、缺哪一型。
第 3 部分的计量规范最硬:定义七类计价最小单元,规范按项目、按服务内容和数量、按效果、按系统交付、混合式五种计价模式,并给出九项核心指标,每一项都附带统计口径与最小样本量。这里必须划出一条红线——标准明确禁止「保证首位」「确保收录」这类绝对效果承诺,服务商评估还设了一票否决:存在黑帽操作、虚假效果承诺或数据安全处罚记录的,直接出局。第 5 部分进一步要求 AI 输出必须人工核验,金融与医疗内容需 100% 人工复核。
我的判断是:谁还在用「保排名第一」当卖点,谁就已经把自己写进了不合规名单。
六、合规不是背景音:9 月 1 日新规与 9 月 7 日最高法意见
与团标同期的还有两条监管线索,行业里讨论得不多,但对服务商是实打实的经营约束。
第一条是 2026 年 9 月 1 日正式实施的《互联网信息内容多渠道分发服务管理规定》。它以专项法规形式规范 AI 信息分发、网络内容传播与品牌营销推广的全链条行为,明确 MCN 机构、内容服务商、品牌运营主体的合规责任,并划定 11 条运营红线。
第二条是 2026 年 9 月 7 日最高人民法院发布的《关于依法审理涉人工智能纠纷案件的意见》。其中与 GEO 直接相关的一句是:对于采取虚构干扰数据、恶意标注数据、对抗样本攻击等技术手段、损害人工智能运行安全的行为,应依法承担相应责任。
边界必须讲清楚,否则容易被误读成「做 GEO 违法」:正常的网站建设、SEO、内容运营、品牌传播、媒体报道、知识库建设,以及让企业信息变得更完整,都不属于这里所说的恶意干扰。真正要被追究的是另一条路线——为了操纵 AI 答案而故意制造虚假事实、虚构证据、污染数据。
叠加此前中央网信办「清朗·整治 AI 应用乱象」专项行动把 GEO 信息投毒、批量伪造信源、操纵大模型引用列为重点打击对象,以及 2026 年 8 月发布的 T/CAPT 026—2026《互联网信息可信传播评价规范》建立的四级信源分级体系,方向已经很清楚了:GEO 可以优化信息供给,但不能把「优化」做成「伪造」。
七、平台侧同步收紧:五家一周内集体升级,共同卖点是「信源」
把时间线摆出来,会看到这不是孤立事件。9 月 3 日,OpenAI 把「多步网页研究 + 电脑操作」写进默认推理链路,不再是需要手动开启的插件;9 月 10 日,DeepSeek V4.1-Flash 上线,旧模型的请求被全量路由到新模型;9 月 16 日,豆包 2.1 Pro 官方明确强化「证据溯源、权威信源检索、时效判断、数据核验」四项能力。信源检索、降幻觉、引用优先,成了这一轮迭代的共同关键词。
平台侧已经出现一批第三方实测数字,值得记住(以下均为行业与第三方实测口径,非平台官方公布的算法权重):
元宝:三轮检索返回约 118 条信源,最终被采信进结论的只有 23 条,占比约 19%。换句话说,铺十篇内容,可能有八篇只在候选池里陪跑。
文心一言:第三方实测对百度系内容的引用率达到 81.7%,生态闭环明显。
豆包:手机端在商品选购、好物推荐场景下信源向抖音倾斜,目的地推荐类问题对抖音内容的引用率达到 97.7%;同一个模型换个端口规则就不同,App 端抖音域名占比 28.62%,Web 端降到 11.85%。
DeepSeek:最终精读的信源数量从 10 至 15 个压缩到 4 至 5 个;央媒内容的引用权重是普通自媒体的 25 至 30 倍;学术论文与机构报告占引用比例 47%,官方媒体占 39.4%。
这些数字未必每条都精确到小数点,但它们的方向高度一致:评价标准正在从「谁的内容多」转向「谁能被证实」。
八、用我们自己的站做一次对照:20 条 URL 说明的问题
今天(9 月 24 日)我们对自有站点 www.yunroad.cn 做了一次外部只读自测,快照是:核心页 7/7 返回 200、平均 0.13 秒;部署指纹 20260921a 与本地一致;sitemap 20 条(其中文章 7 篇);robots.txt 指向 www;canonical 抽查 2/2 指向 www;本地自有文章 8 篇,最新一篇日期为 2026-09-23。
把这份数据和上面的行业数据摆在一起,有三处校准值得写进方法论。
第一,自有内容不是主战场。Shero Commerce 对 1,851 条购买类提示词的引用来源做过分析,只有 2.8% 是品牌自有页面;即便引擎在答案里推荐了某个品牌,该品牌自己的页面被引用的比例也只有 31%。而我们全站只有 20 条 URL——这不是「内容写得不够多」的问题,是「只有自有内容」的结构问题。
第二,样本量比指标本身更重要。团标给九项核心指标都配了最小样本量,原因就在这里:SE Ranking 对 10,000 个 AI Mode 查询重复检索三次,平均 URL 重叠只有 9.2%,21.2% 的查询出现零重叠。我们的探针系统此前实测的单次采样方差约 38%,与这个数量级一致。所以「今天问了三次都被引用」不是结论,是噪声;要拿频率说话,而不是拿一次结果说话。
第三,品牌名比 URL 稳定。Wellows 对 596,723 条提示词、两个以上引擎的统计显示,只有 10.2% 的 URL 会被多个引擎同时引用,域名级升到 17.9%,但换成品名口径,一致度升到 67.4%——约 6.6 倍的差距。所以报告的第一指标应该是「提及率」,而不是「某条 URL 被引用了没有」。AthenaHQ 给出的基准是平均品牌提及率 17.24%,领先者 56.71%。
落到动作上,交付口径需要三次校准:报告头部从单一的「推荐率」改成「提及率 + 引用来源分布(自有与第三方)+ 采样次数与置信说明」;每个项目必须留下可继续经营的资产,包括官网产品服务与案例页、客户问题库、统一的品牌事实口径、AI 平台监测基线,而不是几百条第三方稿件的截图;最后,把任何绝对效果承诺从合同与话术里删掉——这已经是团标的一票否决项。
常见问题
AI 已经引用了我们,为什么网站流量没有涨?
因为引用和点击是两件事。2026 年 9 月公开的一项预注册随机对照田野实验(追踪 1,100 名用户七天)显示,被强制使用 Google AI Mode 的用户,外链点击率比普通搜索下降 18.8 个百分点,95% 置信区间为 −22.2 到 −15.3;而隐藏 AI Overviews 之后点击率上升了 8.8 个百分点。同月 Google 还被观察到在测试 AI Overviews 内的链接直接打开 AI Mode 而非外部网页。因此「出现在 AI 答案里」应当作为曝光指标,与访问量、询盘量分开计量。
国内做 GEO,现在有没有统一的效果衡量标准?
有了。2026 年 9 月 14 日,中国商务广告协会提出并归口、AI 营销应用工作委员会组织制定的《生成式引擎优化(GEO)》五项团体标准(T/CAACCHINA 001-2026 至 005-2026)正式公布。其中第 3 部分《计价、评估与测量规范》定义了七类计价最小单元、五种计价模式和九项核心指标,并为每一项指标给出统计口径与最小样本量。需要提醒的是,该标准明确禁止「保证首位」「确保收录」这类绝对效果承诺。
既然不能保证被引用,那 GEO 还能承诺什么?
可以承诺的是过程与资产,而不是结果数字。按五项团标的框架,可交付的部分包括:GEO 四层技术框架(L1 技术基础层、L2 内容质量层、L3 平台适配层、L4 品牌心智层)的落地情况;围绕引用决策五大信号(语义相关性、信息增益、实体一致性、品牌权威性、内容质量)的内容改造;可信语料与合规流程;以及可复查的监测基线与采样说明。结果是概率事件,过程是可验收的。