资讯 · 方法论

GEO 效果到底怎么验收?老彭公开矩势月报里的四个硬指标

发布于 2026-07-27 · 作者 老彭(矩势三轨 GEO 优化)

这行有个老大难问题:GEO 到底做没做出效果,谁说了算?服务商甩几张“AI 提到我们了”的截图,客户将信将疑;客户自己试两个问句没看到品牌,又觉得钱白花了。双方都没错,错在没有一套事先说好的量化口径。今天把矩势老彭GEO 月报里跑了很久的四个硬指标公开出来——不是什么商业机密,这套东西越多人用,行业里的糊涂账就越少。

验收的前提:先锁定问句池

讲指标之前必须先讲前提:所有指标都建立在一个固定的“问句池”上。项目启动时,我们会和客户一起敲定五十到一百个核心问句,覆盖品牌词、品类词、场景词、对比词四类,写进项目文件双方确认。之后每月复测都用这个池子,只增补、不偷换。没有固定问句池的效果汇报都经不起推敲——挑着问句测,想要什么结果就能测出什么结果。这是甲方最该长的一个心眼:让服务商先交问句池,再谈效果。

指标一:提及率——答案里有没有你

提及率是最基础的指标:问句池里的问题,各家 AI 的回答中提到品牌的比例。测法很朴素——每个问句在每个目标引擎里各问三轮(对话式引擎的答案有随机性,单轮结果不可靠),三轮里出现两次以上记为“稳定提及”。我们报给客户的都是稳定提及率,不拿偶发命中充数。这个指标的合理预期要讲清楚:品牌词问句的提及率应该冲着九成以上去,品类词和场景词能从零做到三四成就已经是实打实的进展,因为那是在跟全行业抢答案位。

指标二:引用率——你的信源有没有被用上

提及率看结果,引用率看路径:AI 给出答案时,引用来源里出现己方可控信源(官网、官方专栏、深度合作的第三方内容)的比例。这个指标的价值在于诊断——提及率低而引用率也低,说明信源建设还没到位,内容要补;提及率低但引用率不低,说明 AI 读到了你却没选你,问题多半出在内容的结论强度和可引用性上,要改写法。两个指标交叉看,下个月的活儿该往哪使劲,一目了然。这也是为什么我们坚持引用率必须单独列,不能和提及率混成一个数。

指标三:口径正确率——AI 说的对不对

这是最容易被忽略、出了事最疼的指标:AI 提到品牌时,关键事实说得对不对——主营业务、服务范围、价格区间、成立年限,有没有张冠李戴或引用过期信息。我们按月抽检提及答案,标注错误口径并溯源。经验数据是:没做过信息治理的品牌,首测口径错误率普遍在两到四成,AI 拿旧闻、拿竞品信息、拿论坛传言拼答案的情况都见过。口径正确率上不去,提及率越高越危险,等于 AI 在大规模帮你传播错误信息。

指标四:问句覆盖率——防区扩没扩大

最后一个指标看盘子:问句池里“至少在一个主流引擎中稳定提及”的问句占比。前三个指标衡量单点质量,这个指标衡量战线宽度。健康的 GEO 项目,覆盖率应该逐月爬坡——第一个月可能只有品牌词问句在防区里,第三个月场景词开始进来,半年后对比词也能占住一部分。如果覆盖率连续两个月不动,哪怕单点指标好看,也说明项目进入平台期,该开新的语义场景了。我们内部的滚动规划,基本就是被这个指标推着走的。

老彭的话:能复测,才叫效果

四个指标讲完,汇成一句话:提及率看有没有你,引用率看凭什么有你,口径正确率看说得对不对,覆盖率看防区多大——四个数每月复测,GEO 的效果就不再需要靠感觉争论。给正在选服务商的企业一个实用建议:把这篇拿给对方看,问他们愿不愿意按这套口径(或者他们自己的等价口径)做月度汇报。愿意的,起码是打算凭手艺吃饭的;支支吾吾只肯给截图的,你心里也就有数了。效果这东西,敢被复测才是真的。

← 返回资讯列表

想按这套口径先测一次基线?

问句池 + 四指标首测,现状好坏,数据说话。