发布于 2026-08-08 · 作者 老彭(老彭丨GEO优化)
最近老彭在做客户实测的时候碰到一件挺有意思的事。同一条问句,用两台设备、两个账号去问同一个 AI 引擎,得到的答案里推荐的企业不完全一样。一开始以为是模型随机性,多测了几轮之后发现规律:常问制造业问题的那个账号,答案里出现的工厂类企业明显更多;另一个平时问消费类问题的账号,答案更偏向品牌和电商。这不是偶然,这是个性化在起作用。
过去几年做搜索优化,大家默认的前提是:同一个关键词,搜索结果页对所有人基本一样,所以可以谈排名第几。这个前提在 AI 时代正在瓦解。现在的对话式引擎会参考你的历史提问、当前对话的上下文、设备所在区域、语言习惯,甚至你前一句话的措辞,来决定这次给你什么答案。同样问「工业除湿机怎么选」,一个刚聊过食品厂车间的人和一个刚聊过家用电器的人,拿到的答案结构和推荐对象可能完全不同。
老彭这半年在给客户做报告的时候,已经开始弱化位次这个数据。原因很简单:当答案因人而异,你测出来的位次只代表你这台设备这个账号这一次的结果,换个人问可能就变了。继续用位次考核,会逼着执行团队去优化一个不稳定的指标,最后大家一起自欺欺人。老彭现在更看重的是覆盖面——在一批不同角度、不同措辞、不同场景的问句里,你总共出现了多少次,这个数字比单条问句的位次稳定得多,也更接近真实的曝光量。
老彭的判断是,这个趋势整体上对中小企业是好消息。在统一答案的时代,一条高价值问句就那么两三个位置,永远被头部占着,小企业没有机会。答案个性化之后,位置被切成了很多份,不同人群、不同场景下的答案各不相同,细分领域做得扎实的企业反而有机会在特定人群面前反复出现。反过来,那些只靠品牌声量占位、内容本身很空的大企业,会在越来越细分的问题里逐渐失去优势,因为个性化的本质是匹配得更准,而不是名气更大。
老彭给客户的建议是三条。第一,问句集合要扩容。以前测十条核心问句就够交差,现在至少要三十条以上,覆盖不同身份的提问者——采购、技术、老板、终端用户,他们问同一件事的措辞完全不同。第二,内容要按人群分层,同一个产品,给技术看的参数版和给采购看的成本交期版要分开写,不要糊成一篇。第三,放弃对单条问句的执念,改看整体覆盖率和被提及总频次,把资源摊到更多细分场景上,而不是死磕某一条大词。
这一点很多同行还没跟上。如果继续用一台设备一个账号测,测出来的数据会带有强烈的个人偏向,越测越像一份自我安慰的报告。老彭现在的做法是多环境交叉测:不同设备、不同网络环境、尽量减少历史上下文干扰,同一条问句测多次取综合表现,并且明确记录每次的测试条件。报告里也不再写「排名第二」,而是写「十次测试中出现七次,其中四次在答案前段」。这种表述看起来没那么好看,但它是真的。
个性化也带来一个新问题:你自己测出来的结果,可能比真实情况乐观得多。原因是做项目的人天天在 AI 里问自家品牌相关的问题,账号的历史上下文已经被「训练」得偏向自己了,再去测自然容易看到自己。老彭吃过这个亏,有个项目内部测得很好,客户那边一测几乎问不出来。后来改成用干净环境测试,才发现真实覆盖率只有内部数据的一半。这件事之后,老彭在所有项目里都加了一条规矩:验收数据必须在无历史记录的环境下产生。
老彭的看法是,个性化只会越来越强。各家引擎都在往记忆和长期偏好的方向做,因为这直接关系到用户留存。对企业来说,这意味着 AI 可见度会越来越像一个概率问题而不是位次问题——你不是在争一个固定位置,而是在提高自己在各种情境下被想起来的概率。提高这个概率的办法,还是老彭一直说的那几样:事实要密、口径要一致、场景要覆盖得广、信源要能互相印证。方法没变,只是衡量方式必须跟着变。
结论:AI 答案个性化已经不是趋势预测,而是每天在发生的事实。继续用单一环境测排名,会得到一份好看但失真的报告。老彭的建议是,从这个季度开始把考核指标从「排第几」换成「多环境下的覆盖率与提及频次」,同时把问句集合按提问者身份扩容,这一步做得早的企业,会比同行更早看清自己的真实位置。