同一个问题,四个大模型给了四种品牌印象
GEO 的第一步不是改官网,是先去问。
拿同一家公司,同一个问题,分别去问豆包、DeepSeek、通义千问和 Kimi。四份回答摊在一起看,差异比任何一份单独的回答都有信息量 —— 它把信源上的洞指出来了。
怎么问,才算一次有效的诊断
大部分人第一次做这件事都问错了,问完还很满意。
问客户真会问的问题,不要问公司名
「云浪科技怎么样」这种问法拿不到有效信息。你把公司名喂进去,模型大概率会顺着你的话往下说 —— 那是配合,不是评价。
该问的是客户在还不知道你的时候会问的话:
- 华北地区做企业内容和 AI 可见性优化的服务商有哪些
- 我想找人把公司官网改成 AI 能读懂的结构,应该找什么类型的公司
- 帮我对比一下做 GEO 服务的几家公司
这三个问题的回答里有没有你,是完全不同性质的结论。第一个考的是覆盖,第二个考的是模型有没有把你和这类需求关联起来,第三个考的是你在同类里有没有可比的事实。
同一个问题问四遍以上
大模型的输出有随机性。同一个问题问两次,回答不一样是常态。一次答出了你,不代表这条链路通了;一次没答出你,也不能定罪。
问四到五遍,记下出现次数。这才叫数据。
记原话,不要记结论
「豆包认可我们」是一句没法复查的记录。要存的是完整原话、日期、用的哪个模型、有没有开联网。三个月后再测,才有东西可比。
四种差异,对应四种漏洞
四份回答一起看,差异通常落在下面四类里。每类指向的问题不一样,修法也不一样。
一、根本答不出你 —— 覆盖漏洞
模型的语料和检索范围里没有你,或者有但太少。这时候讨论「说得准不准」是没意义的,先解决有没有。
修的方向是铺信源:官网的语义层、行业媒体、第三方内容,让同一套事实在多个地方出现过。
二、说得对,但很薄 —— 事实密度漏洞
回答只有一句「一家内容服务公司」,再问细一点就没了。这说明模型手上关于你的信息只剩一个标签。
原因几乎总是同一个:官网上写满了形容词,能提取的具体事实太少。成立时间、所在城市、服务分几项、每项交付什么 —— 这些能被复述的东西一条都没有,模型就只能给标签。
三、说错了 —— 冲突信源漏洞
模型说你在某个城市、做某项业务,而事实不是。这种情况下别急着骂模型,先去查你自己的信源:官网、公众号简介、招聘页面、旧版 PPT、某个第三方目录站上三年前的收录,口径大概率是不一致的。
模型不会判断哪份对,它只是选了见得比较多的那份。同一套品牌事实在不同地方长得不一样,是 GEO 里最常见也最好修的问题。
四、把你和别人搞混 —— 区分度漏洞
名字撞车、定位撞车,模型把两家公司的信息合成一份回答。修法是给自己加唯一的识别锚点:全称、成立年份、所在城市、专有的方法名或栏目名,并且让这些锚点总是和公司名一起出现。
为什么四个模型答得不一样
这件事本身值得理解一下,不然会误判。
差异主要来自三处:训练语料的截止时间不同;有没有联网检索、检索走的是哪个搜索后端;以及对信源可信度的偏好不同 —— 有的模型明显更愿意引用媒体报道,有的更认官网。
由此得到一个反直觉但很实用的结论:**不要为某一个模型做优化。**针对某个模型的技巧型做法,寿命通常只有一次版本更新。四个模型的共同底座是同一件东西 —— 公开网络上关于你的、能被抓取、能相互对上的事实。修底座,四份回答会一起变好。
这件事得定期做
一次诊断只是一张快照。语料在更新,检索后端在换,同行也在做同样的事。
我们的做法是把问题清单固定下来,每月跑一次,只记三个东西:有没有提到、说得对不对、有没有引用官网。三个月一对比,趋势就出来了 —— 这也是 GEO 唯一能拿出来验收的东西。
没有人能保证你在某个模型的回答里排第几 —— 谁这么承诺,谁就是在骗你。
