从「感觉最近被 AI 提到了」到「可以写进周报、能纵向比较的数字」,中间隔着的就是这套指标。口径先统一,后面的讨论才有意义。
为什么必须先定义指标
GEO 的交付物如果只有一份描述性的报告,很容易陷入两个困境:进度无法验收,效果无法复盘。要解决这个问题,就需要把「品牌在 AI 端的表现」拆成可重复计算的指标,并在一开始就把口径固定下来。
口径固定的另一个好处是:只有口径不变,纵向比较才成立。中途换算法,趋势图就失去了意义。
八个指标
| 指标 | 含义 | 计算方式 | 常见误用 |
|---|---|---|---|
| AI 收录量 | 品牌相关内容被 AI 平台纳入可检索范围的程度 | 按平台抽样检索品牌相关表述的命中数量 | 把收录量当成曝光效果——收录只是前提 |
| 提及率 | 目标问法集中提到品牌的占比 | 提到品牌的问法数 ÷ 总问法数 | 只问品牌词,得出虚高的提及率 |
| 推荐率 | 不仅被提到,且出现在推荐语境中 | 推荐语境问法数 ÷ 总问法数 | 把中性提及算作推荐 |
| 引用率 | 答案把品牌信源直接列为参考来源 | 被引用的问法数 ÷ 总问法数 | 与提及率混为一谈 |
| 引文准确率 | 被引用内容与事实基线一致的程度 | 准确引用条数 ÷ 被引用总条数 | 只统计被引,不校验是否失真、是否过时 |
| 需求覆盖广度 | 在目标决策维度上的覆盖比例 | 已覆盖维度数 ÷ 目标维度总数 | 用整体覆盖率掩盖局部空白 |
| 平台覆盖度 | 覆盖了多少个主流 AI 平台 | 有效覆盖平台数 ÷ 目标平台数 | 只测一个平台就下结论 |
| 询盘转化率 | AI 端触达带来的有效线索转化 | 有效线索数 ÷ AI 端触达量(需与线索系统打通) | 把访问量直接当线索量 |
指标之间的关系:它是一条链,不是一个分
这八个指标存在明显的层级关系:
收录 → 提及 → 推荐 / 引用 → 转化
前一环是后一环的必要条件。断在哪一环,就说明问题出在哪一环:
- 收录低 → 信源可及性问题,先解决「拿得到」。
- 收录高、提及低 → 内容可被召回但没进入答案,检查相关性与实体一致性。
- 提及高、推荐低 → 有存在感但缺乏可信结论支撑,补事实与出处。
- 推荐高、转化低 → 认知已到位,问题可能在承接环节而非 GEO 本身。
汇报时的建议:不要只报一个总分。分平台、分层级、并带上波动区间,比一个漂亮的单一数字更有说服力,也更经得起追问。
波动纪律:不要用单点数据下结论
AI 答案是动态变化的,而且波动幅度比多数人预期的大。第三方实测显示,引用来源份额的周均波动显著——ChatGPT 约 39%、Gemini 约 41%(BrightEdge 实测口径)。
这意味着两件事:
- 时序图必须画波动带。只画一条折线再配一句结论,很容易把正常波动讲成趋势。
- 判断趋势至少看 4 周。单周、单次的结果只能当线索。
不要做的事:不要引用未经第三方审计的效果承诺数字,也不要把「提升百分之多少」写进交付承诺。可以承诺的是过程、口径与采样纪律;效果数字应当来自可复核的观测记录。
结语
指标的意义不是把复杂的事情简化成一个分数,而是让「品牌在 AI 端的表现」这件模糊的事,变得可以重复测量、可以纵向比较、可以被追问。做到这一点,GEO 才算真正进入了可运营的状态。