不需要预算、不需要授权、不需要工具。一个人半天时间,就能做一次最小可行但结论可靠的 AI 可见性体检。下面是可以直接照做的清单。
你需要准备什么
- 20 条真实问法,覆盖品牌词、品类词、对比词、场景词、地域词。
- 3 个主流 AI 平台的账号(先用最常用的三个即可,不必求全)。
- 一张记录表,字段见下文第三节。
一、问法怎么出:20 条的结构
| 类型 | 数量 | 示例方向 |
|---|---|---|
| 品牌直问 | 5 条 | XX 怎么样 / 值得买吗 / 口碑如何 |
| 品类泛问 | 5 条 | 这个价位 / 这个类型有哪些选择 |
| 对比问 | 4 条 | A 和 B 哪个好 / 相比差在哪 |
| 场景问 | 3 条 | 孩子上学 / 通勤 / 改善置换 |
| 地域问 | 3 条 | XX 板块 / 区域值得考虑吗 |
关键要求:问法必须口语化。用真实用户会打出来的字,不要用行业词。把「品牌声量表现如何」换成「这个牌子靠谱吗」,测出来的结果才有参考价值。
二、采样
每条问法在 3 个平台上各问一遍,共 60 次采样。采样时注意:
- 使用新会话提问,避免上一轮对话影响结果。
- 问法原样输入,不要为了「问得更准」而改写。
- 保留原始回答的截图或文本,便于复核。
三、记录表字段
| 字段 | 填什么 |
|---|---|
| 平台 | 哪个 AI |
| 问法编号 / 原文 | 与问法集一一对应 |
| 是否提及 | 是 / 否 |
| 提及顺序 | 第几个被提到 |
| 描述摘要 | AI 原话摘录,不要转述 |
| 语境倾向 | 正向 / 中性 / 负面 |
| 引用来源 | 答案给出的参考来源 |
| 备注 | 异常情况,例如同一问法两次结果差异大 |
四、判读标准:四层
| 层级 | 特征 | 说明什么问题 |
|---|---|---|
| 存在 | 没被提到 | 信源可及性或相关性不足 |
| 被认可 | 提到了但语境中性或负面 | 缺少支撑性事实 |
| 被信任 | 提到了但没有具体事实与出处 | 内容缺少可验证性 |
| 被选择 | 有事实但不在推荐结论里 | 权威来源与对比内容不足 |
五、三个最容易犯的错
- 只问品牌词。品牌词当然问得到,但用户在真实场景里问的是品类和场景问题。只测品牌词会得出严重虚高的结论。
- 只问一次。AI 答案波动明显,同一问法两次结果不同是常态。至少重复两到三轮再判断。
- 只用一个平台。不同平台的语料来源与回答风格差异大,单一平台的结果不足以代表整体。
六、从体检到诊断
体检能回答「有没有问题」,诊断才能回答「问题在哪、先补哪里」。
从 20 条问法扩展到覆盖网格,从一次抽查变成常态监测,需要补齐三件事:更完整的问法集(按决策维度、人设、阶段展开)、更高频的采样(形成波动带而不是单点)、以及信源层面的诊断(谁在描述你、缺口在哪)。
七、合规提示
体检过程中的合规底线:
- 不做语料投毒、不做答案霸权、不做提示词注入——这三类是明确的禁区,短期可能见效,但一旦被发现会直接摧毁品牌可信度。
- 自有事实、第三方事实与推测性表述要区分清楚,不要混写。
- 房地产领域额外注意:不作升值或回报承诺、不设时间标距承诺、不使用虚假关键词、不对未落定规划设施作承诺、面积口径规范表述。
结语
这套体检的价值不在于得出一个好看的结论,而在于用半天时间把「品牌在 AI 端到底什么样」从猜测变成事实。发现问题本身就是收获——大部分品牌的第一步,都是先意识到自己被说错了。