量化品牌在 AI 回答里的曝光:10 档难度阶梯测试

Forest Liu · 多家公司数据营销负责人#geo#ai-search#brand-visibility

摘要

跨四个 AI 模型的 10 档难度阶梯测试——每轮约 120 次调用、成本约 $0.23——显示 AI 可见性是分层的:示例品牌在中等名单长度下保有曝光,一旦提示词要求 30 个以上品牌便全线归零。

快速答案

把品类问题做成 10 档难度阶梯——从“推荐一个产品”到“列举 30 个品牌”——对 ChatGPT、Claude、Gemini、Perplexity 每个档位多次重复,记录提及与位置。完整一轮约 120 次调用、成本约 $0.23,足以常设监测。我们测试中示例品牌在较短名单下保有曝光,30 个以上品牌时全线归零——长列表里的 AI 可见性必须专门经营。

有一个问题,我们一直想得到干净的回答:当用户在 ChatGPT、Claude、Gemini、Perplexity 上问我们品类的相关问题,我们的品牌被提到的概率有多大、出现在什么位置?传统品牌监测回答不了这个问题——它统计的是网页上的提及,而不是模型回答内部的引用。于是我们设计了一套自己的测试,现在它已经跑成了常规监测。

设计 10 档难度阶梯

我们把问题切成 10 个难度档位。第 1 档最友好——“推荐一个这个品类的产品”;最深的档位刻意苛刻——“列举 30 个这个品类的品牌”。阶梯背后的逻辑是:AI 可见性不是一个单一数字——同一个品牌可能在简单问题里被引用,在难题里完全隐形,而这两种处境需要完全不同的经营动作。我们为每个档位固定一套提示词模板,在每个模型上重复多次提问,并记录品牌是否被提到、出现在哪里——首个回答、列表前部、还是完全缺席。提及次数与位置是分开记录的,因为“被提到”和“被排在前三名”是两回事。

一轮测试的成本与发现

完整一轮大约 120 次调用,成本约 $0.23。这个价格意味着 AI 回答可见性可以做成常设监测,而不是偶尔一次的研究项目——反复跑同一批提示词也很重要,因为模型回答本身有随机性,一次缺席说明不了什么,多次重复才能看到稳定的概率。第一次跑下来就很有信息量:当提示词只需要较短名单(20 个品牌以内)时,示例品牌还能保有部分曝光;可一旦阶梯要求列举 30 个及以上品牌,全部模型全线 0% 曝光——品牌在 AI 长列表里的可见性,不经营就不会存在。

可见性是分层的,经营也是分层的

AI 可见性是分层的:低档位容易进入,高档位需要专门经营。真正帮到我们的是把测试变成仪表盘——一个 品牌 × 模型曝光矩阵,一眼看出哪个模型低估了你;同一批查询上的竞品追踪,让你知道谁家的品牌正在顶替你的位置;以及当你在 AI 回答中的份额上升或崩塌时立刻触发的趋势告警。矩阵里的数字只是起点,它们指向的具体动作——补充结构化数据、改写可被引用的摘要段落、在模型真正会引用的页面上做锚点——才是监测的价值所在。

GEO 阶梯测试 5 步清单

  • 定义品类问题档位——由易到难 10 档,最深的一档要足够苛刻。
  • 固定提示词模板——只有提示词一致,结果才可比。
  • 跨模型多次重复——每个档位、每个模型多跑几遍,AI 回答是有随机性的。
  • 记录曝光、位置与竞品——谁被引用、在哪被引用、谁顶替了你的位置。
  • 按节奏重跑——AI 可见性在变,监测必须是持续的。

这套阶梯、曝光矩阵和趋势告警,正是我们平台里GEO 竞争监测模块每周在为我们运行的东西。

关于系统说明:iport 平台持续迭代。本文涉及的系统功能、界面或流程为该文写作时的版本,可能与最新版本存在出入;系统细节介绍以最新版为准。

常见问题

怎么量化品牌在 AI 回答里是否出现?

我们用一个 10 档难度阶梯,把品类问题从“推荐一个产品”排到“列举 30 个品牌”,对 ChatGPT、Claude、Gemini、Perplexity 每个模型多次重复提问,记录品牌是否被提到以及位置——首个、列表前部或完全缺席。完整一轮约 120 次调用,成本约 $0.23。

AI 回答里 0% 曝光意味着什么?

意味着你的品牌不在模型为这个品类稳定产出的名单里。我们测试中,示例品牌在要求 20 个左右名字的提示下还有曝光,一旦要求 30 个及以上,所有模型全线归零。低档位容易进入,长列表可见性必须专门经营。

跑 GEO 监测的成本高吗?

测量本身几乎免费——一轮约 120 次模型调用成本约 $0.23,完全可以常设运行。真正的投入是结果指向的经营动作,而不是测量本身。

继续阅读