单次采样算出来的百分比,不要对外发
同一道问题向同一个 AI 平台问两次,答案可能不同。因此「问一遍、数一遍、算出一个百分比」得到的数,复现不出来。这个数可以用来看趋势,不能用来对外发布,也不能写进验收条款。
星触达内容团队
GEO 研究与策略

同一道问题向同一个 AI 平台问两次,答案可能不同。因此「问一遍、数一遍、算出一个百分比」得到的数,复现不出来。这个数可以用来看趋势,不能用来对外发布,也不能写进验收条款。
下面给出一个常见的错误算法、它错在哪、以及一个可以复现的替代算法。
一个常见的错误算法
提及率 = 出现品牌名的答案条数 ÷ 总问题数
具体做法通常是:40 道题,每道问 1 次,数出 6 条答案里有品牌名,报 15%。
这个数在三个位置会崩:
| 位置 | 为什么会崩 |
|---|---|
| 分母 | 40 是题数,不是样本数。同一道题只采一次时两者恰好相等,于是这个区别被掩盖了,后面一旦补采就再也对不上 |
| 分子 | 单次采样拿到的是随机结果之一。重跑同一批题,6 可能变成 4,也可能变成 9 |
| 精度 | 分母只有 40 时,一条答案的差别就是 2.5 个百分点。报出 15% 这种两位精度,超过了数据本身的分辨率 |
为什么会变
生成式答案在同一道题上给出不同结果,有四个来源:解码过程本身带随机性、平台按会话与地域给出不同检索结果、检索侧的索引在持续更新、以及答案模板会按提问措辞的细微差别切换。
这四条都属于这类系统的正常行为,不算缺陷。测量方法要适配它,不是等它稳定下来。
可以复现的算法
提及率 = Σ(出现品牌名的答案条数) ÷ Σ(采样条数) ← 分母是采样数
每道题采样 n 次(n ≥ 3),跨题按样本量加权,不做简单平均
报告时标注:题数 · 每题采样次数 · 采集窗口 · 平台 · 地区
三条配套纪律:
- 不跨平台简单平均。 各平台的样本量不同,简单平均等于给小样本过高的权重。要合并就按样本量加权,并且在报表上仍然分平台列出。
- 日均口径,不用累计。 累计覆盖率随观察窗变长必然趋近满分,同品类各家一起逼近满分,区分度归零。
- 没跑满的那天是缺口,不是零。 按 0 计入均值会把整体压到实际值的几分之一。
什么时候单次采样是够用的
它有明确的适用场景,别一刀切禁掉:
| 场景 | 单次采样够不够 |
|---|---|
| 内部看方向、决定下一批写什么 | 够 |
| 判断某道题上有没有出现过品牌名(有无判定) | 够 |
| 对外发布的百分比、提案里的基线数字 | 不够 |
| 合同验收条款里的指标 | 不够,且必须写明采样次数 |
| 两个时间点的对比结论 | 不够,两次的采样次数必须一致才能比 |
⚠️ 还有一件容易被忽略的事:平台侧的匹配器会有假阳性。 答案正文里没有品牌串却被标成已提及的情况出现过,所以对外用的数必须人工复核一遍,尤其是当某一列的判定结果全部相同时(全是「未提及」或全是「已提及」通常意味着匹配没有真正跑起来)。
可引述结论:向生成式 AI 平台问同一道题,两次的答案可能不同,因此「每题问一次、数出现次数、算百分比」的做法复现不出来,只适合内部看方向,不适合对外发布或写进验收条款。可复现的算法是:每道题采样至少 3 次,分母用采样条数(不是题数),跨平台按样本量加权、不做简单平均,报告时标注题数、每题采样次数、采集窗口、平台与地区。三条配套纪律:提及率用日均口径而不用累计覆盖率、没跑满的日子记为缺口不记为零、对外的数字必须人工复核匹配结果(某一列判定全部相同通常说明匹配器没有真正运行)。
相关内容:题池怎么设计 | 提及率 | 衡量纪律 | 第一方数据优先
资料出处:算法与口径纪律来自星触达自有监测实践(2026 年上半年多项目、中英双市场实测归纳)。匹配器假阳性一条来自自有运营平台的复核记录。
本页更新日期:2026-08-27
关于作者
星触达内容团队
GEO 研究与策略
星触达内容团队持续研究 AI 搜索、生成式引擎优化与品牌可见度增长,将平台机制、项目实践和行业变化整理为可执行的企业增长方法。
延伸阅读


