FactRelay 文档
测量标准
用版本化问题、独立会话、重复采样、对照与不可变快照管理 AI 输出波动。
最近更新:2026年8月15日
FactRelay 测量的是“特定界面、地区、模型和时间条件下的 AI 回答观察”,不是跨平台通用排名。
最小采样方案
| 阶段 | 建议问题数 | 重复次数 | 用途 |
|---|---|---|---|
| 快速预览 | 3–5 | 1–3 | 发现是否存在明确风险,不做稳定结论 |
| 两周 POC | 10–15 | 3–5 | 验证工作流和方向性变化 |
| 付费基线 | 15–20 | 5 | 建立可比较基线 |
| 关键问题 | 5 | 10 | 观察高价值问题的波动 |
建议跨 2–3 个时段运行,并保留 3–5 个未干预对照问题。实际方案要结合调用成本和业务风险,不盲目扩大样本。
必须控制的条件
- 问题文本及问题集版本;
- 自然、引用诊断与意图变体面板;
- 数据提供方、产品界面和模型版本;
- 国家、语言、时区和近似地点;
- 新会话或明确的会话状态;
- 基线和复测的时间块;
- 重试规则和失败处理。
报告方式
单题优先报告原始次数,例如“10 次回答中 4 次出现该主张”。汇总时展示样本量和区间,不使用没有业务解释的两位小数排名。
跨平台结果分面展示,因为不同 API、网页端和模型产品的检索能力与用户体验不同。任何综合指数都必须说明公式、用途和限制,首版默认不提供跨平台总分。
对照与变化
对照问题帮助识别平台整体变化。如果干预问题提升,但对照问题同期提升相同幅度,只能说明发生了同步变化,不能将全部结果归因于本轮动作。
不可变快照
原始响应先落不可变存储,再进行解析。后续解析器升级可以重新计算观察指标,但不能改写历史原文。每个报告结论都必须能点回精确问题、原始回答、来源和运行条件。
科学表述
使用“在本次样本和测量界面中观察到方向性变化”,不要使用“已经证明该页面让 ChatGPT 排名提升”。