FactRelay 文档

测量标准

用版本化问题、独立会话、重复采样、对照与不可变快照管理 AI 输出波动。

最近更新:2026年8月15日

FactRelay 测量的是“特定界面、地区、模型和时间条件下的 AI 回答观察”,不是跨平台通用排名。

最小采样方案

阶段 建议问题数 重复次数 用途
快速预览 3–5 1–3 发现是否存在明确风险,不做稳定结论
两周 POC 10–15 3–5 验证工作流和方向性变化
付费基线 15–20 5 建立可比较基线
关键问题 5 10 观察高价值问题的波动

建议跨 2–3 个时段运行,并保留 3–5 个未干预对照问题。实际方案要结合调用成本和业务风险,不盲目扩大样本。

必须控制的条件

  • 问题文本及问题集版本;
  • 自然、引用诊断与意图变体面板;
  • 数据提供方、产品界面和模型版本;
  • 国家、语言、时区和近似地点;
  • 新会话或明确的会话状态;
  • 基线和复测的时间块;
  • 重试规则和失败处理。

报告方式

单题优先报告原始次数,例如“10 次回答中 4 次出现该主张”。汇总时展示样本量和区间,不使用没有业务解释的两位小数排名。

跨平台结果分面展示,因为不同 API、网页端和模型产品的检索能力与用户体验不同。任何综合指数都必须说明公式、用途和限制,首版默认不提供跨平台总分。

对照与变化

对照问题帮助识别平台整体变化。如果干预问题提升,但对照问题同期提升相同幅度,只能说明发生了同步变化,不能将全部结果归因于本轮动作。

不可变快照

原始响应先落不可变存储,再进行解析。后续解析器升级可以重新计算观察指标,但不能改写历史原文。每个报告结论都必须能点回精确问题、原始回答、来源和运行条件。

科学表述

使用“在本次样本和测量界面中观察到方向性变化”,不要使用“已经证明该页面让 ChatGPT 排名提升”。

输入关键词,快速找到方法、产品和标准文档。