FactRelay 文档

问题集与采样任务

版本化管理自然问题、引用诊断、意图变体与对照,并保存完整运行条件。

最近更新:2026年8月15日

问题集定义了系统到底在测什么。FactRelay 不从关键词数量出发,而从真实用户在认知、比较、声誉和购买阶段需要完成的决策出发。

问题设计

每个问题记录意图阶段、目标地区、语言、主题、是否关键问题以及是否属于对照。示例:

认知:这个品牌主要提供什么服务?
比较:品牌 A 和品牌 B 在服务范围上有什么区别?
购买:适合有夜间上门需求的服务商有哪些?
声誉:选择该品牌前应注意哪些限制?

问题应使用用户自然语言,不把预期答案或品牌优势塞进提问。

三种面板

自然问题

用于模拟不带额外要求的普通提问。重复运行时,问题文本必须逐字一致;独立性通过新会话和请求元数据实现,不能在末尾追加 [1][2]

引用诊断

用于要求模型提供来源,帮助定位错误信息从哪里来。它改变了模型行为和搜索触发率,因此必须单独报告。

意图变体

覆盖同一决策意图的不同表达,帮助发现问题边界。变体不是同条件重复,也不能与原问题合并计算稳定性。

运行计划

探索阶段建议每题 3–5 次,付费项目建议常规题 5 次、关键题 10 次,并跨 2–3 个时间段运行。每轮保留 3–5 个未干预对照问题,帮助区分整体平台波动与本轮动作变化。

快照内容

每次运行都保存:

  • 精确问题和哈希、问题集版本;
  • 数据提供方、测量界面和模型标识;
  • 地区、语言、时区和时间;
  • 是否触发搜索、原始回答与来源;
  • 供应商任务编号、重试谱系和结构版本;
  • 原始响应文件的不可变哈希。

成本和失败

任务提交使用幂等键,避免重试造成重复调用和重复计费。超时、限流、字段变化和解析失败要分别展示,不能把失败样本当作“品牌未出现”。

输入关键词,快速找到方法、产品和标准文档。