FactRelayBlog
返回博客测量标准

同一个问题为什么要重复采样:从截图到可解释测量

单次截图只能证明某个回答出现过。要比较变化,必须冻结问题文本、测量面、地区、时间窗和样本规则。

单次结果的解释边界

生成式系统并非确定性数据库。即使用户问题相同,检索触发、引用组合和措辞也可能变化,因此不能用一次结果代表稳定表现。

建议保存的运行条件

每个快照需要保留足够的运行信息,才能在复测时判断是否仍然属于同一测量口径。

  • 精确问题文本与哈希
  • provider、surface 与模型标识
  • 国家、语言、时区和运行时间
  • 是否触发搜索、来源与重试谱系

报告应该展示 n/N

单题优先报告出现次数,而不是伪精确排名。跨问题汇总时,也应显示样本量、区间和对照变化。