单次结果的解释边界
生成式系统并非确定性数据库。即使用户问题相同,检索触发、引用组合和措辞也可能变化,因此不能用一次结果代表稳定表现。
建议保存的运行条件
每个快照需要保留足够的运行信息,才能在复测时判断是否仍然属于同一测量口径。
- 精确问题文本与哈希
- provider、surface 与模型标识
- 国家、语言、时区和运行时间
- 是否触发搜索、来源与重试谱系
报告应该展示 n/N
单题优先报告出现次数,而不是伪精确排名。跨问题汇总时,也应显示样本量、区间和对照变化。
生成式系统并非确定性数据库。即使用户问题相同,检索触发、引用组合和措辞也可能变化,因此不能用一次结果代表稳定表现。
每个快照需要保留足够的运行信息,才能在复测时判断是否仍然属于同一测量口径。
单题优先报告出现次数,而不是伪精确排名。跨问题汇总时,也应显示样本量、区间和对照变化。