FactRelay 文档
AI 答案如何发现、检索并引用网站内容
用访问、发现、检索、候选选择、生成和引用六个阶段定位内容问题。
最近更新:2026年8月16日
生成式 AI 的回答不是固定搜索结果。一个产品可能直接使用模型已有知识,也可能重写问题、调用搜索或私有知识库、选择候选来源,再结合地点、语言和会话上下文生成答案。诊断必须区分每个阶段。
一个可用的分析模型
1. 访问
页面首先要能被正常请求。状态码、robots、CDN/WAF、登录墙、脚本渲染和地区限制都可能阻断访问。伪装成某个爬虫 User-Agent 的本地请求不能证明真实机器人可访问。
2. 发现
系统可以通过网站链接、站点地图、搜索索引、即时检索、内容平台或合作数据源发现页面。没有内部链接的孤立页面,即使 URL 存在,也更难被稳定发现。
3. 索引或即时检索
不同入口可能读取已有索引,也可能在回答时搜索。必须记录具体 surface 和搜索状态,不能把开发者 API 能力外推为消费端产品行为。
4. 候选选择
系统会根据问题、实体、内容相关性、新鲜度、语言、地点和来源条件选择候选。候选来源出现不表示系统一定采用其中的事实。
5. 答案生成
模型把候选信息与上下文合成为回答,过程中可能概括、遗漏条件、混淆同名实体或组合互相冲突的来源。
6. 来源展示
产品可能展示引用、链接、卡片或不展示来源。可见引用是重要证据,但不能代表全部内部处理过程,也不能证明某个来源拥有固定权重。
网站能控制什么
- 页面可访问、可索引和关键内容使用可读文本;
- 品牌名称、类别、产品、地区和关系保持一致;
- 一个页面围绕一个主要任务,首段直接回答;
- 事实包含条件、单位、日期、来源和责任人;
- 内部链接把主题入口、任务页和证据页连接起来;
- 结构化数据与页面可见内容一致;
- 旧页面更新、重定向或明确标为过期。
网站不能控制什么
企业不能控制模型版本、搜索触发、个性化、候选排序、引用界面或最终措辞,也不能保证某次更新何时被重新抓取和采用。因此产品结论应表述为“在指定条件下观察到”,而不是“已经改变所有 AI 认知”。
实际诊断顺序
| 顺序 | 检查 | 失败时的动作 |
|---|---|---|
| 1 | 页面是否可请求、可渲染 | 修复状态码、robots、WAF 与页面输出 |
| 2 | 页面是否被链接和发现 | 补站点地图、导航和上下文内链 |
| 3 | 页面是否直接回答目标问题 | 重构标题、首段、表格与限定条件 |
| 4 | 实体与事实是否一致 | 修复名称、关系、范围和过期内容 |
| 5 | 来源是否适合支持主张 | 增加对应证据,不制造虚假第三方内容 |
| 6 | AI 是否实际采用 | 保存回答、来源、时间与重复样本 |
适用边界
即使温度参数固定,回答仍可能因模型、检索、索引与基础设施变化而波动。单次结果只能证明一次观测;API 结果不等于真实 App。FactRelay 会分开记录 provider、surface、模型、地区、问题版本、搜索状态和会话条件。