FactRelay 文档

AI 答案如何发现、检索并引用网站内容

用访问、发现、检索、候选选择、生成和引用六个阶段定位内容问题。

最近更新:2026年8月16日

生成式 AI 的回答不是固定搜索结果。一个产品可能直接使用模型已有知识,也可能重写问题、调用搜索或私有知识库、选择候选来源,再结合地点、语言和会话上下文生成答案。诊断必须区分每个阶段。

一个可用的分析模型

1. 访问

页面首先要能被正常请求。状态码、robots、CDN/WAF、登录墙、脚本渲染和地区限制都可能阻断访问。伪装成某个爬虫 User-Agent 的本地请求不能证明真实机器人可访问。

2. 发现

系统可以通过网站链接、站点地图、搜索索引、即时检索、内容平台或合作数据源发现页面。没有内部链接的孤立页面,即使 URL 存在,也更难被稳定发现。

3. 索引或即时检索

不同入口可能读取已有索引,也可能在回答时搜索。必须记录具体 surface 和搜索状态,不能把开发者 API 能力外推为消费端产品行为。

4. 候选选择

系统会根据问题、实体、内容相关性、新鲜度、语言、地点和来源条件选择候选。候选来源出现不表示系统一定采用其中的事实。

5. 答案生成

模型把候选信息与上下文合成为回答,过程中可能概括、遗漏条件、混淆同名实体或组合互相冲突的来源。

6. 来源展示

产品可能展示引用、链接、卡片或不展示来源。可见引用是重要证据,但不能代表全部内部处理过程,也不能证明某个来源拥有固定权重。

网站能控制什么

  • 页面可访问、可索引和关键内容使用可读文本;
  • 品牌名称、类别、产品、地区和关系保持一致;
  • 一个页面围绕一个主要任务,首段直接回答;
  • 事实包含条件、单位、日期、来源和责任人;
  • 内部链接把主题入口、任务页和证据页连接起来;
  • 结构化数据与页面可见内容一致;
  • 旧页面更新、重定向或明确标为过期。

网站不能控制什么

企业不能控制模型版本、搜索触发、个性化、候选排序、引用界面或最终措辞,也不能保证某次更新何时被重新抓取和采用。因此产品结论应表述为“在指定条件下观察到”,而不是“已经改变所有 AI 认知”。

实际诊断顺序

顺序 检查 失败时的动作
1 页面是否可请求、可渲染 修复状态码、robots、WAF 与页面输出
2 页面是否被链接和发现 补站点地图、导航和上下文内链
3 页面是否直接回答目标问题 重构标题、首段、表格与限定条件
4 实体与事实是否一致 修复名称、关系、范围和过期内容
5 来源是否适合支持主张 增加对应证据,不制造虚假第三方内容
6 AI 是否实际采用 保存回答、来源、时间与重复样本

适用边界

即使温度参数固定,回答仍可能因模型、检索、索引与基础设施变化而波动。单次结果只能证明一次观测;API 结果不等于真实 App。FactRelay 会分开记录 provider、surface、模型、地区、问题版本、搜索状态和会话条件。

相关阅读:可引用内容的结构 · 爬虫管理 · 问题集与采样 · 测量标准

输入关键词,快速找到方法、产品和标准文档。