什么是 引用溯源(Citation)?

引用溯源(Citation)是把 AI 生成声明归因到支持该声明的具体来源文档、片段、URL、记录或工具输出。

工作原理

引用溯源是事实锚定中用户可见的部分。在 RAG 系统中,引用帮助读者验证声明、检查来源上下文,并发现无依据答案。强引用应指向支持某个声明的具体片段或记录,而不仅是宽泛文档。它还应保留 URL、标题、时间戳、页码、章节和访问范围等来源元数据。引用质量取决于检索质量、分块边界、来源偏移量,以及生成步骤是否真的使用了被引用证据。

主要特点

  • 把生成声明归因到具体来源或证据记录
  • 当引用具体且正确时,可提升可审计性和用户信任
  • 需要来源元数据、分块偏移量和稳定文档标识
  • 如果被引用来源并不支持声明,引用也可能误导用户
  • 可用于文档、网页、数据库行、工具输出和上传文件

常见用途

  1. 在 RAG 答案下展示来源片段
  2. 把政策答案链接到手册中的精确章节
  3. 将 Agent 决策追踪到工具输出和检索记录
  4. 帮助用户验证医疗、法律、金融或合规声明
  5. 通过检查被引用证据调试无依据答案

示例

loading...
Loading code...

常见问题

RAG 中好的引用是什么样的?

好的引用会指向直接支持声明的具体来源片段,并提供足够元数据让用户或审计者验证。

引用也会错吗?

会。系统可能把引用附到相关但并不支持具体声明的来源上,因此需要评估引用忠实度。

文档级引用够用吗?

有时够用,但片段级或章节级引用通常更好,因为它降低了验证答案所需的成本。

引用和文档分块有什么关系?

分块决定来源片段和偏移量。糟糕分块会让引用过宽、不完整或难以审计。

相关工具

相关术语

相关文章

AI 搜索引擎架构:生产级检索、引用验证与安全门禁

深入解析生产级 AI 搜索引擎架构:从查询契约、检索规划、网页抓取、混合召回、重排与证据组装,到带引用答案生成、主张级蕴含验证、拒答、缓存和版本化发布门禁。本文还覆盖网页 SSRF、Robots Exclusion Protocol、间接 Prompt Injection、来源投毒、租户授权与删除传播,并给出可运行的引用结构验证代码和分层评测指标。

2026-04-25

LLM 幻觉检测:证据契约、拒答与发布门禁

系统讲解 LLM 幻觉检测的生产方法:将回答拆成原子声明,固定证据快照并执行四态判定,分别评估 RAG 检索、引用、忠实度与拒答,再通过风险覆盖曲线、人工校准和确定性发布门禁控制大模型事实错误与外部副作用。适合构建企业知识问答、搜索摘要、客服 Agent 及医疗、法律、金融等高影响工作流的开发者,避免把低温度、结构化输出、多模型一致或模型自报置信度误当成真实性保证。

2026-02-21

RAG 幻觉治理实战:五层证据控制、拒答与发布门禁

本文从生产系统视角讲解 RAG 幻觉治理:先建立带版本、权限和有效期的证据契约,再分别控制检索覆盖、重排充分性、冲突上下文、间接提示注入、声明级引用和答案忠实度,最后通过校准后的发布、部分回答、拒答与人工升级策略处理证据不足。文中提供可运行的 Python 发布门禁、故障测试矩阵和观测字段,帮助企业知识库、AI 搜索与客服团队避免把相似度、低温度、来源编号或单一 LLM Judge 误当成事实保证。

2026-04-03