什么是 事实锚定(Grounding)?
事实锚定(Grounding)是在运行时向生成式 AI 模型提供有边界的外部证据,并要求重要输出 Claim 或 Action 可追溯到这些证据、已观察状态或 Tool Result 的系统实践。
工作原理
本词条讨论生成式 AI 工程中的 Evidence Grounding。它与认知科学中的 Symbol Grounding Problem、把语言映射到图像区域的 Visual Grounding,以及机器人 Sensorimotor Grounding 有关,但不是同一个实现问题。
Evidence Grounding 在生成之前就开始:每个文档片段、数据库记录、搜索结果、API Response、用户文件或 Sensor Observation 都需要稳定 Identity、不可变 Revision 或 Content Hash、精确 Locator、观察时间、有效区间、Authority Policy 和 Access Scope。Retrieval 还要找到与问题相关且充分的 Evidence。被检索内容不会自动变成真实、最新、完整、相互一致、已授权或安全的信息,还可能携带 Indirect Prompt Injection。应用应在 Retrieval 前过滤权限,把 Instruction 与不可信 Evidence 分隔,在 Reranking 和 Context Assembly 中保留 Provenance,并显式传递 Tool Error、Partial Result 和 Timestamp。
生成期间和之后,应把重要陈述拆成 Atomic Claim,并映射到能够 Entail、Contradict 或无法支持它的 Evidence。Answer Faithfulness 检查 Claim 是否能从给定 Context 推导;Factual Correctness 则检查它是否符合外部 Reference 或现实状态。模型可能忠实复述错误或过期来源,也可能凭 Parametric Memory 说对事实,却没有被本次 Run 的 Evidence 支持。
Citation 又是独立层:Citation Pointer 必须解析到正确 Source 和 Span,该 Span 必须支持对应 Claim,并且 Citation 要覆盖全部重要 Claim。生成后补上的引用不能证明该来源实际影响了答案。RAG 是 Grounding 的一种架构,Search、Database、Knowledge Graph、类型化 Tool Call 与 Observation 也能提供 Evidence。
System Prompt 中「只根据资料回答」只是尽力遵守的行为指令,不是确定性强制边界。Evidence 缺失、过期、未授权或相互冲突时,系统应按 Policy 返回有边界的部分答案、Abstain、请求澄清或升级人工。
生产评测必须分别检查 Corpus Authority 与 Freshness、Permission Leakage、Retrieval Recall 与 Sufficiency、Claim Support 与 Contradiction、Citation Precision 与 Coverage、External Correctness、Answer Relevance 与 Completeness、Abstention、Prompt Injection、延迟、成本和最终任务状态。自动 Judge 必须版本化,并用人工标注故障样本校准。
主要特点
- 把重要 Claim 绑定到运行时 Evidence 或已观察状态,而不是只依赖 Parametric Memory
- 在回答链路中保留 Source Identity、Revision、Hash、Locator、Timestamp、Authority、Validity 与 Access Scope
- 把 Retrieval Relevance 和 Sufficiency 与 Answer Faithfulness、Citation Quality、External Factual Correctness 分开
- 用 entailed、contradicted 或 insufficient 等 Claim-Evidence 关系表达支持程度,而不是把出现来源当成证明
- Evidence 缺失、过期、冲突、未授权或来自失败 Tool 时,要求显式 Abstention 或 Escalation
- 把外部内容视为不可信输入,并在模型外执行 Authorization、写入控制和 Judge 校准
常见用途
- 生成重要 Claim 可链接到精确且带 Revision 来源片段的 RAG 答案
- 根据带明确成功状态和观察时间的类型化 Tool Result 回答账户、库存或运行状态问题
- 生成经过 Source Authority、Freshness、Conflict 与 Citation 检查的研究或政策摘要
- 为高风险助手提供权限过滤 Evidence、Abstention、Escalation 与可审计 Provenance
- 通过对比检索证据、生成 Claim、Citation、Action 和最终环境状态评测 Agent
示例
Loading code...常见问题
Grounding 与 RAG 有什么区别?
Grounding 是更广泛的 Evidence Contract:重要 Claim 或 Action 必须可追溯到已授权、当前有效且可检查的 Evidence。RAG 是生成前检索文档的一种架构;Database Query、Web Search、Knowledge Graph、类型化 Tool Call 与 Sensor Observation 也能提供 Evidence。检索不完整或 Generator 忽略 Context 时,RAG 仍可能缺少 Grounding。
Grounding、Answer Faithfulness、Factual Correctness 和 Citation 有什么区别?
Grounding 覆盖系统中的 Evidence 获取、Provenance、使用与验证;Answer Faithfulness 检查每个 Claim 是否能从给定 Context 推导;Factual Correctness 把 Claim 与外部 Reference 或现实状态比较;Citation 只是 Evidence Pointer,只有能够解析、支持精确 Claim 并覆盖重要 Claim 时,才能构成 Grounding 证据。
带 Citation 的 AI 回答一定有事实依据吗?
不一定。Citation 可能指向不存在的页面、不相关 Span、与 Claim 矛盾的来源,或只在生成后附加。应分别验证 Locator、Claim-Evidence Entailment 和 Citation Coverage,还要检查 Source Authority、Revision、Freshness 与 Permission,因为被忠实引用的来源本身也可能错误或过期。
证据缺失或冲突时,Grounded System 应如何处理?
系统应按明确 Policy 只返回有支持的部分、Abstain、请求缺失信息、展示冲突或升级给合格 Reviewer,而不是静默使用模型记忆填空。结果应保留 Evidence ID、Conflict Status、Timestamp 和 Terminal Decision Reason,供用户与审计流程复核。
如何评测并保护 Grounding 链路?
使用 Answerable、Unanswerable、Stale、Conflicting、Deleted 和 Access-Denied 切片,分别测量 Source Quality、Retrieval Coverage、Claim Support 与 Contradiction、Citation Precision 与 Coverage、External Correctness、Completeness、Abstention 和 End-Task Success。自动 Judge 要用人工标签校准;检索内容按不可信输入处理,权限和写操作授权必须由代码执行。