RAG与向量检索实战

深入学习 RAG 与向量检索系统的架构、选型和优化。覆盖向量数据库、Embedding、Chunking、Hybrid Search、Rerank、RAG 幻觉治理、Long Context 对比、RAG 与微调选型、检索评估、引用归因和生产性能优化,帮助开发者构建准确、可解释、可迭代的企业知识库问答系统。

本专栏共 13 篇文章 · 创建于 2026-02-21
1

RAG 是什么:从知识检索到有据可查的模型回答

RAG 检索增强生成如何把企业知识变成有据可查的回答?本文贯通文档解析、分块、版本管理、权限过滤、关键词与向量检索、重排序、上下文装配、生成和引用校验,提供可运行的 Go 证据链路示例,并介绍分层评测与故障定位方法。适合知识库问答和企业 AI 应用开发者,帮助区分来源有效与结论成立,判断 RAG、长上下文和微调的适用范围及成本。

2

向量数据库指南:RAG、pgvector、搜索引擎与成本选型

向量数据库什么时候需要、什么时候不需要?本文从 RAG 与语义搜索的真实工作负载出发,比较精确检索、PostgreSQL + pgvector、搜索引擎、专用数据库与托管服务,讲清 HNSW、IVF、乘积量化、元数据过滤、租户权限、召回率与尾延迟评测、Embedding 迁移、删除一致性、备份恢复和总成本,提供可运行 Go 基线与生产选型清单。

3

语义搜索:混合检索、权限控制与评测指南

把语义搜索下沉为可授权、可度量、可迁移的检索系统。本文系统讲解词法与向量召回、RRF 融合、重排、权限过滤、索引迁移、缓存和分层评测,并提供可运行 Python 示例,适合 RAG、企业知识库、商品搜索、代码检索和多语言内容发现等生产场景。重点说明相似度分数边界、ANN 召回损失、跨租户隔离、版本化缓存键,以及如何用影子流量和回放评测完成安全切流。

4

RAG 混合检索与重排架构设计:融合、评测与发布门禁

RAG 混合检索不能靠固定 Top-K 和 RRF 参数套模板。本文从 BM25、稠密检索、权限过滤、候选去重、RRF 融合与 Cross-Encoder 重排出发,解释如何建立可追踪的检索契约,按查询切片评测 Recall、MRR、nDCG、答案证据支持度、P95 时延与成本,并通过消融实验、漂移监控和回滚门禁判断混合检索是否真的优于单路基线。

5

RAG 幻觉治理实战:五层证据控制、拒答与发布门禁

本文从生产系统视角讲解 RAG 幻觉治理:先建立带版本、权限和有效期的证据契约,再分别控制检索覆盖、重排充分性、冲突上下文、间接提示注入、声明级引用和答案忠实度,最后通过校准后的发布、部分回答、拒答与人工升级策略处理证据不足。文中提供可运行的 Python 发布门禁、故障测试矩阵和观测字段,帮助企业知识库、AI 搜索与客服团队避免把相似度、低温度、来源编号或单一 LLM Judge 误当成事实保证。

6

GraphRAG:架构、证据与评测指南

系统讲解图结构检索与向量 RAG 的工程化组合,覆盖实体与关系抽取、来源片段、实体消歧、社区摘要、混合检索、租户和对象权限、删除血缘、引用覆盖与评测方法。文章说明 GraphRAG 何时能改善多跳或语料级问题,何时会增加抽取错误、刷新成本、延迟和治理风险,并提供可复现的安全实现边界,适合企业知识库和受监管数据场景的技术选型。

7

AI 知识图谱:GraphRAG、来源治理与安全查询

知识图谱如何用于 AI?本文从实体、关系与主张建模出发,讲清 RDF、属性图、图数据库和 GraphRAG 的适用边界,并给出来源治理、实体消歧、安全查询、授权继承、分层评测、删除传播与回滚的生产实践。读者可从真实问题设计查询契约,用关键词、向量与关系查询建立基线,再以可验证的质量、时延和成本门禁判断图谱是否值得上线。

8

RAG vs 微调:基于证据的大模型架构选型指南

系统比较 RAG、微调与长上下文的真实工程边界,覆盖知识更新、行为适配、检索质量、幻觉与引用、延迟、成本、数据删除、评测协议和混合架构,帮助团队用同一测试集选择能通过生产门禁的方案,而不是套用“知识用 RAG、行为用微调”的口号。文章进一步拆解语料覆盖、授权召回、排序、生成、训练泄漏与适配器生命周期等失败模式,并给出可运行的 Go 验收门禁、成本口径、安全控制与可逆实验流程。

9

RAG 分块策略:如何评测 Chunking 是否有效

系统讲解如何设计和评测 RAG 文档分块,而不是照搬固定 Token 数与重叠比例。比较结构感知、固定 Token、父子检索、上下文化、Late Chunking 和层级检索,在统一检索 Token 预算下评估证据覆盖、重复上下文、引用正确率、回答质量、延迟、索引规模和更新成本,并提供可运行的证据覆盖代码。

10

多模态 RAG:生产级架构、检索与评测指南

面向 PDF、图表、图片与文本设计生产级多模态 RAG。系统比较 OCR 与版面检索、Caption 代理、共享多模态向量、ColPali 视觉文档检索和混合检索,给出查询路由、排名融合、证据打包、安全防护、成本治理与分层评测方法,适合企业知识库、财报问答、合同检索和扫描文档场景,帮助团队从演示原型走向可验证、可追溯的生产系统。

11

长上下文 vs RAG:一套以证据为中心的架构决策框架

用真实工作负载在长上下文、提示词缓存、RAG 与混合架构之间做选择。本文不再依赖固定 Token 阈值和通用成本倍数,而是从证据覆盖、更新频率、访问控制、缓存复用、端到端延迟、答案质量、引用正确性与运维复杂度出发,给出可复现的对照实验与上线方法,并说明何时应该简化链路、何时必须保留检索、权限过滤与可追踪证据,适合正在设计企业知识问答、研究助手和文档分析系统的架构师与工程团队。

12

AI 搜索引擎架构:生产级检索、引用验证与安全门禁

深入解析生产级 AI 搜索引擎架构:从查询契约、检索规划、网页抓取、混合召回、重排与证据组装,到带引用答案生成、主张级蕴含验证、拒答、缓存和版本化发布门禁。本文还覆盖网页 SSRF、Robots Exclusion Protocol、间接 Prompt Injection、来源投毒、租户授权与删除传播,并给出可运行的引用结构验证代码和分层评测指标。

13

Agentic RAG 工程指南:控制循环、证据与评测

系统讲解 Agentic RAG 的生产级设计:把检索建模为受授权约束的证据控制循环,厘清 Self-RAG、CRAG 与 Adaptive-RAG 的机制差异;通过类型化工具契约、来源追踪、迭代与 Token 预算、拒答和澄清策略,建立路由、检索、证据、引用、安全、延迟与 Goodput 分层评测,并用影子流量、灰度门禁和可回滚策略控制上线风险。