什么是 语义缓存?

语义缓存是一种先对请求生成向量、查找足够相似的历史请求,并在策略与元数据边界同时匹配时复用已有回答的缓存。

快速了解

创建时间2020 年代初在 LLM 应用中逐步普及
规范文档官方规范

工作原理

语义缓存把精确键缓存扩展到改写句和近似重复请求。查询时,系统对标准化请求生成向量,先应用租户、授权范围、语言、模型版本、提示词版本、来源修订和安全策略等硬过滤,再只接受距离通过校准阈值的最近条目。有效命中可以跳过检索与生成,但误命中可能为错误意图返回看似合理的答案,甚至跨边界泄露数据。因此缓存必须是非权威、可观测、带版本、会过期且可安全重建的派生数据。阈值、失效和风险控制见<a href="https://qubittool.com/zh/blog/llm-semantic-caching-production-guide">生产级语义缓存指南</a>。

主要特点

  • 通过向量匹配请求语义,不要求缓存键逐字相同
  • 把软相似度阈值与硬元数据和权限过滤结合
  • 需要 TTL、失效、版本管理和内存淘汰策略
  • 在命中率、误命中风险与陈旧答案风险之间权衡
  • 按需隔离租户、身份、模型、提示词、语言和来源版本

常见用途

  1. 为高频 FAQ 的不同问法复用已验证答案
  2. 减少客服与内部知识助手中的重复 LLM 调用
  3. 缓存近似重复输入的确定性分类或抽取结果
  4. 在明确新鲜度窗口内提供稳定公开信息
  5. 在不绕过策略校验的前提下测量成本与延迟收益

示例

loading...
Loading code...

常见问题

语义缓存与精确缓存有什么区别?

精确缓存要求键完全一致;语义缓存可为改写后的请求复用答案,但需要相似度模型,并且必须更严格地防止错误匹配。

语义缓存与 RAG 有什么区别?

RAG 检索来源片段后仍会调用生成模型;语义缓存直接取回完整历史回答,有效命中时可以完全跳过生成。

如何选择语义缓存相似度阈值?

应使用真实业务中的标注请求对扫描不同阈值,按意图切片测量命中率和有害误命中率,再根据风险预算确定策略。

语义缓存应按哪些字段分区?

至少考虑租户、授权范围、语言、模型和提示词版本、来源修订、安全策略与响应类型。相似度匹配绝不能跨越安全边界。

哪些请求不适合语义缓存?

个性化、快速变化、高风险、权限敏感、交易型或会产生副作用的请求通常不适合,除非有更强的确定性校验保证正确性。

相关工具

相关术语

相关文章

向量数据库指南:RAG、pgvector、搜索引擎与成本选型

向量数据库什么时候需要、什么时候不需要?本文讲解 Embedding、HNSW、元数据过滤与 RAG,比较 PostgreSQL + pgvector、搜索引擎、专用数据库和托管服务,提供租户隔离、混合检索、召回率、尾延迟、索引更新、数据迁移、备份恢复与总成本的生产选型矩阵和 Python 示例,适合企业知识库、语义搜索、推荐和大规模检索系统。

2026-02-21

LLM 语义缓存:生产设计、阈值与安全风险

设计安全可控的生产级 LLM 语义缓存。本文区分精确响应缓存、提示词缓存、KV Cache 与 RAG,讲解如何校准相似度阈值,按租户、授权范围、语言、模型、提示词和来源版本分区,并通过 TTL、事件失效、缓存准入、误命中评估、影子模式和熔断机制降低陈旧回答、跨租户泄露与缓存投毒风险,适合需要同时优化响应延迟、调用成本、答案新鲜度与数据隔离的 AI 平台团队。

2026-07-28

语义搜索:混合检索、重排与评测指南

把语义搜索设计为可度量的检索系统:Embedding、关键词召回、元数据过滤、ANN 索引、混合融合、重排与评测。本文用 Python 示例说明何时向量检索有价值、何时精确匹配更可靠,以及如何验证相关性、权限、新鲜度、延迟与成本,适合 RAG、企业知识库、电商搜索、代码检索和多语言内容发现等生产场景。

2026-02-21