什么是 小语言模型?

小语言模型(Small Language Model, SLM)是一类非标准、依赖上下文的语言模型,其资源或能力边界小于相关比较对象。它没有统一参数上限,仅凭 SLM 标签不能证明模型适配设备、满足任务质量、支持离线、降低延迟或保护数据。

快速了解

全称Small Language Model (SLM)
创建时间2023-2024 年随 Phi、Gemma、SmolLM 等模型兴起

工作原理

小语言模型应相对于明确工作负载与部署预算评估,而不能用一个固定参数阈值定义。可复现的 SLM 部署需要记录模型 Revision、制品哈希、Tokenizer、Chat Template、量化、许可证、运行时、后端、设备 SKU、上下文长度与任务集 Revision。设备适配取决于总常驻内存,包括权重、KV Cache、激活、临时缓冲、运行时库、应用内存和安全余量。本地推理可能减少 Prompt 外传,但隐私与离线结论仍要检查下载、遥测、日志、备份、检索、工具调用和云端回退。生产发布应同时设置任务验收率与严重错误门禁,并测量 TTFT、逐字延迟、峰值内存、热稳定、能耗、崩溃率、离线成功率以及更新与回滚。

主要特点

  • 非标准的相对类别,没有标准组织规定的统一参数上限
  • 部署身份包含模型 Revision、哈希、Tokenizer、模板、量化、许可证与运行时
  • 设备适配由实测总常驻内存决定,而不是由权重文件体积决定
  • 质量与延迟必须在版本化目标任务和代表性设备切片上评测
  • 只有同时控制遥测、日志、存储与回退,本地运行才可能减少数据外传
  • 依据确定性产品门禁,可以选择本地、混合、托管部署或拒绝发布

常见用途

  1. 具有明确 Schema 的离线信息抽取、分类或命令路由
  2. 在受支持手机、笔记本、车载或工业设备上的交互助手
  3. 满足 WebGPU 兼容、首载、缓存和完整性要求的浏览器推理
  4. 独立控制日志、存储、权限与回退的数据最小化应用
  5. 每个有效结果成本优于托管基线的高频窄域工作负载

示例

loading...
Loading code...

常见问题

小语言模型是什么?

小语言模型是指相对于相关比较对象具有更小资源或能力边界的语言模型,它没有统一的 7B、10B 或 13B 参数上限。团队可以记录具体参数量,但最终应结合工作负载、运行时、设备、总内存、任务质量与运行边界判断是否适配。

SLM 与 LLM 有什么区别?

SLM 与 LLM 是相对类别,不是可互操作的技术格式。SLM 通常面向更受限的资源或任务边界,LLM 通常指更大的通用模型。这两个标签都不能直接预测准确率、延迟、成本、上下文支持或部署位置,这些属性属于具体模型制品与系统。

所有小语言模型都能在手机或边缘设备运行吗?

不能。参数量和量化文件体积没有覆盖全部内存与算子要求。候选模型必须容纳权重、KV Cache、缓冲、运行时、应用内存与安全余量,并在每个支持设备切片上通过质量、延迟、温度、能耗、崩溃和生命周期测试。

小语言模型一定比大模型更快、更便宜吗?

不一定。更小的制品可能减少部分计算或供应商费用,但后端 Kernel、Prompt 长度、硬件、热降频、失败任务、人工复核、设备支持与云端回退都会影响结果。应在同一质量策略下比较端到端尾延迟和每个有效任务成本。

本地运行 SLM 就不会泄露数据吗?

本地推理可以避免把 Prompt 发送给推理供应商,但应用仍可能产生网络下载、遥测、日志、崩溃报告、备份、检索、工具调用或云端回退。隐私需要端到端数据流审查、访问控制、保留规则和经过验证的离线行为。

相关术语

相关文章

小语言模型端侧部署:从设备适配到发布门禁

系统讲解小语言模型与端侧 AI 的生产评估方法:不以参数量代替设备适配,而是固定模型制品、Tokenizer、量化格式、运行时和设备身份,测量峰值内存、首字延迟、逐字延迟、任务质量、热降频、能耗、离线成功率与云端回退,并通过隐私、许可证、完整性和设备群发布门禁决定本地、混合或云端部署,适合规划移动端、浏览器、车载与工业边缘 AI 的开发和平台团队。

2026-04-22

AI Agent 模型路由:质量门禁、升级与成本控制

系统讲解 AI Agent 模型路由的工程方法:按步骤能力、风险和运行状态选择模型,用输出级联、质量门禁、校准升级、拒答与人工审批控制失败;通过历史回放、影子流量、灰度和自动回滚验证策略,并将路由器、验证器、重试、回退、工具副作用与修复成本纳入单次验收轨迹成本,避免用参数量、Token 单价或平均基准代替真实任务成功率。

2026-06-28

大模型量化工程:方法、运行时适配与质量评测指南

系统讲解大模型量化的生产方法:区分权重、激活与 KV Cache 量化,解释 GPTQ、AWQ、SmoothQuant、bitsandbytes 与 GGUF 的层级和边界;建立模型制品契约、校准数据、运行时与硬件兼容矩阵,并用业务质量、长上下文、工具调用、结构化输出、延迟、吞吐、显存和 Goodput 门禁完成灰度与回滚。

2026-02-21