什么是 小语言模型?
小语言模型(Small Language Model, SLM)是一类非标准、依赖上下文的语言模型,其资源或能力边界小于相关比较对象。它没有统一参数上限,仅凭 SLM 标签不能证明模型适配设备、满足任务质量、支持离线、降低延迟或保护数据。
快速了解
| 全称 | Small Language Model (SLM) |
|---|---|
| 创建时间 | 2023-2024 年随 Phi、Gemma、SmolLM 等模型兴起 |
工作原理
小语言模型应相对于明确工作负载与部署预算评估,而不能用一个固定参数阈值定义。可复现的 SLM 部署需要记录模型 Revision、制品哈希、Tokenizer、Chat Template、量化、许可证、运行时、后端、设备 SKU、上下文长度与任务集 Revision。设备适配取决于总常驻内存,包括权重、KV Cache、激活、临时缓冲、运行时库、应用内存和安全余量。本地推理可能减少 Prompt 外传,但隐私与离线结论仍要检查下载、遥测、日志、备份、检索、工具调用和云端回退。生产发布应同时设置任务验收率与严重错误门禁,并测量 TTFT、逐字延迟、峰值内存、热稳定、能耗、崩溃率、离线成功率以及更新与回滚。
主要特点
- 非标准的相对类别,没有标准组织规定的统一参数上限
- 部署身份包含模型 Revision、哈希、Tokenizer、模板、量化、许可证与运行时
- 设备适配由实测总常驻内存决定,而不是由权重文件体积决定
- 质量与延迟必须在版本化目标任务和代表性设备切片上评测
- 只有同时控制遥测、日志、存储与回退,本地运行才可能减少数据外传
- 依据确定性产品门禁,可以选择本地、混合、托管部署或拒绝发布
常见用途
- 具有明确 Schema 的离线信息抽取、分类或命令路由
- 在受支持手机、笔记本、车载或工业设备上的交互助手
- 满足 WebGPU 兼容、首载、缓存和完整性要求的浏览器推理
- 独立控制日志、存储、权限与回退的数据最小化应用
- 每个有效结果成本优于托管基线的高频窄域工作负载
示例
Loading code...常见问题
小语言模型是什么?
小语言模型是指相对于相关比较对象具有更小资源或能力边界的语言模型,它没有统一的 7B、10B 或 13B 参数上限。团队可以记录具体参数量,但最终应结合工作负载、运行时、设备、总内存、任务质量与运行边界判断是否适配。
SLM 与 LLM 有什么区别?
SLM 与 LLM 是相对类别,不是可互操作的技术格式。SLM 通常面向更受限的资源或任务边界,LLM 通常指更大的通用模型。这两个标签都不能直接预测准确率、延迟、成本、上下文支持或部署位置,这些属性属于具体模型制品与系统。
所有小语言模型都能在手机或边缘设备运行吗?
不能。参数量和量化文件体积没有覆盖全部内存与算子要求。候选模型必须容纳权重、KV Cache、缓冲、运行时、应用内存与安全余量,并在每个支持设备切片上通过质量、延迟、温度、能耗、崩溃和生命周期测试。
小语言模型一定比大模型更快、更便宜吗?
不一定。更小的制品可能减少部分计算或供应商费用,但后端 Kernel、Prompt 长度、硬件、热降频、失败任务、人工复核、设备支持与云端回退都会影响结果。应在同一质量策略下比较端到端尾延迟和每个有效任务成本。
本地运行 SLM 就不会泄露数据吗?
本地推理可以避免把 Prompt 发送给推理供应商,但应用仍可能产生网络下载、遥测、日志、崩溃报告、备份、检索、工具调用或云端回退。隐私需要端到端数据流审查、访问控制、保留规则和经过验证的离线行为。