什么是 大语言模型?
大语言模型(LLM,Large Language Model)是一类根据学习到的参数和提供的上下文预测、评分或生成 Token 序列的神经语言模型。其任务行为取决于模型修订版、分词器、Prompt、解码策略、工具、检索和评测协议。
快速了解
| 创建时间 | 2018 年(GPT-1),2020 年显著扩展(GPT-3) |
|---|---|
| 规范文档 | 官方规范 |
工作原理
许多 LLM 使用仅解码器 Transformer 架构,通过 Token 预测目标预训练,再经监督训练、偏好优化、工具调用、检索或产品控制进行适配。也存在仅编码器、编解码器、多模态和小语言模型变体。参数数量、基准分数或流畅输出本身不能证明其对某项任务可靠。 LLM 可以完成有价值的草稿、转换、分类和工具规划,也可能出错、遗漏约束、遵循不可信指令、暴露敏感上下文或产生不一致输出。应以带日期的模型修订版为对象,在有代表性的输入、明确成功标准、对抗案例、成本与延迟预算下评测;必要时加入人工复核和回滚路径。检索和较低温度会改变行为,但不能保证事实性或安全性。
主要特点
- 根据学习参数和提供上下文预测或生成 Token
- 架构、分词器、上下文限制和解码策略均具有版本相关行为
- 可通过 Prompt、检索、工具或参数更新适配行为
- 可能跨任务泛化,但每个部署场景都需要代表性评测
- 存在可测量的质量、延迟、上下文、内存、成本、隐私和安全权衡
- 可能生成看似合理但没有证据支持的内容,高影响场景需验证控制
常见用途
- 对话式 AI 助手和客服聊天机器人
- 内容生成,包括文章、营销文案和创意写作
- 代码生成、补全和调试,用于软件开发
- 语言翻译和跨语言交流
- 文档摘要和信息提取
示例
Loading code...常见问题
大语言模型与传统 NLP 模型有什么区别?
许多传统 NLP 系统针对较窄任务训练或工程化,而 LLM 往往先进行广泛预训练,再通过 Prompt、检索、微调或工具适配。边界并不绝对:更小或任务专用的模型可能更准确、成本更低、隐私更好或更易验证。应在代表性输入和失败案例上比较准确模型。
训练一个大语言模型需要多少数据和算力?
需求会随架构、参数量、Token 预算、序列长度、精度、硬件、并行方式和训练目标显著变化,许多模型的公开报告也并不完整。应根据选定配置、数据治理要求、硬件可用性、能耗、评测和运维成本估算具体训练,而非套用通用 Token、GPU 或价格数字。
什么是大语言模型的幻觉,如何减少?
幻觉是相对任务证据而言缺少支持、错误或虚构的输出。可采用限定范围的检索和来源检查、受约束输出、验证工具、校准拒答、人工复核和任务专用评测。RAG、微调或较低温度会改变错误模式,但不能保证事实性。
大语言模型可以在本地运行而不使用云 API 吗?
可以,部分模型修订版可在本地或端侧运行。可行性取决于模型架构和规模、量化、上下文长度、KV Cache、批量、后端、硬件内存、吞吐目标和许可证。应在预期负载下测量准确版本,并纳入安全更新、数据留存、访问控制和监控成本。
什么是上下文窗口,为什么它很重要?
上下文窗口限制特定模型配置可处理的 Token 总数,通常包含输入、生成输出以及部分系统或工具内容。更大的标称窗口不保证每个位置都被有效使用,它还会影响内存、延迟、成本、截断、检索设计和评测。应测试与实际任务相关的长上下文案例,而不是只看宣传上限。