什么是 思维链?
思维链(Chain-of-Thought,CoT)是一种提示技术,引导模型在最终答案前生成自然语言中间步骤。这些文本可能改善部分多步任务,但不保证步骤正确,也不保证忠实呈现模型的内部计算。
快速了解
| 全称 | 思维链提示 |
|---|---|
| 创建时间 | 2022 年由 Google Research 提出 |
| 规范文档 | 官方规范 |
工作原理
Wei 等人在 2022 年系统提出 Few-Shot 思维链提示:在示例输入和答案之间加入完整推导。Kojima 等人随后发现,简短的 Zero-Shot 指令也能在部分受测模型和基准上引出中间步骤。这些研究证明的是特定模型、任务和提示配置下的实验收益,不是通用提示规则,也没有形成适用于现代模型的固定参数门槛。可见推导仍是生成文本,可能包含错误步骤、遗漏真正改变答案的线索,或在结论之后补写看似合理的解释。现代推理模型使用的提供方内部推理计算,也不等于用户要求输出的 CoT。生产系统应把 CoT 与直接回答做消融对比,用工具、测试或来源独立核验结果,默认不保存敏感推导,并分别评测正确性、鲁棒性、延迟、Token 成本与拒答行为。
主要特点
- 在最终答案前生成自然语言或符号形式的中间文本
- 包含 Few-Shot 示例和 Zero-Shot 引导两类常见变体
- 收益取决于模型、任务、提示和解码配置
- 增加输出 Token、延迟,并可能需要多次采样
- 即使最终答案正确,也可能生成错误或不忠实的推导
- 可信决策仍需要外部证据、工具、测试或验证器
常见用途
- 在具有精确标签或人工标注的多步任务上执行消融评测
- 由计算器独立核验最终结果的算术工作流
- 具备可执行测试或形式约束的符号推理与代码任务
- 为稳定题型和领域流程提供 Few-Shot 推导示例
- 用户需要理由时生成简洁且绑定证据的解释
示例
Loading code...常见问题
零样本思维链和少样本思维链有什么区别?
Zero-Shot CoT 只加入引导模型生成中间步骤的指令,不提供示例;Few-Shot CoT 则提供输入、推导与答案组成的完整示例,用来定义题型和输出模式。二者没有普遍优劣,应在同一模型版本、标注任务集、解码参数、延迟和 Token 预算下与直接回答基线比较。
为什么思维链能提高模型准确性?
CoT 可以生成更多中间 Token,把部分结果保留在后续生成上下文中;Few-Shot 示例也可能把模型引导到更合适的求解格式。这是工程解释,不是模型采用人类式思维的证明。收益随模型和任务变化,更长推导也可能引入错误或掩盖真正影响答案的因素。
可见思维链是模型真实的内部推理吗?
不一定。可见推导是另一段生成文本。忠实度研究表明,模型可能使用某些信息却不在推导中说明,也可能生成与答案真实因果过程不一致的合理化解释。因此不能把 CoT 当作鉴权记录、合规证据或正确性证明。
思维链必须使用 1000 亿参数以上的模型吗?
不存在通用参数门槛。2022 年原始实验在当时的模型家族中观察到更大规模对应更明显收益;后续模型已经经历训练数据、指令微调、蒸馏和推理专项训练的变化。应评测实际模型与 Endpoint,不能用参数数量替代任务证据。
应该如何评测思维链提示?
在版本化任务集上比较直接回答、问题分解、Few-Shot CoT、Zero-Shot CoT 与工具验证方案。分别度量最终答案正确率、可标注场景下的步骤合法性、鲁棒性、拒答行为、p50/p95 延迟、Token 成本、隐私暴露,以及每个正确结果的总成本。