什么是 混合专家模型?

混合专家模型(Mixture of Experts,MoE)是一种条件计算架构,由可学习或固定的路由策略为每个输入选择部分专家子网络,并组合这些专家的输出。

快速了解

全称Mixture of Experts (MoE)
创建时间1991 年由 Jacobs 等人提出,2022 年起在 LLM 中流行
规范文档官方规范

工作原理

在许多 Transformer 语言模型中,MoE 块会用一个路由器和一组专家 FFN 替换部分稠密前馈层。路由器为 Token 状态打分,选择一个或多个专家,分发 Token 状态,再加权合并专家输出。稀疏激活可以在不让每个 Token 执行全部专家的前提下扩大总参数容量,但总参数、激活参数、FLOPs、延迟、内存和质量不能互相替代。真实系统仍需存储或分片专家权重、平衡负载、把 Token 分配聚合成高效算子,并处理跨设备通信。专家可能形成统计上的专门化,但架构本身不保证人类可读的领域分工。可阅读<a href="https://qubittool.com/zh/blog/moe-architecture-explained">混合专家模型架构指南</a>了解训练、推理与评测契约。

主要特点

  • 使用条件计算为每个输入激活部分子网络
  • 通常替换部分 Transformer FFN,而其他组件保持稠密或共享
  • 对批量 Token 路由,按专家分组,执行专家算子,再恢复 Token 顺序
  • 区分总参数、激活参数、算术量、内存、延迟和模型质量
  • 需要明确负载均衡、溢出、分发、精度和设备放置策略
  • 可使用专家并行和跨 Worker 的 All-to-All 类通信

常见用途

  1. 在限制单 Token 专家路径的同时扩大模型参数容量
  2. 跨分布式加速器训练稀疏语言或多模态模型
  3. 研究条件计算与可学习路由
  4. 在公开架构中组合共享专家与细粒度路由专家
  5. 在实测内存、延迟、质量和成本目标下部署已验证的稀疏 Checkpoint

示例

loading...
Loading code...

常见问题

什么是混合专家模型 MoE?

混合专家模型是一种条件计算架构。路由器把每个输入分配给被选中的专家子网络并组合输出。在 Transformer 大模型中,专家通常是部分层内部的前馈模块,而不是彼此独立的端到端模型。

MoE 推理成本只与激活参数量有关吗?

不是。激活参数量描述被选中的权重路径,却没有计入共享层、路由、Token 重排、内存访问、通信、填充、同步和算子效率。应在目标系统上测量端到端延迟、吞吐、内存、质量与成本。

MoE 专家会分别代表不同知识领域吗?

定义上不会保证。专家可能形成不同路由分布或内部特征,也可能互相重叠,或者专门处理人类不可读的模式。给专家贴领域标签需要路由分析和受控质量证据。

什么是专家并行?

专家并行把不同专家放在不同 Worker 上。Token 状态被分发到持有所选专家的 Worker,完成计算后返回并合并。它能减少单设备的专家权重内存,但会引入通信和负载均衡约束。

如何比较 MoE 与稠密模型?

固定 Checkpoint 任务、数据、质量门禁、精度、运行时、硬件拓扑、批处理、并发与序列分布,再报告总参数与激活参数、分片质量、Prefill 和 Decode 性能、延迟分位数、内存、通信、失败率和成本。

相关术语

相关文章

混合专家模型 MoE 架构:路由、训练与推理部署

系统理解混合专家模型 MoE 的 Token 路由、稀疏激活与专家并行,厘清总参数、激活参数、FLOPs、显存、吞吐、延迟和模型质量之间不能直接换算的边界。本文从批量路由数据路径出发,讲清训练阶段的负载均衡、容量与溢出策略,以及推理阶段的专家权重常驻、All-to-All 通信、Grouped GEMM、Prefill 与 Decode 差异,并给出可复现的稠密模型与 MoE 模型评测契约,帮助训练、推理和平台团队避免把架构参数误当成生产性能。

2026-04-07

混合推理模型实战:何时开启/关闭大模型的「思考」模式

面向生产环境的混合推理 API 版本化指南。本文区分产品开关与内部架构,介绍如何在固定协议下评估质量、延迟和成本,使用有界预算路由请求,并明确返回的推理文本不是权威证据,避免把思考模式当成质量保证,适用于代码生成、长文档分析、批量任务和高风险审核流程,帮助团队建立可审计的回退、发布和故障复盘策略体系。

2026-04-23

注意力机制完全指南:从直觉理解到Transformer核心原理与代码实现

实用的注意力机制指南,涵盖 Query-Key-Value 投影、缩放点积、掩码、多头注意力、复杂度、诊断方法和 Transformer 集成。文章提供 NumPy 与 PyTorch 示例、形状检查、长上下文权衡和实现边界,并说明为什么不能把注意力热力图直接当作模型解释,适合学习 Transformer 和排查实现问题。

2026-02-21