MoE(混合专家架构)
官方介绍
**MoE(Mixture of Experts,混合专家)是一类神经网络架构:把模型里的前馈层替换成多个并行的「专家」子网络,由可学习的门控网络(Router)**为每个 token 只激活其中一小部分(专家稀疏性)。思想源自 1990 年代 Jacobs、Jordan 等人的「自适应专家混合」,Switch Transformers、GLaM 等工作将其推广到大模型训练。按 NVIDIA 的定义,MoE 由四要素构成:专家(Experts)、专家稀疏(Expert Sparsity)、门控网络(Gating Network)、输出组合(Output Combination)。
核心特点
- 算力省:每个 token 只算「激活参数」,同等算力可以堆更大的总参数
- 权重仍占地方:总参数决定内存 / 显存占用——「激活少」不等于「装得下」
- 激活参数少的 MoE 在多数基准上能打败同算力的稠密(Dense)模型,但最高难度的推理可能仍输给最强稠密模型
- 本地部署门槛:需要 MoE 专用引擎做 CPU + GPU 混合推理(如 FreeToken、Strata、llama.cpp)
使用说明
- 看模型规格时区分两个数字:总参数(决定占多少内存)与激活参数(决定算得多快),如 Qwen3.8-Flash-Next 为 125B 总参、激活 6B
- 选本地部署方案时:按总参数 + 量化档估算内存,按激活参数估算速度
官方链接
- NVIDIA 术语解释:nvidia.com/glossary/mixture-of-experts
- Hugging Face 详解(中文):huggingface.co/blog/zh/moe
- NVIDIA 技术博客(Dense vs MoE):developer.nvidia.com/blog