ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Qwen3 MoE 稀疏专家部署实战:为什么激活 3B 参数就能跑 30B 模型

Qwen3 MoE 稀疏专家部署实战:为什么激活 3B 参数就能跑 30B 模型 Qwen3 MoE 稀疏专家部署实战为什么激活 3B 参数就能跑 30B 模型【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5如果你部署过 Qwen3 的 MoEMixture of Experts混合专家模型可能会注意到官方基准表里一个扎眼的行Transformers 中 MoE 模型的 GPTQ-INT4 一项标注MoE Kernel Unsupported——INT4 量化根本跑不起来。这恰恰是稀疏专家部署的现实算力开销可以降到原来的十分之一但推理框架必须懂 MoE 的算法。Qwen3 是阿里云 Qwen 团队的大语言模型系列它用 Qwen3-30B-A3B 和 Qwen3-235B-A22B 两款 MoE 模型重新引入了稀疏专家架构——在此之前Qwen 家族直到 2024 年的 Qwen1.5-MoE-A2.7B 才有过一次 MoE 实践。本文用仓库里的实测数据讲清楚三件事MoE 的真实成本、命名怎么读、服务怎么起。 单卡 H20 实测吞吐先给数字以下数据来自官方速度基准测试NVIDIA H20 96GBbatch size 1生成 2048 token推理引擎量化输入长度速度 (tokens/s)显存SGLang 0.4.6.post1BF161137.18—SGLang 0.4.6.post1FP81155.55—SGLang 0.4.6.post1BF161290421385.65—Transformers 4.51.3BF1611.89约 58.5 GBTransformers 4.51.3FP810.44约 30.3 GB三行数字能得出三个结论30B-A3B 在 BF16 下可单卡 96GB 全量驻留FP8 把显存压掉约 48%58.5 → 30.3 GB长输入 prefill 场景下MoE 吞吐随输入长度上升SGLang 在 129k 输入时超过 1300 tokens/sTransformers 的 FP8 速度目前不理想高吞吐在线服务建议直接上 SGLang。30B-A3B的命名规则稀疏专家路由一句话讲透Qwen3 的命名格式是Qwen3-size-type-dateDense 模型直接写总参数如 32BMoE 模型多一个 A 前缀表示每个 token 实际激活的参数量。所以 30B-A3B 总参数 30B、每 token 只激活 3B235B-A22B 总参数 235B、激活 22B。路由的本质很简单三步走输入当前 token 的隐藏状态送进路由层一个很小的线性层路由路由层给本层所有专家打分只选中得分最高的前几个其余专家不参与这个 token 的计算加权输出被选中专家的输出按分数加权求和得到该层最终输出于是一个 30B 模型的单 token 计算成本接近 3B 模型而每个 token 又能动态命中最对口的专家——这就是稀疏激活成本亚线性增长的来源。⚠️ 框架支持矩阵哪里能跑、哪里不能跑框架支持状态版本 / 说明Hugging Face Transformers✅ 4.51.0MoE 的 GPTQ-INT4 内核暂不支持vLLM✅ 0.8.5OpenAI 兼容 API 服务SGLang✅0.4.6.post1 实测高吞吐推荐llama.cpp✅b5092 起支持 Qwen3MoE走 GGUF 格式LM Studio✅支持 GGUF / MLX含 MoE 变体表里最需要留意的是第一行的备注MoE 的 GPTQ-INT4 在 Transformers 里没有可用内核。想吃 INT4 只能走 SGLang 路线实测 31.29 tokens/s 输入 1比 BF16 的 137.18 还慢多数场景并不划算。⚡️ vLLM 一条命令拉起 MoE 服务pip install vllm0.8.5 vllm serve Qwen/Qwen3-30B-A3B-Instruct-2507 --port 8000 --max-model-len 262144服务启动后即兼容 OpenAI API--max-model-len 262144对应 2507 版本的 256K 长上下文该系列还支持超长输入扩展到 1M token细节见对应 modelcard。需要思考模式时把模型名换成Qwen3-30B-A3B-Thinking-2507并追加推理解析参数即可同一套服务两种模式共用。Dense 还是 MoE怎么选MoE 的本质是拿显存换算力30B-A3B 每 token 只算 3B 的专家但 30B 总参数必须全部驻留BF16 约 58.5 GB。所以选型基本看三条线手里有一张 80~96GB 卡、要跑高并发在线服务30B-A3B 几乎是唯一解——同档 32B Dense 更慢且显存更高追求能力上限、有多卡预算235B-A22B 是系列天花板边缘设备、单用户本地、想用 llama.cpp 跑 INT4/INT8 量化Dense 8B/14B/32B GGUF 量化反而更务实。下一步生产服务部署vLLM 部署指南量化选型与提速数据速度基准测试本地运行llama.cpp / Ollama / LM Studiorun_locally 文档部署前建议先把自己业务的输入长度分布对着基准表过一遍选显存与速度的甜点组合——MoE 部署的差距往往不在模型本身而在你站在了表格的哪一行。【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表