导语
2026 年 7 月,vLLM v0.26.0 与 SGLang v0.5.16 同周发布,两家头部推理引擎同时把 MoE 专家并行 + DeepSeek-V3 FP8 路径 列入主线,DeepSeek-V3 仓库累计 104,043 颗星、Qwen3 27,442 颗星,MoE 推理已经从「少数派的实验」变成「默认形态」。本文以 DeepSeek-V3(671B 总参 / 256 路由专家 / top-8 激活 / 37B 激活参数)为基准,拆开 MoE 推理对显存、内存带宽与跨卡互联的硬约束,并对照 2026 年下半年的硬件选型路径,给出 4 个量级的部署决策图。
一、核心事件:三引擎同周迭代 MoE 推理栈
2026 年 7 月下旬,vLLM 与 SGLang 在不到一周的时间里先后发版:vLLM v0.26.0 在 7 月 27 日发布、SGLang v0.5.16 在 7 月 25 日发布。同期 HuggingFace TGI 仓库(10,884 颗星)在主分支的 fused_moe.py 中已经支持 DeepSeek-V3 风格的细粒度专家路由(共 24 处 num_experts、54 处 topk 引用)。意味着从「MoE 专家并行」到「FP8 + 动态 expert dispatch」的主线实现已经在三家头部框架全部就绪。
与此同时,mlc-ai/mlc-llm(23,009 颗星)在 7 月 23 日仍有活跃提交,把 MoE 编译路径铺到了本地端侧 — 即 M4 Pro / Snapdragon X Elite 这类统一内存架构的设备,可以在 64GB 共享内存上跑 Qwen3-30B-A3B 这种 30B 总参 / 3B 激活的 MoE 模型,免去传统 GPU 的 host-device 拷贝瓶颈。

二、技术解析:MoE 推理为什么不是「参数越大显存越多」
MoE 推理和稠密模型的根本差异在于:显存占用不再与总参数线性绑定,而是与「当前活跃专家的权重 + KV Cache」绑定。以 DeepSeek-V3 为例:
- 总参:671B,但单 token 激活参数只有 37B(top-8 路由专家 + 1 共享专家)
- 显存占用:FP8 权重 671B × 1 字节 ≈ 671 GB;但每个 token 只需读取 8 个路由专家 + 1 共享专家,实际显存带宽压力 ≈ 37B × 1 字节 ≈ 37 GB/token
- 关键洞察:MoE 推理的瓶颈在「跨卡 all-to-all 通信」与「专家权重的局部性命中」,而不是「整模型权重能否塞进显存」
这带来三个工程后果:
1. 8 张 A100 80GB(640GB) 跑 DeepSeek-V3 FP8 671B 理论上够用,但单 token 推理必须做 64-way 张量并行 + 专家并行,跨卡 NVLink 带宽利用率是性能决定项。
2. Mac Studio M3 Ultra(192GB 统一内存) 在 FP16 下能装下 DeepSeek-V3 的完整权重,但 192GB/s 内存带宽意味着单 token 推理延迟是 A100 集群的 5-10 倍 — 适合离线批量 / 草稿生成,不适合在线对话。
3. 端侧 NPU(Apple Neural Engine / Qualcomm Hexagon) 跑 MoE 是「做梦」:专家路由是动态的,无法静态编译;现实路径是用 SoC 上的 CPU + GPU 跑 top-k 调度,把 NPU 当纯矩阵乘加速器。
三、关键点(决策图)

- 批量推理 / 低延迟首选:8 卡 H100 80GB NVL(640GB 总显存、900GB/s NVLink)跑 DeepSeek-V3 FP8,单 batch 1 路请求即可达到 ~50 tokens/s。
- 离线批量 / 草稿生成:Mac Studio M3 Ultra 192GB,DeepSeek-V3 FP16 完整装入,token/s 仅 5-12 但功耗只有 200W,跑批量任务能耗比优于 H100 集群。
- 中等规模 MoE(Qwen3-30B-A3B / Mixtral 8x7B):单张 RTX 4090 24GB + QLoRA 4-bit 量化可行,本地社区实测 ~30 tokens/s,适合个人开发者。
- 避坑:消费级 RTX 5090 32GB 的 FP8 路径支持仍不完整(2026-07 主流框架还未把 Blackwell 的 FP8 调度路径下放到消费级驱动);生产环境首选仍是数据中心级 H100 / B200。
四、行业影响
MoE 架构在 2026 年的主线地位已经确立 — DeepSeek-V3、Qwen3-MoE、Mixtral、GLM-5-MoE 都在「同总参 / 1/4 推理算力」这条路线上跑通,显存不再是线性天花板。但随之而来的是推理框架的分化:vLLM 走「通用 + 大社区」、SGLang 走「结构化输出 + agent」、TGI 走「HuggingFace 生态闭环」、mlc-ai 走「端侧编译」。选型时,先选推理框架、再选硬件 比「先选硬件再适配框架」少走 3-6 个月弯路。
参考资料:
官方文档
- DeepSeek-V3 仓库元数据 [200] - 2026-07-29 累计 104,043 stars / 总参 671B / top-8 激活
- Qwen3 仓库元数据 [200] - 2026-07-29 累计 27,442 stars
- arXiv 2503.05139: Scaling a 300B Mixture-of-Experts LING LLM [200] - 2025-03-25 不用 premium GPU 训 300B MoE 的方案
开源项目
- vLLM v0.26.0 Release [200] - 2026-07-27 发布,FusedMoE 路径已成熟
- SGLang v0.5.16 Release [200] - 2026-07-25 发布,expert parallelism 主线实现
- mlc-ai/mlc-llm [200] - 2026-07-23 端侧 MoE 编译路径
- kvcache-ai/ktransformers [200] - 2024-08-29 Show HN: 236B 模型 + 1M context 本地推理
- HuggingFace Text Generation Inference [200] - 2026-03-21 fused_moe.py 含 DeepSeek-V3 支持
行业报道
- HN: 4x RTX 3090 跑 $6/月 LLM 服务 [200] - 2026-06-14 8pts 消费级硬件 MoE 部署实录
- HN: GLM 5.2 在慢速电脑上跑通 [200] - 2026-07-09 937pts MoE 端侧落地讨论
社区讨论
- A Visual Guide to Mixture of Experts LLMs [200] - 2024-10-09 3pts 社区共识科普
- HN: $6/月无限 LLM 提供商实战 [200] - 2026-06-14 消费级 GPU 4 卡部署 MoE
对比基准
- kvcache-ai/ktransformers 本地 236B 推理 [200] - 2024-08-29 端侧 vs 数据中心级 MoE 性能边界
本文由 AI 生成。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。
