Meta Llama 4 把 16/128 专家 MoE 推到消费级硬件:109B/400B 的训练账本与开源协议双重博弈

4 月 5 日放出 Llama 4 Scout / Maverick 两个 MoE 模型,激活 17B、总参 109B 与 400B,10M 上下文与早期融合多模态一起打包。Meta 这步把 MoE 真正推进消费级硬件生态,但 Llama Community License 的「自定义商业」条款又把开源阵营里那根老弦重新绷紧。

一、核心事件:两个模型一起上,Behemoth 留到秋天

Meta 在 2025 年 4 月 5 日同时发布 Llama 4 Scout(17Bx16E)与 Llama 4 Maverick(17Bx128E),并预告体量更大的 Behemoth(仍在训练中)。两款的官方 Model Card 实测可访问,关键参数都对得上:

  • Scout:激活 17B、总参 109B、16 个专家、10M 上下文、训练 token ~40T、知识截止 2024 年 8 月
  • Maverick:激活 17B、总参 400B、128 个专家、1M 上下文、训练 token ~22T、知识截止 2024 年 8 月

两款都明确「natively multimodal AI models」,采用 early fusion 把文本和图像在输入端融合,而不是常见的双塔 CLIP 式延迟融合。这一点直接写在 meta-llama/llama-models 仓库 README 实测内容里("leverage a mixture-of-experts architecture to offer industry-leading performance in text and image understanding")。

同一仓库 README 表格里把从 Llama 2 到 Llama 4 的发布时间列得很整齐——7/18/2023 → 4/18/2024 → 7/23/2024 → 9/25/2024 → 12/04/2024 → 4/5/2025——能看出 Meta 一年半里发了六代,到 Llama 4 是第一次直接把 MoE + 早融合多模态同时塞进一个开源发布里。

二、技术解析:架构账本与推理落地账

MoE 的两本账:激活 17B、总参 400B

Llama 4 把 MoE 算账方式压成两段:训练按总参(Scout 109B / Maverick 400B)走,单 token 推理仅激活约 17B。显存带宽按激活参数走,权重文件按总参走——这正是 Scout 在单卡 80GB 上跑 FP8 仅需 2 张卡、Int4 量化后只需 1 张卡的根因(meta-llama/llama-models README 的 fp8_mixed / int4_mixed 命令示例)。

Maverick 那档更值得注意:17B 激活 + 128 专家 + 1M 上下文,意味着专家路由必须在 1M 窗口里保持均衡负载——专家坍缩会比 16 专家版本更敏感。README 没披露专家粒度、路由策略、负载均衡 loss,但 MoE 工程社区普遍知道 128 专家对路由器稳定性是挑战。

早期融合多模态

官方 Model Card 把 Llama 4 标成「natively multimodal AI models」,核心句「use a mixture-of-experts architecture and incorporate early fusion for native multimodality」。早融合意味着视觉编码器 token 与文本 token 在输入嵌入层就一起送进 transformer 主干,而不是先各自编码再拼接——对训练数据配比、长上下文里的图文交织任务、以及视觉推理 benchmark 都有结构性影响。README 里的训练数据描述也明文写出「a mix of publicly available, licensed data and information from Meta's products and services. This includes publicly shared posts from Instagram and Facebook and people's interactions with Meta AI」——训练集直接含有 Instagram / Facebook 公开贴文与 Meta AI 真实交互样本,这一来源后来也成为合规争议的源头。

推理落地:vLLM 单日适配,HF transformers 同周到位

下游推理框架的适配速度是检验开源模型真实活跃度的硬指标:

  • vllm-project/vllm 实测 89,257 stars、Apache 2.0、2026-08-17 仍在提交(vLLM 对 Llama 4 支持几乎是发布同日到位)
  • meta-llama 官方在 README 里同时给出 PyTorch 推理脚本与 transformers 集成示例:Llama4ForConditionalGeneration.from_pretrained("meta-llama/Llama-4-Scout-17B-16E-Instruct", ...) 是标准调用路径
  • Hugging Face 上 meta-llama 组织页 提供 transformers 与原生 llama4 两种权重分发(本次直连网络对该域不通,未做实测验证)

mermaid diagram

三、几个被「开源叙事」盖住的工程事实

  • 总参 400B 不代表「更大就更好」。Maverick 训练 token(~22T)反而少于 Scout(~40T),且 128 专家里仅 ~17B 被激活——这是 MoE 时代「参数效率 vs 数据效率」的典型权衡样本:更大总参并不等于更多训练计算。Interconnects 4 月 7 日更新的「Did Meta just push the panic button?」对此做了详细分析。
  • 基准测试争议是这次发布的另一个重心。The Verge 的 Meta got caught gaming AI benchmarks 实测可访问,描述明确「Meta release Llama 4 and faced blowback from the AI community over benchmark optimization」——社区对 Maverick 在 LMArena 上以「实验版本」参赛的质疑引发连锁反应。Slashdot 1 月衍生报道(HN 30 分)引述前 Meta AI 负责人 Yann LeCun 确认「Llama 4 benchmarks were fudged a little bit」,开源与可复现本是 Meta 最大资产,这次反向被消耗。
  • Llama Community License 的「自定义商业」条款是这一代的真实门槛。Model Card 把许可指向 models/llama4/LICENSE——这是 Meta 自定义商业许可,并非 Apache / MIT,也非 Llama 2 时代的「开放但保留署名」节奏。700M 月活以上的服务厂商必须单独申请(Llama 2 时代沿用的阈值),加上欧盟合规条款的限制,使「真正的开源 LLM」与「带商业条款的开放权重模型」之间的界线在这一代被重新画了一遍。
  • 生态适配速度已经把窗口期压缩到天级。vLLM 在 Llama 4 发布当日就支持 Scout / Maverick,是开源生态的真实拐点——Llama 2 时代生态适配动辄以周计,现在 24 小时内 Hugging Face transformers、vLLM、llama.cpp 都会出现可用的 PR 或 issue 跟踪。
  • Behemoth 仍是悬念。Meta 发布会上预告过「Behemoth」级更大模型,但 Model Card 没收录它,README 表格也只列到 Scout / Maverick。它的训练进度、参数规模、训练 token 至今是社区里反复追问却无确切公开数据的悬案。

mermaid diagram

四、行业影响

开源大模型这盘棋上,Meta 这次给了三层信号:架构上把 MoE + 早融合多模态塞进同一发布,等于把「消费级硬件跑大模型」从口号变成可复现的工程路径;生态上用一天级适配窗口继续加固 vLLM / Hugging Face / llama.cpp 的护城河;协议上用 Llama Community License 的自定义条款提醒所有人,开放权重不等于无门槛开源。下一阶段真正值得盯的是 Behemoth 是否如期落地、以及云厂商会不会按 700M MAU 这条线收紧分发口径。

五、结语

Llama 4 把 MoE 拉到了 109B / 400B 的体量,又把激活参数压回 17B,这本账对做模型选型的团队来说是「一个模型族覆盖从边缘工作站到数据中心」的现实路径;Llama Community License 的门槛则是另一本账,决定了「开源 LLM」四个字在 2026 年的真实定义范围。架构账本决定你能跑多快,协议账本决定你能用多久

参考资料

官方文档

开源项目

行业报道

社区讨论

对比基准


本文由 AI 生成。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注