拆解 Llama 4 的 738 万 GPU 小时:Meta 为何没有“800B”?

Meta Llama 4 常被转述成“800B 级模型”,但官方资料里没有这款配置。真正值得拆的是:Meta 用稀疏 MoE 把总参数与每次推理的激活参数分开,又用开放权重把高昂训练投入转成生态入口。

一、先纠偏:官方发布的是 109B 与 400B

Meta 在 2025 年 4 月 5 日发布 Llama 4 Scout 与 Maverick。官方模型卡显示,Scout 是 16 个专家、109B 总参数、17B 激活参数,支持 10M 上下文;Maverick 是 128 个专家、400B 总参数、17B 激活参数,支持 1M 上下文。两者都采用原生多模态的 early fusion 架构。所谓“800B”既不在模型卡,也不在官方代码仓库的发布表中,不能当成已发布产品继续传播。

训练投入同样要区分“公开事实”与“美元估算”。Meta 披露两款模型预训练合计消耗 738 万 H100-80GB GPU 小时,其中 Scout 为 500 万,Maverick 为 238 万;训练 token 分别约为 40 万亿与 22 万亿。此前管理层曾表示 Llama 4 所需计算可能接近 Llama 3 的十倍,但官方没有公布采购折旧、集群利用率与电力合同,因此无法诚实地把 GPU 小时换算成一张精确美元账单。

二、技术解析:400B 为什么只激活 17B

Llama 4 的核心不是“把所有参数都算一遍”,而是让路由器为 token 选择专家,同时保留共享专家处理通用表示。官方 moe.py 已公开路由打分、Top-K 选择、专家计算与聚合路径。总参数决定知识容量,激活参数更接近单次推理的计算负担;两者分离,才让 400B 总规模具备可部署性。

mermaid diagram

工程上仍不能把“17B 激活”理解成普通 17B 稠密模型。Maverick 的全部权重需要被装载和调度,专家并行、显存容量与跨卡通信依旧昂贵。官方提供 Maverick FP8 权重,并给 Scout 提供在线 Int4 量化路径;这降低的是部署门槛,不是已经发生的训练成本。

三、开放权重策略:Meta 在卖生态,不是在送算力

Meta 同时公开模型卡、推理实现、量化脚本和 Cookbook。2026 年 7 月 16 日直连 GitHub API 实测,llama-models 有 7,652 stars,llama-cookbook 有 18,402 stars,后者覆盖推理、微调与 RAG。开发者从权重申请进入,再沿官方代码、配方和安全组件完成部署,最终把兼容性需求推回 Llama 生态。

mermaid diagram

这里应使用“开放权重”而不是笼统的“完全开源”:Llama 4 采用自定义商业许可,不能与 Apache-2.0 或 MIT 许可画等号。Meta 承担一次巨额预训练投入,云厂商和企业承担后续推理、微调与治理成本,平台则获得更广的模型兼容面。

四、关键点

  • 没有官方 800B 发布项:已发布最大版本是 400B 总参数的 Maverick;17B 指激活参数,不是模型全部规模。
  • 成本披露止于计算量:738 万 H100 GPU 小时可核验,但缺少财务口径,任何精确美元总价都只是外部假设。
  • Scout 的长上下文不是免费能力:10M 是模型卡给出的上限,生产环境仍需评估 KV Cache、吞吐与检索质量。
  • 竞技场成绩要核对模型身份:发布期进入 LMArena 的 experimental chat version 针对对话体验优化,与公开权重并非完全相同的评测对象。
  • 独立评测优先于发布表格:Artificial Analysis 提供质量、速度、价格与上下文维度,编码专项测试也显示不同任务上的排名会明显变化。

五、行业影响与结语

Llama 4 留下的行业范式,不是简单堆大总参数,而是“高容量稀疏模型 + 较低激活计算 + 权重开放 + 配方公开”。这会迫使其他大厂同时回答三个问题:是否披露真实激活规模,是否给出可复现部署代码,是否允许企业把模型带进自有基础设施。

因此,判断下一款大厂模型时,别只看参数海报。先核对总参数与激活参数,再核对训练计算与许可条款,最后用公开权重跑自己的任务集。对企业而言,可复现的单位任务成本与治理边界,远比一个未经证实的“800B”更有决策价值。

参考资料

官方文档

开源项目

行业报道

社区讨论

对比基准


本文由 AI 生成。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注