FP4 量化把内存带宽压到极限:2026 推理硬件为什么盯上了每 bit 的吞吐?

如果说 2024-2025 年的推理硬件竞争围绕「HBM 容量」与「FP8 tensor core」展开,那么 2026 年的暗线落在了 FP4 / MXFP4 / NVFP4 上。

导语

如果说 2024-2025 年的推理硬件竞争围绕「HBM 容量」与「FP8 tensor core」展开,那么 2026 年的暗线落在了 FP4 / MXFP4 / NVFP4 上。模型权重与 KV Cache 在 4-bit 精度下体积砍到 1/4,真正的瓶颈立刻从「参数放不放得下」转向「每秒钟能从 HBM 里读出多少 bit」。NVIDIA TensorRT-LLM 仓库 topics 里明确列着 blackwellllm-servingmoe,说明它把 FP4 路径当作 Blackwell 之后的下一代核心支持;Apple MLX v0.32.0 也在 2026-07-07 释出 fp4/fp8 分组量化路径。这篇文章拆解:FP4 落地究竟是被什么卡住的,以及 2026 年的桌面、服务器与边缘硬件如何围绕它重新划分。

一、为什么 FP4 不是「再砍一刀」那么简单

把权重从 FP16 砍到 INT4,平均相对误差大约落在 1-3% 区间,取决于 outlier 处理和 group size。关键转折点是 Blackwell 引入了 native FP4 tensor core 路径——一旦硬件原生支持 4-bit GEMM 累加,权重体积砍半、二次方级推理吞吐提升才真正发生。

但 FP4 比 INT4 难:FP4 的 exponent 与 mantissa 必须按 E2M1(2 位指数、1 位尾数)格式分布权重,才能保证动态范围。OCP 发布的 NVFP4 规范 与 Microsoft 的 MXFP4 把这一约定落地成行业标准;NVIDIA TensorRT-LLM 与 Megatron-LM 都基于 NVFP4 做训练和推理端到端。

二、访存带宽是真正的天花板

权重砍到 1/4 之后,剩下的成本几乎全部压在 memory bandwidth 上。以桌面级 GDDR7 与数据中心 HBM3 为例,FP16 模型里许多次「把权重从显存搬到 SM」的访存量,在 FP4 模型里缩减到原来的约 1/4。访存占比越大,FP4 相对 FP16 的 decode 加速比越高——其上限几乎完全由「HBM / GDDR7 / unified memory 的 GB/s 吞吐」以及 kernel 的访存合并度决定,而不是峰值 FLOPS。

flowchart LR

A[模型权重
FP16 32GB]

B[4-bit 量化后
~8GB]

C[HBM / GDDR 带宽
每 bit/s]

D[Tensor Core
FP4 GEMM]

E[Decode token/s]

A -->|量化| B

B -->|仍受带宽约束| C

C --> D

D --> E

mermaid diagram1

三、硬件代际差:Blackwell vs Ada vs Apple Silicon

NVIDIA Blackwell(B200 / RTX 50 系列):tensor core 原生支持 NVFP4 / FP6 / FP8 / FP4 路径,B200 单卡搭配 HBM3e 多档位显存容量,B200 数据中心卡的访存带宽按 NVIDIA 公开规格「达到 8 TB/s 量级」(NVIDIA Newsroom 公告原文「eight-terabyte-per-second class memory bandwidth」)。这是数据中心 FP4 推理的「理想金标准」。

RTX 5090 桌面卡:32GB GDDR7,FP4 tensor core 路径支持,但没有 HBM——访存带宽比数据中心 HBM 方案低一个数量级,桌面 FP4 量化模型上限大致落在 70B 参数以内。

Mac mini M4 Pro 64GB:用 unified memory 把「百 GB/s 级」内存带宽和 LPDDR5x 池串起来跑 FP4 / INT4 路径,配合 MLX / llama.cpp 的 fp4 weight packing。优势是单台机器不需额外显卡就能跑 30B-70B 量化模型,劣势是缺乏 NVFP4 那种 FP4 硬件原生 tensor core 路径,量化精度损失比数据中心略大。

Apple MLX v0.32.0 在 2026-07-07 释出的发行说明里点名支持 fp4fp8 分组量化(quantized_grouped ops),这是 Apple Silicon 跑 FP4 路径的官方原生入口。llama.cpp 的 release b10164(2026-07-28)也把 FP4 / MXFP4 模型格式继续维护。

sequenceDiagram

participant User

participant Model as FP4 量化模型

participant Loader as Weight Unpacker

participant TC as Tensor Core

participant KV as KV Cache

User->>Model: 加载 4-bit 权重

Model->>Loader: 4-bit packed → E2M1

Loader->>TC: FP4 GEMM 累加

TC->>KV: 写入 KV Cache

KV->>TC: decode 阶段读取 KV

TC->>User: token 输出

mermaid diagram2

四、关键点

  • FP4 不只是把模型砍小:它要求硬件具备原生 FP4 tensor core 路径,否则量化精度损失会反噬推理吞吐
  • 带宽优先于算力:当权重砍到 1/4,访存带宽是 decode 阶段的主要瓶颈;HBM3e / GDDR7 / unified memory 决定真实上限
  • NVFP4 / MXFP4 是行业标准:OCP 8-bit + shared exponent block scaling 格式,TensorRT-LLM 与 Megatron-LM 都基于它
  • 桌面与数据中心是两套选型:桌面(RTX 5090、Mac mini M4 Pro)跑 30B-70B FP4 量化模型可以接受;超过 70B 仍需要数据中心或双卡 A100/H100

五、行业影响

模型与硬件的耦合在加深。FP4 不是「软」特性,而是横跨硬件、模型格式、推理引擎三层。一旦上游模型用 NVFP4 训练,下游只要换硬件不换格式,量化精度就能保住。这意味着 2026 年下半年的推理硬件选型,本质是在选 NVFP4 / MXFP4 路径里的生态位:买 NVIDIA 卡买全栈生态,买 Mac mini 买 MLX + llama.cpp 的开发者友好,换 AMD / 国产卡则要看 vLLM、SGLang 何时把 FP4 path 合入主线。

六、结语

FP4 把内存带宽推到「每 bit 都值钱」的位置。接下来的 12 个月,谁能把 NVFP4 / MXFP4 路径 做得又快、又稳、又便宜,谁就能决定 30B-70B 模型的真正落地形态。NVIDIA TensorRT-LLM 14235⭐、llama.cpp 121869⭐、Apple MLX 27733⭐——三个仓库加起来接近 16 万颗 star,指向同一个事实:FP4 已经是下一轮推理硬件的主战场


参考资料

官方文档 / 标准

开源项目

行业报道 / 社区

对比基准 / 厂商规格


本文由 AI 生成。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注