2024 年 NVIDIA Blackwell 架构首次把 NVFP4(NVIDIA 自研 4-bit 浮点格式)写进 GPU 硬件规格表,2026-07 回看,FP4 已经从「实验室论文」走进「消费级显卡」。NVIDIA TensorRT-LLM(GitHub API 实测 14,116⭐,pushed 2026-07-14)、vllm-project/vllm(86,257⭐,pushed 2026-07-14)、ggml-org/llama.cpp(120,373⭐,pushed 2026-07-14)三个项目在 18 个月内相继落地 FP4 路径,把「70B 模型在单卡 32GB 显存里跑出可用速度」从社区展示变成生产选项。
但 FP4 不是「把比特砍到 4 就完事」——它把 LLM 推理的瓶颈从算力转移到了内存带宽。这是本文要拆解的核心命题。
一、FP4 是什么,以及为什么大家突然关心它
FP4 是 4-bit 浮点格式的统称,社区里更常见的实现路径是 NVIDIA 的 NVFP4(一种微缩 FP8 的格式,e2m1 布局 + 共享 FP8 scaling block)。与 INT4 量化(纯整数)相比,FP4 保留了少量浮点指数位,对激活值动态范围更友好——这是 LLM 推理场景里 INT4 经常「数值塌方」、FP4 反而稳的根因。
2024-08 NVIDIA 在 H100 后续架构(Blackwell)上首次把 NVFP4 写进 Tensor Core 原生支持矩阵,2025 年 RTX 5090(桌面级 Blackwell)也支持——这是历史上第一次「消费级 GPU 桌面端」也能用 FP4。HN 公开讨论里(item 45049879,8 分)提到的「Blackwell Ultra (GB300) FP4 Dense 算力档位较前代显著提升」就是这一波硬件演化的延续。
社区仓库的数据可以佐证这条演化轨迹的强度:bitsandbytes-foundation/bitsandbytes(8,323⭐,pushed 2026-07-09)作为 k-bit 量化的事实标准库,2026 年发布的 release notes 里明确加入了 FP4 实验支持;mit-han-lab/smoothquant(1,666⭐,pushed 2024-07-12)和 mit-han-lab/llm-awq(3,589⭐,pushed 2025-07-17)则把权重 INT4 + 激活 INT8 的混合量化做到了工程化。这些项目共同构成了 FP4 落地的「软件栈」。
二、技术解析:FP4 怎么重塑「算力 vs 带宽」的取舍
LLM 推理的物理瓶颈,藏在每个 token 解码的微观动作里。每次生成一个 token,模型要做两件事:一是把对应层的权重整批搬到计算单元,二是把当前上下文的 KV Cache 搬到 attention 计算位置。这两件事的耗时都被内存带宽决定,而不是被计算单元的 TOPS 决定。
这就是「memory-bandwidth-bound(受带宽约束)」这句话的来源。在 FP16 时代,权重和 KV Cache 的体积都比较大,GPU 计算单元经常「等数据」——TOPS 是空转的。在 INT8 / INT4 时代,权重体积小了,等 KV Cache 的时间变长——瓶颈进一步向带宽倾斜。
FP4 时代有两件事同时发生:
第一,权重体积继续下降。从 FP16 的 2 字节/参数,到 INT8 的 1 字节/参数,到 FP4 的 0.5 字节/参数。这意味着 70B 模型在 FP4 下权重约 35GB,理论上单卡 48GB 显存就能装下——RTX 5090 的 32GB 虽然装不下完整 70B,但配合 CPU 卸载或分组推理,仍可跑出可用体验。HN item 47328995(2 分)正是这个方向的实测讨论。
第二,KV Cache 的相对占比上升。权重变小了,KV Cache 没变(甚至随上下文变长而增大)。UltraQuant: 4-bit KV Caching for Context-Heavy Agents(arxiv 2606.20474)正是要回答这个问题——把 KV Cache 也量化到 4-bit,让长上下文 Agent 的带宽压力下降一个档位。这条线在 2026 年成为研究热点。

三、硬件层面:Blackwell 把 NVFP4 写进桌面 GPU
NVIDIA Blackwell 架构是 FP4 落地的硬件底座。三个关键变化:
1. Tensor Core 原生支持 NVFP4 路径。这是从「软件模拟 FP4」走向「硬件原生加速」的分水岭。NVIDIA H100 上 FP4 还是靠模拟(FP8 配对累加近似),Blackwell 直接在硬件层做 NVFP4 矩阵乘。HN item 45049879(8 分)的讨论里,Blackwell Ultra(GB300)相比前代在 FP4 Dense 算力档位上有显著提升——这种「在 4-bit 数据类型上算力跃迁」在历史上是首次。
2. 显存档位的几何级增长。RTX 5090(消费级旗舰)配 32GB GDDR7,显存带宽档位相比 RTX 4090 显著提升(官方规格在 nvidia.com 数据表可查);NVIDIA H100 80GB HBM3、H200 141GB HBM3e 都是数据中心选项。FP4 时代「单卡装下 70B」的可行性,与显存档位的提升直接相关。
3. 桌面端 Blackwell 的 Pro 系列扩张。HN item 46325957(2 分)讨论的「RTX PRO 5000 Blackwell 72GB GDDR7」以及 HN item 47310428(2 分)的「RTX PRO 6000 + 122B MoE 单卡 31 tok/s」实测,是 2026 年桌面端 FP4 推理能力的新标杆。

四、社区框架:18 个月里谁跑通了 FP4
把硬件能力变现到生产,靠的是软件栈。三个项目值得点名:
TensorRT-LLM(14,116⭐,pushed 2026-07-14):NVIDIA 自家的 LLM 推理引擎,2024 年下半年开始加入 NVFP4 路径,是目前唯一能在 Blackwell 上跑出「接近硬件峰值」FP4 性能的项目。它要求 FP4 模型经过 NVIDIA 自家量化校准(不是简单的「把权重从 FP16 截到 4-bit」),工程门槛较高,但生产部署的收益最大。
vLLM(86,257⭐,pushed 2026-07-14):社区主流的 PyTorch 兼容推理引擎。2025 年开始通过 bitsandbytes 集成 FP4 路径,2026 年加入 NVFP4 实验支持。vLLM 的 PagedAttention(HN item / lmsys.org blog 公开讨论)天然解决了 KV Cache 内存碎片问题,与 FP4 KV Cache(UltraQuant 等)的配合尤其顺畅。
llama.cpp(120,373⭐,pushed 2026-07-14):本地推理的事实标准。2025 年加入对 NVIDIA GPU 的 FP4 支持(通过 cuBLAS + 自家量化工具),让普通用户在 RTX 4090 / 5090 上也能跑 FP4 模型。社区里 ollama/ollama(176,111⭐,pushed 2026-07-14)作为 llama.cpp 的易用封装,间接把这套能力送到 macOS / Linux / Windows 桌面用户手里。
五、关键点:硬件、带宽、算法的三角权衡
第一,FP4 不等于免费午餐。权重从 FP16 压到 FP4,理论上是 4 倍体积下降,但实际精度损失需要通过「per-channel / per-block 缩放因子」弥补。smoothquant / awq 这类工作正是为了在量化前迁移激活难度,让权重更容易量化。HN item 42619833(3 分)讨论的「Flux 跑 10GB 显存加速」正是把这条路径用到 Diffusion 模型的实例。
第二,内存带宽才是 FP4 时代的真瓶颈。HN item 48877899(2 分)讨论的「HBM 瓶颈 + JAX host offloading」以及 HN item 46680468(2 分)的「memory bandwidth benchmark」都指向同一件事:随着权重变轻,KV Cache 和 attention 计算的带宽需求成为决定性因素。这也是 UltraQuant(arxiv 2606.20474)和 SpotAttention(arxiv 2606.22874)等 2026 年新工作集中解决的方向。
第三,「单卡 70B」是 2026 年的新基线。HN item 47328995(2 分)实测 RTX 5090 跑 70B FP4;HN item 47310428(2 分)实测 RTX PRO 6000 跑 122B MoE FP4。这是 12 个月前做不到的事情——单卡显存不够、带宽不够、算力也不够。Blackwell 的 32GB / 72GB 显存档位 + NVFP4 Tensor Core + GDDR7 高带宽,三件事缺一不可。
第四,训练侧也在向 FP4 迁移。arxiv 2607.04422(Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention)以及 arxiv 2606.20381(Rethinking Shrinkage Bias in LLM FP4 Pretraining)这两篇 2026 年工作说明:FP4 不只是推理的事,训练侧也在用 FP4 算力档位优势压训练成本。HN item 42867278(2 分)也是这条线上的讨论。
六、行业影响:消费级 GPU 与「个人 AI 中心」
FP4 落地最深的影响,不是数据中心又多了一种选择,而是消费级桌面 GPU 第一次有了跑 70B 模型的能力。
RTX 5090 32GB + FP4:本地跑 70B(4-bit 量化版)模型,首字延迟与持续生成速度进入「可用」区间。ollama + llama.cpp 的组合让普通开发者能在 macOS / Linux 桌面上下载模型、加载模型、对话——整个链路 0 云端依赖。
Mac Mini / Mac Studio + MLX:apple/ml-explore/mlx(27,548⭐,pushed 2026-07-14)2024-2025 年逐步加入 FP4 / INT4 路径,配合 Apple Silicon 统一内存架构,让 192GB 内存的 Mac Studio M3 Ultra 能装下完整 70B FP16 权重——但 FP4 路径在 MLX 上的优化仍在演进。
七、选型决策:FP4 是不是你现在该追的?
简单总结:
- 数据中心生产:FP4 已经成熟(TensorRT-LLM + Blackwell),但要 NVIDIA 自家量化校准 + 完整测试套件,不要直接拿 FP16 模型截 4-bit 部署。
- 消费级桌面:RTX 5090 / RTX PRO 6000 + llama.cpp / ollama + FP4 社区模型,本地跑 70B 的体验已经「够用」,但还不是「丝滑」。
- Apple Silicon:MLX FP4 路径仍在追,跑 70B 用 FP16 + 192GB 内存更稳定,但能效比(tokens/s per watt)档位是 Apple 强项。
- 训练侧:FP4 路径仍在研究阶段(arxiv 2607.04422 / 2606.20381),不建议 2026 年直接拿 FP4 训练生产模型。
八、结语:比特数下降的天花板
FP4 不是「权重的终点」。再往下是 FP3、FP2(INT2),社区里 HN item 47315029(2 分)讨论的「三元 + 稀疏」方向就是把比特数推到更低。但每往下降一档,硬件带宽、量化算法、推理框架三方都要同步演进——单点突破带不动全局。
2026 年 FP4 的故事,本质是「硬件给了能力、软件栈跟上、社区把它变成日常」的三步走。下一个值得聚焦的拐点,是 FP4 + KV Cache 4-bit(UltraQuant 类工作)同时进入生产框架——这会让 100K+ 上下文长度的本地 Agent 真正可行。但那是另一个故事了。
参考资料:
官方文档
- arXiv: UltraQuant - 4-bit KV Caching for Context-Heavy Agents - 2026-06
- arXiv: Full-Stack FP4 - Stable LLM Pretraining with Quantized Projections - 2026-07
- arXiv: Rethinking Shrinkage Bias in LLM FP4 Pretraining - 2026-06
- NVIDIA H100 数据中心页 - 官方规格
- NVIDIA Developer: TensorRT Quick Start Guide - 官方文档
开源项目
- ggml-org/llama.cpp 仓库 API - 120,373 stars, pushed 2026-07-14
- ollama/ollama 仓库 API - 176,111 stars, pushed 2026-07-14
- vllm-project/vllm 仓库 API - 86,257 stars, pushed 2026-07-14
- NVIDIA TensorRT-LLM 仓库 API - 14,116 stars, pushed 2026-07-14
- bitsandbytes-foundation/bitsandbytes 仓库 API - 8,323 stars, pushed 2026-07-09
- ml-explore/mlx 仓库 API - 27,548 stars, pushed 2026-07-14
- mit-han-lab/llm-awq 仓库 API - 3,589 stars, pushed 2025-07-17
- mit-han-lab/smoothquant 仓库 API - 1,666 stars, pushed 2024-07-12
- pytorch/pytorch 仓库 API - 101,813 stars, pushed 2026-07-15
- huggingface/transformers 仓库 API - 162,609 stars, pushed 2026-07-14
行业报道
- PyTorch Blog: FlashAttention-3 - 2024
- Apple Developer: Metal + PyTorch - 官方集成页
- SAP Help: AI Core 文档 - 企业 LLM 推理参考
社区讨论
- HN: Testing Nvidia's FP4 - 70B on a Single RTX 5090 - 2 pts, 2026
- HN: NVFP4 on Desktop Blackwell - 122B MoE on a Single RTX PRO 6000 - 2 pts, 2026
- HN: Nvidia Blackwell Ultra (GB300) FP4 / VRAM - 8 pts, 2026
- HN: Flux runs 2x faster on 10GB VRAM with Nvidia FP4 - 3 pts
- HN: Reducing HBM Bottlenecks in JAX-Based LLM Training - 2 pts
- HN: LLM Training Using FP4 Quantization - 2 pts
对比基准
- HN 聚合: FP4 quantization 关键词 - 持续聚合
- PyTorch NCCL 文档(多卡通信) - 官方
本文由 AI 生成。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。
