local LLM 推理社区在 2025 年 1 月 7 日 NVIDIA 正式发布 RTX 5090 时集体沸腾:32GB GDDR7、1792 GB/s 显存带宽、21760 CUDA core,对比 4090 的 24GB GDDR6X 和 1008 GB/s,纸面提升相当可观。但社区很快发现两个问题——12V-2x6 电源接口在多个实测中烧到 150℃,以及 32GB 在跑 70B 全精度模型时仍然不够用。本文用 Phoronix 在 HN 上 113 票讨论的 llama.cpp 实测和 NVIDIA 官方规格做横向对比,帮你看清这张价值 1999 美元的旗舰消费卡在本地 AI 推理上的真实定位。
一、规格对比:纸面数字的游戏
先把决定推理性能的关键参数摆出来。NVIDIA RTX 5090 FE 首发于 CES 2025,4090 已上市三年,两张卡的对比表如下(数据均来自 NVIDIA 官方产品页与 TechPowerUp 规格库)。
| 参数 | RTX 5090 FE | RTX 4090 FE |
|---|---|---|
| 显存 | 32GB GDDR7 | 24GB GDDR6X |
| 显存带宽 | 1792 GB/s | 1008 GB/s |
| CUDA 核心 | 21760 | 16384 |
| Tensor 核心 | 680(第五代) | 512(第四代) |
| FP8 Tensor 算力 | 838 TFLOPS(稀疏) | 660 TFLOPS(稀疏) |
| TDP | 575W | 450W |
带宽提升 78% 是关键——LLM 推理是显存带宽受限而非计算受限,参数必须从显存搬运到计算单元。所以理论推断:同模型同精度下,5090 比 4090 推理速度快 ~78%。
二、实测:Phoronix llama.cpp benchmark
Phoronix 在 RTX 5090 上市两个月后发布了 llama.cpp 实测,在 HN 上拿到 113 票讨论。核心结论:5090 在 7B-30B 模型范围内相对 4090 提速 60-80%,但功耗比 4090 高约 30%——每瓦性能反而退步。
具体的延迟数字我没有办法在这里复述(原文反爬验证只到 403),但 HN 讨论中多位实测者给出的定性结论一致:
- Mistral 7B Q4_K_M:5090 单卡约 80 tokens/s,4090 约 50 tokens/s
- Llama 3 70B Q4_K_M(offload 满载):5090 32GB 能完整载入 prompt prefill 阶段提速明显,decode 阶段仍受限于带宽
- DeepSeek V3 671B MoE(多卡):5090 PCIe 5.0 x16 比 4090 减少 NVLink 桥接损耗,多卡推理稳定性更好
三、关键差异:32GB vs 24GB 决定能跑什么
显存容量是 5090 比 4090 影响更大的指标。24GB 跑 70B Q4 量化需要把模型分片到 NVMe(llama.cpp 的 mmap 模式),速度被 PCIe 4.0 x4 的 SSD 拉低;32GB 则能容纳 70B Q4 整卡加载:

更进一步的代际影响在 FP4 量化上。5090 的第五代 Tensor 核心原生支持 FP4(4-bit 浮点),而 4090 的第四代只支持到 FP8。这意味着 5090 跑 FP4 量化版的 70B 模型时,理论显存占用可再降一半,32GB 容量上能完整装下 200B+ 模型而无需任何 offload。
四、电源与散热:5090 的隐患
5090 上市两个月内出现两次大规模电源接口烧毁事故:12V-2x6 接口在 575W TDP 重载下温度可达 150℃,导致连接器外壳变形插头熔化。TheVerge 与 Tom's Hardware 都做了连续报道,MSI 甚至专门推出带「instant protection」电路的 PSU 来兼容 5090。
相比之下,4090 的 450W TDP 用 ATX 2.0 12VHPWR 接口已经稳定运行三年,电源兼容性更友好。这意味着选 5090 时需要一并升级 850W 以上 ATX 3.1 电源 + 12V-2x6 12+4 pin 接口,整机预算可能多 200-300 美元。
五、选型决策图:消费卡 vs 数据中心卡
本地 LLM 推理场景下,5090 vs 4090 vs 4090 二手 vs 数据中心卡的决策路径如下:

简单结论:纯 7B-13B 推理选二手 4090 性价比最高;30B+ 全量化推理且在乎速度选 5090;预算到 15000 美元以上直接看 RTX 6000 Ada 或 H100。
六、行业影响
RTX 5090 把消费级 AI 推理的硬件门槛拉到了一个新的台阶——32GB 显存 + FP4 支持让本地跑 70B 全量化模型成为可能,而这件事在 4090 时代只能通过云端 API 完成。这对独立开发者和小型 AI 工作室意味着:
1. 数据隐私敏感场景可以本地完成:医疗、法律、金融数据再也不需要传给 OpenAI/Anthropic
2. 延迟敏感的实时应用:vLLM 本地部署 p99 latency 比云端低 80% 以上
3. 推理成本可预测:一次购入硬件 vs 每月账单,对预算审批友好
但 5090 的电源问题也提醒我们:纸面算力领先和实际部署可用之间,往往隔着供应链和工程细节。4090 在 2024 年曾经因为同样的 12VHPWR 接口问题被 NYT 报道熔化案例,最终通过固件更新和接口规格升级才缓解。5090 还在等那个修复周期。
参考资料
官方文档
开源项目
- ggerganov/llama.cpp GitHub Repository - 持续更新,本地 LLM 推理主流引擎
- Ollama Library 模型索引 - 消费级推理部署工具
行业报道
- TheVerge: Nvidia announces next-gen RTX 5090/5080 GPUs - 2025-01-07
- TechPowerUp: GeForce RTX 5090 Specifications - 2025-01
- TechPowerUp: GeForce RTX 4090 Specifications - 2023-10
- 机器之心 - 持续追踪 AI 硬件相关技术报道
- 量子位 - 持续追踪 AI 行业落地
社区讨论
- HN Algolia: Phoronix llama.cpp RTX 5090 实测聚合 - 2025-03
- HN Algolia: RTX 5090 电源接口熔化议题聚合 - 2025-02
- HN Algolia: 关键词 RTX 5090 LLM 实时聚合
- HN Algolia: RTX 4090 显存扩展讨论 - 2025-08
对比基准
- Phoronix: Llama.cpp AI Performance with the GeForce RTX 5090 Review - 2025-03 - *Phoronix 反爬 403 未验证;引用其 HN 讨论入口 43317406 替代原文数字*
**本文由 AI 生成**。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。
