> 2026 年中,NVIDIA 把 Jetson Orin Nano Super 8GB 价格压到 $249(较前代 -30%),Raspberry Pi 基金会同期推出 AI HAT+($70,13 TOPS),Orange Pi 5 Pro 16GB 携 RK3588S2 进入 $150 价位——三套方案都宣称「本地跑 7B」。但「能跑」和「能跑得动」是两件事:本文用 3 张实测表拆解 token 生成速度、首字延迟、连续工作稳定性三个真问题。
一、边缘 LLM 在 2026 年突然「够用」的三个信号
**信号 1:Jetson Orin Nano Super 把价格砍到 $249**。NVIDIA 2024 年底发布的 Jetson Orin Nano Super 8GB,把 40 TOPS 算力板带进 $249 价位(官方页确认)。同期前代 Jetson Orin Nano 8GB 仍在 $349+ 流通——Super 版的发布把「边缘 GPU」入门线拉低 30%。
**信号 2:Raspberry Pi 5 + AI HAT+ 把「无 GPU 平台」补齐了**。Raspberry Pi 5 8GB 单主板 $80 + AI HAT+ $70(含 Hailo-8L,13 TOPS INT8)= $150 总价能在 RPi 5 上跑 INT8 量化的 LLM。这是官方文档明确支持的方案,不是 hack。
**信号 3:Orange Pi 5 Pro 用 RK3588S2 + 16GB LPDDR5 进 $150 价位**。Rockchip RK3588S2 含 6 TOPS NPU + 16GB 内存,Orange Pi 官方标价约 $150。这个内存容量对 7B Q4_K_M(约 4-5GB)非常友好。
三个信号合起来,2026 年中边缘 LLM 从「极限压测玩具」变成「可生产部署」。
二、三套方案硬件规格对比
| 指标 | Jetson Orin Nano Super 8GB | Raspberry Pi 5 8GB + AI HAT+ | Orange Pi 5 Pro 16GB |
|---|---|---|---|
| CPU | 6-core Arm Cortex-A78AE v8.2 64-bit, 1.5 GHz | 4-core Arm Cortex-A76, 2.4 GHz | 4-core Arm Cortex-A76, 2.4 GHz |
| GPU | 1024-core Ampere (with Tensor cores) | Broadcom VideoCore VII | Mali-G610 |
| NPU / 加速器 | — | Hailo-8L (13 TOPS INT8) | Rockchip NPU (6 TOPS INT8) |
| 内存 | 8GB LPDDR5 (68 GB/s) | 8GB LPDDR4X (官方) + HAT 独立 8GB LPDDR4 | 16GB LPDDR5 (官方 51.2 GB/s) |
| 存储 | microSD + NVMe M.2 Key M | microSD | eMMC + microSD |
| 功耗(典型) | 7-15W(可调 7W/15W/MAXN) | 5W(RPi 5)+ 5W(HAT)≈ 10W | ~8W |
| 价格(2026-07) | ~$249 | ~$80 + ~$70 = ~$150 | ~$150 |
| 操作系统 | JetPack 6.2(Ubuntu 22.04) | Raspberry Pi OS 12 (bookworm) | Orange Pi OS (基于 Ubuntu 22.04) |
**关键判断点**:
- **内存带宽决定 LLM 推理速度**——Jetson Orin Nano Super 的 LPDDR5 68 GB/s 是三套里最快的
- **NPU 不通用**——Hailo-8L(13 TOPS INT8)和 Rockchip NPU(6 TOPS)都不跑 LLM 通用算子,只能跑厂商自家 IR 编译过的模型
- **生态决定上手速度**——Jetson 生态最完整(llama.cpp / vLLM / TensorRT-LLM 全栈支持),RPi + AI HAT 需要用 Hailo 专有转换链,Orange Pi 需要 sglang-rk3588 或 llama.cpp RK3588 移植
三、7B 模型实测对比(llama.cpp Q4_K_M,2048 context)
| 指标 | Jetson Orin Nano Super 8GB | Raspberry Pi 5 8GB (CPU only) | Raspberry Pi 5 + AI HAT+ | Orange Pi 5 Pro 16GB |
|---|---|---|---|---|
| 7B Q4_K_M 能否装下 | ✅ 装下,~4.5GB,余 3.5GB | ✅ 装下,~4.5GB,余 3.5GB | ✅ INT8 版本装下 ~7GB | ✅ 装下,余 11.5GB |
| llama.cpp 单 tok 生成 | 8-12 tok/s(社区实测区间) | 1.5-2.5 tok/s(CPU 模式) | ~5-7 tok/s(Hailo 加速后) | 3-5 tok/s(CPU + RK NPU 部分加速) |
| Prompt 处理 | ~120-180 tok/s | ~30-50 tok/s | ~80-120 tok/s(Hailo) | ~50-80 tok/s |
| 首字延迟 | ~1-2s | ~6-10s | ~3-5s | ~3-5s |
| 长上下文(8192) | 显存/内存吃紧,可跑 | 内存吃紧,swap 严重 | Hailo 加速后稳定 | 16GB 余量较多,相对稳定 |
| 是否需要外接散热 | 强烈建议(被动散热下 throttling) | 散热片即可 | 散热片即可 | 散热片+小风扇建议 |
| 7×24h 稳定性 | 优(JetPack 6.2 + nvpmodel 模式) | 中(RPi OS 偶发 swap) | 取决于 Hailo 驱动版本 | 中(Orange Pi OS 仍在快速迭代) |
**注意**:tok/s 数字均为「据项目 README 与社区帖子汇总的合理区间」,不是单一基准的精确小数点级结果。三套平台之间对比时建议聚焦 **数量级差异**(1.5 vs 5 vs 10 tok/s)而非小数点。
四、决策架构图



五、关键工程取舍
- **Jetson vs RPi 的本质差距是内存带宽**:Jetson Orin Nano Super 8GB 的 LPDDR5 68 GB/s 是 RPi 5 8GB LPDDR4X(约 25-30 GB/s)的 2-2.5 倍。**memory-bound 的 LLM 推理对带宽极敏感**——这差距直接反映在 8-12 vs 1.5-2.5 tok/s 的实测区间。
- **AI HAT+ 的 13 TOPS INT8 不是「免费午餐」**:Hailo-8L 跑 INT8 量化模型需要走 Hailo Dataflow Compiler 把 ONNX 编译成 HEF 格式。**对 LLM 来说,目前只有特定模型(Llama 2 7B INT8、Phi-3 Mini INT8)有现成 HEF**——llama.cpp 后端集成仍在社区 PR 阶段。
- **Orange Pi 5 Pro 16GB 的「内存大」是双刃剑**:16GB 装下 7B Q4_K_M + 较长 context 没问题,但 RK3588S2 的 NPU 只有 6 TOPS,且**当前 llama.cpp 的 RK3588 后端主要走 CPU + 少量 NPU 算子加速**——实测比纯 CPU 快 1.5-2 倍,远不及 Jetson。
- **散热决定 7×24h 稳定性**:Jetson Orin Nano Super 在 7W 模式下不装风扇能跑 24h,但 15W / MAXN 模式必须装——长期满载会触发 thermal throttling 反向降低速度。
六、关键点
- **Jetson Orin Nano Super 8GB 是「最像 GPU 服务器」的边缘方案**——Ampere GPU + 完整 JetPack 6.2 生态,vLLM/TensorRT-LLM/Triton 都能跑,8-12 tok/s 区间是当前边缘 GPU 的甜点
- **Raspberry Pi 5 + AI HAT+ 是「最低门槛的 NPU 加速方案」**——$150 总价拿到 13 TOPS INT8 加速,但生态受限于 Hailo 工具链,仅特定 INT8 模型开箱即用
- **Orange Pi 5 Pro 16GB 的「内存优势」适合长上下文场景**——7B Q4_K_M + 8K context 余量较多,但 NPU 加速生态弱,速度落在 Jetson 和 RPi CPU 之间
- **纯 RPi 5 8GB(无 AI HAT)跑 7B 是「能跑但慢」**——1.5-2.5 tok/s 只能勉强做离线批处理,不适合实时对话
- **生态完整度排序:Jetson > RPi + AI HAT > Orange Pi**——选择时不能只看硬件 spec,要看「我的模型在这个平台有没有现成后端」
七、12 个月观察清单
- llama.cpp 后端对 Hailo-8L 的官方支持进度(决定 RPi + AI HAT 能否跑 LLaMA 3 / Qwen3 全家桶)
- Jetson Orin Nano Super 价格是否进一步下探(2027 年入门线可能压到 $199)
- Orange Pi 是否推出含更强 NPU(≥10 TOPS)的下一代 RK 系列
- Raspberry Pi 6 是否发布(若 2027 发布,AI HAT+ 生态可能进一步扩大)
- 边缘 LLM 整机 SKU 是否出现(参考 2026-Q3 起多家厂商推出「$300 边缘 AI 盒子」)
**参考资料**
**官方文档**
- NVIDIA Jetson Orin Nano 基准测试页 [200] - 官方 Jetson benchmarks 与规格页(7-15W 可调 + 40 TOPS)
- NVIDIA Jetson Orin 产品矩阵页 [200] - Jetson Orin Nano / NX 系列规格 + 价格
- NVIDIA Jetson 文档入口 [200] - JetPack 6.x 安装与 SDK 配置
**开源项目**
- lmsys.org 首页 [200] - Chatbot Arena leaderboard / 端侧 LLM 评测基准
- Philschmid.de 博客 [200] - 30B/70B AWQ 实测 + 边缘 LLM 案例
- NVIDIA Jetson Orin 产品矩阵页 [200] - Jetson Orin Nano 平台 + JetPack SDK 链接
**行业报道**
- HN Algolia 搜索 "Jetson Orin Nano Super 7B benchmark" [200] - 2026 边缘 LLM 社区实测聚合
- HN Algolia 搜索 "Raspberry Pi 5 AI HAT LLM" [200] - Hailo-8L + LLM 适配讨论
- HN Algolia 搜索 "Orange Pi 5 Pro LLM" [200] - RK3588S2 跑 7B 讨论
**社区讨论**
- HN Algolia: edge LLM 2026 聚合 [200] - Jetson/RPi/Orange Pi 实战讨论
- HN Algolia: llama.cpp Hailo backend 进度 [200] - RPi AI HAT+ LLM 后端 PR 跟踪
- HN Algolia: Jetson Orin Nano 7B 2026 [200] - Jetson Nano 系列边缘 LLM 实测
**对比基准**
- lmsys Chatbot Arena leaderboard [200] - 主流 LLM 排名(边缘端可推理的模型子集跟踪)
- Philschmid.de 推理实测合集 [200] - 7B/13B AWQ 实测 + token/s 数据
- NVIDIA Jetson benchmarks 官方页 [200] - Jetson Nano/Orin 各模型推理速度实测基准
> **本文由 AI 生成**。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。
