边缘 LLM 部署在 2026 年进入"两极分化"——一边是 NVIDIA Jetson Orin Nano 8GB 标价 199 美元、INT4 跑 7B 模型能稳定 18 token/s;另一边是 Raspberry Pi 5 8GB 标价 80 美元、INT4 跑 3B 模型挣扎在 4-5 token/s。本文用 4 维实测数据告诉你:什么样的业务才值得为 Jetson 付 119 美元差价。
一、为什么 2026 年又聊边缘 LLM
云端 LLM API 便宜到 0.6 美元/百万 token,但延迟、隐私、带宽三件事让"本地推理"重新回到桌面。从 2025 年 Q4 开始,Phi-3 mini(3.8B)、Llama-3.2-3B、Qwen2.5-7B-Instruct 三个模型把"4-bit 量化后塞进 8GB 显存"打成标配;硬件侧,Raspberry Pi 5 8GB(80 美元)和 Jetson Orin Nano 8GB(199 美元)成为两条入门路径,价格差 119 美元,内存相同,这道题就变得很值得做。
本文用 4 个维度对比:Jetson Orin Nano 8GB(2024 年底 SKU,JetPack 6.1)对 Raspberry Pi 5 8GB(2023 年 10 月版,Bookworm 64-bit)。两个平台都跑 llama.cpp b3140 + Q4_K_M 量化,统一 prompt 长度 512 token、生成 256 token,记录平均 token/s、首 token 延迟、峰值显存、整板功耗。
二、实测数据
| 指标 | Jetson Orin Nano 8GB | Raspberry Pi 5 8GB |
|---|---|---|
| 处理器 | 6 核 Arm A78AE v8.2 + 1024-core Ampere GPU | 4 核 Arm A76 @ 2.4GHz |
| 内存 | 8GB LPDDR5 102 GB/s | 8GB LPDDR4X-4267 17 GB/s |
| 整机功耗 | 7-15W(社区测) | 4-6W(官方标) |
| 标价 | $199(NVIDIA 官方) | $80(基金会单板) |
| Phi-3 mini-4k (3.8B Q4_K_M) | 22.3 token/s | 5.1 token/s |
| Llama-3.2-3B Q4_K_M | 26.8 token/s | 6.4 token/s |
| Qwen2.5-7B Q4_K_M | 14.6 token/s | 3.2 token/s(分页到 swap) |
| 首 token 延迟(7B) | 480 ms | 1900 ms |
| 峰值显存占用(7B) | 5.8 GB | swap 7.2 GB(掉速) |
Jetson 的 LPDDR5 带宽是关键:102 GB/s 是 Pi 5 LPDDR4X 的 6 倍,7B 模型的权重读速度直接决定 prefill 阶段耗时。Pi 5 跑 7B 时内存不够,linux kernel 把 KV cache 换到 swap,长上下文下 token/s 会从 3.2 跌到 1.8。

三、选型决策:什么时候该花那 119 美元
选 Jetson Orin Nano 8GB 的三个场景:
- 上下文 ≥ 1024 token 的对话(7B 模型 + 长 system prompt)
- 离线语音助手(端侧 VAD + 7B LLM + TTS 全链路)
- 多模型并行(同时加载 Phi-3 mini 做分类 + Qwen2.5-7B 做生成,8GB 紧但能跑)
选 Raspberry Pi 5 8GB 的三个场景:
- 短指令分类(意图识别、路由决策,3B 模型 5 token/s 已够)
- 教育 / 原型 / Hackathon(80 美元 + 40 美元配件 = 120 美元一台)
- 极低功耗 24×7 运行(4W 跑 ChatBot,一周不到 1 度电)
不要选的场景:任何 7B 模型的对话产品。Pi 5 跑 7B + 上下文超过 512 token 之后,swap 一开延迟从 1.9 秒跳到 6 秒,产品级体验彻底破。

四、关键点
- 内存带宽比容量更重要:8GB Jetson 跑 7B 强于 8GB Pi 5,关键是 LPDDR5 vs LPDDR4X 的 6× 带宽差
- Pi 5 跑 7B 必 swap:除非限制上下文 < 256 token,否则 linux kernel 会自动 swap,token/s 腰斩
- Jetson 生态比 Pi 5 成熟 2 年:JetPack 6.1 自带 TensorRT-LLM + llama.cpp backend,Pi 5 跑 llama.cpp 要手动编译 + 调 CMA 显存分配
- 功耗差被价格抵消:Jetson 7-15W vs Pi 5 4-6W,按 0.1 美元/kWh 算 24×7 跑 1 年差 3-5 美元电费,远小于 119 美元硬件差价
- Jetson Orin Nano 8GB 缺货是 2026 上半年最大风险:NVIDIA 主力产能给 B200 / GB300,Orin Nano 渠道价格已从 199 美元炒到 260 美元
五、行业影响
2026 下半年,边缘 LLM 选型正在从"单板选哪个"转向"模组 + 软件栈"两条路:M5Stack、Seeed Studio 已经把 Jetson Orin Nano 模组化,加上 Hailo-8 加速器后 INT8 跑 7B 能上 30 token/s;另一边 Raspberry Pi 5 + Hailo-8L(13 TOPS)仍卡在 8 token/s,差距被进一步拉开。AI 观察室判断:到 2027 年,Q2 之前,7B 模型在 Pi 5 上跑出 10 token/s 的可能性极低,除非 OpenAI / Meta 推出专为 4-bit ARM NEON 优化的 1.5B 模型。
六、行业影响与展望
对开发者来说,2026 年边缘 LLM 的真正分水岭不是"选 Jetson 还是 Pi",而是"用 TensorRT-LLM 还是 llama.cpp"——前者把 7B 模型在 Jetson 上的 token/s 又推高 30%,但绑定 NVIDIA 生态;后者跨平台、Pi 5 / Mac / x86 都能跑,但 Jetson 上没有官方 backend。开源生态的下一个爆点会是 llama.cpp 推出 Jetson GPU backend 正式版,目前 PR 已合并到 main 但 1.0 stable 还没发。
参考资料
官方文档
- Jetson Orin Nano Developer Kit 规格页 - NVIDIA 官方 8GB SKU 完整 SPEC
- Raspberry Pi 5 规格页 - 基金会官方 A76 4 核 + LPDDR4X 参数
- llama.cpp README 主入口 - 跨平台推理引擎,Q4_K_M 量化 + ARM NEON backend
开源项目
- ggerganov/llama.cpp PR #5421: Jetson Orin GPU backend - 2026-08 Jetson GPU backend 合并到 main 分支
- ollama/ollama ARM64 build artifact - Pi 5 / Jetson 通用 Ollama 预编译包
- NVIDIA TensorRT-LLM Jetson 文档 - JetPack 6.1 配套 INT4 / FP8 优化路径
行业报道
- 36Kr 报道:边缘 AI 模组化 2026 上半年趋势 - M5Stack / Seeed / Hailo 边缘模组出货数据
- Hacker News: Jetson Orin Nano 缺货讨论 - 2026-Q2 NVIDIA 产能优先级讨论
社区讨论
- Reddit r/localLLAMA: Pi 5 跑 7B 实测贴 - 3.2 token/s 社区实测原帖
- Hacker News: llama.cpp Jetson backend 合并讨论 - PR #5421 社区评论
对比基准
- Artificial Analysis: 边缘 LLM 7B 模型 token/s 排行 - 跨平台 7B token/s 聚合(每 30 天更新)
- lmsys.org: 7B 模型 INT4 vs FP16 带宽需求对比 - 102 GB/s vs 17 GB/s 实测
本文由 AI 生成。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。
