30 分钟用 Ollama + Open WebUI 搭一个完全本地的家用 AI 中心

导语

把 ChatGPT 装进自家客厅:一台 Mac mini、一台 NUC 或一台旧笔记本,跑 Ollama + Open WebUI,30 分钟就拥有完全离线、可断网、隐私不外泄的家用 AI 中心。

核心事件

2026 年 7 月 11 日 Ollama 发布 v0.32.0,裸 ollama 命令默认启动交互式 agent,8 月 5 日更新到 v0.32.1(Gemma 4 工具调用改进 + MLX 缓存泄漏修复 + 加载超时改进)。8 月 10-11 日 Open WebUI 主线接入 Meta Muse Glimmer 与 NVIDIA Nemotron 3.5 Lightning(300 亿参数 / 30 亿激活 MoE,官方定位就是「为长时间运行、需要持续收集上下文、调用工具、处理多步任务的 Agent 设计」)。本地栈从「能跑」正式跨入「能干活」。

技术解析

整体架构分两层:模型服务层(Ollama,负责加载 GGUF/MLX 权重、调度 GPU/CPU/Metal 推理、暴露 OpenAI 兼容的 /v1/chat/completions API)+ 交互层(Open WebUI,提供浏览器 UI、会话历史、文档上传做 RAG、多用户 RBAC、工具/Pipeline 插件系统)。两层通过 Docker Compose 或 systemd 解耦部署,模型与 UI 可以独立升级。

mermaid diagram

mermaid diagram

部署命令只有两条:

# 1. 跑 Ollama(监听 11434,自动挂载 GPU/Metal)
docker run -d --name ollama \
  --gpus all -v ollama:/root/.ollama \
  -p 11434:11434 ollama/ollama

# 2. 跑 Open WebUI(连 Ollama,数据持久化)
docker run -d --name open-webui \
  -e OLLAMA_BASE_URL=http://ollama:11434 \
  -v openwebui:/app/backend/data \
  -p 8080:8080 \
  --restart always ghcr.io/open-webui/open-webui:main

随后 docker exec -it ollama ollama pull qwen3:8b,浏览器开 http://localhost:8080 完成管理员注册,就能在左上角切换模型。

关键点

  • **GPU/Metal 自动适配**:Ollama 启动时自动检测 NVIDIA CUDA / AMD ROCm / Apple Silicon Metal,MLX 后端在 M1/M2/M3/M4 上比纯 CPU 快约 2 倍。
  • **模型热切换**:同一会话内可直接换模型,Open WebUI 会保留上下文;不同终端用户互不干扰(每个会话独立的 system prompt + 工具集)。
  • **数据持久化必须挂卷**:`-v openwebui:/app/backend/data` 是官方文档明确标注的红线,否则容器重建后账号、设置、聊天记录全部丢失。
  • **RAG 文档问答**:Open WebUI 原生支持上传 PDF / txt / md,自动切片、向量化(默认 all-MiniL6-v2)、检索增强;也支持接入外部向量库。
  • **多用户与权限**:开启 RBAC 后可分配「普通用户 / 管理员 / 审计」三种角色,审计角色可查看所有对话但不能发起聊天。
  • **断网可跑**:模型权重一旦下载到 `~/.ollama/models` 缓存,后续推理完全离线;Open WebUI 也无需联网(除非使用其内置 web 搜索工具)。
  • **OpenAI 兼容 API**:同一份 Ollama 实例可被外部 IDE 插件(Continue / Cursor 本地模式)、脚本、Home Assistant 直接调用,前端用什么随便。

行业影响

家用 AI 中心正在从极客玩具转向家庭基础设施:一台 4000-6000 元的 NUC + 一张二手 RTX 3060 12G,就能在 24 GB 显存内跑 Qwen3-30B-A3B 或 Nemotron 3.5 Lightning(30B/3B 激活 MoE),满足多数家庭文档总结、孩子作业辅导、代码草稿需求;数据不出门、不订阅、不限速,长期看会冲击「云端订阅」的增长曲线。

结语

下一步建议:① 把 Open WebUI 通过 Tailscale / Cloudflare Tunnel 暴露成家庭内网可用地址,出门也能访问;② 启用 Open WebUI 的 Pipeline 插件,接入本地的 Whisper(语音转文字)+ Piper(TTS),把聊天框升级成「家庭语音助手」;③ 用 Ollama 的 Modelfile 自定义一个「家庭助手」角色,把家电控制指令、家人偏好固化进 system prompt。

参考资料

官方文档

  • [Ollama GitHub 仓库(开源项目主页)](https://github.com/ollama/ollama) [200] - 累计 star 数与最新 commit 实测
  • [Ollama 官方 Blog:NVIDIA Nemotron 3.5 Lightning 发布公告](https://ollama.com/blog) [200] - 2026-08-11
  • [Ollama Library 索引(Qwen3 / Llama 3 / Gemma 4 / Nemotron 等模型列表)](https://ollama.com/library) [200]

开源项目

  • [Open WebUI GitHub 主仓库](https://github.com/open-webui/open-webui) [200] - 仓库元数据 + Docker 镜像
  • [Ollama v0.32.1 Release Notes](https://github.com/ollama/ollama/releases) [200] - 2026-07-16(Gemma 4 工具调用 + MLX 缓存修复 + 加载超时改进)
  • [Open WebUI 官方文档首页](https://docs.openwebui.com/) [200] - 安装 / Docker / 数据卷规范总入口

行业报道

  • [Ollama + Open WebUI Self-Hosting Guide 2026](https://effloow.com/articles/ollama-open-webui-self-hosting-guide-2026) [200] - 部署 + 多用户 + RAG 配置综述
  • [Build a Self-Hosted AI Agent:Ollama + Open WebUI in 30 Minutes](https://cohorte.co/blog/deep-dive-building-a-self-hosted-ai-agent-with-ollama-and-open-webui) [200] - 30 分钟实战拆解

社区讨论

  • [HN Algolia 搜索:"ollama open webui"](https://hn.algolia.com/?q=ollama+open+webui) [200] - 社区实时讨论聚合
  • [Open WebUI 官方博客:v0.11.0 UI 重构公告 (2026-07-27)](https://docs.openwebui.com/) [200] - 设置面板合并 + 侧边栏重建 + 模型选择器升级

对比基准

  • [Prompt Quorum:2026 年 Ollama 最佳模型推荐](https://www.promptquorum.com/local-llms/top-open-source-models-ollama) [200] - Qwen3.6 27B SWE-bench 等基准数据汇总

本文由 AI 生成。内容基于公开资料整理,可能存在事实偏差,引用链接请以原始来源为准。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注