自托管 AI 工具搭建指南:从 Ollama 到 Open WebUI
> 数据不出境、隐私保护、零订阅费——自托管 AI 正在成为技术用户的首选。
---
为什么选择自托管?
| 优势 | 说明 |
| 隐私 | 数据不离开你的服务器 |
| 成本 | 一次性硬件投入,无月费 |
| 定制 | 模型可以微调、Prompt 可以预设 |
| 离线 | 断网也能用 |
| 劣势 | 说明 |
| 硬件 | 需要 GPU(至少 8GB VRAM) |
| 维护 | 需要自己更新模型、排查问题 |
| 模型 | 顶级模型(如 GPT-4)无法本地运行 |
---
第一步:硬件选择
最低配置(能跑 7B 模型)
推荐配置(跑 13B-34B 模型)
云 GPU 替代方案
| 服务 | 价格 | 适合 |
| RunPod | $0.3-0.5/小时 | 临时测试 |
| Lambda Labs | $0.5-1/小时 | 长期训练 |
| AutoDL | 国内可用,按小时计费 | 国内用户 |
---
第二步:安装 Ollama
``bash
一键安装
curl -fsSL https://ollama.com/install.sh | sh
验证
ollama --version运行第一个模型
ollama run llama3列出已安装模型
ollama list `---
第三步:选择合适的模型
通用对话
模型 大小 适合
Llama 3 8B 通用对话、速度快
Mistral 7B 多语言、轻量
Qwen2 7B/14B 中文友好
DeepSeek 7B/14B 中文代码友好
代码专用
模型 大小 适合
Code Llama 7B-34B 代码生成、补全
DeepSeek-Coder 6.7B 代码理解、重构
StarCoder2 3B-7B 轻量代码补全
推荐组合
日常使用:Llama 3 8B
中文场景:Qwen2 14B 或 DeepSeek 14B
编程场景:Code Llama 34B 或 DeepSeek-Coder 33B ---
第四步:搭建 Web UI
Open WebUI(原 Ollama WebUI)
`bash
Docker 一键启动
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway ghcr.io/open-webui/open-webui:main
`访问
http://localhost:3000,就能像用 ChatGPT 一样对话。功能特性
多模型切换
对话历史本地存储
支持 RAG(上传 PDF 对话)
插件生态 ---
第五步:进阶玩法
自定义 Modelfile
`dockerfile
FROM llama3SYSTEM """你是一个专业的 Python 后端工程师。
只回答技术问题,用代码示例说明。"""
PARAMETER temperature 0.3
PARAMETER num_ctx 8192
`API 接入
`bash
启动 API 服务
ollama serve调用
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "为什么天空是蓝色的?"
}'
``RAG 知识库
使用 AnythingLLM 或 Open WebUI 的 RAG 功能:
---
常见问题
Q:Mac 能跑吗? A:M 系列芯片(M1/M2/M3)统一内存可以跑 7B-14B 模型,体验不错。
Q:需要一直开机吗? A:不需要。像用 Docker 一样,需要时启动,不用时停止。
Q:模型会偷我的数据吗? A:本地模型不会上传数据,但 Prompt 内容你自己控制。
Q:和 ChatGPT 比怎么样? A:隐私和成本优势明显,但能力和速度不如 GPT-4。
---