自托管 AI 工具完全指南:从模型到 UI 的全栈方案
> 不想把代码和 prompt 交给第三方?这篇指南教你搭建完全自主的 AI 开发环境。
为什么选择自托管?
数据泄露、API 宕机、供应商 lock-in——这些问题在 2026 年越来越突出。自托管不是极客的专利,而是生产环境的合理选择。
本地 LLM 方案
Ollama:最傻瓜式的本地模型启动器,一条命令跑 Llama 3、DeepSeek、Mistral。Mac 和 Linux 都支持 GPU 加速。
llama.cpp:更底层的推理引擎,GGUF 格式模型,内存占用极低。4GB 显存就能跑 7B 模型。
vLLM / TGI:服务器级推理服务,支持多卡、批处理、OpenAI 兼容 API。适合团队多用户场景。
自托管 AI 编程工具
Tabby:开源 Copilot 替代品,Rust 编写,支持私有部署。提供代码补全和 Chat API。
OpenHands(原 OpenDevin):全功能软件 Engineer Agent,能在你的代码库上自主完成 Issue → PR 的全流程。
Continue:VS Code / JetBrains 插件,支持连接本地 Ollama 或远程 vLLM。界面最友好。
Aider:终端 AI 编程工具,天然适合 Docker 容器化部署。
全栈架构参考
``
┌─────────────────────────────────────┐
│ IDE 层:VS Code + Continue / Tabby │
├─────────────────────────────────────┤
│ 服务层:vLLM / Ollama (模型服务) │
├─────────────────────────────────────┤
│ 网关层:OpenAI 兼容 API Gateway │
├─────────────────────────────────────┤
│ 数据层:向量数据库 (Qdrant/Milvus) │
└─────────────────────────────────────┘
``
硬件参考
| 模型规模 | 最低显存 | 推荐配置 |
| 7B (Q4) | 6GB | RTX 3060 12GB |
| 13B (Q4) | 10GB | RTX 4060 Ti 16GB |
| 70B (Q4) | 40GB | RTX 3090/4090 24GB x2 |
Mac M系列:M2 16GB 可跑 7B,M2 Pro 32GB 可跑 13B。
一句话建议
个人开发者用 Ollama + Continue,团队用 vLLM + Tabby,追求极致自主用 llama.cpp + Aider。