← 返回首页

自托管 AI 工具完全指南:从模型到 UI 的全栈方案

> 不想把代码和 prompt 交给第三方?这篇指南教你搭建完全自主的 AI 开发环境。

为什么选择自托管?

数据泄露、API 宕机、供应商 lock-in——这些问题在 2026 年越来越突出。自托管不是极客的专利,而是生产环境的合理选择。

本地 LLM 方案

Ollama:最傻瓜式的本地模型启动器,一条命令跑 Llama 3、DeepSeek、Mistral。Mac 和 Linux 都支持 GPU 加速。

llama.cpp:更底层的推理引擎,GGUF 格式模型,内存占用极低。4GB 显存就能跑 7B 模型。

vLLM / TGI:服务器级推理服务,支持多卡、批处理、OpenAI 兼容 API。适合团队多用户场景。

自托管 AI 编程工具

Tabby:开源 Copilot 替代品,Rust 编写,支持私有部署。提供代码补全和 Chat API。

OpenHands(原 OpenDevin):全功能软件 Engineer Agent,能在你的代码库上自主完成 Issue → PR 的全流程。

Continue:VS Code / JetBrains 插件,支持连接本地 Ollama 或远程 vLLM。界面最友好。

Aider:终端 AI 编程工具,天然适合 Docker 容器化部署。

全栈架构参考

`` ┌─────────────────────────────────────┐ │ IDE 层:VS Code + Continue / Tabby │ ├─────────────────────────────────────┤ │ 服务层:vLLM / Ollama (模型服务) │ ├─────────────────────────────────────┤ │ 网关层:OpenAI 兼容 API Gateway │ ├─────────────────────────────────────┤ │ 数据层:向量数据库 (Qdrant/Milvus) │ └─────────────────────────────────────┘ ``

硬件参考

模型规模最低显存推荐配置
7B (Q4)6GBRTX 3060 12GB
13B (Q4)10GBRTX 4060 Ti 16GB
70B (Q4)40GBRTX 3090/4090 24GB x2

Mac M系列:M2 16GB 可跑 7B,M2 Pro 32GB 可跑 13B。

一句话建议

个人开发者用 Ollama + Continue,团队用 vLLM + Tabby,追求极致自主用 llama.cpp + Aider