Langfuse 评测:LLM 可观测性的开源最优解
> 用 Langfuse 追踪了 1000+ 次 LLM 调用,prompt 调试效率提升 3 倍。
为什么需要 LLM 可观测性?
上线 LLM 应用后,你会发现:
Langfuse 就是解决这些问题的。
核心功能
Trace 追踪
一次用户请求可能触发多次 LLM 调用(RAG 检索 + 重写 + 生成)。Langfuse 把这些调用串成一条 trace,可视化展示完整链路。
Prompt 管理
在线编辑 prompt,版本历史保留,支持 A/B test。比把 prompt 写在代码里硬编码灵活 10 倍。
成本统计
按 user、session、model 维度统计 token 消耗和费用。直接对接 OpenAI、Anthropic 的定价,自动换算。
评分与反馈
支持用户 thumbs up/down,也可以接入自动评分(用 LLM judge)。把"好对话"和"坏对话"自动标记,用于后续 fine-tune。
自托管 vs 云服务
| 维度 | 自托管 | 云服务 |
| 部署 | Docker Compose | 无需部署 |
| 成本 | 服务器费用 | $0.5/1k traces |
| 数据隐私 | 完全本地 | 发送到 Langfuse 服务器 |
| 定制性 | 高 | 中 |
| 维护 | 需升级、备份 | 无需维护 |
实测数据
在内部客服机器人上跑了 2 周:
对比其他方案
| 工具 | 优势 | 劣势 |
| Langfuse | 开源、可自托管、功能全 | 需要自己运维 |
| LangSmith | LangChain 原生集成 | 贵、不自托管 |
| Helicone | 轻量、代理模式 | 功能较少 |
| Braintrust | 评测功能强 | 学习曲线陡 |
适合谁?
一句话
Langfuse 是 LLM 可观测性的事实标准——开源、成熟、社区活跃。只要你在生产环境跑 LLM,就需要它。