Langfuse 是什么?
Langfuse 是开源的 LLM 可观测性平台,解决 AI 应用「上线后看不见」的问题:每次模型调用、Agent 步骤、提示词版本、token 成本和错误都记录在案,可以回放、分析和评估。
对 AI 工程团队来说,Langfuse 的价值是三点:调试——定位「为什么这个回答不对」;评估——建立评估集做回归测试,防止提示词改动导致质量回退;成本——清楚知道每个功能、每个用户消耗了多少 token。它支持自托管(Apache 2.0 协议,数据私有),也提供云服务。
需要客观看待的是:接入需要 SDK 集成(有学习成本),中文文档和社区规模小于国际主流;评估标准需要团队自己设计。适合把 AI 应用当产品的团队。
百器AI 将 Langfuse 归入「AI 开发」分类,适合生产级 AI 应用团队、RAG 项目和需要质量保障的开发者。
产品截图

主要功能
全链路追踪:LLM 调用、Agent 步骤、检索过程完整记录
成本监控:token 用量和费用按功能/用户统计
评估集:建立回归测试防质量回退
提示词管理:版本化提示词和在线调试
开源自托管:Apache 2.0,数据不出内网
多语言 SDK:Python、JS 等主流语言
如何使用
部署 Langfuse(自托管)或注册云版
安装 SDK(Python/JS)
在应用代码中初始化客户端并配置 API 密钥
包裹模型调用和 Agent 步骤,开启追踪
在控制台查看调用链路、成本和错误
建立评估集,对关键提示词做回归测试
接入 CI 流程,提示词变更自动跑测试
定期复盘失败案例,优化提示词和流程
核心优势
开源可自托管,数据私有
追踪、评估、成本一体
社区活跃,生态完善
适合生产级应用
同类竞品对比
| 对比维度 | Langfuse | LangSmith | promptfoo |
|---|---|---|---|
| 核心能力 | 全链路追踪:LLM 调用、Agent 步骤、检索过程完整记录;成本监控:token 用量和费用按功能/用户统计 | LangChain 原生集成:追踪和调试一体化;评估数据集:建立回归测试 | 提示词测试:回归测试和防回退;模型对比:多模型效果对照 |
| 上手门槛 | 免费版可体验,进阶功能按订阅收费 | 免费版可体验,进阶功能按订阅收费 | 免费版可体验,进阶功能按订阅收费 |
| 适合场景 | AI 应用调试 | AI 应用调试 | 选择适合业务的大模型 |
| 独特优势 | 开源可自托管,数据私有 | LangChain 生态集成最深 | 能减少凭感觉选型 |
| 注意事项 | 接入有学习成本 | 偏 LangChain 生态 | 需要维护测试集和指标 |
应用场景
AI 应用调试
成本监控
质量回归
提示词管理
标签
注意点
接入有学习成本
中文文档有限
评估标准需自行设计
自托管需要运维投入
不适用边界
常见问题
开源免费自托管,云版有免费额度和付费套餐。
相似工具
LangSmith
免费/付费LangChain 官方的 LLM 应用可观测与评估平台:追踪、调试、评估和监控 AI 应用。
promptfoo
免费/付费开源 LLM 评测和 Prompt 回归测试工具,适合比较模型、提示词和安全策略。
Vercel AI SDK
免费面向 TypeScript 开发者的 AI 应用 SDK,支持多模型调用、流式输出和前端集成。
LangChain.js
免费JavaScript/TypeScript 生态的 LLM 应用框架,适合构建 Agent、RAG 和工具调用流程。
LlamaIndex
免费/付费面向数据增强型 LLM 应用的开发框架,擅长连接文档、数据库和检索系统。
Haystack
免费开源 LLM 应用和搜索管道框架,适合构建检索增强生成、问答和文档处理系统。