Langfuse 路线图
Langfuse 是开源的,我们希望完全透明地展示我们正在做什么以及下一步是什么。这份路线图是一份活文档,我们会随着进展更新它。详情请参见下面的路线图、产品愿景和最近发布。
我们非常感谢你的反馈。觉得缺少什么?在 GitHub 上添加新想法或对现有想法投票。两者都是为 Langfuse 做贡献并帮助我们了解什么对你很重要的好方法。
路线图
当前的重点是让现有基础变得卓越,并将各部分连接成一个面向 agent 的持续改进闭环。
Agent 可观测性与视图
- 让 v4 observations 表、过滤侧边栏、保存的视图和默认视图对 agent traces 表现出色。
- 构建 agent 级视图,用于每个 agent 的 traces、成本、延迟、步骤、工具调用,以及聚合的步骤/工具行为。
- 改进长时间运行 agent traces 的 trace 详情页,包括紧凑表示、选定的 JSON 路径,以及从图表到底层 spans 的更好方式。
- 改进全文搜索、元数据过滤、自定义维度和仪表盘到 trace 的工作流,以便团队能以更少的噪声切分 observations。
评估与实验
- 发布实验和评估器的公共 API。
- 扩展评估器数据模型并支持新的评估器类型。
- 改进实验图表、对比流程、评估器管理和评估器模板库。
- 扩展代码评估器、分类和布尔评审、自由文本分数、多模态数据集,以及 trace 级评估弃用路径。
工作流自动化与 agents
- 构建第一个产品内 Langfuse agent,用于读取 Langfuse 数据、使用屏幕上下文,并帮助完成诸如对比 traces 等任务。
- 使用 skills、指南和 academy 内容在产品外自动化 AI 工程工作流,然后将最好的打包进产品内。
- 改进 Langfuse CLI、MCP 接口和 skill 管理,以便外部 agent 能够检查数据形状、高效查询 Langfuse 并执行常见工作流。
- 优先处理可重复的工作流,如低分分析、故障聚类、评估器设置、生产到数据集的刷新、合成数据生成和实验触发。
平台可靠性与规模
- 完成跨 Langfuse Cloud 和自托管部署的 v4 上线。
- 继续为大型 agent 工作负载扩展接入,并在需要时通过预聚合使读取路径更快。
- 使系统集成点(如 blob 导出、S3 导出、公共 API、指标、observations 访问和 CLI)可靠到乏味。
告警、工作流与企业控制
- 跨 Slack、PagerDuty、webhooks 和电子邮件等交付渠道,发布针对评估、指标和操作阈值的告警。
- 探索用于可观测性和评估事件的 webhooks 和自动化。
- 改进 API 密钥作用域,转向 bearer 密钥,并为企业部署扩展管理控制。
- 改进自托管和 Helm chart 体验,使用 ClickHouse Operator,并为需要更强数据隔离或直接 ClickHouse 访问的客户探索混合或 BYOC 部署模型。
多模态与 playground
- 弥合多模态缺口,使 traces、playground、数据集和评估感觉像一个一致的系统。
产品愿景与方向
Langfuse 应成为开放的数据和评估层,帮助人类(并最终帮助 agents)改进 agents。我们最优先优化一个产品闭环:追踪、理解、评估和改进 agentic 系统。
战略选择是在执行层保持中立。Langfuse 不应成为有主见的 agent 框架或运行时。相反,Langfuse 应拥有围绕 agentic 软件的改进闭环:理解 agent 行为、将其切分为有用的视图、将生产故障转化为数据集、运行实验,并通过 API、CLI、skills 和产品内 agent 自动化重复的工作流。
长期方向是自动优化的 agents:连接追踪和你的代码仓库,Langfuse 就可以为你管理 agent 改进闭环。Langfuse 理解定义你系统的指令、提示词、评估和 skill 文件;管理版本;运行评估;提议或触发实验;并让人类参与最高杠杆的判断。
视图作为平台原语
视图应成为将 observations 切分为有用产品界面的原语。视图定义哪些 observations 重要、它们如何分组、显示哪些属性、哪些指标和分数重要,以及哪些下游操作可用。这解锁了 agent 总览仪表盘、默认模板、语义聚类、评估分布对比和工作流触发器。
偏好层
人类判断仍然是评估 agents 的标准答案。Langfuse 应使捕获显式反馈、推导隐式信号、将 LLM-as-a-judge 评估器与人类偏好对齐,以及将低置信度案例路由回人工审阅变得更容易。
语义分组
随着 agents 从路由的子 agent 系统转向更广泛的动态 agents,固定标签是不够的。Langfuse 应帮助团队在过滤视图内发现有意义的交互组,跨这些组对比分数,并将反复出现的故障转化为数据集或实验。
实验作为爬坡界面
实验应成为对比提示词、模型和运行时变更的旗舰工作流。Langfuse 应使基线、运行对比、标注、指标和下一步操作足够简单,以至于团队自然地将实验用作他们的 agent 改进闭环。
托管改进闭环
最终状态是 Langfuse 能够监控 agent 系统、提议或运行实验、从生产刷新测试集、在需要人工输入时分配标注工作,并报告系统如何随时间改进。
最近发布
最近 10 条 changelog 项目请参见英文原文页面(由 changelog 组件动态渲染)。
订阅我们的邮件列表,以获取关于新功能的不定期电子邮件更新。
功能请求和 bug 报告
支持 Langfuse 的最好方式是分享你的反馈、报告 bug,并对他人提出的想法投赞成票。你也可以在我们的下一次 community hour 与团队讨论路线图。