Langfuse 文档 中文 英文原文 ↗
文档 / Langfuse 路线图

Langfuse 路线图

Langfuse 是开源的,我们希望完全透明地展示我们正在做什么以及下一步是什么。这份路线图是一份活文档,我们会随着进展更新它。详情请参见下面的路线图产品愿景最近发布

我们非常感谢你的反馈。觉得缺少什么?在 GitHub 上添加新想法或对现有想法投票。两者都是为 Langfuse 做贡献并帮助我们了解什么对你很重要的好方法。

路线图

当前的重点是让现有基础变得卓越,并将各部分连接成一个面向 agent 的持续改进闭环。

Agent 可观测性与视图

评估与实验

工作流自动化与 agents

平台可靠性与规模

告警、工作流与企业控制

多模态与 playground

产品愿景与方向

Langfuse 应成为开放的数据和评估层,帮助人类(并最终帮助 agents)改进 agents。我们最优先优化一个产品闭环:追踪、理解、评估和改进 agentic 系统。

战略选择是在执行层保持中立。Langfuse 不应成为有主见的 agent 框架或运行时。相反,Langfuse 应拥有围绕 agentic 软件的改进闭环:理解 agent 行为、将其切分为有用的视图、将生产故障转化为数据集、运行实验,并通过 API、CLI、skills 和产品内 agent 自动化重复的工作流。

长期方向是自动优化的 agents:连接追踪和你的代码仓库,Langfuse 就可以为你管理 agent 改进闭环。Langfuse 理解定义你系统的指令、提示词、评估和 skill 文件;管理版本;运行评估;提议或触发实验;并让人类参与最高杠杆的判断。

视图作为平台原语

视图应成为将 observations 切分为有用产品界面的原语。视图定义哪些 observations 重要、它们如何分组、显示哪些属性、哪些指标和分数重要,以及哪些下游操作可用。这解锁了 agent 总览仪表盘、默认模板、语义聚类、评估分布对比和工作流触发器。

偏好层

人类判断仍然是评估 agents 的标准答案。Langfuse 应使捕获显式反馈、推导隐式信号、将 LLM-as-a-judge 评估器与人类偏好对齐,以及将低置信度案例路由回人工审阅变得更容易。

语义分组

随着 agents 从路由的子 agent 系统转向更广泛的动态 agents,固定标签是不够的。Langfuse 应帮助团队在过滤视图内发现有意义的交互组,跨这些组对比分数,并将反复出现的故障转化为数据集或实验。

实验作为爬坡界面

实验应成为对比提示词、模型和运行时变更的旗舰工作流。Langfuse 应使基线、运行对比、标注、指标和下一步操作足够简单,以至于团队自然地将实验用作他们的 agent 改进闭环。

托管改进闭环

最终状态是 Langfuse 能够监控 agent 系统、提议或运行实验、从生产刷新测试集、在需要人工输入时分配标注工作,并报告系统如何随时间改进。

最近发布

最近 10 条 changelog 项目请参见英文原文页面(由 changelog 组件动态渲染)。

订阅我们的邮件列表,以获取关于新功能的不定期电子邮件更新。

功能请求和 bug 报告

支持 Langfuse 的最好方式是分享你的反馈、报告 bug,并对他人提出的想法投赞成票。你也可以在我们的下一次 community hour 与团队讨论路线图。

非官方中文翻译 · 图片/视频/代码均链接官方资源 · 版权归 Langfuse GmbH 所有 查看英文原文 ↗