评估的 Agentic 访问
AI Agent 可以帮助检查质量问题并在 Langfuse 中运行评估工作流。Agent 有多种方式访问你的数据:
选择访问方式
| Agent 能力 | 推荐访问方式 |
|---|---|
| 可以安装工具并运行 shell 命令 | 安装 Langfuse Agent Skill。它教会 Agent Langfuse 的工作流,并使用 Langfuse CLI 来查询和更新项目数据。 |
| 无法安装工具或运行 shell 命令 | 连接 Langfuse MCP server,将 Langfuse 操作暴露为工具。 |
| 作为脚本或 CI/CD 流水线的一部分运行 | 直接使用 Langfuse CLI 或调用 Public API。 |
示例工作流
让你的 Agent 执行以下任务:
- 定位低分 observations 并将典型案例放入数据集
- 定义或修改评分配置并录入分数值
- 检查实验结果并发现回归问题
- 建立评估器及评估规则
- 创建和管理人工审阅的标注队列
跨模块协作
Agent 还可以在 Langfuse 中检查生产环境行为和管理提示词。
相关指南与博客
- 使用 Langfuse skill 校准 LLM-as-a-Judge——Agent 引导的流程,将评估器输出与人工标签对比并优化提示词。
- 评估 AI Agent Skills——展示数据集、追踪和 Agent SDK 如何支持对 skill 的反复测试和改进。
- 从编码 Agent 中无头使用 Langfuse——涵盖 trace 分析、数据集组装和评估设置。