文档 / 评估概览
评估概览
评估(Evals)为你的 LLM 应用行为提供可重复的检查。它用数据取代猜测,帮助你在发布变更之前发现回归问题。

评估贯穿了AI 工程闭环的大部分环节:你为生产环境的实时 traces 打分,把有价值的样本转化为数据集,运行实验来对比变更,并用人工或自动评估器来判定结果。它既发生在线上(对生产环境的实时 traces),也发生在线下(在发布变更之前)。
观看本演示视频,了解 Langfuse 评估以及如何用它来改进你的 LLM 应用。
开始使用
从核心概念页开始。它讲解了评估器、分数、数据集和实验在 Langfuse 中是如何组合在一起的,理解了这些,其余文档会更容易上手。
有了这些背景之后,使用下表找到对应的功能页面:
| 如果你想…… | 使用这个 Langfuse 功能 |
|---|---|
| 人工审阅和评价 traces | 标注队列、通过 UI 打分 |
| 收集终端用户的反馈 | 用户反馈 |
| 在 traces 上留下开放式备注 | 文本分数、标注队列 |
| 追踪反复出现的故障类别 | 分数配置、分数 |
| 构建可复用的测试用例集 | 数据集 |
| 并排对比提示词、模型或代码变更 | 通过 UI 做实验、通过 SDK 做实验 |
| 在出现回归时阻止部署 | CI/CD 实验 |
| 运行确定性检查 | 代码评估器 |
| 自动为生产环境实时 traces 打分 | LLM-as-a-Judge、通过 API/SDK 打分 |
| 查看分数随时间的变化趋势 | Score Analytics、自定义仪表盘 |
已经知道要找什么?浏览侧边栏中的 Evaluation Methods 和 Experiments。