Langfuse 文档 中文 英文原文 ↗
文档 / 评估概览

评估概览

评估(Evals)为你的 LLM 应用行为提供可重复的检查。它用数据取代猜测,帮助你在发布变更之前发现回归问题。

Langfuse 中的 Score Analytics 仪表盘,展示多个评估器的评估分数随时间变化的趋势。

评估贯穿了AI 工程闭环的大部分环节:你为生产环境的实时 traces 打分,把有价值的样本转化为数据集,运行实验来对比变更,并用人工或自动评估器来判定结果。它既发生在线上(对生产环境的实时 traces),也发生在线下(在发布变更之前)。

观看本演示视频,了解 Langfuse 评估以及如何用它来改进你的 LLM 应用。

开始使用

核心概念页开始。它讲解了评估器、分数、数据集和实验在 Langfuse 中是如何组合在一起的,理解了这些,其余文档会更容易上手。

有了这些背景之后,使用下表找到对应的功能页面:

如果你想…… 使用这个 Langfuse 功能
人工审阅和评价 traces 标注队列通过 UI 打分
收集终端用户的反馈 用户反馈
在 traces 上留下开放式备注 文本分数标注队列
追踪反复出现的故障类别 分数配置分数
构建可复用的测试用例集 数据集
并排对比提示词、模型或代码变更 通过 UI 做实验通过 SDK 做实验
在出现回归时阻止部署 CI/CD 实验
运行确定性检查 代码评估器
自动为生产环境实时 traces 打分 LLM-as-a-Judge通过 API/SDK 打分
查看分数随时间的变化趋势 Score Analytics自定义仪表盘

已经知道要找什么?浏览侧边栏中的 Evaluation MethodsExperiments

非官方中文翻译 · 图片/视频/代码均链接官方资源 · 版权归 Langfuse GmbH 所有 查看英文原文 ↗