Langfuse 文档 中文 英文原文 ↗
文档 / 分数分析(Score Analytics)

分数分析(Score Analytics)

Score Analytics 提供了一种轻量级、零配置的方式,开箱即用地分析你的评估数据。无论你是在验证不同的 LLM 评审是否产生一致的结果、检查人工标注是否与自动评估一致,还是在探索分数分布和趋势,Score Analytics 都能帮助你建立对评估过程的信心。

为什么使用 Score Analytics?

Score Analytics 通过提供即时、零配置的分数分析,补充了 Langfuse 的实验 SDK自助仪表盘:

对于需要自定义指标或复杂对比的高级分析,请使用实验 SDK 进行更深入的研究。

开始使用

前提条件

确保你的 Langfuse 项目中有来自任何评估方法的分数数据

导航到 Score Analytics

  1. 转到你在 Langfuse 中的项目
  2. 点击导航菜单中的 Scores
  3. 选择 Analytics 标签页

分析单个分数

选择一个分数以查看其分布、随时间的趋势和统计摘要。

关键功能

多数据类型支持

Score Analytics 根据分数数据类型自动调整可视化和指标。

文本分数在 Score Analytics 中不受支持,因为自由文本无法有意义地聚合或比较。

数值分数(连续值,如 1-10 评分)

分类分数(离散类别,如 "good/bad/neutral")

布尔分数(true/false 二元值)

匹配数据 vs 全部数据分析

Score Analytics 提供两个视图来理解你的数据:

匹配数据(Matched Data)(默认标签页)

全部数据(All Data)(单个分数标签页)

基于时间的分析

Trend Over Time 图表帮助你监控分数模式,具备:

统计指标

Score Analytics 提供带解读指导的行业标准统计指标:

相关性指标(用于数值分数)

Pearson 相关系数:衡量分数之间的线性关系。值范围从 -1(完全负相关)到 1(完全正相关)。

Spearman 相关系数:衡量单调关系(基于秩)。比 Pearson 对异常值更稳健。

误差指标(用于数值分数)

MAE(平均绝对误差):分数之间的平均绝对差。越低越好。

RMSE(均方根误差):平均平方差的平方根。比 MAE 更惩罚较大的误差。

一致性指标(用于分类/布尔分数)

Cohen's Kappa:衡量经机会调整的一致性。值范围从 -1 到 1。

F1 Score:精确率和召回率的调和平均。值范围从 0 到 1,1 为完美。

Overall Agreement:匹配分类的简单百分比。未经机会一致性调整。

示例用例

验证 LLM 评审的可靠性

场景:你同时使用 GPT-4 和 Gemini 评估有用性。它们是否产生一致的结果?

工作流:

  1. 选择 "helpfulness_gpt4-NUMERIC-EVAL" 作为 score 1
  2. 选择 "helpfulness_gemini-NUMERIC-EVAL" 作为 score 2
  3. 查看 Statistics 卡片:Pearson 相关系数 0.984,带 "Very Strong" 徽章
  4. 检查热力图:强对角线模式确认对齐
  5. 结果:两个评审高度一致,你的评估是可靠的

人工 vs AI 标注一致性

场景:你有质量的人工标注和 AI 评估。你应该信任 AI 吗?

工作流:

  1. 选择 "quality-CATEGORICAL-ANNOTATION" 作为 score 1
  2. 选择 "quality-CATEGORICAL-EVAL" 作为 score 2
  3. 检查混淆矩阵:强对角线表明良好一致性
  4. 查看 Cohen's Kappa:0.85 显示 "Almost Perfect" 一致性
  5. 结果:AI 评估与人工判断高度一致

识别负相关

场景:理解不同应用行为之间的关系

工作流:

  1. 选择 "has_tool_use-BOOLEAN-EVAL" 作为 score 1
  2. 选择 "has_hallucination-BOOLEAN-EVAL" 作为 score 2
  3. 观察混淆矩阵:反对角线模式
  4. 结果:当你的 agent 使用工具时,它产生幻觉的频率更低

追踪评估覆盖率

场景:你的评估数据有多完整?

工作流:

  1. 选择任意分数
  2. 对比 Distribution 中的 "all" 标签页 vs "matched" 标签页
  3. 检查总计数:1,143 个单独 score 1 vs 567 个匹配对
  4. 结果:识别出约 50% 的父对象同时拥有两个分数

检测质量回归

场景:最近一次部署后你的模型质量下降了吗?

工作流:

  1. 选择一个质量或性能分数
  2. 设置时间范围以包含部署前后时期
  3. 查看 Trend Over Time 图表是否有任何下降或变化
  4. 结果:快速发现质量回归并调查根本原因

当前限制

测试功能:Score Analytics 目前处于测试阶段。请报告任何问题或反馈。

当前约束:

提示与最佳实践

选择要对比的分数

解读热力图

理解匹配数据

相关资源

非官方中文翻译 · 图片/视频/代码均链接官方资源 · 版权归 Langfuse GmbH 所有 查看英文原文 ↗