Langfuse 文档 中文 英文原文 ↗
文档 / 分数分析(Score Analytics)

分数分析(Score Analytics)

Score Analytics 提供了一种轻量级、零配置的方式,开箱即用地分析你的评估数据。无论你是在验证不同的 LLM 评审是否产生一致的结果、检查人工标注是否与自动评估一致,还是在探索分数分布和趋势,Score Analytics 都能帮助你建立对评估过程的信心。

为什么使用 Score Analytics?

Score Analytics 通过提供即时、零配置的分数分析,补充了 Langfuse 的实验 SDK自助仪表盘:

对于需要自定义指标或复杂对比的高级分析,请使用实验 SDK 进行更深入的研究。

开始使用

关键功能

多数据类型支持

Score Analytics 根据分数数据类型自动调整可视化和指标。

文本分数在 Score Analytics 中不受支持,因为自由文本无法有意义地聚合或比较。

数值分数(连续值,如 1-10 评分)

分类分数(离散类别,如 "good/bad/neutral")

布尔分数(true/false 二元值)

匹配数据 vs 全部数据分析

Score Analytics 提供两个视图来理解你的数据:

匹配数据(Matched Data)(默认标签页)

全部数据(All Data)(单个分数标签页)

基于时间的分析

Trend Over Time 图表帮助你监控分数模式,具备:

统计指标

Score Analytics 提供带解读指导的行业标准统计指标:

相关性指标(用于数值分数)

Pearson 相关系数:衡量分数之间的线性关系。值范围从 -1(完全负相关)到 1(完全正相关)。

Spearman 相关系数:衡量单调关系(基于秩)。比 Pearson 对异常值更稳健。

误差指标(用于数值分数)

MAE(平均绝对误差):分数之间的平均绝对差。越低越好。

RMSE(均方根误差):平均平方差的平方根。比 MAE 更惩罚较大的误差。

一致性指标(用于分类/布尔分数)

Cohen's Kappa:衡量经机会调整的一致性。值范围从 -1 到 1。

F1 Score:精确率和召回率的调和平均。值范围从 0 到 1,1 为完美。

Overall Agreement:匹配分类的简单百分比。未经机会一致性调整。

示例用例

验证 LLM 评审的可靠性

场景:你同时使用 GPT-4 和 Gemini 评估有用性。它们是否产生一致的结果?

工作流:

  1. 选择 "helpfulness_gpt4-NUMERIC-EVAL" 作为 score 1
  2. 选择 "helpfulness_gemini-NUMERIC-EVAL" 作为 score 2
  3. 查看 Statistics 卡片:Pearson 相关系数 0.984,带 "Very Strong" 徽章
  4. 检查热力图:强对角线模式确认对齐
  5. 结果:两个评审高度一致,你的评估是可靠的

人工 vs AI 标注一致性

场景:你有质量的人工标注和 AI 评估。你应该信任 AI 吗?

工作流:

  1. 选择 "quality-CATEGORICAL-ANNOTATION" 作为 score 1
  2. 选择 "quality-CATEGORICAL-EVAL" 作为 score 2
  3. 检查混淆矩阵:强对角线表明良好一致性
  4. 查看 Cohen's Kappa:0.85 显示 "Almost Perfect" 一致性
  5. 结果:AI 评估与人工判断高度一致

识别负相关

场景:理解不同应用行为之间的关系

工作流:

  1. 选择 "has_tool_use-BOOLEAN-EVAL" 作为 score 1
  2. 选择 "has_hallucination-BOOLEAN-EVAL" 作为 score 2
  3. 观察混淆矩阵:反对角线模式
  4. 结果:当你的 agent 使用工具时,它产生幻觉的频率更低

追踪评估覆盖率

场景:你的评估数据有多完整?

工作流:

  1. 选择任意分数
  2. 对比 Distribution 中的 "all" 标签页 vs "matched" 标签页
  3. 检查总计数:1,143 个单独 score 1 vs 567 个匹配对
  4. 结果:识别出约 50% 的父对象同时拥有两个分数

检测质量回归

场景:最近一次部署后你的模型质量下降了吗?

工作流:

  1. 选择一个质量或性能分数
  2. 设置时间范围以包含部署前后时期
  3. 查看 Trend Over Time 图表是否有任何下降或变化
  4. 结果:快速发现质量回归并调查根本原因

当前限制

测试功能:Score Analytics 目前处于测试阶段。请报告任何问题或反馈。

当前约束:

提示与最佳实践

选择要对比的分数

解读热力图

理解匹配数据

相关资源

非官方中文翻译 · 图片/视频/代码均链接官方资源 · 版权归 Langfuse GmbH 所有 查看英文原文 ↗