分数分析(Score Analytics)
Score Analytics 提供了一种轻量级、零配置的方式,开箱即用地分析你的评估数据。无论你是在验证不同的 LLM 评审是否产生一致的结果、检查人工标注是否与自动评估一致,还是在探索分数分布和趋势,Score Analytics 都能帮助你建立对评估过程的信心。
为什么使用 Score Analytics?
Score Analytics 通过提供即时、零配置的分数分析,补充了 Langfuse 的实验 SDK 和自助仪表盘:
- 轻量设置:无需配置——在分数接入后立即开始分析
- 快速验证:对比来自不同来源的分数(例如 GPT-4 vs Gemini 作为评审),以衡量一致性并确保可靠性
- 开箱即用的洞察:无需自定义仪表盘配置即可可视化分布、追踪趋势并发现相关性
- 统计严谨性:访问 Pearson 相关系数、Cohen's Kappa 和 F1 分数等指标,并内置解读
对于需要自定义指标或复杂对比的高级分析,请使用实验 SDK 进行更深入的研究。
开始使用
关键功能
多数据类型支持
Score Analytics 根据分数数据类型自动调整可视化和指标。
文本分数在 Score Analytics 中不受支持,因为自由文本无法有意义地聚合或比较。
数值分数(连续值,如 1-10 评分)
- 分布:带 10 个 bin 的直方图,显示值范围
- 对比:10×10 热力图,显示相关模式
- 指标:Pearson 相关系数、Spearman 相关系数、MAE(平均绝对误差)、RMSE(均方根误差)
分类分数(离散类别,如 "good/bad/neutral")
- 分布:显示每个类别计数的柱状图
- 对比:N×M 混淆矩阵,显示类别如何对齐
- 指标:Cohen's Kappa、F1 Score、Overall Agreement
布尔分数(true/false 二元值)
- 分布:带 2 个类别的柱状图
- 对比:2×2 混淆矩阵
- 指标:Cohen's Kappa、F1 Score、Overall Agreement
匹配数据 vs 全部数据分析
Score Analytics 提供两个视图来理解你的数据:
匹配数据(Matched Data)(默认标签页)
- 仅显示同时附加了两个所选分数的父对象(traces、observations、sessions 或 dataset run items)
- 支持评估方法之间的有效对比
- 当两个分数关联到同一父对象时,匹配存在
- 使用此视图衡量一致性和相关性
全部数据(All Data)(单个分数标签页)
- 独立显示每个分数的完整分布
- 揭示评估覆盖率(多少父对象拥有每个分数)
- 帮助识别你评估策略中的缺口
基于时间的分析
Trend Over Time 图表帮助你监控分数模式,具备:
- 可配置间隔:从分钟到年(5m、30m、1h、3h、1d、7d、30d、90d、1y)
- 自动间隔选择:基于你所选时间范围的智能默认值
- 缺口填充:缺失的时间段用零填充,以保持一致的可视化
- 平均值计算:副标题显示该时间段的总体平均值
统计指标
Score Analytics 提供带解读指导的行业标准统计指标:
相关性指标(用于数值分数)
Pearson 相关系数:衡量分数之间的线性关系。值范围从 -1(完全负相关)到 1(完全正相关)。
- 0.9-1.0:非常强的相关性
- 0.7-0.9:强相关性
- 0.5-0.7:中等相关性
- 低于 0.5:弱相关性
Spearman 相关系数:衡量单调关系(基于秩)。比 Pearson 对异常值更稳健。
误差指标(用于数值分数)
MAE(平均绝对误差):分数之间的平均绝对差。越低越好。
RMSE(均方根误差):平均平方差的平方根。比 MAE 更惩罚较大的误差。
一致性指标(用于分类/布尔分数)
Cohen's Kappa:衡量经机会调整的一致性。值范围从 -1 到 1。
- 0.81-1.0:几乎完全一致
- 0.61-0.80:实质一致
- 0.41-0.60:中等相关
- 低于 0.41:一般到轻微一致
F1 Score:精确率和召回率的调和平均。值范围从 0 到 1,1 为完美。
Overall Agreement:匹配分类的简单百分比。未经机会一致性调整。
示例用例
验证 LLM 评审的可靠性
场景:你同时使用 GPT-4 和 Gemini 评估有用性。它们是否产生一致的结果?
工作流:
- 选择 "helpfulness_gpt4-NUMERIC-EVAL" 作为 score 1
- 选择 "helpfulness_gemini-NUMERIC-EVAL" 作为 score 2
- 查看 Statistics 卡片:Pearson 相关系数 0.984,带 "Very Strong" 徽章
- 检查热力图:强对角线模式确认对齐
- 结果:两个评审高度一致,你的评估是可靠的
人工 vs AI 标注一致性
场景:你有质量的人工标注和 AI 评估。你应该信任 AI 吗?
工作流:
- 选择 "quality-CATEGORICAL-ANNOTATION" 作为 score 1
- 选择 "quality-CATEGORICAL-EVAL" 作为 score 2
- 检查混淆矩阵:强对角线表明良好一致性
- 查看 Cohen's Kappa:0.85 显示 "Almost Perfect" 一致性
- 结果:AI 评估与人工判断高度一致
识别负相关
场景:理解不同应用行为之间的关系
工作流:
- 选择 "has_tool_use-BOOLEAN-EVAL" 作为 score 1
- 选择 "has_hallucination-BOOLEAN-EVAL" 作为 score 2
- 观察混淆矩阵:反对角线模式
- 结果:当你的 agent 使用工具时,它产生幻觉的频率更低
追踪评估覆盖率
场景:你的评估数据有多完整?
工作流:
- 选择任意分数
- 对比 Distribution 中的 "all" 标签页 vs "matched" 标签页
- 检查总计数:1,143 个单独 score 1 vs 567 个匹配对
- 结果:识别出约 50% 的父对象同时拥有两个分数
检测质量回归
场景:最近一次部署后你的模型质量下降了吗?
工作流:
- 选择一个质量或性能分数
- 设置时间范围以包含部署前后时期
- 查看 Trend Over Time 图表是否有任何下降或变化
- 结果:快速发现质量回归并调查根本原因
当前限制
测试功能:Score Analytics 目前处于测试阶段。请报告任何问题或反馈。
当前约束:
- 最多两个分数:目前支持一次对比最多两个分数。对于多路对比,请执行成对分析。
- 仅相同数据类型:你只能对比相同数据类型的分数(数值与数值、分类与分类、布尔与布尔)。
- 采样:为性能优化,预期超过 10 万分数的查询(对 score1 或 score2)会自动应用随机采样。此采样近似真实随机采样,并保持你数据的统计特性。当采样激活时会显示可见指示器,如果你需要完整数据集,可以使用时间范围或对象类型过滤器缩小分析范围。
提示与最佳实践
选择要对比的分数
- 只有相同数据类型的分数才能对比
- 不同量表的分数可以对比,但误差指标(MAE、RMSE)会受量表差异影响
- 选择评估相似维度的分数以进行有意义的对比
解读热力图
- 对角线模式:表明一致(两个分数分配相似的值)
- 反对角线模式:表明负相关(一个分数的高值对应另一个的低值)
- 分散模式:表明低相关性或噪声数据
- 单元格强度:较深的单元格代表该 bin 组合中有更多数据点
理解匹配数据
- 分数始终附加到一个父对象(trace、observation、session 或 dataset run item)
- 当分数关联到同一父对象时,分数之间存在匹配
- 如果匹配计数远低于单独计数,则你存在覆盖率缺口
- 某些评估方法可能是选择性的(例如只标注边缘案例)
相关资源
- 构建自定义仪表盘,将分数趋势与其他指标一起可视化。
- 要以编程方式查询聚合分数数据用于外部监控,请使用 Metrics API。