文档 / 通过 UI 做实验(Prompt Experiments)
通过 UI 做实验(Prompt Experiments)
你可以在 Langfuse UI 中通过 UI 执行实验(也称为 Prompt Experiments),以测试来自提示词管理的不同提示词版本或语言模型,并并排对比结果。
可选地,你可以使用 LLM-as-a-Judge 评估器或代码评估器,根据预期输出自动为响应打分,从而在聚合层面进一步分析结果。
为什么使用 Prompt Experiments?
- 快速测试不同的提示词版本或模型
- 通过使用数据集测试不同的提示词版本和模型,结构化你的提示词测试
- 通过 Prompt Experiments 快速迭代提示词
- 可选地使用 LLM-as-a-Judge 或代码评估器,根据数据集中的预期输出为响应打分
- 通过在更改提示词时运行测试来防止回归
实验始终在实验时的最新数据集版本上运行。对特定数据集版本运行实验的支持即将添加。
前提条件
通过 UI 触发实验(Prompt Experiment)
相关资源
- 如果你需要评估完整的应用或 agent 逻辑(包括自定义运行时配置),而不仅是仅提示词的运行,请使用通过 SDK 做实验。你也可以通过 UI 用 webhooks 触发基于 SDK 的评估运行。