文档 / 通过 UI 做实验(Prompt Experiments)
通过 UI 做实验(Prompt Experiments)
你可以在 Langfuse UI 中通过 UI 执行实验(也称为 Prompt Experiments),以测试来自提示词管理的不同提示词版本或语言模型,并并排对比结果。
可选地,你可以使用 LLM-as-a-Judge 评估器或代码评估器,根据预期输出自动为响应打分,从而在聚合层面进一步分析结果。
为什么使用 Prompt Experiments?
- 快速测试不同的提示词版本或模型
- 通过使用数据集测试不同的提示词版本和模型,结构化你的提示词测试
- 通过 Prompt Experiments 快速迭代提示词
- 可选地使用 LLM-as-a-Judge 或代码评估器,根据数据集中的预期输出为响应打分
- 通过在更改提示词时运行测试来防止回归
实验始终在实验时的最新数据集版本上运行。对特定数据集版本运行实验的支持即将添加。
前提条件
1. 创建可用的提示词
创建你想要测试和评估的提示词。如何创建提示词?
提示词可用的条件: 你的提示词具有与实验所用数据集中数据集条目键匹配的变量。参见下面的示例。
示例:提示词变量与数据集条目键的映射
提示词:
You are a Langfuse expert. Answer based on:
{{ documentation }}
Question: {{question}}
数据集条目:
{
"documentation": "Langfuse is an AI Engineering Platform",
"question": "What is Langfuse?"
}
在此示例中:
- 提示词变量
{{documentation}}映射到 JSON 键"documentation" - 提示词变量
{{question}}映射到 JSON 键"question" - 两个键都必须存在于数据集条目的输入 JSON 中,实验才能成功运行
2. 创建数据集
创建一个包含测试用例的数据集。如何创建数据集?
3. 配置 LLM 连接
确保你已配置 LLM 连接,以便 Langfuse 可以调用模型来运行实验。
通过 UI 触发实验(Prompt Experiment)
1. 导航到数据集
实验目前从数据集的详情页面启动。
- 导航到
Your Project>Datasets - 点击你要为其启动实验的数据集

2. 打开设置页面
点击 Start Experiment 打开设置页面

点击 prompt Experiment 下方的 Create

3. 配置实验
- 设置实验名称
- 选择你要使用的提示词
- 如果你只有一块动态内容,我们建议使用带静态系统提示词和动态用户消息的 chat 提示词(例如将完整用户消息作为变量)。这确保你可以将动态内容映射为用户消息。
- 如果你有多块动态内容,我们建议为每块动态内容在提示词中创建一个变量。这确保你可以将动态内容映射到相应的变量。
- 设置或选择你要使用的 LLM 连接
- 选择你要使用的数据集
- 可选配置结构化输出 - 切换开启以强制执行 JSON schema 响应格式
- 从你的项目中选择现有 schema 或创建新 schema
- Schema 可以在 Playground 中创建和保存并在此处复用
- 使用 schema 选择器旁边的眼睛图标查看/编辑 schema
- 可选选择你要使用的评估器
- 点击
Create触发实验
相关资源
- 如果你需要评估完整的应用或 agent 逻辑(包括自定义运行时配置),而不仅是仅提示词的运行,请使用通过 SDK 做实验。你也可以通过 UI 用 webhooks 触发基于 SDK 的评估运行。