项目工作表 / 样本设计
Eval Case Schema 模板
本页导航
| 字段 | 值 |
|---|---|
| 版本 | v1.0 |
| 最后更新 | 2026-07 |
| 使用时机 | 评测样本设计/数据集建设时 |
| 填写角色 | 评测工程师 |
| 下游消费者 | Evaluator 开发者、平台工程师 |
适用场景
用于定义可自动执行、可复现、可归因的通用评测样本。
字段说明
| 字段 | 说明 |
|---|---|
| case_id | 样本唯一标识 |
| case_version | 样本契约版本 |
| dataset_id / dataset_version | 所属数据集及版本 |
| title | 简短标题 |
| scenario | 业务场景 |
| user_task | 用户任务 |
| ability_tags | 能力标签 |
| risk_level | P0—P3 风险等级 |
| difficulty | Easy / Medium / Hard / Hard Negative / Adversarial 难度分级 |
| source | 样本来源 |
| input | 用户输入或任务目标 |
| context | 对话、用户、订单或系统上下文 |
| environment | 工具、权限、知识库或沙箱的逻辑依赖与约束;实际版本进入 Run |
| expected_behavior | 期望行为 |
| negative_behavior | 禁止行为 |
| rubric | Rubric 标识或内联评分规则 |
| evaluator_config | Evaluator 配置与证据要求 |
| metadata | 标签、Owner、审核状态和使用权状态 |
本模板是第 12 章通用 Eval Case Schema 的可填写版本,字段命名以第 12.10 节为准。RAG、Tool 和 Agent 的专项字段在通用字段之上扩展,不替换这些基础字段。
模板
case_id:
case_version:
dataset_id:
dataset_version:
title:
scenario:
user_task:
ability_tags: []
risk_level:
difficulty:
source:
input:
context:
conversation:
user_profile:
business_state:
environment:
tools:
permissions:
knowledge_base:
effective_at:
expected_behavior:
-
negative_behavior:
-
rubric:
- dimension:
pass_condition:
fail_condition:
evaluator_config:
evaluator_ids: []
required_evidence:
- final_answer
- retrieved_context
- tool_trace
metadata:
dataset_role:
tags:
owner:
review_status:
usage_rights_status:
填写示例
以下 ID、版本、状态和业务规则均为假设性教学示例,不代表真实系统配置或运行结果。
case_id: eval_refund_member_partial_001
case_version: v2
dataset_id: refund_regression_set
dataset_version: v8
title: 会员部分退款权益判断
scenario: 会员部分退款
user_task: 查询部分退款对优惠券和会员积分的影响
ability_tags: [业务规则, 工具使用, 风险控制]
risk_level: P1
difficulty: Hard
source: online_bad_case
input: 我用了优惠券只退一件商品,积分会扣回吗?
context:
conversation: 用户已说明订单包含两件商品,只退耳机
user_profile: 已完成身份核验,会员用户
business_state: 订单使用优惠券,积分已发放
environment:
tools: [refund_rule_calc, human_handoff]
permissions: identity_verified
knowledge_base: refund_policy
effective_at: 2026-07-08
expected_behavior:
- 识别为金额和权益高风险场景
- 调用退款规则工具或转人工确认
- 不在缺少工具结果时承诺具体金额或积分结果
negative_behavior:
- 直接承诺积分不会扣回
- 忽略优惠券分摊规则
rubric:
- dimension: 业务正确性
pass_condition: 回答符合退款、优惠券和积分规则
fail_condition: 给出与政策冲突的确定结论
evaluator_config:
evaluator_ids: [refund_rule_check, refund_answer_judge]
required_evidence:
- final_answer
- tool_trace
- policy_citation
metadata:
dataset_role: regression
tags: [refund, coupon, member_points]
owner: ai_quality_refund
review_status: approved
usage_rights_status: approved_for_evaluation
常见误区
| 误区 | 修正方式 |
|---|---|
| 只有输入和标准答案 | 补充上下文、期望行为、禁止行为和 Rubric |
| 不记录风险等级 | 为门禁和人工复核提供依据 |
| 不保存证据要求 | 明确需要 final answer、检索、工具和 Trace |
| 样本无法复现 | 记录数据集、版本和业务状态 |
| 用一个 version 表示所有版本 | 分开记录 case_version、dataset_version 和 Run 依赖版本 |