E AI 评测 企业级质量体系 English
导航
项目工作表 / 样本设计

Eval Case Schema 模板

本页导航
字段
版本 v1.0
最后更新 2026-07
使用时机 评测样本设计/数据集建设时
填写角色 评测工程师
下游消费者 Evaluator 开发者、平台工程师

适用场景

用于定义可自动执行、可复现、可归因的通用评测样本。

字段说明

字段 说明
case_id 样本唯一标识
case_version 样本契约版本
dataset_id / dataset_version 所属数据集及版本
title 简短标题
scenario 业务场景
user_task 用户任务
ability_tags 能力标签
risk_level P0—P3 风险等级
difficulty Easy / Medium / Hard / Hard Negative / Adversarial 难度分级
source 样本来源
input 用户输入或任务目标
context 对话、用户、订单或系统上下文
environment 工具、权限、知识库或沙箱的逻辑依赖与约束;实际版本进入 Run
expected_behavior 期望行为
negative_behavior 禁止行为
rubric Rubric 标识或内联评分规则
evaluator_config Evaluator 配置与证据要求
metadata 标签、Owner、审核状态和使用权状态

本模板是第 12 章通用 Eval Case Schema 的可填写版本,字段命名以第 12.10 节为准。RAG、Tool 和 Agent 的专项字段在通用字段之上扩展,不替换这些基础字段。

模板

case_id:
case_version:
dataset_id:
dataset_version:
title:
scenario:
user_task:
ability_tags: []
risk_level:
difficulty:
source:
input:
context:
  conversation:
  user_profile:
  business_state:
environment:
  tools:
  permissions:
  knowledge_base:
  effective_at:
expected_behavior:
  -
negative_behavior:
  -
rubric:
  - dimension:
    pass_condition:
    fail_condition:
evaluator_config:
  evaluator_ids: []
  required_evidence:
    - final_answer
    - retrieved_context
    - tool_trace
metadata:
  dataset_role:
  tags:
  owner:
  review_status:
  usage_rights_status:

填写示例

以下 ID、版本、状态和业务规则均为假设性教学示例,不代表真实系统配置或运行结果。

case_id: eval_refund_member_partial_001
case_version: v2
dataset_id: refund_regression_set
dataset_version: v8
title: 会员部分退款权益判断
scenario: 会员部分退款
user_task: 查询部分退款对优惠券和会员积分的影响
ability_tags: [业务规则, 工具使用, 风险控制]
risk_level: P1
difficulty: Hard
source: online_bad_case
input: 我用了优惠券只退一件商品,积分会扣回吗?
context:
  conversation: 用户已说明订单包含两件商品,只退耳机
  user_profile: 已完成身份核验,会员用户
  business_state: 订单使用优惠券,积分已发放
environment:
  tools: [refund_rule_calc, human_handoff]
  permissions: identity_verified
  knowledge_base: refund_policy
  effective_at: 2026-07-08
expected_behavior:
  - 识别为金额和权益高风险场景
  - 调用退款规则工具或转人工确认
  - 不在缺少工具结果时承诺具体金额或积分结果
negative_behavior:
  - 直接承诺积分不会扣回
  - 忽略优惠券分摊规则
rubric:
  - dimension: 业务正确性
    pass_condition: 回答符合退款、优惠券和积分规则
    fail_condition: 给出与政策冲突的确定结论
evaluator_config:
  evaluator_ids: [refund_rule_check, refund_answer_judge]
  required_evidence:
    - final_answer
    - tool_trace
    - policy_citation
metadata:
  dataset_role: regression
  tags: [refund, coupon, member_points]
  owner: ai_quality_refund
  review_status: approved
  usage_rights_status: approved_for_evaluation

常见误区

误区 修正方式
只有输入和标准答案 补充上下文、期望行为、禁止行为和 Rubric
不记录风险等级 为门禁和人工复核提供依据
不保存证据要求 明确需要 final answer、检索、工具和 Trace
样本无法复现 记录数据集、版本和业务状态
用一个 version 表示所有版本 分开记录 case_version、dataset_version 和 Run 依赖版本

About the author

寒江雪 · 企业 AI 评测实践者

拥有 10 年以上测试与质量工程经验,关注 Eval Case、Evaluator、Agent Trace、EvalOps 与质量治理的工程化落地。