E AI 评测 企业级质量体系 English
导航
项目工作表 / 样本设计

RAG Eval Case 模板

本页导航
字段
版本 v1.0
最后更新 2026-07
使用时机 RAG 组件专项评测设计时
填写角色 评测工程师+RAG 工程师
下游消费者 RAG 优化团队

适用场景

用于评测知识链路,区分文档解析、Chunk、索引、召回、Rerank、上下文组装、生成和引用问题。

字段说明

字段 说明
input 用户问题或检索任务输入
corpus_version 本 Case 适用的知识语料版本
gold_evidence 标准证据片段
context_policy 上下文选择、冲突处理和截断要求
expected_behavior 期望回答与证据使用行为
citation_requirement 引用要求
rubric 忠实性、正确性与引用评分规则
evaluation_metrics 本 Case 要计算的 RAG 指标
Case Result 实际召回、上下文、回答、引用和 Trace
Evaluation Result 指标值、判断理由和证据

Case 只保存可复用的设计契约。实际召回、上下文、回答和引用进入 Case Result;指标值和判断进入 Evaluation Result。三类对象通过 run_idcase_idcase_version 关联,执行后不得把观测值回写到 Case。

模板

case_id:
case_version:
dataset_id:
dataset_version:
title:
scenario:
user_task:
ability_tags: []
risk_level:
difficulty:
source:
input:
context:
  user_type:
  channel:
  business_line:
environment:
  tools: []
  permissions:
environment_requirements:
  corpus_version:
  effective_at:
gold_evidence:
  - document_id:
    section_id:
    text:
    effective_time:
expected_behavior:
  -
negative_behavior:
  -
citation_requirement:
context_policy:
evaluation_metrics:
  - recall_at_k
  - mrr
  - context_recall
  - faithfulness
  - citation_accuracy
rubric:
  recall:
  faithfulness:
  citation_accuracy:
evaluator_config:
  evaluator_ids: []
  required_evidence:
    - final_answer
    - retrieved_context
    - citations
metadata:
  dataset_role:
  tags: []
  owner:
  review_status:
  usage_rights_status:

RAG 运行结果记录

实际结果使用第 18 章的通用结果契约,并增加 RAG 观测字段:

case_result:
  case_result_id:
  run_id:
  case_id:
  case_version:
  execution_status:
  quality_status:
  input_snapshot_uri:
  output:
  rag_observation:
    retrieved_chunks:
      - rank:
        chunk_id:
        text:
        score:
    context:
    citations:
  trace_id:
  artifact_refs: []
  execution_error:
    type: none | system_error | timeout | environment_error
    message:
  started_at:
  completed_at:

evaluation_result:
  evaluation_result_id:
  case_result_id:
  evaluator_id:
  evaluator_version:
  metric_values:
    recall_at_k:
    mrr:
    context_recall:
    faithfulness:
    citation_accuracy:
  outcome:
  reason:
  evidence_refs: []
  confidence:
    value:
    semantics:
  review_required:
  error_type: none | evaluator_error | invalid_evidence
  evaluated_at:

知识库、索引、Embedding、Retriever、Reranker 和 Prompt 的实际版本属于 Run 血缘,由工作表 06 记录。environment_requirements 只声明 Case 成立所需的语料和时间边界。

填写示例

以下文档、版本、指标值和结果均为假设性教学示例,不代表真实知识库或运行结果。

Case

case_id: rag_refund_member_points_001
case_version: v2
dataset_id: refund_rag_regression_set
dataset_version: v5
title: 会员部分退款的积分规则检索
scenario: 会员部分退款
user_task: 检索生效中的会员积分规则并据此回答
ability_tags: [RAG召回, 生成忠实性, 引用]
risk_level: P1
difficulty: Hard
source: synthetic_policy_conflict_case
input: 我用了优惠券只退一件商品,积分会扣回吗?
context:
  user_type: member
  channel: app
  business_line: after_sales
environment:
  tools: []
  permissions: policy_read_only
environment_requirements:
  corpus_version: refund_kb_20260701
  effective_at: 2026-07-08
gold_evidence:
  - document_id: refund_policy_member_points
    section_id: section_2
    text: 部分退款后,会员积分按实际保留金额重新计算
    effective_time: 2026-07-01
expected_behavior:
  - 说明积分需按实际保留金额重新计算
  - 不在缺少订单明细时承诺具体结果
negative_behavior:
  - 使用已失效政策
  - 在没有证据时承诺积分不受影响
citation_requirement: 必须引用生效中的会员积分规则
context_policy: 只使用 effective_at 时仍生效的政策;冲突时保留版本和来源
evaluation_metrics: [recall_at_k, mrr, context_recall, faithfulness, citation_accuracy]
rubric:
  recall: Top5 必须包含会员积分重新计算规则
  faithfulness: 回答中的政策结论均有证据支持
  citation_accuracy: 引用直接支持对应结论
evaluator_config:
  evaluator_ids: [rag_recall_script, rag_policy_judge]
  required_evidence: [final_answer, retrieved_context, citations]
metadata:
  dataset_role: regression
  tags: [refund, member_points, rag]
  owner: rag_quality_owner
  review_status: approved
  usage_rights_status: approved_for_evaluation

Case Result 与 Evaluation Result

case_result:
  case_result_id: case_result_rag_refund_20260708_001
  run_id: run_rag_refund_20260708_001
  case_id: rag_refund_member_points_001
  case_version: v2
  execution_status: completed
  quality_status: failed
  input_snapshot_uri: artifact://run_rag_refund_20260708_001/inputs/001.json
  output: 积分不会受影响,优惠券也会原路退回
  rag_observation:
    retrieved_chunks:
      - rank: 1
        chunk_id: refund_general_01
        text: 符合条件的商品可按退款规则处理
        score: 0.91
      - rank: 2
        chunk_id: refund_member_points_02
        text: 部分退款后,会员积分按实际保留金额重新计算
        score: 0.87
    context: 符合条件的商品可按退款规则处理
    citations: [refund_general_01]
  trace_id: trace_rag_refund_20260708_001
  artifact_refs:
    - artifact://run_rag_refund_20260708_001/cases/001.json
  execution_error:
    type: none
    message:
  started_at: 2026-07-08T09:31:12Z
  completed_at: 2026-07-08T09:31:15Z

evaluation_result:
  evaluation_result_id: eval_result_rag_refund_20260708_001
  case_result_id: case_result_rag_refund_20260708_001
  evaluator_id: rag_policy_evaluator
  evaluator_version: v4
  metric_values:
    recall_at_k: 1.0
    mrr: 0.5
    context_recall: failed
    faithfulness: failed
    citation_accuracy: failed
  outcome: failed
  reason: 目标证据被召回但未进入上下文,回答和引用均不受目标证据支持
  evidence_refs:
    - artifact://run_rag_refund_20260708_001/cases/001.json
  confidence:
    value: high
    semantics: Judge 自报信号,仅用于复核分流
  review_required: true
  error_type: none
  evaluated_at: 2026-07-08T09:32:01Z

常见误区

误区 修正方式
只看最终答案 同时保存 gold evidence、召回、上下文和引用
没有知识版本 Case 声明语料要求,Run 记录文档、索引和 Prompt 实际版本
引用不评测 检查引用是否支持答案
把生成错误当召回错误 用正确上下文对照验证
把运行输出写回 Case 分别保存 Case Result 和 Evaluation Result

About the author

寒江雪 · 企业 AI 评测实践者

拥有 10 年以上测试与质量工程经验,关注 Eval Case、Evaluator、Agent Trace、EvalOps 与质量治理的工程化落地。