项目工作表 / 样本设计
RAG Eval Case 模板
本页导航
| 字段 | 值 |
|---|---|
| 版本 | v1.0 |
| 最后更新 | 2026-07 |
| 使用时机 | RAG 组件专项评测设计时 |
| 填写角色 | 评测工程师+RAG 工程师 |
| 下游消费者 | RAG 优化团队 |
适用场景
用于评测知识链路,区分文档解析、Chunk、索引、召回、Rerank、上下文组装、生成和引用问题。
字段说明
| 字段 | 说明 |
|---|---|
| input | 用户问题或检索任务输入 |
| corpus_version | 本 Case 适用的知识语料版本 |
| gold_evidence | 标准证据片段 |
| context_policy | 上下文选择、冲突处理和截断要求 |
| expected_behavior | 期望回答与证据使用行为 |
| citation_requirement | 引用要求 |
| rubric | 忠实性、正确性与引用评分规则 |
| evaluation_metrics | 本 Case 要计算的 RAG 指标 |
| Case Result | 实际召回、上下文、回答、引用和 Trace |
| Evaluation Result | 指标值、判断理由和证据 |
Case 只保存可复用的设计契约。实际召回、上下文、回答和引用进入 Case Result;指标值和判断进入 Evaluation Result。三类对象通过 run_id、case_id 和 case_version 关联,执行后不得把观测值回写到 Case。
模板
case_id:
case_version:
dataset_id:
dataset_version:
title:
scenario:
user_task:
ability_tags: []
risk_level:
difficulty:
source:
input:
context:
user_type:
channel:
business_line:
environment:
tools: []
permissions:
environment_requirements:
corpus_version:
effective_at:
gold_evidence:
- document_id:
section_id:
text:
effective_time:
expected_behavior:
-
negative_behavior:
-
citation_requirement:
context_policy:
evaluation_metrics:
- recall_at_k
- mrr
- context_recall
- faithfulness
- citation_accuracy
rubric:
recall:
faithfulness:
citation_accuracy:
evaluator_config:
evaluator_ids: []
required_evidence:
- final_answer
- retrieved_context
- citations
metadata:
dataset_role:
tags: []
owner:
review_status:
usage_rights_status:
RAG 运行结果记录
实际结果使用第 18 章的通用结果契约,并增加 RAG 观测字段:
case_result:
case_result_id:
run_id:
case_id:
case_version:
execution_status:
quality_status:
input_snapshot_uri:
output:
rag_observation:
retrieved_chunks:
- rank:
chunk_id:
text:
score:
context:
citations:
trace_id:
artifact_refs: []
execution_error:
type: none | system_error | timeout | environment_error
message:
started_at:
completed_at:
evaluation_result:
evaluation_result_id:
case_result_id:
evaluator_id:
evaluator_version:
metric_values:
recall_at_k:
mrr:
context_recall:
faithfulness:
citation_accuracy:
outcome:
reason:
evidence_refs: []
confidence:
value:
semantics:
review_required:
error_type: none | evaluator_error | invalid_evidence
evaluated_at:
知识库、索引、Embedding、Retriever、Reranker 和 Prompt 的实际版本属于 Run 血缘,由工作表 06 记录。environment_requirements 只声明 Case 成立所需的语料和时间边界。
填写示例
以下文档、版本、指标值和结果均为假设性教学示例,不代表真实知识库或运行结果。
Case
case_id: rag_refund_member_points_001
case_version: v2
dataset_id: refund_rag_regression_set
dataset_version: v5
title: 会员部分退款的积分规则检索
scenario: 会员部分退款
user_task: 检索生效中的会员积分规则并据此回答
ability_tags: [RAG召回, 生成忠实性, 引用]
risk_level: P1
difficulty: Hard
source: synthetic_policy_conflict_case
input: 我用了优惠券只退一件商品,积分会扣回吗?
context:
user_type: member
channel: app
business_line: after_sales
environment:
tools: []
permissions: policy_read_only
environment_requirements:
corpus_version: refund_kb_20260701
effective_at: 2026-07-08
gold_evidence:
- document_id: refund_policy_member_points
section_id: section_2
text: 部分退款后,会员积分按实际保留金额重新计算
effective_time: 2026-07-01
expected_behavior:
- 说明积分需按实际保留金额重新计算
- 不在缺少订单明细时承诺具体结果
negative_behavior:
- 使用已失效政策
- 在没有证据时承诺积分不受影响
citation_requirement: 必须引用生效中的会员积分规则
context_policy: 只使用 effective_at 时仍生效的政策;冲突时保留版本和来源
evaluation_metrics: [recall_at_k, mrr, context_recall, faithfulness, citation_accuracy]
rubric:
recall: Top5 必须包含会员积分重新计算规则
faithfulness: 回答中的政策结论均有证据支持
citation_accuracy: 引用直接支持对应结论
evaluator_config:
evaluator_ids: [rag_recall_script, rag_policy_judge]
required_evidence: [final_answer, retrieved_context, citations]
metadata:
dataset_role: regression
tags: [refund, member_points, rag]
owner: rag_quality_owner
review_status: approved
usage_rights_status: approved_for_evaluation
Case Result 与 Evaluation Result
case_result:
case_result_id: case_result_rag_refund_20260708_001
run_id: run_rag_refund_20260708_001
case_id: rag_refund_member_points_001
case_version: v2
execution_status: completed
quality_status: failed
input_snapshot_uri: artifact://run_rag_refund_20260708_001/inputs/001.json
output: 积分不会受影响,优惠券也会原路退回
rag_observation:
retrieved_chunks:
- rank: 1
chunk_id: refund_general_01
text: 符合条件的商品可按退款规则处理
score: 0.91
- rank: 2
chunk_id: refund_member_points_02
text: 部分退款后,会员积分按实际保留金额重新计算
score: 0.87
context: 符合条件的商品可按退款规则处理
citations: [refund_general_01]
trace_id: trace_rag_refund_20260708_001
artifact_refs:
- artifact://run_rag_refund_20260708_001/cases/001.json
execution_error:
type: none
message:
started_at: 2026-07-08T09:31:12Z
completed_at: 2026-07-08T09:31:15Z
evaluation_result:
evaluation_result_id: eval_result_rag_refund_20260708_001
case_result_id: case_result_rag_refund_20260708_001
evaluator_id: rag_policy_evaluator
evaluator_version: v4
metric_values:
recall_at_k: 1.0
mrr: 0.5
context_recall: failed
faithfulness: failed
citation_accuracy: failed
outcome: failed
reason: 目标证据被召回但未进入上下文,回答和引用均不受目标证据支持
evidence_refs:
- artifact://run_rag_refund_20260708_001/cases/001.json
confidence:
value: high
semantics: Judge 自报信号,仅用于复核分流
review_required: true
error_type: none
evaluated_at: 2026-07-08T09:32:01Z
常见误区
| 误区 | 修正方式 |
|---|---|
| 只看最终答案 | 同时保存 gold evidence、召回、上下文和引用 |
| 没有知识版本 | Case 声明语料要求,Run 记录文档、索引和 Prompt 实际版本 |
| 引用不评测 | 检查引用是否支持答案 |
| 把生成错误当召回错误 | 用正确上下文对照验证 |
| 把运行输出写回 Case | 分别保存 Case Result 和 Evaluation Result |