E AI 评测 企业级质量体系 English
导航
项目工作表 / 归因修复

Bad Case 归因模板

本页导航
字段
版本 v1.0
最后更新 2026-07
使用时机 发现失败样本后根因分析时
填写角色 评测工程师+对应组件 Owner
下游消费者 优化团队、回归测试

适用场景

用于将失败样本从“系统错了”拆解为具体层级、证据和根因。

字段说明

字段 说明
bad_case_id Bad Case 记录标识
case_id / case_result_ids 关联静态 Case 和暴露问题的执行结果
error_type 可观察错误现象,不包含技术根因
mechanism_signal 检索、工具、状态或规则执行日志中的待验证信号
risk_level 风险等级
affected_scope 影响范围
tags / status 稳定分类标签与处理状态
evidence 证据链
layer_analysis 分层分析
root_cause 根因
contributing_factors 贡献因素与暴露条件
evidence_strength / evidence_level 归因证据强度与 E0—E4 证据成熟度;均不是统计概率
falsification_check 可能推翻当前结论的反证与尚需验证项
next_action 后续动作

本模板对应第 21.12 节,并使用第 21 章七层根因模型。产品交互是修复手段,不作为第八个归因层。

模板

# Bad Case 归因

## 基本信息

- bad_case_id:
- case_id:
- case_result_ids:
- 场景:
- 风险等级:
- 错误类型:
- 机制信号:
- 影响范围:
- 标签:
- 处理状态:

## 错误现象

- 用户输入:
- Agent 回答:
- 期望行为:
- 可直接观察到的偏差:
- 暂不作根因解释的机制信号:

## 证据链

- 检索结果:
- 上下文:
- 工具调用:
- Agent Trace:
- 版本信息:
- 人工复核:

## 分层归因

| 层级 | 是否相关 | 证据 | 结论 | 证据强度 |
| --- | --- | --- | --- | --- |
| 模型 |  |  |  |  |
| Prompt |  |  |  |  |
| RAG |  |  |  |  |
| Tool |  |  |  |  |
| Agent 编排 |  |  |  |  |
| 系统 |  |  |  |  |
| 业务规则 |  |  |  |  |

## 归因结论

- 主根因:
- 贡献因素:
- 暴露条件:
- 证据强度:
- 证据成熟度:
- 对照验证:
- 反证检查:
- 尚需验证:

## 后续动作

| 动作 | Owner | 验证方式 |
| --- | --- | --- |
|  |  |  |

填写示例

以下归因结论为假设性教学示例;真实项目必须用 Trace、版本对照和必要的反事实验证支持结论。

## 归因结论

- 主根因:RAG Query 未召回会员积分扣回规则
- 贡献因素:Agent 未在金额权益场景强制调用退款规则工具
- 证据强度:高(会诊治理标签,不是概率)
- 证据成熟度:E4
- 对照验证:注入正确政策片段后,模型能给出正确回答
- 反证检查:若原 Query 已稳定召回正确规则,则当前主根因不成立
- 尚需验证:修正 Query 后,同簇样本是否稳定通过

常见误区

误区 修正方式
直接归因到模型 按模型、Prompt、RAG、Tool、Agent、系统和业务规则排查
只看最终回答 保存检索、工具、Trace 和版本
没有证据强度说明 给出高、中、低治理标签及其支持证据
归因后没有动作 转入修复验证和防复发流程
把检索失败直接写成根因 先记为 retrieval_miss,再用索引、Query 和对照实验定位根因

About the author

寒江雪 · 企业 AI 评测实践者

拥有 10 年以上测试与质量工程经验,关注 Eval Case、Evaluator、Agent Trace、EvalOps 与质量治理的工程化落地。