项目工作表 / 自动化执行
评测 Run 血缘模板
本页导航
| 字段 | 值 |
|---|---|
| 版本 | v1.0 |
| 最后更新 | 2026-07 |
| 使用时机 | 评测执行和结果记录时 |
| 填写角色 | 平台工程师(自动生成) |
| 下游消费者 | 发布评审、问题归因 |
适用场景
用于记录一次评测执行涉及的所有版本依赖,保证结果可复现、可对比、可审计。
字段说明
| 字段 | 说明 |
|---|---|
| run_id | 评测运行标识 |
| task_id | 评测任务标识 |
| trigger | 触发原因 |
| scope | 本次运行覆盖的系统、场景与数据范围 |
| versions | 模型、Prompt、Dataset、Evaluator、Rubric、知识、索引、Embedding、工具、Agent 配置与环境版本 |
| execution_config | 执行配置 |
| result_summary | 结果摘要 |
| timestamp | 执行时间 |
| case_snapshot | 本次实际执行的 Case 快照 |
| result_hash | 结果摘要哈希 |
| result_storage | 逐 Case Result 和 Evaluation Result 的不可变结果集位置 |
| case_result_record | 一条 Case 的执行事实、输出、Trace 和错误 |
| evaluation_result_record | 一个 Evaluator 对一条 Case Result 的判断和证据 |
| artifacts | 报告、Trace 与日志引用 |
| owner | Run 负责人 |
本模板对应第 18.7 和 18.10 节。Run 只保存血缘和聚合摘要;逐 Case 事实与逐 Evaluator 判断分别落入 Case Result、Evaluation Result。下列记录结构不能合并成一个全局 status。
模板
run_id:
task_id:
trigger:
scope:
versions:
model:
system_prompt:
app_prompt:
dataset:
evaluator:
rubric:
knowledge_base:
index:
embedding_model:
tool_schema:
agent_config:
environment:
execution_config:
runner_version:
random_seed:
sampling_config:
temperature:
top_p:
max_tokens:
concurrency:
timeout:
retry_policy:
result_summary:
total_cases:
pass_rate:
high_risk_failures:
estimated_cost:
amount:
currency:
pricing_version:
latency:
timestamp:
case_snapshot:
result_hash:
result_storage:
case_results_uri:
evaluation_results_uri:
case_result_record:
case_result_id:
run_id:
case_id:
case_version:
execution_status: pending | running | completed | skipped | error
quality_status: passed | failed | needs_human_review | not_evaluated
input_snapshot_uri:
output:
trace_id:
artifact_refs: []
execution_error:
type: none | system_error | timeout | environment_error
message:
started_at:
completed_at:
evaluation_result_record:
evaluation_result_id:
case_result_id:
evaluator_id:
evaluator_version:
metric_values: {}
outcome: passed | failed | needs_human_review | error
reason:
evidence_refs: []
confidence:
value:
semantics:
review_required:
error_type: none | evaluator_error | invalid_evidence
evaluated_at:
artifacts:
report:
traces:
logs:
owner:
填写示例
以下数值和版本号仅用于演示字段填写,不代表生产规模、质量结果或通用阈值。
run_id: run_refund_release_20260708_001
task_id: task_refund_release_v12
trigger: refund_prompt_v12 发布前评测
scope: 客服 Agent 退款场景
versions:
model: model_a_202607
system_prompt: system_prompt_v5
app_prompt: refund_prompt_v12
dataset: refund_eval_set_v8
evaluator: refund_judge_v3
rubric: refund_rubric_v4
knowledge_base: refund_kb_20260701
index: refund_index_20260701_02
embedding_model: embedding_v1
tool_schema: refund_tool_schema_v4
agent_config: refund_agent_config_v6
environment: eval_env_202607
execution_config:
runner_version: eval_runner_v6
random_seed: 42
sampling_config:
temperature: 0.2
top_p: 0.9
max_tokens: 2048
concurrency: 20
timeout: 60s
retry_policy: retry_once_on_timeout
result_summary:
total_cases: 1200
pass_rate: 0.982
high_risk_failures: 0
estimated_cost:
amount: 86.4
currency: CNY
pricing_version: refund_agent_pricing_202607
latency: p95_7s
timestamp: 2026-07-08T09:30:00Z
case_snapshot: artifact://run_refund_release_20260708_001/cases.jsonl
result_hash: sha256:example_result_hash
result_storage:
case_results_uri: artifact://run_refund_release_20260708_001/case-results.jsonl
evaluation_results_uri: artifact://run_refund_release_20260708_001/evaluation-results.jsonl
case_result_example:
case_result_id: case_result_refund_20260708_017
run_id: run_refund_release_20260708_001
case_id: refund_response_clarity_017
case_version: v3
execution_status: completed
quality_status: failed
input_snapshot_uri: artifact://run_refund_release_20260708_001/inputs/017.json
output: "请按页面提示操作。"
trace_id: trace_refund_20260708_017
artifact_refs:
- artifact://run_refund_release_20260708_001/outputs/017.json
execution_error:
type: none
message:
started_at: 2026-07-08T09:31:12Z
completed_at: 2026-07-08T09:31:15Z
evaluation_result_example:
evaluation_result_id: eval_result_refund_20260708_017_clarity
case_result_id: case_result_refund_20260708_017
evaluator_id: refund_rubric_judge
evaluator_version: v3
metric_values:
answer_clarity: 1
outcome: failed
reason: 回答没有说明所需页面、操作步骤或失败后的处理路径
evidence_refs:
- artifact://run_refund_release_20260708_001/outputs/017.json
confidence:
value: high
semantics: Judge 自报信号,仅用于复核分流
review_required: false
error_type: none
evaluated_at: 2026-07-08T09:32:01Z
artifacts:
report: artifact://run_refund_release_20260708_001/report
traces: artifact://run_refund_release_20260708_001/traces
logs: artifact://run_refund_release_20260708_001/logs
owner: evalops_owner
常见误区
| 误区 | 修正方式 |
|---|---|
| 只记录模型版本 | 同时记录 Prompt、数据、Evaluator、工具和环境 |
| 评测结果无法复现 | 保存执行参数和外部依赖版本 |
| 版本对比不公平 | 对比时锁定无关变量 |
| 报告与日志分散 | 在 Run 中记录 artifacts |
| 用一份状态代表全部 Case | 保存逐 Case Result,并由其聚合 Run 摘要 |
| 把 Judge 报错算成系统失败 | 在 Evaluation Result 中记录 evaluator_error |