E AI 评测 企业级质量体系 English
导航
导读 / 书前导读

读者指南:如何使用本书

本页导航

全书结构

本书共六篇 26 章,围绕一条主线展开:

业务目标 → 风险识别 → 被评对象分层 → 指标树 → 评测数据 → Evaluator / Judge / 人评 → 自动化执行 → 发布门禁 → 线上监控 → Bad Case 归因 → 系统与数据优化 → 回归验证

篇章 章节 核心问题
第一篇:重新定义 AI 评测问题 第 1-4 章 为什么传统测试失效?企业级评测解决什么?完整闭环长什么样?
第二篇:理解被评系统 第 5-8 章 LLM、RAG、Tool、Memory、Agent 到底应该分层评什么?
第三篇:设计可信评测方案 第 9-16 章 如何把业务目标变成指标、数据、Evaluator、Trace 与可信结论?
第四篇:建设 EvalOps 平台 第 17-20 章 如何把评测从脚本和报告升级为持续运行的平台与门禁?
第五篇:从评测走向改进闭环 第 21-23 章 如何归因 Bad Case,并反哺 Prompt、RAG、Agent 和训练数据?
第六篇:安全、垂类与组织化 第 24-26 章 如何处理安全合规、垂类适配和组织级成熟度?

选择阅读方式

第一次系统学习 AI 评测,建议按六篇顺序阅读。已经带着岗位任务或项目问题而来的读者,可以使用在线版的《阅读路径》定位章节。两页分工如下:本页说明全书结构和工作产物;“阅读路径”只提供选读顺序,不再重复解释全书结构。

读者角色 优先关注
AI 评测工程师 / 质量负责人 第 9-16、21-22 章:指标、数据、Evaluator、Trace、可信结论与归因闭环
EvalOps / LLMOps 平台工程师 第 12、14、17-20 章:对象模型、版本血缘、执行、门禁与线上信号
LLM / RAG / Agent 工程师 第 5-8、14、21-22 章:失效模式、过程证据与系统修复
AI 产品负责人 / 技术管理者 第 2、4、9、15、19-20、26 章:目标、风险、决策证据与组织治理
安全与合规负责人 第 3、9-10、19-20、24、26 章:安全控制、门禁与证据链
从传统测试转向 AI 质量的工程师 第 1-5、9-15、17-19 章:保留工程测试底座,并扩展概率行为评测能力

如何使用工作产物

本书的可操作内容与正文论证逐层对应,分为三类工作产物:

  1. 章内交付物:清单、方法卡、决策表和字段契约,用于理解并复核本章方法。
  2. 项目工作表:书后 11 份可填写载体,用于把方法带入具体项目;字段和阈值是起点,不是行业标准。
  3. 伴读参考:术语表、端到端案例和工具与 Benchmark 参考,用于核对概念与观察完整闭环,不引入第二条方法主线。

11 份项目工作表如下:

项目工作表 对应章节 用途
业务目标到指标树模板 第 9 章 将模糊业务目标拆为可评测指标
Eval Case Schema 模板 第 12 章 设计结构化评测样本
RAG Eval Case 模板 第 7 章 设计 RAG 专项评测样本
Evaluator Rubric 模板 第 13 章 设计评分规则和 Judge Prompt
Agent Trace Schema 模板 第 14 章 记录 Agent 执行过程
评测 Run 血缘模板 第 18 章 记录评测运行的版本依赖
发布门禁规则模板 第 19 章 定义发布准入规则
线上质量报告模板 第 20 章 输出多角色质量报告
Bad Case 归因模板 第 21 章 结构化归因失败根因
修复验证与防复发模板 第 22 章 跟踪修复和回归验证
红队样本与合规证据链模板 第 24 章 设计安全测试和合规审计

建议先读对应章节,再填写项目工作表。工作表中的示例均为假设性教学示例;具体字段、阈值、审批策略和证据要求需要由团队结合业务风险与适用制度确定。

阅读建议

  1. 不要跳过第一篇。第 1-4 章建立全书认知框架,直接跳到方法或平台章节容易“知其然不知其所以然”。

  2. 跟着客服 Agent 案例走。全书以企业客服 Agent 为主案例,第 8、14、16 章集中使用代码 Agent 做对照,第 18、25 章补充执行环境和行业迁移视角。同一问题会在不同章节进入不同环节,例如“会员部分退款”先成为评测样本,再进入归因和修复;阅读时应关注每次出现新增了什么证据或决策。

  3. 边读边做最小闭环。读完前四章后,可以选择一个核心业务场景(例如退款、查询或下单),建立一组能覆盖关键风险的起始 Eval Set,设计基础指标,配置一个简单的 Evaluator,再跑一次版本对比。样本规模应由风险、场景分层和结论所需证据决定,而不是套用固定数量。

  4. 关注“反模式”和“为什么”。这本书不仅讲“怎么做”,也花大量篇幅讲“不要怎么做”和“为什么这样做”。AI 评测领域还在快速演进,理解底层原则比记住具体工具更重要。

  5. 术语表放在手边。书后有术语表,遇到 Eval Set、Rubric、Trace、Meta-Eval 等术语时可以快速查阅。

About the author

寒江雪 · 企业 AI 评测实践者

拥有 10 年以上测试与质量工程经验,关注 Eval Case、Evaluator、Agent Trace、EvalOps 与质量治理的工程化落地。