读者指南:如何使用本书
本页导航
全书结构
本书共六篇 26 章,围绕一条主线展开:
业务目标 → 风险识别 → 被评对象分层 → 指标树 → 评测数据 → Evaluator / Judge / 人评 → 自动化执行 → 发布门禁 → 线上监控 → Bad Case 归因 → 系统与数据优化 → 回归验证
| 篇章 | 章节 | 核心问题 |
|---|---|---|
| 第一篇:重新定义 AI 评测问题 | 第 1-4 章 | 为什么传统测试失效?企业级评测解决什么?完整闭环长什么样? |
| 第二篇:理解被评系统 | 第 5-8 章 | LLM、RAG、Tool、Memory、Agent 到底应该分层评什么? |
| 第三篇:设计可信评测方案 | 第 9-16 章 | 如何把业务目标变成指标、数据、Evaluator、Trace 与可信结论? |
| 第四篇:建设 EvalOps 平台 | 第 17-20 章 | 如何把评测从脚本和报告升级为持续运行的平台与门禁? |
| 第五篇:从评测走向改进闭环 | 第 21-23 章 | 如何归因 Bad Case,并反哺 Prompt、RAG、Agent 和训练数据? |
| 第六篇:安全、垂类与组织化 | 第 24-26 章 | 如何处理安全合规、垂类适配和组织级成熟度? |
选择阅读方式
第一次系统学习 AI 评测,建议按六篇顺序阅读。已经带着岗位任务或项目问题而来的读者,可以使用在线版的《阅读路径》定位章节。两页分工如下:本页说明全书结构和工作产物;“阅读路径”只提供选读顺序,不再重复解释全书结构。
| 读者角色 | 优先关注 |
|---|---|
| AI 评测工程师 / 质量负责人 | 第 9-16、21-22 章:指标、数据、Evaluator、Trace、可信结论与归因闭环 |
| EvalOps / LLMOps 平台工程师 | 第 12、14、17-20 章:对象模型、版本血缘、执行、门禁与线上信号 |
| LLM / RAG / Agent 工程师 | 第 5-8、14、21-22 章:失效模式、过程证据与系统修复 |
| AI 产品负责人 / 技术管理者 | 第 2、4、9、15、19-20、26 章:目标、风险、决策证据与组织治理 |
| 安全与合规负责人 | 第 3、9-10、19-20、24、26 章:安全控制、门禁与证据链 |
| 从传统测试转向 AI 质量的工程师 | 第 1-5、9-15、17-19 章:保留工程测试底座,并扩展概率行为评测能力 |
如何使用工作产物
本书的可操作内容与正文论证逐层对应,分为三类工作产物:
- 章内交付物:清单、方法卡、决策表和字段契约,用于理解并复核本章方法。
- 项目工作表:书后 11 份可填写载体,用于把方法带入具体项目;字段和阈值是起点,不是行业标准。
- 伴读参考:术语表、端到端案例和工具与 Benchmark 参考,用于核对概念与观察完整闭环,不引入第二条方法主线。
11 份项目工作表如下:
| 项目工作表 | 对应章节 | 用途 |
|---|---|---|
| 业务目标到指标树模板 | 第 9 章 | 将模糊业务目标拆为可评测指标 |
| Eval Case Schema 模板 | 第 12 章 | 设计结构化评测样本 |
| RAG Eval Case 模板 | 第 7 章 | 设计 RAG 专项评测样本 |
| Evaluator Rubric 模板 | 第 13 章 | 设计评分规则和 Judge Prompt |
| Agent Trace Schema 模板 | 第 14 章 | 记录 Agent 执行过程 |
| 评测 Run 血缘模板 | 第 18 章 | 记录评测运行的版本依赖 |
| 发布门禁规则模板 | 第 19 章 | 定义发布准入规则 |
| 线上质量报告模板 | 第 20 章 | 输出多角色质量报告 |
| Bad Case 归因模板 | 第 21 章 | 结构化归因失败根因 |
| 修复验证与防复发模板 | 第 22 章 | 跟踪修复和回归验证 |
| 红队样本与合规证据链模板 | 第 24 章 | 设计安全测试和合规审计 |
建议先读对应章节,再填写项目工作表。工作表中的示例均为假设性教学示例;具体字段、阈值、审批策略和证据要求需要由团队结合业务风险与适用制度确定。
阅读建议
不要跳过第一篇。第 1-4 章建立全书认知框架,直接跳到方法或平台章节容易“知其然不知其所以然”。
跟着客服 Agent 案例走。全书以企业客服 Agent 为主案例,第 8、14、16 章集中使用代码 Agent 做对照,第 18、25 章补充执行环境和行业迁移视角。同一问题会在不同章节进入不同环节,例如“会员部分退款”先成为评测样本,再进入归因和修复;阅读时应关注每次出现新增了什么证据或决策。
边读边做最小闭环。读完前四章后,可以选择一个核心业务场景(例如退款、查询或下单),建立一组能覆盖关键风险的起始 Eval Set,设计基础指标,配置一个简单的 Evaluator,再跑一次版本对比。样本规模应由风险、场景分层和结论所需证据决定,而不是套用固定数量。
关注“反模式”和“为什么”。这本书不仅讲“怎么做”,也花大量篇幅讲“不要怎么做”和“为什么这样做”。AI 评测领域还在快速演进,理解底层原则比记住具体工具更重要。
术语表放在手边。书后有术语表,遇到 Eval Set、Rubric、Trace、Meta-Eval 等术语时可以快速查阅。