E AI 评测 企业级质量体系 English
导航

Read

全书目录

书籍主线由书前导读、六篇 26 章正文和书后内容组成。阅读路径只提供在线选读导航;项目工作表承接章内方法;伴读参考用于术语核对和观察完整案例,不另建一条内容主线。

从前言开始
书前

为什么写、写给谁、如何读

  1. 导读前言7 个小节
  2. 导读读者指南:如何使用本书4 个小节
01

第一篇:重新定义 AI 评测问题

  1. 01 为什么仅靠传统测试无法保障 AI 质量 20 个小节
  2. 02 企业级 AI 评测到底在解决什么问题 21 个小节
  3. 03 AI 评测的核心悖论与可信原则 20 个小节
  4. 04 企业级评测闭环全景图 17 个小节
02

第二篇:理解被评系统

  1. 05 Agent 应用的分层评测对象模型 17 个小节
  2. 06 LLM 能力边界与失效模式 16 个小节
  3. 07 RAG 与知识链路评测 20 个小节
  4. 08 Agent 组件与编排评测 20 个小节
03

第三篇:设计可信评测方案

  1. 09 从业务目标到风险场景和指标树 32 个小节
  2. 10 评测类型全景与组合策略 20 个小节
  3. 11 评测数据资产建设 42 个小节
  4. 12 Eval Case Schema 与样本设计 24 个小节
  5. 13 Evaluator 设计:规则、脚本、Judge 与人工 33 个小节
  6. 14 Agent 轨迹级评测方法论 30 个小节
  7. 15 可信评测:统计、Meta-Eval 与体系质量 28 个小节
  8. 16 成本、延迟与规模化评测 23 个小节
04

第四篇:建设 EvalOps 平台

  1. 17 EvalOps 平台对象模型与架构 27 个小节
  2. 18 自动化执行、版本血缘与可复现 20 个小节
  3. 19 CI/CD 集成、发布门禁与灰度 28 个小节
  4. 20 线上监控、质量看板与多角色报告 28 个小节
05

第五篇:从评测走向改进闭环

  1. 21 Bad Case 分类与根因归因 26 个小节
  2. 22 从评测结果到系统优化闭环 30 个小节
  3. 23 评测结果如何反哺后训练与数据生产 28 个小节
06

第六篇:安全、垂类与组织化

  1. 24 安全红队与合规证据链 27 个小节
  2. 25 垂类评测方法论与行业案例 24 个小节
  3. 26 成熟度模型、团队能力与路线图 26 个小节
书后

术语表与后记

  1. 附录术语表14 个小节
  2. 附录后记3 个小节
选读

按角色与任务选择阅读顺序

  1. 指南阅读路径不计入正文篇章
工作表

随章使用的 11 份项目工作表

  1. 工作表业务目标到指标树模板业务目标拆解
  2. 工作表Eval Case Schema 模板样本设计
  3. 工作表RAG Eval Case 模板样本设计
  4. 工作表Evaluator Rubric 模板评估器设计
  5. 工作表Agent Trace Schema 模板Agent 过程评测
  6. 工作表评测 Run 血缘模板自动化执行
  7. 工作表发布门禁规则模板发布决策
  8. 工作表线上质量报告模板线上运营
  9. 工作表Bad Case 归因模板归因修复
  10. 工作表修复验证与防复发模板归因修复
  11. 工作表红队样本与合规证据链模板安全合规
伴读

案例与时效性参考资料

  1. 参考案例设定:企业客服 Agent18 个小节
  2. 参考工具生态与 Benchmark 参考5 个小节
  3. 参考端到端案例:退款政策误答闭环11 个小节