企业级 AI 评测方法论 · 在线书
AI 评测构建企业级 LLM 与 Agent 质量体系
一本系统讲清大模型评测、RAG 评测、Agent 评测与 EvalOps 的中文在线书。从业务风险定义质量,用可复现评测支撑发布决策,并把线上 Bad Case 变成持续优化闭环。
Why this book
AI 评测不是跑 Benchmark,也不是给回答打一个分
企业真正需要回答的是:这个 LLM、RAG 或 Agent 在哪些业务场景可靠,哪些风险必须阻断,为什么候选版本比当前版本更值得上线,以及事故发生后应该修模型、Prompt、知识库、工具还是编排。
本书围绕一条完整质量链路展开:定义业务目标与风险,建立指标树和 Eval Case,设计 Evaluator 与 Agent Trace,记录评测血缘,通过门禁和灰度做发布决策,再让线上监控、根因归因、修复验证和数据回流形成闭环。
Quality system
建设企业 AI 质量体系的六组任务
六组建设任务覆盖完整的 12 环节质量闭环:先定义问题,再建立证据,最终让评测进入发布、运营与持续改进。
定义质量目标与风险边界
从业务目标、用户任务和高风险场景出发,明确什么是合格、什么必须阻断,以及哪些指标真正支持决策。
阅读相关方法 →02分解被评系统与失效链路
按照应用、Agent 编排、工具、RAG 和模型分层评测,避免用一个总分掩盖不同层级的问题。
阅读相关方法 →03设计评测方案与证据资产
建设指标树、Eval Case、数据集和 Evaluator,并组合规则、脚本、模型评审与人工复核。
阅读相关方法 →04保证评测结论可信可复现
通过 Agent Trace、统计检验、Meta-Eval 和版本血缘,说明分数如何产生、差异是否可信、结果能否复核。
阅读相关方法 →05接入发布决策与线上运营
用 EvalOps 管理对象和运行,把关键指标接入发布门禁、灰度策略、线上监控与多角色报告。
阅读相关方法 →06形成归因、修复与治理闭环
把 Bad Case 定位到可执行根因,完成修复验证、回归沉淀,并延伸到安全、垂类和组织能力建设。
阅读相关方法 →Book structure
六篇正文,从问题定义走到组织化能力
第一篇:重新定义 AI 评测问题
第 1 章:为什么仅靠传统测试无法保障 AI 质量 → 第 4 章:企业级评测闭环全景图
02第二篇:理解被评系统
第 5 章:Agent 应用的分层评测对象模型 → 第 8 章:Agent 组件与编排评测
03第三篇:设计可信评测方案
第 9 章:从业务目标到风险场景和指标树 → 第 16 章:成本、延迟与规模化评测
04第四篇:建设 EvalOps 平台
第 17 章:EvalOps 平台对象模型与架构 → 第 20 章:线上监控、质量看板与多角色报告
05第五篇:从评测走向改进闭环
第 21 章:Bad Case 分类与根因归因 → 第 23 章:评测结果如何反哺后训练与数据生产
06第六篇:安全、垂类与组织化
第 24 章:安全红队与合规证据链 → 第 26 章:成熟度模型、团队能力与路线图
Start with a question