E AI 评测 企业级质量体系 English
导航

企业级 AI 评测方法论 · 在线书

AI 评测构建企业级 LLM 与 Agent 质量体系

一本系统讲清大模型评测、RAG 评测、Agent 评测与 EvalOps 的中文在线书。从业务风险定义质量,用可复现评测支撑发布决策,并把线上 Bad Case 变成持续优化闭环。

62611 份项目工作表
Enterprise AI Quality Loop12 个关键环节
业务目标风险识别对象分层指标树评测数据Evaluator自动化执行版本决策发布门禁线上监控Bad Case 归因系统与数据优化

Why this book

AI 评测不是跑 Benchmark,也不是给回答打一个分

企业真正需要回答的是:这个 LLM、RAG 或 Agent 在哪些业务场景可靠,哪些风险必须阻断,为什么候选版本比当前版本更值得上线,以及事故发生后应该修模型、Prompt、知识库、工具还是编排。

本书围绕一条完整质量链路展开:定义业务目标与风险,建立指标树和 Eval Case,设计 Evaluator 与 Agent Trace,记录评测血缘,通过门禁和灰度做发布决策,再让线上监控、根因归因、修复验证和数据回流形成闭环。

Quality system

建设企业 AI 质量体系的六组任务

六组建设任务覆盖完整的 12 环节质量闭环:先定义问题,再建立证据,最终让评测进入发布、运营与持续改进。

Book structure

六篇正文,从问题定义走到组织化能力

完整目录 →

Start with a question

你正在解决哪个 AI 质量问题?