前言
本页导航
企业推进 LLM 与 Agent 落地时,常会遇到这样一类场景:
团队完成了一个客服 Agent,接口全通、标准问答准确、Demo 演示流畅,于是进入灰度。上线后却出现退款政策误答、越权查询订单、工具调用失败后编造承诺、多轮对话状态丢失等问题。所有人都在问:为什么测试全绿,线上仍会失效?
因为传统软件测试常用的五个前提——确定性、可断言性、稳定性、可分解性、可观测性——在 AI 系统中不再总能成立。同样的输入可能产生不同输出,开放问题未必有唯一标准答案,模型、Prompt 和知识库会持续变化;一个错误回答背后还可能有检索、工具、Prompt、编排和业务规则等多层因素共同作用。最终答案即使表达自然,也可能缺少事实依据。
很多团队的第一反应是“多写点测试用例”或“找个 Judge 打个分”。但很快他们会发现:跑了一堆公开 Benchmark,不知道业务场景能不能上线;写了 Judge Prompt,发现 Judge 偏好长回答且看不出工具参数错误;有了评测报告,发布时还是靠人拍板;线上出了问题,不知道该改模型、改 Prompt、改知识库还是改编排。
AI 评测不只是跑分,也不是对传统测试的简单延伸。它是在传统工程测试底座之上,面向企业 LLM/Agent 系统建立的质量基础设施:从业务目标出发,拆解风险场景,设计指标树,构建评测数据,实现规则、脚本、Judge 与人评的混合评估,自动化执行并记录版本血缘,通过门禁支持发布决策,在线上监控中持续回流 Bad Case,完成根因归因后反哺 Prompt、RAG、工具、Agent 架构和训练数据,再进入下一轮回归。
这是一个完整的闭环,而不是某个工具或某份报告。
这本书为什么存在
关于大模型的学习材料已经很多,常见主题包括模型原理、Prompt Engineering、RAG 实践,以及评测论文、Benchmark 和指标综述。这些内容各有价值,但不足以单独回答企业生产环境中的质量决策问题。
当一个 Agent 准备进入生产环境,团队还需要回答:怎么定义“可以上线”?怎么证明这个版本比上个版本更适合发布?出了问题怎么定位到具体失效层?怎么让评测结果进入系统迭代和发布决策,而不只停留在报告里?
这本书就是为回答这些问题而写的。
这本书讲什么,不讲什么
本书覆盖
- 企业级 AI 评测的完整闭环:从业务目标到指标树、数据集、Evaluator、平台、门禁、线上监控、归因优化
- LLM、RAG、Tool Call、Memory、Workflow、Agent 的分层评测对象模型
- 如何设计可信的 Eval Case、Rubric、LLM-as-Judge 和人工校准流程
- Agent 轨迹级评测:不只看最终结果,还要看过程、工具调用、状态变化和副作用
- EvalOps 平台的核心对象模型、版本血缘、可复现执行和 CI/CD 集成
- Bad Case 分层归因方法:如何把“模型不行”拆解为可修复的具体根因
- 安全红队、垂类适配和组织级评测成熟度模型
本书不覆盖
- Transformer 原理、训练细节或算法推导(评测人需要理解失效模式,但不需要成为训练专家)
- 某个具体开源框架的使用教程(工具会过时,方法论不会)
- 人工标注平台操作手册(讲数据资产原则,不讲平台按钮在哪)
- 如何从零开发一个 Agent(讲如何评测和治理 Agent,不讲如何搭 Demo)
这本书写给谁
- AI 评测工程师 / 质量负责人:你会系统地学会如何从零建设企业级评测体系,而不只是跑 Benchmark 和写 Judge。
- EvalOps / LLMOps 平台工程师:你会理解评测平台应该管理哪些对象、如何保证可复现、如何把评测接入发布流程。
- LLM / Agent 应用工程师:你会理解你的系统会在哪些环节失效、评测如何发现这些问题、如何根据评测结果优化而非盲目调参。
- AI 产品负责人 / 技术管理者:你会学会如何把“效果好”拆成可决策的指标和门禁,如何组织跨团队质量协作,如何判断团队评测成熟度。
- 从传统测试转向 AI 质量的资深工程师:你会看到传统测试在 AI 时代哪里失效、什么需要保留、什么需要重建。
如何使用这本书
书前有“读者指南”,会按不同角色给出阅读路径建议。如果你是第一次系统接触 AI 评测,建议按顺序读完前四章,它们建立全书的认知框架——为什么传统测试不够、企业评测解决什么问题、如何在不确定性下做可信决策、完整闭环长什么样。之后可以根据工作需要跳读特定章节。
每章都围绕一个明确的企业质量问题展开,并以贯穿全书的假设性企业客服 Agent 作为主案例。全书的可操作内容分为三层:正文负责解释问题和方法;章内交付物沉淀可复用的清单、决策表与方法卡;书后的项目工作表提供可填写的实施载体。术语表、端到端案例和工具与 Benchmark 参考用于伴读和核对,不承担新的主线论证。在线版的“阅读路径”只为带着具体任务而来的读者提供选读导航,不改变纸书的篇章顺序。
一个邀请
AI 评测是一个快速演进的领域。这本书提供的是一套可操作、可审查的方法框架,而不是适用于所有组织的标准答案。具体指标、阈值和控制要求仍需根据业务风险、证据和适用制度确定。如果你在实践中发现更好的方法,或者遇到书中尚未覆盖的场景,欢迎交流。
构建可信赖的 AI 系统,需要评测成为基础设施,而不是事后补救。希望这本书能帮你少走一些弯路。
——作者 2026 年 7 月