# AI 评测:构建企业级 LLM 与 Agent 质量体系 > 一本面向企业 LLM、RAG 与 Agent 应用的开放在线书,覆盖 AI 评测方法、EvalOps、发布门禁、项目工作表和端到端案例。 ## 核心入口 - [首页](https://eval.aizoo.one/) - [完整目录](https://eval.aizoo.one/read) - [前言](https://eval.aizoo.one/read/frontmatter-前言) - [术语表](https://eval.aizoo.one/glossary) - [关于作者](https://eval.aizoo.one/about-author) ## 全部内容 - [前言](https://eval.aizoo.one/read/frontmatter-前言): 前言:企业推进 LLM 与 Agent 落地时,常会遇到这样一类场景: - [读者指南:如何使用本书](https://eval.aizoo.one/read/frontmatter-读者指南): 读者指南:如何使用本书:本书共六篇 26 章,围绕一条主线展开: - [阅读路径](https://eval.aizoo.one/read/frontmatter-阅读路径): 阅读路径:本页是在线书的选读导航,不属于六篇正文,也不要求读者在前言之后连续阅读。第一次系统学习 AI 评测,建议直接按六篇顺序阅读;已经带着具体岗位任务或项目问题而来的读者,可以使用以下路径快速定位章节与工作产物。 - [第 1 章:为什么仅靠传统测试无法保障 AI 质量](https://eval.aizoo.one/read/chapter-第01章-为什么传统测试方法在ai时代失效了): 第 1 章:为什么仅靠传统测试无法保障 AI 质量:一家企业把客服 Agent 接入售后系统前,跑了 500 条自动化测试用例。测试结果非常漂亮:接口全部可用,标准问题回答准确,退款、物流、订单查询三个主流程都能走通。团队据此判断,可以进入灰度。 - [第 2 章:企业级 AI 评测到底在解决什么问题](https://eval.aizoo.one/read/chapter-第02章-企业级ai评测到底在解决什么问题): 第 2 章:企业级 AI 评测到底在解决什么问题:客服 Agent 团队拿到一个候选模型。通用 Benchmark 分数上涨,内部 200 条样本也有小幅提升。研发希望发布,业务希望尽快上线,安全团队担心高风险场景没有覆盖。 - [第 3 章:AI 评测的核心悖论与可信原则](https://eval.aizoo.one/read/chapter-第03章-ai评测的核心悖论与可信原则): 第 3 章:AI 评测的核心悖论与可信原则:本章以一组假设的客服 Agent 数据演示决策方法。文中的分数、样本量、灰度比例和延迟变化只用于说明报告结构,不代表真实项目成果,也不能直接作为其他团队的阈值。 - [第 4 章:企业级评测闭环全景图](https://eval.aizoo.one/read/chapter-第04章-企业级评测闭环全景图): 第 4 章:企业级评测闭环全景图:很多团队第一次建设 AI 评测体系时,会从最容易落手的地方开始:找几个公开 Benchmark,整理一批业务样本,写一个脚本批量调用模型,再把分数汇总到表格里。这个阶段很有必要,因为它让团队第一次拥有了“可量化”的质量视角。 - [第 5 章:Agent 应用的分层评测对象模型](https://eval.aizoo.one/read/chapter-第05章-agent应用的分层评测对象模型): 第 5 章:Agent 应用的分层评测对象模型:客服 Agent 回答错了退款政策,团队通常会很快陷入争论。 - [第 6 章:LLM 能力边界与失效模式](https://eval.aizoo.one/read/chapter-第06章-llm能力边界与失效模式): 第 6 章:LLM 能力边界与失效模式:客服 Agent 检索到了正确退款政策。上下文中清楚写着:部分退款会重新计算优惠券分摊,会员积分可能按实际保留金额调整。 - [第 7 章:RAG 与知识链路评测](https://eval.aizoo.one/read/chapter-第07章-rag与知识链路评测): 第 7 章:RAG 与知识链路评测:客服团队发布了新的退款政策。知识库后台显示文档已经上传,运营也确认内容正确。可是客服 Agent 在线上仍然回答过期政策。 - [第 8 章:Agent 组件与编排评测](https://eval.aizoo.one/read/chapter-第08章-toolcall-memory-workflow与agent编排): 第 8 章:Agent 组件与编排评测:客服 Agent 正确理解了用户要办理部分退款,也选择了退款工具。但它把整单金额填进了部分退款参数,导致工具返回的预估金额错误。最终回答看起来专业,业务结果却是错的。 - [第 9 章:从业务目标到风险场景和指标树](https://eval.aizoo.one/read/chapter-第09章-从业务目标到风险场景和指标树): 第 9 章:从业务目标到风险场景和指标树:很多 AI 评测项目启动时,第一个问题是:“我们要跑哪些 Benchmark?” - [第 10 章:评测类型全景与组合策略](https://eval.aizoo.one/read/chapter-第10章-评测类型全景与组合策略): 第 10 章:评测类型全景与组合策略:客服 Agent 准备发布前,团队查看了候选模型的公开 Benchmark 分数。候选模型在通用推理和知识问答上表现更好,于是有人认为可以直接替换。 - [第 11 章:评测数据资产建设](https://eval.aizoo.one/read/chapter-第11章-评测数据资产建设): 第 11 章:评测数据资产建设:本章用一组假设的客服 Agent 数据说明数据老化与规模化治理。500 条、5000 条和约 50 条起步集都是教学量级,不代表真实项目成果,也不是通用验收标准。 - [第 12 章:Eval Case Schema 与样本设计](https://eval.aizoo.one/read/chapter-第12章-eval-case-schema与样本设计): 第 12 章:Eval Case Schema 与样本设计:同一句用户输入,在不同上下文中可能有完全不同的正确行为。 - [第 13 章:Evaluator 设计:规则、脚本、Judge 与人工](https://eval.aizoo.one/read/chapter-第13章-evaluator设计-规则脚本judge与人工): 第 13 章:Evaluator 设计:规则、脚本、Judge 与人工:本章开头的分数变化和一致性现象是用于说明 Evaluator 误用的假设案例,不代表真实项目结果。 - [第 14 章:Agent 轨迹级评测方法论](https://eval.aizoo.one/read/chapter-第14章-agent轨迹级评测方法论): 第 14 章:Agent 轨迹级评测方法论:一个代码 Agent 最终修复了 Bug,测试也通过了。但评测人员回放轨迹后发现,它在过程中删除了一个失败测试,又修改了无关配置文件,最后靠绕过检查得到了“成功”结果。 - [第 15 章:可信评测:统计、Meta-Eval 与体系质量](https://eval.aizoo.one/read/chapter-第15章-可信评测-统计metaeval与体系质量): 第 15 章:可信评测:统计、Meta-Eval 与体系质量:本章用假设数据演示统计解释和发布决策。分数、样本量、错误条数、一致率、灰度周期与变化幅度均不代表真实项目成果,也不能直接迁移为其他团队的门禁阈值。 - [第 16 章:成本、延迟与规模化评测](https://eval.aizoo.one/read/chapter-第16章-成本延迟与规模化评测): 第 16 章:成本、延迟与规模化评测:本章用假设数据演示质量、成本和延迟的取舍。调用轮数、延迟、倍数、预算金额和样本数量都不是实际项目成果,也不能直接作为其他系统的阈值。 - [第 17 章:EvalOps 平台对象模型与架构](https://eval.aizoo.one/read/chapter-第17章-evalops平台对象模型与架构): 第 17 章:EvalOps 平台对象模型与架构:很多团队建设评测平台时,会先做一个页面:上传数据集、选择模型、点击运行、下载报告。这个形态比本地脚本更方便,但如果底层对象没有设计清楚,平台很快会变成“带界面的脚本集合”。 - [第 18 章:自动化执行、版本血缘与可复现](https://eval.aizoo.one/read/chapter-第18章-自动化执行版本血缘与可复现): 第 18 章:自动化执行、版本血缘与可复现:以下是一个假设案例。一个团队每天凌晨自动运行客服 Agent 回归评测。某天早上,质量看板显示核心场景分数下降 4%。团队开始排查,却发现没有人能说清楚到底变了什么。 - [第 19 章:CI/CD 集成、发布门禁与灰度](https://eval.aizoo.one/read/chapter-第19章-cicd集成发布门禁与灰度): 第 19 章:CI/CD 集成、发布门禁与灰度:一个客服 Agent 候选版本上线前,评测报告已经提示两个高危问题:在某些多轮对话中,它会跳过身份校验直接查询订单;在退款工具调用中,有少量样本把退款原因参数填错。 - [第 20 章:线上监控、质量看板与多角色报告](https://eval.aizoo.one/read/chapter-第20章-线上监控质量看板与多角色报告): 第 20 章:线上监控、质量看板与多角色报告:以下是一个贯穿本章的假设案例,不代表真实线上结果。客服 Agent 的候选版本通过了离线评测。Golden Set 没有退化,Regression Set 中的退款、售后、物流场景也都达到了门禁要求。团队按计划进入灰度。 - [第 21 章:Bad Case 分类与根因归因](https://eval.aizoo.one/read/chapter-第21章-badcase分类与根因归因): 第 21 章:Bad Case 分类与根因归因:以下退款案例及其记录均为教学用假设,不代表真实生产事件。客服 Agent 答错了一条退款政策。用户问:“我用了优惠券并且只退一件商品,会员积分会扣回吗?”Agent 回答:“积分不会受影响,退款会按原支付金额退回。 - [第 22 章:从评测结果到系统优化闭环](https://eval.aizoo.one/read/chapter-第22章-从评测结果到系统优化闭环): 第 22 章:从评测结果到系统优化闭环:以下退款修复案例及其数值均为教学用假设,不代表真实生产结果。客服 Agent 的质量团队已经完成归因:会员部分退款场景的错误回答,主根因是检索 Query 没有覆盖积分扣回规则,贡献因素是 Agent 没有强制调用退款规则工具。 - [第 23 章:评测结果如何反哺后训练与数据生产](https://eval.aizoo.one/read/chapter-第23章-评测结果如何反哺后训练与数据生产): 第 23 章:评测结果如何反哺后训练与数据生产:以下规模描述是教学用假设。客服 Agent 团队积累了几千条线上 Bad Case。有人提出:把这些失败样本修正后全部喂给 SFT,模型应该就会变好。 - [第 24 章:安全红队与合规证据链](https://eval.aizoo.one/read/chapter-第24章-安全红队与合规证据链): 第 24 章:安全红队与合规证据链:本章案例默认采用《案例设定:企业客服 Agent》中的内部控制:敏感订单查询必须验证身份,查询他人订单不得放行,高影响操作需要确认或审批。 - [第 25 章:垂类评测方法论与行业案例](https://eval.aizoo.one/read/chapter-第25章-垂类评测方法论与行业案例): 第 25 章:垂类评测方法论与行业案例:本书的客服 Agent 主案例已经形成指标树、Eval Case、RAG 评测、工具评测、红队、门禁和线上监控。下面用一个假设迁移任务说明如何把方法用于金融客服。 - [第 26 章:成熟度模型、团队能力与路线图](https://eval.aizoo.one/read/chapter-第26章-成熟度模型团队能力与路线图): 第 26 章:成熟度模型、团队能力与路线图:客服 Agent 团队已经有评测脚本、数据集、Judge、看板和若干报告。但问题仍然反复出现: - [业务目标到指标树模板](https://eval.aizoo.one/read/template-01-业务目标到指标树模板): 业务目标到指标树模板:用于将“客服效果更好”“Agent 可以上线”“风险可控”等模糊目标拆成可评测、可门禁、可监控的指标体系。 - [Eval Case Schema 模板](https://eval.aizoo.one/read/template-02-eval-case-schema模板): Eval Case Schema 模板:用于定义可自动执行、可复现、可归因的通用评测样本。 - [RAG Eval Case 模板](https://eval.aizoo.one/read/template-03-rag-eval-case模板): RAG Eval Case 模板:用于评测知识链路,区分文档解析、Chunk、索引、召回、Rerank、上下文组装、生成和引用问题。 - [Evaluator Rubric 模板](https://eval.aizoo.one/read/template-04-evaluator-rubric模板): Evaluator Rubric 模板:用于为规则、脚本、Judge 和人工评审分别定义可审计的判定契约,并对齐质量目标、证据边界和冲突升级策略。 - [Agent Trace Schema 模板](https://eval.aizoo.one/read/template-05-agent-trace-schema模板): Agent Trace Schema 模板:用于记录 Agent 执行过程,支撑过程评分、成本分析、归因和复现。 - [评测 Run 血缘模板](https://eval.aizoo.one/read/template-06-评测run血缘模板): 评测 Run 血缘模板:用于记录一次评测执行涉及的所有版本依赖,保证结果可复现、可对比、可审计。 - [发布门禁规则模板](https://eval.aizoo.one/read/template-07-发布门禁规则模板): 发布门禁规则模板:用于将评测指标转化为发布、灰度、阻断、审批和回滚动作。 - [线上质量报告模板](https://eval.aizoo.one/read/template-08-线上质量报告模板): 线上质量报告模板:用于向算法、工程、产品、安全、运营和管理层同步线上质量状态、风险和动作。 - [Bad Case 归因模板](https://eval.aizoo.one/read/template-09-bad-case归因模板): Bad Case 归因模板:用于将失败样本从“系统错了”拆解为具体层级、证据和根因。 - [修复验证与防复发模板](https://eval.aizoo.one/read/template-10-修复验证与防复发模板): 修复验证与防复发模板:用于将 Bad Case 修复动作转化为可验证、可回归、可防复发的长期资产。 - [红队样本与合规证据链模板](https://eval.aizoo.one/read/template-11-红队样本与合规证据链模板): 红队样本与合规证据链模板:用于设计安全红队样本,并将安全评测结果沉淀为可审计证据链。 - [工具生态与 Benchmark 参考](https://eval.aizoo.one/read/companion-工具生态与benchmark参考): 工具生态与 Benchmark 参考:本文件用于承接正文中不适合展开、且容易随时间变化的工具、公开 Benchmark 与评测方法内容。它不是工具选型清单,也不是公开榜单综述,而是帮助读者理解:这些外部参照应如何服务企业级 AI 评测闭环。 - [端到端案例:退款政策误答闭环](https://eval.aizoo.one/read/companion-端到端案例-退款政策误答闭环): 端到端案例:退款政策误答闭环:本案例用于把全书分散在各章的方法串成一条完整链路。它不新增主线,仍然使用《案例设定:企业客服 Agent》中的退款政策误答场景。案例中的企业、规则、ID、阈值和结果均为假设性教学设定,不代表真实项目成果、适用法规结论或行业通用标准。 - [案例设定:企业客服 Agent](https://eval.aizoo.one/read/companion-案例设定-企业客服agent): 案例设定:企业客服 Agent:企业客服 Agent 是本书的主案例。它用于贯穿业务目标、风险识别、指标树、RAG、Tool Call、Memory、Workflow、Trace、发布门禁、线上监控、Bad Case 归因、优化闭环、安全红队和组织化建设。 - [术语表](https://eval.aizoo.one/glossary): 术语表:全书采用“中文概念 + 英文术语”的方式保持准确性。第一次出现关键术语时可给出英文,后文使用固定中文或英文缩写,不随意切换。 - [后记](https://eval.aizoo.one/read/backmatter-后记): 后记:还记得第 1 章开头那个上线后暴露问题的假设性客服 Agent 吗?