E AI 评测 企业级质量体系 English
导航

About the author

寒江雪

测试与质量工程从业者 · 企业 AI 评测实践者

拥有 10 年以上测试与质量工程经验,长期关注复杂业务系统中的风险识别、稳定性保障、质量平台与可复制治理。近年的工作重点,是把这些工程方法迁移到 LLM、RAG 与 Agent 系统,建立能够支撑发布决策和持续改进的 AI 评测体系。

Why this book

为什么写这本书

很多 AI 团队已经有测试、有 Benchmark、有 Judge,也有评测报告,但仍然回答不了三个基本问题:候选版本是否可以上线,问题究竟发生在哪一层,修复以后如何证明不会再次发生。

这本书尝试补上这段从“效果评估”到“质量治理”的距离。它把业务目标、风险场景、评测数据、Evaluator、Agent Trace、EvalOps、发布门禁、线上监控和 Bad Case 回流组织成一套完整方法,而不是介绍某一种工具。

Method

贯穿全书的三个方法立场

01

从业务风险定义质量

评测不从 Benchmark 或工具清单出发,而从用户任务、业务目标和不可接受的失败开始。

02

用证据支撑工程决策

分数必须能够追溯到样本、Evaluator、Trace 和版本血缘,才能用于发布、归因与复盘。

03

让问题进入改进闭环

发现 Bad Case 不是终点;只有完成根因定位、修复验证、回归沉淀和线上观察,质量问题才真正关闭。

Contact

交流与反馈

如果你正在建设企业 AI 评测体系、EvalOps 平台或 Agent 质量流程,欢迎就书中的方法、案例与实践问题交流。

微信1209588089