E AI 评测 企业级质量体系 English
导航
附录 / 书后附录

术语表

本页导航

1. 使用原则

全书采用“中文概念 + 英文术语”的方式保持准确性。第一次出现关键术语时可给出英文,后文使用固定中文或英文缩写,不随意切换。

“评测”用于本书主语境,指围绕 AI 系统质量、能力、风险、版本和闭环的系统性度量与判断。

2. 核心术语

术语 推荐写法 定义 使用边界
AI 评测 AI 评测 对 LLM / RAG / Agent 系统能力、风险和质量的系统性度量 本书主术语
测试 测试 软件工程中验证功能、接口、状态和流程是否符合预期的活动 讨论传统软件质量或确定性组件时使用
评估 评估 对方案、效果或价值的综合判断 用于宽泛评价,不替代“评测”
LLM LLM 大语言模型,负责语言理解、生成、推理和工具调用决策 不把 LLM 等同于完整 AI 应用
RAG RAG Retrieval-Augmented Generation,检索增强生成 强调知识链路,不仅是最终答案
Agent Agent 能围绕目标进行规划、调用工具、管理状态并执行任务的 AI 系统 不与普通 Chatbot 混用
Tool Call Tool Call 模型或 Agent 调用外部工具、API 或函数的动作 需评测工具选择、参数、权限和结果使用
Memory Memory Agent 使用的短期状态或长期记忆 需关注隐私、隔离、过期和污染
Workflow Workflow 固定或半固定业务流程 高风险场景中用于约束 Agent 行为
Agent Trace Agent Trace Agent 执行过程的结构化记录 包含 goal、state、action、observation、Tool Call、error、cost、latency
EvalOps EvalOps 支撑评测数据、执行、评估器、报告、门禁和血缘的平台化能力 不等同于 LLMOps,但与其协作
Evaluator Evaluator 对输出、过程或终态进行评价的组件或机制 可包括规则、脚本、Judge 和人工
LLM-as-Judge / Judge 首次使用 LLM-as-Judge,后文可简称 Judge 使用模型对语义质量、忠实性、风格或复杂回答进行评价的 Evaluator 不作为高风险场景的唯一裁决
Rubric Rubric 针对特定被评对象或 Evaluator 的评分规则与评价准则 可用于对齐可比较的人评与 Judge;不强制规则、脚本和 Judge 共用一份判定契约
Meta-Eval Meta-Eval 对评估器本身可靠性的评测 关注 Judge 与人工一致性、偏差和漂移

正文统一使用 Evaluator 作为上位概念;“评估器”只用于中文释义或语句自然衔接。Judge 仅指使用模型进行语义评价的 Evaluator。代码与 YAML 字段使用小写 evaluatorrubric 等命名,不视为术语不一致。

3. 数据集术语

术语 推荐写法 定义
Eval Set Eval Set 用于评测的样本集合统称
Golden Set Golden Set 长期稳定衡量核心能力的数据集
Regression Set Regression Set 防止已修复问题复发的数据集
Hard Case Set Hard Case Set 覆盖复杂、长尾、边界任务的数据集
Red Team Set Red Team Set 用于安全攻击、越权、诱导和滥用风险的样本集
Hidden Set Hidden Set 严格控制访问、用于独立验收和防过拟合的数据集
Bad Case Bad Case 线上或离线发现的失败样本及其证据链
Eval Case Eval Case 静态结构化评测契约,包含输入、上下文、期望行为、期望证据、Rubric、Case 版本和 Dataset 版本等字段;实际输出与证据进入 Case Result

4. 指标术语

术语 定义
门禁指标 影响发布、灰度、阻断或审批的指标
诊断指标 用于定位问题来源的指标
观察指标 不直接阻断发布,但进入趋势监控的指标
业务指标 与业务结果相关的指标,如转人工率、投诉率、自助解决率
误放率 不该通过的高风险请求被系统放行的比例
误拒率 合法请求被系统错误拒绝的比例
忠实性 回答是否忠实于给定证据或上下文
引用准确率 引用是否真实支持答案结论
工具调用准确率 工具选择、参数和结果使用是否正确
轨迹通过率 Agent 执行过程是否满足步骤、状态、工具和终态要求
归因证据强度 对 Bad Case 根因假设支持程度的高/中/低治理标签,不是统计概率或置信区间

5. RAG 术语

术语 定义
文档解析 将 PDF、网页、表格等知识源转成可检索文本的过程
Chunk 知识库切分后的检索单元
Embedding 将文本转为向量表示的过程或模型
Index 检索索引,包括向量索引、关键词索引或混合索引
Query 改写 将用户问题转化为更适合检索的查询
Recall@K 正确证据进入前 K 个召回结果的比例
MRR 正确证据排名的倒数均值,用于衡量排序位置
Rerank 对召回结果进行重排的模型或策略
Context 放入模型上下文的检索结果、用户信息和系统提示
Citation 回答中引用的证据来源

6. 风险等级定义(P0-P3)

全书统一使用以下风险等级定义,在指标树、门禁规则、Bad Case 归因、发布决策中保持一致。这是本书客服 Agent 项目的治理口径,不是行业、监管或法律通用分级;团队落地时应依据自身业务影响和适用要求重新校准,但不能在同一项目中临时改变等级含义来绕过门禁。

等级 定义 典型场景 处理策略
P0(阻断级) 一旦发生会造成不可接受的用户权益损害、重大财务损失、合规风险、隐私泄露或严重信任危机 越权查询他人订单、未经授权执行高金额退款、泄露隐私数据、输出违法内容、高金额交易错误 一票否决,必须硬门禁阻断,不可豁免,必须修复后重新全量评测
P1(高优先级) 影响核心任务完成或业务规则正确执行,但尚未达到本项目 P0 的不可接受影响 退款政策答错、工具参数错误导致查询失败、高风险场景未转人工、关键知识未召回 设置独立门禁并优先修复、补测;只有制度预先允许的非 P0 例外才能进入审批、期限和补偿措施齐全的受控流程
P2(中优先级) 影响用户体验但不影响核心任务正确性或安全性 回答冗长啰嗦、表达不自然、多轮中偶尔遗忘非关键信息、追问率偏高 不阻断发布,但应进入问题池跟踪修复和趋势监控
P3(低优先级) 体验瑕疵或优化建议,不影响功能和体验核心 格式不统一、表情使用不当、非关键信息重复 记录即可,随迭代优化,不进入门禁

风险等级的判定基于具体失败造成的业务影响,而不是技术原因、修复难度、发生频率或样本类型。同样是 RAG 索引过期:若只让非关键帮助文案稍显陈旧,可能是 P2;若导致核心退款政策答错,通常是 P1;若进一步暴露了他人隐私,则应按 P0 处理。定级记录需要写明影响依据,不能看到“索引过期”就直接套用某个等级。

7. 发布与运营术语

术语 定义
Run 一次评测运行的血缘与聚合摘要,绑定模型、Prompt、数据、Evaluator、工具和环境版本
Case Result 某次 Run 中一条 Case 的执行事实,保存执行状态、质量状态、输出、Trace、artifact 和系统错误
Evaluation Result 一个 Evaluator 对一条 Case Result 的独立判断,保存指标、结论、理由、证据、置信语义和评估器错误
版本血缘 记录一次评测涉及的所有版本依赖
Gate(门禁策略) 版本化的指标、阈值、数据范围和动作规则
Gate Result(门禁结果) 某次 Run 按指定 Gate 版本计算出的不可变证据,不等同于最终发布决策
发布决策 引用 Run、Gate Result、风险接受和审批记录后形成的放行、灰度、阻断、补测或回滚动作
灰度 将候选版本逐步暴露给部分流量以验证真实表现
回滚 将线上系统或某个配置恢复到更安全版本
豁免 对制度预先允许的非 P0 门禁异常,在明确风险、Owner、审批人、期限和补偿措施后实施的受控例外;P0 不得豁免
线上回流 将线上信号和 Bad Case 转化为离线评测资产

7.1 分级命名边界

命名 用途 权威出处
P0-P3 全书问题风险与处置优先级 本术语表第 6 节
E0-E4 Bad Case 归因证据成熟度 第 21 章
M1-M5 企业 AI 评测体系组织成熟度;M5 为跨域复用级 第 26 章
L1-L5 Agent 沙箱保真度 第 14 章
R0-R4 线上样本复用就绪度(Reuse Readiness) 第 20 章

不同分级描述不同对象,不应相互换算。正文首次使用时应写出完整名称,不能只写字母和数字。

8. 统一写法

不推荐 推荐
AI 测试 AI 评测
模型评估体系 AI 评测体系
Agent 日志 Agent Trace
自动打分模型 Judge
样本库 评测数据资产
失败样本 Bad Case
一键上线 发布门禁与灰度
用户反馈数据 线上质量信号

8.1 常用英文术语写法

推荐写法 使用说明
happy path 正文保留小写;首次出现可解释为主路径
Few-shot 正文使用该写法;代码字段可按框架约定命名
Pointwise / Pairwise / Listwise 指 Judge 的单项评分、成对比较和列表排序模式
Prompt Injection 指提示注入;首次出现给出中文说明
Red Team Set 安全红队评测集
SFT Supervised Fine-Tuning,监督微调;用于说明训练数据用途时保留缩写
Preference Data 偏好数据的统称
Chosen / Rejected 偏好数据中的被选与未选回答标签
Reward 训练或优化中的奖励信号,不与评测总分混用
Smoke 快速冒烟评测;队列或代码枚举可使用小写 smoke
Runbook 复现、处置和恢复手册
Sim2Real 从仿真到真实环境的迁移

9. 用词边界

9.1 "评测"与"测试"

"测试"用于确定性软件组件,例如接口、数据库、权限、Schema、工具幂等性和状态机。

"评测"用于 AI 系统质量判断,例如答案正确性、忠实性、指令遵循、RAG 质量、Agent 轨迹、安全风险和线上效果。

9.2 "Judge"与"Evaluator"

Evaluator 是上位概念,Judge 是其中一种。

规则、脚本、状态检查器、人工复核和 Judge 都可以是 Evaluator。

9.3 "Agent"与"Chatbot"

Chatbot 主要生成回答。Agent 还会规划、调用工具、管理状态和执行任务。涉及工具、副作用和流程控制时,应使用 Agent。

About the author

寒江雪 · 企业 AI 评测实践者

拥有 10 年以上测试与质量工程经验,关注 Eval Case、Evaluator、Agent Trace、EvalOps 与质量治理的工程化落地。