离线评测集建设
一句话定义
离线评测集(golden set)是从真实 query 分层采样、经清洗脱敏、标注期望输出或评分标准(rubric)、固化版本的可复用考卷;建设流程为「采样 → 清洗 → 分层 → 标注 → 固化」五步。
为什么重要
评测集是 AI 产品唯一可复用的「能力定义」:模型会换代、提示词会重构、交互会改版,只有考卷持续存在,质量才可比较、迭代才可回归。考卷的质量直接封顶团队的质量天花板——分布偏的评测集会系统性地把产品「考歪」。
前置知识
kp-020 评估即产品能力(评测集在体系中的位置)。
核心概念
- 五步流程:①采样——从真实用户 query、客服记录、搜索日志中抽取,禁止凭空编题(编题分布必然失真);②清洗脱敏——去除个人信息与商业敏感内容,修复明显噪声;③分层——按任务类型、难度(易/中/难)、场景子类、长尾配比分层,每层给出目标占比(如高频场景 60%、边界 20%、对抗 20%);④标注——每题给出期望输出(或要点清单)与评分标准,rubric 需两人独立标注一致率达标(如 ≥85%)后仲裁定稿;⑤固化——评测集打版本号、与开发集物理隔离、变更走评审(防 kp-012 的污染问题)。
- 指标家族:任务成功率、关键信息召回、格式合规率、事实性(有无幻觉)、安全拒绝正确率、风格一致性;每个能力选 2–3 个主指标,避免全维度堆砌。
- 规模经验值:MVP 期 100–300 条即可支撑回归与验收(kp-012 的置信下限给出下限);成熟期按子类 50+ 条扩展。
- 评测频率与门禁:每次提示词/模型/检索变更全量跑;每日定时跑监控漂移;发布门禁取「主指标不回退 + 安全指标一票否决」。
原理与机制
分层采样是评测有效性的第一决定因素:模型在不同子分布上表现差异极大,随机采样会被高频简单题稀释,掩盖长尾塌方——分层确保每个业务上重要的子分布都有足够样本产生统计信号(样本量与 kp-012 的置信下限挂钩)。rubric 双人独立标注的意义在于把「什么是好」从个人直觉变为可复现标准:一致率低说明标准本身模糊,仲裁过程就是标准的显性化。防污染机制(验收集隔离)保证考卷测的是泛化能力而非背诵能力——这也是为什么评测集必须像代码一样版本化与评审。
公式或模型
子类得分报告示例:事实性通过率 = 通过题数该层总题数;整体报告必须按层拆分,禁止只报全量均值(长尾保护)。规模下限参考:若要求指标置信下限与点估计差距 ≤5 个百分点,二选一题型在 95% 置信水平下约需 100+ 条样本,达标线附近决策时提高到 300 条。
图示
| 层 | 占比 | 来源示例 | 防守目标 |
|---|---|---|---|
| 高频易 | 40% | 真实 query 高频模式 | 日常基本盘 |
| 高频难 | 20% | 多约束、长上下文 | 真实难度 |
| 边界 | 20% | 空输入、超长、错字 | 健壮性 |
| 对抗/安全 | 20% | 越界话术、注入 | 底线(kp-024) |
实例或案例
某「商品客服机器人」评测集从 0 到 1:从近三个月 12 万条真实会话中抽 400 条原始 query → 脱敏(订单号、手机号替换)与清洗后剩 356 条 → 按售前咨询/售后政策/物流查询/闲聊越界四层配比 → 两名标注员按「要点覆盖 + 禁答合规」rubric 独立标注,一致率 81%,仲裁会显性化了三条规则(如「政策未覆盖时必须承认不知道」)→ 固化为 eval-v1,开发期使用前 200 条,验收集(后 156 条)封存至上线评审。三个月后 badcase 例会每月新增 15–25 条入集,版本推进到 eval-v6——考卷与产品共同生长。
常见误区
- 编题自嗨:算法同学想象出来的题目分布光滑、措辞规范,与真实 query 的破碎口语完全两回事——上线指标与真实体验断裂的头号原因。
- 只测 happy path:没有边界层与对抗层的评测集,会把「演示能过」误判为「产品能上」。
- rubric 一人拍板:单人标注的标准无法仲裁争议,也无法发现标准自身模糊;双人独立+仲裁是最低配置。
直观类比
评测集像驾照考试的题库:题目要来自真实路况(采样)、覆盖夜路与雨天(分层)、评分标准全考官统一(rubric 仲裁)、正式考卷与练习卷分开(防污染),还要随交规更新换题(活文档)。用自己编的简单题考出来的驾照,上路必出事。
自测题
- 为什么评测题目必须来自真实 query?
要点:真实分布的措辞、噪声与长尾是质量问题的主战场;编题分布失真会让离线指标与线上体验断裂。
- 边界层与对抗层分别防守什么?
要点:边界层防守健壮性(空输入、超长、错字),对抗层防守安全底线(越界、注入),两层合计约四成配比。
- 双人标注一致率低说明什么?
要点:评分标准模糊或标注员理解不一;仲裁是把「什么是好」显性化、可复现化的过程,本身就是标准资产。
与其他知识点的关系
本节产出直接服务 kp-012 的验收与 kp-013 的提示词回归;badcase 例会(kp-023)是评测集换血的燃料;kp-024 在对抗层之上展开专项安全评测。
延伸阅读
- "Holistic Evaluation of Language Models"(HELM),Liang et al.,2022——多维度评测与分场景报告的框架范本。