kp-021

离线评测集建设

核心约 30 分钟05-质量与评测

离线评测集(golden set)是从真实 query 分层采样、经清洗脱敏、标注期望输出或评分标准(rubric)、固化版本的可复用考卷;建设流程为「采样 → 清洗 → 分层 → 标注 → 固化」五步。

前置知识点kp-020
学习状态: 更新于 2026-10-02 · 状态 reviewed

离线评测集建设

一句话定义

离线评测集(golden set)是从真实 query 分层采样、经清洗脱敏、标注期望输出或评分标准(rubric)、固化版本的可复用考卷;建设流程为「采样 → 清洗 → 分层 → 标注 → 固化」五步。

为什么重要

评测集是 AI 产品唯一可复用的「能力定义」:模型会换代、提示词会重构、交互会改版,只有考卷持续存在,质量才可比较、迭代才可回归。考卷的质量直接封顶团队的质量天花板——分布偏的评测集会系统性地把产品「考歪」。

前置知识

kp-020 评估即产品能力(评测集在体系中的位置)。

核心概念

  • 五步流程:①采样——从真实用户 query、客服记录、搜索日志中抽取,禁止凭空编题(编题分布必然失真);②清洗脱敏——去除个人信息与商业敏感内容,修复明显噪声;③分层——按任务类型、难度(易/中/难)、场景子类、长尾配比分层,每层给出目标占比(如高频场景 60%、边界 20%、对抗 20%);④标注——每题给出期望输出(或要点清单)与评分标准,rubric 需两人独立标注一致率达标(如 ≥85%)后仲裁定稿;⑤固化——评测集打版本号、与开发集物理隔离、变更走评审(防 kp-012 的污染问题)。
  • 指标家族:任务成功率、关键信息召回、格式合规率、事实性(有无幻觉)、安全拒绝正确率、风格一致性;每个能力选 2–3 个主指标,避免全维度堆砌。
  • 规模经验值:MVP 期 100–300 条即可支撑回归与验收(kp-012 的置信下限给出下限);成熟期按子类 50+ 条扩展。
  • 评测频率与门禁:每次提示词/模型/检索变更全量跑;每日定时跑监控漂移;发布门禁取「主指标不回退 + 安全指标一票否决」。

原理与机制

分层采样是评测有效性的第一决定因素:模型在不同子分布上表现差异极大,随机采样会被高频简单题稀释,掩盖长尾塌方——分层确保每个业务上重要的子分布都有足够样本产生统计信号(样本量与 kp-012 的置信下限挂钩)。rubric 双人独立标注的意义在于把「什么是好」从个人直觉变为可复现标准:一致率低说明标准本身模糊,仲裁过程就是标准的显性化。防污染机制(验收集隔离)保证考卷测的是泛化能力而非背诵能力——这也是为什么评测集必须像代码一样版本化与评审。

公式或模型

子类得分报告示例:事实性通过率 = 通过题数该层总题数;整体报告必须按层拆分,禁止只报全量均值(长尾保护)。规模下限参考:若要求指标置信下限与点估计差距 ≤5 个百分点,二选一题型在 95% 置信水平下约需 100+ 条样本,达标线附近决策时提高到 300 条。

图示

层占比来源示例防守目标
高频易40%真实 query 高频模式日常基本盘
高频难20%多约束、长上下文真实难度
边界20%空输入、超长、错字健壮性
对抗/安全20%越界话术、注入底线(kp-024)

实例或案例

某「商品客服机器人」评测集从 0 到 1:从近三个月 12 万条真实会话中抽 400 条原始 query → 脱敏(订单号、手机号替换)与清洗后剩 356 条 → 按售前咨询/售后政策/物流查询/闲聊越界四层配比 → 两名标注员按「要点覆盖 + 禁答合规」rubric 独立标注,一致率 81%,仲裁会显性化了三条规则(如「政策未覆盖时必须承认不知道」)→ 固化为 eval-v1,开发期使用前 200 条,验收集(后 156 条)封存至上线评审。三个月后 badcase 例会每月新增 15–25 条入集,版本推进到 eval-v6——考卷与产品共同生长。

常见误区

  • 编题自嗨:算法同学想象出来的题目分布光滑、措辞规范,与真实 query 的破碎口语完全两回事——上线指标与真实体验断裂的头号原因。
  • 只测 happy path:没有边界层与对抗层的评测集,会把「演示能过」误判为「产品能上」。
  • rubric 一人拍板:单人标注的标准无法仲裁争议,也无法发现标准自身模糊;双人独立+仲裁是最低配置。

直观类比

评测集像驾照考试的题库:题目要来自真实路况(采样)、覆盖夜路与雨天(分层)、评分标准全考官统一(rubric 仲裁)、正式考卷与练习卷分开(防污染),还要随交规更新换题(活文档)。用自己编的简单题考出来的驾照,上路必出事。

自测题

  1. 为什么评测题目必须来自真实 query?

要点:真实分布的措辞、噪声与长尾是质量问题的主战场;编题分布失真会让离线指标与线上体验断裂。

  1. 边界层与对抗层分别防守什么?

要点:边界层防守健壮性(空输入、超长、错字),对抗层防守安全底线(越界、注入),两层合计约四成配比。

  1. 双人标注一致率低说明什么?

要点:评分标准模糊或标注员理解不一;仲裁是把「什么是好」显性化、可复现化的过程,本身就是标准资产。

与其他知识点的关系

本节产出直接服务 kp-012 的验收与 kp-013 的提示词回归;badcase 例会(kp-023)是评测集换血的燃料;kp-024 在对抗层之上展开专项安全评测。

延伸阅读

  • "Holistic Evaluation of Language Models"(HELM),Liang et al.,2022——多维度评测与分场景报告的框架范本。

相关知识点