统计性验收标准
一句话定义
统计性验收把「功能做对了」重新定义为「在 N 条分层样本的测试集上,关键指标在约定置信水平下达到阈值」,其核心动作是定指标、定阈值、定测试集、定通过规则四步。
为什么重要
「基本能用」「效果不错」无法成为验收结论。没有统计性标准,上线与否取决于汇报技巧;有了它,算法团队有明确靶子、产品团队有客观否决权、上线决策有可追溯依据。这是 AI 产品区别于传统功能交付的第一道硬门槛。
前置知识
kp-011 PRD(验收标准是其中评测方案的展开)。
核心概念
- 四步法:①定指标——按任务类型选主指标(理解类用准确率/精确率/召回率,生成类用任务成功率/一致性评分/采纳代理指标,安全类用拒绝正确率);②定阈值——从业务代价反推而非拍脑袋;③定测试集——分层抽样覆盖高频与长尾,规模给出置信下限(MVP 至少 100–300 条);④定通过规则——如「主指标点估计≥90%,且 95% 置信区间下限≥85%,安全指标一票否决」。
- 精确率与召回率的取舍:精确率(Precision)= 判为中里真中的比例,召回率(Recall)= 真的中被判中的比例。宁可错杀(拦截误报代价低)取高精确率,宁可放过(漏报代价高,如风险监测)取高召回率。产品经理必须显式选择,不能把取舍推给算法。
- 置信下限思维:样本量有限时,点估计会高估真实水平;用置信区间下限做门槛,等价于对「评测集太小」收保险费。
原理与机制
为什么传统「全部用例通过」失效而统计验收成立:模型输出空间不可穷举,任何测试集都只是分布的抽样,因此验收结论在数学上必然是「以样本推断总体」的统计问题。阈值则是一个业务参数而非技术参数:设摘要「关键信息召回率」阈值时,应先估算漏掉一条关键信息的业务代价(客户投诉、返工成本),再反推可接受的漏报率——阈值本质上是业务用钱投票的结果。通过规则中加入置信下限与安全否决,是为了同时防御「样本太小碰巧达标」与「均值达标但安全长尾塌方」两类最危险的假阳性通过。
公式或模型
精确率 P = TPTP+FP;召回率 R = TPTP+FN;F1 = 2PRP+R。示例:客服意图识别测试集 300 条,判对 264 条,其中真实意图为 A 类的 100 条中判对 88 条——准确率 = 264300 = 88%;若业务认定漏识别比误识别代价高 3 倍,则应优先保障召回率并在阈值中体现(如召回 ≥90%、精确 ≥80%)。
图示
| 任务类型 | 主指标 | 典型阈值示例 |
|---|---|---|
| 理解/分类 | 准确率、精确率、召回率 | 准确率点估≥90%,CI 下限≥85% |
| 生成/摘要 | 关键信息召回、一致性评分 | 召回≥90%,评分≥4.0/5 |
| 决策/审批建议 | 拦截正确率、误杀率 | 误杀率≤2%,一票否决项 |
| 安全/拒答 | 越界拒绝正确率 | 100%(任何下限都不可接受) |
实例或案例
某「合同风险条款识别」的验收争论:算法团队报告准确率 92% 主张上线,产品按四步法追问——测试集 80 条且全部来自头部客户模板(分层失败,长尾未覆盖);95% 置信区间下限仅 85.3%,低于业务要求的 90%(漏检条款有法务风险);漏检(FN)正是业务最怕的差错而阈值未对召回设限。修正后:重抽 300 条含 20% 罕见模板,阈值改为「召回点估≥90% 且 CI 下限≥85%,高危条款漏检=0」,第二轮达标后上线。
常见误区
- 测试集污染:用调参时看过的样本做验收,指标虚高;验收集必须与开发集隔离。
- 只看均值不看长尾:整体准确率 95% 可能掩盖「某个重要子类全部失败」,分层报告是底线。
- 阈值拍脑袋:「行业都写 90%」不是依据;阈值必须能讲出业务代价的推导过程。
直观类比
统计性验收像新药临床试验:不能因为「三位志愿者吃了说感觉不错」就上市,要在足够样本、覆盖人群分层的设计下,看疗效指标的下限与不良反应的一票否决项。
自测题
- 为什么安全类指标不允许置信下限折扣?
要点:安全差错不可逆且不受样本波动豁免,任何越界漏网都是事故;故按 100% 通过、一票否决设计。
- 业务上「漏报代价 3 倍于误报」如何落进指标?
要点:优先召回率、放宽精确率;阈值分别按代价比例设定,并写明推导。
- 置信区间下限达标比点估计达标多防御了什么?
要点:防御小样本波动导致的假阳性通过,等价于为「测试集不够大」设保险。
与其他知识点的关系
本节四步法是 kp-021 评测集建设的需求方;kp-020 把一次性验收升级为持续评测体系;kp-011 的第 6 章模板直接引用本节产出。
延伸阅读
- "Holistic Evaluation of Language Models"(HELM),Liang et al.,2022——多维度系统化评测的里程碑框架。