数据需求与冷启动方案
一句话定义
数据需求清单定义 AI 产品要跑通所需的四类数据(知识数据、评测数据、微调数据、反馈数据)及其合规要求;冷启动方案则回答「飞轮转起来之前,质量从哪里来」。
为什么重要
大模型时代「没有数据做不了 AI」的说法半对半错:通用能力确实可以用 API 租,但产品专有的知识、评测与反馈数据无人可租,且必须在立项期就规划——评测集要提前建设(kp-021),知识库要提前治理,否则上线日即幻觉日。冷启动质量决定首批用户的去留,直接决定 kp-009 飞轮有没有机会转起来。
前置知识
kp-011 PRD(数据需求从能力规格反推)。
核心概念
- 四类数据清单:①知识数据(RAG 语料:产品文档、政策、FAQ——决定答案的内容正确性);②评测数据(golden set:题目+期望输出或评分标准——决定「多好算好」);③微调数据(指令-输出对,仅当提示词+RAG 达标后仍不满足才引入);④反馈数据(用户采纳、编辑、点踩——决定飞轮转速)。
- 数据合规三问:来源是否授权(爬取与第三方采购的授权链)、内容是否脱敏(个人信息、商业机密)、使用是否超范围(用户数据用于改进模型是否在隐私条款内)。
- 冷启动三级阶梯:第一级,通用模型 + 公开知识 + 强提示词,快速验证场景;第二级,小规模精标 golden set(100–300 条)+ 知识库治理,达到上线门槛;第三级,上线后反馈回流持续喂养飞轮。
- 合成数据的机会与风险:用强模型批量生成训练/评测样本可低成本扩量,但存在分布偏移与「自我循环」(模型生成的数据再训练同一族模型,错误被放大);必须与真实样本按比例混合并抽样人工校验。
原理与机制
为什么四类数据缺一不可且顺序不可乱:知识数据解决「说什么」,评测数据解决「怎么算对」,二者是上线门槛;微调数据解决「说得更像你」,但它会放大知识库的错误,所以在知识治理之前微调是负资产;反馈数据解决「越来越对」,但它的质量依赖前三者建立的用户信任——没人会给糟糕的产品点踩。冷启动三级阶梯本质是把「数据债务」按风险排序偿还:先还「答非所问」(提示词),再还「内容错误」(知识库),再还「风格不准」(微调)。
公式或模型
不适用——清单与流程类内容;评测数据的规模依据见 kp-012 的置信下限逻辑。
图示
| 数据类型 | 作用 | 冷启动来源 | 不做会怎样 |
|---|---|---|---|
| 知识数据 | 内容正确性 | 现有文档治理 | 系统性幻觉 |
| 评测数据 | 定义「好」 | 人工精标+真实 query | 无法验收 |
| 微调数据 | 风格与格式 | 上线后再建 | 早期浪费 |
| 反馈数据 | 飞轮燃料 | 埋点与反馈入口 | 无法迭代 |
实例或案例
某律所「合同审查助手」的数据规划:知识数据——三千份历史合同与内部审查清单,先做脱敏与版本去重(发现 30% 是过期模板,不清掉会教坏模型);评测数据——两位合伙人从真实案件中精选 200 条标注「风险点清单」,作为 golden set;微调数据——明确暂缓,先验证提示词+RAG 上限;反馈数据——律师每次修改 AI 审查意见的 diff 自动回流。冷启动期六周,全部花在知识治理与 golden set 上——这正是产品经理在立项期就该排进计划的数据工程。
常见误区
- 拿埋点数据当训练数据:日志未经清洗与脱敏,直接喂模型既低质又违规。
- 评测集后补:上线后才想起建评测集,导致上线决策无据可依;golden set 应与开发并行启动。
- 合成数据闭环自嗨:全部用模型生成样本训练评测,指标漂亮但真实分布上一崩到底;真实样本必须占底仓。
直观类比
冷启动像新餐厅开业:通用模型是连锁底料包(能开张),知识库是你自己的食材仓(决定味道对不对),golden set 是试菜环节的评分表(决定能不能正式营业),反馈数据是熟客意见本(决定能否常青)。没有食材仓和评分表就开业,宣传再好也只坑第一批客人。
自测题
- 为什么微调数据排在知识治理之后?
要点:微调会放大语料中的错误;知识库未治理时微调等于把错误固化进权重。
- 合成数据的两大风险与对策?
要点:分布偏移与自我循环;对策是与真实样本混合底仓、抽样人工校验、分开评测真实/合成来源。
- 数据合规三问是什么?
要点:来源授权、内容脱敏、使用范围——分别对应版权链、个人信息保护与隐私条款一致性。
与其他知识点的关系
golden set 的建设方法与规模依据在 kp-021 展开;反馈数据的质量指标(采纳率等)在 kp-022 监控;冷启动期的降级预案(信息不足时诚实提示)见 kp-017。
延伸阅读
- 《精益数据分析》,Alistair Croll、Benjamin Yoskovitz——反馈数据如何转化为产品决策。