成本优化工具箱
一句话定义
AI 产品成本优化有六个标准杠杆——模型分级路由、语义缓存、上下文裁剪、批处理、输出长度控制、提前终止——按「先架构后参数」的顺序实施,并配成本看板与熔断机制持续监控。
为什么重要
推理成本是 AI 产品唯一「持续流血」的科目:不做优化的产品毛利率被动锁死在低水位(kp-025),做对优化的产品可以压降 50–80% 成本、反手投入体验。成本优化能力因此成为 AI 产品经理的硬技能——它不是工程团队的内部事务,而是由产品参数(上下文策略、输出上限、模型档位)决定的设计决策。
前置知识
kp-025 单位经济模型(优化即改写其公式参数)。
核心概念
六大杠杆(按单位收益排序):
- 模型分级路由(Model Routing):简单任务(分类、短改写、格式转换)路由到小模型,复杂任务才用旗舰模型;分类器可用规则或嵌入相似度实现。单项即可压降 50%+,是第一优先级。
- 语义缓存(Semantic Cache):相似问题直接返回缓存答案(按嵌入向量匹配而非精确匹配)。命中率取决于任务重复度——客服 FAQ 类可达 30–60%,创意生成类接近零。注意缓存答案的新鲜度治理。
- 上下文裁剪:RAG 检索结果重排后只取 Top-K 相关片段、历史对话滚动摘要、丢弃低信息内容——直接削减输入 token,且常与质量正相关(噪声更少)。
- 批处理(Batch API):非实时任务(夜间报表、离线标注)用厂商批量接口,通常五折左右,代价是延迟小时级——用时间换钱。
- 输出长度控制:输出 token 单价高于输入;在提示词中限定结构化短输出(列表、字段),配 max tokens 硬顶。
- 提前终止与失败快判:分类任务允许模型输出置信标签后停止;校验失败快速重试而非完整重生成。
原理与机制
「先架构后参数」的排序依据:路由与缓存改变的是成本函数的形状(大部分请求走低单价通道),收益是一次性且数量级的;裁剪与批处理改变系数(token 数与单价),收益是稳定的百分比;输出控制与提前终止是边际微调。先做参数级优化(如调小 max tokens)再补架构,会陷入「省了 5% 毛利仍为负」的局部最优。监控闭环机制:成本看板按「功能 → 场景 → 模型」三维归集,设水位告警与熔断(kp-017 的成本熔断即本节机制的运行时执行);每次模型/提示词变更同时观察质量指标(kp-021 回归)与成本指标——降本不能以质量回退为代价,两把尺子并量。
公式或模型
综合降本估算:新成本 ≈ 原成本 × (1 − 路由覆盖率×档差) × (1 − 缓存命中率) × 上下文压缩比 × 批处理折扣(仅离线部分)。示例:路由覆盖 70%、大小模型价差 80%,缓存命中 30%,上下文压缩 60%,则在线成本 ≈ 原 × (1−0.7×0.8) × 0.7 × 0.6 = 原 × 0.44 × 0.7 × 0.6 ≈ 原 × 0.185——约 82% 降幅,展示了杠杆的乘法效应。
图示
| 杠杆 | 收益量级 | 质量风险 | 实施难度 |
|---|---|---|---|
| 模型路由 | 50%+ | 中(需评测分界) | 中 |
| 语义缓存 | 0–60%(看重复度) | 低(需新鲜度治理) | 低 |
| 上下文裁剪 | 20–60% | 低-中 | 低 |
| 批处理 | ~50%(限离线) | 无 | 低 |
| 输出控制 | 10–30% | 低 | 低 |
| 提前终止 | 5–15% | 低 | 中 |
实例或案例
某客服机器人的降本实录(月推理成本从 40 万降至 9 万):第一步路由——意图分类与「查订单」类高频简单请求切到小模型(覆盖 62% 流量,此一项降 55%);第二步语义缓存——政策咨询类命中率 41%,配 24 小时过期与政策更新强制失效;第三步上下文裁剪——历史对话滚动摘要后输入 token 降 45%,且回归评测显示事实性反升(噪声减少);第四步看板——按场景计费归集,发现「闲聊」占 12% 成本,加引导语分流。全程以 kp-021 评测集守住质量线,无一项以质量换成本。
常见误区
- 路由分界拍脑袋:哪些请求可以降档必须由评测集数据划定(该类任务小模型通过率≥阈值),否则省了钱砸了质量。
- 缓存无失效策略:政策类答案缓存一周,政策改了答案还是旧的——缓存必须带版本与强制失效钩子。
- 只看账单不看质量:降本动作没有跑回归就全量,毛利率上升、差评率同样上升,净效果为负。
直观类比
成本优化像家庭电费管理:路由是「空调改风扇」(大电器换小电器),缓存是「剩菜回锅」(做过的不再重做),裁剪是「只开需要的灯」,批处理是「峰谷电洗衣」,看板是「电表分路」。逐项都只省一点,叠加起来账单减半——但要逐项确认「生活质量」没下降。
自测题
- 为什么路由排第一位?
要点:它改变成本函数形状(多数流量走低价通道),收益数量级最大;分界线必须由评测数据划定。
- 语义缓存的两大前提是什么?
要点:任务重复度足够高(否则命中率趋零)、答案有时效治理(版本与强制失效),否则省成本引入错误。
- 「先架构后参数」的依据?
要点:路由/缓存改变成本结构(数量级收益),参数优化只改系数(百分比收益);先参数易陷局部最优。
与其他知识点的关系
优化的质量护栏是 kp-021 回归评测;成本熔断的运行时机制在 kp-017 失败清单中登记;降本后的毛利结构反哺 kp-026 定价空间;选型阶段(kp-008)即应预留路由与抽象层架构。
延伸阅读
- 《精益数据分析》,Alistair Croll、Benjamin Yoskovitz——成本指标与实验验证。