kp-013

Prompt 即接口

进阶约 30 分钟03-需求与规格

在 AI 产品里,提示词(Prompt)是承载产品逻辑的核心接口——它应当像 API 一样被版本管理、变更评审、回归测试与灰度发布,而不是散落在代码里的即兴文本。

前置知识点kp-011
学习状态: 更新于 2026-10-02 · 状态 reviewed

Prompt 即接口

一句话定义

在 AI 产品里,提示词(Prompt)是承载产品逻辑的核心接口——它应当像 API 一样被版本管理、变更评审、回归测试与灰度发布,而不是散落在代码里的即兴文本。

为什么重要

「改一行提示词,转化率翻倍」与「改一行提示词,全线输出崩坏」在 AI 产品里同样常见。提示词决定了模型的角色边界、输出格式与拒答策略,是产品行为真正的「源代码」;用管理代码的纪律管理提示词,是把 AI 产品从「玄学调优」拉回工程轨道的关键一步。

前置知识

kp-011 PRD(示例集是提示词迭代的需求来源)。

核心概念

  • System Prompt 承载四类产品逻辑:角色与语气(品牌人格)、能力边界(只答什么、拒答什么)、输出契约(格式、字段、长度)、安全策略(红线与降级话术)。这四类内容分别来自 PRD 的能力规格、范围章、输出定义与安全章——提示词是 PRD 的机器可执行投影。
  • 结构化输出(JSON Schema)作为机器接口:当输出供程序消费时,要求模型按 schema 返回并做程序校验;校验失败触发重试或降级,而不是把自由文本解析到崩溃。
  • 提示词工程化的五个动作:①抽离——提示词从代码移到配置中心,支持热更新;②版本号——每次变更记录版本、作者、变更理由;③回归——每次变更必须跑 kp-021 的评测集,指标不回退才可发布;④灰度——新旧提示词按流量比例并行(见 kp-022);⑤归档——历史版本与当时的评测结果一并留存,可随时回滚。
  • 上下文组装:生产环境的完整提示词 = 系统提示词 + 检索内容(RAG)+ 用户输入 + 少样本示例,组装顺序与截断策略本身也是需要版本化的产品逻辑。

原理与机制

为什么提示词值得 API 级待遇:指令微调(RLHF 一系工作)使模型行为对提示词高度敏感——措辞、顺序、示例数量都会系统性改变输出分布。这种敏感性意味着提示词变更是「行为变更」而非「文案变更」,其风险量级等同于一次代码发布,因此必须复用软件发布的全部护栏(回归、灰度、回滚)。反过来,敏感性也是资产:提示词迭代是 AI 产品迭代周期最短、成本最低的改进手段,工程化后它成为周级甚至日级的优化引擎——这正是「Prompt 即接口」的双重含义:既是风险源,也是迭代杠杆。

公式或模型

不适用——工程方法类内容;其质量度量依赖 kp-021 的评测指标。

图示

PRD 能力规格 ──→ 系统提示词 v1.3(配置中心) │ 变更 → 评测集回归(kp-021) │ 通过 → 灰度 5% → 50% → 100%(kp-022) └ 回滚 → v1.2 一键切回 输出侧:JSON Schema 校验 → 失败重试 → 仍失败走降级(kp-017)

实例或案例

某电商「商品文案生成」的提示词从 1.0 到 1.3 的演化:v1.0 自由文本散落在三处代码里,无法追溯哪次改动导致合规事故;工程化后 v1.1 增加输出 Schema(title/features/disclaimer 三字段),v1.2 在评测集上发现「极限词」违规率 4%,加入红线清单与拒答改写,v1.3 灰度中采纳率从 61% 升至 68% 后全量。全程每次变更可在十分钟内回滚——这个安全网正是团队敢于高频迭代的前提。

常见误区

  • 提示词越写越长:堆叠补丁式规则会稀释重点、增加 token 成本,且互相冲突;正确做法是定期重构 + 用评测集证明每次精简不回退。
  • 与 RAG 互相打架:系统提示词说「只依据检索内容作答」,示例却示范了自由发挥,模型行为随机——提示词内部要自洽。
  • 把成功案例硬编码为 few-shot:示例过拟合到历史 badcase,反而降低对新分布的泛化;示例选择应随评测集演进。

直观类比

非工程化的提示词像用便利贴给新员工传口头指令,贴得越多越乱;工程化的提示词像一份带版本号的岗位手册:入职培训按手册来,改版要过评审,出了问题能翻回上一版。

自测题

  1. System Prompt 的四类产品逻辑分别对应 PRD 哪些章节?

要点:角色语气←背景与用户、能力边界←MVP 范围、输出契约←输出定义、安全策略←安全合规章。

  1. 为什么提示词变更必须跑回归评测?

要点:模型对措辞高度敏感,行为变更需验证全指标不回退;回归是把主观调优转为工程决策的枢纽。

  1. 程序消费输出时为什么用 JSON Schema 而非自由文本?

要点:可校验、可重试、可降级,把解析失败从运行时事故变为可控分支。

与其他知识点的关系

kp-021 评测集是提示词回归的靶场;kp-022 提供提示词灰度的流量机制;kp-015 的置信度话术往往就写在系统提示词里;kp-025 提醒每次 token 都计价——提示词长度是成本变量。

延伸阅读

  • "Training language models to follow instructions with human feedback"(InstructGPT),Ouyang et al.,2022——指令遵循能力的来源,解释了提示词为何如此有效。

相关知识点