什么是 提示词 CI/CD(Prompt CI/CD)?
提示词 CI/CD(Prompt CI/CD)是对影响大模型应用行为的变更进行受控集成、评测、发布、监控和回滚的工程实践。
工作原理
提示词 CI/CD 不把提示词变更视为孤立文本编辑,而是完整行为发布的一部分。发布身份应包含提示词与模板制品、模型修订、解码参数、工具 Schema 与授权策略、检索快照、输出 Schema、评测数据集、评估器和路由策略。持续集成负责验证确定性契约和任务特定离线回归;持续交付把已批准的不可变发布包送入受控灰度或实验,监测生产护栏,并能够恢复完整且兼容的已知良好依赖。离线 Eval 与在线实验提供不同证据,不能压缩为一个分数。
主要特点
- 使用不可变发布清单标识完整行为包
- 在概率评分前运行 Schema、策略、授权和预算等确定性检查
- 通过配对 Case、重复运行和关键风险切片比较基线与候选
- 使用具有代表性的盲化人工标签校准自动 Judge
- 分离离线回归证据与受控在线实验
- 把提示词、模型、工具、检索、Schema 和路由作为兼容发布整体回滚
常见用途
- 阻止不再满足下游 JSON Schema 的发布
- 按任务与风险切片比较模型或提示词候选和已批准基线
- 高影响变更的 Judge 证据不足时强制人工复核
- 使用预先声明的产品指标与安全护栏运行灰度
- 生产回归后恢复不可变的已知良好发布包
示例
loading...
Loading code...常见问题
为什么只有提示词文本版本还不够?
同一文本在模型、解码、工具、检索、Schema 或路由变化后可能产生不同结果。发布身份必须覆盖真正经过评测和部署的完整依赖包。
Prompt CI/CD 离线门禁应该测试什么?
应测试确定性契约、任务质量、已知失败、安全与授权、输出兼容性、延迟和 Token 预算、重复运行方差,以及重要生产切片。
离线 Eval 与 Prompt A/B 测试有什么区别?
离线 Eval 在用户暴露前使用受控数据检查已知契约;A/B 测试在候选通过前置门禁后估计真实流量效果,二者不能互相替代。
LLM-as-Judge 能自动批准提示词发布吗?
经过校准的 Judge 可以提供证据,但高风险或模糊变更仍需要确定性控制,有时还需人工裁决。Judge 自报 Confidence 不是经过校准的正确率。
Prompt CI/CD 回滚需要恢复哪些内容?
应恢复完整已知良好发布身份:提示词、模型修订、参数、工具与策略、检索索引、输出 Schema、解析器和路由配置。