OpenAI 发布 Better prompt caching for GPT-6。GPT-6 旨在让持久 Agent 连续数小时处理复杂任务,例如重构代码库、生成研究文档和演示文稿。这类应用会发起一系列相互衔接的 API 请求,常常重复携带相同指令、工具定义和上下文。OpenAI 缓存这些共享上下文,以跨请求复用计算,降低响应时间,并为缓存输入 token 提供最高 90% 折扣。GPT-6 系列的改进包括:默认更高缓存命中率、30 分钟窗口内符合条件共享前缀可获缓存折扣,以及监控、诊断和选择缓存范围的新工具。

一、默认机制与显式断点
官方说明,缓存折扣面向 30 分钟窗口内被复用的 eligible shared prefixes。开发者不必完全依赖自动行为:显式缓存断点(explicit cache breakpoints)允许选择哪些 prompt 前缀复用。刷新后的 prompt caching guide 解释如何使用它们、缓存前缀保持 eligible 的时长,以及工具和输入变化如何影响复用。工程分析:缓存策略从只看命中率转向明确划定稳定前缀。对 Agent 而言,稳定系统指令、工具定义和参考材料通常适合作为可复用前缀,但是否真正稳定应由 Dashboard 和诊断数据判断。

二、用 Dashboard 与诊断定位 miss
新 Prompt Caching Dashboard 显示应用输入中有多少由缓存提供,可跟踪随时间变化的命中率,并用输入构成图比较 cached 与 uncached tokens。这能帮助发现命中率下降,并评估应用变更对缓存表现的影响。出现意外 miss 时,prompt caching diagnostics tool 可比较请求与近期响应,识别模型、工具、设置或输入中哪些变化阻止复用。诊断会估算受影响 token 数,便于评估影响并优化集成。官方示例显示:type 为 cache_miss、reason 为 tools_changed,comparison_reusable_tokens 和 cache_missed_tokens 均为 5629。工程分析:如果 miss 由工具变化触发,应优先检查工具定义、schema 和顺序是否被改动;诊断给出的 token 规模可用于排优先级。

三、不破坏缓存的四类优化
1. 选择缓存内容。用显式断点选择要复用的 prompt 前缀。指南说明 eligible 时长和工具/输入变化的影响。
2. 调整 reasoning effort 而不破坏缓存。GPT-6 模型可在响应之间改变 reasoning effort,同时不破坏缓存。方法是追加 configuration_update,并保持 request-level reasoning effort 不变。这样困难任务可提高 effort,常规跟进可降低 effort,同时保留可复用上下文。
3. 工具与指令变化时保留缓存。让工具定义、schema、顺序保持稳定,使更早上下文仍可复用。只让相关工具可调用,用 allowed_tools;不需要工具时把 tool_choice 设为 none,而不是删除定义。新增指令应通过新的 developer messages 追加到上下文末尾,以覆盖旧指令。官方提供了管理工具变化的 append-only 更新指南。
4. Prewarm 降低延迟。Prewarm 提前准备已知上下文,让请求到达时模型更快开始响应。例如应用可在启动阶段、用户首次提问前,预热共享指令、工具定义或参考材料。这会把处理移出用户等待时间。

四、成本与迁移落地
官方事实是:缓存可降低响应时间,cached input tokens 折扣最高 90%;GPT-6 默认命中率更高;30 分钟窗口决定共享前缀是否 eligible。工程上,成本优化可围绕三点:先以 Dashboard 建立命中率基线;再用 diagnostics 解释每次 miss 的 token 影响;最后把稳定前缀设为显式断点,并采用 append-only 方式更新工具与指令。对长时间运行的 Agent,还应检查 reasoning effort 调整是否用 configuration_update 完成,避免直接改 request-level 设置导致缓存失效。对需要低延迟的交互,可在启动阶段 prewarm 共享上下文。官方还建议使用 Codex 审查代码、应用改进并测量结果。这些控制是可选项,建立在引擎默认性能之上,是否启用取决于工作负载。

从工程视角看,RAG 与长上下文集成也可沿用同一原则:先确认哪些上下文能被稳定复用,再通过诊断数据决定断点位置;动态内容若导致 miss,应根据诊断估算的影响调整集成。GPT-6 的 prompt caching 升级不是单一参数,而是默认命中率、30 分钟窗口、显式断点、诊断工具、reasoning effort 与工具更新策略、prewarm 的组合。落地时,先用可观测性找到 miss 原因,再把稳定上下文沉淀为可复用前缀,才能把最高 90% 的缓存输入折扣转化为实际成本与延迟收益。