2026年9月30日,OpenAI披露了一起协同模型蒸馏攻击活动。根据官方说明,最早活动出现在7月第一周,攻击者并未突破加密、入侵数据库或直接访问存储的用户对话,而是通过操纵模型交互,让受保护的推理内容以请求者可见的形式被批量复现。这类行为被定义为对抗性蒸馏:系统性、未经授权地利用一个模型的输出或推理,去训练、复现或改进另一个模型。
攻击链路:从加密推理到跨会话转录
OpenAI观察到的新手法包括:把一个会话中的加密推理内容复制出来,在另一个会话中要求模型解密并转录隐藏的推理内容。独立安全研究人员也通过负责任披露,向OpenAI提交了跨模型和会话压缩相关的漏洞。OpenAI调查后确认这些攻击路径真实存在。
活动时间线显示:7月1日开始,初期量较低;7月24日和25日出现高流量峰值,两天内来自超过4000名用户的16000次请求使用了相关提取模式;进一步调查发现,相关提示模式活动涉及超过15000名用户的集群,到7月28日被完全阻断。OpenAI指出,活动随时间演变,说明对抗性蒸馏是需要分层、自适应防御的 broader 安全挑战。
风险机制:为什么推理提取比输出抄袭更危险
受保护推理是模型处理任务的内部记录。提取它可能暴露最终答案中未包含的信息,并帮助他人复现模型能力。OpenAI评估认为,对抗性蒸馏带来安全与国家安全风险:被提取的推理可用于训练另一个模型,而无需保留原始模型面向用户输出所施加的安全防护。规模化蒸馏还能加速高级能力的转移,且不需要同等安全投入。随着模型在双用途领域能力增强,这种担忧会加剧。OpenAI明确表示,该风险并非其独有,类似技术可能影响其他先进AI系统。
企业防御:分层控制与可落地实践
OpenAI的响应组合包括账号执法、技术控制和合作伙伴协调:封禁或限制欺诈账号,加强注册与基础设施控制,扩大对相关网络的监控;加强跨用户、工作区、组织和模型族的隐藏推理保护;关闭“已持有他人加密推理即可重放并恢复内容”的路径;增加检查以检测并扣留可能暴露推理的流式输出;当相关活动通过第三方服务时,与提供商合作识别和阻断账号;通过Frontier Model Forum和政府信息共享渠道分享发现。
对自建模型服务的企业和开发者,可参考以下工程方向:
- 输出水印与推理链脱敏:对返回内容做结构化过滤,避免内部推理字段直接透出;对必须返回的中间结果做摘要化或延迟披露。
- API滥用检测与行为指纹:监控异常提示模式、跨会话复制加密推理、高频重放等行为;结合用户、IP、设备指纹做聚类。
- 速率限制与配额隔离:对推理类接口设置更严格的速率和并发上限,按工作区、组织维度隔离配额,防止单点批量提取。
- 流式输出检查:在流式返回路径中加入检测与扣留逻辑,避免推理内容在分块传输中泄露。
- 第三方托管部署对齐:合作伙伴托管的部署需要与第一方服务同等级别的保护;工具输出攻击需要检查普通可见文本之外的内容。
OpenAI表示后续将继续改进工具防御、分类器覆盖、模型拒绝,并将相关控制推广到云合作伙伴,重点放在三方面:更强的提取技术防护、更好的协同活动检测与执法、更深入的行业与政府威胁信息共享。
需要区分的是,上述防御建议属于工程分析,并非OpenAI官方逐条列出的实施清单。官方事实仅包括其已部署的缓解措施和后续方向。对企业而言,核心结论是:对抗性蒸馏不是单一漏洞,而是需要持续适配的分层防御问题;推理能力保护必须覆盖第一方与合作伙伴托管部署,并延伸到工具输出等非普通文本通道。