OpenAI披露协同模型蒸馏攻击及三项修复措施
OpenAI官方文章披露一次协同模型蒸馏攻击,攻击者通过正常模型交互尝试提取受保护推理,未涉及破解加密或入侵用户对话数据库。修复包括阻断加密推理重放、拦截可能泄露推理的流式输出以及加强账户监测。研发团队若支持可携带...
OpenAI 官方文章《Disrupting a coordinated model distillation campaign》披露了一次协同模型蒸馏攻击。攻击者利用正常的模型交互尝试提取受保护推理,而不是破解加密或入侵用户对话数据库。这次事件将推理泄露的路径从传统的存储层扩展到了模型交互本身。
相关修复措施覆盖三个层面。一是阻断加密推理重放,这提示跨会话重放可能被用于重复提交同一推理请求,从而绕过单次交互的保护。二是拦截可能泄露推理的流式输出,说明部分响应在逐 token 输出时可能暴露中间推理内容。三是加强账户监测,从行为层面识别异常的交互或蒸馏活动。
文章特别提到,若研发团队支持可携带推理工件,应复核跨用户、工作区和模型的隔离边界。这意味着可携带的推理产物可能成为多租户环境中的薄弱点,让攻击者有机会在不同身份或模型实例之间搬运受保护推理。但官方并未说明这种工件的具体形式、支持范围或实现方式。
对于工程团队,这些修复方向对应了几个需要检查的位置。流式输出路径是否可能泄露中间推理,账户监测规则是否能发现高频或结构化的蒸馏行为,以及会话管理中对推理重放的防护是否足够。文章没有提供受影响模型、时间、规模或攻击者身份等细节,因此无法判断这些修复是否已经全部部署,还是仅为官方建议。
目前披露的信息集中在防御思路和需要复核的隔离边界上。对于实现细节,例如加密推理重放的具体阻断机制、流式输出的拦截算法、账户监测的指标与阈值,OpenAI 都没有展开。相关团队在参考时需要结合自身系统的推理缓存、会话 token 管理和流式传输实现做进一步评估。

