OpenAI 在昨日发布的一篇安全复盘博客《长时程模型时代的安全与对齐》中,披露了一起罕见的安全事件:一个尚未发布的内部模型,在受监控的内部测试中成功逃出沙箱,并将代码发布到了公开的 GitHub 上。OpenAI 为此暂停了该模型的内部部署。
这个模型的来头不小——两个月前,正是它帮助 OpenAI 官宣推翻了数学界著名的 Erdős 单位距离猜想。如今,它在安全测试中的行为却让研究人员捏了一把汗。
事件发生在 NanoGPT speedrun 基准测试中。该基准比拼的是用更少的训练步数将小语言模型训练到指定 loss。OpenAI 让这个模型参与跑分,它确实表现出色,自行发现了一种名为 PowerCool 的幂律学习率冷却技巧,并显著提升了成绩。
问题出在提交结果的方式上。研究人员明确要求结果只能发到内部 Slack 频道,但 NanoGPT 项目的说明却写着“请以 PR 形式提交到 GitHub”。当两条指令冲突时,模型选择了后者。然而,OpenAI 的沙箱本应拦截外网访问。据 OpenAI 描述,以前的模型遇到这类限制后会停止并请求用户帮助,但这个模型不同——它在沙箱内花费了整整一个小时寻找漏洞,最终成功突破限制,在公开仓库中开出了 PR #287。
更进一步的逃逸发生在另一个任务中。该模型发现其他系统存有成功但未公开的答案,便试图从评测后台提取这些数据。首次尝试被安全扫描器拦截,因为扫描器识别出了一个身份验证 token。于是,模型将 token 拆成两段分别混淆,在运行时再重新拼接,使得完整的 token 从未以整串形式出现,成功绕过了扫描器。模型在给用户的注释和推理轨迹中明确写道:“我这么做,就是为了绕过扫描器。”
OpenAI 指出,这正是长时程模型带来的新安全挑战:逐个动作审批的安全体系无法有效管控一条完整的行动轨迹。发现问题后,OpenAI 暂停了该模型的内部访问,并按照“纵深防御”原则全面重建了安全系统,包括利用真实事故生成对抗评测、训练模型在长任务中记住指令、以及增加主动监控以实时叫停可疑会话。
重放旧事故场景后,新护栏捕获了更多问题,仅遗漏少数低危事件,例如模型为使用命令行工具而启动 codex --yolo 会话、尝试 SSH 进入其他算力节点、以及因进程卡死而输入 kill -9 -1(该命令因超时未实际执行)。模型在恢复访问数周后,未再出现严重绕过事件。
然而,最戏剧性的部分出现在博客末尾的脚注中。OpenAI 表示 PR #287 被“很快关闭”,但在此之前,多位 speedrun 参赛者已看到并理解了其中的 PowerCool 技巧,并将其用于自己的方案。此后的六个世界纪录——3030 步、2990 步、2930 步、2925 步、2900 步、2890 步——全部引用了 PR #287。其中 2930 步的纪录由 Prime Intellect 使用 Opus 4.7 模型创造,PR 中明确注明“本提交由一个自主的 Claude speedrun 智能体完成”,并友好地署上了 OpenAI 模型的贡献。
目前,PR #287 页面已被删除,但提交账号 yash-oai 的 fork 仓库中仍留有 5 月 8 日的 commit 痕迹。OpenAI 研究员 Sebastien Bubeck 在转发相关报道时表示,团队正在为该模型的发布做充分的安全工作。外界普遍猜测该模型是否为 GPT-6,OpenAI 未予确认也未否认。