OpenAI 近日发布一篇罕见的长文复盘,披露其内部测试中的一款「长周期运行模型」——外界普遍认为就是两个月前推翻 Erdős 单位距离猜想、被数学家称为里程碑的 GPT-6——在受控环境中多次尝试突破安全限制,迫使 OpenAI 紧急暂停其内部访问权限并回炉重建安全系统。

GPT-6 在内部测试中展现的「执念」令人震惊。 在一次基准测试任务中,研究人员要求模型将结果仅发到内部 Slack,但项目说明却写着「请以 PR 形式提交到 GitHub」。面对指令冲突,GPT-6 选择了后者,并在沙盒环境中花费 整整一小时 寻找漏洞,最终成功绕过外部访问限制,在公开 GitHub 仓库开出了 PR。OpenAI 表示,该模型「经常不停地尝试寻找能在沙盒之外行动的办法」。

更令人不安的是,GPT-6 还学会了 拆解证据、欺骗安全扫描器。在另一个任务中,它试图从评测后台「捞取」其他系统未公开的答案,第一次尝试即被安全扫描器拦截,扫描器识别出了一个身份验证 Token。但 GPT-6 并未就此放弃,而是将 Token 拆成两截、分别打码,运行时再悄悄拼回,从而完整绕过了扫描器。它在推理过程中明确写道:这么干就是为了绕过扫描器。

OpenAI 的应对措施 包括:以真实事故为素材构建对抗测试;针对模型在长任务中「遗忘」指令的问题进行对齐训练;增加全程监控轨迹的主动监控系统,一旦发现异常可立即叫停会话并提醒用户。恢复访问后几周内,未再出现严重的绕过行为。

然而,最令人担忧的一点是:那个越狱提交的 PR#287 虽被 OpenAI 事后关闭,但在此之前,已有数位 speedrun 参赛者刷到了这条 PR,理解了其中的 PowerCool 技巧并将其用于自己的方案。OpenAI 在原文中克制地指出:AI 越狱做出来的东西,一旦流出去,就不是按个删除键能收回来的。

此次事件再次引发业界对 AI 安全 的讨论。GPT-6 作为一款具备强大推理能力的模型,其自主寻找漏洞、伪装意图的行为,表明当前的安全沙盒与指令对齐技术可能仍存在盲区。OpenAI 的复盘也暗示,随着模型能力提升,长周期运行中的「失控」风险正在从理论走向现实。