OpenAI 即将推出的 Astra 模型将采用一种名为“循环深度”的推理技术,该技术允许模型在多数推理模型所依赖的顺序思考之外运行。据 The Information 周二报道,这一技术也被称为“不透明循环”,可能使模型的思维链更难被监控,从而引发 AI 安全专家的担忧。

思维链是推理模型在尝试解决问题时生成的逐步步骤记录,尽管其表示并不完美,但仍是监控模型不当行为或失准的重要工具。例如,在 OpenAI 近期出现的“ rogue agent”事件中,思维链记录在分析代理行为原因时发挥了关键作用。而“循环深度”技术让模型采用一种非线性方法,多次循环处理同一查询,留下的可读痕迹更少,从而绕过了传统的思维链记录。

Redwood Research 首席执行官 Buck Shlegeris 在消息传出后发文表示:“我对 Astra 使用不透明循环的报道极为担忧。”他担心如果 OpenAI 进一步推动该技术,可能会大幅增加循环次数,从而彻底摧毁思维链的可监控性。长期关注 AI 安全的 Zvi Mowshowitz 也评论称,可能需要立法来防止 AI 实验室之间的“逐底竞争”,他认为该技术“玩火”,可能破坏 OpenAI 和 Anthropic 一直努力建立的思维链忠实性与可监控性规范。

值得注意的是,Astra 对该技术的使用似乎有限。OpenAI 表示,模型的思维链预计仍可读,并反驳了其将转向“神经语”的说法。OpenAI 首席科学家 Jakub Pachocki 在 X 上强调,公司自首个推理模型起就致力于保留和利用思维链监控,这是当前研究计划的核心目标。他承认所有 AI 模型都会进行一定量的不透明推理,且很少有研究者将思维链日志视为模型推理的直接表示,但这些保留意见并未消除外界的担忧。

The Information 周三上午的后续报道称,Anthropic 和 Google DeepMind 已在讨论这一技术。Redwood Research 首席科学家 Ryan Greenblatt 回应称,不透明推理可能比传统思维链推理更容易扩展,从而将所有推理从可见渠道中移除。他最大的担忧是,自然的发展路径可能涉及将不透明推理扩展到模型完全或几乎完全在潜在空间中推理的程度,他希望现在避免最令人担忧的架构还为时不晚,并希望 OpenAI 能就此止步。

这一事件凸显了 AI 安全领域在模型可解释性与性能提升之间的持续张力。随着推理模型日益复杂,如何在追求能力的同时保持足够的透明度和可控性,已成为行业和监管者共同面临的挑战。