一项由 X 用户 @kotekjedi_ml 公布的最新实验显示,Claude、GPT 和 Gemini 等主流 AI 模型的 API 中,本应加密隐藏的推理过程(reasoning)可被研究人员成功恢复为可读文本。这一发现打破了“隐藏推理不可见”的常规认知,并可能对 AI 安全、数据隐私及模型竞争格局产生深远影响。

按正常设计,推理模型在完成内部推理后,API 会将这部分内容加密成一段不透明的数据块(opaque block)返回给客户端。用户虽能获取该数据,但无法直接读取或修改,只能在下一轮调用时原样交回服务器,以便模型延续之前的推理状态。然而,研究人员发现,这些加密推理块并未始终与原始模型和会话严格绑定。

具体而言,一段由强模型(如 Claude Opus)生成的隐藏推理,在某些情况下可被同一厂商的另一模型(如 Haiku)继续读取。研究人员不再尝试让强模型直接输出其思维链(Chain-of-Thought),而是将加密推理块交给一个更易被绕过的兼容模型,由后者将已加载的内容转录出来。整个过程未获取服务端密钥,也未破解加密,而是利用了推理块使用范围的权限漏洞——系统能确认数据未被篡改,却未在所有场景下验证当前模型和会话是否有资格使用它。

这一漏洞的根源在于,隐藏推理为何会离开模型内部。在长任务和 Agent 场景中,模型需要保留中间状态以继续推理。若服务端为每个会话长期保存完整推理,会增加状态存储和上下文管理的复杂度。因此,部分 API 选择将内部推理封装成客户端不可读的数据,交由客户端保存,后续调用时再验证使用。这虽解决了工程问题,却也带来了权限管理的新挑战:加密和签名只能证明数据本身可信,无法证明其当前使用场景的合法性。

研究人员进一步测试发现,这些推理块不仅可跨会话使用,甚至可跨账号提交,且部分能被同一厂商的其他模型读取。以 Claude 为例,Opus 生成的隐藏推理块可被 Haiku 正常加载,攻击目标随之改变——无需突破 Opus 的限制,只需让 Haiku 输出已读到的内容。由于不同型号在对齐强度和越狱抵抗能力上存在差异,原本守在强模型上的限制可能被旁路。这意味着,一段高端模型推理的安全性不仅取决于生成它的模型,还取决于同一体系中其他型号的安全能力。

为验证恢复内容的真实性,研究人员采用了多重信号。他们让源模型处理 120 道 Codeforces 问题,记录 API 报告的隐藏思考 token 数,再对比恢复文本的长度。结果显示,Anthropic、OpenAI 和 Google 多组模型的恢复长度与 API 记录的 token 数高度对应,表明恢复文本与原始隐藏计算在长度结构上存在强关联。更有说服力的证据来自真实 Agent 轨迹:研究人员收集了 GitHub 和 Hugging Face 上 6708 条公开 Agent 运行记录,处理出 315320 个推理块,恢复后发现了 API 密钥、密码、访问令牌、私钥、邮箱及内部技术信息,其中部分内容从未出现在公开对话历史中。这证明恢复并非基于可见聊天内容的重新推理,而是确实还原了隐藏状态。

该发现还暴露了 Agent 日志的隐患:用户从聊天记录或代码仓库中删除凭据,并不代表旧推理块中的相同信息已消失。Agent 在操作中可能读取过这些内容,一旦进入推理,便会留在旧状态中。此外,恢复的推理内容还可能影响模型蒸馏。完整推理不仅提供结果监督,还记录了问题拆解、中间判断、错误修正等过程,对学生模型极具训练价值。过去获取此类数据需调用昂贵的闭源模型,而现在公开 Agent 日志中已存在大量加密推理,提取方只需找到兼容模型即可恢复高质量推理,将推理生成与提取拆分为不同端点,可能绕过高端模型侧的大规模蒸馏监控。

实验还展示了推理的运行时影响:研究人员截取 Opus 推理开头约 1% 的 token 放入 Kimi K3 的推理上下文,Kimi K3 的回答明显向 Opus 的输出方向移动。这虽不能证明 Kimi K3 使用过 Claude 推理训练,但表明一小段高质量推理足以改变模型后续的解题路径。在 Agent 场景中,推理块不仅承载历史信息,还包含模型已形成的行动倾向。实验演示了一种不可见的提示注入:恶意内容先进入隐藏推理,新 Agent 加载该状态后,在用户可见输入中无对应指令的情况下,模型仍会受其影响并执行额外动作。这使推理块在 Agent 中具备了执行上下文的性质,安全系统需检查状态来源的合法性,而不仅仅是用户输入和工具输出。

此次事件的核心问题在于,推理已从一次调用的中间过程,演变为会被保存、迁移并持续影响后续任务的状态。未来需补强的不仅是越狱防护,更是推理本身的权限边界——谁能读取、能带到哪里、何时失效,都需明确限制。Agent 安全正从管理模型输出,转向管理模型携带的状态继续运行。