Anthropic 宣布,其 AI 模型 Claude Mythos Preview 成功发现了支撑数字安全的密码学算法中的数学弱点。据 Anthropic 称,该模型对后量子签名方案 HAWK 开发了一种改进攻击,并对简化版的 高级加密标准(AES) 实现了新攻击。AES 是全球最广泛使用的对称加密标准,保护着人们在网上的几乎所有活动。Anthropic 强调,这两项发现目前均不影响实际使用的系统:HAWK 仅是美国国家标准与技术研究院(NIST)正在进行的一项标准化流程的候选方案,而 AES 攻击针对的是仅使用完整方案 10 轮中 7 轮的修改版本。尽管如此,这些结果显示了 AI 模型如何挑战互联网安全背后的核心假设。

Mythos 在 60 小时 内以约 10 万美元 的 API 成本发现了 HAWK 攻击。HAWK 是 NIST 第三轮额外后量子签名竞赛中剩余的方案之一,旨在即使面对未来量子计算机也能保持安全。人类专家已对 HAWK 进行了超过两年的审查,但 Mythos Preview 发现了一种改进攻击。该攻击利用了 HAWK 安全所依赖的数学格中一个先前未被检测到的对称性。Mythos 在一个多智能体系统中半自主地工作,一个智能体最初试图认为该想法不可行,但第二个智能体找到了充分利用它的方法。据 Anthropic 称,人类研究员具有理论计算机科学背景,但并非格基密码学专家,其角色主要限于项目管理。

Mythos 还几乎完全自主地发现了对简化版 AES-128 的攻击。一位研究员构建了一个框架,允许 Claude 形成假设并通过实验进行测试。Mythos 随后开发了一种名为 “Möbius Bridge” 的新指纹识别方法,该方法消除了攻击者必须做出的一个猜测,并将最佳已知攻击的效果提高了 200 到 800 倍。人类提示在此过程中作用很小:模型最初拒绝处理该问题,认为进一步改进不可能,写道“如果你想要不同的结果,目标必须改变……AES-128 r5/r6 确实很难。”在研究员鼓励其寻找“真正新颖的想法”后,Mythos 才开始探索更具创造性的方法。在三天内,该模型生成了数亿个 token,仅收到了三个实质性提示,其中一个只是“重申我们不是在寻找容易的成果,我们想要真正的研究来找到真正困难的发现”。这次运行也花费了约 10 万美元 的 API 费用,处理了约 10 亿个 token。随后,非密码学专家的人类研究员花费了数百小时验证结果。

Anthropic 已提前与美国政府和行业合作伙伴分享了这些发现,并与 HAWK 方案的作者协调披露了该弱点。Mythos Preview 目前仍未向公众开放。此外,Anthropic 与苏黎世联邦理工学院、特拉维夫大学和海法大学的研究人员共同开发了一个名为 CryptanalysisBench 的基准测试,允许其他人系统地评估语言模型的密码分析能力。