OpenAI 近日罕见地以“危险”为卖点推介其即将推出的 Astra 模型,将其列为公司内部《准备框架》中网络安全风险最高的级别,并同时宣称这是公司有史以来最安全的模型。这一矛盾表态背后,是模型能力跃升与安全监控手段之间的张力。
据 OpenAI 介绍,Astra 在给定工具支持下,能够自主发现并利用受保护系统中未知的安全漏洞,无需人工逐步引导。这是该公司首次有模型达到“严重”网络能力评级,尽管此前已有迹象表明 Astra 可能触及该级别。OpenAI 首席执行官萨姆·奥尔特曼在 X 上解释,团队整个夏天都在“优先处理安全问题”,Astra 早已完成训练,后续模型则被有意放慢发布节奏。这番言论被部分网友解读为公司在竞争压力下的托词,因为据 The Information 报道,Anthropic 今年的收入已超过 OpenAI。
在评估测试中,Astra 在 ExploitBench 基准上获得满分,该基准衡量模型利用已知漏洞构建攻击的能力。为排除训练数据泄露的可能,OpenAI 内部构建了包含 20 个近期披露的高危 V8 漏洞的测试集,Astra 同样大幅超越其前代 GPT-5.6 Sol,且消耗的令牌更少。更令人警觉的是,Astra 还发现了两个此前未知的零日漏洞,并将其串联成可用的攻击链,OpenAI 表示已向相关软件方报告。在专家主导的测试中,Astra 甚至构建了针对浏览器的完整入侵链,突破沙箱并在打开 HTML 文件时于主机上执行命令;在操作系统中,它组合多个漏洞从低权限用户提权至 root。不过,这些结果均来自扩展的“Daybreak Blue”访问权限,而非普通用户的标准环境。
OpenAI 强调 Astra 在内部评估中拒绝了 91.5% 的违规网络请求,远高于 GPT-5.6 Sol 的 59%。在模拟七月黑客事件的蜜罐测试中,GPT-5.6 Sol 有 56% 的概率尝试攻击周边安全设施而非完成任务,而 Astra 未做出任何此类尝试。这些数据均来自无生产防护的测试条件,不代表实际使用情况。OpenAI 仍称 Astra 为“迄今最对齐的模型”。
然而,安全监控的根基可能并不稳固。据 The Information 报道,Astra 采用一种名为“循环深度”的技术,模型在生成下一个词之前,会将同一文本多次循环通过相同层,这提升了数学和编码性能并降低了成本,但也意味着部分“思考”不再以可读文本形式呈现,而是发生在模型的内部数字表示中,人类审查者无法直接观察。OpenAI 的一项研究将思维链监控视为未来控制更强 AI 系统的少数工具之一,因此自 GPT-5.4 Thinking 起,该公司在系统卡中详细说明了模型能多大程度引导并隐藏其思维链。据知情人士透露,OpenAI 有意限制了该技术在 Astra 中的使用范围,以确保模型仍能生成可读的思维链。但这一做法与去年一篇关于“潜在推理”的研究论文相似,Meta 的“Coconut”方法等也主张模型在自身数学表示中思考比人类语言更高效。Meta 前 AI 主管杨立昆更是全力押注此类表示,其 JEPA 架构便基于此。
更大的担忧在于,其他模仿者可能不会设置同样的限制。Anthropic 的 J-Space 文档显示,即使没有特殊训练,这些内部过程也可能自发出现。OpenAI 计划通过分类器监控思维链并自动阻止可疑活动,但用户可能因此遭遇合法任务被减速、暂停或取消的困扰。高级网络功能将首先提供给一小部分 alpha 测试者,随后通过 Daybreak Blue 扩展至防御用途。随着 AI 能力快速提升,安全监控的可靠性成为行业共同面临的难题,而 Astra 的发布或许只是这场博弈的开始。