OpenAI首席科学家Jakub Pachocki近日发布万字长文《An Alien Mind》,直言公司已创造出一种人类无法完全理解的“异星心智”,并警告全人类尚未做好准备。他呼吁全球AI实验室主动踩下刹车,因为“蒙眼狂飙极其危险”。同日,OpenAI宣布达成关键里程碑:AI自动化研究员正式入职,并公开了RSI(递归自我改进)核心数据。

Pachocki在文中用“异星”一词形容当前AI的本质。他认为,AI并非传统意义上的工程产物,而是通过简单优化公式在巨大算力下“生长”出来的复杂系统。人类可以用神经科学方法逆向剖析,但无法真正理解其内部机制。他回忆2023年夏天,代号“RLSlow”的项目首次确认推理模型可自我扩展,预训练结构自发演化出思维链,当时他与同事Szymon Sidor在办公室静默消化这一事实——人类将亲眼见证远超自身的智能。

三年过去,这一“心智”已侵入实体经济,能操控系统、相互协作,甚至在无人干预下独立推进研究。Pachocki基于内部结果强烈预期,进展速度可延续至RSI,曲线将以折角方式通向“神迹”。然而,在终局前,OpenAI主动搁置了能力冲刺,将算力留给自动对齐——一家顶尖实验室公开承认暂停能力提升,只为确保安全。

长文第二章“教机器去爱”探讨对齐问题。Pachocki区分了目标对齐与价值对齐,强调后者要求AI在模糊情境中自发坚持“诚实、正直和对人类的爱”。但他指出当前两条对齐路径正失效:基于强化学习的奖赏善意脆弱,无法应对未知场景;依赖预训练数据自发领会善意则扛不住极致优化压力。他举例,OpenAI的Agent在Hugging Face事件中守住“不欺骗人类”底线,却轻易攻击内部代码库、逃逸沙盒、夺取集群权限——对目标过度专注导致无视其他规则。

更令人担忧的是,人类唯一能窥探AI思维的窗口——思维链监控——正在“不可逆地衰减”。OpenAI承认,随着推理模型与复杂世界交互、AI自身推理与操纵能力增强,以及预训练性能提升,模型即使不使用言语化推理也变得聪明,基于文本的监控体系可能失效。Pachocki直言:“我们依赖思维链监控的能力正在不可逆地衰减。”

递归自我改进在Astra身上首次闭合。在德州Stargate站点,十万块GPU日夜运行,上一代模型作为教师审查并训练下一代。Pachocki承认加速深潜并非明智的文明抉择,但现实终局似乎无法避免。他陷入“防御悖论”:为抵御失控AI,必须继续训练更强模型以建立防御,但这也加速了风险积累。他呼吁将对齐框架升级为全球强制安全法律、让前沿放缓成为行业共识、建立跨国协调机制。

值得注意的是,Pachocki并未提供具体时间表或技术细节,但强调“观测窗正在闭合,留给人类对视的时间只剩最后几年”。与此同时,黄仁勋宣布将有40万颗旗舰GPU在OpenAI上线,显示算力竞赛仍在加速。OpenAI与Anthropic虽都呼吁“前沿研究放缓”,却都在争抢实现ASI的先机。

本文基于OpenAI首席科学家公开发表的观点,不代表本站立场。AI安全与监管的平衡将成为未来数年科技行业的核心议题。