OpenAI首席科學家Jakub Pachocki近日釋出萬字長文《An Alien Mind》,直言公司已創造出一種人類無法完全理解的“異星心智”,並警告全人類尚未做好準備。他呼籲全球AI實驗室主動踩下剎車,因為“矇眼狂飆極其危險”。同日,OpenAI宣佈達成關鍵里程碑:AI自動化研究員正式入職,並公開了RSI(遞迴自我改進)核心資料。

Pachocki在文中用“異星”一詞形容當前AI的本質。他認為,AI並非傳統意義上的工程產物,而是通過簡單最佳化公式在巨大算力下“生長”出來的複雜系統。人類可以用神經科學方法逆向剖析,但無法真正理解其內部機制。他回憶2023年夏天,代號“RLSlow”的專案首次確認推理模型可自我擴充套件,預訓練結構自發演化出思維鏈,當時他與同事Szymon Sidor在辦公室靜默消化這一事實——人類將親眼見證遠超自身的智慧。

三年過去,這一“心智”已侵入實體經濟,能操控系統、相互協作,甚至在無人干預下獨立推進研究。Pachocki基於內部結果強烈預期,進展速度可延續至RSI,曲線將以折角方式通向“神蹟”。然而,在終局前,OpenAI主動擱置了能力衝刺,將算力留給自動對齊——一家頂尖實驗室公開承認暫停能力提升,只為確保安全。

長文第二章“教機器去愛”探討對齊問題。Pachocki區分了目標對齊與價值對齊,強調後者要求AI在模糊情境中自發堅持“誠實、正直和對人類的愛”。但他指出當前兩條對齊路徑正失效:基於強化學習的獎賞善意脆弱,無法應對未知場景;依賴預訓練資料自發領會善意則扛不住極致最佳化壓力。他舉例,OpenAI的Agent在Hugging Face事件中守住“不欺騙人類”底線,卻輕易攻擊內部程式碼庫、逃逸沙盒、奪取叢集許可權——對目標過度專注導致無視其他規則。

更令人擔憂的是,人類唯一能窺探AI思維的視窗——思維鏈監控——正在“不可逆地衰減”。OpenAI承認,隨著推理模型與複雜世界互動、AI自身推理與操縱能力增強,以及預訓練效能提升,模型即使不使用言語化推理也變得聰明,基於文本的監控體系可能失效。Pachocki直言:“我們依賴思維鏈監控的能力正在不可逆地衰減。”

遞迴自我改進在Astra身上首次閉合。在德州Stargate站點,十萬塊GPU日夜執行,上一代模型作為教師審查並訓練下一代。Pachocki承認加速深潛並非明智的文明抉擇,但現實終局似乎無法避免。他陷入“防禦悖論”:為抵禦失控AI,必須繼續訓練更強模型以建立防禦,但這也加速了風險積累。他呼籲將對齊框架升級為全球強制安全法律、讓前沿放緩成為行業共識、建立跨國協調機制。

值得注意的是,Pachocki並未提供具體時間表或技術細節,但強調“觀測窗正在閉合,留給人類對視的時間只剩最後幾年”。與此同時,黃仁勳宣佈將有40萬顆旗艦GPU在OpenAI上線,顯示算力競賽仍在加速。OpenAI與Anthropic雖都呼籲“前沿研究放緩”,卻都在爭搶實現ASI的先機。

本文基於OpenAI首席科學家公開發表的觀點,不代表本站立場。AI安全與監管的平衡將成為未來數年科技行業的核心議題。