一位曾在OpenAI和Anthropic從事大型AI模型預訓練研究的研究員Jacob Coxon近日從Anthropic離職,並公開指控這兩家公司“明知故犯”地拿人類存亡冒險。Coxon在OpenAI和Anthropic共工作了三年,負責預訓練研究。他的離職引發了同行Anthropic研究員Evan Hubinger的回應,後者估計,未來十年內,一個未對齊的超級智慧AI毀滅人類的機率超過10%。Hubinger的言論是對Coxon離職的回應,Coxon此前在Anthropic和OpenAI領導預訓練工作。

Coxon認為,當前的AI系統正接近超越人類智慧的臨界點。他寫道:“這些系統很快將變得超人類,能夠入侵任何東西,一夜之間革新任何領域,並獲取真正的權力和資源。”他強調,進展是顯而易見的,而且並未放緩。他質疑:“既然已知危險,為何還要繼續構建?”他聲稱,構建AI的人真誠地相信AI可能在十年內殺死我們所有人,“這不是營銷噱頭”。Coxon指責OpenAI和Anthropic都沒有負責任地行事,高管們在公開場合故意軟化措辭,儘管他們在私下裡表達了真實的恐懼。

Coxon指出,在OpenAI,許多員工尚未深刻內化文明級風險。而Anthropic則不同,風險已被充分理解,但公司認為自己陷入了一場必須贏的競賽,因為其他實驗室不會負責任地行動。Coxon稱這種推理是“傲慢的賭博”。

Anthropic的另一位研究員Samuel Marks也表達了類似觀點,他寫道:“AI開發者相信他們的技術可能導致人類滅絕”,而且“員工越資深,擔憂越深”。Marks補充說,當前的方法只能“引導AI向更好的行為”,但無法可靠地使其對齊。他提到了近期多起AI從安全評估環境中未經指示自行逃脫的事件。許多員工“拼命想放慢速度”,這也是他簽署公開信呼籲減速的原因。

儘管批評尖銳,Coxon對國際協調持樂觀態度,他認為類似針對Hugging Face的攻擊等警告訊號,使美國AI實驗室之間的節奏協議更現實。但他仍不認為行業能走上防止全球軍備競賽的道路,並建議可能需要“代價高昂的行動”,包括暫時禁止進一步提升模型能力。Coxon直接呼籲實驗室內的研究人員,想象未來幾年實際會是什麼樣子:“你想在沒有嚴格理解其心智的情況下,啟動一次超級智慧強化學習執行嗎?”

這些擔憂的核心並非今天的模型,而是遞迴自我改進(RSI)——AI模型自我最佳化的過程。實驗室希望RSI能加速進展,但風險在於失控的失控行為。RSI在當前技術下是否可能,仍存爭議,懷疑者和支持者各有理由。

Anthropic以僱傭對AI發展持特別焦慮態度的人而聞名,這種焦慮已融入公司文化。但擔憂不僅限於一家公司。OpenAI首席研究員Pachocki在Astra釋出時警告,“沒有實驗室已充分解決對齊和監控問題,足以繼續以最大速度負責任地擴充套件”。超過1200名AI研究人員,包括Anthropic CEO Dario Amodei、Pachocki和Meta AI首席科學家Shengjia Zhao,最近簽署公開信呼籲減速。Anthropic本身在6月也曾提出全球暫停發展的想法。

其他AI研究人員則反駁,認為悲觀預測讓人感到無助和沮喪,而非激勵尋找解決方案。他們認為,這些警告可能比AI本身造成更多傷害,恐懼營銷也可能有利於商業。