Anthropic 的一位研究員近日公佈了一項新研究,展示了 AI 系統如何自我改進對齊能力,這可能是邁向遞迴自我改進 AI 的重要一步。該論文題為《自動化研究者能可靠緩解對齊失敗》,由 Anthropic 研究員陳嶽翰(Chen Yueh-Han)領導,於週五釋出。

研究團隊開發了一種自動化系統,在給定 10 個針對特定錯誤行為的基準測試後,該系統能夠在不降低整體效能的前提下,逐一提升模型在這些基準上的表現。這一成果表明,自動化對齊訓練可能很快變得實用。

該系統模擬了傳統研究流程:每個自動化系統會搜尋現有文獻,提出改進方法,然後用該方法訓練模型 30 分鐘,並在多次迭代中逐步提高基準難度。有效的方法被保留,無效的則被丟棄,這使得系統能夠快速、大規模地執行。論文指出,這些結果為自動化對齊後訓練在近期內變得可行提供了早期證據。

這一研究被視為邁向遞迴自我改進 AI 的一步,許多人認為這是 AI 發展的下一個重大突破。如果模型能夠改進自身的對齊訓練,那麼它們也可能改進更廣泛的訓練實踐,屆時人類 AI 研究者可能很快變得過時。論文毫不避諱地探討了這一可能性,直接將自動化對齊研究者(AAR)與人類研究員進行比較。

論文稱,平均在六小時內,最佳的 AAR 方法就能勝過經驗豐富的人類提出的方法,且人類指導的研究方向並未帶來更強的效能。此外,成本對比也頗具說服力:AAR 的 API 推理成本約為每小時 4 美元,而人類研究員的時薪高達 150 美元

不過,論文也指出了該方法的侷限性。自動化系統僅在基準測試能真實反映對齊目標時才有效,而建立和維護這些基準,以及維護和擴充套件自動化研究者所依賴的文獻,仍需大量工作。

這一研究引發了關於 AI 自我改進可能性的廣泛討論。支持者認為,這能大幅降低 AI 訓練成本並加速技術進步;而批評者則擔憂,一旦 AI 能自我改進,人類可能失去對 AI 的控制。無論如何,這項研究為 AI 領域提供了一個重要的新視角。