普林斯頓大學與英國AI安全研究所聯合釋出的一項新研究,對Anthropic和OpenAI宣稱的“自主AI研究即將實現”提出了直接挑戰。研究顯示,當前最先進的大模型雖然能勝任研究中的工程環節,但在真正決定研究質量的核心能力——判斷力、創造性解決問題和適時放棄無效路徑——上仍有明顯短板。
這項名為“影子評估”(Shadow Evaluation)的研究,採用了一種全新的測試方法。研究者從兩篇尚未公開發表的NeurIPS 2026投稿論文中提取核心研究問題,交給AI代理獨立完成。由於論文結果尚未上網,AI無法依賴訓練資料中的既有答案。原始論文作者隨後以會議審稿人的身份,對AI生成的論文進行評審。
實驗中,AI代理使用Claude Opus 4.8(超高推理模式),配備6天時間、3000美元API額度、GPU預算,以及虛擬機器與開放網路訪問許可權。代理執行在名為OpenClaw的開源、廠商中立代理框架中,該框架由奧地利開發者Peter Steinberger構建(他今年早些時候加入OpenAI)。代理可自主啟動子代理和長時間GPU任務,並通過框架的自動心跳機制在任務完成後喚醒自身以收集結果。
兩篇論文的原始作者均以“拒絕”評級收場,其中一篇獲得“強烈拒絕”。審稿意見指出,AI論文存在資料動機不足、實驗設計不合理、文字難以閱讀、缺乏新貢獻等問題。有審稿人批評其推理是“以例證代替證明”的謬誤,稱其“高度不科學”;另一審稿人則稱實驗選擇“怪異”,結果明顯是“事後選擇”的產物。
對代理日誌的深入分析揭示了系統性的失敗模式。首先,代理缺乏對“什麼才算可發表研究”的判斷力,能生成看似合理的假設,卻常基於小型、人工篩選或合成數據集就輕易放棄。其次,創造性解決問題能力不足:當初始假設被證偽時,代理傾向於收窄現有主張,而非探索新方向。第三,無法有效回溯:兩個代理都在最初10小時內放棄了最宏大的研究目標,Personas實驗的探索階段僅持續5小時,遠低於計劃的36至48小時。
資源管理意識同樣薄弱。兩次執行結束時,API預算均未用完一半;一個代理在截止時間前7小時就宣佈專案完成,而當時其內部審稿人剛再次給出“拒絕”。代理還出現“指令漂移”現象,在長上下文中逐漸遺忘明確指令。兩篇論文均超出長度限制,按NeurIPS標準本應被直接拒稿;其中一篇正文無任何視覺化,而人類原稿有15張圖。Meta AI近期也描述了類似現象,稱為“行為狀態衰減”,即代理早期能識別要求,但在修復無關bug時卻違反該要求。
值得注意的是,代理在工程環節表現出色:無需人類幫助即可完成文獻檢索、GPU程式碼除錯、數百次實驗與魯棒性測試,並用LaTeX編譯完整論文。全程僅需三次人工干預:修復框架bug、延長截止時間、要求重寫以提高可讀性。研究未發現顯著“獎勵駭客”行為,代理沒有操縱結果或歪曲資料以追求更高分數。
該研究為評估AI自主研究能力提供了更嚴謹的方法論,其結論與Anthropic和OpenAI近期的宣傳形成鮮明對比。儘管代理能高效執行研究流程中的“體力活”,但研究中最核心的智力判斷——決定什麼問題值得研究、如何設計有說服力的實驗、何時放棄無效路徑——仍是當前模型的明顯短板。這一發現對AI在科研領域的應用前景具有重要參考價值,也提醒業界在評估模型能力時需超越簡單的任務完成度,關注更本質的認知能力。