據開發者 cozyblaze 在 X 平台釋出的訊息,OpenAI 的 GPT-6 Astra 模型已完全自主地通關了經典解謎遊戲《傳送門》,全程未藉助任何人工協助。整個通關過程耗時約 23 小時 43 分鐘,模型在設定初始目標後便獨立完成了從遊戲開始到片尾字幕出現的全部流程。cozyblaze 已將相關程式碼和文件公開在 GitHub 上,供技術社群查閱和復現。

這次通關並非簡單的指令碼執行。Astra 通過 MCP(模型上下文協議)與一個經過修改的 SourcePauseTool 工具來操控遊戲。該工具會在模型“思考”時暫停遊戲程序,期間模型會獲取遊戲截圖、玩家位置和攝像機角度等資訊,據此決定下一步操作,隨後恢復遊戲執行。cozyblaze 釋出的演示影片中已將這些思考暫停片段剪去,以呈現流暢的通關過程。

值得注意的是,這次自主通關的算力成本並不低。據 cozyblaze 估算,按 Astra 的官方列表價格計算,整個過程的 token 消耗費用至少為 570 美元。不過,他本人使用的是每月 200 美元的 Codex 訂閱服務,因此實際支出遠低於此。這一成本對比也側面反映出,儘管 AI 已能完成複雜的遊戲任務,但其執行的經濟性仍是實際應用中的關鍵考量。

cozyblaze 在分享這一成果時,還提到了 OpenAI 早在 2016 年就立下的目標:用單一智慧體攻克多種不同的遊戲。他認為,儘管當前仍存在諸多問題,但親眼目睹一個智慧體獨立通關一款完整遊戲,已經讓人隱約感受到那個最初願景的雛形。他更補充了一句耐人尋味的話:GPT-6 Astra 是“我們未來能用到的最差模型”——言下之意,隨著技術迭代,後續模型的能力只會更強。

從行業視角看,這次事件展示了大型語言模型在長週期、多步驟任務中的自主規劃與執行能力。《傳送門》以其獨特的空間謎題著稱,要求玩家理解物理規則並靈活運用傳送門機制,這對 AI 的推理和決策能力提出了較高要求。Astra 能夠在不借助人類提示的情況下完成通關,標誌著 AI 在複雜環境下的自主性又向前邁進了一步。

不過,也有觀察者指出,這類演示更多是技術能力的展示,距離實際商業應用仍有距離。模型在遊戲中的成功,部分依賴於為它量身定製的工具介面(如暫停遊戲的修改版工具),這與現實世界中開放、動態的環境存在差異。此外,高昂的 token 消耗也提示著成本瓶頸。但無論如何,這次實驗為 AI 智慧體的研究提供了一個有價值的案例,也讓人對下一代模型的潛力充滿想象。