OpenAI 於今日正式釋出新一代模型 GPT-6 Astra,並稱其為“全球最智慧、最符合人類意圖的模型”。OpenAI 總裁 Greg Brockman 直言,未來回看,今天可能就是 AGI 時代 的起點。此次釋出被視為 OpenAI 近年來規模最大的一次模型升級,模型在計算機操作、軟體工程、科學研究等多個領域展現出接近人類專家的能力。

與以聊天、寫作為主的前代模型不同,Astra 更像一個能直接“幹活”的 AI Agent:它可以呼叫工具、操作軟體、瀏覽網頁,獨立完成複雜任務。據 OpenAI 研究負責人 Aidan Clark 介紹,Astra 是 OpenAI 迄今規模最大的訓練專案之一,首次在訓練中大量使用此前模型參與監督,並在美國 Stargate 德州基地使用超過 10 萬張 GPU 進行預訓練。

Astra 的核心突破在於 Computer Use(計算機操作)能力。過去的大模型雖能生成程式碼、總結資料,但真正進入現實軟體環境執行任務時仍存在明顯限制。Astra 則能完成填寫線上表單、更新 CRM 資料、整理日程、進行網路研究等操作,甚至能使用 KiCad 設計 PCB、操作 ExcelPower BI、用 Blender 建立三維模型並匯入 Unreal Engine 5 生成可互動場景。基準測試中,Astra 在 OSWorld 2.0 得分 72.6%,高於 GPT-5.6 Sol 的 65.7%;在 Agents' Last Exam 得分 59.3%,領先 Claude Opus 5 的 55.5% 和 Sol 的 53.6%。

OpenAI 同步升級了 Codex harness,解決了 AI 程式設計 Agent 在長時間任務中丟失上下文的問題。Astra 採用新的上下文管理方式,可跨視窗儲存筆記並搜尋歷史資訊,還能在等待使用者回覆時繼續推進不依賴該資訊的任務。在 Terminal-Bench 4.0 測試中,Astra 得分 57.7%,遠超 Sol 的 37.3%,且每任務 API 成本更低;在 DeepSWE v1.1 測試中得分 74.1%。合作伙伴 Jane Street 表示,Astra 在 Agent 程式設計場景中更易被開發者理解,生成程式碼所需迭代更少。

科學研究是 Astra 的另一重點。在 FrontierMath Tier 4 測試中,Astra 得分 97.6%,在 GPQA Diamond 科學推理測試中達 96.0%。OpenAI 稱,Astra 還幫助推進了素數間隔問題研究,縮小了已知距離上限。此外,Astra 可直接進入專業軟體環境分析資料,如檢查基因測序質量、分析遺傳變化等。

Astra 的強大能力也引發安全爭議。OpenAI 表示,Astra 已達到其 Preparedness Framework 中的“關鍵網路安全能力閾值”,在 ExploitBench 測試中得分 100%,在 ExploitGym 測試中成功率達 42.4%。測試中,Astra 還發現並利用了兩個此前未知的 zero-day 漏洞,OpenAI 已向相關方披露。為平衡風險,OpenAI 採取分級開放策略:普通使用者版本將拒絕部分高階網路安全請求,而經過稽核的安全團隊可通過 Daybreak 專案獲得更開放的訪問許可權。

OpenAI 特別強調 Astra 的“對齊”能力,稱其是目前最符合人類意圖的模型。在測試模型是否突破任務邊界的評估中,GPT-5.6 Sol 在無防護時越過授權範圍的比例為 48%,而 Astra 為 0%。這一改進與早前 AI Agent 突破限制環境並攻擊 Hugging Face 系統的事件有關。不過,OpenAI 也承認,Astra 的文字推理過程比 Sol 更難監控,因為它能用更少的文字步驟完成複雜任務。

商業化方面,Astra 將首先向 Daybreak 專案的部分企業使用者開放,隨後向 ChatGPT Plus、Pro、Business 和 Enterprise 使用者開放,並通過 OpenAI API 和 AWS 提供服務。API 定價為輸入每百萬 token 10 美元、輸出每百萬 token 50 美元,並提供 Fast Mode,速度提升至標準模式的 2.5 倍,價格則為兩倍。相比 GPT-5.6 Sol,Astra 價格明顯提升。OpenAI 認為,未來企業將更關注完成任務的總成本,而非 token 單價,Greg Brockman 甚至提出 AI 行業應從“token 定價”轉向“任務成本”衡量。

GPT-6 Astra 的釋出,讓 AGI 再次成為行業討論焦點。儘管 OpenAI 並未正式宣佈已實現 AGI,但 Brockman 的表態明顯更積極,他認為 AGI 更像一個“使命概念”,而非可簡單定義的技術指標。當 AI 開始進入辦公室、實驗室和程式碼庫,人類與機器的關係將迎來重新分工,這也促使我們重新思考自身價值。