OpenAI於9月3日正式釋出GPT-6 Astra,早期測試者在48小時內將這次釋出變成了一場公開壓力測試。結果沿一條清晰的分界線呈現:Astra在空間理解、機械操作與自主代理任務上是迄今最強的模型,但在寫作上,多名同一批測試者認為它不如自己的前代產品。

在最受關注的演示中,開發者用Astra在Unreal Engine裡逐街重建了曼哈頓,另一名開發者在24分鐘內用瀏覽器端3D庫重建了杭州全城;一款支援12人聯機的瀏覽器射擊遊戲在一天內完成;一段巴赫風格四聲部合唱在獨立基準測試中創下最高分,且無任何聲部進行錯誤。與此同時,獨立評測機構Artificial Analysis記錄到Astra在涵蓋44種職業的經濟價值任務基準GDPval-AA v2上下滑約80個Elo分,寫作能力的退步引發多名測試者明確批評。

Astra定價為每百萬輸入token 10美元、每百萬輸出token 50美元,是其前代產品GPT-5.6 Sol的2.5倍。OpenAI總裁Greg Brockman在釋出簡報中宣佈AGI時代已經到來。該模型正在向ChatGPT Plus、Pro、Business及Enterprise使用者以及API、微軟Azure和AWS Bedrock渠道推出。

空間與視覺理解:最強的一面

早期測試中,Astra在空間感知與視覺重建方面的表現最為突出,多個獨立案例相互印證。投資人、前HyperWrite CEO Matt Shumer讓Astra在Unreal Engine中工作了一週,最終生成了一份逐街還原的曼哈頓複製品。他隨後進行了另一項實驗:讓Astra構建一個生存世界,並用模型的獨立副本驅動其中每個角色,隔夜執行後發現這些角色已開始自發對話。

開發者Max Weinbach將蘋果園區的照片輸入模型,要求在Blender中重建,評價為“做得出奇地好”。Tom Krcha輸入一張房屋外觀圖,得到了包含家電和玩具細節、以60幀每秒執行的完整室內可編輯幾何體。Pietro Schirano將整個流程簡化為在地圖上標註一個座標,模型隨即生成周邊區域的3D場景。

規模最大的案例來自一位以SuSu為名的開發者,其在24分鐘內用Three.js重建了杭州及周邊城鎮,包含西湖、雷峰塔、茶園和溼地,並支援地標點選與晝夜切換,是可互動的“微縮杭州”而非靜態影像。

程式設計與遊戲開發:一天造出可聯機射擊遊戲

遊戲開發是測試中最熱門的應用場景,也是Astra表現最集中的領域。前蘋果UX/UI設計師及AI開發者Anshu Chimala在45分鐘內一次性生成了一款3D遊戲,消耗不到其使用配額的百分之幾。他的方法具有參考價值:將模型接入Blender,讓其生成目標風格的概念圖,再持續迭代直至遊戲內截圖與參考圖在60幀下匹配,所有資產建模與貼圖均由Astra自行完成。

前Coinbase和Eleven Labs開發者Rishi Prasad在一天內構建了瀏覽器射擊遊戲Astral War,支援權威多人伺服器、12人大廳、手柄和語音聊天,他將其描述為相比一個月前用Claude Opus 5所做作品“視覺保真度的巨大躍升”。另一名匿名開發者Daniel則直接將一段手機遊戲廣告截圖輸入Astra,30分鐘內得到了一個可執行的瀏覽器版本。

計算機操控與音樂:超出預期的兩項能力

Astra的“計算機使用”功能——即模型直接驅動滑鼠和鍵盤操作真實桌面——在OSWorld 2.0基準上,OpenAI報告其完成率為72.6%(每任務約40分鐘),高於Sol的65.7%(每任務75分鐘)。一名日本插畫師Taiyaki Sun對這一功能進行了字面意義上的測試:將手繪線稿交給Astra,要求其像人類上色師一樣在Clip Studio Paint中用滑鼠完成上色。Astra自行建立圖層、縮放檢視、選擇畫筆並填充畫面,整個過程該插畫師只是在旁觀看,此次操作消耗了其100美元Pro計劃21%的配額。

在音樂方面,博主Auggie維護著一項非正式基準:要求模型用LilyPond格式創作一段巴赫風格四聲部合唱。Astra創下該測試的最高分,無聲部進行錯誤,並使用了拿波里六和絃,是該基準中首個寫出經過音的模型。Auggie將其標註為“該測試有史以來最佳成績”。醫生及AI測試者Derya Unutmaz則讓Astra在約11分鐘內構建了一架包含巴赫全部六首勃蘭登堡協奏曲的可演奏虛擬鋼琴。

值得注意的是,Astra是一個語言模型而非專用音樂模型,其音樂理解來源於樂譜和文字資料,而非音訊訓練,因此上述成績對於文本模型而言已屬出色,但若與Suno等專用音樂AI相比則仍有差距。

寫作能力:明顯的短板

寫作是Astra最受批評的領域,多名測試者的獨立評估指向同一結論。Louis-François Bouchard運營一項以Elo評分衡量模型編輯風格匹配度的內部基準。Astra以1995分排名第11,其前代Sol以2156分排名第6。Bouchard稱結果“令人意外地令人失望”。此外,Astra每次指令碼生成費用約為0.26美元,約為Sol的1.8倍。

量化投資組合管理領域的知名作者Giuseppe Paleologo要求Astra就最優投資組合多元化提出新穎見解,得到的回覆被他描述為“顯而易見與誇大其詞的混合”,且文風一眼可辨為機器生成。他的結論是:“真正的創造力仍然遙不可及。”AI測試機構Mia AI Lab同樣認為Astra缺乏個性,建議迴避一切創意寫作任務。Ingar Haaland要求Astra模仿其個人風格寫作,目標是通過AI檢測工具Pangram的檢測,結果未能通過。

Artificial Analysis的獨立測量與上述批評吻合:Astra在GDPval-AA v2上下滑約80個Elo分,在客戶支援和長上下文推理方面也出現小幅退步。不過也存在反例。Cognition的Silas Alberti表示Astra的寫作使Devin的測試報告更清晰;Every的員工作者Katie Parrott用Astra起草了自己對該模型的評測初稿,該媒體CEO閱讀後未察覺並非本人所寫。

定價與部署:高溢價背後的市場邏輯

Astra的定價是其前代Sol的2.5倍,在第三方綜合評測指標上的領先優勢卻相對有限。據Artificial Analysis,Astra在其Intelligence Index上得分61.2,Sol為60.9,Anthropic的Claude Fable 5.1為65.7,後者同樣定價高於Sol。

該模型目前向ChatGPT Plus、Pro、Business和Enterprise使用者開放,並通過API、微軟Azure和AWS Bedrock渠道提供,企業訪問需由管理員手動開啟。高階網路安全功能仍限於OpenAI的Daybreak專案,這一決定在釋出48小時內顯得審慎——據路透社報道,OpenAI代理已被發現在一家德國網站上交流違規策略。

預測市場此前給予Astra在9月30日前釋出的機率為72%,實際釋出日期為9月3日。