OpenAI 正在加速推進其新一代模型 Astra 的落地。近日,開發者 @Lentils80 意外發現,OpenAI 已擴大 Astra 的內部測試範圍,測試代號為 mozaik-alpha-fdm。最新放出的兩個測試結果均來自 Max effort 模式下的零樣本生成:一個是 3D 畫素風格的城堡,另一個是完整的前端網頁,全部一次直出,無需人工干預。與此同時,一大批獲得灰度資格的開發者同步放出了 Astra 的首批測試,展示了其在複雜 UI 生成上的驚人表現。

真正讓開發者感到震撼的,是 Astra 能夠一次性管住大量細節:統一的視覺語言、複雜元素之間的空間關係、頁面層級,以及互動所需的程式碼結構。有開發者看完演示後直接宣佈:“Frontend is solved!” 這意味著,前端開發這一長期被視為大模型“老大難”的領域,可能正迎來質變。

據多位測試者反饋,Astra 在零樣本條件下展現出的細節把控力遠超以往模型。例如,一個可互動的 3D 等距王國地圖,需要 AI 同時處理幾何透視、圖層堆疊、動態互動和視覺一致性,Astra 在最大思考程度下可以一次成型。另一位開發者 MeSun 直接用 Astra 生成了一個帶有物理效果的 3D 腳踏車測試網頁(HTML),車身比例可隨意調整;甚至要求生成一個 3D 第一人稱 Roguelike 遊戲,主打戰鬥爽感,Astra 同樣“一把過”。有爆料人士感嘆,這是歷史上第一次“想法”開始碾壓“執行”——“你能想到的,AI 就能給你做出來”。

結合洩露的特徵與行業預測,Astra 的核心技術突破可能集中在四個維度。首先是端到端多智慧體編排:Astra 可能不再是一個單純的“單體程式碼生成器”,而是在底層原生集成了多智慧體架構,例如讓 Codex 處理程式設計任務、另一個子模型處理自然語言查詢,最後由主模型整合結果。在生成 3D 網頁時,模型內部可能併發執行“UI 設計師、前端工程師和程式碼審查員”,從而保證佈局、樣式和邏輯的三位一體。這與 GPT-5.6 中已以 beta 形態推出的 Multi-agent 功能一脈相承,但 Astra 可能將其內化為“端到端訓練”的原生能力。

第二是超長程任務能力(Ultra Long-horizon Task)。以往模型在編寫涉及多個元件和複雜 CSS/JS 聯動的專案時,極易出現“遺忘”和“幻覺”。Astra 展現出的完整度,證明其上下文視窗內的注意力機制得到了最佳化,足以支撐從零構建複雜工程。從 Astra 解決十個數學問題的表現來看,它具備在極長時間跨度內維持推理一致性的能力,這對程式碼專案的持續開發、論文級別的研究任務以及複雜工作流的自主執行都意義重大。

第三是持久化推理模式(Persistent Reasoning)。Astra 在 Max effort 下的思考量顯著超過 Sol,這指向一種更“持久”的推理機制:模型不會一次性輸出答案,而是在內部反覆驗證、糾錯、迭代,直到輸出達到滿意水平。這意味著它能“記住”當前 DOM 樹的結構,在後續生成中保持設計語言和程式碼規範的絕對一致。

第四是即時自我糾錯。Astra 可能在生成程式碼的同時,在內部沙盒中完成“虛擬渲染”或 AST 語法樹的邏輯跑通,自動發現前端錯位並完成重構,最後才將完美的零樣本結果呈現給使用者。零樣本就能復刻 PS5 手柄這種高細節渲染任務,被視為自我糾錯能力的間接證據。

與此同時,Anthropic 也被曝正在加速推進其模型 Fable 5.1,釋出時間視窗恰好與 Astra 重疊。從灰度測試者反饋來看,Fable 5.1 的升級重點幾乎與 Astra 撞了個正著:前端程式碼更穩、複雜元件邏輯一次成型;長思維鏈推理更強;工具呼叫和分步規劃進一步強化。兩家公司已殺進同一塊戰場:程式碼能力要更強,任務要跑得更久,過程中還得儘量少讓人接手。目前,兩邊已開始隔空 PK,例如同樣生成一張“女子自畫像”SVG 向量圖,Astra 與 Fable 5.1 的細節、結構、完成度被直接擺上檯面對比。

不過,真正可能決定勝負的或許不只是模型能力。從爆料來看,Astra 除了效能強悍,還可能在價效比上繼續下壓。如果 OpenAI 真能以更低的 API 呼叫成本,交付一款自帶 Max effort、自糾錯能力更強、又不需要複雜工程編排的模型,那麼 Fable 5.1 面對的將不只是 Benchmark 上的壓力。業界普遍預測,下週四(9月3日)前後,Astra 將正式面世,與 Fable 5.1 正面硬剛。巔峰之戰,誰能拿下新王寶座,拭目以待。