OpenAI 正在加速推进其新一代模型 Astra 的落地。近日,开发者 @Lentils80 意外发现,OpenAI 已扩大 Astra 的内部测试范围,测试代号为 mozaik-alpha-fdm。最新放出的两个测试结果均来自 Max effort 模式下的零样本生成:一个是 3D 像素风格的城堡,另一个是完整的前端网页,全部一次直出,无需人工干预。与此同时,一大批获得灰度资格的开发者同步放出了 Astra 的首批测试,展示了其在复杂 UI 生成上的惊人表现。
真正让开发者感到震撼的,是 Astra 能够一次性管住大量细节:统一的视觉语言、复杂元素之间的空间关系、页面层级,以及交互所需的代码结构。有开发者看完演示后直接宣布:“Frontend is solved!” 这意味着,前端开发这一长期被视为大模型“老大难”的领域,可能正迎来质变。
据多位测试者反馈,Astra 在零样本条件下展现出的细节把控力远超以往模型。例如,一个可交互的 3D 等距王国地图,需要 AI 同时处理几何透视、图层堆叠、动态交互和视觉一致性,Astra 在最大思考程度下可以一次成型。另一位开发者 MeSun 直接用 Astra 生成了一个带有物理效果的 3D 自行车测试网页(HTML),车身比例可随意调整;甚至要求生成一个 3D 第一人称 Roguelike 游戏,主打战斗爽感,Astra 同样“一把过”。有爆料人士感叹,这是历史上第一次“想法”开始碾压“执行”——“你能想到的,AI 就能给你做出来”。
结合泄露的特征与行业预测,Astra 的核心技术突破可能集中在四个维度。首先是端到端多智能体编排:Astra 可能不再是一个单纯的“单体代码生成器”,而是在底层原生集成了多智能体架构,例如让 Codex 处理编程任务、另一个子模型处理自然语言查询,最后由主模型整合结果。在生成 3D 网页时,模型内部可能并发运行“UI 设计师、前端工程师和代码审查员”,从而保证布局、样式和逻辑的三位一体。这与 GPT-5.6 中已以 beta 形态推出的 Multi-agent 功能一脉相承,但 Astra 可能将其内化为“端到端训练”的原生能力。
第二是超长程任务能力(Ultra Long-horizon Task)。以往模型在编写涉及多个组件和复杂 CSS/JS 联动的项目时,极易出现“遗忘”和“幻觉”。Astra 展现出的完整度,证明其上下文窗口内的注意力机制得到了优化,足以支撑从零构建复杂工程。从 Astra 解决十个数学问题的表现来看,它具备在极长时间跨度内维持推理一致性的能力,这对代码项目的持续开发、论文级别的研究任务以及复杂工作流的自主执行都意义重大。
第三是持久化推理模式(Persistent Reasoning)。Astra 在 Max effort 下的思考量显著超过 Sol,这指向一种更“持久”的推理机制:模型不会一次性输出答案,而是在内部反复验证、纠错、迭代,直到输出达到满意水平。这意味着它能“记住”当前 DOM 树的结构,在后续生成中保持设计语言和代码规范的绝对一致。
第四是即时自我纠错。Astra 可能在生成代码的同时,在内部沙盒中完成“虚拟渲染”或 AST 语法树的逻辑跑通,自动发现前端错位并完成重构,最后才将完美的零样本结果呈现给用户。零样本就能复刻 PS5 手柄这种高细节渲染任务,被视为自我纠错能力的间接证据。
与此同时,Anthropic 也被曝正在加速推进其模型 Fable 5.1,发布时间窗口恰好与 Astra 重叠。从灰度测试者反馈来看,Fable 5.1 的升级重点几乎与 Astra 撞了个正着:前端代码更稳、复杂组件逻辑一次成型;长思维链推理更强;工具调用和分步规划进一步强化。两家公司已杀进同一块战场:代码能力要更强,任务要跑得更久,过程中还得尽量少让人接手。目前,两边已开始隔空 PK,例如同样生成一张“女子自画像”SVG 矢量图,Astra 与 Fable 5.1 的细节、结构、完成度被直接摆上台面对比。
不过,真正可能决定胜负的或许不只是模型能力。从爆料来看,Astra 除了性能强悍,还可能在性价比上继续下压。如果 OpenAI 真能以更低的 API 调用成本,交付一款自带 Max effort、自纠错能力更强、又不需要复杂工程编排的模型,那么 Fable 5.1 面对的将不只是 Benchmark 上的压力。业界普遍预测,下周四(9月3日)前后,Astra 将正式面世,与 Fable 5.1 正面硬刚。巅峰之战,谁能拿下新王宝座,拭目以待。