OpenAI 于今日正式发布新一代模型 GPT-6 Astra,并称其为“全球最智能、最符合人类意图的模型”。OpenAI 总裁 Greg Brockman 直言,未来回看,今天可能就是 AGI 时代 的起点。此次发布被视为 OpenAI 近年来规模最大的一次模型升级,模型在计算机操作、软件工程、科学研究等多个领域展现出接近人类专家的能力。
与以聊天、写作为主的前代模型不同,Astra 更像一个能直接“干活”的 AI Agent:它可以调用工具、操作软件、浏览网页,独立完成复杂任务。据 OpenAI 研究负责人 Aidan Clark 介绍,Astra 是 OpenAI 迄今规模最大的训练项目之一,首次在训练中大量使用此前模型参与监督,并在美国 Stargate 德州基地使用超过 10 万张 GPU 进行预训练。
Astra 的核心突破在于 Computer Use(计算机操作)能力。过去的大模型虽能生成代码、总结资料,但真正进入现实软件环境执行任务时仍存在明显限制。Astra 则能完成填写在线表单、更新 CRM 数据、整理日程、进行网络研究等操作,甚至能使用 KiCad 设计 PCB、操作 Excel 和 Power BI、用 Blender 创建三维模型并导入 Unreal Engine 5 生成可交互场景。基准测试中,Astra 在 OSWorld 2.0 得分 72.6%,高于 GPT-5.6 Sol 的 65.7%;在 Agents' Last Exam 得分 59.3%,领先 Claude Opus 5 的 55.5% 和 Sol 的 53.6%。
OpenAI 同步升级了 Codex harness,解决了 AI 编程 Agent 在长时间任务中丢失上下文的问题。Astra 采用新的上下文管理方式,可跨窗口保存笔记并搜索历史信息,还能在等待用户回复时继续推进不依赖该信息的任务。在 Terminal-Bench 4.0 测试中,Astra 得分 57.7%,远超 Sol 的 37.3%,且每任务 API 成本更低;在 DeepSWE v1.1 测试中得分 74.1%。合作伙伴 Jane Street 表示,Astra 在 Agent 编程场景中更易被开发者理解,生成代码所需迭代更少。
科学研究是 Astra 的另一重点。在 FrontierMath Tier 4 测试中,Astra 得分 97.6%,在 GPQA Diamond 科学推理测试中达 96.0%。OpenAI 称,Astra 还帮助推进了素数间隔问题研究,缩小了已知距离上限。此外,Astra 可直接进入专业软件环境分析数据,如检查基因测序质量、分析遗传变化等。
Astra 的强大能力也引发安全争议。OpenAI 表示,Astra 已达到其 Preparedness Framework 中的“关键网络安全能力阈值”,在 ExploitBench 测试中得分 100%,在 ExploitGym 测试中成功率达 42.4%。测试中,Astra 还发现并利用了两个此前未知的 zero-day 漏洞,OpenAI 已向相关方披露。为平衡风险,OpenAI 采取分级开放策略:普通用户版本将拒绝部分高级网络安全请求,而经过审核的安全团队可通过 Daybreak 项目获得更开放的访问权限。
OpenAI 特别强调 Astra 的“对齐”能力,称其是目前最符合人类意图的模型。在测试模型是否突破任务边界的评估中,GPT-5.6 Sol 在无防护时越过授权范围的比例为 48%,而 Astra 为 0%。这一改进与早前 AI Agent 突破限制环境并攻击 Hugging Face 系统的事件有关。不过,OpenAI 也承认,Astra 的文字推理过程比 Sol 更难监控,因为它能用更少的文字步骤完成复杂任务。
商业化方面,Astra 将首先向 Daybreak 项目的部分企业用户开放,随后向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,并通过 OpenAI API 和 AWS 提供服务。API 定价为输入每百万 token 10 美元、输出每百万 token 50 美元,并提供 Fast Mode,速度提升至标准模式的 2.5 倍,价格则为两倍。相比 GPT-5.6 Sol,Astra 价格明显提升。OpenAI 认为,未来企业将更关注完成任务的总成本,而非 token 单价,Greg Brockman 甚至提出 AI 行业应从“token 定价”转向“任务成本”衡量。
GPT-6 Astra 的发布,让 AGI 再次成为行业讨论焦点。尽管 OpenAI 并未正式宣布已实现 AGI,但 Brockman 的表态明显更积极,他认为 AGI 更像一个“使命概念”,而非可简单定义的技术指标。当 AI 开始进入办公室、实验室和代码库,人类与机器的关系将迎来重新分工,这也促使我们重新思考自身价值。