据开发者 cozyblaze 在 X 平台发布的消息,OpenAI 的 GPT-6 Astra 模型已完全自主地通关了经典解谜游戏《传送门》,全程未借助任何人工协助。整个通关过程耗时约 23 小时 43 分钟,模型在设定初始目标后便独立完成了从游戏开始到片尾字幕出现的全部流程。cozyblaze 已将相关代码和文档公开在 GitHub 上,供技术社区查阅和复现。

这次通关并非简单的脚本执行。Astra 通过 MCP(模型上下文协议)与一个经过修改的 SourcePauseTool 工具来操控游戏。该工具会在模型“思考”时暂停游戏进程,期间模型会获取游戏截图、玩家位置和摄像机角度等信息,据此决定下一步操作,随后恢复游戏运行。cozyblaze 发布的演示视频中已将这些思考暂停片段剪去,以呈现流畅的通关过程。

值得注意的是,这次自主通关的算力成本并不低。据 cozyblaze 估算,按 Astra 的官方列表价格计算,整个过程的 token 消耗费用至少为 570 美元。不过,他本人使用的是每月 200 美元的 Codex 订阅服务,因此实际支出远低于此。这一成本对比也侧面反映出,尽管 AI 已能完成复杂的游戏任务,但其运行的经济性仍是实际应用中的关键考量。

cozyblaze 在分享这一成果时,还提到了 OpenAI 早在 2016 年就立下的目标:用单一智能体攻克多种不同的游戏。他认为,尽管当前仍存在诸多问题,但亲眼目睹一个智能体独立通关一款完整游戏,已经让人隐约感受到那个最初愿景的雏形。他更补充了一句耐人寻味的话:GPT-6 Astra 是“我们未来能用到的最差模型”——言下之意,随着技术迭代,后续模型的能力只会更强。

从行业视角看,这次事件展示了大型语言模型在长周期、多步骤任务中的自主规划与执行能力。《传送门》以其独特的空间谜题著称,要求玩家理解物理规则并灵活运用传送门机制,这对 AI 的推理和决策能力提出了较高要求。Astra 能够在不借助人类提示的情况下完成通关,标志着 AI 在复杂环境下的自主性又向前迈进了一步。

不过,也有观察者指出,这类演示更多是技术能力的展示,距离实际商业应用仍有距离。模型在游戏中的成功,部分依赖于为它量身定制的工具接口(如暂停游戏的修改版工具),这与现实世界中开放、动态的环境存在差异。此外,高昂的 token 消耗也提示着成本瓶颈。但无论如何,这次实验为 AI 智能体的研究提供了一个有价值的案例,也让人对下一代模型的潜力充满想象。