OpenAI 发布新一代模型 GPT-6 Astra 后,其影响已从语言与多模态领域蔓延到具身智能。社交平台上出现不少网友测试用 Astra 控制机械臂的视频,随之而来的是「具身智能要被通用语言大模型降维打击」的讨论。9 月 10 日,在 2026 外滩大会「物理智能」论坛上,自变量机器人创始人兼首席执行官 王潜 对这一话题给出了自己的判断。

王潜认为,「降维打击」说法背后真正的担忧,是基础模型能否凭借在其他领域积累的通用智能,直接泛化到具身智能上。他的观点是,目前这种可能性不大。他解释说,GPT 本身已经升级为多模态模型,OpenAI 此前曾大量采购机器人数据,Astra 版本的训练中已加入机器人数据,因此它能控制机械臂并不令人意外。

在他看来,智能的本体存在于数据与评估之中。训练阶段,模型更多扮演「蒸馏器」的角色,而部署阶段则更像一个「容器」。他由此提出,今天要打造前沿 AI 系统,模型本身发挥的作用已经变小;语言模型的进步,一部分来自模型规模扩大,但更多还是源于数据质量的提升——投入在数据生产、筛选、验证、标注等环节的工作,才是推动 AI 系统发展的关键。

王潜还以语言模型的演进路径作类比。他指出,由于代码数据最容易生成和验证,代码能力最先被攻克,之后才是 3D 与视频生成。他据此推演,如果 OpenAI 要做具身智能,一系列问题会随之而来:是否要像具身智能企业那样依赖数据与验证的基础设施、是否要自研硬件等。这些事情的难度并不会因为基础模型的优势而降低,反而具身智能公司可能握有实质性优势。

他补充说,即便当前视频生成模型已经表现不错,这种能力也没有直接转化为机器人在动作控制上的优势。不过,王潜也认为,GPT-6 操控机器人的表现反而给具身智能行业带来启示,例如通用数据预训练确实有效。他判断,最后可能出现的情况是,OpenAI 把数据融入通用大模型,但仍无法在机器人上以合理速度完成推理与部署;行业里依然需要专门的具身大模型来承担这一任务。

从行业视角看,这场讨论的实质是两条路线的分工问题:通用大模型擅长语义理解与多模态生成,而具身智能需要在真实物理环境中完成感知、决策与执行的闭环,对实时性、数据采集与硬件适配的要求截然不同。王潜的表态代表了具身智能创业公司的一种典型立场——通用模型的进步可以成为基础设施,但难以直接替代垂直领域的工程积累。这一判断是否成立,仍有待后续产品与落地数据检验。