8月22日,第二届世界人形机器人运动会百米大型组预赛中,宇树机器人跑出12.41秒、小组垫底,而一年前该赛事400米冠军正是宇树。就在两天前,宇树创始人王兴兴在WRC主论坛上重申其对具身智能“ChatGPT时刻”的预判:快则2到3年、慢则5到10年——届时机器人泛化能力将使其在80%的陌生场景中,通过语音或文字指令完成约80%的任务。赛场表现的巨大落差,迅速将宇树科技推上舆论风口浪尖,“具身智能骗局论”再度升温,质疑其是否配得上“领衔者”位置,以及大模型驱动路线是否可行。
本文作者陈宥文(智讯智库)评论认为,所谓“ChatGPT时刻”被广泛误用。2022年11月ChatGPT发布后,5天用户破百万、两个月月活过亿,成为史上增长最快的消费级AI应用。但作者指出,这一时刻并非单一技术突破,而是能力涌现、边际成本骤降、病毒式传播三条曲线同时触达阈值的共振产物。GPT-3早在2020年就具备粗糙可用能力,直到两年半后才完成共振。作者强调,具身智能的物理交互属性使其难度远高于大语言模型——语言模型预测下一个词元,离散且容错;机器人输出连续力矩,零容错,错一步就摔碎杯子。
作者将具身智能的发展拆解为三条曲线,并逐一算账。能力曲线卡在跨场景泛化:固定基准测试中,头部VLA模型(如OpenVLA-OFT、智元GO-2、Being-H0.5)在LIBERO等任务上成功率已达97%-99%,但换场景后指标明显下滑——GO-2在VLABench得分仅47.4,Being-H0.5在RoboCasa成功率53.9%。更极端的测试显示,模型学会“A→B”和“A→C”后,重组为“B→C”的成功率骤降至0%-15%。作者认为,会执行与会在陌生条件下组织执行之间,隔着一层真正的具身推理能力。
成本曲线卡在真机闭环。作者引用DROID项目为例,为产出7.6万条成功轨迹,动用18台机器人、50名采集者、13家机构,跨三大洲耗时12个月。虽然合成数据可大幅降低成本——英伟达11小时生成78万条合成轨迹,RoboDream实验显示无实物遥操作比传统方式快2.2倍——但将100条异域DROID轨迹直接搬到目标环境,成功率竟为0%。作者强调,生成模型无法自动消除本体、视角、物体等域差异,真机校准与验证仍是刚性成本。
扩散曲线卡在跨客户复制。作者称,上半年行业出货量同比增长近300%,但生产级场景占比不足两成,可跨厂复制的标准化任务包尚未形成。作者认为,具身智能的“ChatGPT时刻”不会是单点爆发,而会分层落地:先形成开发者层的基座模型标准,再出现客户层的可复制任务包,最后才是公众层面的通用途径,整体是渐进式渗透而非一夜奇观。
作者还指出,9月3日OpenAI发布GPT-6 Astra,在ARC-AGI-3测试取得99.9%成绩,但并未带来第二个“ChatGPT时刻”,说明能力跃升不足以单独构成产业时刻。文章最后提示,具身智能处于技术验证向规模化落地的早期阶段,跨场景泛化、交付经济性、商用复制成熟度可能不及预期,但长期产业逻辑具备支撑,实际节奏需综合多重变量判断。