小米发布了其机器人AI基础模型 Xiaomi-Robotics-1,该模型遵循与大语言模型相似的扩展规律:性能随训练数据量的增加而提升。但与传统大模型依赖互联网文本数据不同,机器人AI面临独特的数据瓶颈——有用的机器人运动数据极其稀缺。
为突破这一瓶颈,小米在数据收集阶段几乎完全放弃了实体机器人。研究团队使用便携式手持夹持器,配备摄像头,由人类直接操作并录制各种操作任务。这些任务在厨房、办公室、商店、工厂车间和户外空间等超过 1700 种不同环境 中完成,最终积累了 超过 10 万小时 的运动记录。
如此庞大的数据集带来了新的挑战:每条记录都需要文本描述供模型学习。手动标注不切实际,小米转而使用另一个AI模型自动为每个运动片段生成描述,整个数据集的标注工作在大约 两周 内完成。随后,小米将训练成果迁移至实体机器人,包括轮式模型和双臂系统,并需要处理手持夹持器与机器人手臂之间的差异。
测试结果清晰地表明:更多训练数据带来的性能提升远大于增加计算量。研究人员认为,机器人AI的进步将主要取决于收集更大、更多样化的数据集。这一发现与今年3月初关于视觉数据的研究结论一致。对于语言模型,模型规模与数据量通常需大致同步增长以优化固定计算预算;但当模型处理图像而非文本时,增加数据的帮助远大于扩大模型规模。
在实体机器人测试中,随着训练数据量的增加,模型在陌生环境中的成功率从约 25% 提升至 75%。研究人员表示,尚未观察到数据量增加导致性能提升停滞的迹象。在标准机器人AI基准测试中,Xiaomi-Robotics-1 取得了迄今最佳成绩。在一项演示中,一个机器人据称在无人协助下完成了整理行李箱的任务,耗时超过十分钟,需要机器人横跨整个房间。
该基础模型在快速适应新任务方面表现出色。在四项测试任务中——包括包装手机、将衣物放入洗衣机、向打印机送纸以及将物品装入箱子——每个任务仅使用不到 10 小时 的训练数据,模型平均成功率即达到 75%。相比之下,Physical Intelligence 的竞争模型在同一测试中仅达到 40%。小米表示,其模型在处理纸张等柔软、可变形材料以及需要移动的任务时表现尤为突出。在 RoboCasa365 排行榜上,Xiaomi-Robotics-1 以显著优势领先,尤其是在未见过的复合任务上。
机器人数据问题仍是该领域研究的焦点,不同团队正探索截然不同的解决方案。今年5月一项关于世界动作模型的调查回顾了约100项研究,发现遥操作数据精确但成本高昂且局限于少数场景。小米的手持夹持器正是为应对这些限制而设计。与此同时,英伟达、卡内基梅隆大学和加州大学伯克利分校通过 ENPIRE 项目,让AI编码代理自主训练一支由八台机器人组成的队伍学习抓取物体;英伟达还计划通过生成合成训练数据,将机器人数据问题转化为计算问题。中国北京智源人工智能研究院(BAAI) 则采取相反路线,其 Orca 世界模型从 12.5万小时 无动作标签的视频中学习,在五项操作任务上仍能与专门的 pi0.5 模型匹敌。小米的做法是自动化标注并大规模应用,而 Orca 则试图完全消除标签。Physical Intelligence 在这两种方案中均作为参照点,该公司今年4月因 pi0.7 模型声称能泛化但可能只是回忆相似训练数据而受到批评。
小米的发现表明,在机器人AI领域,数据量的扩展比模型规模的扩大更具决定性,但绝对成功率仍然较低,意味着该领域仍有巨大的提升空间。