机器人初创公司 Generalist AI 于 8 月 20 日发布了其最新 AI 模型 GEN-1.5,该模型能够仅凭一次演示就让机器人学会执行新任务,无需任何传统意义上的训练。据公司介绍,用户只需提供一段 3 至 12 秒 的演示视频,该视频会被加载到模型的上下文窗口中,作为“物理提示”(physical prompt)——相当于模型的短期记忆。此后,机器人即可直接执行该任务,无需任何额外训练。

在公司的内部测试中,GEN-1.5 在十项任务(如打开罐子、从钱包中取钱等)上的平均成功率为 59%。如果使用五分钟的数据进行十步训练,成功率可提升至 83%。此外,该模型还支持将两个提示串联成更长的任务序列,并能利用仿真环境中的演示,以及部分模仿人类手部动作。

Generalist AI 表示,这些能力并非通过显式训练获得,而是在超过八个月的交互数据预训练过程中“自发涌现”的。公司声称,尽管其他研究团队此前也展示过类似的上下文学习能力,但仅限于少数任务类型,而 GEN-1.5 是首个在广泛任务范围内实现这一功能的模型。

不过,值得注意的是,目前所有测试结果均来自公司自身,尚未经过独立验证。所展示的任务也相对简单且耗时较短,因此该技术在复杂、长时程任务上的表现仍有待检验。

这一进展反映了具身智能领域的一个新趋势:通过大语言模型式的“上下文学习”来减少机器人编程和训练成本。如果该技术得到验证,可能对工业自动化、家庭服务机器人等领域产生深远影响。然而,从实验室演示到实际部署之间仍有相当距离,行业观察者普遍认为,此类模型的泛化能力和可靠性仍需更多第三方验证。