乐聚机器人今日宣布推出面向工业场景的垂域具身智能模型 KUAVO VLA。该模型以通用VLA基础模型为能力起点,使用 600+小时 的KUAVO同构型真机数据进行中训练,将本体适配、基础操作和工业场景的共性能力沉淀到模型中。据乐聚介绍,在KUAVO VLA赋能下,不少工业场景可实现约 一倍 的提效,某些任务成功率甚至达到 100%。
在具身智能领域,预训练和后训练是常见范式,但乐聚此次强调的 中训练(Mid-train) 却鲜有公司提及。预训练的VLA模型在具体场景中往往无法发挥全部智能,而后训练则面临时间和成本门槛,且技能训练环节容易出现数据采集、训练和调试的重复工作。乐聚认为,中训练或许是VLA落地提效的破局良方。
KUAVO VLA被定义为“垂域模型”,即通用基模与具身技能之间的“中间层”。乐聚先将KUAVO本体能力和工业场景中的共性能力训练进模型,再将具体技能的学习范围收敛到工业场景,从而获得更高的能力起点。模型详细训练了 100个“工业共性能力”,包括分拣、搬运、上下料、装配等典型操作,使模型能快速依靠“原子动作”完成任务,甚至实现能力泛化。
与跨本体混合训练不同,KUAVO VLA的训练数据全部来自KUAVO单一构型,使模型能持续学习同一套动作空间、运动特性和控制规律,减少不同本体数据差异的干扰,从而显著降低推理误差,提升执行效率。
在评估方面,KUAVO VLA的测试体系共设 25项任务,包括20项定制化工业任务和5项来自公共任务集GM100的任务,对照模型为 π 0.5、GR00T N1.7和Lingbot-VLA 2.0 三种通用基模。综合结果显示,KUAVO VLA整体任务成功率达 48.27%,过程分达 74.51%,两项指标均位列第一。相较基模Lingbot-VLA 2.0(任务成功率16.27%、过程分42.06%),KUAVO VLA成功率提升 32%,过程分提升 32.45%。成功率与过程分同步提升,说明垂域训练不仅影响任务完成与否,也改善了执行过程,真机运行中动作平滑性、决策稳定性与执行一致性均有提升。
乐聚常务副总裁柯真东表示,未来会有很多具身开发者深入行业,在场景中调出相应技能,乐聚将提供平台、模型和工具链等支持。乐聚已举办多场具身开发比赛,并为二次开发者配置工具链、机器人培训,还设有专门服务团队,端到端帮助开发者解决问题。柯真东认为,对二次开发团队而言,能让他们赚到钱的平台就是最好的平台。
当前许多开发者面临后训练耗时耗力、数据需求大、任务迁移困难等问题,导致工作重复、算力浪费。KUAVO VLA的出现有望改变这一局面,使技能开发更高效、门槛更低、过程更快、效果更好。柯真东强调,为二次开发提供更好的环境,是乐聚未来在具身智能大生态中的核心竞争力。
乐聚表示,KUAVO VLA的诞生不仅是其在具身版图上的进展,也是行业在具身大脑技术范式上的一次新探索。当更多开发者实际受益于KUAVO VLA,垂域模型方案或将成为一种主流路径。