触觉正在成为具身智能领域的新风口。据第一财经记者不完全统计,自今年7月以来,具身智能触觉赛道至少发生8起融资事件,累计金额超过25亿元,并催生出帕西尼、一目科技两家百亿元独角兽企业,这两家公司最新一轮融资金额均达到10亿元,与机器人本体企业相当。

多模态触觉感知技术企业千觉机器人创始人马道林透露,今年上半年的产品订单量已经是去年全年的“几倍多”。多家投资机构和产业资本正在涌入这一赛道,行业普遍认为,机器人要真正学会“干活”,触觉已成为必选项。

触觉让机器人能干“精细活”

多家触觉赛道企业及机构发布的DEMO视频显示,搭载触觉大模型的机器人能够夹取柔软水果和薯片、在人为干扰下完成叠纸盒、翻书页以及盲摸麻将等操作。智在无界大模型相关负责人李明(化名)介绍,传统机器人依赖腕部摄像头拍摄的视觉画面,当夹爪伸入包中时,摄像头无法捕捉全局,任务容易失败;而拥有触觉的机器人能在夹爪与物品接触时获取更多信息,从而判断如何取出物品,任务成功率更高。

马道林补充说,在将耳机精准放入充电盒的任务中,夹爪抓取时耳机位置会发生偏移,摄像头可能被遮挡,触觉能为判断夹取状态、滑动状态提供关键信息补充。要以近零点几毫米的公差将耳机塞入狭小空间,对机器人要求很高。大晓机器人相关负责人也解释,视觉能判断“手”是否靠近物体,但难以准确知道接触位置、力度是否合适、物体是否滑动以及柔性物体是否持续形变,而触觉能提供接触压力、受力分布、摩擦与滑移趋势等关键信号,让机器人动态调整抓取点、夹持力度和动作策略。

技术路线分化:硬件采集与视频估算

目前,触觉赛道已发展出多种技术路线。硬件设备如触觉手套、传感器可直接采集触觉数据,按传感器原理可分为压阻式、电容式、霍尔效应式等传统主流路线,以及近两年备受关注的视触觉传感器——通过摄像头捕捉受力后软胶(如凝胶)的形变,再用视觉算法重建接触面的三维形变和受力分布。

千觉机器人采用视触觉路线作为自研传感器的主要方向。马道林表示,压阻式、电容式等路线在精度、电磁干扰等方面存在局限,而视触觉路线具有空间分辨率高、抗干扰能力强等优势。团队还通过自研数采设备、数据处理引擎及数据清洗质检体系,为训练机器人交互能力提供高质量数据。此前,千觉机器人发布了VTLA具身触觉模型X-TouchMind V1,以及面向真实物理交互的视触觉多模态具身数据集TacVerse 1k

另一条路线不依赖传感器硬件,而是从人类视频中提取触觉信息。智在无界开发了面向大规模无标注人类视频的密集触觉伪标签系统TactoHand,无需为数据采集者配备触觉手套或额外传感器,即可从人类视频中推断手部与物体交互过程中密集空间点的接触概率和连续接近度。李明解释,该系统通过物理法则、人类先验知识等估算摩擦力、接触面及抓取力度,但估算数据相比硬件采集会损失一定准确性。因此,智在无界在预训练时仍会引入部分硬件采集的高质量数据,其推出的具身基础模型Being-H0.8便结合大规模人类视频与触觉信息,将触觉模态系统性引入隐式世界模型架构。

挑战:数据稀缺与训练范式调整

触觉具身智能模型的训练并不简单。受访行业人士提到,行业内带有触觉模态的数据量较少,马道林判断这类高质量数据规模或在万小时级。采集成本高是重要原因:基于触觉手套或UMI设备的数据采集方案整套可能需数万元,有的甚至十几万元,且部分传感器设备不够成熟,长时间使用可能损坏。李明还指出,触觉手套采集的数据多来自数采工厂,背景和任务单一,准确性高但多样性不足。

视触觉传感器的成本方面,千觉机器人选择从减少更换损耗入手。马道林称,单个传感器价格在一两千元左右,两指夹爪用4个,灵巧手用10个。传感器表面的柔性材料有寿命限制,整体更换成本高,而千觉基于模块化设计,只需替换表面柔性材料,无需重新适配或更换其他高成本部件。近两年客户采购量加大后,产品报价已有所降低。

将触觉数据引入预训练也是一道难题。直接将触觉数据加入大模型,反而可能降低任务成功率。今年斯坦福教授李飞飞参与的一篇论文提到,T-Rex团队把触觉力信号直接拼接到预训练好的VLA模型中,任务成功率有所下降,原因涉及多信息对齐、频率及表征浅等问题。大晓机器人负责人分析,视觉可远距离连续记录,而触觉只有在真实接触时才产生有效信号,还受安装位置、材料形变、摩擦变化、个体差异和传感器漂移等影响。触觉数据真正难的不是采到一个压力数值,而是把数值与视觉、动作、物体状态及任务过程精准对应。其提出的环境式数据采集方案2.0通过ACE Sense Glove、统一时空标定和多传感器同步,将20余种异构信号控制在1毫秒级误差内。

考虑到触觉数据特征和规模,千觉机器人率先探索出训练范式。马道林建议,针对想增加触觉能力的公司,合理方法是先将原有VLA模型能力训练到足够好,再将触觉信息规范化纳入训练。引入触觉信息也推高训练成本,尤其高性能世界模型训练本身成本较高。李明估算,若显式世界模型训练数据规模达50万小时,研发成本低则数千万元、高则上亿元。智在无界选择的隐式世界模型路线一定程度上能降低训练成本。

千觉机器人、智在无界均专注于具身“大脑”研究。千觉定位为触觉基础设施建设者,现阶段收入更多来自数据产品及采集方案,同时探索具身模型场景落地;智在无界则与硬件公司合作为其提供模型支持,并正在进行模型商业落地的POC验证。