智元自研的具身原生全模态大模型 WITA-Omni Preview 在权威第三方榜单 DailyOmni 最新评测中,以 85.21分 的综合成绩登顶榜首,并在八项细分指标中的六项取得第一。这一结果凸显了智元在音视频联合理解与时序推理方面的技术实力。

DailyOmni 是行业公认的检验音视频时序对齐、跨模态联合推理能力的权威榜单。与面向图文、短视频的常规评测任务不同,该榜单大量采用真实开放环境的音视频素材,核心考验模型融合视觉画面、环境音频信息,精准识别声画对应关系、事件先后顺序及跨模态语义的综合能力。这些能力高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知。

智元作为具身智能领域的参与者,其 WITA-Omni Preview 模型的此次表现,反映出其在多模态感知技术上的积累。该模型若能持续优化,有望为智元的人形机器人产品提供更强大的环境理解与交互基础,从而在工业、服务等场景中提升实用性。不过,榜单成绩仅为单一维度的技术评估,实际产品落地还需考虑成本、稳定性及场景适配等因素。