智元自研的具身原生全模態大模型 WITA-Omni Preview 在權威第三方榜單 DailyOmni 最新評測中,以 85.21分 的綜合成績登頂榜首,並在八項細分指標中的六項取得第一。這一結果凸顯了智元在音影片聯合理解與時序推理方面的技術實力。

DailyOmni 是行業公認的檢驗音影片時序對齊、跨模態聯合推理能力的權威榜單。與面向圖文、短影片的常規評測任務不同,該榜單大量採用真實開放環境的音影片素材,核心考驗模型融合視覺畫面、環境音訊資訊,精準識別聲畫對應關係、事件先後順序及跨模態語義的綜合能力。這些能力高度貼合人形機器人在真實物理空間開展人機互動所需的核心感知。

智元作為具身智慧領域的參與者,其 WITA-Omni Preview 模型的此次表現,反映出其在多模態感知技術上的積累。該模型若能持續最佳化,有望為智元的人形機器人產品提供更強大的環境理解與互動基礎,從而在工業、服務等場景中提升實用性。不過,榜單成績僅為單一維度的技術評估,實際產品落地還需考慮成本、穩定性及場景適配等因素。