智元大模型登上DailyOmni全模态理解榜单首位

2026-07-28 17:56:38
分享
AIME

问财摘要

1、近日,具身全模态理解权威榜单DailyOmni最新评测结果揭晓,智元自研的具身原生全模态大模型WITA-Omni Preview,凭借音视频联合理解与时序推理能力,以85.21分综合成绩登陆榜单首位,在八项细分指标中的六项取得第一。 2、WITA-Omni并不是简单地把聊天模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达。
免责声明 内容由AI生成
文章提及标的

7月28日,记者获悉,近日,具身全模态理解权威榜单DailyOmni最新评测结果揭晓,智元自研的具身原生全模态大模型WITA-Omni Preview,凭借音视频联合理解与时序推理能力,以85.21分综合成绩登陆榜单首位,在八项细分指标中的六项取得第一。

对于人形机器人(886069)交互能力来说,以往的全模态模型大多优先适配线上数字内容交互,而机器人身处持续变化的物理空间,不仅需要同步“看见画面、听见声音”,更要实时判断声音归属主体、事件发生顺序,识别交互对象、找准响应时机,传统模块化机器人方案很难完成这类时序耦合的复杂推理任务,也是长久以来人机交互生硬割裂的关键瓶颈。

对具身智能机器人而言,“理解”和“回应”并不是两个割裂的步骤,而是一个持续发生的物理过程。机器人需要一边观察环境、一边接收声音;一边组织语言、一边配合动作和表情。在多人、开放且持续变化的真实环境中,它还必须进一步判断:是否应该回应、什么时候回应,以及正在与谁交互。

据智元方面介绍,WITA-Omni并不是简单地把聊天模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达。

同时,WITA-Omni一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。在中训练阶段,WITA-Omni 使用千万小时级多模态数据,将强文本、视觉底座进一步升级为能够“听得见、看得懂,并进行音画联合推理”的全模态模型。模型不仅学会“回答正确”,还进一步学会在真实场景中判断:该不该回应、何时回应,以及回应谁。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME