全球第一,智元 WITA-Omni Preview 具身大模型登顶 DailyOmni 全模态理解榜单
最新 7 月 28 日消息,据智元 AGIBOT 微信公众号消息,近日,具身全模态理解权威榜单 DailyOmni 最新评测结果揭晓,智元自研的具身原生全模态大模型 WITA-Omni Preview,凭借领先的音视频联合理解与时序推理能力,以 85.21 分综合成绩登顶榜首,超过千问、Gemini、豆包、英伟达等国内外领先模型,并在八项细分指标中的六项取得第一。

据最新了解,DailyOmni 是行业公认的检验音视频时序对齐、跨模态联合推理能力的权威第三方榜单。不同于面向图文、短视频的常规评测任务,该榜单大量采用真实开放环境音视频素材,核心考验模型融合视觉画面、环境音频信息,精准识别声画对应关系、事件先后顺序及跨模态语义的综合能力,高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知能力。

官方称,WITA-Omni 领先的关键,在于它并不是简单地把聊天模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达,从 Thinker–Talker 范式上进一步扩展出面向具身输出的 Thinker–Talker–Actor 架构。
WITA-Omni 的领先并非单纯依靠模型规模,而是来自一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。在中训练阶段,WITA-Omni 使用总计千万小时级的开源和自有多模态数据,将强文本、视觉底座进一步升级为能够“听得见、看得懂,并进行音画联合推理”的全模态模型。
此外,公开音视频数据通常缺少真实交互中的轮次切换、响应时机、动作和表情信息,难以直接训练端到端具身交互模型。为此,智元构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留声音、画面、语言、动作和表情之间天然的时序关系。
《全球第一,智元 WITA-Omni Preview 具身大模型登顶 DailyOmni 全模态理解榜单》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
ESP32-AI 亮相:8MB PSRAM 运行 2890 万参数模型,设想离线调配出最佳咖啡
科技媒体 Tom's Hardware 昨日(7 月 27 日)发布博文,报道称乌克兰开发者 Slava S 发布 ESP32-AI 项目,针对乐鑫(Espressif)的 ESP32-S3 开发板,成功部署 2890 万个参数的本地 AI 模型。... -
国内首个能“飞檐走壁”的具身智能特种机器人亮相,还有“六臂玄甲”
该机器人支持攀爬作业,它可以垂直墙面飞檐走壁,左手打磨、右手焊接,高效协同,集人形双臂、磁吸爬壁、大模型智能于一体,专攻化工储罐、船舶、能源设施等大型钢结构外壁。#飞檐走壁机器人# #国内首个具身智能特种机器人#... -
首届 CMG 世界机器人登泰山大赛启动
大赛将以泰山红门至中天门的登山步道为赛道,让泰山的复杂环境成为具身智能的实景实训“天然极限试验场”,考验机器人感知决策、操作执行、环境适应和可靠运行能力。... -
比亚迪人形机器人确认 8 月在郑州“上岗”
据财联社今天(28 日)下午报道,比亚迪方面证实,人形机器人产品将于 8 月正式亮相。公开信息显示,“迪空间”也是比亚迪新技术、新产品的首发场景,郑州是首座迪空间的所在地。... -
争夺印度开发者市场:Cursor 推出月付 649 卢比 Start 套餐
Cursor 表示印度已是其全球第三大市场,过去一年内 Cursor 印度客户增长到了原来的三倍,印度的高级用户数量也高于世界上任何其他市场。...












