天脉资讯
财经快讯 价值公司 财经人物 IPO解读 热门赛道 经济解码 科技业界 文化艺术 消费零售 大燕公益 商业快讯

智元WITA-Omni登顶DailyOmni:人形机器人交互从“生硬”迈向“自然”新篇

2026-07-29来源:快讯编辑:瑞雪

在科技飞速发展的当下,人形机器人正逐渐从实验室走向实际应用场景,然而,交互生硬的问题却如同一道难以跨越的沟壑,阻碍着它们真正融入人类生活。近日,具身全模态理解权威榜单DailyOmni公布了最新评测结果,智元自研的WITA - Omni Preview以85.21分的综合成绩一举登顶,超越了千问、Gemini、豆包、英伟达等18款国内外主流模型,在八项细分指标中更是斩获六项第一,这一成绩为解决人形机器人交互难题带来了新的曙光。

在人工智能领域,大模型榜单层出不穷,但DailyOmni榜单却独树一帜。常规的多模态榜单多聚焦于图文问答,主要考验模型对图片内容的识别以及文字问题的回答能力,更适用于线上内容消费场景。而DailyOmni的测试集则大量采用开放环境的真实音视频素材,着重考核模型三个关键能力:能否将画面中的人物与声音精准对应,能否理清事件发生的先后顺序,以及能否结合视听信息进行跨模态推理。这就好比普通榜单考的是“看图说话”,而DailyOmni考的是“察言观色”,更贴近真实社交场景中人类所需的感知能力,也是人形机器人在家庭、工厂、公共服务等场景中最为刚需且欠缺的感知基础。

过去,模块化机器人方案存在诸多弊端。视觉、语音、决策分属不同模块,数据在多个系统间流转,不仅延迟高,还常常出现“声画错位”的现象。例如,画面中的人已经移动到左边,语音识别却还停留在上一个指令,机器人的反应总是慢半拍。在多人同时说话的场景下,机器人更是难以精准定位交互对象,经常答非所问。DailyOmni榜单也因此被业内视为具身智能感知能力的“试金石”,智元WITA - Omni能够登顶,意味着在机器人急需的视听时序理解能力上占据了领先地位。

WITA - Omni之所以能在时序推理方面表现出色,关键在于它采用了面向具身场景的三层架构:Thinker(思考) - Talker(说话) - Actor(动作),跳出了“把聊天大模型装进机器人”的传统思路。以往的机器人交互如同一条流水线,视觉模块处理画面,语音模块转写文字,大模型生成回答文本,最后运动控制模块转化为肢体动作和表情。各环节依次进行,前一步未完成,后一步就无法启动,不仅延迟高,各模块还容易“配合失误”,导致交互生硬。而WITA - Omni将感知、决策、表达整合到同一个端到端模型中,共享同一套认知状态。Thinker作为核心,将视觉、音频、文本统一映射到同一语义空间进行联合推理;在此基础上,Talker流式生成语音,Actor同步输出动作和表情,三者并行推进,共用同一时间轴,实现了“边想边说,边说边动”,与真人聊天状态更为接近。比如用户呼唤机器人名字时,它能一边顺着声音方向转头,一边开口应答,眼神和动作同步跟上;讲解物品时,手指指向位置和嘴里说的内容精准对应,避免了“指东说西”的错位感。这种一体化设计有效解决了行业长期存在的“交互割裂感”,在多人对话场景中,模型能通过声画同步判断说话者和目光方向,从而确定回应对象,不再对着空气作答;在持续交互中,也能判断何时倾听、何时插话,更符合人类社交习惯。

同样是多模态大模型,为何专门做具身的在时序交互上更具优势?答案在于数据和训练方法。普通公开音视频数据集大多仅标注画面和语音内容,如“说了什么、发生了什么”,却不会标注“何时回应、对谁回应、做什么表情动作”。用这类数据训练出的模型虽能答对问题,却不懂交互的“分寸感”,如同只会背书却不知聊天时机的人。为解决这一问题,智元构建了一套以人为中心的全模态数据集,完整保留真实交互场景中声音、画面、语言、动作、表情之间的时序关系,将人类社交的“节奏”融入训练数据。在此基础上,模型采用三阶段训练策略:先用监督微调打基础,让模型学会基础视听理解和表达;再用同策略蒸馏方式,使模型在“有额外信息辅助”和“无辅助”状态下对齐,提升复杂上下文推理精度;最后用强化学习优化交互决策,奖励信号不仅包括“答案正确”,还涵盖时间点、交互对象、是否主动回应等社交维度指标。这相当于教人社交,不仅要教说正确的话,还要教察言观色、把握时机,这也是WITA - Omni与普通全模态模型的核心区别,其训练目标从“回答准确”升级为“交互自然”。

随着人形机器人运动能力逐渐成熟,行业竞争重心正从“走得稳、抓得准”向“交互自然、融入人类场景”转移。此前在WAIC 2026上,多家厂商展出的人形机器人虽能完成行走、抓取、搬运等动作,但人机交互仍显生硬,多数停留在“指令 - 执行”初级阶段。不过,高质量具身交互训练数据稀缺仍是行业瓶颈。智元千小时级的专项数据集虽覆盖典型交互场景,但面对家庭、工厂等复杂多变的真实环境,数据的丰富度与泛化性还需在实际落地中持续扩充。

智元WITA - Omni登顶榜单,释放出一个重要行业信号:具身智能竞赛已从单维度运动能力比拼进入综合交互能力下半场。如今主流产品运动能力已达可用门槛,接下来谁能让机器人更自然融入人类环境,谁就能获得下一阶段入场券。从全球范围看,特斯拉Optimus、Figure 01等产品都在加速端到端多模态交互研发,试图让机器人从“执行命令的工具”变为“能协作的伙伴”。智元此次在具身全模态榜单上领跑,表明中国厂商在具身认知算法层面已进入全球第一梯队。对智元自身而言,WITA - Omni是其“三智一体”架构中交互智能的核心底座,后续将与运动智能、作业智能联动,支撑机器人在更多场景落地。但从榜单成绩到真实商用,还有漫长的工程化路径要走,算力成本能否降低、真实场景稳定性能否达标、量产时体验能否一致,都是比跑分更现实的考验。

千方科技AI业务新进展:双大模型赋能,打造全场景行业AI智能体集群
总结而言,公司不仅拥有软硬一体的“云-边-端”产品体系,更率先以“鲲巢”和“梧桐”双轮驱动,将AI技术升维为可自主协同、持续进化的不同场景的“行业AI智能体”集群,并在智慧交通与智慧物联等领域实现了规模化商业…

2026-08-11

马斯克“Terafab”芯片工厂来袭,超大规模与创新设计引领未来
Terafab项目标志着美国在高端芯片制造领域一次前所未有的战略布局,最终总投资可能高达1190亿美元。 马斯克于8月9日在X平台发布了Terafab的概念渲染视频,配文称它“将成为地球上最大、最有价值的建…

2026-08-11

千问开放第三方智能体:AI伙伴开启理解用户意图新征程
从目前阿里巴巴千问开放平台的设计来看,未来AI伙伴的“记忆”可能会由两个层面组成:一类是平台级的水平记忆,沉淀在千问这样的个人AI入口中,负责理解用户的长期偏好、行为习惯与整体需求;另一类是垂直场景中的专业…

2026-08-11

蚂蚁领投戴盟机器人:触觉智能新突破,全球首个“物理交互脑”引领变革
沿着“先建立数据入口,再走向物理智能”的技术路径持续攀登,戴盟于近期正式推出全球首个触觉锚定世界模型Daimon-TWM(Tactile-grounded World Model),以原生触觉贯穿理解、推…

2026-08-11

硅臻芯片联合中科大实现片上MBQC突破 通用光量子计算迈向新里程
为此,研究团队提出一种基于测量的量子计算(MBQC)技术路线下的纠缠态资源制备方法,基于“高维扩展-路由-逐层量子测量”的资源扩展思路,利用单个光子的路径自由度进行高维编码,将复杂的多光子态制备问题转化为对单…

2026-08-10

AI赋能科研新范式:切问学术Agent如何破解“确定性劳动”困局?
先Google Scholar搜一轮,筛出20篇看起来相关的;下载全文,发现其中8篇被付费墙挡住;把剩下的12篇扔进Zotero,逐篇读摘要,挑出5篇精读;精读时发现某篇实验设置跟自己的场景不匹配,又回去搜替…

2026-08-10

生物节律光度测定监测系统:解锁昼夜节律研究高通量动态监测新路径
各个检测通道支持独立启动、暂停;实验进程中可临时中断信号采集,完成样本干预处理后继续记录数据,完整保留干预前后全部时序数据,不影响后期统一分析,十分适合各类干预对照实验开展。 内置专业信号补偿算法,能够自动…

2026-08-10

深度求索“打新”宇树科技,王兴兴首谈合作:三大领域携手共进
据中国基金报消息,宇树科技董事长、总经理兼首席技术官王兴兴在会上首次回应称,深度求索参与宇树科技IPO战略配售,是基于双方签订的《战略合作备忘录》。 同时,深度求索将为宇树科技提供具有市场竞争力的商业合作方…

2026-08-10

澳玛特冲刺北交所:28岁董事长领衔,家族成员共掌高端工业母机企业
本次IPO的辅导机构为东吴证券股份有限公司,律师事务所为浙江天册律师事务所,会计师事务所为立信会计师事务所(特殊普通合伙)。 股权方面,公司的共同控股股东为夏慧丽、王静、卢锦伟、胡微梅,分别持有公司43.…

2026-08-10