天脉资讯
财经快讯 价值公司 财经人物 IPO解读 热门赛道 经济解码 科技业界 文化艺术 消费零售 大燕公益 商业快讯

成立不足四月,莫刻机器人凭LJM模型冲榜WorldArena全球第二

2026-07-31来源:快讯编辑:瑞雪

在机器人技术快速发展的今天,具身智能领域正面临一个关键挑战:如何让机器人真正理解物理世界的运行规律。当前主流的世界模型虽然能生成逼真的视频画面,却难以准确预测机械臂与环境的真实交互效果。这种"画面精美但物理失真"的现象,暴露出行业在模型设计上的根本性缺陷。

成立仅三个月的中国初创企业莫刻机器人,凭借其创新的LJM(Latent Joint-conditional Model)架构,在全球权威评测平台WorldArena上以匿名身份斩获总榜第二名。该模型在LIBERO机器人操作基准测试中,以89.17的运动质量、92.60的三维精度和85.93的可控性得分,全面刷新四项视觉指标纪录。更令人瞩目的是,这个突破性成果仅使用32张显卡就完成了全流程训练。

传统模型陷入"画面优先"的误区,导致物理交互预测严重失真。测试数据显示,具有电影级画面生成能力的通用视频模型Wan2.2仅得62.35分,与头部专用模型存在明显差距。问题根源在于现有方案将99%的计算资源用于优化画面美观度,却忽视了夹爪接触、物体形变等关键物理细节——这些真实交互信息在视频中往往不足1%的像素占比。

LJM模型通过"双脑协作"架构破解了这个困局。其推理专家模块基于改进的Qwen3-VL-2B模型,专门负责在隐空间推演交互剧本:机械臂的运动轨迹、接触时间点、物体抓取结果等关键物理参数。世界建模专家则采用改造后的Wan2.2-TI2V-5B视频扩散模型,将推演结果转化为流畅的视频画面。这种"先理解后生成"的流程设计,从机制上避免了物理逻辑与视觉呈现的割裂。

为确保物理预测的准确性,研究团队为每个推理token设定了三维坐标预测、视觉状态变化、光流运动方向三重监督目标。通过Mixture-of-Transformers共享注意力机制,两个专家模块在Transformer的每一层都能实时交换信息:视频生成模块及时获取最新推理约束,推理模块同步调整推演结果。这种深度耦合的设计,使模型能同时满足毫米级动作精度和高层物理解释的需求。

针对世界模型普遍存在的记忆衰退问题,LJM引入价值驱动时序条件(VTC)机制。通过算法筛选关键历史帧构建记忆库,使模型能准确维护交互后的物体状态。对比实验显示,启用VTC后物体消失或重复生成的问题减少67%,空间关系预测准确率提升42%。这种长时记忆能力,为机器人执行复杂序列任务提供了可靠保障。

在LIBERO基准测试中,LJM在PSNR、SSIM、FVD和LPIPS四项核心指标上全面超越现有方法。研究团队强调,单纯的视频生成能力不等于有效的机器人世界模型,只有将动作信号转化为包含语言、场景和未来状态的交互变量,才能构建真正可控的动态预测系统。这一认知突破,为具身智能的工程化落地开辟了新路径。

据悉,莫刻机器人从项目启动就同步开展分布式训练优化和国产算力适配,全流程在阿里云真武810E平台上完成。这种软硬件协同设计理念,使模型在保持高性能的同时,具备快速工程化部署的潜力。随着LJM架构的推广应用,机器人有望通过在虚拟世界中的"预演学习",显著缩短现实场景中的适应周期。

马斯克旗下SpaceXAI推Grok新语音模型,性能登顶,价格优势明显引期待
在权威评测机构Artificial Analysis的语音到语音指数(Speech to Speech Index)中,Grok VoiceThink Fast 2.0高推理能力版本以82.9%的得分位列…

2026-07-31