清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据

星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。
好家伙,世界动作模型(WAM)赛道,中国团队直接冲到了全球第一?!
而且,GPT-6-Astra、Physical Intelligence的π0.5、英伟达GR00T-N1.7等一众全球头部具身模型,这次都被甩在了身后。
出手的是一家中国机器人公司——清华唯一持股的嫡系具身公司,星动纪元。
近日,星动纪元自研的世界动作模型VPP2,一举登顶RoboDojo仿真榜单。
综合平均成功率32.26%,综合平均得分39.26分,两个指标双双第一。

RoboDojo号称具身智能界的「珠穆朗玛峰」,由香港大学MMLab牵头,全球近20所顶尖学术机构共同建设。
它专挑机器人不擅长的地方出题:换个环境,还会不会干活?东西摆歪了,还能不能抓准?任务做到一半,还记不记得前面发生了什么?
总之,想靠刷熟练度蒙混过关,没那么容易。
星动纪元VPP2不仅拿下综合第一,在泛化能力、精细操作、记忆能力三个维度上,也拔得头筹。

据说,这次VPP2没有额外加数据,也没用Agent RSI等增强手段,仅靠「标准数据集」,就把一众高手给卷了下去。
这代表着VPP2模型本身足够强,性能提升来自预训练,基座足够泛化,因此不靠外挂增强策略,不靠扩充数据「刷分」。
不是,哥们儿,这么夯的模型到底是怎么练出来的啊???
我们往技术路线里扒了扒,你别说,VPP2这次的突破,还真有点东西。
它瞄准了世界动作模型的一道老大难问题:预测错了,动作就跟着错。
VPP2给出的解法,是先把视频预测能力练到足够强,再让机器人在陌生环境里真正动起来。
从目前披露的多项测试结果来看,VPP2已经成为世界动作模型WAM赛道中,最有竞争力的选手之一。
机器人Demo越做越炫,模型榜单分数也越来越高,但真要问一句,谁的机器人更聪明、更能干活?
比如让机器人抓杯子。在训练时见过的桌面上,它可能百发百中。结果换个杯子、挪下位置,立刻开始怀疑人生。
更别提那些需要连续执行多个步骤的任务了。

这也是为什么,RoboDojo这套评测值得关注。
本文图片来自互联网,仅供学习交流使用,版权归原作者或原平台所有。如认为图片侵犯了您的权益,请联系我们删除。

