发展趋势量子位5/10

看了20万小时「人类干活实录」,机器人悟了

By 一水

看了20万小时「人类干活实录」,机器人悟了
图源:量子位

AI 摘要

黎曼动力正式发布Riemann-1.0

原文正文

看了20万小时「人类干活实录」,机器人悟了

黎曼动力正式发布Riemann-1.0

刚刚,机器人圈公认最难的「家务大考」RoboCasa-365,榜首换人了。

新纪录62.6%,比之前的SOTA直接高出8.4个百分点。

要知道,这个榜上大部分模型还在50%以下挣扎。

更有意思的是,登顶的这个名字,之前几乎没人听说过:Riemann-1.0,黎曼动力。

一查,好家伙,首秀。这个模型才刚在WAIC 2026上正式发布。

跑分说明不了一切,我又去翻了它的真机视频。

随手点开一段机器人收拾餐桌的demo,只能说,榜单没骗人。

薄薄贴在桌面上的勺子,夹得起来;碗里剩的汤,知道先倒了再收;完事了还顺手把桌子擦干净。

(完了,估计连老妈以后的台词都要改了:连机器人都比你眼里有活儿~)

再往上扒,黎曼动力背后站着的是昆仑万维——前者正是昆仑万维专为具身智能方向成立的子公司。

一个新面孔,凭什么首秀就登顶?

答案藏在它的「食谱」里:23.2万小时训练数据中,占大头的根本不是机器人数据,是人的视频。

没错,人做饭、叠衣服、收拾桌子的第一视角视频。

造机器人大脑,行业吵出了新共识

为什么是「人的视频」?这还要从具身智能领域吵了一年多的路线之争说起。

VLA和世界模型,谁代表机器人的未来?行业曾为此分裂成鲜明两派。

两派各有优劣,为便于大家做对比,这里我直接放了一张AI生成的图表:

△图片由AI生成

简单总结就是,VLA属于「直觉派」,快但容易翻车;世界模型则属于「深思派」,稳但是又慢又贵。

吵着吵着大家发现:算了,既然各有优劣,那不如来一个取长补短?

于是,两条路线开始合流。

今年6月,英伟达西雅图机器人实验室发布了一篇长文综述,文章的核心判断是:

World Action Model(WAM,世界动作模型)已经从VLA研究里的小众分支,迅速长成了机器人基础模型的第二条主路线,而下一代机器人基础模型,大概率是两者的混合体。

△图源:英伟达官方技术博客

ICML 2026上,包括LeCun团队在内的多篇论文也在往同一个方向使劲:

从海量无标注的野外视频(in-the-wild videos)里学习潜在动作世界模型。

△图源:ICML官网

把这些工作放在一起看,一条正在被越来越多团队验证的训练范式浮出水面:

先用大规模开放世界视频做预训练,让模型看遍人类怎么和物理世界打交道,攒够物理直觉;再用少量真实机器人数据做动作对齐,把直觉翻译成可执行的控制信号。

这就解释了,为什么下一代机器人大脑,都盯上了「人的视频」。

对机器人来说,人类每天的生活就是一场不间断的操作示范。做饭、叠衣服、整理房间,这些第一视角视频里,藏着人类怎么感知环境、规划动作、处理意外的全部秘密。

而且这类数据要多少有多少,场景丰富,还在源源不断地增长。

实际上,行业里少部分前沿玩家已经看到了这点。比如Being-H0.7用了20万小时第一视角人类视频,Generalist AI的GEN-1更是砸了50万小时可穿戴设备采集的人类数据。

作为其中之一,Riemann-1.0的独特之处在于:

它是国内较早把这条范式完整工程化跑通的选手,从仿真Benchmark到真机均获得验证的那种。

而它之所以能跑通,关键在于解决了一个核心难题:人类视频里没有机器人动作标签。

没错,再漂亮的范式,也有自己的问题要解决。

人叠衣服的视频看得再多,机器人手臂该转多少度、夹爪该用多大力,视频里一个字都没写。

阅读原文
看了20万小时「人类干活实录」,机器人悟了 · AI Daily