发展趋势量子位5/10

李飞飞的世界模型,终于开始训练机器人了

By henry

李飞飞的世界模型,终于开始训练机器人了
图源:量子位

AI 摘要

李飞飞老师的World Labs,补了块关键拼图

原文正文

李飞飞的世界模型,终于开始训练机器人了

李飞飞老师的World Labs,补了块关键拼图

henry 发自 凹非寺

量子位 | 公众号 QbitAI

李飞飞老师的World Labs,补了块关键拼图。

刚刚,借助新收购机器人公司SceniX之力,World Labs发布了全新的机器人策略训练与评估引擎——

Real-to-sim-to-real (R2S2R) 。

这套引擎将World Labs空间智能的版图从生成可交互的虚拟世界,进一步延伸到了真实机器人的训练、评估与部署,并首次打通了从仿真训练到真实运行的闭环。

拆开来看,R2S2R包含Real-to-Sim和Sim-to-Real两个部分。

其中,Real-to-Sim负责把现实中的机器人、传感器、物体以及交互过程搬进仿真,构建与真实任务对齐的虚拟环境。

Sim-to-Real则让机器人在这些虚拟环境中完成训练和评估,再将策略直接部署回真实世界。

李飞飞老师在X上表示,基于这套方法训练出来的策略,即使完全没用过真实世界数据,也已经能够连续自主运行1小时,无需人工干预。

不仅如此,R2S2R还让机器人策略的评估变得更容易规模化。

通过对齐策略在仿真与现实中的运行过程,真实世界里的成功、失败及其触发条件,都可以在虚拟世界中被复现和分析。

可以说,R2S2R不仅打通了世界模型从生成世界,到训练、评估和部署真实机器人的闭环,也推进了李飞飞此前提出的世界模型三分法中,最关键的一块——

仿真器。

在她的经典划分中,世界模型可以承担三种功能:渲染器负责生成观察,仿真器负责模拟世界状态,规划器则负责输出行动。

而R2S2R所做的,正是让World Labs生成的世界从“看起来真实”,进一步变成机器人真正能够进入、交互和学习的训练场。

想scale具身智能,先得scale机器人学习的世界

那么,为什么要扩展机器人的学习环境,而且还非得在仿真里?

在博客中,World Labs表示:

当前机器人发展的主要瓶颈,已经不只是模型架构,而是缺少能够规模化获取的经验和评估。

一方面,真实世界中的物体位置、光照、物理属性和交互过程都在不断变化。

要让机器人真正走出实验室,就必须提前覆盖足够丰富的场景,并反复测试它在什么情况下会成功、又会在哪里失败。

另一方面,与训练大模型的互联网数据不同,机器人的每一条经验都需要真实发生。

每轮实验都要占用硬件,人工重置物体、恢复失败并维护系统。即便拥有海量人类视频,也很难系统覆盖不同环境、物体属性、机器人状态和失败条件。

因此,仿真最大的价值,并不只是“省下采集数据的钱”,而是可以主动制造现实中昂贵、危险或难以重复的情况,让机器人反复经历成功与失败。

但过去的仿真技术也存在着明显短板。

它不仅需要为每项真实任务单独搭建环境,成本高、速度慢,而且仿真与现实之间往往存在视觉、几何和物理动态上的差距。

更重要的是,机器人在仿真中学会的策略,到了真实世界未必依然有效;仿真中的测试结果,也未必能反映真实表现。

基于上述背景,World Labs推出了从现实到仿真再到现实训练(R2S2R)的仿真引擎,用于训练和评估机器人策略。

其中,Real-to-Sim负责把现实中的机器人、传感器、物体和交互过程重建成与任务对齐的虚拟世界。不仅要还原世界的外观,还要尽可能保留机器人与物体交互时的运动和物理反馈。

Sim-to-Real则利用这些世界完成策略训练与评估,找到模型容易失败的状态,并判断仿真中的表现能否迁移到真实硬件。

两者连接起来,便形成了一套闭环:

从现实中提取任务,在仿真中规模化生成经验、训练和寻找失败,再把策略部署回现实;现实中的新结果,又会继续修正世界模型、训练数据和机器人策略。

也就是说,R2S2R不是简单地用仿真替代真实数据,而是把一个真实任务扩展成大量可控制、可复用的学习世界,让机器人能够以更低的成本反复训练、评估和迭代。

Real-to-sim-to-real

具体来说,这套方法首先从Real-to-Sim开始。

团队先采集机器人、传感器、环境、物体和任务演示等信息,再通过生成式世界建模系统,将其重建为一个可交互的虚拟世界。

这个世界不仅要还原外观和几何结构,还要尽可能复现物体的物理和动力学特性。

阅读原文
李飞飞的世界模型,终于开始训练机器人了 · AI Daily