李飞飞学生发起国际具身人类数据标准,光轮智能成唯一参与中国企业
By 林, 方舟

原文正文
李飞飞学生发起国际具身人类数据标准,光轮智能成唯一参与中国企业
诺亚 发自 凹非寺
量子位 | 公众号 QbitAI
2009年,李飞飞团队正式发布ImageNet。
随后,以ImageNet为基础形成的大规模视觉识别任务,让不同机构第一次能够围绕共同的数据集、类别体系和评测指标训练模型、比较结果。
得益于这套可以持续扩展、统一比较的数据与评测基础设施,图像识别和深度学习开始快速发展。
17年后,李飞飞的博士生Danfei Xu,开始为机器人学习寻找类似的协作基础设施。
Danfei Xu目前担任佐治亚理工学院交互计算学院助理教授,也是机器人学习与推理实验室(RL2)的负责人。他在斯坦福大学攻读博士期间,由李飞飞和Silvio Savarese共同指导。过去几年,他持续研究一个问题:机器人如何从人类演示中学习,并将这些经验迁移到不同任务、环境和机器人本体上。
这条研究线,最终汇入了EgoVerse——“第一视角人类操作数据生态”。
EgoVerse是一套持续增长的第一视角人类操作数据生态与标准。EgoVerse最新公开的联盟伙伴中,除了佐治亚理工、斯坦福、苏黎世联邦理工和UC San Diego等学术机构,还包括Meta、Scale AI、光轮智能、Mecka AI、MicroAGI、Trace Labs等公司。
最值得的关注是,光轮智能作为唯一一家中国公司,出现在这个顶级大佬云集的全球标准牌桌上。
EgoVerse:Danfei想做的不只是一个数据集
机器人学习长期面临一个明显的数据悖论。
目前机器人训练仍然依赖真机遥操作,每增加一条演示,都需要机器人硬件、操作人员、实验场地和复位流程。采集速度慢、成本高,能够覆盖的任务和场景也很有限。
而人类的各种行为天然包含丰富的视觉信息、动作过程、物体交互和任务策略,明显是机器人更好的老师。
第一视角人类数据提供了新的路线:先记录人如何在真实环境中完成任务,再把这些经验迁移给不同机器人。
但过去的人类数据集大多是一次性项目。
不同团队使用各自的采集设备、坐标体系、动作标签和任务定义,数据发布后也很难持续扩张。即使两家机构都采集了“把杯子放到碟子上”,两份数据也未必能够直接放在一起训练。
Danfei及其合作者因此没有把EgoVerse设计成又一份静态数据集,而是做成了一套“活”的协作框架。
EgoVerse当前公开版本包含1362小时人类演示数据、约8万个episode、1965项任务、240个场景和2087名采集者。数据不仅包含第一视角视频,还提供相机位姿、三维手部信息以及细粒度语言描述,并在不同实验室、不同任务和不同机器人本体上验证人类数据的迁移效果。
一套事实标准形成之前,往往要先完成几件事:
让参与者采用共同的数据结构,遵守共同的任务语义,生产可以相互兼容的数据,并用统一方法检验这些数据是否真的有效。
EgoVerse正在做的,正是这一步:先让全球具身数据开始按照同一套“语言体系”流动。
EgoVerse的核心共建方,都是什么背景?
具身人类数据并不是戴上一副眼镜、录一段视频,再加几个标签那么简单。完整采集流程至少包括研究问题定义、采集硬件、动作迁移、规模化运营、数据标注和机器人验证。任何一家机构,都很难单独完成所有环节。
EgoVerse召集了具身领域里最头部的高校、学者、机构进行全球协作,共同定义具有划时代意义的数据标准。
佐治亚理工Danfei Xu教授:具身人类数据采集路线标志性代表,EgoVerse的发起人
佐治亚理工承担的是EgoVerse的组织中枢和研究框架角色。Danfei Xu与RL2团队长期关注机器人如何从人类数据中学习。到了EgoVerse,问题不再只是“某一批人类视频能不能改善某一台机器人”,而是进一步升级为:人类数据的效果能否跨实验室复现?能否跨机器人本体成立?数据规模增加时,能力是否稳定增长?哪些类型的数据才真正具有迁移价值?
EgoVerse让不同实验室在共享协议下重复实验。佐治亚理工学院负责的代表任务是object-in-container,斯坦福大学负责双臂精细操作,UC San Diego和ETH Zurich则参与长时序双臂任务验证。由此,Danfei搭起一种新的协作方式,使过去互不兼容的数据、算法、机器人和实验室,开始在共享协议下回答同一组问题。
斯坦福Shuran Song教授:UMI发明人,让人类操作经验能够迁移给机器人
人类有柔软灵活的双手,机器人可能只有两指夹爪;人可以依靠触觉、经验和身体协调完成任务,机器人却需要明确的观测和动作表示。因此,人类数据并不会天然变成机器人能力,中间横着一道“具身鸿沟”。
Shuran Song带领的斯坦福REAL Lab,是打通这条路径的代表团队之一。其团队开创的UMI——Universal Manipulation Interface,使用便携式手持夹爪采集真实环境中的人类操作,再将这些演示转化为可部署的机器人策略。
UMI的关键价值,是让数据采集摆脱固定机器人和实验室。人可以带着设备进入真实环境进行复杂长时序任务,学习得到的策略还能迁移到不同机器人平台。
简单说,斯坦福要解决的是:让人类经验变成机器人能执行的动作。
Meta:为EgoVerse提供专用数据采集眼镜
第一视角数据采集首先需要一双合格的“眼睛”。Meta研发的Project Aria,是行业首个专为“大规模基础模型”设计的专用数据采集硬件,可以记录第一视角视频、手部动作、相机位姿和空间信息。设备包含面向前方的RGB相机,以及用于SLAM和手部追踪的同步场景相机。没有这类空间感知能力,第一视角数据很容易只是一段“看起来像人在干活”的视频。Meta解决的是如何把“人看到了什么”,升级为“人在三维世界中如何行动”。
Mecka:人类数据先驱,把数据采集从专用眼镜普及到手机
如果一套人类数据生态只能依赖少数专用硬件,它能够覆盖的采集者与真实环境就始终有限。
Mecka AI推动了一条更便携的采集路线:使用iPhone与轻量化头戴装置完成第一视角采集,再通过云端处理恢复头部轨迹与双手三维关键点。
这一方案让第一视角数据不再只来自少数机器人实验室,而能够进入家庭、商店、工作场所和更多真实任务环境。