世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型
By henry

原文正文
世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型
henry 发自 凹非寺
量子位 | 公众号 QbitAI
刚刚,BeingBeyond智在无界发布首个基于人类视频数据的隐式触觉世界动作模型——
Being-H0.8。
作为一套带有触觉的隐式世界—动作模型,Being-H0.8在预训练阶段就教会机器人提前判断将要怎样接触物体,并在真正接触后,根据触觉反馈及时调整动作。
相比于过去根据画面决定做什么动作的世界模型,Being-H0.8这次把触觉放进了“预测—执行—反馈”的完整链路:
模型先根据当前画面,预判接下来可能发生的接触,执行过程中再读取最新触觉,重新生成下一小段动作。
具体来说,为了实现这一点,Being-H0.8从数据、模型和控制三层同时入手:
- 数据:汇总数十家合作伙伴的数据,建立超过50万小时的原始数据池,形成高质量数据集UniHand-3.0 ,并通过TactoHand生成接触和邻近度标注。
- 模型:预训练时,把动作执行后实际记录到的视觉和触觉结果作为监督,让模型学习仅凭当前指令和画面,提前判断接下来会怎样接触。
- 控制:每个动作块开始时,模型先生成完整动作计划;每执行一小段,就读取最新机器人状态和触觉,只重算下一小段动作。
基于这套方法,Being-H0.8在真实双臂机器人实验中,完成了包中取物、毛笔写字、挤牙膏、夹薯片等依赖触觉的高难度精巧任务。
首个基于人类视频数据的隐式触觉世界动作模型
要说Being-H0.8这次最值得关注的亮点,当属创新的隐式触觉世界动作模型架构和超50万小时的超大数据集了,咱们先来看模型层面。
对于具身模型而言,触觉不仅关系到精细操作,还能帮助它完成仅凭视觉难以实现的接触推断。
因此,过去两年,围绕触觉如何赋能具身基础模型,学界已经涌现出不少探索,李飞飞、徐丹飞、Wenzhen Yuan、宋舒然等研究者也都在推进相关方向。
但如果我们把问题进一步聚焦到世界模型,就会发现:触觉究竟该如何进入世界模型,仍然是一个开放问题。
一方面,现有的世界模型大多以视觉为核心。它们可以看到物体如何移动、形变,却很难准确判断接触是否发生、接触发生在哪里,以及物体正在承受怎样的作用力。
另一方面,触觉传感器虽种类繁多,但数据形态和表征方式并不统一。更现实的问题是,绝大多数大规模人类视频和机器人数据集,本身就没有同步记录触觉信息。
这就意味着,想要训练一个具备触觉能力的世界模型,不仅缺少统一的触觉表征,也缺少能够规模化获取的训练数据。
Being-H0.8正是智在无界针对这一问题给出的解法。
Being-H0.8在Being-H0.7隐式世界—动作模型的基础上,首次把触觉模态纳入隐空间表示中,将原本以视觉预测为主的建模方式,进一步扩展为隐式触觉世界—动作模型(Latent Tactile World-Action Model),把触觉预训练扩展到可规模化的第一视角人类视频数据。
这里的关键在于,Being-H0.8并不试图在像素层面完整重建未来画面,而是在隐空间中预测与任务真正相关的交互后果,例如是否发生接触、接触可能带来怎样的状态变化,并利用预测出的潜在状态进一步调节动作生成。
换句话说,Being-H0.8试图让机器人不只“看到”接下来会发生什么,还能从没有显式触觉标注的人类视频中,学习对接触与受力结果的隐式判断。
具体的,Being-H0.8由四个核心模块组成:负责预测交互后果的Mixture of Transformers (MoT)、负责执行与实时调整的慢—快动作专家、负责统一触觉输入的通用触觉编码器,以及负责统一动作空间的TopoHand。
其中,通用触觉编码器首先将不同传感器采集到的触觉信号,转换为统一的触觉token,从而降低不同设备、不同数据形态之间的差异。
而慢—快动作专家,则负责兼顾推理效率与接触反馈。
- 慢速流缓存视觉、语言和隐世界状态等计算成本更高的上下文,负责维持整体任务与动作计划;
- 快速流则在动作执行过程中,读取最新状态和触觉反馈,只重新生成接下来的一小段动作。
这样一来,机器人不必每次接收到触觉变化都重新计算完整计划,也能根据滑动、受力变化或接触偏移及时调整动作。
在训练阶段,未来时刻的触觉token会进入MoT的后验分支,帮助模型理解真实接触发生后,世界状态会如何变化。
到了部署阶段,MoT负责提前预测交互后果,慢速流维持整体上下文,快速流则根据最新触觉实时纠偏。
由此,触觉不再只是动作完成后的附加反馈,而是同时进入了机器人的“预测、执行与调整”过程。
超过50万小时的数据池
聊完模型,一个很自然的问题是:那训练模型的数据从哪里来呢?
这就要进入Being-H0.8的另一项关键工作——数据。
作为国内最早一批利用大规模人类视频预训练具身基础模型的企业之一,智在无界一直沿着人类视频预训练这条路线持续积累数据,并将其用于具身基础模型训练。
Being-H0.8的数据底座,正是这条路线长期积累的结果。
历经Being-H0到Being-H0.8的持续迭代,智在无界已汇聚了超过500,000小时的第一人称视频数据,并与数十家数据供应商开展合作。