发展趋势量子位5/10

超越π0,中国团队用1B参数模型登顶具身智能榜单

By 田, 晏林

超越π0,中国团队用1B参数模型登顶具身智能榜单
图源:量子位

AI 摘要

具身智能正在从「参数竞赛」进入「架构竞赛」。

原文正文

超越π0,中国团队用1B参数模型登顶具身智能榜单

具身智能正在从「参数竞赛」进入「架构竞赛」。

田晏林 发自 凹非寺

量子位 | 公众号 QbitAI

谁能想到,在全球具身智能操作能力的顶级榜单上,打败海外标杆模型π0的,居然是一个只有1B级参数的轻量级模型。

近日,全球具身智能领域关注度最高的公开榜单之一Evo-SOTA更新排名。

优艾智合研发的FabriVLA,在多任务操作核心基准Meta-World MT50中,以90.0%的tier-average成功率登顶第一,超过包括π0在内的一众国际知名模型。

在没有堆叠数百亿参数的情况下,这个小身板模型在全难度梯度测试中拿到SOTA,其轻量化设计也为部署到机器人边缘端提供了基础。

Meta-World MT50的抓取、放置、开门、插拔等操作,与工业场景的基本工序高度重合,考验的正是在不同任务下的多任务能力和操作稳定性。

而这,恰恰是工业场景最看重的能力。

榜单成绩证明的是算法性能,但工业真正需要的是落地真实环境。

过去9年,优艾智合在半导体、能源化工、锂电等行业完成800+真实场景交付。

近期,该公司又趁热打铁推出了工业具身智能大模型「智合」FabriX与工业原生人形机器人「隙锋」,并喊出了一个极其激进的口号:

3年内,赋能10000个工业现场。

原本外界还觉得这步子迈得太大,但「隙锋」首发当日获得4000台意向订单。

而今,FabriVLA拿下全球SOTA,也让这4000台订单背后的逻辑越发清晰:

工业客户看重的,从来不是参数有多大,而是谁更好用。

1B级模型如何登顶具身智能Benchmark?

FabriVLA登顶绝非一次偶发的运气暴击。

Evo-SOTA作为全球具身智能领域重要公开评测榜单之一,汇聚了全球高校与科技公司的主流模型。

所有结果均基于公开发表论文,具备极高的行业参考价值。

而在它选用的Meta-World MT50基准中,包含了整整50个不同任务,覆盖抓取、放置、推动、开门、插拔等多类复杂操作。

它考验的不是机器人死记硬背某一个特定动作的上限,而是同时掌握50项不同任务的多任务操作能力。

这与工业一线的诉求不谋而合。

产线上的组件千变万化,机械臂如果换个工件就罢工,对工厂来说就是灾难。

FabriVLA能拿下第一,意味着轻量化VLA模型同样可以具备顶级具身智能操作能力,为工业具身智能落地提供了模型基础。

但这引起不少人的好奇:为什么一个1B参数模型,可以击败更大的模型?

FabriVLA选择围绕机器人操作任务重新设计神经网络架构。

传统VLA模型往往陷入盲目扩增参数的困局,靠硬背关节角度来应对复杂场景。

FabriVLA却提出两个关键创新:

- 门控自注意力机制:让模型预测出的一连串动作前后互相「看见」、彼此配合,并通过一个从零渐进打开的门控逐步学会动作间的时序衔接,执行复杂装配这类长序列动作时更连贯、更稳定。

- 深浅层视觉特征融合:同时看懂零件整体结构和细微的位置、边界与姿态,处理插拔、组装、精准摆放这类精细工序时,一次到位的成功率大幅提升。

对于机器人来说,看见一个物体只是第一步。

它不仅需要知道「这是什么」,还需要知道「应该怎么操作」。

比如拿起一个零件。

高层视觉信息帮助机器人理解目标是什么。

低层视觉细节帮助机器人判断具体位置、形状和姿态。

如果只有语义理解,机器人可能知道这是一个零件,却不知道手应该伸到哪里。

如果只有视觉细节,又无法理解任务目标。

FabriVLA通过「深浅层视觉特征融合」,让机器人同时拥有理解能力和精细操作能力。

阅读原文
超越π0,中国团队用1B参数模型登顶具身智能榜单 · AI Daily