1.5B开源通用VLA模型,冲进具身智能第一梯队
By 十三

AI 摘要
面壁智能发布MiniCPM-Robot系列模型
原文正文
1.5B开源通用VLA模型,冲进具身智能第一梯队
面壁智能发布MiniCPM-Robot系列模型
金磊 发自 上海
量子位 | 公众号 QbitAI
一个新的国产VLA模型诞生了,而且只有1.5B。
Size这么小,能好用吗?
来,话不多说,我们直接看效果:
视频地址:
https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw
在上面这个真机演示里,两只机械臂围着桌面开始做三明治。它们分工合作,先取面包,再夹起生菜、火腿和鸡蛋,一层层叠到一起。
再来看下另一段演示:
视频地址:
https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw
一只宇树机器狗收到“跟随前面的人”这条指令后,开始一路跟在目标身后。
从室外走进办公楼,再进入电梯、地下停车场,机器狗始终没有跟丢。就算周围不断有人经过,环境和光线也在变化,它还是能认准一开始指定的那个人。
更关键的是,这套能力直接跑在机器狗本地!
电梯和地下停车场往往是网络信号比较差的地方。即使进入弱网甚至无网环境,机器狗依然能继续识别目标、规划动作,保持跟随。
而在这两段Demo背后,则是面壁智能在WAIC期间正式发布并开源的MiniCPM-Robot系列模型。
目前包含两个模型:
- MiniCPM-RobotManip:也就是开头控制机械臂做三明治的通用VLA模型,参数量只有1.5B。
- MiniCPM-RobotTrack:主要负责机器人的跟踪与导航,让机器人能够根据自然语言指令,在动态环境里持续跟住指定目标。
和它们一起出现的,还有开源具身智能推理框架PhyAI,负责让这些模型更快地适配硬件、跑到真实机器人上。
简单来说,一个负责让机器人“动手干活”,一个负责让机器人“认准人、跟着走”,再配上一套负责高效推理的底座。
面壁这次端出来的,已经是一套逐渐成形的具身智能组合。
跻身第一梯队,延迟接近一半
先来看MiniCPM-RobotManip。
虽然参数量只有1.5B,但在LIBERO、Calvin、RoboTwin2等主流VLA评测里,它的整体表现已经进入第一梯队,与π0.5等模型处在相近水平。
真正把差距拉开的,是对机器人记忆力的考验。
很多VLA模型在执行动作时,主要根据当前这一帧画面做判断。
比如让机器人点击画面里的第二个按钮5次。
如果它看不到前面的画面,也记不住自己已经按过几次,就很容易按一下便停,或者一直按下去。
MiniCPM-RobotManip会把历史观测和此前执行过的动作一起纳入判断。它知道任务已经进行到哪一步,也知道什么时候应该停下来。
在专门考察上下文记忆的RMBench中,π0.5的成绩约为10分,接近随机水平,MiniCPM-RobotManip则达到约53分。
这项能力对真实机器人很重要。
叠衣服、收拾桌面、做三明治,看起来都是日常小事,拆开后却包含一连串动作。机器人只看眼前,很容易做到一半便“失忆”;能记住此前的状态,才有机会把长任务完整做完。
除了记得住,机器人还得反应快。
面壁给出的单帧推理对比中,在H100显卡、bf16精度下,MiniCPM-RobotManip单次决策延迟约为120毫秒,π0.5约为234毫秒,前者接近后者的一半。
这里的“成本减半”,主要是体现在推理延迟和计算量上。
聊天模型多想一秒,用户通常还能等。机械臂每做一步都停顿一秒,动作马上就会变得僵硬,整个任务的完成时间也会被拉长。
对VLA来说,能不能在有限算力下快速输出下一步动作,和榜单分数一样重要。