发展趋势量子位5/10

机器人为啥困在Demo?讯飞新公司爻方智能给出答案:缺一味「本体认知」

By 一水

机器人为啥困在Demo?讯飞新公司爻方智能给出答案:缺一味「本体认知」
图源:量子位

AI 摘要

VLA不是终局

原文正文

机器人为啥困在Demo?讯飞新公司爻方智能给出答案:缺一味「本体认知」

VLA不是终局

逛过WAIC具身智能展区的人,多半有同一个疑问:

都2026年了,机器人干活,怎么还是慢吞吞的?

转头一讨论,大家默认的答案是:技术不行,快不了。

但一位刚成立机器人公司的负责人,给出了一个扎心得多的解释:

不是不能快,是怕出错。速度是可以调快的,调快以后出错概率就会增加,给别人演示的时候就会掉链子。

原来,展台上的慢,是主动调低的安全档。

而不敢调快的根源,正是行业如今热议的「大脑」:机器人的大脑,还没跨过实用门槛。

换个环境、换个物体,动作就开始变形,所以很多展示只能停留在Demo层面,在精心布置的场景里小心完成。

说这话的人叫潘嘉,国家科技进步一等奖主要完成人、科大讯飞杰出科学家、具身智能前沿科学带头人。

就在WAIC 2026开幕前,科大讯飞悄悄注册了一家新公司:安徽爻方智能科技有限公司,注册资本3亿元,由潘嘉带队,专攻的正是机器人大脑。

同期,团队联合中国科学技术大学、聆动通用机器人交出了一篇技术报告:iFLYTEK-Embodied-Omni。

报告很厚,判断却很短:

现在主流的机器人大脑,造法就不对。

VLA不是终局,世界模型还需补上「本体认知」这一环

总结下来,爻方的思路可以概括成这样两点:

第一,VLA不是终局。这个当下最热的路线,天花板在哪还没人验证过,但理论上的短板,已经摆在了明面上。

第二,接棒VLA的世界模型,也有可以完善的空间,比如「本体认知」这味关键药引子。

要理解这两点,不妨来完整看一下整个行业围绕「大脑」的这场激烈争夺。

为什么大家都在争「大脑」?这背后其实是一个逐渐成型的共识:具身智能真正的瓶颈,从来不在身体,在大脑。

原因很简单,交互方式变了。

过去几十年,人机交互停在离身的符号层面。你说话它识别,你打字它应答,始终隔着一块屏幕。

而具身交互要的是另一件事:机器人得用身体走进物理世界。

倒一杯水,它就得知道壶有多重、水会怎么流、洒了怎么办。每一个动作背后,都是对物理规律的理解和推演。

这不是能力的线性延伸,是一次底层跃迁。

而承担这次跃迁的,只能是大脑。身体的关节、电机、灵巧手,供应链一年比一年成熟;但让身体知道该做什么、会发生什么的那颗大脑,还没造好。

瓶颈在此,战场也自然在此。

至于这颗「大脑」怎么造?行业的分歧,集中在两件事上:用什么架构,和拿什么数据喂。

先说架构之争。

很长一段时间里,VLA都是绝对主流。它直接将视觉和语言映射为动作,见效快、门槛低,所以一时备受追捧。

但VLA的软肋也越来越明显:

它更像一个「即时反应系统」,只管现在怎么做,不管做完之后世界会变成什么样。

就好比在路上开车,看到红灯它确实知道踩刹车,但它预判不到雨天路滑、这一脚下去车会打滑失控。

只对当下做反应,不对后果做推演——这就是「VLA不是终局」这一判断的根本原因。

△图片由AI生成

正是看到了这一点,世界模型接棒火了起来。其逻辑在于:

先预测未来画面,再从画面推出动作,让机器人也学会「先想后动」。

英伟达把这条路的招牌「Physical AI」喊成了年度关键词,各家世界模型在榜单上轮番刷榜,行业开始集体从VLA迁向WAM(World Action Model)。

看上去方向是对了,但爻方认为:这里面还藏着两个坑。

阅读原文
机器人为啥困在Demo?讯飞新公司爻方智能给出答案:缺一味「本体认知」 · AI Daily