逛了趟WAIC,我只想说,AI在物理世界都快卷疯了……
By Jay

AI 摘要
还得是AI圈春晚
原文正文
逛了趟WAIC,我只想说,AI在物理世界都快卷疯了……
还得是AI圈春晚
梦瑶 发自 凹非寺
量子位 | 公众号 QbitAI
太!火!爆!了!
还得是WAIC,还得是AI圈春晚——
哪怕到了展会第三天,依旧人挤人人人人,火爆热程度堪比上海这两天的天气。(doge)
甚至,据说,连黄牛票…都炒到3000块钱一张了!?
真不怪大家这么热情,主要吧,还是展会现场太有看头了——
这边机器人模拟药房拿药取药、那边机器人组团开演奏会,还有各种长进真实硬件里的Agent和操作系统。
具身智能、世界模型、AI Coding、Token经济、AI硬件……过去一年最火的技术概念,今年几乎全都被搬到了现场。
如果说去年逛展大家聊得更多的,还是AI还能做点啥,那到了今年,一个非常非常非常明显的变化是——
AI已经从屏幕里走了出来,开始往工厂、家庭、药房、穿戴设备和各种真实生产场景里「疯狂流动」了:
在一众展商中,我也看到了一个咱非常之熟悉的玩家:京东。
只不过吧,这次,这家厂商亮相的方式确实有亿点不一样。
此前,京东就官宣要打造全球最大的物理世界运营中心,没想到这么快就把最新成果搬到了WAIC现场——
首次集体亮相的JoyAI全系列大模型、具身数据采集与训练链路,还有以JoyInside为底座打造的京东AI Home,全都来了:
逛完今年的WAIC,我们会发现AI的能力边界,真的开始从数字内容的理解与生成,进一步延伸至物理世界的环境感知、实时决策与具体执行。
而过去停留在屏幕里的智能概念,如今已经开始进入工厂、家庭和各类终端设备,真正参与现实世界的现实运行了。
看得见、听得懂、还能执行,面向物理AI的模型全家桶来了
这两年,大模型已经进入密集发布期。
今年走进WAIC主场馆,我们会发现图像、视频、语音、交互、具身等不同方向的模型几乎覆盖了所有热门赛道。
但不得不承认的一点是,在真实的物理环境中,单一模型给出判断,只是整个AI任务执行流程的「起点」。
后续的路径规划、设备控制、动作执行与结果反馈,可以说每个环节都直接影响一个任务能否真正形成完整闭环!!
也正因如此,物理AI对模型能力的要求,也从单项能力的突破进一步延伸至感知、理解、决策、执行的系统协作。
△AI生成
就在今年WAIC现场,京东直接端上了一整套面向物理世界的JoyAI模型「全家桶」。
从语音、图像、视频、实时交互、到具身智能,可以说是把物理AI需要的模型能力统统梭哈了……
对物理AI来说,视觉能力决定了AI能否建立对现实环境的连续认知。
毕竟一台机器人真正开始行动前,需要先弄清周围有什么、物体位于哪里,以及彼此之间存在怎样的空间关系。
而京东此前开源的JoyAI-Image-Edit、JoyAI-Echo和JoyAI-VL-Interaction模型,刚好对应了视觉能力向物理世界延伸的不同维度——
JoyAI-Image-Edit实现了视角变换、空间漫游与几何一致性编辑,让AI从处理平面像素进一步走向理解空间结构。
△JoyAI-Image-Edit
JoyAI-Echo通过跨模态记忆维持长视频的一致性,JoyAI-VL-Interaction则把理解和响应压缩至毫秒级,让AI可以一边观察实时画面,一边交互、调用Agent。
值得一提的是,京东还在今年WAIC上,展示了多模态领域的最新研究成果:实时视频编辑模型JoyAI-Video-Edit。
具体来说,用户可以自定义画面,并在预览过程中实时修改,让视频生成具备更强的即时反馈与动态调整能力。
从长时一致性、实时理解到即时修改,几款模型分别补上了动态视觉中的不同环节,让物理AI既能记住前后变化,也能跟上实时画面,并根据环境变化及时调整反应。
△JoyAI-Video-Edit
视觉模型让设备看懂周围环境,但当设备真正进入家庭和零售场景,还要面对一个更难处理的变量——人的指令。
毕竟,大家都懂,现实交流很少按照标准格式发生。