发展趋势量子位5/10

逛了趟WAIC,我只想说,AI在物理世界都快卷疯了……

By Jay

逛了趟WAIC,我只想说,AI在物理世界都快卷疯了……
图源:量子位

AI 摘要

还得是AI圈春晚

原文正文

逛了趟WAIC,我只想说,AI在物理世界都快卷疯了……

还得是AI圈春晚

梦瑶 发自 凹非寺

量子位 | 公众号 QbitAI

太!火!爆!了!

还得是WAIC,还得是AI圈春晚——

哪怕到了展会第三天,依旧人挤人人人人,火爆热程度堪比上海这两天的天气。(doge)

甚至,据说,连黄牛票…都炒到3000块钱一张了!?

真不怪大家这么热情,主要吧,还是展会现场太有看头了——

这边机器人模拟药房拿药取药、那边机器人组团开演奏会,还有各种长进真实硬件里的Agent和操作系统。

具身智能、世界模型、AI Coding、Token经济、AI硬件……过去一年最火的技术概念,今年几乎全都被搬到了现场。

如果说去年逛展大家聊得更多的,还是AI还能做点啥,那到了今年,一个非常非常非常明显的变化是——

AI已经从屏幕里走了出来,开始往工厂、家庭、药房、穿戴设备和各种真实生产场景里「疯狂流动」了:

在一众展商中,我也看到了一个咱非常之熟悉的玩家:京东。

只不过吧,这次,这家厂商亮相的方式确实有亿点不一样。

此前,京东就官宣要打造全球最大的物理世界运营中心,没想到这么快就把最新成果搬到了WAIC现场——

首次集体亮相的JoyAI全系列大模型、具身数据采集与训练链路,还有以JoyInside为底座打造的京东AI Home,全都来了:

逛完今年的WAIC,我们会发现AI的能力边界,真的开始从数字内容的理解与生成,进一步延伸至物理世界的环境感知、实时决策与具体执行。

而过去停留在屏幕里的智能概念,如今已经开始进入工厂、家庭和各类终端设备,真正参与现实世界的现实运行了。

看得见、听得懂、还能执行,面向物理AI的模型全家桶来了

这两年,大模型已经进入密集发布期。

今年走进WAIC主场馆,我们会发现图像、视频、语音、交互、具身等不同方向的模型几乎覆盖了所有热门赛道。

但不得不承认的一点是,在真实的物理环境中,单一模型给出判断,只是整个AI任务执行流程的「起点」。

后续的路径规划、设备控制、动作执行与结果反馈,可以说每个环节都直接影响一个任务能否真正形成完整闭环!!

也正因如此,物理AI对模型能力的要求,也从单项能力的突破进一步延伸至感知、理解、决策、执行的系统协作。

△AI生成

就在今年WAIC现场,京东直接端上了一整套面向物理世界的JoyAI模型「全家桶」。

从语音、图像、视频、实时交互、到具身智能,可以说是把物理AI需要的模型能力统统梭哈了……

对物理AI来说,视觉能力决定了AI能否建立对现实环境的连续认知。

毕竟一台机器人真正开始行动前,需要先弄清周围有什么、物体位于哪里,以及彼此之间存在怎样的空间关系。

而京东此前开源的JoyAI-Image-Edit、JoyAI-Echo和JoyAI-VL-Interaction模型,刚好对应了视觉能力向物理世界延伸的不同维度——

JoyAI-Image-Edit实现了视角变换、空间漫游与几何一致性编辑,让AI从处理平面像素进一步走向理解空间结构。

△JoyAI-Image-Edit

JoyAI-Echo通过跨模态记忆维持长视频的一致性,JoyAI-VL-Interaction则把理解和响应压缩至毫秒级,让AI可以一边观察实时画面,一边交互、调用Agent。

值得一提的是,京东还在今年WAIC上,展示了多模态领域的最新研究成果:实时视频编辑模型JoyAI-Video-Edit。

具体来说,用户可以自定义画面,并在预览过程中实时修改,让视频生成具备更强的即时反馈与动态调整能力。

从长时一致性、实时理解到即时修改,几款模型分别补上了动态视觉中的不同环节,让物理AI既能记住前后变化,也能跟上实时画面,并根据环境变化及时调整反应。

△JoyAI-Video-Edit

视觉模型让设备看懂周围环境,但当设备真正进入家庭和零售场景,还要面对一个更难处理的变量——人的指令。

毕竟,大家都懂,现实交流很少按照标准格式发生。

阅读原文
逛了趟WAIC,我只想说,AI在物理世界都快卷疯了…… · AI Daily