SIGGRAPH时间检验奖揭晓:这项研究,提前十年押中了物理AI
By 思邈

AI 摘要
开源项目GitHub狂揽8000+Star
原文正文
SIGGRAPH时间检验奖揭晓:这项研究,提前十年押中了物理AI
开源项目GitHub狂揽8000+Star
允中 发自 凹非寺
量子位 | 公众号 QbitAI
2026年7月召开的计算机图形学顶会SIGGRAPH,公布了时间检验奖(Test-of-Time Award)。
这个奖项专门表彰十年前发表、至今仍对业界产生持续影响的论文。
而今年,香港大学计算机科学系教授Taku Komura与团队成员在2016年发表的《A Deep Learning Framework for Character Motion Synthesis and Editing》获此殊荣。
这项工作首次使用深度学习从大规模人类动作数据中自动学习人类运动的内在结构,再根据高层指令生成自然的人形角色动作。
彼时,AI的突破还主要集中在图像领域,这项工作已经系统地把表示学习用于复杂3D动作的生成,让AI从学会如何看到学会如何动。
十年之后,这项工作的意义已经超出角色动作生成本身:机器如何从人的运动与交互中学习,理解物理世界并在其中行动,正成为物理AI面对的核心问题。
二十年,让身体成为一种可计算的语言
围绕这个问题,Taku Komura已经研究了二十余年。
他曾在爱丁堡大学任教多年,长期研究动作生成、物理模拟和交互技术。
2020年,他加入香港大学,现任计算机科学系教授。他曾任SIGGRAPH Asia 2025大会主席,并被AI 2000评为该领域最具影响力学者全球前15。
具体而言,他希望让机器从数据中学习人类运动的结构,并进一步理解动作如何随场景、物体和任务而变化。
2016 年,Taku在SIGGRAPH发表的获奖论文,将深度学习系统性地用于角色运动合成与编辑。
研究团队用卷积自编码器从大规模动作捕捉数据中学习一个低维的运动空间,再将行走路径等高层控制条件映射到这个空间。
模型由此可以生成和编辑动作,同时尽量保留人类运动的自然性。
这项工作的关键不在于逐帧记住训练动作,而在于学习可复用的运动表示。
用今天更熟悉的说法,它学习的是一种Human Motion Prior:哪些姿态与时间变化通常属于自然的人体运动,以及怎样在满足目标约束时仍留在这个运动空间内。
论文的引用量至今持续增长,也成为后来数据驱动动作生成研究的一项基础工作。
此后,Taku与实验室成员继续把动作放入更复杂的场景。
2019年的Neural State Machine让数字角色根据场景几何完成坐下、搬运、开门与避障;2020年的Local Motion Phases则处理多接触、快速切换和全身协调等问题。
研究对象由孤立的人体动作,逐渐扩展到身体、物体和环境之间的关系。
2022年,他与团队提出的DeepPhase获得SIGGRAPH最佳论文奖。
这项技术通过周期性自编码器从未经人工整理的动作数据中学习多维相位空间,捕捉不同身体部位随时间变化的结构。
它让系统在检索、对齐和合成复杂动作时,不再依赖人为定义的单一动作阶段;生成结果也不只在单帧姿态上“看起来像”,在时间组织上同样更加连贯。
围绕这条研究线形成的AI4Animation开源项目已经获得GitHub 8,000多个Star,是动作生成领域最具影响力的开源项目之一。
项目由团队成员持续维护,汇集了Taku团队长期以来在人形运动、四足运动和场景交互等方向的积累。
人类交互先验模型,为什么对具身智能重要
从2016年论文在十年后获得时间检验奖,Taku的研究主线可以概括为一个完整的人类交互先验模型:
让模型先学会表示人类在真实世界的自然运动,再学习人与场景、物体和任务如何发生交互,再把真实接触、受力与环境变化纳入模型。
这条研究路线对物理AI的意义,正在被机器人行业验证。
真机遥操作数据采集成本高、场景窄、且动作不自然,靠它撑起通用能力并不现实;机器要学会在真实世界里做事,更可行的来源是人自己的日常操作。
但人的数据并不是采下来就能用。
要采得足够多,硬件必须便宜到可以铺开,而低成本传感器噪声大、信息缺失。
团队多年积累下来的人类交互先验模型正好补上这一环:它知道什么样的姿态和时间变化属于自然的人体运动,能把残缺的信号补齐,再约束回真实的人体运动。
依托这套先验,团队现在用消费级设备(例如一台iPhone手机)就能完成采集与重建,得到人手、物体和场景在同一世界坐标系下的3D结果,采集成本降到过去的几十分之一,在第一人称手部重建的公开评测上误差降低60%。
这套管线的价值不止于降低数据采集成本,更指向一个关键判断:具身智能的下一个突破口,将出现在消费级场景而非受控环境。
家庭整理、厨房操作、日常物品交互——这些场景数据量巨大、离散,边际成本极低,却因动作精细、接触关系复杂,此前始终缺乏可规模化的高质量数据来源。