Autoregressive Flow Matching for Motion Prediction
自回归流匹配用于运动预测
机构 * Stanford University(斯坦福大学)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 ARFM通过自回归流匹配方法,利用多样化视频数据集预测复杂运动,提升机器人和人类动作预测的下游任务性能。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
自回归流匹配用于运动预测
机构 * Stanford University(斯坦福大学)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 ARFM通过自回归流匹配方法,利用多样化视频数据集预测复杂运动,提升机器人和人类动作预测的下游任务性能。
Motus:一个统一的潜在动作世界模型
机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) ; Peking University(北京大学) ; Horizon Robotics
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 Motus通过统一的潜在动作世界模型整合理解、视频生成和动作模块,利用光流和三阶段训练流程提升大规模动作预训练效果,实现模拟与现实场景中的性能突破。
从模糊图像生成过去、现在和未来
机构 * York University(约克大学) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出利用预训练视频扩散模型从模糊图像恢复过去、现在和未来的视频,以揭示复杂场景动态。
Comments Code and data are available at https://blur2vid.github.io
Journal ref ACM Trans. Graph. (SIGGRAPH Asia 2025), vol. 44, no. 6, pp. 1-15, Dec. 2025
DeX-Portrait: 通过显式和潜在运动表示实现解耦且表达性的肖像动画
机构 * University of Science and Technology of China(中国科学技术大学) ; Central Media Technology Institute, Huawei(华为中央媒体技术研究所) ; Nanjing University(南京大学)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 DeX-Portrait通过显式和潜在运动表示生成解耦且表达性的肖像动画,提升动画质量和可控性。
Comments Projectpage: https://syx132.github.io/DeX-Portrait/
在抓取之前看到它:基于深度学习的篮球运动预测
机构 * Universitat de Barcelona(巴塞罗那大学) ; Universitat de Barcelona Computer Vision Center(巴塞罗那大学计算机视觉中心)
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
AI总结 本文提出篮球动作预测任务,利用深度学习技术预测投篮后球权归属,构建了首个篮球反弹预测数据集,展示了该数据集在篮球视频理解中的广泛应用价值。
物理真实序列级对抗性服装用于鲁棒的人体检测规避
机构 * School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) ; Institute for Interdisciplinary Information Sciences, Tsinghua University(交叉信息研究院,清华大学)
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
AI总结 本研究提出序列级优化框架,生成可打印的对抗性服装纹理,以实现在数字和物理环境中对人类检测的鲁棒规避。
高效动态查询动作计数
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
AI总结 本文提出了一种基于动态查询表示的高效动作计数方法,通过动态更新和跨查询对比学习,显著提升了长视频和未见过动作的计数性能。
Comments code: https://github.com/lizishi/DeTRC, proj page: https://shirleymaxx.github.io/DeTRC/
Lang2Motion: 通过联合嵌入空间连接语言与运动
机构 * Northeastern University(东北大学)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 Lang2Motion通过联合嵌入空间连接语言与运动,利用文本描述和视觉化监督生成高精度的轨迹,实现跨领域运动迁移和风格编辑。
通过生成时间序列建模实现高效的实时视频运动迁移
机构 * Coupa Software(Coupa软件) ; Intel Corporation(英特尔公司)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 本研究提出基于生成时间序列模型的实时视频运动迁移框架,通过关键点预测和光流模块实现高效低帧率视频传输,提升带宽效率与视频生成的可控性。
GigaBrain-0:一种由世界模型驱动的视觉-语言-动作模型
机构 * GigaBrain Team(GigaBrain团队)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 GigaBrain-0通过世界模型生成数据,减少对真实机器人数据的依赖,提升视觉-语言-动作模型的泛化能力和现实世界性能。
Comments https://gigabrain0.github.io/
基于3D点轨迹的生成视频运动编辑
机构 * Adobe Research(Adobe研究院) ; Adobe(Adobe公司) ; University of Maryland College Park(马里兰大学学院公园分校)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 本文提出基于3D点轨迹的视频生成框架,实现摄像机与物体运动的联合编辑,通过稀疏对应关系保持时空一致性,提升视频编辑的精确度和创作潜力。
Comments Project page: https://edit-by-track.github.io
TBT-Former:基于时间边界分布的学习用于动作定位
机构 * Dept. of Computer Science \& Engineering University of Moratuwa Sri Lanka
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
AI总结 TBT-Former通过改进的Transformer架构和边界分布回归头,提升动作定位性能,实现THUMOS14和EPIC-Kitchens 100数据集上的新高。
Comments 8 pages, 6 figures
GigaWorld-0:世界模型作为数据引擎赋能具身AI
机构 * GigaWorld Team(GigaWorld团队)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 GigaWorld-0通过整合视频生成与3D建模技术,构建统一的数据引擎,生成高质量具身交互数据,提升VLA模型在现实任务中的性能。
Comments Project Page: https://giga-world-0.github.io/
WonderPlay:从单张图像和动作生成动态3D场景
机构 * Stanford University(斯坦福大学) ; University of Utah(犹他大学)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 WonderPlay通过结合物理模拟与视频生成,实现从单张图像和动作生成多样化动态3D场景。
Comments ICCV 2025 (Highlight). The first two authors contributed equally. Project website: https://kyleleey.github.io/WonderPlay/
DisMo:解耦的运动表示用于开放世界运动迁移
专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV
AI总结 DisMo通过解耦运动语义与外观,实现了开放世界中的运动迁移,提升了视频生成和理解的性能。
Comments Accepted at NeurIPS 2025
运动提线木偶:通过先验引导重新思考刚体运动迁移
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Cisco Research(思科研究)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
AI总结 Motion Marionette通过内部先验引导刚体运动迁移,实现跨物体的高效可控视频生成。
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
机构 * The University of Tokyo Hospital(东京大学医院)
专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV
机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学)
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) ; Department of Computer Science, Durham University(杜伦大学计算机科学系) ; Department of Computer Science and Technology, Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University(人工智能研究院,北京人工智能研究院,清华大学-博世联合机器学习中心,THBI实验室,清华大学计算机科学与技术系) ; Zhongguancun Laboratory, Beijing(中关村实验室,北京)
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments Accepted by IEEE Transactions on Image Processing
机构 * KAIST(韩国科学技术院) ; ByteDance Seed(字节跳动种子)
专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV
Comments version 1
机构 * ETH Zürich(苏黎世联邦理工学院) ; Google(谷歌) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) ; DAMO Academy, Alibaba Group(阿里达摩院)
专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) ; X-Era AI Lab(X-Era人工智能实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
Comments 16 pages, 6 figures
机构 * Peking University(北京大学) ; University of California, Los Angeles(美国加州大学洛杉矶分校)
专题命中 动作与事件理解 :long video(abstract);分类 cs.CV
Comments Accepted by ICCV 2025
机构 * Delft University of Technology(代尔夫特理工大学) ; German Research Center for Artificial Intelligence(德国人工智能研究中心) ; Mercedes-Benz(梅赛德斯-奔驰)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
机构 * School of Software(软件学院) ; Beihang University(北航) ; Qingdao Research Institute(青岛研究院)
专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV
Comments Accepted by ACM MM 2025
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) ; ReLER, CCAI, Zhejiang University(浙江大学ReLER、CCAI)
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
Comments Accepted by ICCV 2025
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) ; Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) ; Microsoft Research(微软研究院)
专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV
Comments Accepted to ICCV2025. Code available at https://github.com/microsoft/Reducio-VAE