arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 470 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 470 篇

2512.22688 2025-12-30 cs.CV 57%

Autoregressive Flow Matching for Motion Prediction

自回归流匹配用于运动预测

Johnathan Xie, Stefan Stojanov, Cristobal Eyzaguirre, Daniel L. K. Yamins, Jiajun Wu

机构 * Stanford University(斯坦福大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 ARFM通过自回归流匹配方法,利用多样化视频数据集预测复杂运动,提升机器人和人类动作预测的下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13030 2025-12-29 cs.CV cs.LG cs.RO 57%

Motus: A Unified Latent Action World Model

Motus:一个统一的潜在动作世界模型

Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng, Chendong Xiang, Yinze Rong, Hongyan Zhao, Hanyu Liu, Zhizhong Su, Lei Ma, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) Peking University(北京大学) Horizon Robotics

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 Motus通过统一的潜在动作世界模型整合理解、视频生成和动作模块,利用光流和三阶段训练流程提升大规模动作预训练效果,实现模拟与现实场景中的性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19817 2025-12-24 cs.CV cs.GR 57%

Generating the Past, Present and Future from a Motion-Blurred Image

从模糊图像生成过去、现在和未来

SaiKiran Tedla, Kelly Zhu, Trevor Canham, Felix Taubner, Michael S. Brown, Kiriakos N. Kutulakos, David B. Lindell

机构 * York University(约克大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出利用预训练视频扩散模型从模糊图像恢复过去、现在和未来的视频,以揭示复杂场景动态。

Comments Code and data are available at https://blur2vid.github.io

Journal ref ACM Trans. Graph. (SIGGRAPH Asia 2025), vol. 44, no. 6, pp. 1-15, Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15524 2025-12-18 cs.CV 57%

DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations

DeX-Portrait: 通过显式和潜在运动表示实现解耦且表达性的肖像动画

Yuxiang Shi, Zhe Li, Yanwen Wang, Hao Zhu, Xun Cao, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究所) Nanjing University(南京大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 DeX-Portrait通过显式和潜在运动表示生成解耦且表达性的肖像动画,提升动画质量和可控性。

Comments Projectpage: https://syx132.github.io/DeX-Portrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15386 2025-12-18 cs.CV 57%

See It Before You Grab It: Deep Learning-based Action Anticipation in Basketball

在抓取之前看到它:基于深度学习的篮球运动预测

Arnau Barrera Roy, Albert Clapés Sintes

机构 * Universitat de Barcelona(巴塞罗那大学) Universitat de Barcelona Computer Vision Center(巴塞罗那大学计算机视觉中心)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出篮球动作预测任务,利用深度学习技术预测投篮后球权归属,构建了首个篮球反弹预测数据集,展示了该数据集在篮球视频理解中的广泛应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16020 2025-12-16 cs.CV cs.AI 57%

Physically Realistic Sequence-Level Adversarial Clothing for Robust Human-Detection Evasion

物理真实序列级对抗性服装用于鲁棒的人体检测规避

Dingkun Zhou, Patrick P. K. Chan, Hengxu Wu, Shikang Zheng, Ruiqi Huang, Yuanjie Zhao

机构 * School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) Institute for Interdisciplinary Information Sciences, Tsinghua University(交叉信息研究院,清华大学)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 本研究提出序列级优化框架,生成可打印的对抗性服装纹理,以实现在数字和物理环境中对人类检测的鲁棒规避。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01543 2025-12-15 cs.CV 57%

Efficient Action Counting with Dynamic Queries

高效动态查询动作计数

Xiaoxuan Ma, Zishi Li, Qiuyan Shang, Wentao Zhu, Hai Ci, Yu Qiao, Yizhou Wang

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 本文提出了一种基于动态查询表示的高效动作计数方法,通过动态更新和跨查询对比学习,显著提升了长视频和未见过动作的计数性能。

Comments code: https://github.com/lizishi/DeTRC, proj page: https://shirleymaxx.github.io/DeTRC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10617 2025-12-12 cs.CV 57%

Lang2Motion: Bridging Language and Motion through Joint Embedding Spaces

Lang2Motion: 通过联合嵌入空间连接语言与运动

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 Lang2Motion通过联合嵌入空间连接语言与运动,利用文本描述和视觉化监督生成高精度的轨迹,实现跨领域运动迁移和风格编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05537 2025-12-12 cs.CV cs.AI 57%

Towards Efficient Real-Time Video Motion Transfer via Generative Time Series Modeling

通过生成时间序列建模实现高效的实时视频运动迁移

Tasmiah Haque, Md. Asif Bin Syed, Byungheon Jeong, Xue Bai, Sumit Mohan, Somdyuti Paul, Imtiaz Ahmed, Srinjoy Das

机构 * Coupa Software(Coupa软件) Intel Corporation(英特尔公司)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本研究提出基于生成时间序列模型的实时视频运动迁移框架,通过关键点预测和光流模块实现高效低帧率视频传输,提升带宽效率与视频生成的可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19430 2025-12-05 cs.RO cs.CV 57%

GigaBrain-0: A World Model-Powered Vision-Language-Action Model

GigaBrain-0:一种由世界模型驱动的视觉-语言-动作模型

GigaBrain Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jie Li, Jiagang Zhu, Lv Feng, Peng Li, Qiuping Deng, Runqi Ouyang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yang Wang, Yifan Li, Yilong Li, Yiran Ding, Yuan Xu, Yun Ye, Yukun Zhou, Zhehao Dong, Zhenan Wang, Zhichao Liu, Zheng Zhu

机构 * GigaBrain Team(GigaBrain团队)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 GigaBrain-0通过世界模型生成数据,减少对真实机器人数据的依赖,提升视觉-语言-动作模型的泛化能力和现实世界性能。

Comments https://gigabrain0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02015 2025-12-02 cs.CV 57%

Generative Video Motion Editing with 3D Point Tracks

基于3D点轨迹的生成视频运动编辑

Yao-Chih Lee, Zhoutong Zhang, Jiahui Huang, Jui-Hsien Wang, Joon-Young Lee, Jia-Bin Huang, Eli Shechtman, Zhengqi Li

机构 * Adobe Research(Adobe研究院) Adobe(Adobe公司) University of Maryland College Park(马里兰大学学院公园分校)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出基于3D点轨迹的视频生成框架,实现摄像机与物体运动的联合编辑,通过稀疏对应关系保持时空一致性,提升视频编辑的精确度和创作潜力。

Comments Project page: https://edit-by-track.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01298 2025-12-02 cs.CV 57%

TBT-Former: Learning Temporal Boundary Distributions for Action Localization

TBT-Former:基于时间边界分布的学习用于动作定位

Thisara Rathnayaka, Uthayasanker Thayasivam

机构 * Dept. of Computer Science \& Engineering University of Moratuwa Sri Lanka

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 TBT-Former通过改进的Transformer架构和边界分布回归头,提升动作定位性能,实现THUMOS14和EPIC-Kitchens 100数据集上的新高。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19861 2025-12-02 cs.CV cs.RO 57%

GigaWorld-0: World Models as Data Engine to Empower Embodied AI

GigaWorld-0:世界模型作为数据引擎赋能具身AI

GigaWorld Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jiagang Zhu, Kerui Li, Mengyuan Xu, Qiuping Deng, Siting Wang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yankai Wang, Yu Cao, Yifan Chang, Yuan Xu, Yun Ye, Yang Wang, Yukun Zhou, Zhengyuan Zhang, Zhehao Dong, Zheng Zhu

机构 * GigaWorld Team(GigaWorld团队)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 GigaWorld-0通过整合视频生成与3D建模技术,构建统一的数据引擎,生成高质量具身交互数据,提升VLA模型在现实任务中的性能。

Comments Project Page: https://giga-world-0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18151 2025-12-02 cs.GR cs.AI cs.CV 57%

WonderPlay: Dynamic 3D Scene Generation from a Single Image and Actions

WonderPlay:从单张图像和动作生成动态3D场景

Zizhang Li, Hong-Xing Yu, Wei Liu, Yin Yang, Charles Herrmann, Gordon Wetzstein, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Utah(犹他大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 WonderPlay通过结合物理模拟与视频生成,实现从单张图像和动作生成多样化动态3D场景。

Comments ICCV 2025 (Highlight). The first two authors contributed equally. Project website: https://kyleleey.github.io/WonderPlay/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23428 2025-12-01 cs.CV 57%

DisMo: Disentangled Motion Representations for Open-World Motion Transfer

DisMo:解耦的运动表示用于开放世界运动迁移

Thomas Ressler-Antal, Frank Fundel, Malek Ben Alaya, Stefan Andreas Baumann, Felix Krause, Ming Gui, Björn Ommer

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

AI总结 DisMo通过解耦运动语义与外观,实现了开放世界中的运动迁移,提升了视频生成和理解的性能。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19909 2025-11-26 cs.CV 57%

Motion Marionette: Rethinking Rigid Motion Transfer via Prior Guidance

运动提线木偶:通过先验引导重新思考刚体运动迁移

Haoxuan Wang, Jiachen Tao, Junyi Wu, Gaowen Liu, Ramana Rao Kompella, Yan Yan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Cisco Research(思科研究)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 Motion Marionette通过内部先验引导刚体运动迁移,实现跨物体的高效可控视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13315 2025-11-18 cs.CV cs.AI 57%

Computer Vision based group activity detection and action spotting

Narthana Sivalingam, Santhirarajah Sivasthigan, Thamayanthi Mahendranathan, G. M. R. I. Godaliyadda, M. P. B. Ekanayake, H. M. V. R. Herath

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18800 2025-11-11 cs.CV cs.AI 57%

Video CLIP Model for Multi-View Echocardiography Interpretation

Ryo Takizawa, Satoshi Kodera, Tempei Kabayama, Ryo Matsuoka, Yuta Ando, Yuto Nakamura, Haruki Settai, Norihiko Takeda

机构 * The University of Tokyo Hospital(东京大学医院)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23155 2025-10-24 cs.CV 57%

PreFM: Online Audio-Visual Event Parsing via Predictive Future Modeling

Xiao Yu, Yan Fang, Xiaojie Jin, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19972 2025-10-09 cs.CV 57%

PHI: Bridging Domain Shift in Long-Term Action Quality Assessment via Progressive Hierarchical Instruction

Kanglei Zhou, Hubert P. H. Shum, Frederick W. B. Li, Xingxing Zhang, Xiaohui Liang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Department of Computer Science, Durham University(杜伦大学计算机科学系) Department of Computer Science and Technology, Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University(人工智能研究院,北京人工智能研究院,清华大学-博世联合机器学习中心,THBI实验室,清华大学计算机科学与技术系) Zhongguancun Laboratory, Beijing(中关村实验室,北京)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21888 2025-09-29 cs.CV 57%

Drag4D: Align Your Motion with Text-Driven 3D Scene Generation

Minjun Kang, Inkyu Shin, Taeyeop Lee, In So Kweon, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院) ByteDance Seed(字节跳动种子)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

Comments version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17864 2025-09-23 cs.CV 57%

ProDyG: Progressive Dynamic Scene Reconstruction via Gaussian Splatting from Monocular Videos

Shi Chen, Erik Sandström, Sandro Lombardi, Siyuan Li, Martin R. Oswald

机构 * ETH Zürich(苏黎世联邦理工学院) Google(谷歌) University of Amsterdam(阿姆斯特丹大学)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10090 2025-09-10 cs.CV 57%

InteractPro: A Unified Framework for Motion-Aware Image Composition

Weijing Tao, Xiaofeng Yang, Miaomiao Cui, Guosheng Lin

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) DAMO Academy, Alibaba Group(阿里达摩院)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09822 2025-09-09 cs.CV 57%

Physical Autoregressive Model for Robotic Manipulation without Action Pretraining

Zijian Song, Sihan Qin, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10684 2025-09-03 cs.CV cs.AI 57%

Open-World Skill Discovery from Unsegmented Demonstrations

Jingwen Deng, Zihao Wang, Shaofei Cai, Anji Liu, Yitao Liang

机构 * Peking University(北京大学) University of California, Los Angeles(美国加州大学洛杉矶分校)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16512 2025-08-25 cs.CV 57%

Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation

Chun-Peng Chang, Chen-Yu Wang, Julian Schmidt, Holger Caesar, Alain Pagani

机构 * Delft University of Technology(代尔夫特理工大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) Mercedes-Benz(梅赛德斯-奔驰)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15535 2025-08-22 cs.CV 57%

Multi-Object Sketch Animation with Grouping and Motion Trajectory Priors

Guotao Liang, Juncheng Hu, Ximing Xing, Jing Zhang, Qian Yu

机构 * School of Software(软件学院) Beihang University(北航) Qingdao Research Institute(青岛研究院)

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05311 2025-08-21 cs.CV 57%

MMAD: Multi-label Micro-Action Detection in Videos

Kun Li, Pengyu Liu, Dan Guo, Fei Wang, Zhiliang Wu, Hehe Fan, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) ReLER, CCAI, Zhejiang University(浙江大学ReLER、CCAI)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08307 2025-08-15 cs.CV 57%

M2DAO-Talker: Harmonizing Multi-granular Motion Decoupling and Alternating Optimization for Talking-head Generation

Kui Jiang, Shiyu Liu, Junjun Jiang, Hongxun Yao, Xiaopeng Fan

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13552 2025-08-13 cs.CV 57%

REDUCIO! Generating 1K Video within 16 Seconds using Extremely Compressed Motion Latents

Rui Tian, Qi Dai, Jianmin Bao, Kai Qiu, Yifan Yang, Chong Luo, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Microsoft Research(微软研究院)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Accepted to ICCV2025. Code available at https://github.com/microsoft/Reducio-VAE

详情

展开后加载摘要…

URL PDF HTML 收藏