arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 470 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 470 篇

2508.07989 2025-08-12 cs.CV cs.HC 57%

The Escalator Problem: Identifying Implicit Motion Blindness in AI for Accessibility

Xiantao Zhang

机构 * Beihang University(北航大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments 9 pages, 3 figures, 2 tables. Accepted at CV4A11y, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04049 2025-08-07 cs.CV 57%

Motion is the Choreographer: Learning Latent Pose Dynamics for Seamless Sign Language Generation

Jiayi He, Xu Wang, Shengeng Tang, Yaxiong Wang, Lechao Cheng, Dan Guo

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01304 2025-08-07 cs.CV 57%

Deep learning for action spotting in association football videos

Silvio Giancola, Anthony Cioppa, Bernard Ghanem, Marc Van Droogenbroeck

机构 * 1 Center of Excellence for Generative AI, IVUL, KAUST, Saudi Arabia 2 Montefiore Institute, Open-SportsLab, University of Li \`e ge, Belgium

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments 31 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21353 2025-07-30 cs.CV cs.LG 57%

Group Relative Augmentation for Data Efficient Action Detection

Deep Anil Patel, Iain Melvin, Zachary Izzo, Martin Renqiang Min

机构 * NEC Laboratories America(NEC美洲实验室)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13092 2025-07-29 cs.CV 57%

EventVAD: Training-Free Event-Aware Video Anomaly Detection

Yihua Shao, Haojin He, Sijie Li, Siyu Chen, Xinwei Long, Fanhu Zeng, Yuxuan Fan, Muyang Zhang, Ziyang Yan, Ao Ma, Xiaochen Wang, Hao Tang, Yan Wang, Shuyan Li

机构 * Peking University(北京大学) Guangdong University of Technology(广东工业大学) The University of Sheffield(谢菲尔德大学) University of Science and Technology Beijing(北京科技大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nanjing University(南京大学) University of Trento(特伦特大学) Queen's University Belfast(贝尔法斯特女王大学)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments Paper was accepted by ACM MM 2025; Code: https://github.com/YihuaJerry/EventVAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02361 2025-07-15 cs.GR cs.CV 57%

MG-Gen: Single Image to Motion Graphics Generation

Takahiro Shirakawa, Tomoyuki Suzuki, Takuto Narumoto, Daichi Haraguchi

机构 * CyberAgent

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01012 2025-07-02 cs.CV 57%

DAM-VSR: Disentanglement of Appearance and Motion for Video Super-Resolution

Zhe Kong, Le Li, Yong Zhang, Feng Gao, Shaoshu Yang, Tao Wang, Kaihao Zhang, Zhuoliang Kang, Xiaoming Wei, Guanying Chen, Wenhan Luo

机构 * Shenzhen Campus of Sun Yat-sen University, China, Meituan, China and Division of AMC and Department of ECE, HKUST(深圳中山大学校园,中国,美团,中国及AMC部门和HKUST电子工程系) Department of ECE, HKUST Hong Kong(HKUST电子工程系,香港) Tianjin University China(天津大学,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences China(中国科学院大学人工智能学院,中国) Nanjing University China(南京大学,中国) Harbin Institute of Technology, Shenzhen China(哈尔滨工业大学深圳校区,中国) Shenzhen Campus of Sun Yat-sen University China(深圳中山大学校园,中国) Department of ECE, HKUST(HKUST电子工程系) Tianjin University(天津大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Nanjing University(南京大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Shenzhen Campus of Sun Yat-sen University(深圳中山大学校园)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

Comments Accepted by ACM SIGGRAPH 2025, Homepage: https://kongzhecn.github.io/projects/dam-vsr/ Github: https://github.com/kongzhecn/DAM-VSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11768 2025-06-16 cs.CV 57%

MambaVSR: Content-Aware Scanning State Space Model for Video Super-Resolution

Linfeng He, Meiqin Liu, Qi Tang, Chao Yao, Yao Zhao

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) Visual Intelligence + X International Cooperation Joint Laboratory of MOE, Beijing Jiaotong University(教育部视觉智能+X国际合作联合实验室) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11621 2025-06-16 cs.CV 57%

SignAligner: Harmonizing Complementary Pose Modalities for Coherent Sign Language Generation

Xu Wang, Shengeng Tang, Lechao Cheng, Feng Li, Shuo Wang, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11144 2025-06-16 cs.CV 57%

AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation

Chao Liang, Jianwen Jiang, Wang Liao, Jiaqi Yang, Zerong zheng, Weihong Zeng, Han Liang

机构 * ByteDance(字节跳动)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Homepage: https://alignhuman.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09411 2025-06-12 cs.CV cs.AI 57%

Synthetic Human Action Video Data Generation with Pose Transfer

Vaclav Knapp, Matyas Bohacek

机构 * SSPS(社会学系) Stanford University(斯坦福大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Journal ref Synthetic Data for Computer Vision Workshop @ CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08466 2025-06-10 cs.CV 57%

Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models

Quan Zhang, Jinwei Fang, Rui Yuan, Xi Tang, Yuxin Qi, Ke Zhang, Chun Yuan

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20218 2025-06-04 cs.CV 57%

Video Motion Graphs

Haiyang Liu, Zhan Xu, Fa-Ting Hong, Hsin-Ping Huang, Yi Zhou, Yang Zhou

机构 * The University of Tokyo(东京大学) Adobe Research(Adobe研究)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments 14 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20920 2025-05-28 cs.CV 57%

HuMoCon: Concept Discovery for Human Motion Understanding

Qihang Fang, Chengcheng Tang, Bugra Tekin, Shugao Ma, Yanchao Yang

机构 * The University of Hong Kong(香港大学) Meta

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments 18 pages, 10 figures

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19306 2025-05-27 cs.RO cs.CV cs.GR cs.LG 57%

From Single Images to Motion Policies via Video-Generation Environment Representations

Weiming Zhi, Ziyong Ma, Tianyi Zhang, Matthew Johnson-Roberson

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12549 2025-05-26 cs.CV 57%

VGGT-SLAM: Dense RGB SLAM Optimized on the SL(4) Manifold

Dominic Maggio, Hyungtae Lim, Luca Carlone

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13437 2025-05-20 cs.CV cs.AI 57%

FinePhys: Fine-grained Human Action Generation by Explicitly Incorporating Physical Laws for Effective Skeletal Guidance

Dian Shao, Mingfei Shi, Shengda Xu, Haodong Chen, Yongle Huang, Binglu Wang

机构 * Unmanned System Research Institute, Northwestern Polytechnical University, Xi’an, China(无人系统研究院、西北工业大学、西安,中国) School of Software, Northwestern Polytechnical University, Xi’an, China(软件学院、西北工业大学、西安,中国) School of Automation, Northwestern Polytechnical University, Xi’an, China(自动化学院、西北工业大学、西安,中国) School of Astronautics, Northwestern Polytechnical University, Xi’an, China(航天学院、西北工业大学、西安,中国)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11383 2025-05-19 cs.CV cs.RO 57%

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation

Zihan Wang, Seungjun Lee, Gim Hee Lee

机构 * School of Computing, National University of Singapore(计算学院,新加坡国立大学)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02393 2025-05-09 cs.CV 57%

Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection

Sungheon Jeong, Jihong Park, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01583 2025-05-06 cs.CV cs.AI 57%

TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action

Jen-Hao Cheng, Vivian Wang, Huayu Wang, Huapeng Zhou, Yi-Hao Peng, Hou-I Liu, Hsiang-Wei Huang, Kuang-Ming Chen, Cheng-Yen Yang, Wenhao Chai, Yi-Ling Chen, Vibhav Vineet, Qin Cai, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) National Yang Ming Chiao Tung University Microsoft(微软公司)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00200 2025-04-28 cs.RO cs.CV 57%

Unified Video Action Model

Shuang Li, Yihuai Gao, Dorsa Sadigh, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Project website: https://unified-video-action-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10676 2025-04-16 cs.CV 57%

H-MoRe: Learning Human-centric Motion Representation for Action Analysis

Zhanbo Huang, Xiaoming Liu, Yu Kong

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments 15 pages, 14 figures, 7 tables, accepted to CVPR 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08222 2025-04-16 cs.CV cs.AI 57%

F$^3$Set: Towards Analyzing Fast, Frequent, and Fine-grained Events from Videos

Zhaoyu Liu, Kan Jiang, Murong Ma, Zhe Hou, Yun Lin, Jin Song Dong

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments ICLR 2025; Website URL: https://lzyandy.github.io/f3set-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00672 2025-04-15 cs.CV 57%

ExpertAF: Expert Actionable Feedback from Video

Kumar Ashutosh, Tushar Nagarajan, Georgios Pavlakos, Kris Kitani, Kristen Grauman

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04842 2025-04-08 cs.CV 57%

FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis

Mengchao Wang, Qiang Wang, Fan Jiang, Yaqi Fan, Yunpeng Zhang, Yonggang Qi, Kun Zhao, Mu Xu

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17422 2025-04-08 cs.CV cs.AI cs.RO 57%

Open-Vocabulary Action Localization with Iterative Visual Prompting

Naoki Wake, Atsushi Kanehira, Kazuhiro Sasabuchi, Jun Takamatsu, Katsushi Ikeuchi

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments 9 pages, 5 figures, 6 tables. Published in IEEE Access. Last updated on April 7th, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00432 2025-04-02 cs.CV 57%

DecoFuse: Decomposing and Fusing the "What", "Where", and "How" for Brain-Inspired fMRI-to-Video Decoding

Chong Li, Jingyang Huo, Weikang Gong, Yanwei Fu, Xiangyang Xue, Jianfeng Feng

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24026 2025-04-02 cs.CV 57%

HumanDreamer: Generating Controllable Human-Motion Videos via Decoupled Generation

Boyuan Wang, Xiaofeng Wang, Chaojun Ni, Guosheng Zhao, Zhiqin Yang, Zheng Zhu, Muyang Zhang, Yukun Zhou, Xinze Chen, Guan Huang, Lihong Liu, Xingang Wang

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Project Page: https://humandreamer.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21616 2025-03-28 cs.CV 57%

Audio-driven Gesture Generation via Deviation Feature in the Latent Space

Jiahui Chen, Yang Huan, Runhua Shi, Chanfan Ding, Xiaoqi Mo, Siyu Xiong, Yinong He

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20348 2025-03-27 cs.CV cs.AI cs.CL cs.LG 57%

VideoGEM: Training-free Action Grounding in Videos

Felix Vogel, Walid Bousselham, Anna Kukleva, Nina Shvetsova, Hilde Kuehne

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏