arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 469 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 469 篇

2411.09921 2025-04-07 cs.CV cs.AI 79%

Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level

Andong Deng, Tongjia Chen, Shoubin Yu, Taojiannan Yang, Lincoln Spencer, Yapeng Tian, Ajmal Saeed Mian, Mohit Bansal, Chen Chen

专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02700 2025-03-31 cs.CV 79%

Motion Prompting: Controlling Video Generation with Motion Trajectories

Daniel Geng, Charles Herrmann, Junhwa Hur, Forrester Cole, Serena Zhang, Tobias Pfaff, Tatiana Lopez-Guevara, Carl Doersch, Yusuf Aytar, Michael Rubinstein, Chen Sun, Oliver Wang, Andrew Owens, Deqing Sun

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

Comments CVPR 2025 camera ready. Project page: https://motion-prompting.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00719 2025-03-26 cs.CV 79%

Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation

Shuling Zhao, Fa-Ting Hong, Xiaoshui Huang, Dan Xu

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2025. Project page: https://shaelynz.github.io/synergize-motion-appearance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00263 2025-03-14 cs.CV cs.AI 79%

Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation

Kun Yuan, Vinkle Srivastav, Nassir Navab, Nicolas Padoy

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

Comments Accepted at the 38th Conference on Neural Information Processing Systems (NeurIPS 2024 Spolight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05263 2025-03-11 cs.CV 79%

Mind the Time: Temporally-Controlled Multi-Event Video Generation

Ziyi Wu, Aliaksandr Siarohin, Willi Menapace, Ivan Skorokhodov, Yuwei Fang, Varnith Chordia, Igor Gilitschenski, Sergey Tulyakov

专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV

Comments CVPR 2025. Project Page: https://mint-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08549 2025-03-03 cs.CV cs.AI 79%

The Devil is in Temporal Token: High Quality Video Reasoning Segmentation

Sitong Gong, Yunzhi Zhuge, Lu Zhang, Zongxin Yang, Pingping Zhang, Huchuan Lu

专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11594 2025-02-19 cs.CV 79%

iMOVE: Instance-Motion-Aware Video Understanding

Jiaze Li, Yaya Shi, Zongyang Ma, Haoran Xu, Feng Cheng, Huihui Xiao, Ruiwen Kang, Fan Yang, Tingting Gao, Di Zhang

专题命中 动作与事件理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08380 2024-11-14 cs.CV 79%

EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation

Xiaofeng Wang, Kang Zhao, Feng Liu, Jiayu Wang, Guosheng Zhao, Xiaoyi Bao, Zheng Zhu, Yingya Zhang, Xingang Wang

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

Comments Project Page: https://egovid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06158 2024-10-10 cs.RO cs.CV cs.LG 79%

GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation

Chi-Lam Cheang, Guangzeng Chen, Ya Jing, Tao Kong, Hang Li, Yifeng Li, Yuxiao Liu, Hongtao Wu, Jiafeng Xu, Yichu Yang, Hanbo Zhang, Minzhao Zhu

专题命中 动作与事件理解 :video-language(title);video generation(abstract);分类 cs.CV

Comments Tech Report. Authors are listed in alphabetical order. Project page: https://gr2-manipulation.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18111 2024-09-27 cs.CV 79%

E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding

Ye Liu, Zongyang Ma, Zhongang Qi, Yang Wu, Ying Shan, Chang Wen Chen

专题命中 动作与事件理解 :video-language(title);video understanding(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09511 2024-08-20 cs.CV 79%

NAVERO: Unlocking Fine-Grained Semantics for Video-Language Compositionality

Chaofan Tao, Gukyeong Kwon, Varad Gunjal, Hao Yang, Zhaowei Cai, Yonatan Dukler, Ashwin Swaminathan, R. Manmatha, Colin Jon Taylor, Stefano Soatto

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14436 2024-06-21 cs.CV cs.RO 79%

Video Generation with Learned Action Prior

Meenakshi Sarkar, Devansh Bhardwaj, Debasish Ghose

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20305 2024-05-31 cs.CV 79%

Can't make an Omelette without Breaking some Eggs: Plausible Action Anticipation using Large Video-Language Models

Himangi Mittal, Nakul Agarwal, Shao-Yuan Lo, Kwonjoon Lee

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16393 2024-05-29 cs.CV cs.AI 79%

Disentangling Foreground and Background Motion for Enhanced Realism in Human Video Generation

Jinlin Liu, Kai Yu, Mengyang Feng, Xiefan Guo, Miaomiao Cui

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09736 2023-11-10 cs.CV cs.CL 79%

STOA-VLP: Spatial-Temporal Modeling of Object and Action for Video-Language Pre-training

Weihong Zhong, Mao Zheng, Duyu Tang, Xuan Luo, Heng Gong, Xiaocheng Feng, Bing Qin

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

Comments AAAI 2023, 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10683 2023-10-24 cs.CV cs.CL 79%

Paxion: Patching Action Knowledge in Video-Language Foundation Models

Zhenhailong Wang, Ansel Blume, Sha Li, Genglin Liu, Jaemin Cho, Zineng Tang, Mohit Bansal, Heng Ji

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

Comments NeurIPS 2023 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06708 2023-04-14 cs.CV cs.AI cs.CL 79%

Verbs in Action: Improving verb understanding in video-language models

Liliane Momeni, Mathilde Caron, Arsha Nagrani, Andrew Zisserman, Cordelia Schmid

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02350 2022-12-06 cs.CV 79%

Audio-Driven Co-Speech Gesture Video Generation

Xian Liu, Qianyi Wu, Hang Zhou, Yuanqi Du, Wayne Wu, Dahua Lin, Ziwei Liu

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

Comments Accepted by Advances in Neural Information Processing Systems (NeurIPS), 2022 (Spotlight Presentation). Camera-Ready Version, 19 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.14957 2022-03-29 cs.CV 79%

Frame-wise Action Representations for Long Videos via Sequence Contrastive Learning

Minghao Chen, Fangyun Wei, Chong Li, Deng Cai

专题命中 动作与事件理解 :long video(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.05977 2021-04-13 cs.CV 79%

Hybrid Dynamic-static Context-aware Attention Network for Action Assessment in Long Videos

Ling-An Zeng, Fa-Ting Hong, Wei-Shi Zheng, Qi-Zhi Yu, Wei Zeng, Yao-Wei Wang, Jian-Huang Lai

专题命中 动作与事件理解 :long video(title,abstract);分类 cs.CV

Comments ACM International Conference on Multimedia 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.00983 2018-07-04 cs.CV 79%

Long Activity Video Understanding using Functional Object-Oriented Network

Ahmad Babaeian Jelodar, David Paulius, Yu Sun

专题命中 动作与事件理解 :video understanding(title,abstract);分类 cs.CV

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15867 2024-10-22 cs.AI 79%

In-Context Ensemble Learning from Pseudo Labels Improves Video-Language Models for Low-Level Workflow Understanding

Moucheng Xu, Evangelos Chatzaroulas, Luc McCutcheon, Abdul Ahad, Hamzah Azeem, Janusz Marecki, Ammar Anwar

专题命中 动作与事件理解 :video-language(title,abstract)

Comments To appear in NeurIPS Workshop on Video-Language Models 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20811 2025-06-10 cs.CV cs.CL cs.MM 79%

HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models

Xiao Wang, Jingyun Hua, Weihong Lin, Yuanxing Zhang, Fuzheng Zhang, Jianlong Wu, Di Zhang, Liqiang Nie

机构 * Kuaishou Technology(快手科技) Shandong University(山东省大学)

专题命中 动作与事件理解 :video generation(abstract);video understanding(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04415 2026-05-08 cs.CL 78%

STEER: Structured Event Evidence for Video Reasoning via Multi-Objective Reinforcement Learning

STEER: 通过多目标强化学习进行视频推理的结构事件证据

Zinuo Li, Yongxin Guo, Jun Liu, Jiawei Zhan, Xi Jiang, Chengjie Wang, Mohammed Bennamoun, Farid Boussaid, Feng Zheng, Qiuhong Ke

机构 * University of Western Australia(西澳大学) CUHKSZ(香港科技大学) Tencent Youtu Lab(腾讯优图实验室) SUSTech(南方科技大学) Monash University(墨尔本大学)

专题命中 动作与事件理解 :video reasoning(title);video understanding(abstract)

AI总结 本文提出结构事件证据方法,通过多目标强化学习解决视频推理中事件结构缺失问题,提出STEER-60K数据集和P-FAB算法提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20640 2025-11-26 cs.CV cs.AI cs.GR cs.LG 77%

MotionV2V: Editing Motion in a Video

MotionV2V: 视频中运动的编辑

Ryan Burgert, Charles Herrmann, Forrester Cole, Michael S Ryoo, Neal Wadhwa, Andrey Voynov, Nataniel Ruiz

机构 * Google(谷歌) Stony Brook University(石溪大学)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 MotionV2V通过直接编辑稀疏轨迹实现视频运动编辑,利用生成性主干提升视频编辑能力,在用户研究中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18823 2025-11-25 cs.CV 77%

VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models

VideoPerceiver: 提升视频多模态大语言模型的细粒度时序感知能力

Fufangchen Zhao, Liao Zhang, Daiqi Shi, Yuanjun Gao, Chen Ye, Yang Cai, Jian Gao, Danfeng Yan

机构 * State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室)

专题命中 动作与事件理解 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV

AI总结 VideoPerceiver通过两阶段训练框架提升视频多模态大语言模型对细粒度动作和短暂事件的感知能力,显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08117 2024-12-12 cs.CV cs.AI cs.MM cs.NE 76%

E2HQV: High-Quality Video Generation from Event Camera via Theory-Inspired Model-Aided Deep Learning

Qiang Qu, Yiran Shen, Xiaoming Chen, Yuk Ying Chung, Tongliang Liu

专题命中 动作与事件理解 :video generation(title);分类 cs.CV、cs.MM

Comments Accepted in AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01862 2024-04-03 cs.CV cs.HC cs.MM 76%

Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model

Xu He, Qiaochu Huang, Zhensong Zhang, Zhiwei Lin, Zhiyong Wu, Sicheng Yang, Minglei Li, Zhiyi Chen, Songcen Xu, Xiaofei Wu

专题命中 动作与事件理解 :video generation(title);分类 cs.CV、cs.MM

Comments 22 pages, 8 figures, CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09694 2025-05-20 cs.RO 75%

EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models

Hu Yue, Siyuan Huang, Yue Liao, Shengcong Chen, Pengfei Zhou, Liliang Chen, Maoqing Yao, Guanghui Ren

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);text-to-video(abstract)

Comments Website: https://github.com/AgibotTech/EWMBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13332 2026-06-12 cs.CV 新提交 74%

OR-Action: Multi-Role Video Understanding with Fine-Grained Actions

OR-Action: 细粒度动作的多角色视频理解

Felix Tristram, Ege Özsoy, Christian Benz, Marcel Walch, Ghazal Ghazaei, Nassir Navab

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Carl Zeiss AG(卡尔蔡司股份公司)

专题命中 动作与事件理解 :video understanding(title);分类 cs.CV

AI总结 针对手术室活动理解中场景图方法缺乏时间建模的问题,提出基于公开数据集的细粒度多角色动作基准,并引入纯视觉时序模型,显著优于图方法,同时提出多视角到单视角特征对齐策略提升单视角性能。

详情

展开后加载摘要…

URL PDF HTML 收藏