arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 473 篇

2506.00928 2025-06-03 cs.CV cs.CL 79%

Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times

Olga Loginova, Sofía Ortega Loguinova

机构 * University of Trento(特伦托大学) Maastricht University(马斯特里赫特大学)

专题命中 动作与事件理解 :video language model(title);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05530 2025-05-20 cs.RO cs.AI cs.CV 79%

This&That: Language-Gesture Controlled Video Generation for Robot Planning

Boyang Wang, Nikhil Sridhar, Chao Feng, Mark Van der Merwe, Adam Fishman, Nima Fazeli, Jeong Joon Park

机构 * University of Michigan(密歇根大学) University of Washington(华盛顿大学)

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08344 2025-04-14 cs.CV 79%

EasyGenNet: An Efficient Framework for Audio-Driven Gesture Video Generation Based on Diffusion Model

Renda Li, Xiaohua Qi, Qiang Ling, Jun Yu, Ziyi Chen, Peng Chang, Mei HanJing Xiao

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09921 2025-04-07 cs.CV cs.AI 79%

Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level

Andong Deng, Tongjia Chen, Shoubin Yu, Taojiannan Yang, Lincoln Spencer, Yapeng Tian, Ajmal Saeed Mian, Mohit Bansal, Chen Chen

专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02700 2025-03-31 cs.CV 79%

Motion Prompting: Controlling Video Generation with Motion Trajectories

Daniel Geng, Charles Herrmann, Junhwa Hur, Forrester Cole, Serena Zhang, Tobias Pfaff, Tatiana Lopez-Guevara, Carl Doersch, Yusuf Aytar, Michael Rubinstein, Chen Sun, Oliver Wang, Andrew Owens, Deqing Sun

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

Comments CVPR 2025 camera ready. Project page: https://motion-prompting.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00719 2025-03-26 cs.CV 79%

Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation

Shuling Zhao, Fa-Ting Hong, Xiaoshui Huang, Dan Xu

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2025. Project page: https://shaelynz.github.io/synergize-motion-appearance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00263 2025-03-14 cs.CV cs.AI 79%

Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation

Kun Yuan, Vinkle Srivastav, Nassir Navab, Nicolas Padoy

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

Comments Accepted at the 38th Conference on Neural Information Processing Systems (NeurIPS 2024 Spolight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05263 2025-03-11 cs.CV 79%

Mind the Time: Temporally-Controlled Multi-Event Video Generation

Ziyi Wu, Aliaksandr Siarohin, Willi Menapace, Ivan Skorokhodov, Yuwei Fang, Varnith Chordia, Igor Gilitschenski, Sergey Tulyakov

专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV

Comments CVPR 2025. Project Page: https://mint-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08549 2025-03-03 cs.CV cs.AI 79%

The Devil is in Temporal Token: High Quality Video Reasoning Segmentation

Sitong Gong, Yunzhi Zhuge, Lu Zhang, Zongxin Yang, Pingping Zhang, Huchuan Lu

专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11594 2025-02-19 cs.CV 79%

iMOVE: Instance-Motion-Aware Video Understanding

Jiaze Li, Yaya Shi, Zongyang Ma, Haoran Xu, Feng Cheng, Huihui Xiao, Ruiwen Kang, Fan Yang, Tingting Gao, Di Zhang

专题命中 动作与事件理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08380 2024-11-14 cs.CV 79%

EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation

Xiaofeng Wang, Kang Zhao, Feng Liu, Jiayu Wang, Guosheng Zhao, Xiaoyi Bao, Zheng Zhu, Yingya Zhang, Xingang Wang

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

Comments Project Page: https://egovid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06158 2024-10-10 cs.RO cs.CV cs.LG 79%

GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation

Chi-Lam Cheang, Guangzeng Chen, Ya Jing, Tao Kong, Hang Li, Yifeng Li, Yuxiao Liu, Hongtao Wu, Jiafeng Xu, Yichu Yang, Hanbo Zhang, Minzhao Zhu

专题命中 动作与事件理解 :video-language(title);video generation(abstract);分类 cs.CV

Comments Tech Report. Authors are listed in alphabetical order. Project page: https://gr2-manipulation.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18111 2024-09-27 cs.CV 79%

E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding

Ye Liu, Zongyang Ma, Zhongang Qi, Yang Wu, Ying Shan, Chang Wen Chen

专题命中 动作与事件理解 :video-language(title);video understanding(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09511 2024-08-20 cs.CV 79%

NAVERO: Unlocking Fine-Grained Semantics for Video-Language Compositionality

Chaofan Tao, Gukyeong Kwon, Varad Gunjal, Hao Yang, Zhaowei Cai, Yonatan Dukler, Ashwin Swaminathan, R. Manmatha, Colin Jon Taylor, Stefano Soatto

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14436 2024-06-21 cs.CV cs.RO 79%

Video Generation with Learned Action Prior

Meenakshi Sarkar, Devansh Bhardwaj, Debasish Ghose

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20305 2024-05-31 cs.CV 79%

Can't make an Omelette without Breaking some Eggs: Plausible Action Anticipation using Large Video-Language Models

Himangi Mittal, Nakul Agarwal, Shao-Yuan Lo, Kwonjoon Lee

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16393 2024-05-29 cs.CV cs.AI 79%

Disentangling Foreground and Background Motion for Enhanced Realism in Human Video Generation

Jinlin Liu, Kai Yu, Mengyang Feng, Xiefan Guo, Miaomiao Cui

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09736 2023-11-10 cs.CV cs.CL 79%

STOA-VLP: Spatial-Temporal Modeling of Object and Action for Video-Language Pre-training

Weihong Zhong, Mao Zheng, Duyu Tang, Xuan Luo, Heng Gong, Xiaocheng Feng, Bing Qin

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

Comments AAAI 2023, 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10683 2023-10-24 cs.CV cs.CL 79%

Paxion: Patching Action Knowledge in Video-Language Foundation Models

Zhenhailong Wang, Ansel Blume, Sha Li, Genglin Liu, Jaemin Cho, Zineng Tang, Mohit Bansal, Heng Ji

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

Comments NeurIPS 2023 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06708 2023-04-14 cs.CV cs.AI cs.CL 79%

Verbs in Action: Improving verb understanding in video-language models

Liliane Momeni, Mathilde Caron, Arsha Nagrani, Andrew Zisserman, Cordelia Schmid

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02350 2022-12-06 cs.CV 79%

Audio-Driven Co-Speech Gesture Video Generation

Xian Liu, Qianyi Wu, Hang Zhou, Yuanqi Du, Wayne Wu, Dahua Lin, Ziwei Liu

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

Comments Accepted by Advances in Neural Information Processing Systems (NeurIPS), 2022 (Spotlight Presentation). Camera-Ready Version, 19 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.14957 2022-03-29 cs.CV 79%

Frame-wise Action Representations for Long Videos via Sequence Contrastive Learning

Minghao Chen, Fangyun Wei, Chong Li, Deng Cai

专题命中 动作与事件理解 :long video(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.05977 2021-04-13 cs.CV 79%

Hybrid Dynamic-static Context-aware Attention Network for Action Assessment in Long Videos

Ling-An Zeng, Fa-Ting Hong, Wei-Shi Zheng, Qi-Zhi Yu, Wei Zeng, Yao-Wei Wang, Jian-Huang Lai

专题命中 动作与事件理解 :long video(title,abstract);分类 cs.CV

Comments ACM International Conference on Multimedia 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.00983 2018-07-04 cs.CV 79%

Long Activity Video Understanding using Functional Object-Oriented Network

Ahmad Babaeian Jelodar, David Paulius, Yu Sun

专题命中 动作与事件理解 :video understanding(title,abstract);分类 cs.CV

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15867 2024-10-22 cs.AI 79%

In-Context Ensemble Learning from Pseudo Labels Improves Video-Language Models for Low-Level Workflow Understanding

Moucheng Xu, Evangelos Chatzaroulas, Luc McCutcheon, Abdul Ahad, Hamzah Azeem, Janusz Marecki, Ammar Anwar

专题命中 动作与事件理解 :video-language(title,abstract)

Comments To appear in NeurIPS Workshop on Video-Language Models 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20811 2025-06-10 cs.CV cs.CL cs.MM 79%

HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models

Xiao Wang, Jingyun Hua, Weihong Lin, Yuanxing Zhang, Fuzheng Zhang, Jianlong Wu, Di Zhang, Liqiang Nie

机构 * Kuaishou Technology(快手科技) Shandong University(山东省大学)

专题命中 动作与事件理解 :video generation(abstract);video understanding(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04415 2026-05-08 cs.CL 78%

STEER: Structured Event Evidence for Video Reasoning via Multi-Objective Reinforcement Learning

STEER: 通过多目标强化学习进行视频推理的结构事件证据

Zinuo Li, Yongxin Guo, Jun Liu, Jiawei Zhan, Xi Jiang, Chengjie Wang, Mohammed Bennamoun, Farid Boussaid, Feng Zheng, Qiuhong Ke

机构 * University of Western Australia(西澳大学) CUHKSZ(香港科技大学) Tencent Youtu Lab(腾讯优图实验室) SUSTech(南方科技大学) Monash University(墨尔本大学)

专题命中 动作与事件理解 :video reasoning(title);video understanding(abstract)

AI总结 本文提出结构事件证据方法,通过多目标强化学习解决视频推理中事件结构缺失问题,提出STEER-60K数据集和P-FAB算法提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20640 2025-11-26 cs.CV cs.AI cs.GR cs.LG 77%

MotionV2V: Editing Motion in a Video

MotionV2V: 视频中运动的编辑

Ryan Burgert, Charles Herrmann, Forrester Cole, Michael S Ryoo, Neal Wadhwa, Andrey Voynov, Nataniel Ruiz

机构 * Google(谷歌) Stony Brook University(石溪大学)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 MotionV2V通过直接编辑稀疏轨迹实现视频运动编辑,利用生成性主干提升视频编辑能力,在用户研究中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18823 2025-11-25 cs.CV 77%

VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models

VideoPerceiver: 提升视频多模态大语言模型的细粒度时序感知能力

Fufangchen Zhao, Liao Zhang, Daiqi Shi, Yuanjun Gao, Chen Ye, Yang Cai, Jian Gao, Danfeng Yan

机构 * State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室)

专题命中 动作与事件理解 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV

AI总结 VideoPerceiver通过两阶段训练框架提升视频多模态大语言模型对细粒度动作和短暂事件的感知能力,显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08117 2024-12-12 cs.CV cs.AI cs.MM cs.NE 76%

E2HQV: High-Quality Video Generation from Event Camera via Theory-Inspired Model-Aided Deep Learning

Qiang Qu, Yiran Shen, Xiaoming Chen, Yuk Ying Chung, Tongliang Liu

专题命中 动作与事件理解 :video generation(title);分类 cs.CV、cs.MM

Comments Accepted in AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏