arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 470 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 470 篇

2503.19953 2025-03-27 cs.CV 57%

Self-Supervised Learning of Motion Concepts by Optimizing Counterfactuals

Stefan Stojanov, David Wendt, Seungwoo Kim, Rahul Venkatesh, Kevin Feigelis, Jiajun Wu, Daniel LK Yamins

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Project webpage: https://neuroailab.github.io/opt_cwm_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19383 2025-03-26 cs.CV 57%

MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait Animation

Yukang Lin, Hokit Fung, Jianjin Xu, Zeping Ren, Adela S. M. Lau, Guosheng Yin, Xiu Li

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14340 2025-03-26 cs.CV 57%

Zero-shot Action Localization via the Confidence of Large Vision-Language Models

Josiah Aklilu, Xiaohan Wang, Serena Yeung-Levy

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16916 2025-03-24 cs.CV 57%

Temporal Action Detection Model Compression by Progressive Block Drop

Xiaoyong Chen, Yong Guo, Jiaming Liang, Sitong Zhuang, Runhao Zeng, Xiping Hu

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15871 2025-03-21 cs.CV 57%

MASH-VLM: Mitigating Action-Scene Hallucination in Video-LLMs through Disentangled Spatial-Temporal Representations

Kyungho Bae, Jinhyung Kim, Sihaeng Lee, Soonyoung Lee, Gunhee Lee, Jinwoo Choi

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted for CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12828 2025-03-19 cs.CE cs.CV 57%

AUTV: Creating Underwater Video Datasets with Pixel-wise Annotations

Quang Trung Truong, Wong Yuk Kwan, Duc Thanh Nguyen, Binh-Son Hua, Sai-Kit Yeung

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03699 2025-03-11 cs.CV 57%

Motion-Aware Generative Frame Interpolation

Guozhen Zhang, Yuhan Zhu, Yutao Cui, Xiaotong Zhao, Kai Ma, Limin Wang

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05643 2025-03-04 cs.CV 57%

TRACE: Temporal Grounding Video LLM via Causal Event Modeling

Yongxin Guo, Jingyu Liu, Mingda Li, Qingbin Liu, Xi Chen, Xiaoying Tang

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06525 2025-03-03 cs.CV cs.AI 57%

I2VControl-Camera: Precise Video Camera Control with Adjustable Motion Strength

Wanquan Feng, Jiawei Liu, Pengqi Tu, Tianhao Qi, Mingzhen Sun, Tianxiang Ma, Songtao Zhao, Siyu Zhou, Qian He

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Accepted to ICLR 2025, Project page: https://wanquanf.github.io/I2VControlCamera

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20361 2025-02-28 cs.CV 57%

OpenTAD: A Unified Framework and Comprehensive Study of Temporal Action Detection

Shuming Liu, Chen Zhao, Fatimah Zohra, Mattia Soldan, Alejandro Pardo, Mengmeng Xu, Lama Alssum, Merey Ramazanova, Juan León Alcázar, Anthony Cioppa, Silvio Giancola, Carlos Hinojosa, Bernard Ghanem

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17753 2025-02-27 cs.CV 57%

Task Graph Maximum Likelihood Estimation for Procedural Activity Understanding in Egocentric Videos

Luigi Seminara, Giovanni Maria Farinella, Antonino Furnari

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2406.01486

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03280 2025-02-20 cs.CV cs.AI 57%

Animate Your Thoughts: Decoupled Reconstruction of Dynamic Natural Vision from Slow Brain Activity

Yizhuo Lu, Changde Du, Chong Wang, Xuanliu Zhu, Liuyun Jiang, Xujin Li, Huiguang He

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04296 2025-02-07 cs.RO cs.CV cs.LG 57%

Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression

Lirui Wang, Kevin Zhao, Chaoqi Liu, Xinlei Chen

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Website: https://liruiw.github.io/hma/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04076 2025-02-07 cs.CV 57%

Content-Rich AIGC Video Quality Assessment via Intricate Text Alignment and Motion-Aware Consistency

Shangkun Sun, Xiaoyu Liang, Bowen Qu, Wei Gao

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02817 2025-02-06 cs.AI cs.CV 57%

A Decade of Action Quality Assessment: Largest Systematic Survey of Trends, Challenges, and Future Directions

Hao Yin, Paritosh Parmar, Daoliang Xu, Yang Zhang, Tianyou Zheng, Weiwei Fu

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments 36 Pages, 20 Figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01486 2025-01-10 cs.CV 57%

Differentiable Task Graph Learning: Procedural Activity Representation and Online Mistake Detection from Egocentric Videos

Luigi Seminara, Giovanni Maria Farinella, Antonino Furnari

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03567 2024-12-05 cs.CV 57%

Streaming Detection of Queried Event Start

Cristobal Eyzaguirre, Eric Tang, Shyamal Buch, Adrien Gaidon, Jiajun Wu, Juan Carlos Niebles

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00148 2024-12-03 cs.CV 57%

Motion Modes: What Could Happen Next?

Karran Pandey, Matheus Gadelha, Yannick Hold-Geoffroy, Karan Singh, Niloy J. Mitra, Paul Guerrero

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17751 2024-10-31 cs.CV cs.AI cs.LG 57%

VISAGE: Video Synthesis using Action Graphs for Surgery

Yousef Yeganeh, Rachmadio Lazuardi, Amir Shamseddin, Emine Dari, Yash Thirani, Nassir Navab, Azade Farshad

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Accepted at MICCAI 2024 Embodied AI and Robotics for HealTHcare (EARTH) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12165 2024-10-22 cs.CV cs.AI 57%

Dual-Model Distillation for Efficient Action Classification with Hybrid Edge-Cloud Solution

Timothy Wei, Hsien Xin Peng, Elaine Xu, Bryan Zhao, Lei Ding, Diji Yang

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13830 2024-10-18 cs.CV 57%

DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control

Yujie Wei, Shiwei Zhang, Hangjie Yuan, Xiang Wang, Haonan Qiu, Rui Zhao, Yutong Feng, Feng Liu, Zhizhong Huang, Jiaxin Ye, Yingya Zhang, Hongming Shan

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Project page: https://dreamvideo2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06087 2024-10-15 cs.CV 57%

GAIA: Rethinking Action Quality Assessment for AI-Generated Videos

Zijian Chen, Wei Sun, Yuan Tian, Jun Jia, Zicheng Zhang, Jiarui Wang, Ru Huang, Xiongkuo Min, Guangtao Zhai, Wenjun Zhang

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted by NeurIPS2024 Dataset and Benchmark Track as Spotlight. 33 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08649 2024-10-14 cs.CV 57%

E-Motion: Future Motion Simulation via Event Sequence Diffusion

Song Wu, Zhiyu Zhu, Junhui Hou, Guangming Shi, Jinjian Wu

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05267 2024-10-08 cs.CL cs.CV 57%

Grounding Partially-Defined Events in Multimodal Data

Kate Sanders, Reno Kriz, David Etter, Hannah Recknor, Alexander Martin, Cameron Carpenter, Jingyang Lin, Benjamin Van Durme

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

Comments Preprint; 9 pages; 2024 EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19580 2024-10-01 cs.CV 57%

High Quality Human Image Animation using Regional Supervision and Motion Blur Condition

Zhongcong Xu, Chaoyue Song, Guoxian Song, Jianfeng Zhang, Jun Hao Liew, Hongyi Xu, You Xie, Linjie Luo, Guosheng Lin, Jiashi Feng, Mike Zheng Shou

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17523 2024-09-27 cs.CV cs.AI 57%

EAGLE: Egocentric AGgregated Language-video Engine

Jing Bi, Yunlong Tang, Luchuan Song, Ali Vosoughi, Nguyen Nguyen, Chenliang Xu

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by ACMMM 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18259 2024-09-27 cs.CV cs.AI 57%

Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives

Kristen Grauman, Andrew Westbury, Lorenzo Torresani, Kris Kitani, Jitendra Malik, Triantafyllos Afouras, Kumar Ashutosh, Vijay Baiyya, Siddhant Bansal, Bikram Boote, Eugene Byrne, Zach Chavis, Joya Chen, Feng Cheng, Fu-Jen Chu, Sean Crane, Avijit Dasgupta, Jing Dong, Maria Escobar, Cristhian Forigua, Abrham Gebreselasie, Sanjay Haresh, Jing Huang, Md Mohaiminul Islam, Suyog Jain, Rawal Khirodkar, Devansh Kukreja, Kevin J Liang, Jia-Wei Liu, Sagnik Majumder, Yongsen Mao, Miguel Martin, Effrosyni Mavroudi, Tushar Nagarajan, Francesco Ragusa, Santhosh Kumar Ramakrishnan, Luigi Seminara, Arjun Somayazulu, Yale Song, Shan Su, Zihui Xue, Edward Zhang, Jinxu Zhang, Angela Castillo, Changan Chen, Xinzhu Fu, Ryosuke Furuta, Cristina Gonzalez, Prince Gupta, Jiabo Hu, Yifei Huang, Yiming Huang, Weslie Khoo, Anush Kumar, Robert Kuo, Sach Lakhavani, Miao Liu, Mi Luo, Zhengyi Luo, Brighid Meredith, Austin Miller, Oluwatumininu Oguntola, Xiaqing Pan, Penny Peng, Shraman Pramanick, Merey Ramazanova, Fiona Ryan, Wei Shan, Kiran Somasundaram, Chenan Song, Audrey Southerland, Masatoshi Tateno, Huiyu Wang, Yuchen Wang, Takuma Yagi, Mingfei Yan, Xitong Yang, Zecheng Yu, Shengxin Cindy Zha, Chen Zhao, Ziwei Zhao, Zhifan Zhu, Jeff Zhuo, Pablo Arbelaez, Gedas Bertasius, David Crandall, Dima Damen, Jakob Engel, Giovanni Maria Farinella, Antonino Furnari, Bernard Ghanem, Judy Hoffman, C. V. Jawahar, Richard Newcombe, Hyun Soo Park, James M. Rehg, Yoichi Sato, Manolis Savva, Jianbo Shi, Mike Zheng Shou, Michael Wray

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Expanded manuscript (compared to arxiv v1 from Nov 2023 and CVPR 2024 paper from June 2024) for more comprehensive dataset and benchmark presentation, plus new results on v2 data release

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00126 2024-09-26 cs.CV cs.RO 57%

Event-Free Moving Object Segmentation from Moving Ego Vehicle

Zhuyun Zhou, Zongwei Wu, Danda Pani Paudel, Rémi Boutteau, Fan Yang, Luc Van Gool, Radu Timofte, Dominique Ginhac

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12031 2024-09-19 cs.CV 57%

PhysMamba: Efficient Remote Physiological Measurement with SlowFast Temporal Difference Mamba

Chaoqi Luo, Yiping Xie, Zitong Yu

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments Accepted by CCBR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21136 2024-08-27 cs.CV 57%

MotionCraft: Crafting Whole-Body Motion with Plug-and-Play Multimodal Controls

Yuxuan Bian, Ailing Zeng, Xuan Ju, Xian Liu, Zhaoyang Zhang, Wei Liu, Qiang Xu

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏