arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 469 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 469 篇

2605.06185 2026-05-08 cs.AI cs.CV 88%

Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios

事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架

Peizheng Yan, Yu Zhao, Liang Xie, Juntong Qi, Mingming Wang, Erwei Yin

机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) Tianjin University(天津大学) Institute of Computing and Intelligence(计算与智能研究所) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) School of Future Technology(未来技术学院) Shanghai University(上海大学)

专题命中 动作与事件理解 :video reasoning(title,abstract);long video(title);video understanding(abstract);分类 cs.CV

AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14052 2026-03-23 cs.CV cs.MA 88%

A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning

一种多智能体感知-行动联盟用于高效长视频推理

Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Zachary Yahn, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

专题命中 动作与事件理解 :video reasoning(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出A4VL多智能体感知-行动探索联盟,通过多轮感知-行动探索循环提升长视频推理效率,采用事件驱动划分和线索引导块对齐技术,实现高质量推理并降低推理延迟。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08328 2024-11-14 cs.CV 85%

Motion Control for Enhanced Complex Action Video Generation

Qiang Zhou, Shaofeng Zhang, Nianzu Yang, Ye Qian, Hao Li

专题命中 动作与事件理解 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://mvideo-v1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13024 2026-03-16 cs.CV cs.AI cs.LG eess.IV 84%

SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation

SAW:通过可控且可扩展的视频生成实现手术动作世界模型

Sampath Rapuri, Lalithkumar Seenivasan, Dominik Schneider, Roger Soberanis-Mukul, Yufan He, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Pengfei Guo, Daguang Xu, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) NVIDIA

专题命中 动作与事件理解 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、eess.IV

AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。

Comments The manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02159 2023-07-19 cs.CV cs.MM 84%

Robustness Analysis of Video-Language Models Against Visual and Language Perturbations

Madeline C. Schiappa, Shruti Vyas, Hamid Palangi, Yogesh S. Rawat, Vibhav Vineet

专题命中 动作与事件理解 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments NeurIPS 2022 Datasets and Benchmarks Track. This projects webpage is located at https://bit.ly/3CNOly4

Journal ref Proceedings of the Neural Information Processing Systems Track on Datasets and Benchmarks (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18856 2026-05-11 cs.CV cs.AI 83%

Motion-o: Trajectory-Grounded Video Reasoning

Motion-o:基于轨迹的视频推理

Bishoy Galoaa, Shayda Moezzi, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 动作与事件理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 Motion-o通过引入运动链推理,使视频推理模型能够显式且可验证地表示物体运动轨迹,提升动态和轨迹依赖性推理的可监督性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04532 2025-12-05 cs.CV cs.AI 83%

PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement

PhyVLLM:具有运动-外观解耦的物理引导视频语言模型

Yu-Wei Zhan, Xin Wang, Hong Chen, Tongtong Feng, Wei Feng, Ren Wang, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 动作与事件理解 :video language model(title);video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 PhyVLLM通过引入物理运动建模和运动-外观解耦,提升视频语言模型在物理推理和视频理解任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07227 2025-10-28 cs.CV 83%

MECD+: Unlocking Event-Level Causal Graph Discovery for Video Reasoning

Tieyuan Chen, Huabin Liu, Yi Wang, Yihang Chen, Tianyao He, Chaofan Gan, Huanyu He, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学) Zhongguancun Academy(中关村academy) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 动作与事件理解 :video reasoning(title);video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted by IEEE TPAMI (IEEE Transactions on Pattern Analysis and Machine Intelligence). arXiv admin note: substantial text overlap with arXiv:2409.17647

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17647 2024-12-30 cs.CV 83%

MECD: Unlocking Multi-Event Causal Discovery in Video Reasoning

Tieyuan Chen, Huabin Liu, Tianyao He, Yihang Chen, Chaofan Gan, Xiao Ma, Cheng Zhong, Yang Zhang, Yingxue Wang, Hui Lin, Weiyao Lin

专题命中 动作与事件理解 :video reasoning(title,abstract);long video(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2024 as a spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12919 2023-12-05 cs.CV cs.AI 83%

SPOT! Revisiting Video-Language Models for Event Understanding

Gengyuan Zhang, Jinhe Bi, Jindong Gu, Yanyu Chen, Volker Tresp

专题命中 动作与事件理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03883 2025-09-05 cs.CV cs.MM 81%

Human Motion Video Generation: A Survey

Haiwei Xue, Xiangyang Luo, Zhanghao Hu, Xin Zhang, Xunzhi Xiang, Yuqin Dai, Jianzhuang Liu, Zhensong Zhang, Minglei Li, Jian Yang, Fei Ma, Zhiyong Wu, Changpeng Yang, Zonghong Dai, Fei Richard Yu

机构 * Tsinghua University(清华大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Huawei Noah’s Ark Lab(华为诺亚实验室) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学学院) Artificial Intelligence Innovation and Incubation (Al’) Institute of Fudan University(复旦大学人工智能创新与孵化院) University of Chinese Academy of Sciences(中国科学院大学) PCA Lab, Nanjing University of Science and Technology(南京理工大学PCA实验室) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Shenzhen University and Carleton University(深圳大学和卡尔顿大学)

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by TPAMI. Github Repo: https://github.com/Winn1y/Awesome-Human-Motion-Video-Generation IEEE Access: https://ieeexplore.ieee.org/document/11106267

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12018 2024-10-24 cs.CV cs.CL cs.MM 81%

LocoMotion: Learning Motion-Focused Video-Language Representations

Hazel Doughty, Fida Mohammad Thoker, Cees G. M. Snoek

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV、cs.MM

Comments ACCV 2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07932 2026-08-11 cs.CV 新提交 79%

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16322 2026-07-21 cs.CV cs.AI 新提交 79%

GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs

GMoT:用于基于多模态大语言模型的细粒度微手势视频推理的门控运动感知令牌化

Taorui Wang, Wei Xia, Hui Ma, Zijia Song, Jiayu Zhang, Zeheng Wang, Yong Xu, Zitong Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)

专题命中 动作与事件理解 :video reasoning(title);video understanding(abstract);分类 cs.CV

AI总结 研究针对微手势识别中运动易被掩盖及MLLMs处理运动学困难的问题,提出GMoT模块,通过空间加权池等提取运动线索并融合,引入渐进奖励引导策略优化范式,在多数据集上表现出色,还提出BRG召回及跨域转移协议。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17298 2026-06-17 cs.CV 新提交 79%

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins

面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生

Yiqing Shen, Hao Ding, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 动作与事件理解 :text-to-video(title,abstract);分类 cs.CV

AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17045 2026-06-02 cs.CV cs.AI cs.LG 79%

Video Reasoning without Training

无需训练的视频推理

Deepak Sridhar, Kartikeya Bhardwaj, Jeya Pradha Jeyaraj, Nuno Vasconcelos, Ankita Nayak, Harris Teague

机构 * Qualcomm AI Research(高通AI研究) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV

AI总结 提出V-Reason方法,利用输出分布熵作为信号,通过轻量级控制器在推理时自适应调整值缓存,无需强化学习或微调即可提升视频推理性能。

Comments CVPR Findings 2026. Project Page https://deepaksridhar.github.io/vreason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30750 2026-06-01 cs.CV 79%

SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling

SLAP: 用于变分视频-语言建模的语义最小作用原理

Xiang Fang, Wanlong Fang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

AI总结 提出语义最小作用原理(SLAP),将视频插值建模为黎曼流形上的边界值问题,通过离散欧拉-拉格朗日方程保持对象持久性,解决大视频语言模型中的时间间隙问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17555 2026-05-14 cs.CV 79%

GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking

GraphThinker: 通过事件图思维强化时间感知的视频推理

Zixu Cheng, Da Li, Jian Hu, Yuhang Zang, Ziquan Liu, Shaogang Gong, Wei Li

机构 * Queen Mary University of London(伦敦玛丽女王大学) Samsung AI Centre Cambridge(剑桥三星人工智能中心) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV

AI总结 本文提出GraphThinker,通过构建结构化事件表示并强化视觉 grounding,减少视频推理中的时间幻觉。在RexTime和VidHalluc数据集上取得显著提升。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23120 2026-03-16 cs.CV 79%

MMGT: Motion Mask Guided Two-Stage Network for Co-Speech Gesture Video Generation

MMGT:基于运动遮罩的两阶段网络用于语音手势视频生成

Siyuan Wang, Jiawei Liu, Wei Wang, Yeying Jin, Jinsong Du, Zhi Han

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出MMGT网络,通过结合音频、运动遮罩和姿态视频生成同步语音手势视频,解决单一音频控制导致的大动作缺失问题,提升视频质量与细节控制。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10408 2026-03-12 cs.CV 79%

Motion Forcing: A Decoupled Framework for Robust Video Generation in Motion Dynamics

运动强制:一种解耦框架,用于运动动态中的鲁棒视频生成

Tianshuo Xu, Zhifei Chen, Leyi Wu, Hao Lu, Ying-cong Chen

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

AI总结 运动强制通过解耦物理推理与视觉合成,提升复杂场景下视频生成的鲁棒性和物理一致性。

Comments https://tianshuo-xu.github.io/Motion-Forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04899 2026-03-06 cs.CV 79%

FC-VFI: Faithful and Consistent Video Frame Interpolation for High-FPS Slow Motion Video Generation

FC-VFI: 用于高帧率慢动作视频生成的忠实且一致的视频帧插值

Ganggui Ding, Hao Chen, Xiaogang Xu

机构 * Zhejiang University Chinese University of Hong Kong(浙江大学香港中文大学)

专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 FC-VFI通过引入时间建模策略和语义匹配线,实现了高帧率慢动作视频生成中的忠实且一致的帧插值。

Comments ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11792 2025-12-15 cs.CV 79%

Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation

从跟踪中获取结构:从自回归视频跟踪模型中蒸馏保持结构的运动用于视频生成

Yang Fei, George Stoica, Jingyuan Liu, Qifeng Chen, Ranjay Krishna, Xiaojuan Wang, Benlin Liu

机构 * HKUST(香港科技大学) University of Washington(华盛顿大学) Georgia Tech(佐治亚理工学院) Adobe(Adobe公司)

专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 通过蒸馏自回归视频跟踪模型中的结构保持运动先验,SAM2VideoX在视频生成任务中实现了更高的保真度和一致性。

Comments Project Website: https://sam2videox.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11576 2025-11-18 cs.CV 79%

Causality Matters: How Temporal Information Emerges in Video Language Models

Yumeng Shi, Quanyu Long, Yin Wu, Wenya Wang

专题命中 动作与事件理解 :video language model(title,abstract);分类 cs.CV

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02244 2025-09-29 cs.CV cs.AI 79%

Physics-Guided Motion Loss for Video Generation Model

Bowen Xue, Giuseppe Claudio Guarnera, Shuang Zhao, Zahra Montazeri

机构 * University of Manchester(曼彻斯特大学) University of York(约克大学) University of California, Irvine(加州大学 Irvine 分校)

专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07239 2025-09-23 cs.CV cs.AI 79%

Contextual Gesture: Co-Speech Gesture Video Generation through Context-aware Gesture Representation

Pinxin Liu, Pengfei Zhang, Hyeongwoo Kim, Pablo Garrido, Ari Shapiro, Kyle Olszewski

机构 * University of Rochester(罗切斯特大学) University of California Irvine(加州大学尔湾分校) Imperial College(帝国理工学院)

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

Comments Accepted to ACM MM 2025. Project Page: https://andypinxinliu.github.io/Contextual-Gesture/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19988 2025-09-18 cs.RO cs.AI cs.CL cs.CV cs.LG 79%

Video-Language Critic: Transferable Reward Functions for Language-Conditioned Robotics

Minttu Alakuijala, Reginald McLean, Isaac Woungang, Nariman Farsad, Samuel Kaski, Pekka Marttinen, Kai Yuan

机构 * Department of Computer Science, Aalto University(艾尔沃斯大学计算机科学系) Department of Computer Science, Toronto Metropolitan University(多伦多 Metropolitan 大学计算机科学系) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Intel Corporation(英特尔公司)

专题命中 动作与事件理解 :video-language(title,abstract);分类 cs.CV

Comments 14 pages in the main text, 22 pages including references and supplementary materials. 3 figures and 3 tables in the main text, 6 figures and 3 tables in supplementary materials

Journal ref Transactions on Machine Learning Research (TMLR) (02/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15428 2025-07-22 cs.CV cs.AI 79%

EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent

Jiaao Li, Kaiyuan Li, Chen Gao, Yong Li, Xinlei Chen

专题命中 动作与事件理解 :video reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00928 2025-06-03 cs.CV cs.CL 79%

Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times

Olga Loginova, Sofía Ortega Loguinova

机构 * University of Trento(特伦托大学) Maastricht University(马斯特里赫特大学)

专题命中 动作与事件理解 :video language model(title);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05530 2025-05-20 cs.RO cs.AI cs.CV 79%

This&That: Language-Gesture Controlled Video Generation for Robot Planning

Boyang Wang, Nikhil Sridhar, Chao Feng, Mark Van der Merwe, Adam Fishman, Nima Fazeli, Jeong Joon Park

机构 * University of Michigan(密歇根大学) University of Washington(华盛顿大学)

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08344 2025-04-14 cs.CV 79%

EasyGenNet: An Efficient Framework for Audio-Driven Gesture Video Generation Based on Diffusion Model

Renda Li, Xiaohua Qi, Qiang Ling, Jun Yu, Ziyi Chen, Peng Chang, Mei HanJing Xiao

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏