arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 470 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 470 篇

2510.22810 2025-10-28 cs.CV 70%

MAGIC-Talk: Motion-aware Audio-Driven Talking Face Generation with Customizable Identity Control

Fatemeh Nazarieh, Zhenhua Feng, Diptesh Kanojia, Muhammad Awais, Josef Kittler

机构 * School of Computer Science and Electronic Engineering, University of Surrey(Surrey大学计算机科学与电子工程学院) School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey大学视觉、语音和信号处理中心)

专题命中 动作与事件理解 :video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15546 2025-09-22 cs.CV 70%

Enhancing Sa2VA for Referent Video Object Segmentation: 2nd Solution for 7th LSVOS RVOS Track

Ran Hong, Feng Lu, Leilei Cao, An Yan, Youhai Jiang, Fengjie Zhu

机构 * TEX AI, Transsion Holdings(TEX AI,Transsion Holdings) Nanchang University(南昌大学) ShanghaiTech University(上海科技大学)

专题命中 动作与事件理解 :video reasoning(abstract);video-language(abstract);分类 cs.CV

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19924 2025-08-04 cs.CV 70%

HumanSAM: Classifying Human-centric Forgery Videos in Human Spatial, Appearance, and Motion Anomaly

Chang Liu, Yunfan Ye, Fan Zhang, Qingyang Zhou, Yuchuan Luo, Zhiping Cai

机构 * National University of Defense Technology(国防科技大学) Hunan University(湖南大学)

专题命中 动作与事件理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments ICCV 2025. Project page: https://dejian-lc.github.io/humansam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02192 2025-07-22 cs.CV cs.AI 70%

DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization

Wenchuan Wang, Mengqi Huang, Yijing Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02857 2025-07-04 cs.CV 70%

AnyI2V: Animating Any Conditional Image with Motion Control

Ziye Li, Hao Luo, Xincheng Shuai, Henghui Ding

机构 * Fudan University(复旦大学) DAMO Academy, Alibaba group(阿里达摩院) Hupan Lab(虎扑实验室)

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments ICCV 2025, Project Page: https://henghuiding.com/AnyI2V/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00526 2025-06-24 cs.CV cs.AI cs.GR 70%

Human Action CLIPs: Detecting AI-generated Human Motion

Matyas Bohacek, Hany Farid

机构 * Google(谷歌) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Journal ref Workshop on Deepfake Detection, Localization and Interpretability @ IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04830 2025-06-16 cs.CV 70%

DualX-VSR: Dual Axial Spatial$\times$Temporal Transformer for Real-World Video Super-Resolution without Motion Compensation

Shuo Cao, Yihao Liu, Xiaohui Li, Yuanting Gao, Yu Zhou, Chao Dong

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 动作与事件理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01427 2025-05-29 cs.CV 70%

VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control

Yuanpeng Tu, Hao Luo, Xi Chen, Sihui Ji, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) HUST(华中科技大学)

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by SIGGRAPH2025 Project page: https://videoanydoor.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00458 2025-05-27 cs.CV cs.GR cs.LG 70%

Reenact Anything: Semantic Video Motion Transfer Using Motion-Textual Inversion

Manuel Kansy, Jacek Naruniec, Christopher Schroers, Markus Gross, Romann M. Weber

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Added more evaluation and analyses since first version. Accepted to SIGGRAPH 2025 (Conference Track). Project page: https://mkansy.github.io/reenact-anything/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02634 2025-04-07 cs.CV 70%

Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency

Jianwen Jiang, Chao Liang, Jiaqi Yang, Gaojie Lin, Tianyun Zhong, Yanbo Zheng

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments ICLR 2025 (Oral), Homepage: https://loopyavatar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02451 2025-04-04 cs.CV 70%

ConMo: Controllable Motion Disentanglement and Recomposition for Zero-Shot Motion Transfer

Jiayi Gao, Zijin Yin, Changcheng Hua, Yuxin Peng, Kongming Liang, Zhanyu Ma, Jun Guo, Yang Liu

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13016 2025-03-18 cs.CV 70%

Efficient Motion-Aware Video MLLM

Zijia Zhao, Yuqi Huo, Tongtian Yue, Longteng Guo, Haoyu Lu, Bingning Wang, Weipeng Chen, Jing Liu

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17805 2024-12-24 cs.CV 70%

Large Motion Video Autoencoding with Cross-modal Video VAE

Yazhou Xing, Yang Fei, Yingqing He, Jingye Chen, Jiaxin Xie, Xiaowei Chi, Qifeng Chen

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Website: https://yzxing87.github.io/vae/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19324 2024-12-02 cs.CV 70%

Trajectory Attention for Fine-grained Video Motion Control

Zeqi Xiao, Wenqi Ouyang, Yifan Zhou, Shuai Yang, Lei Yang, Jianlou Si, Xingang Pan

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project Page: xizaoqu.github.io/trajattn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20193 2024-10-18 cs.CV 70%

Motion Inversion for Video Customization

Luozhou Wang, Ziyang Mai, Guibao Shen, Yixun Liang, Xin Tao, Pengfei Wan, Di Zhang, Yijun Li, Yingcong Chen

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments https://wileewang.github.io/MotionInversion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10179 2024-07-18 cs.CV 70%

Animate Your Motion: Turning Still Images into Dynamic Videos

Mingxiao Li, Bo Wan, Marie-Francine Moens, Tinne Tuytelaars

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted at European Conference on Computer Vision (ECCV 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15683 2024-05-24 cs.CV 70%

End-to-End Streaming Video Temporal Action Segmentation with Reinforce Learning

Jinrong Zhang, Wujun Wen, Shenglan Liu, Yunheng Li, Qifeng Li, Lin Feng

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments submit to TNNLS

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10832 2024-05-20 cs.CV 70%

Open-Vocabulary Spatio-Temporal Action Detection

Tao Wu, Shuqiu Ge, Jie Qin, Gangshan Wu, Limin Wang

专题命中 动作与事件理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04433 2023-12-08 cs.CV 70%

DreamVideo: Composing Your Dream Videos with Customized Subject and Motion

Yujie Wei, Shiwei Zhang, Zhiwu Qing, Hangjie Yuan, Zhiheng Liu, Yu Liu, Yingya Zhang, Jingren Zhou, Hongming Shan

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02928 2023-12-06 cs.CV 70%

LivePhoto: Real Image Animation with Text-guided Motion Control

Xi Chen, Zhiheng Liu, Mengting Chen, Yutong Feng, Yu Liu, Yujun Shen, Hengshuang Zhao

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://xavierchen34.github.io/LivePhoto-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10352 2023-10-24 cs.CV 70%

Temporal Action Segmentation: An Analysis of Modern Techniques

Guodong Ding, Fadime Sener, Angela Yao

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments 19 pages, 9 figures, 8 tables, TPAMI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08830 2023-03-21 cs.CV 70%

Inductive Attention for Video Action Anticipation

Tsung-Ming Tai, Giuseppe Fiameni, Cheng-Kuang Lee, Simon See, Oswald Lanz

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.10250 2018-12-27 cs.CV 70%

Joint Event Detection and Description in Continuous Video Streams

Huijuan Xu, Boyang Li, Vasili Ramanishka, Leonid Sigal, Kate Saenko

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments WACV2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.08723 2017-05-01 cs.CV 70%

Action Understanding with Multiple Classes of Actors

Chenliang Xu, Caiming Xiong, Jason J. Corso

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.11178 2021-12-08 cs.CV cs.AI cs.LG cs.MM eess.IV 67%

VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text

Hassan Akbari, Liangzhe Yuan, Rui Qian, Wei-Hong Chuang, Shih-Fu Chang, Yin Cui, Boqing Gong

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV、eess.IV、cs.MM

Comments Published in the 35th Conference on Neural Information Processing Systems (NeurIPS 2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23428 2026-05-25 cs.CV cs.MM 62%

FAST-ME: Foundation-aware Adaptive Stopping for Motion Estimation for Efficient IoT Video Analysis

FAST-ME:面向高效物联网视频分析的基于基础模型的自适应运动估计停止方法

Kakia Panagidi, Stathes Hadjieftymiadis

机构 * Department of Informatics \& Telecommunications National Kapodistrian University of Athens Athens, Greece

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 提出一种基于最优停止理论和基础模型(如ViT和SAM)的语义感知运动估计框架,通过融合语义注意力分数与失真度量实现自适应停止,在降低计算量的同时保持精度和语义覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23355 2026-05-25 cs.CV cs.LG cs.MM 62%

Decoupling Spatio-Temporal Adapter for Fine-Grained Badminton Action Localization

解耦时空适配器用于细粒度羽毛球动作定位

Tianyu Wang, Junjie Wu, Jingquan Gao, Shishuo Li

机构 * School of Economics and Management, Beihang University(北京航空航天大学经济管理学院) Key Laboratory of Data Intelligence and Management, Beihang University, Ministry of Industry and Information Technology(信息产业部北京航空航天大学数据智能与管理重点实验室)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 针对细粒度羽毛球动作定位中复杂的时空动态,提出解耦时空适配器(DSTA),通过三个并行分支分别建模时间动态、垂直和水平空间变化,在Fine-Badminton数据集和ShuttleSet基准上实现最优性能且计算开销极小。

Comments 11 pages, 11figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15307 2026-05-18 cs.GR cs.CV cs.MM cs.SD 62%

Sound Sparks Motion: Audio and Text Tuning for Video Editing

声音激发动作:用于视频编辑的音频和文本微调

AmirHossein Naghi Razlighi, Aryan Mikaeili, Ali Mahdavi-Amiri, Daniel Cohen-Or, Yiorgos Chrysanthou

机构 * University of Cyprus(塞浦路斯大学) Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) CYENS Center Of Excellence(CYENS卓越中心)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Sound Sparks Motion框架,通过测试时调整音频视觉生成模型的多模态条件信号,实现视频动作编辑,无需训练,通过音频潜在和文本条件残差扰动促进动作修改,同时利用视觉语言模型反馈提升编辑效果。

Comments Project Page: https://amirhossein-razlighi.github.io/Sound_Sparks_Motion

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20169 2026-03-23 cs.CV cs.MM 62%

EgoForge: Goal-Directed Egocentric World Simulator

EgoForge:面向目标的自体世界模拟器

Yifan Shen, Jiateng Liu, Xinzhuo Li, Yuanzhe Liu, Bingxuan Li, Houze Yang, Wenqi Jia, Yijiang Li, Tianjiao Yu, James Matthew Rehg, Xu Cao, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California San Diego(加州大学圣地亚哥分校)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV、cs.MM

AI总结 EgoForge通过最小静态输入生成连贯的第一人称视频,结合VideoDiffusionNFT提升意图对齐和时间一致性,实现在动态环境模拟中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12060 2025-12-16 cs.CV cs.LG cs.MM 62%

CreativeVR: Diffusion-Prior-Guided Approach for Structure and Motion Restoration in Generative and Real Videos

CreativeVR: 一种基于扩散先验的结构与运动修复方法用于生成视频和真实视频

Tejas Panambur, Ishan Rajendrakumar Dave, Chongjian Ge, Ersin Yumer, Xue Bai

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe(Adobe公司)

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 CreativeVR通过扩散先验引导方法,有效修复AI生成和真实视频中的结构与运动伪影,实现高质量视频修复。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏