arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 473 篇

2512.12534 2025-12-16 cs.CV cs.GR cs.LG 70%

Animus3D: Text-driven 3D Animation via Motion Score Distillation

Animus3D: 通过运动分数蒸馏实现文本驱动的3D动画

Qi Sun, Can Wang, Jiaxiang Shang, Wensen Feng, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

专题命中 动作与事件理解 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 Animus3D通过运动分数蒸馏技术实现文本驱动的3D动画生成,提升运动细节与视觉完整性。

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06158 2025-12-09 cs.CV 70%

Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation

基于跟踪的4D生成:用于3D模型动画的基础跟踪器运动先验

Su Sun, Cheng Zhao, Himangi Mittal, Gaurav Mittal, Rohith Kukkala, Yingjie Victor Chen, Mei Chen

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Track4DGen通过结合基础跟踪器和混合4D高斯点划法,提升多视角视频生成和4D生成的稳定性与精度。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18920 2025-11-25 cs.CV 70%

EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models

EventSTU: 基于事件的高效空间-时间理解用于视频大语言模型

Wenhao Xu, Xin Dong, Yue Li, Haoyuan Shi, Zhiwei Xiong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 EventSTU通过事件引导的方法,高效处理视频大语言模型的空间-时间理解,实现显著的计算效率提升和性能优化。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16669 2025-11-25 cs.CV 70%

Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO

视频作答:联合GRPO预测并生成下一个视频事件

Junhao Cheng, Liang Hou, Xin Tao, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 VANS通过联合GRPO方法,利用强化学习对齐视觉-语言模型与视频扩散模型,实现视频下一个事件预测任务的高精度视频生成与描述生成。

Comments Project page: https://video-as-answer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22810 2025-10-28 cs.CV 70%

MAGIC-Talk: Motion-aware Audio-Driven Talking Face Generation with Customizable Identity Control

Fatemeh Nazarieh, Zhenhua Feng, Diptesh Kanojia, Muhammad Awais, Josef Kittler

机构 * School of Computer Science and Electronic Engineering, University of Surrey(Surrey大学计算机科学与电子工程学院) School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey大学视觉、语音和信号处理中心)

专题命中 动作与事件理解 :video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15546 2025-09-22 cs.CV 70%

Enhancing Sa2VA for Referent Video Object Segmentation: 2nd Solution for 7th LSVOS RVOS Track

Ran Hong, Feng Lu, Leilei Cao, An Yan, Youhai Jiang, Fengjie Zhu

机构 * TEX AI, Transsion Holdings(TEX AI,Transsion Holdings) Nanchang University(南昌大学) ShanghaiTech University(上海科技大学)

专题命中 动作与事件理解 :video reasoning(abstract);video-language(abstract);分类 cs.CV

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19924 2025-08-04 cs.CV 70%

HumanSAM: Classifying Human-centric Forgery Videos in Human Spatial, Appearance, and Motion Anomaly

Chang Liu, Yunfan Ye, Fan Zhang, Qingyang Zhou, Yuchuan Luo, Zhiping Cai

机构 * National University of Defense Technology(国防科技大学) Hunan University(湖南大学)

专题命中 动作与事件理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments ICCV 2025. Project page: https://dejian-lc.github.io/humansam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02192 2025-07-22 cs.CV cs.AI 70%

DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization

Wenchuan Wang, Mengqi Huang, Yijing Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02857 2025-07-04 cs.CV 70%

AnyI2V: Animating Any Conditional Image with Motion Control

Ziye Li, Hao Luo, Xincheng Shuai, Henghui Ding

机构 * Fudan University(复旦大学) DAMO Academy, Alibaba group(阿里达摩院) Hupan Lab(虎扑实验室)

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments ICCV 2025, Project Page: https://henghuiding.com/AnyI2V/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00526 2025-06-24 cs.CV cs.AI cs.GR 70%

Human Action CLIPs: Detecting AI-generated Human Motion

Matyas Bohacek, Hany Farid

机构 * Google(谷歌) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Journal ref Workshop on Deepfake Detection, Localization and Interpretability @ IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04830 2025-06-16 cs.CV 70%

DualX-VSR: Dual Axial Spatial$\times$Temporal Transformer for Real-World Video Super-Resolution without Motion Compensation

Shuo Cao, Yihao Liu, Xiaohui Li, Yuanting Gao, Yu Zhou, Chao Dong

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 动作与事件理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01427 2025-05-29 cs.CV 70%

VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control

Yuanpeng Tu, Hao Luo, Xi Chen, Sihui Ji, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) HUST(华中科技大学)

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by SIGGRAPH2025 Project page: https://videoanydoor.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00458 2025-05-27 cs.CV cs.GR cs.LG 70%

Reenact Anything: Semantic Video Motion Transfer Using Motion-Textual Inversion

Manuel Kansy, Jacek Naruniec, Christopher Schroers, Markus Gross, Romann M. Weber

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Added more evaluation and analyses since first version. Accepted to SIGGRAPH 2025 (Conference Track). Project page: https://mkansy.github.io/reenact-anything/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02634 2025-04-07 cs.CV 70%

Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency

Jianwen Jiang, Chao Liang, Jiaqi Yang, Gaojie Lin, Tianyun Zhong, Yanbo Zheng

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments ICLR 2025 (Oral), Homepage: https://loopyavatar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02451 2025-04-04 cs.CV 70%

ConMo: Controllable Motion Disentanglement and Recomposition for Zero-Shot Motion Transfer

Jiayi Gao, Zijin Yin, Changcheng Hua, Yuxin Peng, Kongming Liang, Zhanyu Ma, Jun Guo, Yang Liu

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13016 2025-03-18 cs.CV 70%

Efficient Motion-Aware Video MLLM

Zijia Zhao, Yuqi Huo, Tongtian Yue, Longteng Guo, Haoyu Lu, Bingning Wang, Weipeng Chen, Jing Liu

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17805 2024-12-24 cs.CV 70%

Large Motion Video Autoencoding with Cross-modal Video VAE

Yazhou Xing, Yang Fei, Yingqing He, Jingye Chen, Jiaxin Xie, Xiaowei Chi, Qifeng Chen

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Website: https://yzxing87.github.io/vae/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19324 2024-12-02 cs.CV 70%

Trajectory Attention for Fine-grained Video Motion Control

Zeqi Xiao, Wenqi Ouyang, Yifan Zhou, Shuai Yang, Lei Yang, Jianlou Si, Xingang Pan

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project Page: xizaoqu.github.io/trajattn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20193 2024-10-18 cs.CV 70%

Motion Inversion for Video Customization

Luozhou Wang, Ziyang Mai, Guibao Shen, Yixun Liang, Xin Tao, Pengfei Wan, Di Zhang, Yijun Li, Yingcong Chen

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments https://wileewang.github.io/MotionInversion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10179 2024-07-18 cs.CV 70%

Animate Your Motion: Turning Still Images into Dynamic Videos

Mingxiao Li, Bo Wan, Marie-Francine Moens, Tinne Tuytelaars

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted at European Conference on Computer Vision (ECCV 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15683 2024-05-24 cs.CV 70%

End-to-End Streaming Video Temporal Action Segmentation with Reinforce Learning

Jinrong Zhang, Wujun Wen, Shenglan Liu, Yunheng Li, Qifeng Li, Lin Feng

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments submit to TNNLS

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10832 2024-05-20 cs.CV 70%

Open-Vocabulary Spatio-Temporal Action Detection

Tao Wu, Shuqiu Ge, Jie Qin, Gangshan Wu, Limin Wang

专题命中 动作与事件理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04433 2023-12-08 cs.CV 70%

DreamVideo: Composing Your Dream Videos with Customized Subject and Motion

Yujie Wei, Shiwei Zhang, Zhiwu Qing, Hangjie Yuan, Zhiheng Liu, Yu Liu, Yingya Zhang, Jingren Zhou, Hongming Shan

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02928 2023-12-06 cs.CV 70%

LivePhoto: Real Image Animation with Text-guided Motion Control

Xi Chen, Zhiheng Liu, Mengting Chen, Yutong Feng, Yu Liu, Yujun Shen, Hengshuang Zhao

专题命中 动作与事件理解 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://xavierchen34.github.io/LivePhoto-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10352 2023-10-24 cs.CV 70%

Temporal Action Segmentation: An Analysis of Modern Techniques

Guodong Ding, Fadime Sener, Angela Yao

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments 19 pages, 9 figures, 8 tables, TPAMI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08830 2023-03-21 cs.CV 70%

Inductive Attention for Video Action Anticipation

Tsung-Ming Tai, Giuseppe Fiameni, Cheng-Kuang Lee, Simon See, Oswald Lanz

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.10250 2018-12-27 cs.CV 70%

Joint Event Detection and Description in Continuous Video Streams

Huijuan Xu, Boyang Li, Vasili Ramanishka, Leonid Sigal, Kate Saenko

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments WACV2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.08723 2017-05-01 cs.CV 70%

Action Understanding with Multiple Classes of Actors

Chenliang Xu, Caiming Xiong, Jason J. Corso

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.11178 2021-12-08 cs.CV cs.AI cs.LG cs.MM eess.IV 67%

VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text

Hassan Akbari, Liangzhe Yuan, Rui Qian, Wei-Hong Chuang, Shih-Fu Chang, Yin Cui, Boqing Gong

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV、eess.IV、cs.MM

Comments Published in the 35th Conference on Neural Information Processing Systems (NeurIPS 2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23428 2026-05-25 cs.CV cs.MM 62%

FAST-ME: Foundation-aware Adaptive Stopping for Motion Estimation for Efficient IoT Video Analysis

FAST-ME:面向高效物联网视频分析的基于基础模型的自适应运动估计停止方法

Kakia Panagidi, Stathes Hadjieftymiadis

机构 * Department of Informatics \& Telecommunications National Kapodistrian University of Athens Athens, Greece

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 提出一种基于最优停止理论和基础模型(如ViT和SAM)的语义感知运动估计框架,通过融合语义注意力分数与失真度量实现自适应停止,在降低计算量的同时保持精度和语义覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏