arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 470 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 470 篇

2404.03179 2025-11-20 cs.CV cs.MM cs.SD eess.AS 62%

UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization

Tiantian Geng, Teng Wang, Jinming Duan, Yanfu Zhang, Weili Guan, Feng Zheng, Ling shao

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(计算机科学与工程系,南方科技大学) School of Computer Science, University of Birmingham(计算机科学学院,伯明翰大学) Department of Computer Science, University of Hong Kong(计算机科学系,香港大学) Division of Informatics, Imaging and Data Sciences, University of Manchester(信息学、成像与数据科学系,曼彻斯特大学) William and Mary(威廉与玛丽学院) Harbin Institute of Technology(哈尔滨工业大学) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学-Terminus AI实验室)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、cs.MM

Comments Published on IEEE TPAMI

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 47, no. 11, pp. 10280-10294, August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06855 2025-10-09 cs.CV eess.IV 62%

Online Generic Event Boundary Detection

Hyungrok Jung, Daneul Kim, Seunggyun Lim, Jeany Son, Jonghyun Choi

机构 * GIST(韩国科学技术院) Seoul National University(首尔国立大学) POSTECH

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、eess.IV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06884 2025-04-10 cs.MM cs.AI cs.CV 62%

Audio-visual Event Localization on Portrait Mode Short Videos

Wuyang Liu, Yi Chai, Yongpeng Yan, Yanzhen Ren

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15279 2024-10-22 cs.CV cs.AI cs.MM 62%

ContextDet: Temporal Action Detection with Adaptive Context Aggregation

Ning Wang, Yun Xiao, Xiaopeng Peng, Xiaojun Chang, Xuanhong Wang, Dingyi Fang

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04629 2024-06-10 cs.CV cs.GR cs.MM 62%

STAR: Skeleton-aware Text-based 4D Avatar Generation with In-Network Motion Retargeting

Zenghao Chai, Chen Tang, Yongkang Wong, Mohan Kankanhalli

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14053 2023-03-29 cs.CV cs.AI cs.MM 62%

Re^2TAL: Rewiring Pretrained Video Backbones for Reversible Temporal Action Localization

Chen Zhao, Shuming Liu, Karttikeya Mangalam, Bernard Ghanem

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13717 2022-08-31 cs.CV cs.AI cs.LG cs.MM cs.SD 62%

StableFace: Analyzing and Improving Motion Stability for Talking Face Generation

Jun Ling, Xu Tan, Liyang Chen, Runnan Li, Yuchao Zhang, Sheng Zhao, Li Song

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV、cs.MM

Comments 12 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.11460 2022-04-20 cs.CV cs.LG eess.IV 62%

Perceptron Synthesis Network: Rethinking the Action Scale Variances in Videos

Yuan Tian, Guangtao Zhai, Zhiyong Gao

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.02463 2021-07-20 cs.CV cs.LG eess.IV 62%

Spatio-Temporal Event Segmentation and Localization for Wildlife Extended Videos

Ramy Mounir, Roman Gula, Jörn Theuerkauf, Sudeep Sarkar

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.07976 2021-04-22 cs.CV cs.LG eess.IV 62%

Actor-Context-Actor Relation Network for Spatio-Temporal Action Localization

Junting Pan, Siyu Chen, Mike Zheng Shou, Yu Liu, Jing Shao, Hongsheng Li

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、eess.IV

Comments Accepted in CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.02401 2020-07-20 cs.CV cs.LG eess.IV 62%

Generating Videos of Zero-Shot Compositions of Actions and Objects

Megha Nawhal, Mengyao Zhai, Andreas Lehrmann, Leonid Sigal, Greg Mori

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV、eess.IV

Comments Accepted at ECCV'20; Project Page: https://www.sfu.ca/~mnawhal/projects/zs_hoi_generation.html

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.03538 2020-04-24 cs.CV cs.LG eess.IV q-bio.PE 62%

Context R-CNN: Long Term Temporal Context for Per-Camera Object Detection

Sara Beery, Guanhang Wu, Vivek Rathod, Ronny Votel, Jonathan Huang

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、eess.IV

Comments CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.01326 2020-03-31 cs.CV cs.LG eess.IV 62%

A Context-Aware Loss Function for Action Spotting in Soccer Videos

Anthony Cioppa, Adrien Deliège, Silvio Giancola, Bernard Ghanem, Marc Van Droogenbroeck, Rikke Gade, Thomas B. Moeslund

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、eess.IV

Comments Accepted for CVPR2020 main conference. This document contains 8 pages + references + supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.06699 2019-10-16 cs.CV cs.LG cs.MM 62%

Generating Human Action Videos by Coupling 3D Game Engines and Probabilistic Graphical Models

César Roberto de Souza, Adrien Gaidon, Yohann Cabon, Naila Murray, Antonio Manuel López

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV、cs.MM

Comments Pre-print of the article accepted for publication in the Special Issue on Generating Realistic Visual Data of Human Behavior of the International Journal of Computer Vision (IJCV). arXiv admin note: substantial text overlap with arXiv:1612.00881

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09178 2022-06-22 cs.CV cs.AI 61%

REVECA -- Rich Encoder-decoder framework for Video Event CAptioner

Jaehyuk Heo, YongGi Jeong, Sunwoo Kim, Jaehee Kim, Pilsung Kang

专题命中 动作与事件理解 :video understanding(abstract,comments);分类 cs.CV

Comments The IEEE/CVF Computer Vision and Pattern Recognition Conference (CVPR). LOng-form VidEo Understanding (LOVEU) workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14022 2026-08-17 cs.CV cs.AI 新提交 57%

ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

ForgeWM:面向少步骤动作条件视频世界模型的渐进式因果训练

Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam

机构 * CUHK(香港中文大学) Tencent PCG(腾讯平台与内容事业群) FDU(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) HKUST(香港科技大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 ForgeWM 是一种渐进式框架,通过多阶段技术将双向动作条件视频生成器转化为少步骤世界模型,在 Minecraft 和 FPS 游戏任务中实现了更优的可控少步骤视频生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27101 2026-08-13 cs.CV cs.CL 版本更新 57%

Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

弹出式干扰揭示视频大语言模型中的事件袋行为

Oscar Chew, Serhii Honcharenko, Qian-Hui Chen, Patricia Lu, Dishant Zaveri, Khoa D. Doan, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯A&M大学) National Taiwan University(台湾国立大学) Stanford University(斯坦福大学) VinUniversity(文大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 通过插入无关广告片段,发现视频大语言模型常将不同片段的事件错误关联,表现出将视频视为事件集合而非时间序列的“事件袋”行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10932 2026-08-12 cs.CV cs.AI 新提交 57%

Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation

基于几何知识蒸馏的时序锚定组合式相机运动理解

Dazhao Du, Shiyan Du, Jian Liu, Yongjian Yu, Bohai Gu, Tao Han, Hualuo Liu, Eric Liu, Yujia Zhang, Xi Chen, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08839 2026-08-11 cs.RO cs.CV 新提交 57%

SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models

SG-WAM:面向世界-动作模型的文本 grounded 与空间感知语义引导

Junjie He, Junfeng Li, Zhide Zhong, Haodong Yan, Ruixin Li, Yangyang Zheng, Jiaguan Zhu, Tianran Zhang, Yuqiao Du, Wen Chen, Shunbo Zhou, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ola Dimensions(奥拉维度公司)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 针对现有世界-动作模型(WAM)存在的视频与指令语义不对齐问题,提出基于视觉-语言模型(VLM)的SG-WAM语义引导方法,通过注入文本接地且空间感知的语义前瞻,提升了WAM的指令遵循与操纵精度,经仿真和真实实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25465 2026-08-11 cs.CV cs.AI 版本更新 57%

EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis

EchoStyle: 通过反向数据合成解锁高保真视频风格化

Huaqiu Li, Jiahao Wang, Sijia Cai, Hualian Sheng, Bing Deng, Jieping Ye, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团) Xi’an Jiaotong University(西安交通大学)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 提出EchoStyle框架,通过构建视频到视频架构、自动反向合成数据集V-Style20k和初始跟随模式机制,解决视频风格化中的内容泄露、数据稀缺和长视频适应性问题,实现高质量任意长度视频风格化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07136 2026-08-10 cs.CV 版本更新 57%

MotionStrata: Hierarchical Motion Latents for Compact Video Autoencoding

MotionStrata:用于紧凑视频自编码的分层运动隐变量

Wenzhang Sun, Huaize Liu, Chunfeng Wang, Biao Gong, Hao Li, Changqing Zou

机构 * University of Chinese Academy of Sciences(中国科学院大学) Li Auto Zhejiang Lab(浙江实验室) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 MotionStrata将运动预算分为全局与详细运动,在不增维度下实现分层表示,压缩时重建质量优于其他方法,为紧凑视频自编码提供新设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02330 2026-08-03 cs.CV cs.AI cs.LG 版本更新 57%

ActionParty: Multi-Subject Action Binding in Generative Video Games

ActionParty:生成视频游戏中的多主体动作绑定

Alexander Pondaven, Ziyi Wu, Igor Gilitschenski, Philip Torr, Sergey Tulyakov, Fabio Pizzati, Aliaksandr Siarohin

机构 * Snap Research(Snap研究院) University of Oxford(牛津大学) University of Toronto(多伦多大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。

Comments ECCV 2026 - Project page: https://action-party.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28243 2026-07-31 cs.CV cs.AI 新提交 57%

EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE

EgoGenesis:基于在线锚定投影记忆与Action-3D RoPE的自我中心世界-动作建模

Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Tianji KernalMind Co., Ltd.(天机芯智有限公司) The Hong Kong University of Science and Technology(香港科技大学) Southeast University(东南大学) Renmin University of China(中国人民大学) The University of Tokyo(东京大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出EgoGenesis模拟器,通过在线锚定投影记忆与Action-3D RoPE合成自我中心操作视频,扩充训练数据,显著提升了真实机器人单臂、双臂任务的分布外操作成功率。

Comments project page: https://egogenesis.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13421 2026-07-16 cs.CV cs.AI 新提交 57%

ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding

ScanFocus:一种用于时空视频定位的从粗到细框架

Kai Chen, Ming Dai, Wenxuan Cheng, Wankou Yang

机构 * Southeast University(东南大学)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 研究时空视频定位问题,提出ScanFocus从粗到细框架,利用统一融合编码器和轻量级模块生成粗略提议,再用语义引导时间聚合器恢复细节,实验表明该方法性能优于以往方法。

Comments this paper has already been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13017 2026-07-15 cs.RO cs.CV 新提交 57%

FlowWAM: Optical Flow as a Unified Action Representation for World Action Models

FlowWAM:光流作为世界动作模型的统一动作表示

Yixiang Chen, Peiyan Li, Yuan Xu, Qisen Ma, Jiabing Yang, Kai Wang, Jianhua Yang, Dong An, He Guan, Gaoteng Liu, Jianlou Si, Jun Huang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(无) MBZUAI(无) Alibaba Group(阿里巴巴集团)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 研究针对世界动作模型控制中动作表示难题,提出FlowWAM双流扩散框架,以光流为统一动作表示。该框架可实现WAMs两种模式,能利用无动作标签视频预训练,实验表明在操纵和世界建模任务中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12231 2026-07-15 cs.CV 新提交 57%

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

GEST引擎:从事件图到合成视频。完整技术报告

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) Büchi Labortechnik AG(布赫实验室技术公司)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 GEST引擎从自然语言文本生成多角色视频,核心是明确的世界模型,以GEST表示世界状态。通过程序或智能系统生成GEST,经四阶段管道执行,能输出多种视频相关数据,且保证相关特性,其输出可作视频理解多方面工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01117 2026-07-15 cs.CV 版本更新 57%

MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models

MoHallBench: 视频大语言模型中运动幻觉的基准测试

Sihan Chen, Jiale Li, Jianghang Lin, Mengyuan Liu

机构 * Xiamen University(厦门大学) South China University of Technology(华南理工大学) Peking University(北京大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 提出MoHallBench基准,系统评估视频大语言模型中的运动幻觉,涵盖共现先验、顺序推理和相似混淆三类来源,揭示动作识别与幻觉抵抗的解耦现象。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01803 2026-07-10 cs.CV 版本更新 57%

Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos

生成式动作叙事:评估合成视频中的人体运动

Xavier Thomas, Youngsun Lim, Ananya Srinivasan, Audrey Zheng, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Belmont High School(贝利蒙高中) Canyon Crest Academy(坎波尔峡谷学院) Runway

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 研究视频生成模型中评估复杂人类动作指标难的问题,提出融合骨骼与外观特征的评估指标,经多方面基准验证,该指标相比现有方法有显著改进,与人类感知相关性强,揭示了当前模型局限性并建立新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04198 2026-07-02 cs.CV cs.RO 版本更新 57%

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA: 视频动作模型是零样本驱动器

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Michael Ying Yang, Francesco Nex, Hao Cheng

机构 * University of Twente(特温特大学) Xiaomi EV(小米电动汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。

Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31187 2026-07-01 cs.CV 新提交 57%

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏