arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 469 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 469 篇

2509.26278 2026-04-21 cs.CV cs.CL 74%

ProfVLM: A lightweight video-language model for multi-view proficiency estimation

ProfVLM:一种轻量级视频-语言模型用于多视角技能评估

Edoardo Bianchi, Jacopo Staiano, Antonio Liotta

机构 * Free University of Bozen-Bolzano(博洛尼亚-博兹纳自由大学) University of Trento(特伦托大学)

专题命中 动作与事件理解 :video-language(title);分类 cs.CV

AI总结 本文提出ProfVLM,一种轻量级视频-语言模型,通过生成式视觉-语言建模实现多视角技能评估,兼具生成自然语言反馈与定量评分,参数更少且训练更快。

Journal ref Computer Vision and Image Understanding, Volume 268, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02576 2025-12-03 cs.CV 74%

Co-speech Gesture Video Generation via Motion-Based Graph Retrieval

通过基于运动的图检索生成同步语音手势视频

Yafei Song, Peng Zhang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 动作与事件理解 :video generation(title);分类 cs.CV

AI总结 本文提出基于运动图检索和扩散模型生成同步语音手势视频,通过提取音频特征和运动分布提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02287 2025-10-03 cs.CV 74%

MultiModal Action Conditioned Video Generation

Yichen Li, Antonio Torralba

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 动作与事件理解 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22457 2025-05-29 cs.CV cs.AI cs.CL 74%

Fostering Video Reasoning via Next-Event Prediction

Haonan Wang, Hongfu Liu, Xiangyan Liu, Chao Du, Kenji Kawaguchi, Ye Wang, Tianyu Pang

机构 * National University of Singapore(新加坡国立大学) Sea AI Lab(Sea AI实验室)

专题命中 动作与事件理解 :video reasoning(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15628 2024-11-26 cs.CV 74%

ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos

Reza Ghoddoosian, Nakul Agarwal, Isht Dwivedi, Behzad Darisuh

专题命中 动作与事件理解 :video-language(title);分类 cs.CV

Comments Accepted at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17674 2024-09-27 cs.CV 74%

Self-Supervised Learning of Deviation in Latent Representation for Co-speech Gesture Video Generation

Huan Yang, Jiahui Chen, Chaofan Ding, Runhua Shi, Siyu Xiong, Qingqi Hong, Xiaoqi Mo, Xinhan Di

专题命中 动作与事件理解 :video generation(title);分类 cs.CV

Comments 5 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12447 2023-11-02 cs.CV 74%

MOFO: MOtion FOcused Self-Supervision for Video Understanding

Mona Ahmadian, Frank Guerin, Andrew Gilbert

专题命中 动作与事件理解 :video understanding(title);分类 cs.CV

Comments Accepted at the NeurIPS 2023 Workshop: Self-Supervised Learning - Theory and Practice

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03631 2023-04-10 cs.CV 74%

Therbligs in Action: Video Understanding through Motion Primitives

Eadom Dessalene, Michael Maynord, Cornelia Fermuller, Yiannis Aloimonos

专题命中 动作与事件理解 :video understanding(title);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.03049 2021-01-11 cs.CV 74%

InMoDeGAN: Interpretable Motion Decomposition Generative Adversarial Network for Video Generation

Yaohui Wang, Francois Bremond, Antitza Dantcheva

专题命中 动作与事件理解 :video generation(title);分类 cs.CV

Comments Please visit https://wyhsirius.github.io/InMoDeGAN/ for introductions and more

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.08230 2020-10-13 cs.CV 74%

Event-based High Dynamic Range Image and Very High Frame Rate Video Generation using Conditional Generative Adversarial Networks

S. Mohammad Mostafavi I., Lin Wang, Yo-Sung Ho, Kuk-Jin Yoon

专题命中 动作与事件理解 :video generation(title);分类 cs.CV

Comments 10 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.05523 2020-06-16 cs.CV 74%

G3AN: Disentangling Appearance and Motion for Video Generation

Yaohui Wang, Piotr Bilinski, Francois Bremond, Antitza Dantcheva

专题命中 动作与事件理解 :video generation(title);分类 cs.CV

Comments CVPR 2020, project link https://wyhsirius.github.io/G3AN/

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.01320 2019-12-09 cs.CV 74%

Synthetic Video Generation for Robust Hand Gesture Recognition in Augmented Reality Applications

Varun Jain, Shivam Aggarwal, Suril Mehta, Ramya Hebbalaguppe

专题命中 动作与事件理解 :video generation(title);分类 cs.CV

Comments Presented at the ICCV 2019 Workshop: The 5th International Workshop on Observing And Understanding Hands In Action

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.01191 2017-08-04 cs.CV 74%

Unsupervised Video Understanding by Reconciliation of Posture Similarities

Timo Milbich, Miguel Bautista, Ekaterina Sutter, Bjorn Ommer

专题命中 动作与事件理解 :video understanding(title);分类 cs.CV

Comments Accepted by ICCV 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06361 2026-08-07 cs.AI 新提交 71%

The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

低频陷阱:视频语言模型在简单事件记录上的失败

Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang

专题命中 动作与事件理解 :video language model(title)

AI总结 该研究提出基于轨迹的参数化分析方法,发现视频语言模型Gemini 3.6 Flash在高数量、高频率事件计数上表现极差,额外帧和提示策略难以解决问题,推动视频评估转向时间推理故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18323 2026-01-27 cs.RO 71%

TC-IDM: Grounding Video Generation for Executable Zero-shot Robot Motion

TC-IDM:为可执行零样本机器人运动实现视频生成

Weishi Mi, Yong Bao, Xiaowei Chi, Xiaozhu Ju, Zhiyuan Qin, Kuangzhi Ge, Kai Tang, Peidong Jia, Shanghang Zhang, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 动作与事件理解 :video generation(title)

AI总结 TC-IDM通过工具中心逆动力学模型实现视频生成,提升机器人零样本任务的执行能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04210 2024-08-13 cs.AI cs.RO 71%

Task Success is not Enough: Investigating the Use of Video-Language Models as Behavior Critics for Catching Undesirable Agent Behaviors

Lin Guan, Yifan Zhou, Denis Liu, Yantian Zha, Heni Ben Amor, Subbarao Kambhampati

专题命中 动作与事件理解 :video-language(title)

Comments Published as a conference paper at COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03954 2023-02-09 cs.RO 71%

Temporal Video-Language Alignment Network for Reward Shaping in Reinforcement Learning

Ziyuan Cao, Reshma Anugundanahalli Ramachandra, Kelin Yu

专题命中 动作与事件理解 :video-language(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05903 2026-08-10 cs.CV cs.RO 版本更新 70%

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

Robust-WAM:桥接生成式预训练与世界-动作模型中的语义前瞻

Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beihang University(北京航空航天大学) Huawei Foundation Model Department(华为基础模型部门)

专题命中 动作与事件理解 :video generation(abstract,abstract_cn);分类 cs.CV

AI总结 Robust-WAM是一种通用后训练方法,在保留VAE生成路径的同时添加语义前瞻对齐,可提升多个WAM基线在分布外条件下的动作预测成功率且不损失分布内性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04657 2026-08-07 cs.CV 版本更新 70%

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接

Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Feng Gao, Bailin Li, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) The University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Southeast University(东南大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Li Auto(理想汽车) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20891 2026-06-23 cs.CV cs.LG 新提交 70%

Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

Go-with-the-Track: 基于点追踪的视频合成与运动控制

Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li Ma, Andrea Vedaldi, Paul Debevec, Ning Yu

机构 * Netflix USA(Netflix美国) Eyeline Labs USA(Eyeline Labs美国) University of Oxford(牛津大学) Eyeline Labs Los Angeles USA(Eyeline Labs洛杉矶美国) University of California, Los Angeles(加州大学洛杉矶分校) Stony Brook University USA(石溪大学美国) Columbia University USA(哥伦比亚大学美国) Eyeline Labs United Kingdom(Eyeline Labs英国) Netflix Los Angeles USA(Netflix洛杉矶美国)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出Go-with-the-Track,通过联合条件多参考图像和参考锚定点轨迹,统一视频合成与运动控制,实现精确合成与运动控制。

Comments SIGGRAPH 2026, Project page: https://eyeline-labs.github.io/Go-with-the-Track/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07298 2026-06-23 cs.CV 版本更新 70%

Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding

模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架

Jianghao Yin, Qingbin Li, Kun Sun, Cheng Ding, Jie Wang, Qin Chen, Jie Zhou, Nan Wang, Changqing Li, Pei Wu, Jian Xu, Zheming Yang, Liang He

机构 * East China Normal University(华东师范大学) ByteDance(字节跳动)

专题命中 动作与事件理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12217 2026-06-11 cs.CV cs.AI cs.RO 新提交 70%

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

使远见可操作:在世界动作模型中重新利用表示对齐

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

机构 * The University of Hong Kong(香港大学) XPENG Robotics(小鹏机器人)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03943 2026-06-04 cs.RO cs.CV cs.LG 70%

PointAction: 3D Points as Universal Action Representations for Robot Control

PointAction: 3D点作为机器人控制的通用动作表示

Mutian Tong, Han Jiang, Qiao Feng, Lingjie Liu, Jiatao Gu

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出PointAction框架,通过微调视频生成模型联合预测未来RGB帧和动态3D点图,将点动力学作为与具体本体无关的动作接口,再由扩散动作解码器映射为可执行动作,以减少RGB动作歧义并跨任务/本体迁移。

Comments Project page: https://oriontmt.github.io/pointaction/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06192 2026-05-08 cs.CV cs.AI cs.RO 70%

EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields

EA-WM:事件感知生成世界模型与结构运动-视觉动作场

Zhaoyang Yang, Yurun Jin, Lizhe Qi, Cong Huang, Kai Chen

机构 * Fudan University(复旦大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) DeepCybo(深瞳)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 EA-WM通过结构化运动-视觉动作场闭环连接运动控制与视觉感知,提升机器人空间几何和细粒度交互动态的生成精度。

Comments Preprint. 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09164 2026-04-13 cs.CV 70%

Efficient Spatial-Temporal Focal Adapter with SSM for Temporal Action Detection

高效空间-时间聚焦适配器与SSM用于时间动作检测

Yicheng Qiu, Keiji Yanai

机构 * Department of Informatics The University of Electro-Communications Chofu, Tokyo, Japan

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出高效空间-时间聚焦适配器与SSM结合的方法,用于提升长视频中动作检测的定位精度与鲁棒性,通过综合时空特征建模与高效处理,验证了方法的有效性。

Comments ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25527 2026-04-02 cs.CV 70%

Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training

超越黄金数据:通过时间步选择性训练解决运动-视觉质量困境

Xiangyang Luo, Qingyu Li, Yuming Li, Guanbo Huang, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Shao-Lun Huang

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出TQD方法,通过时间步选择性训练解决视频生成中运动与视觉质量的矛盾,证明在不平衡数据上训练可超越传统高质量数据训练效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12534 2025-12-16 cs.CV cs.GR cs.LG 70%

Animus3D: Text-driven 3D Animation via Motion Score Distillation

Animus3D: 通过运动分数蒸馏实现文本驱动的3D动画

Qi Sun, Can Wang, Jiaxiang Shang, Wensen Feng, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

专题命中 动作与事件理解 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 Animus3D通过运动分数蒸馏技术实现文本驱动的3D动画生成,提升运动细节与视觉完整性。

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06158 2025-12-09 cs.CV 70%

Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation

基于跟踪的4D生成:用于3D模型动画的基础跟踪器运动先验

Su Sun, Cheng Zhao, Himangi Mittal, Gaurav Mittal, Rohith Kukkala, Yingjie Victor Chen, Mei Chen

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Track4DGen通过结合基础跟踪器和混合4D高斯点划法,提升多视角视频生成和4D生成的稳定性与精度。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18920 2025-11-25 cs.CV 70%

EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models

EventSTU: 基于事件的高效空间-时间理解用于视频大语言模型

Wenhao Xu, Xin Dong, Yue Li, Haoyuan Shi, Zhiwei Xiong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 EventSTU通过事件引导的方法,高效处理视频大语言模型的空间-时间理解,实现显著的计算效率提升和性能优化。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16669 2025-11-25 cs.CV 70%

Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO

视频作答:联合GRPO预测并生成下一个视频事件

Junhao Cheng, Liang Hou, Xin Tao, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 VANS通过联合GRPO方法,利用强化学习对齐视觉-语言模型与视频扩散模型,实现视频下一个事件预测任务的高精度视频生成与描述生成。

Comments Project page: https://video-as-answer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏