arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-09 至 2026-04-09 共收录 11 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2508.20765 2026-04-09 cs.CV cs.AI 79%

Looking Beyond the Obvious: A Survey on Abstract Concept Recognition for Video Understanding

超越显而易见:视频理解中抽象概念识别的综述

Gowreesh Mago, Pascal Mettes, Stevan Rudinac

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文综述了视频理解中抽象概念识别的挑战与方法,强调基础模型的进步对高阶抽象理解的重要性,指出需结合多模态基础模型避免重复发明轮子。

Comments Accepted at IJCV

Journal ref International Journal of Computer Vision 134, 217 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06581 2026-04-09 cs.CV 79%

MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding

MedGRPO:异构医学视频理解的多任务强化学习

Yuhao Su, Anwesa Choudhuri, Zhongpai Gao, Benjamin Planche, Van Nguyen Nguyen, Meng Zheng, Yuhan Shen, Arun Innanje, Terrence Chen, Ehsan Elhamifar, Ziyan Wu

机构 * Northeastern University(东北大学) United Imaging Intelligence(联影智能)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出MedGRPO框架,通过跨数据集奖励归一化和医学LLM评判器提升医学视频理解的训练效果,建立基础基准和训练方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2511.17844 2026-04-09 cs.CV cs.AI 88%

Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation

少即是多:可控文本到视频生成的数据高效适应

Shihan Cheng, Nilesh Kulkarni, David Hyde, Dmitriy Smirnov

机构 * Vanderbilt University, USA(美国范德堡大学) Netflix, USA(美国Netflix)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种数据高效微调策略,通过稀疏低质量合成数据学习物理摄像参数控制,证明其优于真实数据微调结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09646 2026-04-09 cs.CV 83%

VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification

VHOI:通过运动稠密化从稀疏轨迹生成可控的人-物交互视频

Wanyue Zhang, Lin Geng Foo, Thabo Beeler, Rishabh Dabral, Christian Theobalt

机构 * MPI for Informatics, SIC(马克斯·普朗克信息学研究所,SIC) VIA Center(VIA中心) Google(谷歌)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 VHOI通过运动稠密化将稀疏轨迹转化为HOI掩码序列,再通过视频扩散模型生成可控的人-物交互视频,提出了一种新颖的HOI-aware运动表示,增强了模型对真实交互动态的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06655 2026-04-09 cs.CV 57%

Controllable Generative Video Compression

可控生成视频压缩

Ding Ding, Daowen Li, Ying Chen, Yixin Gao, Ruixiao Dong, Kai Li, Li Li

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出可控生成视频压缩方法,通过多视觉条件引导生成细节,兼顾信号保真度与感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06339 2026-04-09 cs.CV 57%

Evolution of Video Generative Foundations

视频生成基础的演变

Teng Hu, Jiangning Zhang, Hongrui Huang, Ran Yi, Zihan Su, Jieyu Weng, Zhucun Xue, Lizhuang Ma, Ming-Hsuan Yang, Dacheng Tao

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文综述了视频生成技术的发展,从早期GAN到扩散模型,再到AR和多模态技术,探讨了核心原理、关键进展及未来趋势,旨在为视频生成及其应用提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2603.17812 2026-04-09 cs.CV cs.AI cs.LG 83%

ChopGrad: Pixel-Wise Losses for Latent Video Diffusion via Truncated Backpropagation

ChopGrad:通过截断反向传播实现基于像素的潜在视频扩散模型

Dmitriy Rivkin, Parker Ewen, Lili Gao, Julian Ost, Stefanie Walz, Rasika Kangutkar, Mario Bijelic, Felix Heide

机构 * Torc Robotics Princeton University(普林斯顿大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出ChopGrad,通过截断反向传播减少视频生成的内存消耗,实现高效的像素级损失微调,适用于视频超分辨率、修复和增强等任务。

Comments Project website: https://light.princeton.edu/chopgrad

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07026 2026-04-09 cs.CV 70%

Not all tokens contribute equally to diffusion learning

并非所有标记对扩散学习贡献相等

Guoqing Zhang, Lu Shi, Wanru Xu, Linna Zhang, Sen Wang, Fangfang Wang, Yigang Cen

机构 * School of Mechanical Engineering, Guizhou University, Guizhou, China(贵州大学机械工程学院) School of Information Science and Technology, Hangzhou Normal University, Zhejiang, China(杭州师范大学信息科学与技术学院)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出DARE框架,通过分布偏见缓解和空间一致性提升扩散模型的语义引导,解决训练数据长尾分布和交叉注意力空间对齐问题,提升文本到视频生成的准确性和语义对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19121 2026-04-09 cs.CV cs.AI 70%

MSG Score: Automated Video Verification for Reliable Multi-Scene Generation

MSG Score: 多场景生成的自动化视频验证

Daewon Yoon, Hyeongseok Lee, Wonsik Shin, Sangyu Han, Nojun Kwak

机构 * Seoul National University(首尔大学) Samsung Electronics(三星电子)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出MSG Score用于评估长视频生成的叙事和视觉一致性,结合Implicit Insight Distillation解决评估与推理速度的平衡,实现可靠且可扩展的视频生成。

Comments 8 pages, 5 figures, 1 table, Accepted AAAI 2026 CVM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2604.06789 2026-04-09 cs.CV cs.CL 57%

Video-guided Machine Translation with Global Video Context

基于全局视频上下文的视频引导机器翻译

Jian Chen, JinZe Lv, Zi Long, XiangHua Fu

机构 * Shenzhen University(深圳大学) Shenzhen Technology University(深圳技术大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出一种全局视频引导的多模态翻译框架,通过预训练语义编码器和向量数据库实现视频片段与字幕的语义关联,结合注意力机制提升翻译效果,在大规模纪录片数据集上验证了其在长视频场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2601.18100 2026-04-09 cs.CV 70%

Spatial-Conditioned Reasoning in Long-Egocentric Videos

长时自体视频中的空间条件推理

James Tribble, Hao Wang, Si-En Hong, Chaoyi Zhou, Ashish Bastola, Siyu Huang, Abolfazl Razi

机构 * Clemson University(克莱姆森大学)

专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 本文研究了在不修改模型架构的情况下,显式空间信号如何影响基于VLM的视频理解,通过引入Sanpo-D数据集和评估多个VLM在导航导向的空间查询上的表现,发现深度感知和空间化表示能提升安全关键任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏