arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-01 至 2026-04-01 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 4 篇

2603.29252 2026-04-01 cs.CV cs.AI 88%

Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

通过视觉记忆机制扩展多模态大语言模型的长视频理解

Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30045 2026-04-01 cs.CV 79%

OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation

OmniRoam:通过长视界全景视频生成实现世界漫游

Yuheng Liu, Xin Lin, Xinke Li, Baihan Yang, Chen Wang, Kalyan Sunkavalli, Yannick Hold-Geoffroy, Hao Tan, Kai Zhang, Xiaohui Xie, Zifan Shi, Yiwei Hu

机构 * University of California, Irvine(加州大学尔湾分校) University of California, San Diego(加州大学圣地亚哥分校) City University of Hong Kong(香港城市大学) University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe研究院)

专题命中 长视频与时序推理 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出OmniRoam框架,利用全景视频生成实现长视界场景漫游,通过预览和精炼阶段提升视频质量和一致性,实验表明其在视觉质量、可控性和长期一致性方面优于现有方法。

Comments Code is available at https://github.com/yuhengliu02/OmniRoam

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29664 2026-04-01 cs.CV 74%

CutClaw: Agentic Hours-Long Video Editing via Music Synchronization

CutClaw:通过音乐同步实现代理长时间视频编辑

Shifang Zhao, Yihan Hu, Ying Shan, Yunchao Wei, Xiaodong Cun

机构 * Beijing Jiaotong University(北京交通大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) ARC Lab, Tencent(腾讯ARC实验室)

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

AI总结 本文提出CutClaw,一种多代理框架,利用多模态语言模型自动编辑长时间原始素材为有意义的短视频,通过音乐同步和视觉优化提升视频质量。

Comments Project Code: https://github.com/GVCLab/CutClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23043 2026-04-01 cs.CV 57%

HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling

HieraMamba:通过分层锚点-Mamba池化实现视频时间接地

Joungbin An, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 HieraMamba通过分层锚点-Mamba池化结构,在长视频中实现精确的时间定位,解决了视频时间接地中的全局上下文与细粒度时间细节捕捉难题。

Comments CVPR 2026. Project Page: https://vision.cs.utexas.edu/projects/hieramamba/

详情

展开后加载摘要…

URL PDF HTML 收藏