arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 644 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 644 篇

2603.21366 2026-03-24 cs.CV 89%

Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation

放松强制:用于一致长视频生成的放松KV内存

Zengqun Zhao, Yanzuo Lu, Ziquan Liu, Jifei Song, Jiankang Deng, Ioannis Patras

机构 * Queen Mary University of London(伦敦玛丽女王大学) Imperial College London(伦敦帝国学院)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Relax Forcing机制,通过结构化时间内存提升长视频生成的运动动态和时间一致性,减少注意力开销。

Comments Project page: see https://zengqunzhao.github.io/Relax-Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19852 2025-12-09 cs.CV cs.AI cs.LG 89%

Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video Generation

径向注意力:具有能量衰减的 $O(n\log n)$ 稀疏注意力用于长视频生成

Xingyang Li, Muyang Li, Tianle Cai, Haocheng Xi, Shuo Yang, Yujun Lin, Lvmin Zhang, Songlin Yang, Jinbo Hu, Kelly Peng, Maneesh Agrawala, Ion Stoica, Kurt Keutzer, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) Princeton(普林斯顿大学) UC Berkeley(加州大学伯克利分校) Stanford(斯坦福大学) First Intelligence(第一智能)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出径向注意力,通过能量衰减机制实现高效的长视频生成,显著提升生成速度并降低计算成本。

Comments Accepted to NeurIPS 2025, Code: https://github.com/mit-han-lab/radial-attention

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04130 2025-09-24 cs.CV 89%

STORM: Token-Efficient Long Video Understanding for Multimodal LLMs

Jindong Jiang, Xiuyu Li, Zhijian Liu, Muyang Li, Guo Chen, Zhiqi Li, De-An Huang, Guilin Liu, Zhiding Yu, Kurt Keutzer, Sungjin Ahn, Jan Kautz, Hongxu Yin, Yao Lu, Song Han, Wonmin Byeon

机构 * NVIDIA(英伟达) Rutgers University(罗格斯大学) UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院) Nanjing University(南京大学) KAIST(韩国科学技术院)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04416 2025-09-04 cs.CV 89%

Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning

Haoji Zhang, Xin Gu, Jiawen Li, Chixiang Ma, Sule Bai, Chubin Zhang, Bowen Zhang, Zhichao Zhou, Dongliang He, Yansong Tang

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15728 2025-07-22 cs.CV 89%

TokensGen: Harnessing Condensed Tokens for Long Video Generation

Wenqi Ouyang, Zeqi Xiao, Danni Yang, Yifan Zhou, Shuai Yang, Lei Yang, Jianlou Si, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Project page: https://vicky0522.github.io/tokensgen-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17254 2025-07-08 cs.CV cs.AI cs.LG 89%

Enhancing Long Video Generation Consistency without Tuning

Xingyao Li, Fengzhuo Zhang, Jiachun Pan, Yunlong Hou, Vincent Y. F. Tan, Zhuoran Yang

机构 * National University of Singapore(新加坡国立大学) Yale University(耶鲁大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments ICML 2025 Workshop on Building Physically Plausible World Models (Best Paper), 32 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17574 2025-05-26 cs.CV 89%

InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO

Xueji Fang, Liyuan Ma, Zhiyang Chen, Mingyuan Zhou, Guo-jun Qi

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);text-to-video(abstract);分类 cs.CV

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19098 2025-05-20 cs.CV cs.LG 89%

$\infty$-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation

Saul Santos, António Farinhas, Daniel C. McNamee, André F. T. Martins

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);video-language(abstract);分类 cs.CV

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09582 2025-01-22 cs.LG cs.AI cs.CV 89%

Neptune: The Long Orbit to Benchmarking Long Video Understanding

Arsha Nagrani, Mingda Zhang, Ramin Mehran, Rachel Hornung, Nitesh Bharadwaj Gundavarapu, Nilpa Jha, Austin Myers, Xingyi Zhou, Boqing Gong, Cordelia Schmid, Mikhail Sirotenko, Yukun Zhu, Tobias Weyand

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23277 2024-11-04 cs.CV cs.AI cs.CL cs.LG cs.RO 89%

SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation

Yining Hong, Beide Liu, Maxine Wu, Yuanhao Zhai, Kai-Wei Chang, Linjie Li, Kevin Lin, Chung-Ching Lin, Jianfeng Wang, Zhengyuan Yang, Yingnian Wu, Lijuan Wang

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20365 2024-10-08 cs.CV 89%

VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMs

Ruotong Liao, Max Erler, Huiyu Wang, Guangyao Zhai, Gengyuan Zhang, Yunpu Ma, Volker Tresp

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);video-language(abstract);分类 cs.CV

Comments EMNLP 2024 Findings; 22 pages; Code: https://github.com/mayhugotong/VideoINSTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14023 2024-08-27 cs.CV cs.AI 89%

Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos

Jiajun Fei, Dian Li, Zhidong Deng, Zekun Wang, Gang Liu, Hui Wang

专题命中 长视频与时序推理 :video-language(title,abstract);long video(title,abstract);video understanding(abstract);分类 cs.CV

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16260 2024-06-25 cs.CV cs.AI 89%

Video-Infinity: Distributed Long Video Generation

Zhenxiong Tan, Xingyi Yang, Songhua Liu, Xinchao Wang

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06428 2025-02-12 cs.CV 89%

CoS: Chain-of-Shot Prompting for Long Video Understanding

Jian Hu, Zixu Cheng, Chenyang Si, Wei Li, Shaogang Gong

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

Comments A training-free test-time optimisation approach for long video understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20504 2025-03-25 cs.CV cs.CL cs.MM 88%

ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding

Xiao Wang, Qingyi Si, Jianlong Wu, Shiyu Zhu, Li Cao, Liqiang Nie

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV、cs.MM

Comments Rewrite the methods section. Add more ablation studies and results in LongVideoBench. Update metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19702 2025-02-13 cs.CV cs.AI cs.MM 88%

TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning

Xiangyu Zeng, Kunchang Li, Chenting Wang, Xinhao Li, Tianxiang Jiang, Ziang Yan, Songze Li, Yansong Shi, Zhengrong Yue, Yi Wang, Yali Wang, Yu Qiao, Limin Wang

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07663 2026-08-11 cs.CV cs.AI cs.CL 新提交 88%

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

保持简洁:用于超长视频理解的多键情景记忆检索

Yeeun Choi, Youngbeom Yoo, Joon-Young Lee, Hyolim Kang, Seon Joo Kim

机构 * Yonsei University(延世大学) Adobe Research(奥多比研究院)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。

Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15772 2026-07-20 cs.CV 新提交 88%

SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation

SlotMem:用于叙事长视频生成的字符可寻址内部存储器

Yilai Liu, Xin Zhang, Shiyuan Zhang, Hongyang Du

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 研究针对叙事长视频生成中保持角色身份的挑战,提出SlotMem框架,通过字符语义探测器定位视觉令牌,记忆编码器压缩记忆,记忆写入器更新记忆,逐角色交叉注意力检索记忆,提升了远程角色一致性与视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19706 2026-06-19 cs.CV cs.CL 新提交 88%

NEST: Narrative Event Structures in Time for Long Video Understanding

NEST:面向长视频理解的时间叙事事件结构

Ali Asgarov, Kaushik Narasimhan, Najibul Haque Sarker, Hani Alomari, Chia-Wei Tang, Anushka Sivakumar, Zaber Ibn Abdul Hakim, Shaurya Mallampati, Chris Thomas

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出NEST数据集(1005部全长电影),通过多模态叙事事件标注和关系链接,评估模型在长视频中理解事件结构、时间顺序和长程依赖的能力,实验表明事件检测等任务极具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16481 2026-05-19 cs.CV cs.AI 88%

Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval

视觉代理记忆:通过在线索引、分层记忆和代理检索实现在线长视频理解

Aiden Yiliu Li, Nels Numan, Anthony Steed

机构 * University College London(伦敦大学学院)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出视觉代理记忆框架,通过在线索引、分层记忆和代理检索实现长视频理解,实验显示其在OVO-Bench和MM-Lifelong数据集上均取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08410 2026-04-10 cs.CV 88%

Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval

通过一次剪辑检索增强多模态大语言模型的长视频理解

Tao Chen, Shaobo Ju, Qiong Wu, Chenxin Fang, Kun Zhang, Jun Peng, Hui Li, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算教育部重点实验室) Xiamen University(厦门大学)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出OneClip-RAG方法,通过一次剪辑检索提升多模态大语言模型对长视频的理解能力,改进知识完整性和语义连贯性,并设计新数据集和训练方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29252 2026-04-01 cs.CV cs.AI 88%

Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

通过视觉记忆机制扩展多模态大语言模型的长视频理解

Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28696 2026-03-31 cs.CV cs.AI 88%

AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding

AdaptToken: 基于熵的自适应令牌选择用于多模态大语言模型长视频理解

Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) EPFL(瑞士联邦理工学院洛桑) ETH Zurich(苏黎世联邦理工学院)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 AdaptToken通过利用模型自不确定性实现全局控制信号,提升多模态大语言模型对长视频的理解能力,通过熵信号分配令牌预算并支持提前停止,提升准确率并减少推理时间。

Comments Project page: https://haozheqi.github.io/adapt-token

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13874 2026-03-31 cs.CV 88%

SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning

SAGE:基于强化学习训练长视频推理的智能任意时间范围智能体

Jitesh Jain, Jialuo Li, Zixian Ma, Jieyu Zhang, Chris Dongjoo Kim, Sangho Lee, Rohun Tripathi, Tanmay Gupta, Christopher Clark, Humphrey Shi

机构 * Allen AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出SAGE系统,通过多轮推理处理长视频并单轮处理简单问题,结合Gemini-2.5-Flash生成合成数据,提出RL后训练方案,并通过SAGE-Bench验证系统有效性,提升视频推理性能达6.1%。

Comments Project Page: https://praeclarumjj3.github.io/sage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02425 2026-03-30 cs.CV cs.AI cs.CL cs.IR cs.LG 88%

WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning

WorldMM: 动态多模态记忆代理用于长视频推理

Woongyeong Yeo, Kangsan Kim, Jaehong Yoon, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡南洋理工大学)

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 WorldMM通过构建和检索多种互补记忆,提升长视频推理能力,实现8.4%的性能提升。

Comments CVPR 2026. Project page : https://worldmm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25209 2026-03-27 cs.CV cs.AI 88%

Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction

通过层适应性O.O.D校正实现免费午餐长视频生成

Jiahao Tian, Chenxi Song, Wei Cheng, Chi Zhang

机构 * Westlake University(西湖大学)

专题命中 长视频与时序推理 :long video(title,abstract);video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出FreeLOC框架,通过层适应性机制解决长视频生成中的O.O.D问题,提升时序一致性和视觉质量。

Comments Accepted to CVPR 2026. Code: https://github.com/Westlake-AGI-Lab/FreeLOC

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13719 2026-03-25 cs.CV cs.AI cs.IR 88%

Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search

基于音频视觉实体凝聚力与代理搜索的层次化长视频理解

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出HAVEN框架,通过整合音频视觉实体凝聚力与层次化视频索引与代理搜索,解决长视频理解中的信息碎片化和全局一致性问题,实验显示在LVBench上达到84.1%的准确率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00512 2026-03-18 cs.CV 88%

Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding

基于语义边界的小波帧选择用于长视频理解

Wang Chen, Yuhui Zeng, Yongdong Luo, Tianyu Xie, Luojun Lin, Jiayi Ji, Yan Zhang, Xiawu Zheng

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出WFS-SB方法,通过小波变换检测语义边界,提升长视频中大视觉语言模型的性能,实验显示在多个基准上均优于现有方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11245 2026-03-09 cs.CV 88%

NarrLV: Towards a Comprehensive Narrative-Centric Evaluation for Long Video Generation

NarrLV: 向长视频生成的综合性叙事导向评估迈进

X. Feng, H. Yu, M. Wu, S. Hu, J. Chen, C. Zhu, J. Wu, X. Chu, K. Huang

机构 * UCAS CASIA(中国科学院自动化研究所) AMAP, Alibaba Group(阿里云实验室) NTU(国立科技大学) PKU(北京大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 NarrLV是首个针对长视频生成模型的综合性叙事评估基准,通过引入时间叙事原子和基于MLLM的评估指标,全面评估模型在叙事表达上的能力。

Comments Project Page: https://amap-ml.github.io/NarrLV-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24289 2026-03-02 cs.CV cs.LG 88%

Mode Seeking meets Mean Seeking for Fast Long Video Generation

模式寻求与均值寻求的结合用于快速长视频生成

Shengqu Cai, Weili Nie, Chao Liu, Julius Berner, Lvmin Zhang, Nanye Ma, Hansheng Chen, Maneesh Agrawala, Leonidas Guibas, Gordon Wetzstein, Arash Vahdat

机构 * Stanford University, California, USA(斯坦福大学) NVIDIA Research, California, USA(NVIDIA研究)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出一种结合模式寻求与均值寻求的解耦扩散变换器,通过监督学习生成快速长视频,提升长距离连贯性和局部真实感。

Comments Project website: https://primecai.github.io/mmm/

详情

展开后加载摘要…

URL PDF HTML 收藏