arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 646 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 646 篇

2411.19772 2025-03-21 cs.CV cs.CL cs.LG cs.MM 84%

LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos

Tiantian Geng, Jinrui Zhang, Qingni Wang, Teng Wang, Jinming Duan, Feng Zheng

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06526 2025-03-11 cs.CV cs.MM 84%

TimeLoc: A Unified End-to-End Framework for Precise Timestamp Localization in Long Videos

Chen-Lin Zhang, Lin Sui, Shuming Liu, Fangzhou Mu, Zhangcheng Wang, Bernard Ghanem

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM

Comments Code & models will be released at https://github.com/sming256/TimeLoc. The first 4 authors contributes equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20368 2026-07-27 cs.CV 版本更新 83%

Self Gradient Forcing: Native Long Video Extrapolation

自梯度强制:原生长视频外推

Junhao Zhuang, Shiyi Zhang, Yuxuan Bian, Yaowei Li, Yawen Luo, Yijun Liu, Weiyang Jin, Songchun Zhang, Xianglong He, Xuying Zhang, Haoran Li, Haoyang Huang, Zeyue Xue, Nan Duan

机构 * Joy Future Academy(京东探索研究院)

专题命中 长视频与时序推理 :long video(title);video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 研究针对自回归视频扩散方法的历史上下文梯度差距问题,提出自梯度强制(SGF)两阶段训练策略,利用未来视频潜变量损失监督模型将上下文编码为有效因果记忆,在长视频外推实验中效果优于自强制。

Comments Project page: https://zhuang2002.github.io/SelfGradientForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29943 2026-07-13 cs.CV 版本更新 83%

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting

EC-Bench:超长视频的枚举与计数基准

Fumihiko Tsuchiya, Taiki Miyanishi, Shunsuke Yasuki, Mahiro Ukai, Nakamasa Inoue, Shuhei Kurita, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo, Japan(东京大学) Institute of Science Tokyo, Japan(东京科学大学) National Institute of Informatics, Japan(国立信息学研究所)

专题命中 长视频与时序推理 :long video(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 EC-Bench针对超长视频的枚举与计数问题,通过152部超过30分钟的视频和1699个查询,评估多模态大语言模型的性能,揭示模型在时间推理和计数任务中的局限性。

Comments The first two authors are equally contributed. The data and code are publicly available at: https://github.com/matsuolab/EC-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17798 2026-06-17 cs.CV cs.AI 新提交 83%

LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams

LiveStarPro: 具有分层记忆的主动式流视频理解用于长时域流

Zhenyu Yang, Kairui Zhang, Bing Wang, Shengsheng Qian, Changsheng Xu

机构 * IEEE

专题命中 长视频与时序推理 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

AI总结 提出LiveStarPro,通过流验证解码、流因果注意力掩码和树结构分层记忆三个组件,实现长时域流媒体视频的主动理解,在语义正确性和时序误差上分别提升28.9%和降低18.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13861 2026-06-15 cs.CV 新提交 83%

Temporal Backtracking Search for Test-time Generative Video Reasoning

时间回溯搜索:测试时生成式视频推理

Sejoon Jun, Zheng Ding, Huangyuan Su, Weirui Ye, Yilun Du

机构 * Northeastern University(东北大学) Independent Researcher(独立研究者) Harvard & Kempner(哈佛大学与肯普纳研究所) MIT(麻省理工学院)

专题命中 长视频与时序推理 :video reasoning(title,abstract);video generation(abstract);分类 cs.CV

AI总结 提出时间回溯搜索(TBS),通过将搜索空间转移到时间轴,在扩散过程中定位失败点并回溯重启,显著提升视频模型在测试时的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02402 2026-06-02 cs.CV 83%

Explainable Forensics of Manipulated Segments in Untrimmed Long Videos

未修剪长视频中被操纵片段的可解释取证

Yue Feng, Jingjing Li, Qijia Lu, Wei Ji, Jingrou Zhang, Fei Shen, Xiao Li, Yizhen Jia, Qiang Chen, Limin Wang, Wentong Li, Jie Qin

机构 * MoE Key Laboratory of Brain-Machine Intelligence Technology, College of Artificial Intelligence, Nanjing University of Aeronautics(脑机智能技术关键实验室、人工智能学院、南京航空航天大学) Dalian University of Technology(大连理工大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 针对长视频中AI生成片段的定位与解释任务,提出TASLE基准数据集和MSLoc粗到细取证方法,实现时序定位、真实性检测与可解释分析。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06094 2026-05-25 cs.CV cs.AI 83%

VISD: Enhancing Video Reasoning via Structured Self-Distillation

VISD: 通过结构化自蒸馏增强视频推理

Hao Lin, Kunyang Lv, Xu Jiang, Jingqi Tian, Zhongjing Du, Jiayu Ding, Qiaoman Zhang, Hongbo Jin

机构 * HUST(华中科技大学) Wuhan University(武汉大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(abstract);分类 cs.CV

AI总结 提出VISD框架,利用结构化自蒸馏和方向-幅度解耦机制,实现细粒度信用分配,提升视频推理准确性和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25021 2026-04-08 cs.CV 83%

VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning

VideoTIR:通过高效工具集成推理实现长视频的准确理解

Zhe Gao, Shiyu Shen, Taifeng Chai, Weinong Wang, Haotian Xu, Xing W, Wenbin Li, Qi Fan, Yang Gao, Dacheng Tao

机构 * Nanjing University(南京大学) Nankai University(南开大学) East China Normal University(华东师范大学) Tencent(腾讯) MiroMind Nanyang Technological University(南洋理工大学)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出VideoTIR,通过强化学习优化工具调用策略,提升长视频理解的准确性和效率,结合零样本RL和SFT冷启动方法,减少冗余调用并生成高质量轨迹数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04372 2026-04-07 cs.CV 83%

Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning

图到帧RAG:面向无训练和可审计的视频推理的视觉空间知识融合

Songyuan Yang, Weijiang Yu, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出G2F-RAG,通过视觉空间知识融合提升视频推理的可解释性和效率,减少认知负担并保留可追溯的证据轨迹。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00696 2026-04-02 cs.CV 83%

TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning

TTA-Vid: 视频推理的通用测试时间适应

Soumya Shamarao Jahagirdar, Edson Araujo, Anna Kukleva, M. Jehanzeb Mirza, Saurabhchand Bhati, Samuel Thomas, Brian Kingsbury, Rogerio Feris, James R. Glass, Hilde Kuehne

机构 * University of Tübingen(蒂宾根大学) MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Tuebingen AI Center(蒂宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 长视频与时序推理 :video reasoning(title,abstract);video-language(abstract);分类 cs.CV

AI总结 本文提出TTA-Vid方法,通过测试时间强化学习实现视频推理模型的适应,无需标注数据即可在测试时泛化至新领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26193 2026-03-30 cs.CV cs.AI 83%

MemCam: Memory-Augmented Camera Control for Consistent Video Generation

MemCam:用于一致视频生成的记忆增强摄像机控制

Xinhang Gao, Junlin Guan, Shuhan Luo, Wenzhuo Li, Guanghuan Tan, Jiacheng Wang

机构 * Guilin University of Electronic Technology(桂林电子科技大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 MemCam通过利用先前生成帧作为外部记忆,提升动态摄像机控制下的视频生成一致性,实验表明其在长视频场景中表现优异。

Comments 6 pages, 3 figures, 3 tables, accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25730 2026-03-27 cs.CV cs.AI 83%

PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference

PackForcing:短视频训练足以支持长视频采样和长上下文推理

Xiaofeng Mao, Shaohao Rui, Kaining Ying, Bo Zheng, Chuanhao Li, Mingmin Chi, Kaipeng Zhang

机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,盛大AI研究东京) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 长视频与时序推理 :long video(title);video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出PackForcing框架,通过三部分KV缓存策略有效管理生成历史,实现高效内存使用和长视频生成,展示短视频监督足以支持高质量长视频合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15167 2026-03-17 cs.CV 83%

Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding

基于记忆反馈的问题引导视觉压缩用于长期视频理解

Sosuke Yamao, Natsuki Miyahara, Yuankai Qi, Shun Takeuchi

机构 * Fujitsu Research(富士通研究实验室) Macquarie University(麦考瑞大学)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出QViC-MF框架,通过问题引导的多模态选择性注意力和记忆反馈提升长期视频理解性能,在多个基准测试中取得显著提升。

Comments Accepted to CVPR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06097 2026-03-17 cs.CV 83%

VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning

VideoChat-A1: 通过镜头链推理实现长视频的思考

Zikang Wang, Boyu Chen, Zhengrong Yue, Yi Wang, Yu Qiao, Limin Wang, Yali Wang

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11896 2026-03-13 cs.CV cs.AI cs.CL 83%

Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models

边看边想:多轮视频推理的在线流式段级内存

Lu Wang, Zhuoran Jin, Yupu Hao, Yubo Chen, Kang Liu, Yulong Ao, Jun Zhao

专题命中 长视频与时序推理 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出Think While Watching框架,通过段级内存保持多轮视频推理连续性,提升流式视频理解的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06664 2026-03-10 cs.CV cs.AI 83%

Accelerating Video Generation Inference with Sequential-Parallel 3D Positional Encoding Using a Global Time Index

通过全局时间索引的序列-并行3D位置编码加速视频生成推理

Chao Yuan, Pan Li

专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 通过全局时间索引的序列-并行3D位置编码优化视频生成推理,实现亚秒首帧延迟和近实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06573 2026-01-13 cs.AI cs.MM 83%

QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models

QMAVIS:利用大多模态模型融合实现长视频音频理解

Zixing Lin, Jiale Wang, Gee Wah Ng, Lee Onn Mak, Chan Zhi Yang Jeriel, Jun Yang Lee, Yaohao Li

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.MM

AI总结 QMAVIS通过融合大型多模态模型、大型语言模型和语音识别模型,实现了长视频音频理解,展示了在VideoMME数据集上38.75%的性能提升,并在其他数据集上表现出竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17229 2026-01-06 cs.CV 83%

Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos

视频侦探:通过反复寻找关键线索来回答长视频中的问题

Henghui Du, Chunjie Zhang, Xi Chen, Chang Zhou, Di Hu

机构 * Gaoling School of Artificial Intelligence(北京中国人民大学人工智能学院) Renmin University of China(中国人民大学) AI Technology Center Online Video Business Unit(人工智能技术中心在线视频业务部) Tencent PCG(腾讯PCG)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 VideoDetective通过问题感知的记忆机制,使大语言模型能高效处理长视频问答任务,减少计算资源消耗并提升关键信息提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23483 2025-12-30 cs.CV 83%

TV-RAG: A Temporal-aware and Semantic Entropy-Weighted Framework for Long Video Retrieval and Understanding

TV-RAG:一种具有时间意识和语义熵权的长视频检索与理解框架

Zongsheng Cao, Yangfan He, Anran Liu, Feng Chen, Zepeng Wang, Jun Xie

机构 * Researcher(研究者)

专题命中 长视频与时序推理 :long video(title);video language model(abstract);video reasoning(abstract);分类 cs.CV

AI总结 TV-RAG通过时间衰减检索和熵加权关键帧采样,提升长视频检索与理解性能,无需重新训练即可集成至现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18741 2025-12-24 cs.CV 83%

Memorize-and-Generate: Towards Long-Term Consistency in Real-Time Video Generation

记忆与生成:迈向实时视频生成中的长期一致性

Tianrui Zhu, Shiyi Zhang, Zhirui Sun, Jingqi Tian, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 MAG通过分离内存压缩与帧生成任务,提升实时视频生成的长期一致性与效率。

Comments Code will be released at https://github.com/Xilluill/MAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19539 2025-12-23 cs.CV 83%

StoryMem: Multi-shot Long Video Storytelling with Memory

StoryMem: 基于记忆的多镜头长视频叙事

Kaiwen Zhang, Liming Jiang, Angtian Wang, Jacob Zhiyuan Fang, Tiancheng Zhi, Qing Yan, Hao Kang, Xin Lu, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 长视频与时序推理 :long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 StoryMem通过基于记忆的迭代镜头合成,实现了高质量多镜头视频叙事,提升了跨镜头一致性与审美质量。

Comments Project page: https://kevin-thu.github.io/StoryMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26360 2025-12-09 cs.CV cs.AI 83%

TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos

TimeScope: 向长视频中面向任务的时序定位迈进

Xiangrui Liu, Minghao Qin, Yan Shu, Zhengyang Liang, Yang Tian, Chen Jason Zhang, Bo Zhao, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) University of Trento(特伦多大学) Singapore Management University(新加坡管理大学)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 TimeScope通过逐步推理实现长视频中面向任务的时序定位,提升定位精度并增强下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04515 2025-12-05 cs.CV 83%

EgoLCD: Egocentric Video Generation with Long Context Diffusion

EgoLCD:基于长上下文扩散的自体视频生成

Liuzhou Zhang, Jiarui Ye, Yuanlei Wang, Ming Zhong, Mingju Cao, Wanke Xia, Bowen Zeng, Zeyu Zhang, Hao Tang

机构 * Peking University(北京大学) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 EgoLCD通过结合长时稀疏KV缓存和LoRA扩展的注意力机制,实现了高效稳定的自体长上下文视频生成,提升了感知质量和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17945 2025-11-25 cs.CV 83%

Test-Time Temporal Sampling for Efficient MLLM Video Understanding

测试时时间采样用于高效多模态大语言模型视频理解

Kaibin Wang, Mingbao Lin

机构 * SenseTime, China(深睿时代,中国) Rakuten, Singapore(拉结恩,新加坡)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 T3S通过测试时时间采样提高多模态大语言模型处理长视频的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12027 2025-11-18 cs.CV cs.AI 83%

GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory

Jeong Hun Yeo, Sangyun Chung, Sungjune Park, Dae Hoe Kim, Jinyoung Moon, Yong Man Ro

机构 * Integrated Vision and Language Lab., School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(整合视觉与语言实验室,电气工程学院,韩国科学技术院(KAIST)) Visual Intelligence Research Section, Superintelligence Creative Research Laboratory, Electronics and Telecommunications Research Institute (ETRI)(视觉智能研究部,超智能创意研究实验室,电子电信研究院)

专题命中 长视频与时序推理 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15745 2025-10-27 eess.IV cs.LG 83%

InfiniPot-V: Memory-Constrained KV Cache Compression for Streaming Video Understanding

Minsoo Kim, Kyuhong Shim, Jungwook Choi, Simyung Chang

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 eess.IV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06040 2025-10-08 cs.CV cs.AI 83%

VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization

Xinye Cao, Hongcan Guo, Jiawen Qian, Guoshun Nan, Chao Wang, Yuqi Pan, Tianhao Hou, Xiaojuan Wang, Yutong Gao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Minzu University of China(民族大学)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24943 2025-09-30 cs.CV 83%

Perceive, Reflect and Understand Long Video: Progressive Multi-Granular Clue Exploration with Interactive Agents

Jiahua Li, Kun Wei, Zhe Xu, Zibo Su, Xu Yang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港理工大学计算机科学与工程系) College of Computer and Information, Hohai University(河海大学计算机与信息学院)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04450 2025-09-05 cs.CV cs.LG 83%

Virtual Fitting Room: Generating Arbitrarily Long Videos of Virtual Try-On from a Single Image -- Technical Preview

Jun-Kun Chen, Aayush Bansal, Minh Phuoc Vo, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) SpreeAI

专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);分类 cs.CV

Comments Project Page: https://immortalco.github.io/VirtualFittingRoom/

详情

展开后加载摘要…

URL PDF HTML 收藏