arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 646 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 646 篇

2202.10571 2022-02-23 cs.CV cs.LG 70%

Generating Videos with Dynamics-aware Implicit Generative Adversarial Networks

Sihyun Yu, Jihoon Tack, Sangwoo Mo, Hyunsu Kim, Junho Kim, Jung-Woo Ha, Jinwoo Shin

专题命中 长视频与时序推理 :video generation(abstract);long video(abstract);分类 cs.CV

Comments ICLR 2022. Project page with videos and code: https://sihyun-yu.github.io/digan/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11136 2026-07-14 cs.DC 新提交 67%

Xema: Efficient Diffusion Serving through Fine-Grained Memory Management and Auto-Configuration

Xema:通过细粒度内存管理和自动配置实现高效扩散服务

Xueze Kang, Guangyu Xiang, Suyi Li, Yuxin Wang, Shaohuai Shi, Lin Zhang, Xiaowen Chu

专题命中 长视频与时序推理 :video generation(abstract);long video(abstract)

AI总结 研究针对扩散模型服务受GPU内存限制问题,提出Xema系统,通过细粒度内存管理和自动配置,利用可预测张量生命周期优化内存,引入离线规划器联合选择参数,实现高效扩散服务,相比现有配置提升SLO达成率并降低规划成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01322 2026-01-06 cs.CV cs.AI cs.LG cs.MM eess.IV 67%

LinMU: Multimodal Understanding Made Linear

LinMU: 使多模态理解线性化

Hongjie Wang, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV、cs.MM

AI总结 LinMU通过线性复杂度设计实现多模态理解,无需二次注意力模块,提升视频处理效率。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18897 2025-08-21 cs.RO cs.AI 67%

MinD: Learning A Dual-System World Model for Real-Time Planning and Implicit Risk Analysis

Xiaowei Chi, Kuangzhi Ge, Jiaming Liu, Siyuan Zhou, Peidong Jia, Zichen He, Yuzhen Liu, Tingguang Li, Lei Han, Sirui Han, Shanghang Zhang, Yike Guo

专题命中 长视频与时序推理 :video generation(abstract);video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08944 2024-05-16 cs.LG cs.AI cs.CL cs.DC 67%

Challenges in Deploying Long-Context Transformers: A Theoretical Peak Performance Analysis

Yao Fu

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01455 2026-04-22 cs.CV cs.AI cs.CL cs.IR cs.MM 66%

From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents

从逐字到概要:基于语义信息瓶颈的金字塔多模态记忆压缩用于长视界视频智能体

Niu Lian, Yuting Wang, Hanshu Yao, Jinpeng Wang, Bin Chen, Yaowei Wang, Min Zhang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peng Cheng Laboratory(鹏城实验室)

专题命中 长视频与时序推理 :video understanding(abstract,comments);分类 cs.CV、cs.MM

AI总结 本文提出MM-Mem架构,通过金字塔多模态记忆压缩,结合语义信息瓶颈目标,实现长视界视频理解中的高效记忆组织与任务相关信息保留。

Comments Accepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13602 2026-08-17 cs.MM cs.CV cs.SD 新提交 62%

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation

Omni-LiveAvatar:分钟级实时流式视听联动数字人生成

Lunjie Zhu, Xingtong Ge, Fangyu Lin, Yi Zhang, Zhening Liu, Mengfei Li, Yumeng Zhang, Guanglu Song, Yu Liu, Jun Zhang

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本研究提出Omni-LiveAvatar框架,通过渐进式自回归蒸馏等技术,实现分钟级实时流式视听联动数字人生成,速度较LTX-2提升33倍且性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16618 2026-07-29 cs.CV eess.IV q-bio.TO 版本更新 62%

SurgSLOT: Segment Anything in Surgical Videos via Semantic Long-term Tracking

通过语义长期跟踪实现手术视频的分割:SAM2S

Haofeng Liu, Ziyue Wang, Sudhanshu Mishra, Mingqi Gao, Guanyi Qin, Chang Han Low, Alex Y. W. Kong, Zhu Zhuo, Huazhu Fu, Joseph S. Ng, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) University of Sheffield(谢菲尔德大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV

AI总结 SAM2S通过语义长期跟踪提升手术视频分割性能,实现更准确的零样本泛化和实时推理

Comments 19 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28163 2026-06-29 eess.IV cs.CV 新提交 62%

Enhanced Neural Video Representation Compression across Extreme Complexity and Quality Scales

跨极端复杂度和质量尺度的增强型神经视频表示压缩

Ho Man Kwan, Tianhao Peng, Fan Zhang, Mike Nilsson, Andrew Gower, David Bull

机构 * Visual Information Lab, University of Bristol, UK(布里斯托大学视觉信息实验室,英国) Network Connectivity Services Research, BT, UK(BT公司网络连接服务研究,英国)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV

AI总结 提出NVRC++,一种基于隐式神经表示的轻量级视频编解码器,通过多分辨率特征网格和高效优化框架,在多种复杂度级别下实现宽比特率范围的高质量压缩,支持实时解码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25488 2026-05-26 cs.CV cs.AI cs.MM 62%

Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation

测试时自适应条件用于稳定音频驱动说话头生成

Zhicheng Zhang, Lei Wang, Yu Zhang, Yongsheng Gao

机构 * School of Business, University of New South Wales (UNSW)(新南威尔士大学商学院) School of Engineering and Built Environment, Griffith University(格里菲斯大学工程与环境学院)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 提出一种无需参数训练的测试时自适应条件框架(TT-SAC),通过反馈循环调整条件表示,提升预训练说话头生成器的身份保持、时间一致性和感知质量。

Comments Research report

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12477 2026-03-04 eess.IV cs.CV 62%

Slot-BERT: Self-supervised Object Discovery in Surgical Video

Slot-BERT: 在手术视频中实现自监督的对象发现

Guiqiu Liao, Matjaz Jogan, Marcel Hussing, Kenta Nakahashi, Kazuhiro Yasufuku, Amin Madani, Eric Eaton, Daniel A. Hashimoto

机构 * Outcomes Laboratory, Department of Surgery, University of Pennsylvania, Philadelphia, PA, USA. Department of Computer Information Science, University of Pennsylvania, Philadelphia, PA, USA. Division of Thoracic Surgery, Toronto General Hospital, University Health Network, Toronto, Ontario, Canada. Surgical Artificial Intelligence Research Academy, University Health Network, Toronto, ON, Canada.

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV

AI总结 Slot-BERT通过双向长距离模型在手术视频中实现自监督的对象发现,提升时间一致性和跨领域适应能力。

Comments Accepted to Medical Image Analysis Journal, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09841 2025-12-11 cs.CL cs.CV cs.MM 62%

ChronusOmni: Improving Time Awareness of Omni Large Language Models

ChronusOmni: 提升 Omni 大语言模型的时间感知能力

Yijing Chen, Yihan Wu, Kaisi Guan, Yuchen Ren, Yuyue Wang, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院) Baichuan Inc.(百川科技公司)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM

AI总结 ChronusOmni 通过增强时间感知能力,提升音频视觉时间定位任务的性能,实现跨模态统一建模和细粒度推理。

Comments Code available at https://github.com/YJCX330/Chronus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10857 2025-08-05 cs.CV cs.AI cs.MM 62%

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Jiashuo Yu, Yue Wu, Meng Chu, Zhifei Ren, Zizheng Huang, Pei Chu, Ruijie Zhang, Yinan He, Qirui Li, Songze Li, Zhenxiang Li, Zhongying Tu, Conghui He, Yu Qiao, Yali Wang, Yi Wang, Limin Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10005 2025-06-13 cs.CV cs.AI cs.CL cs.GR cs.MM 62%

Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models

Sridhar S, Nithin A, Shakeel Rifath, Vasantha Raj

机构 * Computer Science Engineering(计算机科学与工程) Hindustan Institute of Technology and Science(印度恒河理工学院与科学研究院)

专题命中 长视频与时序推理 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments 10 pages, seven figures about Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11091 2025-05-20 cs.CV cs.AI cs.MM 62%

Learning Segment Similarity and Alignment in Large-Scale Content Based Video Retrieval

Chen Jiang, Kaiming Huang, Sifeng He, Xudong Yang, Wei Zhang, Xiaobo Zhang, Yuan Cheng, Lei Yang, Qing Wang, Furong Xu, Tan Pan, Wei Chu

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM MM 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04388 2025-05-19 cs.CV cs.AI cs.MM 62%

Question-Answering Dense Video Events

Hangyu Qin, Junbin Xiao, Angela Yao

机构 * National University of Singapore(新加坡国立大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM

Comments Accepted to SIGIR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21056 2025-03-28 cs.CV eess.IV 62%

Online Reasoning Video Segmentation with Just-in-Time Digital Twins

Yiqing Shen, Bohan Liu, Chenjia Li, Lalithkumar Seenivasan, Mathias Unberath

专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02317 2024-05-07 cs.CV eess.IV 62%

Long-term Human Participation Assessment In Collaborative Learning Environments Using Dynamic Scene Analysis

Wenjing Shi, Phuong Tran, Sylvia Celedón-Pattichis, Marios S. Pattichis

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00414 2024-03-13 cs.CV cs.MM 62%

Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval

Taichi Nishimura, Shota Nakada, Masayoshi Kondo

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.11885 2023-05-02 cs.CV eess.IV 62%

Visualizing the Passage of Time with Video Temporal Pyramids

Melissa E. Swift, Wyatt Ayers, Sophie Pallanck, Scott Wehrwein

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV

Comments 11 pages, 9 figures, accepted for presentation at IEEE VIS 2022, will be published in conference proceedings, supplementary material and more can be found on our project page at https://fw.cs.wwu.edu/~wehrwes/TemporalPyramids

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04637 2023-04-11 cs.MM eess.IV 62%

Improving ABR Performance for Short Video Streaming Using Multi-Agent Reinforcement Learning with Expert Guidance

Yueheng Li, Qianyuan Zheng, Zicheng Zhang, Hao Chen, Zhan Ma

专题命中 长视频与时序推理 :long video(abstract);分类 eess.IV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12198 2023-03-23 eess.IV cs.CV 62%

Autofluorescence Bronchoscopy Video Analysis for Lesion Frame Detection

Qi Chang, Rebecca Bascom, Jennifer Toth, Danish Ahmad, William E. Higgins

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07055 2022-10-14 cs.CV cs.LG cs.MM cs.SD eess.AS 62%

Sparse in Space and Time: Audio-visual Synchronisation with Trainable Selectors

Vladimir Iashin, Weidi Xie, Esa Rahtu, Andrew Zisserman

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM

Comments Accepted as a spotlight presentation for the BMVC 2022. Code: https://github.com/v-iashin/SparseSync Project page: https://v-iashin.github.io/SparseSync

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.09877 2022-01-27 cs.CV cs.LG eess.IV 62%

Graph Neural Network for Video Relocalization

Yuan Zhou, Mingfei Wang, Ruolin Wang, Shuwei Huo

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.08950 2021-12-17 cs.CV cs.LG eess.IV 62%

Stable Long-Term Recurrent Video Super-Resolution

Benjamin Naoto Chiche, Arnaud Woiselle, Joana Frontera-Pons, Jean-Luc Starck

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.01681 2021-11-03 cs.CV eess.IV 62%

Saliency detection with moving camera via background model completion

Yupei Zhang, Kwok-Leung Chan

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.06017 2019-10-15 cs.CV eess.IV 62%

OmniTrack: Real-time detection and tracking of objects, text and logos in video

Hannes Fassold, Ridouane Ghermi

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV、eess.IV

Comments accepted for IEEE ISM Conference, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.01528 2018-03-05 cs.CV cs.MM 62%

Contextually Customized Video Summaries via Natural Language

Jinsoo Choi, Tae-Hyun Oh, In So Kweon

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM

Comments To appear in WACV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12107 2026-08-13 cs.CV 新提交 57%

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

Avatar-Forever:用于高质量实时无限虚拟形象的解耦并行训练

Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动) AMD(超威半导体公司)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 Avatar-Forever是一种解耦并行训练框架,通过双分支设计与ForeverCache机制,在单张H100 GPU上实现27.2 FPS的768x512音频驱动无限虚拟形象生成,保障质量与效率,推进稳定数字人研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05663 2026-08-10 cs.CV cs.SD 版本更新 57%

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成

Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Tongji University(同济大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。

Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/

详情

展开后加载摘要…

URL PDF HTML 收藏