arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6737 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1369 篇

2201.08264 2022-05-11 cs.CV cs.AI cs.CL cs.HC 70%

End-to-end Generative Pretraining for Multimodal Video Captioning

Paul Hongsuck Seo, Arsha Nagrani, Anurag Arnab, Cordelia Schmid

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Journal ref Proceedings of Conference on Computer Vision and Pattern Recognition (CVPR) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.14834 2022-03-30 cs.CV 70%

IntentVizor: Towards Generic Query Guided Interactive Video Summarization

Guande Wu, Jianzhe Lin, Claudio T. Silva

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments 10 pages and 4 figures, CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.00344 2018-12-07 cs.CV 70%

How to Make a BLT Sandwich? Learning to Reason towards Understanding Web Instructional Videos

Shaojie Wang, Wentian Zhao, Ziyi Kou, Chenliang Xu

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.02612 2016-10-27 cs.CV cs.GR cs.LG 70%

Generating Videos with Scene Dynamics

Carl Vondrick, Hamed Pirsiavash, Antonio Torralba

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments NIPS 2016. See more at http://web.mit.edu/vondrick/tinyvideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24636 2026-06-24 cs.AI 新提交 67%

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

CineCap: 基于时空锚点的结构化推理用于电影化视频描述

Xinyu Mao, Yuhui Zeng, Xiaokun Liu, Wenyu Qin, Meng Wang, Xin Tao, Pengfei Wan, Xiaohan Xing, Max Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Xiamen University(厦门大学) Kling Team, Kuaishou Technology(快手科技Kling团队) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学)

专题命中 视频理解 :video generation(abstract);video understanding(abstract)

AI总结 提出CineCap框架,通过时空锚点结构化推理和强化学习(覆盖完整性、准确性和门控覆盖奖励)生成电影化视频描述,在CineCap Bench基准上达到新最优。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16284 2026-08-07 cs.CV cs.MM 版本更新 62%

MAC 2026: Advancing Micro-Action Analysis Towards Fine-Grained Understanding

MAC 2026:推动微动作分析迈向细粒度理解

Kun Li, Dan Guo, Jihao Gu, Pengyu Liu, Xiaobai Li, Haoyu Chen, Yanbin Hao, Guoying Zhao, Meng Wang

机构 * United Arab Emirates University(阿联酋大学) Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) Zhejiang University(浙江大学) University of Oulu(奥卢大学) CMVS, University of Oulu(奥卢大学计算机视觉与媒体研究中心)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文介绍第三届MAC 2026,以从识别到细粒度微动作理解为主题,扩大挑战范围,引入新任务并借助多模态大语言模型评估,总结了相关数据集、设置、结果等,还探讨了微动作分析未来方向及在视频理解中的作用。

Comments Challenge Summary Paper of the 3rd Micro-Action Analysis Grand Challenge (MAC 2026) at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19515 2026-07-23 eess.IV cs.CV 新提交 62%

BLUE: Semantics-Preserving Video Compression for Efficient Vision-Language Surveillance Analytics

BLUE:用于高效视觉语言监控分析的语义保留视频压缩

Shubham Baid, Akash James, Sahil Chachra, Nishant Sinha, Kunal Kislay

机构 * KGraph AI Solutions Pvt. Ltd.(KGraph AI解决方案私人有限公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV

AI总结 研究持续监控视频给企业视频分析系统带来的负担问题,提出BLUE固定摄像头监控压缩方法,在VIRAT和CHAD数据集上实验,结果表明该方法能在保留VLM语义性能时降低带宽和推理成本。

Comments 17 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02963 2026-07-07 cs.CV cs.AI cs.MM 新提交 62%

Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

用于全模态密集视频字幕的并行自回归解码

Wenzheng Zeng, Siyi Jiao, Chen Gao, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 研究密集视频字幕生成,提出并行自回归框架,利用事件间弱局部依赖重组因果依赖图,引入全局规划和事件分解并行解码机制,提升效率与字幕性能。

Comments ECCV 2026. Project website: https://github.com/showlab/PadCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15347 2026-06-26 eess.IV cs.MM 版本更新 62%

Symmetric Entropy-Constrained Video Coding for Machines

面向机器的对称熵约束视频编码

Yuxiao Sun, Meiqin Liu, Chao Yao, Qi Tang, Jian Jin, Weisi Lin, Frederic Dufaux, Yao Zhao

专题命中 视频理解 :video understanding(abstract);分类 eess.IV、cs.MM

AI总结 提出SEC-VCM框架,通过双向熵约束机制对称对齐视频编解码器与视觉骨干网络,保留语义并丢弃无关信息,结合语义-像素双路径融合提升机器视觉任务性能,在多项任务上显著优于H.266/VVC。

Comments Accepted by IEEE Transactions on Image Processing. This is the author's accepted manuscript (AAM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25186 2026-05-01 cs.CV cs.CE cs.MM 62%

FCMBench-Video: Benchmarking Document Video Intelligence

FCMBench-Video:文档视频智能基准测试

Runze Cui, Fangxin Shang, Yehui Yang, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(启赋科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文提出FCMBench-Video基准测试,用于评估文档视频理解中的文档感知、时间定位和证据推理能力,通过真实场景数据验证系统性能,揭示不同任务的敏感性和能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11102 2026-04-14 cs.CV cs.MM 62%

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进

Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan

机构 * ARC Lab, Tencent(腾讯ARC实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。

Comments Project Page: https://arcomniscript.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13714 2026-04-03 eess.IV cs.AI cs.CV cs.LG 62%

DeDelayed: Deleting Remote Inference Delay via On-Device Correction

DeDelayed:通过设备端校正删除远程推断延迟

Dan Jacobellis, Mateen Ulhaq, Fabien Racapé, Hyomin Choi, Neeraja J. Yadwadkar

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) InterDigital

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV

AI总结 本文提出DeDelayed系统,通过设备端与远程模型协同推断,降低视频处理延迟,提升实时视频分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22466 2026-03-25 cs.CV cs.AI cs.HC cs.MM 62%

Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing

颜色何时重要:灰度引导的在线触发用于始终开启的流视频感知

Weitong Cai, Hang Zhang, Yukai Huang, Shitong Sun, Jiankang Deng, Songcen Xu, Jifei Song, Zhensong Zhang

机构 * Queen Mary University of London(伦敦皇后玛丽大学) Independent Researcher(独立研究者) Durham University(杜伦大学) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文提出灰度引导的在线触发方法,通过减少颜色捕获频率,在资源受限设备上实现高效流视频感知,实验显示其在保持性能的同时显著降低能耗。

Comments Accepted at CVPR 2026 (Main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17022 2026-01-27 cs.MM cs.AI cs.CV cs.CY 62%

AI-based System for Transforming text and sound to Educational Videos

基于AI的将文本和声音转换为教育视频的系统

M. E. ElAlami, S. M. Khater, M. El. R. Rehan

专题命中 视频理解 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于GAN的AI系统,通过文本和语音转录、图像生成与视频合成,生成高质量的教育视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21699 2025-12-09 cs.MM cs.AI cs.CV cs.SD eess.AS 62%

MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX

MAVERIX:多模态音频视觉评估与识别指数

Liuyue Xie, Avik Kuthiala, George Z. Wei, Ce Zheng, Ananya Bal, Mosam Dabhi, Liting Wen, Taru Rustagi, Ethan Lai, Sushil Khyalia, Rohan Choudhury, Morteza Ziyadi, Xu Zhang, Hao Yang, László A. Jeni

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 MAVERIX是一个用于评估多模态模型音频视觉整合能力的统一基准,通过精心设计的问题展示模型在跨模态理解上的性能,揭示了与人类水平的显著差距。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19475 2025-11-26 cs.CV cs.AI cs.MM 62%

Tracking and Segmenting Anything in Any Modality

任何模态下任何事物的跟踪与分割

Tianlu Zhang, Qiang Zhang, Guiguang Ding, Jungong Han

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 SATA提出了一种通用框架,通过解耦的专家混合机制和任务感知多目标跟踪流程,统一了多种跟踪和分割任务,提升了模型的泛化能力。

Comments Accpetd by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02889 2025-09-24 cs.CL cs.AI cs.CV cs.MM 62%

LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture

Xidong Wang, Dingjie Song, Shunian Chen, Junyin Chen, Zhenyang Cai, Chen Zhang, Lichao Sun, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Lehigh University(莱斯利大学) Meituan(美团)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13255 2025-09-17 cs.CV cs.AI cs.IR eess.IV 62%

ResidualViT for Efficient Temporally Dense Video Encoding

Mattia Soldan, Fabian Caba Heilbron, Bernard Ghanem, Josef Sivic, Bryan Russell

机构 * KAUST(科威特科学与技术王国(KAUST)) CIIRC CTU(布拉格技术大学智能信息与计算研究中心(CIIRC CTU)) Adobe Research(Adobe研究)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20518 2025-07-29 cs.CV cs.MM 62%

T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval

Yili Li, Gang Xiong, Gaopeng Gou, Xiangyan Qu, Jiamin Zhuang, Zhen Li, Junzheng Shi

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01980 2025-06-04 eess.IV cs.AI cs.CV 62%

Surgical Foundation Model Leveraging Compression and Entropy Maximization for Image-Guided Surgical Assistance

Lianhao Yin, Ozanan Meireles, Guy Rosman, Daniela Rus

机构 * Surgical Artificial Intelligence Laboratory, Massachusetts General Hospital, MA, USA(马萨诸塞州总医院手术人工智能实验室) Computer Science and Artificial Intelligence Laboratory, Massachusetts Institute of Technology, MA, USA(麻省理工学院计算机科学与人工智能实验室) Department of Surgery, Duke University, NC, USA(达特茅斯大学外科系)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00667 2025-06-03 cs.CV cs.MM 62%

Scene Detection Policies and Keyframe Extraction Strategies for Large-Scale Video Analysis

Vasilii Korolkov

机构 * Binat, Inc.(Binat公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

Comments 24 pages, 8 figures, submitted as a preprint. ArXiv preprint only, not submitted to a journal yet

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00042 2025-05-14 eess.IV cs.AI cs.CV 62%

An Analysis of Data Transformation Effects on Segment Anything 2

Clayton Bromley, Alexander Moore, Amar Saini, Doug Poland, Carmen Carrano

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV

Comments 11 pages, 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02061 2025-04-04 cs.CV cs.MM cs.SD eess.AS 62%

Aligned Better, Listen Better for Audio-Visual Large Language Models

Yuxin Guo, Shuailei Ma, Shijie Ma, Xiaoyi Bao, Chen-Wei Xie, Kecheng Zheng, Tingyu Weng, Siyang Sun, Yun Zheng, Wei Zou

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19026 2025-02-27 eess.IV cs.AI cs.CV 62%

InternVQA: Advancing Compressed Video Quality Assessment with Distilling Large Foundation Model

Fengbin Guan, Zihao Yu, Yiting Lu, Xin Li, Zhibo Chen

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV

Comments Accepted by ISCAS 2025(Lecture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00365 2024-12-31 cs.AI cs.CV eess.IV 62%

Multimodal Fusion and Coherence Modeling for Video Topic Segmentation

Hai Yu, Chong Deng, Qinglin Zhang, Jiaqing Liu, Qian Chen, Wen Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05185 2024-12-12 cs.CV cs.LG cs.MM 62%

LinVT: Empower Your Image-level Large Language Model to Understand Videos

Lishuai Gao, Yujie Zhong, Yingsen Zeng, Haoxian Tan, Dengjie Li, Zheng Zhao

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06682 2024-10-14 cs.CV cs.CL eess.IV 62%

Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization

Changli Tang, Yixuan Li, Yudong Yang, Jimin Zhuang, Guangzhi Sun, Wei Li, Zujun Ma, Chao Zhang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21757 2024-09-13 cs.CV cs.MM 62%

Learning Video Context as Interleaved Multimodal Sequences

Kevin Qinghong Lin, Pengchuan Zhang, Difei Gao, Xide Xia, Joya Chen, Ziteng Gao, Jinheng Xie, Xuhong Xiao, Mike Zheng Shou

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03104 2024-08-13 cs.CV cs.CL cs.MM 62%

KeyVideoLLM: Towards Large-scale Video Keyframe Selection

Hao Liang, Jiapeng Li, Tianyi Bai, Xijie Huang, Linzhuang Sun, Zhengren Wang, Conghui He, Bin Cui, Chong Chen, Wentao Zhang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02411 2024-07-04 cs.CV cs.CR cs.MM 62%

Video Watermarking: Safeguarding Your Video from (Unauthorized) Annotations by Video-based LLMs

Jinmin Li, Kuofeng Gao, Yang Bai, Jingyun Zhang, Shu-Tao Xia

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

Comments arXiv admin note: substantial text overlap with arXiv:2403.13507

详情

展开后加载摘要…

URL PDF HTML 收藏