End-to-end Generative Pretraining for Multimodal Video Captioning
专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV
Journal ref Proceedings of Conference on Computer Vision and Pattern Recognition (CVPR) 2022
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV
Journal ref Proceedings of Conference on Computer Vision and Pattern Recognition (CVPR) 2022
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV
Comments 10 pages and 4 figures, CVPR 2022
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV
专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV
Comments NIPS 2016. See more at http://web.mit.edu/vondrick/tinyvideo/
CineCap: 基于时空锚点的结构化推理用于电影化视频描述
机构 * The Chinese University of Hong Kong(香港中文大学) ; Xiamen University(厦门大学) ; Kling Team, Kuaishou Technology(快手科技Kling团队) ; National University of Singapore(新加坡国立大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 视频理解 :video generation(abstract);video understanding(abstract)
AI总结 提出CineCap框架,通过时空锚点结构化推理和强化学习(覆盖完整性、准确性和门控覆盖奖励)生成电影化视频描述,在CineCap Bench基准上达到新最优。
Comments 10 pages, 4 figures
MAC 2026:推动微动作分析迈向细粒度理解
机构 * United Arab Emirates University(阿联酋大学) ; Hefei University of Technology(合肥工业大学) ; University College London(伦敦大学学院) ; Zhejiang University(浙江大学) ; University of Oulu(奥卢大学) ; CMVS, University of Oulu(奥卢大学计算机视觉与媒体研究中心)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 本文介绍第三届MAC 2026,以从识别到细粒度微动作理解为主题,扩大挑战范围,引入新任务并借助多模态大语言模型评估,总结了相关数据集、设置、结果等,还探讨了微动作分析未来方向及在视频理解中的作用。
Comments Challenge Summary Paper of the 3rd Micro-Action Analysis Grand Challenge (MAC 2026) at ACM Multimedia 2026
BLUE:用于高效视觉语言监控分析的语义保留视频压缩
机构 * KGraph AI Solutions Pvt. Ltd.(KGraph AI解决方案私人有限公司)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV
AI总结 研究持续监控视频给企业视频分析系统带来的负担问题,提出BLUE固定摄像头监控压缩方法,在VIRAT和CHAD数据集上实验,结果表明该方法能在保留VLM语义性能时降低带宽和推理成本。
Comments 17 pages, 10 figures, 6 tables
用于全模态密集视频字幕的并行自回归解码
机构 * National University of Singapore(新加坡国立大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 研究密集视频字幕生成,提出并行自回归框架,利用事件间弱局部依赖重组因果依赖图,引入全局规划和事件分解并行解码机制,提升效率与字幕性能。
Comments ECCV 2026. Project website: https://github.com/showlab/PadCaptioner
面向机器的对称熵约束视频编码
专题命中 视频理解 :video understanding(abstract);分类 eess.IV、cs.MM
AI总结 提出SEC-VCM框架,通过双向熵约束机制对称对齐视频编解码器与视觉骨干网络,保留语义并丢弃无关信息,结合语义-像素双路径融合提升机器视觉任务性能,在多项任务上显著优于H.266/VVC。
Comments Accepted by IEEE Transactions on Image Processing. This is the author's accepted manuscript (AAM)
FCMBench-Video:文档视频智能基准测试
机构 * AI Lab, Qifu Technology(启赋科技AI实验室) ; College of Future Information Technology, Fudan University(复旦大学未来信息学院) ; School of Future Technology, South China University of Technology(华南理工大学未来技术学院) ; Pazhou Lab(琶洲实验室)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 本文提出FCMBench-Video基准测试,用于评估文档视频理解中的文档感知、时间定位和证据推理能力,通过真实场景数据验证系统性能,揭示不同任务的敏感性和能力差异。
OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进
机构 * ARC Lab, Tencent(腾讯ARC实验室)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。
Comments Project Page: https://arcomniscript.github.io
DeDelayed:通过设备端校正删除远程推断延迟
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; InterDigital
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV
AI总结 本文提出DeDelayed系统,通过设备端与远程模型协同推断,降低视频处理延迟,提升实时视频分割性能。
Comments CVPR 2026
颜色何时重要:灰度引导的在线触发用于始终开启的流视频感知
机构 * Queen Mary University of London(伦敦皇后玛丽大学) ; Independent Researcher(独立研究者) ; Durham University(杜伦大学) ; Imperial College London(伦敦帝国学院) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 本文提出灰度引导的在线触发方法,通过减少颜色捕获频率,在资源受限设备上实现高效流视频感知,实验显示其在保持性能的同时显著降低能耗。
Comments Accepted at CVPR 2026 (Main track)
基于AI的将文本和声音转换为教育视频的系统
专题命中 视频理解 :video generation(abstract);分类 cs.CV、cs.MM
AI总结 本文提出基于GAN的AI系统,通过文本和语音转录、图像生成与视频合成,生成高质量的教育视频。
MAVERIX:多模态音频视觉评估与识别指数
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 MAVERIX是一个用于评估多模态模型音频视觉整合能力的统一基准,通过精心设计的问题展示模型在跨模态理解上的性能,揭示了与人类水平的显著差距。
Journal ref AAAI 2026
任何模态下任何事物的跟踪与分割
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 SATA提出了一种通用框架,通过解耦的专家混合机制和任务感知多目标跟踪流程,统一了多种跟踪和分割任务,提升了模型的泛化能力。
Comments Accpetd by AAAI 2026
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Lehigh University(莱斯利大学) ; Meituan(美团)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
Comments Accepted to EMNLP 2025 Findings
机构 * KAUST(科威特科学与技术王国(KAUST)) ; CIIRC CTU(布拉格技术大学智能信息与计算研究中心(CIIRC CTU)) ; Adobe Research(Adobe研究)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 视频理解 :text-to-video(abstract);分类 cs.CV、cs.MM
机构 * Surgical Artificial Intelligence Laboratory, Massachusetts General Hospital, MA, USA(马萨诸塞州总医院手术人工智能实验室) ; Computer Science and Artificial Intelligence Laboratory, Massachusetts Institute of Technology, MA, USA(麻省理工学院计算机科学与人工智能实验室) ; Department of Surgery, Duke University, NC, USA(达特茅斯大学外科系)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV
机构 * Binat, Inc.(Binat公司)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
Comments 24 pages, 8 figures, submitted as a preprint. ArXiv preprint only, not submitted to a journal yet
机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV
Comments 11 pages, 30 figures
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
Comments Accepted to ICLR 2025
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV
Comments Accepted by ISCAS 2025(Lecture)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
Comments Accepted by ECCV 2024
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
Comments arXiv admin note: substantial text overlap with arXiv:2403.13507