Generating Videos with Dynamics-aware Implicit Generative Adversarial Networks
专题命中 长视频与时序推理 :video generation(abstract);long video(abstract);分类 cs.CV
Comments ICLR 2022. Project page with videos and code: https://sihyun-yu.github.io/digan/
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 长视频与时序推理 :video generation(abstract);long video(abstract);分类 cs.CV
Comments ICLR 2022. Project page with videos and code: https://sihyun-yu.github.io/digan/
Xema:通过细粒度内存管理和自动配置实现高效扩散服务
专题命中 长视频与时序推理 :video generation(abstract);long video(abstract)
AI总结 研究针对扩散模型服务受GPU内存限制问题,提出Xema系统,通过细粒度内存管理和自动配置,利用可预测张量生命周期优化内存,引入离线规划器联合选择参数,实现高效扩散服务,相比现有配置提升SLO达成率并降低规划成本。
LinMU: 使多模态理解线性化
机构 * Princeton University(普林斯顿大学)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV、cs.MM
AI总结 LinMU通过线性复杂度设计实现多模态理解,无需二次注意力模块,提升视频处理效率。
Comments 23 pages, 7 figures
专题命中 长视频与时序推理 :video generation(abstract);video diffusion(abstract)
专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract)
从逐字到概要:基于语义信息瓶颈的金字塔多模态记忆压缩用于长视界视频智能体
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 长视频与时序推理 :video understanding(abstract,comments);分类 cs.CV、cs.MM
AI总结 本文提出MM-Mem架构,通过金字塔多模态记忆压缩,结合语义信息瓶颈目标,实现长视界视频理解中的高效记忆组织与任务相关信息保留。
Comments Accepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary
Omni-LiveAvatar:分钟级实时流式视听联动数字人生成
专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 本研究提出Omni-LiveAvatar框架,通过渐进式自回归蒸馏等技术,实现分钟级实时流式视听联动数字人生成,速度较LTX-2提升33倍且性能优于基线模型。
通过语义长期跟踪实现手术视频的分割:SAM2S
机构 * National University of Singapore(新加坡国立大学) ; University of Sheffield(谢菲尔德大学)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
AI总结 SAM2S通过语义长期跟踪提升手术视频分割性能,实现更准确的零样本泛化和实时推理
Comments 19 pages, 7 figures, 11 tables
跨极端复杂度和质量尺度的增强型神经视频表示压缩
机构 * Visual Information Lab, University of Bristol, UK(布里斯托大学视觉信息实验室,英国) ; Network Connectivity Services Research, BT, UK(BT公司网络连接服务研究,英国)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
AI总结 提出NVRC++,一种基于隐式神经表示的轻量级视频编解码器,通过多分辨率特征网格和高效优化框架,在多种复杂度级别下实现宽比特率范围的高质量压缩,支持实时解码。
测试时自适应条件用于稳定音频驱动说话头生成
机构 * School of Business, University of New South Wales (UNSW)(新南威尔士大学商学院) ; School of Engineering and Built Environment, Griffith University(格里菲斯大学工程与环境学院)
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV、cs.MM
AI总结 提出一种无需参数训练的测试时自适应条件框架(TT-SAC),通过反馈循环调整条件表示,提升预训练说话头生成器的身份保持、时间一致性和感知质量。
Comments Research report
Slot-BERT: 在手术视频中实现自监督的对象发现
机构 * Outcomes Laboratory, Department of Surgery, University of Pennsylvania, Philadelphia, PA, USA. ; Department of Computer ; Information Science, University of Pennsylvania, Philadelphia, PA, USA. ; Division of Thoracic Surgery, Toronto General Hospital, University Health Network, Toronto, Ontario, Canada. ; Surgical Artificial Intelligence Research Academy, University Health Network, Toronto, ON, Canada.
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
AI总结 Slot-BERT通过双向长距离模型在手术视频中实现自监督的对象发现,提升时间一致性和跨领域适应能力。
Comments Accepted to Medical Image Analysis Journal, 2026
ChronusOmni: 提升 Omni 大语言模型的时间感知能力
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院) ; Baichuan Inc.(百川科技公司)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
AI总结 ChronusOmni 通过增强时间感知能力,提升音频视觉时间定位任务的性能,实现跨模态统一建模和细粒度推理。
Comments Code available at https://github.com/YJCX330/Chronus/
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
Comments ICCV2025
机构 * Computer Science Engineering(计算机科学与工程) ; Hindustan Institute of Technology and Science(印度恒河理工学院与科学研究院)
专题命中 长视频与时序推理 :text-to-video(abstract);分类 cs.CV、cs.MM
Comments 10 pages, seven figures about Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
Comments Accepted by ACM MM 2021
机构 * National University of Singapore(新加坡国立大学)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
Comments Accepted to SIGIR'25
专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV、eess.IV
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
Comments 24 pages
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
Comments 11 pages, 9 figures, accepted for presentation at IEEE VIS 2022, will be published in conference proceedings, supplementary material and more can be found on our project page at https://fw.cs.wwu.edu/~wehrwes/TemporalPyramids
专题命中 长视频与时序推理 :long video(abstract);分类 eess.IV、cs.MM
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
Comments Accepted as a spotlight presentation for the BMVC 2022. Code: https://github.com/v-iashin/SparseSync Project page: https://v-iashin.github.io/SparseSync
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
Comments 9 pages, 8 figures
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV、eess.IV
Comments accepted for IEEE ISM Conference, 2019
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
Comments To appear in WACV 2018
Avatar-Forever:用于高质量实时无限虚拟形象的解耦并行训练
机构 * The Hong Kong Polytechnic University(香港理工大学) ; ByteDance(字节跳动) ; AMD(超威半导体公司)
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 Avatar-Forever是一种解耦并行训练框架,通过双分支设计与ForeverCache机制,在单张H100 GPU上实现27.2 FPS的768x512音频驱动无限虚拟形象生成,保障质量与效率,推进稳定数字人研究。
Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成
机构 * Vorch Team(Vorch团队) ; Tongji University(同济大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。
Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/