NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation
专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV
增强无列车无限帧生成以实现一致的长视频
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) ; The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(复杂系统认知与决策智能重点实验室,中国科学院自动化研究所,北京,中国) ; AMAP, Alibaba Group, Beijing, China(AMAP,阿里巴巴集团,北京,中国)
专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出MIGA方法,通过两阶段对齐机制和双一致性增强机制,解决训练与推理不匹配和长时一致性维持的问题,从而提升长视频生成效果。
Comments Accepted by ICML 2026~
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光华学院人工智能学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; University of Trento(特伦托大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title);分类 cs.CV、cs.MM
机构 * AI Thrust, HKUST(GZ)(人工智能 thrust,香港科技大学(广州))
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(title);分类 cs.CV、eess.IV
Comments 32 pages, under review
DrawVideo: 从故事板关键帧草图生成长视频
机构 * The University of Sydney(悉尼大学) ; Charles Sturt University(查尔斯·斯特劳特大学)
专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、eess.IV、cs.MM
AI总结 提出 DrawVideo 框架,通过草图引导的故事板分解长视频为可控镜头,结合分层生成策略实现结构可控、外观一致的长视频生成。
Comments 45 pages, 19 figures
通过无训练的身份感知记忆推进叙事长视频生成
机构 * Zhejiang University(浙江大学) ; Tencent Youtu Lab(腾讯云智实验室) ; Huazhong University of Science and Technology(华中科技大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 长视频与时序推理 :video generation(title,abstract);long video(title);分类 cs.CV
AI总结 本文提出了一种无训练的身份感知记忆框架IAMFlow,通过显式建模和跟踪持久实体身份,实现一致的生成,同时引入NarraStream-Bench基准测试,在叙事流视频生成中取得最佳性能。
Comments Project page: https://eddie0521.github.io/projects/iamflow/ Code: https://github.com/Eddie0521/IAMFlow
VSI:视觉字幕整合用于关键帧选择以增强长视频理解
机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)) ; Shandong University(山东大学)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(title);分类 cs.CV
AI总结 VSI通过融合视觉与文本信息提升长视频关键帧检索精度,实现在文本相关任务中的突破性表现。
Comments Accepted to CVPR 2026 Findings, 10 pages
Helios:实时长视频生成模型
机构 * Peking University(北京大学)
专题命中 长视频与时序推理 :video generation(title,abstract);long video(title);分类 cs.CV
AI总结 Helios是首个无需并行框架、能实时生成长视频且质量媲美基线模型的14B视频生成模型。
Comments Page: pku-yuangroup.github.io/Helios-Page
无限世界:实时3D感知长视频生成
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Adobe Research(Adobe研究)
专题命中 长视频与时序推理 :video generation(title,abstract);long video(title);分类 cs.CV
AI总结 Endless World通过实时3D感知机制生成无限长且连贯的视频,解决长视频生成中的3D一致性与动态场景合成问题。
Comments 10 pages,7 figures
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(title);分类 cs.CV
Comments EMNLP 2025; 15 pages, 10 figures
专题命中 长视频与时序推理 :long video(title,abstract);video generation(title);分类 cs.CV
专题命中 长视频与时序推理 :long video(title,abstract);video generation(title);分类 cs.CV
Comments In ECCV 2022
用于参数高效多镜头长视频外推的提示适配器上下文路由
机构 * Instituto de Investigación en Visión Artificial(人工视觉研究所)
专题命中 长视频与时序推理 :long video(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 研究多镜头长视频外推问题,提出PACR-Video框架,通过冻结文本到视频扩散变换器,用低秩时间适配器及递归提示库增强,结合特定调优目标和调度,在多基准测试中优于多种基线,证明其能为长视频外推提供可控能力。
Comments 10 pages, 2 figures
LongVT: 通过原生工具调用激励'通过长视频思考'
机构 * MiroMind ; NTU(国立台湾大学) ; HKUST(GZ)(香港科技大学(广州)) ; THU(清华大学) ; LMMs-Lab(LMMs实验室)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 本文提出LongVT,一种端到端的代理框架,通过交错的多模态工具链式思考实现'通过长视频思考',通过利用LMM的固有时间定位能力作为原生视频裁剪工具,以解决长视频推理中的幻觉问题,并通过VideoSIAH数据集提升训练和评估效果。
Comments CVPR 2026
Video-RAG: 基于视觉对齐的检索增强长视频理解
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) ; Nanjing University(南京大学) ; University of Rochester(罗切斯特大学)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video-language(abstract);分类 cs.CV
AI总结 Video-RAG通过视觉对齐的辅助文本提升长视频理解性能,无需训练且兼容性强,显著优于专有模型。
Comments Accepted at NeurIPS 2025. Camera-ready version
专题命中 长视频与时序推理 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video reasoning(abstract);分类 cs.CV
机构 * NVIDIA ; MIT(麻省理工学院) ; HKU(香港大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);video reasoning(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025. Code at https://github.com/NVlabs/Long-RL and model at https://huggingface.co/Efficient-Large-Model/LongVILA-R1-7B
机构 * NLCo Lab, State Key Laboratory of General Artificial Intelligence, BIGAI(NLCo实验室、国家一般人工智能重点实验室、BIGAI) ; School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院、北京理工大学) ; Computer Science and Engineering, University of California(计算机科学与工程系、加州大学) ; Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所、北京大学)
专题命中 长视频与时序推理 :video understanding(title,abstract);video-language(abstract);long video(abstract);分类 cs.CV
Comments To appear at ICCV 2025
机构 * Tsinghua University(清华大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; Beijing Jiaotong University(北京交通大学) ; ByteDance Inc(字节跳动公司)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video language model(abstract);分类 cs.CV
Comments Accepted by ICCV 2025
机构 * KAIST(韩国科学技术院) ; Google DeepMind(谷歌DeepMind) ; Georgia Tech(佐治亚理工学院) ; Luma AI ; Google Research(谷歌研究)
专题命中 长视频与时序推理 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
Comments CVPR 2025 Workshop on AI for Content Creation (Oral)
机构 * National University of Singapore(国立新加坡大学) ; Xidian University(西安电子科技大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);video diffusion(abstract);分类 cs.CV
Comments The code is available at https://github.com/DualParal-Project/DualParal
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video-language(abstract);分类 cs.CV
Comments Project page: https://github.com/MAC-AutoML/QuoTA
专题命中 长视频与时序推理 :video understanding(title,abstract);video reasoning(abstract);long video(abstract);分类 cs.CV
Comments Accepted to ICLR 2025. Code is available at https://github.com/hmxiong/StreamChat
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video-language(abstract);分类 cs.CV
逐帧测试时校正用于自回归长视频生成
机构 * Nanjing University(南京大学) ; Tencent Hunyuan(腾讯文言) ; Chinese University of Hong Kong Shenzhen(香港中文大学(深圳)) ; University of Science and Technology of China(中国科学技术大学)
专题命中 长视频与时序推理 :video generation(title);long video(title);分类 cs.CV
AI总结 本文提出TTC方法,通过利用初始帧作为参考锚点,有效校正自回归长视频生成中的漂移问题,提升生成质量并延长生成长度。
专题命中 长视频与时序推理 :video understanding(title);long video(title);分类 cs.CV
视频-EM:面向长视频理解的事件中心型片段记忆
机构 * City University of Hong Kong(香港城市大学) ; University of Science and Technology of China(中国科学技术大学) ; Tianjin University(天津大学) ; Nanjing University(南京大学) ; Zhejiang University(浙江大学) ; The Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI))
专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 cs.CV、cs.MM
AI总结 Video-EM通过事件中心型片段记忆框架,将长视频问答转化为事件构建与记忆细化,提升长视频理解的连贯性与可靠性。
Comments 14 pages, 6 figures
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; Shandong University(山东大学)
专题命中 长视频与时序推理 :video-language(title);video understanding(abstract);long video(abstract);分类 cs.CV、cs.MM
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM