arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 75 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 75 篇

2512.23953 2026-08-05 cs.CV 版本更新 86%

T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models

T2VAttack:针对文本到视频扩散模型的对抗攻击

Changzhen Li, Yuecong Min, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen

机构 * Hangzhou Institute for Advanced Study, UCAS, school of Intelligent Science and Technology(杭州高等研究院,UCAS,智能科学与技术学院) State Key Laboratory of AI Safety, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences (UCAS)(中国科学院大学)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

AI总结 T2VAttack研究了文本到视频扩散模型的对抗攻击,提出两种攻击方法揭示模型在语义和时间动态上的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02979 2026-08-11 cs.CV 版本更新 83%

Not All Frames Deserve Full Computation: Accelerating Autoregressive Video Generation via Selective Computation and Predictive Extrapolation

并非所有帧都值得完全计算:通过选择性计算和预测外推加速自回归视频生成

Hanshuai Cui, Zhiqing Tang, Zhi Yao, Fanshuai Meng, Weijia Jia, Wei Zhao

机构 * Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Shenzhen University of Advanced Technology(深圳理工大学)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出SCOPE框架,通过三模式调度器和选择性计算,提升自回归视频扩散模型效率,在保持质量的同时实现4.73倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10671 2026-08-05 cs.CV 版本更新 83%

FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion

FadeMem: 面向自回归视频扩散的距离感知记忆巩固

Yu Lu, Junjie Yang, Piotr Koniusz, YuXin Song, Yi Yang

机构 * Zhejiang University(浙江大学) University of New South Wales (UNSW)(新南威尔士大学) Data61/CSIRO Baidu Inc(百度公司)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);long video(abstract);分类 cs.CV

AI总结 提出FadeMem,一种距离感知的KV记忆巩固机制,在固定缓存预算下将历史KV块组织成时间层次,通过幂律分配实现近密远疏的记忆,提升长视频生成中的主体一致性和时间连贯性。

Comments 14 pages, 9 figures. Substantially revised manuscript with expanded experiments and integrated supplementary material. Project page: https://fademem.github.io/FadeMem_Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21541 2026-08-04 cs.GR cs.CV 版本更新 83%

ControlHair: Synergizing Physics Simulator and Video Diffusion for Controllable Dynamic Hair Rendering

ControlHair:协同物理模拟器与视频扩散实现可控动态毛发渲染

Weikai Lin, Haoxiang Li, Yuhao Zhu

机构 * University of Rochester(罗切斯特大学) Pixocial Technology(Pixocial技术)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 研究针对毛发模拟渲染难题,提出ControlHair框架,融合物理模拟器与视频扩散,通过三阶段管道实现可控动态毛发渲染,性能优于基线并展示多种应用。

Comments Accepted to ECCV 2026. 21 pages. Project page: https://linwk20.github.io/controlhair-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16870 2026-08-03 cs.CV cs.AI 版本更新 83%

Demystifying Video Reasoning

揭秘视频推理

Ruisi Wang, Zhongang Cai, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang, Ran Ji, Chenyang Gu, Bo Li, Ziqi Huang, Hokin Deng, Dahua Lin, Ziwei Liu, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频扩散模型 :video reasoning(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文通过实验揭示视频扩散模型中的推理主要发生在去噪步骤中,提出链式步骤(CoS)机制,并发现工作记忆、自我修正和感知先行等涌现行为,最后提出一种无需训练的集成策略来提升推理能力。

Comments Homepage: https://www.wruisi.com/demystifying_video_reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06173 2026-07-28 cs.CV 版本更新 83%

MobileWan: Closing the Quality Gap for Mobile Video Diffusion

MobileWan:弥合移动视频扩散的质量差距

Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibian

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 研究旨在弥合移动视频扩散质量差距,提出将5B参数视频扩散Transformer通过循环重公式化等方法高效部署在移动硬件上,经多种优化,成为首个可商用移动设备部署的该规模模型,取得新的端到端延迟和分数,建立移动视频生成新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25449 2026-06-16 cs.CV 版本更新 83%

Pantheon360: Taming Digital Twin Generation via 3D-Aware 360° Video Diffusion

Pantheon360: 通过3D感知的360°视频扩散驯服数字孪生生成

Ting-Hsuan Chen, Ying-Huan Chen, Tao Tu, Jie-Ying Lee, Cho-Ying Wu, Fangzhou Lin, Hengyuan Zhang, David Paz, Xinyu Huang, Yuliang Guo, Yu-Lun Liu, Yue Wang, Liu Ren

机构 * University of Southern California(南加州大学) National Yang Ming Chiao Tung University(国家阳明交通大学) Cornell University(康奈尔大学) Bosch Research(博世研究)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 提出Pantheon360框架,利用显式3D缓存从稀疏360°输入生成高保真视频,实现全局几何一致性和可控相机路径,解决传统透视视频生成器视野受限导致的跨视图不一致和时间漂移问题。

Comments Accepted to CVPR 2026. Project page: https://koi953215.github.io/pantheon360_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23159 2026-07-31 cs.AI cs.CV cs.MM 版本更新 81%

CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion

CachedSearch:用于视频扩散测试时搜索的免训练缓存探索

Shreshth Saini, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 研究视频扩散测试时搜索中缓存对候选者排名的影响,提出CachedSearch方法,通过积极缓存探索候选者,仅全计算时重生成获胜者,在多模型多系列中有效提升效率,以低成本获高增益,且免训练、与验证器无关,可用于测试时扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26795 2026-07-14 cs.CV cs.AI cs.MM 版本更新 81%

NaviCache: Test-Time Self-Calibration Caching for Video Generation

NaviCache: 视频生成的测试时自校准缓存

Zheqi Lv, Zhibo Zhu, Jinke Wang, Qi Tian, Shengyu Zhang, Zhengyu Chen, Chengxi Zang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Cornell University(康奈尔大学) Tencent Hunyuan(腾讯文生视频)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 针对视频扩散模型计算成本高的问题,提出NaviCache方法,将特征演化重构思为惯性导航系统问题,通过双状态估计架构自适应跟踪特征变化比和潜在漂移,实现有界误差的计算跳过,在多个模型上取得优异性能。

Comments Published at ICML 2026: Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27345 2026-08-13 cs.CV 版本更新 79%

SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers

RayPE: 用于3D感知视频生成的射线空间位置编码

Minghao Yin, Jiahao Lu, Wenbo Hu, Wang Zhao, Shan Ying, Kai Han

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) ARC Lab, Tencent(腾讯ARC Lab)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出RayPE,通过向自注意力注入6D Plücker坐标编码射线几何关系,提升视频扩散Transformer的3D一致性和相机可控性。

Comments Project page: https://visual-ai.github.io/scope/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14513 2026-08-11 cs.CV cs.AI 版本更新 79%

HEART: Exploiting Head Heterogeneity in Sparse Attention for Video Diffusion

HASTE:通过头级自适应稀疏注意力实现无训练视频扩散加速

Xuzhe Zheng, Yuexiao Ma, Jing Xu, Xiawu Zheng, Rongrong Ji, Fei Chao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HASTE框架,通过时间掩码复用和误差引导预算校准,提升无训练稀疏注意力在视频生成中的速度与质量平衡,实现在720P下1.93倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27741 2026-08-05 cs.CV 版本更新 79%

SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models

SIFT: 视频扩散模型中物理合理运动的自我想象微调

Ruoyu Wang, Jialun Liu, Huayang Huang, Haibin Huang, Jiepeng Wang, Chi Zhang, Xuelong Li, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型生成运动物理不合理的问题,提出自我想象微调(SIFT)范式,通过从模型自身生成视频学习而非直接重建真实视频,结合运动感知判别监督和渐进式难例重放策略,提升运动解耦与物理真实性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04789 2026-08-04 cs.CV 版本更新 79%

Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention

轻量强制:通过稀疏注意力加速自回归视频扩散

Chengtao Lv, Yumeng Shi, Yushi Huang, Ruihao Gong, Shen Ren, Wenya Wang

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 针对自回归视频生成模型中注意力二次复杂度问题,提出首个稀疏注意力方案Light Forcing,通过块感知增长机制和分层稀疏注意力实现质量和效率提升。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20255 2026-08-03 cs.CV 版本更新 79%

AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models

AniCrafter:基于视频扩散模型中化身-背景条件的逼真以人为中心动画定制

Muyao Niu, Mingdeng Cao, Yifan Zhan, Qingtian Zhu, Weihang Ran, Yanhong Zeng, Xiao Sun, Zhihang Zhong, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出AniCrafter模型,通过在视频扩散模型中引入化身-背景条件机制,解决现有角色动画方法在开放域场景中效果受限的问题,其性能优于现有最先进方法,可生成通用且可感知遮挡的动画结果。

Comments Homepage: https://myniuuu.github.io/AniCrafter ; Codes: https://github.com/MyNiuuu/AniCrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14595 2026-07-23 cs.CV 版本更新 79%

MagicPrompt: Ultra-Lightweight Prompt Tuning for Video Generation

MagicPrompt:用于视频生成的超轻量级提示调整

Yinhan Zhang, Dingwei Tan, Xianghao Kong, Yue Ma, Yeying Jin, Anyi Rao

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 研究针对大规模视频扩散模型下游任务微调计算成本高的问题,提出MagicPrompt轻量级框架。采用注意力嵌入提示调整和双空间奖励反馈优化,在可训练参数不到1%时达竞争性能,显著降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30116 2026-07-23 cs.CV cs.LG 版本更新 79%

SGMD: Score Gradient Matching Distillation for Few-Step Video Diffusion Distillation

SGMD: 得分梯度匹配蒸馏用于少步视频扩散蒸馏

Zhuguanyu Wu, Ruihao Gong, Yang Yong, Yushi Huang, Xiangyu Fan, Lei Yang, Dahua Lin, Xianglong Liu

机构 * Beihang University(北京航空航天大学) SenseTime Research(商汤科技研究院) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对分布匹配蒸馏在少步视频扩散中训练昂贵且运动动态保守的问题,提出得分梯度匹配蒸馏(SGMD),通过直接优化假得分朝向教师并使用教师停止梯度Fisher作为稳定目标,实现约3倍训练加速并显著提升运动动态。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13247 2026-07-21 cs.CV 版本更新 79%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12358 2026-07-17 cs.CV 版本更新 79%

ACID: Adaptive Caching for vIDeo generation

ACID:用于视频生成的自适应缓存

Om Agrawal, Saurabh Agarwal, Aditya Akella

机构 * UT Austin(德克萨斯大学奥斯汀分校)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 研究视频扩散模型推理慢问题,提出ACID自适应缓存方法,通过监测漂移信号变化动态切换阈值,无需重新训练,可插入现有缓存方法,实验证明其能显著提升推理速度且质量退化可忽略。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08016 2026-07-16 cs.CV cs.GR 版本更新 79%

LightCrafter: PBR-Conditioned Video Diffusion Refinement for Controllable and Consistent Relighting

LightCrafter:用于可控且一致的重光照的PBR条件视频扩散细化

Zixin Guo, Yehonathan Litman, Yifeng He, John Miller, Chuhan Chen, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Bosch Research(博世研究)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 研究视频重光照问题,提出LightCrafter混合管道,将其重表述为代理视频转换,利用PBR渲染并结合光度先验,在真实世界重光照基准上优于现有技术,还贡献合成基准及相关资源。

Comments Project page: https://www.zixinguo.me/lightcrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09122 2026-07-15 cs.CV 版本更新 79%

LVMark: Robust Watermark for Latent Video Diffusion Models

LVMark:用于潜在视频扩散模型的鲁棒水印

Youngdong Jang, MinHyuk Jang, JaeHyeok Lee, Feng Yang, Gyeongrok Oh, Jongheon Jeong, Sangpil Kim

机构 * Department of Artificial Intelligence, Korea University, Seoul 02841, Republic of Korea(人工智能系,韩国大学,首尔02841,大韩民国) Google DeepMind, Mountain View, CA 94043, USA(谷歌DeepMind,山景城,加利福尼亚州94043,美国)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型现有水印方法的局限,提出LVMark方法,通过学习相邻帧一致性设计新颖水印解码器,结合小波域低频分量与视频颜色特征确保解码准确,训练潜在解码器保持视觉保真,平衡视觉质量与比特精度,实现高容量鲁棒水印嵌入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30308 2026-07-10 cs.CV 版本更新 79%

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11117 2026-07-10 cs.CV 版本更新 79%

HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion

HairWeaver:基于仿真到现实引导视频扩散的少样本逼真头发运动合成

Di Chang, Ji Hou, Aljaz Bozic, Assaf Neuberger, Felix Juefei-Xu, Olivier Maury, Gene Wei-Chin Lin, Tuur Stuyck, Doug Roble, Mohammad Soleymani, Stephane Grabli

机构 * Meta University of Southern California(Meta 美国南加州大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 HairWeaver旨在解决现有方法在头发运动控制上的不足,通过运动上下文LoRA和风格对齐LoRA两个模块,结合CG模拟器生成的数据集训练视频扩散主干,实现对头发运动的精细控制,生成高度逼真且具动态细节的头发动画,达到新的技术水平。

Comments Accepted by ECCV 2026. Website: https://boese0601.github.io/hairweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17195 2026-07-07 cs.CV 版本更新 79%

DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior

DreamShot: 基于视频扩散先验的个性化分镜合成

Junjia Huang, Binbin Yang, Pengxiang Yan, Jiyang Liu, Bin Xia, Zhao Wang, Yitong Wang, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) ByteDance Intelligent Creation(字节跳动智能创作) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 DreamShot通过视频扩散先验实现可控的多镜头合成,支持文本到镜头和参考到镜头生成,提升叙事连贯性和角色一致性。

Comments Accepted by CVPR2026 as a Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11797 2026-07-07 cs.RO cs.CV 版本更新 79%

AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis

AnchorDream:将视频扩散用于具身感知机器人数据合成

Junjie Ye, Rong Xue, Basile Van Hoorick, Pavel Tokmakov, Muhammad Zubair Irshad, Yue Wang, Vitor Guizilini

机构 * Toyota Research Institute(丰田研究院) USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。

Comments Project page: https://jay-ye.github.io/AnchorDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01761 2026-07-03 cs.CV 版本更新 79%

Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion

Control-DINO:用于可控图像到视频扩散的特征空间条件

Edoardo A. Dominici, Thomas Deixelberger, Konstantinos Vardis, Markus Steinberger

机构 * Huawei Technologies, Switzerland(华为技术(瑞士)) Huawei Technologies, Austria(华为技术(奥地利)) Graz University of Technology, Austria(格拉茨技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Control-DINO,通过解耦外观与其他特征,实现对视频扩散模型的可控生成,提升生成渲染的可控性。

Comments ECCV 2026 - Project Page https://dedoardo.github.io/projects/control-dino/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15129 2026-07-02 cs.CV 版本更新 79%

Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors

利用视频扩散先验的超低比特率图像压缩的下一帧解码

Yunuo Chen, Chuqin Zhou, Jiangchuan Li, Xiaoyue Ling, Bing He, Jincheng Dai, Li Song, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出一种超低比特率图像压缩新范式,通过定义紧凑锚帧作为中间状态,利用预训练视频扩散模型将解码转化为下一帧预测,在保持语义的同时丢弃高频细节,相比DiffC在CLIC2020上节省超50%比特率并实现5倍解码加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11641 2026-07-02 cs.CV cs.LG 版本更新 79%

Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers

分布混合至关重要:面向高效视频扩散Transformer的动态稀疏注意力

Yuxi Liu, Yipeng Hu, Zekun Zhang, Kunze Jiang, Kun Yuan

机构 * Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 提出MOD-DiT框架,通过两阶段动态稀疏注意力(利用早期去噪先验和分布混合线性近似预测掩码,结合在线块掩码策略)在无需采样的情况下实现高效视频生成,显著加速并保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15702 2026-07-02 cs.CV 版本更新 79%

End-to-End Training for Autoregressive Video Diffusion via Self-Resampling

通过自重采样实现自回归视频扩散的端到端训练

Yuwei Guo, Ceyuan Yang, Hao He, Yang Zhao, Meng Wei, Zhenheng Yang, Weilin Huang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance Seed(字节跳动Seed) ByteDance(字节跳动)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出自回归视频扩散模型的端到端训练框架Resampling Forcing,通过自重采样模拟推理错误,结合稀疏因果掩码和动态历史路由,实现长视频生成的时间一致性。

Comments Project Page: https://guoyww.github.io/projects/resampling-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14965 2026-07-01 cs.CV 版本更新 79%

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS: 基于几何的视频扩散模型用于新视角合成

Minjun Kang, Inkyu Shin, Taeyeop Lee, Myungchul Kim, In So Kweon, Kuk-Jin Yoon

机构 * KAIST, South Korea(韩国科学技术院) Luma AI, USA(Luma AI(美国))

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。

Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17426 2026-06-29 cs.CV 版本更新 79%

SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning

SHIFT: 视频扩散模型中的运动对齐与对抗混合微调

Xi Ye, Wenjia Yang, Yangyang Xu, Xiaoyang Liu, Duo Su, Mengfei Xia, Jun Zhu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) University of Chinese Academy of Science(中国科学院大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型微调后运动保真度下降的问题,提出基于像素通量动力学的像素运动奖励和SHIFT框架(平滑混合微调),通过对抗优势改进收敛并缓解奖励黑客,有效解决动态度坍塌。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏