arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2510.11715 2026-04-15 cs.CV 79%

Point Prompting: Counterfactual Tracking with Video Diffusion Models

点提示:基于视频扩散模型的反事实跟踪

Ayush Shrivastava, Sanyam Mehta, Daniel Geng, Andrew Owens

机构 * University of Michigan(密歇根大学) Cornell University(康奈尔大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型进行零样本点跟踪,通过提示模型在视频中标记移动点,实现反事实生成,实验表明其跟踪效果优于传统方法且能克服遮挡。

Comments ICLR 2026. Project link: https://point-prompting.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08646 2026-04-13 cs.CV 79%

InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation

InsEdit:通过数据高效的视频扩散模型适应实现基于指令的视觉编辑

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出InsEdit,基于HunyuanVideo-1.5构建指令式编辑模型,结合Mutual Context Attention机制,仅需少量视频编辑数据即可实现高质量视频编辑,并支持图像编辑。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06161 2026-04-13 cs.CV cs.AI cs.GR 79%

DiffHDR: Re-Exposing LDR Videos with Video Diffusion Models

DiffHDR:利用视频扩散模型重新暴露LDR视频

Zhengming Yu, Li Ma, Mingming He, Leo Isikdogan, Yuancheng Xu, Dmitriy Smirnov, Pablo Salamanca, Dao Mi, Pablo Delgado, Ning Yu, Julien Philip, Xin Li, Wenping Wang, Paul Debevec

机构 * Eyeline Labs(Eyeline 实验室) Netflix

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 DiffHDR通过视频扩散模型的潜在空间将LDR视频转换为HDR,恢复过曝和欠曝区域的真实细节,提升动态范围和再曝光效果。

Comments 28 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24270 2026-04-03 cs.CV 79%

ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors

ScrollScape: 通过视频扩散先验解锁32K图像生成

Haodong Yu, Yabo Zhang, Donglin Di, Ruyi Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Li Auto, Beijing, China(理想汽车(中国北京))

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 ScrollScape通过将超大比例图像生成转化为连续视频生成过程,利用视频模型的时序一致性确保结构完整性,实现32K分辨率的高质量图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16515 2026-04-03 cs.CV 79%

SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer

SALAD: 通过高效的线性注意微调实现高稀疏性注意

Tongcheng Fang, Hanling Zhang, Ruiqi Xie, Zhuo Han, Xin Tao, Tianchen Zhao, Pengfei Wan, Wenbo Ding, Wanli Ouyang, Xuefei Ning, Yu Wang

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出SALAD,通过并行的稀疏注意与轻量线性注意分支,结合多级静态-动态缩放策略,实现高达90%的稀疏性和1.52-2.03倍的推理加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07775 2026-03-31 cs.CV 79%

Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion

滚动汇:在有限时间训练和开放-ended测试之间架桥

Haodong Li, Shaoteng Liu, Zhe Lin, Manmohan Chandraker

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Rolling Sink,通过分析AR缓存维护,实现无需训练的超长视频生成,提升视觉质量和时间一致性。

Comments v5: Fix some typos. Figures were compressed to 150 dpi to comply with arXiv's submission size limit. Project page: https://rolling-sink.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23491 2026-03-25 cs.CV 79%

Foveated Diffusion: Efficient Spatially Adaptive Image and Video Generation

视网膜扩散:高效的视空适应图像和视频生成

Brian Chao, Lior Yariv, Howard Xiao, Gordon Wetzstein

机构 * Stanford University, USA(斯坦福大学,美国)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出视网膜扩散模型,通过非均匀分配token提高生成效率,利用人类视觉的视网膜区域高分辨率特性,在保持视觉质量的同时显著减少token数量和生成时间。

Comments Project website at https://bchao1.github.io/foveated-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21856 2026-03-24 cs.CV 79%

Climate Prompting: Generating the Madden-Julian Oscillation using Video Diffusion and Low-Dimensional Conditioning

气候提示:利用视频扩散和低维条件生成 Madden-Julian 振荡

Sulian Thual, Feiyang Cai, Jingjing Wang, Feng Luo

机构 * School of Computing(计算学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型生成MJO序列,通过低维指标条件化生成MJO,并通过理想化条件分析其物理驱动机制,为热带大气预测提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04619 2026-03-24 cs.CV 79%

Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence

去噪以跟踪:利用视频扩散先验进行鲁棒对应

Tianyu Yuan, Yuanbo Yang, Lin-Zhuo Chen, Yao Yao, Zhuzhong Qian

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HeFT框架,利用预训练视频扩散模型的视觉先验进行零样本点跟踪,通过分析内部表示揭示注意力头在匹配、语义理解和位置编码中的不同专长,并提出基于头和频率的特征选择策略提升跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20382 2026-03-24 cs.CV 79%

Uni-Classifier: Leveraging Video Diffusion Priors for Universal Guidance Classifier

Uni-Classifier: 利用视频扩散先验进行通用引导分类器

Yujie Zhou, Pengyang Ling, Jiazi Bu, Bingjie Gao, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Uni-Classifier,通过利用视频扩散先验引导前序模型的去噪过程,提升生成质量,适用于视频和3D生成任务。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19613 2026-03-23 cs.CV 79%

OrbitNVS: Harnessing Video Diffusion Priors for Novel View Synthesis

OrbitNVS: 利用视频扩散先验进行新视角合成

Jinglin Liang, Zijian Zhou, Rui Huang, Shuangping Huang, Yichen Gong

机构 * South China University of Technology(华南理工大学) King's College London(伦敦大学国王学院) Agentic Labs, XGTech(Agentic实验室,XGTech) Pazhou Laboratory(Pazhou实验室)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 OrbitNVS将新视角合成重新定义为轨道视频生成任务,通过定制模型设计和训练策略,利用预训练视频生成模型的丰富视觉先验,提升几何和外观一致性,实验表明在GSO和OmniObject3D基准上表现优异。

Comments 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18501 2026-03-20 cs.CV cs.AI 79%

Efficient Video Diffusion with Sparse Information Transmission for Video Compression

高效视频扩散与稀疏信息传输用于视频压缩

Mingde Zhou, Zheng Chen, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Diff-SIT方法,通过稀疏时序编码模块和单步视频扩散模型提升视频压缩的感知质量和时间一致性,尤其在超低比特率下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17398 2026-03-19 cs.CV 79%

Motion-Adaptive Temporal Attention for Lightweight Video Generation with Stable Diffusion

面向轻量视频生成的运动自适应时间注意力机制

Rui Hong, Shuxue Quan

机构 * George Mason University(乔治·玛森大学) Independent Researcher(独立研究者)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出基于冻结Stable Diffusion模型的运动自适应时间注意力机制,通过动态调整时间注意力接收域,实现高运动序列局部关注与低运动序列全局关注,仅增加25.8M参数即在WebVid验证集上取得竞争性结果。

Comments 6 pages, 3 figures, 4 tables. Published at IS&T Electronic Imaging 2026, GENAI Track

Journal ref IS&T Electronic Imaging 2026, GENAI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04153 2026-03-18 cs.CV 79%

Diffusion-DRF: Free, Rich, and Differentiable Reward for Video Diffusion Fine-Tuning

Diffusion-DRF:免费、丰富且可微的奖励用于视频扩散微调

Yifan Wang, Yanyu Li, Gordon Guocheng Qian, Sergey Tulyakov, Yun Fu, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Diffusion-DRF框架,通过多维问题和密集VQA解释查询生成丰富反馈,实现稳定奖励微调,无需偏好数据集。

Comments Webpage: https://snap-research.github.io/diffusion-drf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15614 2026-03-17 cs.CV 79%

Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion

Tri-Prompting:具有统一场景、主体和运动控制的视频扩散

Zhenghong Zhou, Xiaohang Zhan, Zhiqin Chen, Soo Ye Kim, Nanxuan Zhao, Haitian Zheng, Qing Liu, He Zhang, Zhe Lin, Yuqian Zhou, Jiebo Luo

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 Tri-Prompting提出统一框架,整合场景、多视角主体一致性和运动控制,提升视频生成的可控性和真实感。

Comments Project page: https://zhouzhenghong-gt.github.io/Tri-Prompting-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14320 2026-03-17 cs.CV 79%

Early Failure Detection and Intervention in Video Diffusion Models

视频扩散模型中的早期故障检测与干预

Kwon Byung-Ki, Sohwi Lim, Nam Hyeon-Woo, Moon Ye-Bin, Tae-Hyun Oh

专题命中 视频扩散模型 :video diffusion(title);text-to-video(abstract);分类 cs.CV

AI总结 本文提出了一种用于视频扩散模型的早期故障检测与干预方法,通过实时检查模块在生成过程中快速检测故障并提前干预,减少计算开销,提升生成质量。

Comments 29 pages, 24 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14327 2026-03-16 cs.CV 79%

MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer

MoVieDrive:基于多模态多视角视频扩散变换器的城市场景合成

Guile Wu, David Huang, Dongfeng Bai, Bingbing Liu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出MoVieDrive,通过多模态多视角视频扩散变换器生成城市驾驶场景视频,实现多模态数据生成与可控生成。

Comments CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02919 2026-03-10 cs.CV cs.AI cs.LG 79%

Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformers

可解释的运动注意力图:在视频扩散变换器中进行时空定位概念

Youngjun Jun, Seil Kang, Woojung Han, Seong Jae Hwang

机构 * Yonsei University(延世大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种可解释的运动注意力图方法,通过时空定位运动概念,提升视频扩散变换器的可解释性与定位能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14357 2026-03-10 cs.CV cs.LG 79%

Vid2World: Crafting Video Diffusion Models to Interactive World Models

Vid2World: 构建视频扩散模型以交互式世界模型

Siqiao Huang, Jialong Wu, Qixing Zhou, Shangchen Miao, Mingsheng Long

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 Vid2World通过因果化视频扩散模型,提升其在交互式世界建模中的可控性和生成能力,适用于机器人操作、游戏模拟和开放世界导航等多种领域。

Comments Project page: http://knightnemo.github.io/vid2world/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23681 2026-03-10 cs.CV 79%

QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification

QuantSparse: 通过模型量化和注意力稀疏化全面压缩视频扩散变换器

Weilun Feng, Chuanguang Yang, Haotong Qin, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学,美国) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 QuantSparse通过结合模型量化和注意力稀疏化,实现视频扩散变换器的高效压缩,提升性能并减少存储与推理时间。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11512 2026-03-09 cs.CV cs.AI 79%

LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference

LikePhys: 通过似然偏好评估视频扩散模型中的直观物理理解

Jianhao Yuan, Fabio Pizzati, Francesco Pinto, Lars Kunze, Ivan Laptev, Paul Newman, Philip Torr, Daniele De Martini

机构 * University of Oxford(牛津大学) MBZUAI(穆斯林人工智能研究所) University of Chicago(芝加哥大学) UWE Bristol(布里斯托尔大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 LikePhys通过似然偏好评估视频扩散模型的直观物理理解,展示其与人类偏好一致,优于现有基线,并揭示模型设计和推理设置对物理理解的影响。

Comments 23 pages, 9 figures, Project Page: https://yuanjianhao508.github.io/LikePhys/

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18663 2026-03-09 cs.CV 79%

DVD-Quant: Data-free Video Diffusion Transformers Quantization

DVD-Quant: 数据无依赖的视频扩散变换器量化

Zhiteng Li, Hanxuan Li, Junyi Wu, Kai Liu, Haotong Qin, Linghe Kong, Guihai Chen, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 DVD-Quant通过无数据量化框架实现视频DiT模型的高效量化,提升运行速度并保持视觉质量。

Comments Code and models will be available at https://github.com/lhxcs/DVD-Quant

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07177 2026-03-04 cs.CV cs.AI 79%

Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models

帧引导:基于帧级信号的无训练引导用于视频扩散模型的可控生成

Sangwon Jang, Taekyung Ki, Jaehyeong Jo, Jaehong Yoon, Soo Ye Kim, Zhe Lin, Sung Ju Hwang

机构 * KAIST(韩国国立科学技术院) NTU Singapore(南洋理工大学) Adobe Research(Adobe研究)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 帧引导通过帧级信号实现无训练的视频生成控制,支持多种任务如关键帧引导、风格化和循环,无需训练即可生成高质量视频。

Comments ICLR 2026. Project page: https://frame-guidance-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20123 2026-03-03 cs.CV 79%

UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers

UltraViCo: 突破视频扩散变换器的 extrapolation 限制

Min Zhao, Hongzhou Zhu, Yingze Wang, Bokai Yan, Jintao Zhang, Guande He, Ling Yang, Chongxuan Li, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, THU-Bosch ML Center, Tsinghua University(清华大学计算机科学与技术系,BNRist中心,THU-Bosch机器学习中心,清华大学) ShengShu(盛书) Gaoling School of Artificial Intelligence, Renmin University of China(北京理工大学人工智能学院,中国人民大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Princeton University(普林斯顿大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 UltraViCo通过抑制超出训练窗口的token注意力,突破视频扩散变换器的extrapolation限制,提升泛化能力和性能。

Comments ICLR2026. Project page: https://thu-ml.github.io/UltraViCo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20583 2026-02-25 cs.CV 79%

PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Models

PropFly: 通过预训练视频扩散模型的实时监督学习进行传播

Wonyong Seo, Jaeho Moon, Jaehyup Lee, Soo Ye Kim, Munchurl Kim

机构 * KAIST(韩国科学技术院) Kyungpook National University(庆北国立大学) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 PropFly通过预训练视频扩散模型的实时监督学习,实现基于传播的视频编辑,无需配对数据集,提升编辑质量和一致性。

Comments The first two authors contributed equally to this work (equal contribution)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07399 2026-02-24 cs.CV cs.LG 79%

StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation

StreamDiffusionV2:动态交互视频生成的流式系统

Tianrui Feng, Zhi Li, Shuo Yang, Haocheng Xi, Muyang Li, Xiuyu Li, Lvmin Zhang, Keting Yang, Kelly Peng, Song Han, Maneesh Agrawala, Kurt Keutzer, Akio Kodaira, Chenfeng Xu

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 StreamDiffusionV2通过无训练管道和系统级优化,实现了低延迟、高效率的实时视频生成,支持灵活的去噪步骤和多GPU扩展,推动生成直播的实用化和普及。

Comments Accepted by MLSys 2026. Project Page: http://streamdiffusionv2.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14381 2026-02-17 cs.CV cs.AI 79%

Adapting VACE for Real-Time Autoregressive Video Diffusion

为实时自回归视频扩散适应VACE

Ryan Fosdick

机构 * Daydream

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 VACE被适配用于实时自回归视频生成,通过调整参考帧路径以兼容因果注意力,保留固定分块大小和KV缓存,同时增加20-30%的延迟开销,但显存成本低,参考到视频的保真度下降。

Comments 10 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16081 2026-02-11 cs.CV cs.CL 79%

Survey of Video Diffusion Models: Foundations, Implementations, and Applications

视频扩散模型综述:基础、实现与应用

Yimu Wang, Xuye Liu, Wei Pang, Li Ma, Shuai Yuan, Paul Debevec, Ning Yu

机构 * University of Waterloo(滑铁卢大学) Netflix Eyeline Studios Duke University(杜克大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文综述视频扩散模型的基础、实现与应用,系统梳理了当前方法学体系,分析架构创新与优化策略,并探讨其在视频生成中的实际应用及与其他领域的协同作用。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21896 2026-02-05 cs.CV 79%

Past- and Future-Informed KV Cache Policy with Salience Estimation in Autoregressive Video Diffusion

具有显著性估计的过去和未来信息KV缓存策略在自回归视频扩散中

Hanmo Chen, Chenghao Xu, Xu Yang, Xuan Chen, Cheng Deng

机构 * Hangzhou Institute of Technology, Xidian University, Hangzhou, China(杭州理工大学,西安电子科技大学,中国杭州) Xidian University, Xi'an, China(西安电子科技大学,中国西安) Hohai University, Nanjing, China(河海大学,中国南京)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出PaFu-KV策略,通过显著性估计优化KV缓存,提升视频生成的质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04220 2026-02-05 cs.CV 79%

Adaptive 1D Video Diffusion Autoencoder

自适应一维视频扩散自编码器

Yao Teng, Minxuan Lin, Xian Liu, Shuai Wang, Xiao Yang, Xihui Liu

机构 * The University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司) CUHK(香港中文大学) Nanjing University(南京大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出了一种自适应一维视频扩散自编码器,通过改进的编码和解码机制实现更高效的视频压缩与重建。

详情

展开后加载摘要…

URL PDF HTML 收藏