arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2537 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2537 篇

2605.23445 2026-05-25 cs.CV 57%

DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation

DFSAttn:面向高效视频生成的动态细粒度稀疏注意力

Jie Hu, Zixiang Gao, Yutong He, Kun Yuan

机构 * Peking University(北京大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散变换器中注意力二次复杂度导致计算成本高的问题,提出一种无需训练的稀疏注意力框架DFSAttn,通过希尔伯特曲线重排序、分层块评分和稀疏掩码缓存实现动态细粒度稀疏化,在保持生成质量的同时实现高达2.1倍端到端加速。

Comments ICML 2026; 17 pages, 8 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22718 2026-05-22 cs.CV 57%

WorldKV: Efficient World Memory with World Retrieval and Compression

WorldKV: 通过世界检索和压缩实现高效的world内存

Jung Yi, Minjae Kim, Paul Hyunbin Cho, Wooseok Jang, Sangdoo Yun, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Naver AI Lab(Naver人工智能实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldKV,一种无需训练的框架,通过世界检索和压缩技术,在保持一致性的同时提高效率,实现在Matrix-Game-2.0和LingBot-World-Fast数据集上达到或超越全KV内存保真的性能。

Comments Project Page: https://cvlab-kaist.github.io/WorldKV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21042 2026-05-21 cs.CV 57%

Dynamic Video Generation: Shaping Video Generation Across Time and Space

动态视频生成:跨时间和空间的视频生成塑造

Shikang Zheng, Jingkai Huang, Jiacheng Liu, Guantao Chen, Lixuan, Yuqi Lin, Peiliang Cai, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DVG框架,通过在时间和空间上联合分配计算,自动选择内容感知的加速策略,实现近无损加速,展示了在视频生成中的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20476 2026-05-21 cs.CV 57%

Goodbye Drift: Anchored Tree Sampling for Long-Horizon Video-to-Video Generation

告别漂移:用于长时视频到视频生成的锚定树采样

Matthew Bendel, Stephen W. Bailey, Mithilesh Vaidya, Sumukh Badam, Xingzhe He

机构 * Descript, Inc.(Descript公司)

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV

AI总结 本文提出了一种名为锚定树采样的方法,通过减少关键路径步骤来解决长时视频生成中的漂移问题,并在静态相机模式下实现了稳定且高质量的视频生成。

Comments 30 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03139 2026-05-20 cs.CV 57%

Diversity-Preserved Distribution Matching Distillation for Fast Visual Synthesis

保留多样性的分布匹配蒸馏用于快速视觉合成

Tianhe Wu, Ruibin Li, Lei Zhang, Kede Ma

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种保留多样性的分布匹配蒸馏(DP-DMD)方法,通过分离角色的蒸馏策略,在少量步骤中保持样本多样性并维持竞争性的视觉质量,为其他DMD变体提供了一种简单且稳定的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17726 2026-05-20 cs.CV cs.AI 57%

Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM

Slot-MLLM: 多模态大语言模型中的面向对象视觉标记化

Donghwan Chi, Hyomin Kim, Yoonjin Oh, Yongjin Kim, Donghoon Lee, Daejin Jo, Jongmin Kim, Junyeob Baek, Sungjin Ahn, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kakao Corp(Kakao公司) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种面向对象的视觉标记化方法Slot-MLLM,通过基于Slot Attention的标记器,有效编码局部视觉细节并保持高层语义,从而提升多模态大语言模型在视觉内容理解和生成中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18052 2026-05-19 cs.CV 57%

Efficient 3D Content Reconstruction and Generation

高效3D内容重建与生成

Jiahao Li

机构 * TOYOTA TECHNOLOGICAL INSTITUTE AT CHICAGO(丰田技术研究所芝加哥分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种高效的3D内容生成和重建方法,通过结合多视图扩散和稀疏视图3D重建,实现了高质量的3D资产生成,并开发了FastMap算法以提高3D重建的速度和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17365 2026-05-19 cs.CV 57%

Memory-Augmented Query Intent Understanding for Efficient Chat-based Image Retrieval

基于记忆的查询意图理解用于高效的基于聊天的图像检索

Xianke Chen, Daizong Liu, Yushuo Lou, Xin Tan, Xun Yang, Shuhui Wang, Xun Wang, Jianfeng Dong

机构 * School of Computer Science and Technology, and the School of Statistics and Mathematics, Zhejiang Gongshang University(计算机科学与技术学院,和统计与数学学院,浙江工商大学) School of Computer Science and Technology, Zhejiang Gongshang University, and the Zhejiang Key Laboratory of Big Data and Future E-Commerce Technology(计算机科学与技术学院,浙江工商大学,和大数据与未来电子商务技术浙江省重点实验室) Wangxuan Institute of Computer Technology, Peking University(王璇计算机技术研究所,北京大学) School of Information and Electronic Engineering, Zhejiang Gongshang University(信息与电子工程学院,浙江工商大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,华东师范大学) Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences , Institute of Computing Technology, CAS(中国科学院智能信息处理重点实验室,计算技术研究所,中国科学院) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种高效的基于聊天的图像检索任务中的记忆增强查询意图理解框架MAQIU,通过动态聚合和演化查询意图的语义表示,防止意图遗忘并增强长期语义完整性,从而在保持高计算效率的同时实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16649 2026-05-19 cs.CV 57%

AtlasVid: Efficient Ultra-High-Resolution Long Video Generation via Decoupled Global-Local Modeling

AtlasVid: 通过解耦的全局-局部建模实现高效超高清长视频生成

Ziyang Mai, Yuyao Zhang, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AtlasVid框架,通过解耦建模提升超高清长视频生成效率,实现60.9倍加速和更低训练成本,优于原生4K生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13108 2026-05-18 cs.CV 57%

DGS-Net: Distillation-Guided Gradient Surgery for CLIP Fine-Tuning in AI-Generated Image Detection

DGS-Net:基于知识蒸馏的梯度手术用于AI生成图像检测中的CLIP微调

Jiazhen Yan, Ziqiang Li, Fan Wang, Boyu Wang, Ziwen He, Zhangjie Fu

机构 * School of Computer Science, Nanjing University of Information Science(南京信息工程大学计算机学院) University of Macau(澳门大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DGS-Net,通过梯度空间分解分离有害和有益的下降方向,提升CLIP在AI生成图像检测中的微调效果,实验表明其在检测性能和泛化能力上优于现有方法。

Comments Accepted by ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23352 2026-05-18 cs.CV cs.AI 57%

Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling

动态树RPO:通过结构化采样打破独立轨迹瓶颈

Xiaolong Fu, Lichen Ma, Zipeng Guo, ShiPing Dong, Lan Yang, Tan Lit Sin, Gaojing Zhou, Yu He, Jingling Fu, Shizhe Zhou, Junshi Huang, Jason Li

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Beijing University of Chemical Technology(北京化工大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出动态树RPO,通过树状结构采样策略和动态噪声强度,提升文本到图像生成的质量与效率,同时结合层调优强化学习方法,在多个基准测试中表现出色。

Comments Fig.3 updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15492 2026-05-18 cs.RO cs.CV 57%

FLASH: Efficient Visuomotor Policy via Sparse Sampling

FLASH:通过稀疏采样实现高效的视觉-运动策略

Jiaqi Bai, Jindou Jia, Yuxuan Hu, Gen Li, Xiangyu Chen, Tuo An, Kuangji Zuo, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University, Singapore(马尔萨实验室,南洋理工大学,新加坡)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FLASH通过稀疏采样和Legendre多项式轨迹表示,提升视觉-运动策略学习效率,实现更长的动作时间跨度和更快的推理速度,实验表明其在多个任务中达到最先进的性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17588 2026-05-15 cs.CV 57%

HERO: Hierarchical Extrapolation and Refresh for Efficient World Models

HERO:高效世界模型的分层外推与刷新

Quanjian Song, Xinyu Wang, Donghao Zhou, Jingyu Lin, Cunjian Chen, Yue Ma

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 HERO通过分层策略提升世界模型推理效率,采用补丁刷新和线性外推技术,在保持质量的同时实现1.73倍加速。

Comments 12 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22394 2026-05-15 cs.CV 57%

PacTure: Efficient PBR Texture Generation on Packed Views with Visual Autoregressive Models

PacTure:基于打包视角的高效PBR纹理生成方法

Fan Fei, Jiajun Tang, Fei-Peng Tian, Boxin Shi, Ping Tan

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(视觉技术国家工程研究中心,计算机学院,北京大学) The Hong Kong University of Science and Technology(香港科技大学) Light Illusions PKU-AI 2 Robotics Joint Lab of Embodied AI(北京大学人工智能2机器人联合实验室)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 PacTure通过引入视角打包技术,提升多视角生成的效率与一致性,结合自回归模型实现高效PBR纹理生成。

Comments Accepted by Computational Visual Media Journal (CVMJ) in Feb. 2026. 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13457 2026-05-14 cs.CV 57%

OP4KSR: One-Step Patch-Free 4K Super-Resolution with Periodic Artifact Suppression

OP4KSR:一种一步式无补丁4K超分辨率方法,具有周期性伪影抑制

Chengyan Deng, Pengbin Yu, Zhentao Chen, Wei Shen, Kai Zhang, Meng Li, Lunxi Yuan, Xue Zhou, Li Yu

机构 * School of Automation Engineering, University of Electronic Science and Technology of China(电子科技大学自动化工程学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 OP4KSR提出一种基于Flux架构的一步式4K超分辨率方法,利用F16 VAE压缩降低内存消耗,同时通过RoPE基频重缩放和周期性损失抑制伪影,实现高效且高质量的4K超分辨率生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13858 2026-05-14 cs.CV 57%

EDITS: Enhancing Dataset Distillation with Implicit Textual Semantics

EDITS: 通过隐式文本语义增强数据集蒸馏

Qianxin Xia, Jiawei Du, Guoming Lu, Zhiyong Shu, Jielei Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Centre for Frontier AI Research, Agency for Science, Technology and Research(前沿人工智能研究中心,科技研究局)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出EDITS框架,利用图像数据中的隐式文本语义提升数据集蒸馏效果,通过全局语义查询模块融合外部文本与图像特征,结合局部语义意识选择代表性样本构建图像和文本原型,最终通过双原型引导策略生成合成数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09003 2026-05-13 cs.CV 57%

FlashClear: Ultra-Fast Image Content Removal via Efficient Step Distillation and Feature Caching

FlashClear: 通过高效的步骤蒸馏和特征缓存实现超快图像内容移除

Yixin Tang, Jiawei Guo, Junxian Li, Zhiteng Li, Jixin Zhao, Bingya Zhang, Chenbo Wang, Yulun Zhang, Shangchen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Honor Device Co., Ltd(荣耀设备有限公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FlashClear,通过区域感知对抗蒸馏和前景优先的注意力与缓存策略,实现高效内容移除,实验表明其在保持性能的同时显著提升速度,达到8.26倍和122倍的加速。

Comments Code: https://github.com/GuoCalix/FlashClear

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09442 2026-05-12 cs.CV cs.AI 57%

SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation

SWIFT: 用于高效交互长视频生成的提示自适应内存

Shanwen Tan, Hao Li, Jingtao Zhang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 SWIFT提出一种无需训练的多提示长视频生成框架,通过轻量级语义注入缓存和自适应动态窗口实现高效语义切换,保持时间一致性,达到22.6 FPS的高效生成速度。

Comments Code is available at https://github.com/ShanwenTan/SWIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09302 2026-05-12 cs.LG cs.CV 57%

Discrete Langevin-Inspired Posterior Sampling

离散 Langevin 激发后验采样

Chaitanya Amballa, Sattwik Basu, Jorge Vančo Sampedro, Romit Roy Choudhury

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出离散 Langevin 激发后验采样方法,用于在离散状态空间中解决逆问题,通过梯度信息指导离散移动,实现高效的并行更新,适用于多种逆问题场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09071 2026-05-12 cs.CV 57%

Probability-Flow Distillation: Exact Wasserstein Gradient Flow for High-Fidelity 3D Generation

概率流蒸馏:用于高保真3D生成的精确Wasserstein梯度流

Rohith Ramanan, A. N. Rajagopalan

机构 * Department of Physics(物理系) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Department of Electrical Engineering(电气工程系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出概率流蒸馏,通过精确Wasserstein梯度流解决SDI的模式崩溃问题,实现高保真3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06357 2026-05-08 cs.LG cs.AI cs.CV 57%

Memory Efficient Full-gradient Attacks (MEFA) Framework for Adversarial Defense Evaluations

内存高效的全梯度攻击(MEFA)框架用于对抗性防御评估

Yuan Du, Mitchel Hill, HanQin Cai

机构 * InnoPeak Technology(InnoPeak技术公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MEFA框架,通过梯度检查点技术实现长净化轨迹的精确端到端梯度计算,提升对抗性防御评估的准确性,揭示了近似梯度评估的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15689 2026-05-08 cs.CV 57%

DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization

DOLLAR: 通过蒸馏和潜在奖励优化实现少步视频生成

Zihan Ding, Chi Jin, Difan Liu, Haitian Zheng, Krishna Kumar Singh, Qiang Zhang, Yan Kang, Zhe Lin, Yuchen Liu

机构 * Princeton University(普林斯顿大学) Adobe Research(Adobe研究)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出结合变分分数蒸馏和一致性蒸馏的方法,实现高质量且多样化的少步视频生成,并通过潜在奖励模型微调提升生成性能,实现高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28126 2026-05-01 cs.CV cs.AI 57%

AdvDMD: Adversarial Reward Meets DMD For High-Quality Few-Step Generation

AdvDMD:对抗性奖励与DMD结合实现高质量少步生成

Xu Wang, Zexian Li, Litong Gong, Tiezheng Ge, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Alimama Tech(阿里巴巴技术)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AdvDMD方法,结合DMD蒸馏与强化学习,通过对抗训练的判别器作为奖励模型,提升少步生成质量并稳定训练过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20549 2026-05-01 cs.LG cs.CV stat.ME 57%

Sample-efficient evidence estimation of score based priors for model selection

基于扩散先验的模型选择中高效证据估计

Frederic Wang, Katherine L. Bouman

机构 * Department of Computing and Mathematical Sciences(计算与数学科学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DiME方法,通过整合后验采样方法的时间边际,利用逆扩散采样过程中的大量中间样本,高效估计扩散先验的模型证据,用于模型选择和先验误拟诊断。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10103 2026-04-29 cs.CV 57%

Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation

通过混合注意力与解耦蒸馏实现长时域流式视频生成

Ruibin Li, Tao Yang, Fangzhou Ai, Tianhe Wu, Shilei Wen, Bingyue Peng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动) City University of Hong Kong(香港城市大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出混合强制方法,通过混合注意力设计联合优化时序信息保留与计算效率,采用轻量线性时序注意力和块稀疏注意力,实现高效稳定流式视频生成,实测在单块H100 GPU上达到29.5 FPS的实时832x480视频生成

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24586 2026-04-28 cs.CV 57%

Point-MF: One-step Point Cloud Generation from a Single Image via Mean Flows

点-流:通过均流实现单图像点云生成

Yuta Baba, Keiji Yanai

机构 * The University of Electro-Communications(电子通信大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Point-MF框架,通过均流与辅助损失实现单图像点云重建,以单次网络调用完成高精度重建,提升效率与质量。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20289 2026-04-23 cs.CV 57%

X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference

X-Cache:跨块块缓存用于少步自回归世界模型推理

Yixiao Zeng, Jianlei Zheng, Chaoda Zheng, Shijia Chen, Mingdian Liu, Tongping Liu, Tengwei Luo, Yu Zhang, Boyang Wang, Linkun Xu, Siyuan Lu, Bo Tian, Xianming Liu

机构 * AI Infra Team, XPeng Inc.(AI基础设施团队,小鹏汽车)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出X-Cache,一种无需训练的加速方法,通过跨连续生成块缓存而非去噪步骤来提升少步自回归世界模型的推理效率,实现71%的块跳过率和2.6倍的速度提升,同时保持最小的性能下降。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15451 2026-04-23 cs.CV 57%

Weak-to-Strong Knowledge Distillation Accelerates Visual Learning

弱到强知识蒸馏加速视觉学习

Baiang Li, Wenhao Chai, Felix Heide

机构 * Princeton University(普林斯顿大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种通用知识蒸馏方法,通过冻结弱教师模型并在早期训练中应用蒸馏,加速强学生模型训练,实验表明在ImageNet和CIFAR分类中提升训练效率达4.8倍。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19009 2026-04-22 cs.LG cs.CV 57%

Guiding Distribution Matching Distillation with Gradient-Based Reinforcement Learning

通过基于梯度的强化学习引导分布匹配蒸馏

Linwei Dong, Ruoyu Guo, Ge Bai, Zehuan Yuan, Yawei Luo, Changqing Zou

机构 * Zhejiang University(浙江大学) Bytedance Inc.(字节跳动公司) Zhejiang Lab(浙江实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GDMD框架,通过优先考虑蒸馏梯度而非原始像素输出来优化奖励机制,提升了少步生成的质量与稳定性,实验证明其在生成质量与人类偏好指标上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17397 2026-04-21 cs.CV cs.AI 57%

Speculative Decoding for Autoregressive Video Generation

推测解码用于自回归视频生成

Yuezhou Hu, Jintao Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文探讨了推测解码在自回归视频生成中的应用,通过引入SDVG框架,利用图像质量路由替代token验证,实现高效视频生成,同时保持高质量并提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏