arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-29 至 2026-05-29 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 6 篇

2601.05149 2026-05-29 cs.CV 83%

Multi-Scale Local Speculative Decoding for Image Generation

多尺度局部推测解码用于图像生成

Elia Peruzzo, Guillaume Sautière, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 效率与蒸馏 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出多尺度局部推测解码(MuLo-SD)框架,通过低分辨率草稿模型与高分辨率目标模型结合、局部拒绝与重采样机制,加速自回归图像生成,实现高达5倍加速并保持语义对齐和感知质量。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29398 2026-05-29 cs.LG cs.AI 78%

GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models

GDSD:强化学习作为扩散语言模型的引导去噪器自蒸馏

Xiaohang Tang, Keyue Jiang, Che Liu, Qifang Zhao, Xiaoxiao Xu, Sangwoong Yoon, Ilija Bogunovic

机构 * UCL Dept. of Statistical Science(伦敦大学学院统计科学系) UCL Centre for AI(伦敦大学学院人工智能中心) Alibaba Group(阿里巴巴集团) Dept. of EEE(电子工程系) Imperial College London(伦敦帝国理工学院) UNIST(全南大学) University of Basel(巴塞尔大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 提出引导去噪器自蒸馏(GDSD)方法,通过从逆KL正则化强化学习的闭式最优解中导出的优势引导自教师直接蒸馏扩散语言模型的去噪器,避免了ELBO似然代理带来的训练-推理不匹配偏差,在规划、数学和代码基准上显著优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09574 2026-05-29 cs.CV cs.AI cs.CL 77%

MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models

MENTOR: 面向自回归视觉生成模型的高效多模态条件微调

Haozhe Zhao, Zefan Cai, Shuzheng Si, Liang Chen, Jiuxiang Gu, Wen Xiao, Minjia Zhang, Junjie Hu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学) Peking University(北京大学) Microsoft(微软公司)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出MENTOR框架,通过两阶段训练范式实现自回归图像生成器与多模态输入的细粒度token级对齐,无需辅助适配器或交叉注意力模块,在DreamBench++上取得优异性能。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29033 2026-05-29 cs.LG 50%

Moment Matching Q-Learning

矩匹配Q学习

Yiyan, Liang, Sifei Liu, Weitong Zhang

机构 * School of Data and Information Science, University of North Carolina at Chapel Hill, Chapel Hill, USA(数据与信息科学学院,北卡罗来纳大学教堂山分校,教堂山,美国)

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 提出矩匹配Q学习(MoMa QL)框架,利用最大均值差异(MMD)匹配原始分布与目标分布的所有阶统计量,实现条件得分函数的分布级收敛,在D4RL任务中计算效率高且性能相当,并在离线到在线强化学习中通过加速流策略的动作采样展现更优的适应性和性能。

Comments 23 pages, 14 figures, 10 tables, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22347 2026-05-29 cs.LG cs.AI 50%

Pushing the Limits of Block Rotations in Post-Training Quantization

推动后训练量化中块旋转的极限

Sai Sanjeet, Ian Colbert, Pablo Monteagudo-Lago, Giuseppe Franco, Yaman Umuroglu, Nicholas J. Fraser

机构 * Advanced Micro Devices, Inc. (AMD)(Advanced Micro Devices公司) State University of New York at Buffalo(纽约州立大学布法罗分校) Norwegian University of Science(挪威科学与技术大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出PeRQ框架,通过置换和旋转重新分布激活值,以克服块旋转在抑制异常值时的几何限制,显著提升后训练量化精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10020 2026-05-29 stat.ML cs.LG q-bio.BM 50%

Calibrating Generative Models to Distributional Constraints

生成模型的分布约束校准

Henry D. Smith, Nathaniel L. Diamant, Brian L. Trippe

机构 * Stanford University, Palo Alto, CA USA(斯坦福大学)

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 针对生成模型采样分布统计量偏离期望的校准问题,提出将校准形式化为受约束优化问题,并通过松弛损失和奖励损失两种替代目标进行微调,在蛋白质设计、图像生成和语言建模等应用中显著降低了数百个同时约束下的校准误差。

Comments To appear at the International Conference on Machine Learning (ICML), 2026. Codebase accompanying the paper is available at: https://github.com/smithhenryd/cgm

详情

展开后加载摘要…

URL PDF HTML 收藏