arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-14 至 2026-07-14 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 6 篇

2509.01624 2026-07-14 cs.CV cs.AI 83%

Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling

Q-Sched: 推动少步扩散模型的边界,通过量化感知调度

Natalia Frumkin, Diana Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Q-Sched通过量化感知调度器改进少步扩散模型,实现模型大小减少4倍并提升生成质量

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16514 2026-07-14 cs.CV cs.LG 版本更新 79%

BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation

BARD:通过高效渐进性块合并和分阶段蒸馏桥接自回归与扩散视觉-语言模型

Baoyou Chen, Hanchen Xia, Peng Tu, Haojun Shi, Liwei Zhang, Yuxuan Yao, Weihao Yuan, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 BARD通过高效渐进块合并与分阶段蒸馏将预训练自回归视觉-语言模型转换为解码高效的扩散视觉-语言模型,实现在大块规模下性能恢复与解码效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05737 2026-07-14 cs.CV cs.AI cs.LG cs.RO 版本更新 57%

Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models

让它简单:视觉-语言-动作模型的单步动作生成

Yitong Chen, Shiduo Zhang, Jingjing Gong, Xipeng Qiu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 针对视觉-语言-动作(VLA)模型,提出通过偏置训练时间分布至高频噪声状态,实现无需教师模型、蒸馏或辅助目标的单步动作生成,性能可匹配十步解码。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09892 2026-07-14 eess.IV cs.AI 新提交 50%

Next-Dense-Stride Prediction for Multimodal Autoregressive Visual Modeling

用于多模态自回归视觉建模的下密集步长预测

Chicago Y. Park, Jialin Mao, Xiaojian Xu, Taha Kass-Hout, Ulugbek S. Kamilov, Cao Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) GE HealthCare(通用电气医疗)

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 研究提出DenseAR范式,将自回归图像生成重构成下密集步长预测,解决现有模型局限。基于此扩展为统一模型处理多模态和成像任务,在医学和自然图像验证,在多对比脑MRI及ImageNet上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19812 2026-07-14 physics.chem-ph 版本更新 50%

An efficient method based on the evolutionary center algorithm for optimizing chemical-diffusive models for flame acceleration and DDT

基于进化中心算法的高效方法用于优化火焰加速和DDT的化学扩散模型

Huahua Xiao, Xu Zhang, Mingbin Zhao, Congling Shi

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出基于进化中心算法(ECA)和Nelder-Mead算法的混合方法,用于高效优化化学扩散模型参数,以准确模拟火焰加速和DDT现象,并验证其在氢气混合物中的燃烧波特性。

Comments Manuscript with 13 figures, 7 tables, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10320 2026-07-14 math.PR 版本更新 50%

Lévy Langevin Monte Carlo for sampling from heavy-tailed target distributions

用于从重尾目标分布中采样的Lévy朗之万蒙特卡罗方法

Anita Behme, Claudius Lütke Schwienhorst

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究如何从重尾目标分布采样,扩展Lévy朗之万蒙特卡罗方法,利用由复合泊松过程驱动的随机微分方程,可从非光滑目标和分离模式分布中采样,指数收敛到不变分布,且因复合泊松噪声项易于实现。

Comments 29 pages, 8 figures

Journal ref Extremes (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏