arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-22 至 2026-04-22 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 4 篇

2604.19736 2026-04-22 cs.CV 79%

Generative Drifting for Conditional Medical Image Generation

生成漂移用于条件医学图像生成

Zirong Li, Siyuan Mei, Weiwen Wu, Andreas Maier, Lina Gölz, Yan Xia

机构 * Department of Orthodontics and Orofacial Orthopedics, Friedrich-Alexander-University Erlangen-Nuremberg(口腔正畸与面部骨科系,弗里德里希-艾萨克-埃尔兰-纽伦堡大学) Department Artificial Intelligence in Biomedical Engineering, Friedrich-Alexander-University Erlangen-Nuremberg(生物医学工程人工智能系,弗里德里希-艾萨克-埃尔兰-纽伦堡大学) Pattern Recognition Lab, Friedrich-Alexander-University Erlangen-Nuremberg(模式识别实验室,弗里德里希-艾萨克-埃尔兰-纽伦堡大学) Department of Biomedical Engineering, Sun-Yat-sen University(生物医学工程系,孙中山大学)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出GDM框架,通过多目标学习提升3D医学图像生成的分布合理性与患者特异性保真度,同时保持单步推理效率,在MRI到CT合成和稀疏视图CT重建中优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14630 2026-04-22 cs.CV 70%

Adapting Self-Supervised Representations as a Latent Space for Efficient Generation

将自监督表示适配为潜在空间以实现高效生成

Ming Gui, Johannes Schusterbauer, Timy Phan, Felix Krause, Josh Susskind, Miguel Angel Bautista, Björn Ommer

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Apple(苹果公司)

专题命中 效率与蒸馏 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出RepTok框架,通过自监督视觉Transformer生成单连续潜在token实现图像生成,通过微调语义token嵌入和生成解码器,提升重建精度并减少训练成本。

Comments ICLR 2026, Code: https://github.com/CompVis/RepTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19009 2026-04-22 cs.LG cs.CV 57%

Guiding Distribution Matching Distillation with Gradient-Based Reinforcement Learning

通过基于梯度的强化学习引导分布匹配蒸馏

Linwei Dong, Ruoyu Guo, Ge Bai, Zehuan Yuan, Yawei Luo, Changqing Zou

机构 * Zhejiang University(浙江大学) Bytedance Inc.(字节跳动公司) Zhejiang Lab(浙江实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GDMD框架,通过优先考虑蒸馏梯度而非原始像素输出来优化奖励机制,提升了少步生成的质量与稳定性,实验证明其在生成质量与人类偏好指标上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19730 2026-04-22 cs.LG cs.AI 50%

FASTER: Value-Guided Sampling for Fast RL

FASTER:基于价值引导的快速强化学习采样

Perry Dong, Alexander Swerdlow, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 FASTER通过建模去噪过程中的动作候选过滤作为马尔可夫决策过程,提升采样测试时间缩放的效率,减少计算成本并提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏