arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-29 至 2026-04-29 共收录 2 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2604.25314 2026-04-29 cs.CV 88%

Golden RPG: Confidence-Adaptive Region-Aware Noise for Compositional Text-to-Image Generation

黄金RPG:置信度自适应的区域感知噪声用于组合文本到图像生成

Hao Li

机构 * Department of Electrical and Computer Engineering, University of Arizona(亚利桑那大学电气与计算机工程系)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出Golden RPG,通过区域感知噪声预测和置信度自适应融合提升多区域文本到图像生成的区域一致性,优于现有基线方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25636 2026-04-29 cs.CV 57%

Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models

通过再生进行细化:扩大修改空间提升统一多模态模型中的图像细化

Jiayi Guo, Linqing Wang, Jiangshan Wang, Yang Yue, Zeyu Liu, Zhiyuan Zhao, Qinglin Lu, Gao Huang, Chunyu Wang

机构 * Tsinghua University(清华大学) Tencent HY(腾讯HY)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过再生进行细化的新框架,通过扩大修改空间提升统一多模态模型的图像细化效果,实验表明在多个基准测试中性能显著提升。

Comments GitHub: https://github.com/LeapLabTHU/RvR

详情

展开后加载摘要…

URL PDF HTML 收藏