arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-23 至 2026-04-23 共收录 2 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2604.12652 2026-04-23 cs.CV cs.AI 79%

PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning

PromptEcho:基于视觉语言模型的无标注奖励用于文本到图像强化学习

Jinlong Liu, Wanggui He, Peng Zhang, Mushui Liu, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 PromptEcho通过冻结的视觉语言模型计算token级交叉熵损失,无需标注或训练奖励模型,提升文本到图像模型的提示跟随能力,实验显示在多个基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19976 2026-04-23 cs.CV 57%

Lucky High Dynamic Range Smartphone Imaging

幸运高动态范围智能手机成像

Baiang Li, Ruyu Yan, Ethan Tseng, Zhoutong Zhang, Adam Finkelstein, Jiawen Chen, Felix Heide

机构 * Princeton University(普林斯顿大学) Adobe(Adobe公司)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种基于轻量级网络的智能手机成像方法,通过线性RAW像素间接捕捉高动态范围,避免幻觉伪影,验证了其在合成和真实图像上的泛化能力。

Comments 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏