arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-21 至 2026-05-21 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2605.21195 2026-05-21 cs.CV 88%

RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution

RankE: 用于离散文本到图像生成的端到端后训练方法 with Decoder Co-Evolution

Siyong Jian, Siyuan Li, Luyuan Zhang, Zedong Wang, Xin Jin, Ying Li, Cheng Tan, Huan Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出RankE,一种端到端的后训练框架,通过解码器与策略的协同进化,解决离散自回归文本到图像生成中策略优化导致的潜在协变量偏移问题,同时提升图像质量和对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20808 2026-05-21 cs.CV 85%

Spatial Gram Alignment for Ultra-High-Resolution Image Synthesis

基于超高清图像合成的空间图对齐

Jinjin Zhang, Xiefan Guo, Di Huang

机构 * Beihang University(北航大学)

专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出空间图对齐(SGA)方法,通过利用视觉基础模型的表示先验,保留LDMs的生成能力,解决超高清图像合成中生成质量与结构完整性之间的冲突,实现高质量的文本到图像合成。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21272 2026-05-21 cs.CV cs.AI 83%

MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset

MONET:一个大规模、开放、非冗余且增强的文本到图像数据集

Benjamin Aubin, Gonzalo Iñaki Quintana, Onur Tasar, Sanjeev Sreetharan, Urszula Czerwinska, Damien Henry, Clément Chadebec

机构 * Jasper Research(Jasper研究)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MONET数据集,通过多阶段过滤和增强,提供高质量的文本到图像数据,以降低大规模可重复研究的门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21090 2026-05-21 cs.CV 81%

TextSculptor: Training and Benchmarking Scene Text Editing

TextSculptor: 训练和评估场景文本编辑

Yiheng Lin, Siyu Jiao, Xiaohan Lan, Wei Zhou, Qi She, Fei Yu, Heyun Chen, Zhengwei Wang, Jinghuan Chen, Moran Li, Yingchen Yu, Zijian Feng, Yao Zhao, Yunchao Wei, Yujie Zhong

机构 * Beijing Jiaotong University(北京交通大学) Bytedance(字节跳动)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract);image synthesis(abstract)

AI总结 本文提出TextSculptor框架,通过构建大规模数据集和基准测试,解决场景文本编辑中高质量训练数据稀缺和缺乏标准化评估的问题,提升开源模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏