arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-17 至 2026-08-17 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2608.14226 2026-08-17 cs.CV 新提交 87%

RankT2I: A Submodular Framework for Discovering Interpretable and Diverse Semantics in Text-to-Image Models

RankT2I:一种用于发现文本到图像模型中可解释且多样化语义的子模框架

Ritika Allada, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);image editing(abstract)

AI总结 本文提出无训练、模型无关的RankT2I框架,通过子模方法自动发现T2I模型的可编辑语义,性能优于现有方法,可高效获取多领域文本到图像编辑所需的多样化语义。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19196 2026-08-17 cs.CV 版本更新 83%

CoCA: Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning

CoCA:基于强化学习的文本到图像(T2I)扩散模型微调中的免费步骤级奖励

Xinyao Liao, Wei Wei, Xiaoye Qu, Qiyuan He, Angela Yao, Yu Cheng

机构 * Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对RL驱动T2I扩散模型微调的奖励稀疏问题,提出CoCA信用分配框架,通过余弦相似度变化分配密集奖励,提升样本效率与泛化性且不损害原最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15740 2026-08-17 cs.CV cs.AI cs.LG cs.MM 版本更新 81%

Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

通过隐式文化对齐奖励建模消除文本到图像评估中的偏差

Bo-An Chang, Yu-Chih Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV、cs.MM

AI总结 研究文本到图像评估中文化真实性问题,提出基于轻量级多模态大语言模型构建的隐式文化对齐奖励模型,集成隐式文化探测器与跳跃连接交叉注意力机制,实验证明该模型准确率高、速度快,能为偏好优化管道提供有效信号。

Comments 16 pages, 2 figures, ECCV 2026 Workshop FAILED

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13671 2026-08-17 cs.CV 新提交 57%

PROVE: Training-Free Prompt Recovery using Verifiable Evidence

PROVE:基于可验证证据的无训练提示词恢复

Rupayan Mallick, Mahsa Khoshnoodi, Sarah Adel Bargal

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 该研究提出无训练的黑盒提示词反转攻击PROVE,通过可验证场景描述重建提示词,在多数据集上优于基线方法,可用于版权保护相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏