arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-21 至 2026-04-21 共收录 9 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 9 篇

2604.18167 2026-04-21 cs.CV 87%

Embedding Arithmetic: A Lightweight, Tuning-Free Framework for Post-hoc Bias Mitigation in Text-to-Image Models

嵌入算术:一种轻量级、无需调优的文本到图像模型后处理偏见缓解框架

Venkatesh Thirugnana Sambandham, Torsten Schön

机构 * AIMotion Bavaria, Technische Hochschule Ingolstadt(AIMotion巴伐利亚、英格尔施泰特技术大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract);分类 cs.CV

AI总结 本文提出一种轻量级、无需调优的后处理框架,通过嵌入算术分析并修正嵌入空间中的偏见,保持语义和视觉上下文,提升多样性的同时维持高概念一致性。

Comments A demo notebook with basic implementations can be found at \url{https://github.com/cvims/EMBEDDING-ARITHMETIC}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18258 2026-04-21 cs.CV cs.AI 86%

Long-Text-to-Image Generation via Compositional Prompt Decomposition

通过组合提示分解实现长文本到图像生成

Jen-Yuan Huang, Tong Lin, Yilun Du

机构 * Peking University(北京大学) Harvard University(哈佛大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出PRISM方法,通过轻量模块提取长提示的组成部分,使预训练T2I模型能处理长序列输入,实现对复杂场景的建模,优于基线模型。

Comments Accepted to the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18269 2026-04-21 cs.CL cs.CV 86%

TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation

TextTIGER:基于实体提示精炼的文本智能生成用于文本到图像生成

Shintaro Ozaki, Tomoyuki Jinno, Kazuki Hayashi, Yusuke Sakai, Jingun Kwon, Hidetaka Kamigaito, Katsuhiko Hayashi, Manabu Okumura, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術研究所) The University of Tokyo(东京大学) Chungnam National University(Chungnam国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV

AI总结 TextTIGER通过增强外部信息和大语言模型总结,优化实体描述以提升文本到图像生成性能,实验表明其在多种评估指标上优于仅使用描述的提示方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16516 2026-04-21 cs.CV cs.LG cs.MM 84%

Operationalizing Fairness in Text-to-Image Models: A Survey of Bias, Fairness Audits and Mitigation Strategies

在文本到图像模型中实现公平性:对偏见、公平性审计及缓解策略的综述

Megan Smith, Venkatesh Thirugnana Sambandham, Florian Richter, Laura Crompton, Matthias Uhl, Torsten Schön

机构 * AImotion Bavaria, Technische Hochschule Ingolstadt(AImotion巴伐利亚、因戈尔施塔特技术大学) School of Transformation and Sustainability, Catholic University of Eichstätt-Ingolstadt(转型与可持续性学院,埃施塔特-因戈尔施塔特天主教大学) Chair of Economic and Social Ethics, University of Hohenheim(经济与社会伦理系,霍亨海姆大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文综述了文本到图像模型中的公平性研究,分析了偏见类型和公平性概念的分类,指出现有研究在目标公平与阈值公平之间的差距,并提出新的公平性操作框架。

Comments ICLR 2026 Algorithmic Fairness Across Alignment Procedures and Agentic Systems (AFAA) Workshop, reviews can be found at: https://openreview.net/forum?id=8DOkyBGWwP

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20751 2026-04-21 cs.CV 83%

Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning

Pref-GRPO:基于偏好奖励的GRPO用于稳定文本到图像强化学习

Yibin Wang, Zhimin Li, Yuhang Zang, Yujie Zhou, Jiazi Bu, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Hunyuan, Tencent(腾讯文脉) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Pref-GRPO方法,通过偏好奖励机制提升文本到图像生成的稳定性,同时引入UniGenBench基准测试评估模型性能。

Comments Project Page: https://codegoat24.github.io/UnifiedReward/Pref-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18376 2026-04-21 cs.CV 79%

Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation

面向鲁棒的文本到图像人物检索:多视图重新公式化用于语义补偿

Chao Yuan, Yujian Zhao, Haoxuan Xu, Guanglin Niu

机构 * Beihang University(北航)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出基于大语言模型的语义补偿框架,通过多视图语义重新公式化和特征补偿提升跨模态表示一致性,解决文本到图像检索中的表达漂移问题,实验表明其在三个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16363 2026-04-21 cs.CR cs.AI cs.CV 79%

CSF: Black-box Fingerprinting via Compositional Semantics for Text-to-Image Models

CSF:通过组合语义进行文本到图像模型的黑盒指纹识别

Junhoo Lee, Mijin Koo, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出CSF,一种基于组合语义的黑盒指纹识别方法,用于在不接触模型内部的情况下,通过查询访问确定文本到图像模型的版权归属。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17206 2026-04-21 cs.CV 70%

SciDraw-6K: A Multilingual Scientific Illustration Dataset Generated by Google Gemini

SciDraw-6K:由Google Gemini生成的多语言科学插图数据集

Davie Chen

机构 * University of Arts in Poznań(波兹南艺术大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 SciDraw-6K是6291个由Google Gemini生成的科学插图数据集,涵盖11种语言,用于支持多语言文本到图像研究和科学可视化领域适应。

Comments 9 pages, 5 figures. Dataset: https://huggingface.co/datasets/SciDrawAI/SciDraw-6K. Code: https://github.com/SciDrawAI/scidraw-6k

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11314 2026-04-21 cs.CV cs.CL 57%

CROC: Evaluating and Training T2I Metrics with Pseudo- and Human-Labeled Contrastive Robustness Checks

CROC:通过伪标签和人工标注的对比鲁棒性检查评估和训练T2I度量

Christoph Leiter, Yuki M. Asano, Margret Keuper, Steffen Eger

机构 * University of Mannheim(曼海姆大学) University of Technology Nuremberg(纽伦堡技术大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CROC框架,通过合成对比测试案例评估和训练T2I度量,生成超过100万对对比提示-图像对的伪标签数据集,并训练出CROCScore指标,展示其在开放源方法中的最佳性能。

Comments pre-MIT Press publication version; Accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏