arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-14 至 2026-05-14 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2602.00616 2026-05-14 cs.AI 88%

SPOT: Selective Prompt Projection via Total Variation for Inference-Only Safe Text-to-Image Generation

SPOT:基于总变分的选性提示投影用于仅推理的文本到图像生成

Minhyuk Lee, Hyekyung Yoon, Myungjoo Kang

机构 * Seoul National University(首尔国立大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract)

AI总结 本文提出SPOT框架,通过总变分约束生成器参考分布,实现对文本到图像生成中不安全内容的抑制,同时保持良性提示的行为,实验显示其在多个数据集上显著降低不适当评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13223 2026-05-14 cs.CV 86%

Skill-Aligned Annotation for Reliable Evaluation in Text-to-Image Generation

基于技能对齐的标注以在文本到图像生成中实现可靠评估

Abdelrahman Eldesokey, Merey Ramazanova, Ahmad Sait, Ansar Khangeldin, Karen Sanchez, Tong Zhang, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(卡斯泰大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出基于技能对齐的标注方法,通过统一不同评估技能的特性,提高文本到图像生成评估的一致性和稳定性,同时提供可扩展的评估流程。

Comments Project Page: https://abdo-eldesokey.github.io/skill-aligned-eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12650 2026-05-14 cs.CV 79%

CRAFT: Clinical Reward-Aligned Finetuning for Medical Image Synthesis

CRAFT:面向医学图像合成的临床对齐微调

Yunsung Chung, Alex El Darzi, Carlo El Khoury, Han Feng, Nassir Marrouche, Jihun Hamm

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) School of Medicine, Tulane University(路易斯安那大学医学院)

专题命中 文生图 :image synthesis(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出CRAFT框架,通过临床对齐评分和奖励优化提升医学图像生成质量,减少幻觉生成,提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13155 2026-05-14 cs.CV 70%

Pareto-Guided Optimal Transport for Multi-Reward Alignment

基于帕累托前沿的多奖励对齐最优传输

Ying Ba, Tianyu Zhang, Mohan Zhou, Yalong Bai, Wenyi Mo, Guiwei Zhang, Bing Su, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程技术研究中心) Rutgers University(罗格斯大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出帕累托前沿引导的最优传输框架,通过构建任务特定的帕累托前沿并利用分布感知最优传输将支配样本映射到前沿,结合在线和离线优化策略,引入联合支配率和联合坍塌率作为评估指标,实验显示在多奖励协同和对抗攻击中优于基线方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08039 2026-05-14 cs.CV cs.AI cs.LG 57%

LINE: LLM-based Iterative Neuron Explanations for Vision Models

LINE:基于语言模型的视觉模型迭代神经元解释

Vladimir Zaigrajew, Michał Piechota, Gaspar Sekula, Paweł Gelar, Przemysław Biecek

机构 * Centre for Credible AI(可信AI中心) Warsaw University of Technology(华沙理工大学) University of Warsaw, Poland(波兰华沙大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 LINE提出一种无需训练的迭代方法,通过大语言模型和图像生成器,在黑盒环境下闭环提出和优化概念,提升视觉模型的开放词汇概念标注性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12517 2026-05-14 cs.CL cs.AI cs.CV 57%

Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models

弥合缺失模态的差距:改进纯文本校准的视觉语言模型

Mingyeong Kim, Jungwon Choi, Chaeyun Jang, Juho Lee

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出Latent Imagination Module,通过预测文本输入的潜在嵌入来提升纯文本环境下视觉语言模型的准确性和校准性能。

Comments 9 pages, 16 figures. Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety across Modalities

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13113 2026-05-14 cs.CY cs.AI 50%

Context Matters: Auditing Gender Bias in T2I Generation through Risk-Tiered Use-Case Profiles

语境至关重要:通过风险分层用例配置审计T2I生成中的性别偏见

Jose Luna, Yankun Wu, Xiaofei Xie, Noa Garcia

机构 * Singapore Management University(新加坡国立大学) The University of Osaka(大阪大学)

专题命中 文生图 :text-to-image(abstract)

AI总结 本文提出一个风险对齐的审计框架,用于评估T2I模型中的性别偏见,通过风险分层用例配置、指标目录和危害类型,系统化地审计性别偏见。

Comments FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏