arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-28 至 2026-05-28 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2605.25763 2026-05-28 cs.CV 92%

AI-T2I: Aggregating-and-Isolating Cross-Attention to Diffusion Models for Text-to-Image Synthesis

AI-T2I: 面向文本到图像合成的扩散模型的聚合与隔离交叉注意力

Shipeng Cao, Biao Qian, Haipeng Liu, Yang Wang, Meng Wang

机构 * Institute of Advanced Medicine and Frontier Technology(先进医学与前沿技术研究院) Hefei University of Technology(合肥工业大学) Key Laboratory of Knowledge Engineering With Big Data, Ministry of Education(大数据知识工程重点实验室) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract);personalized generation(abstract)

AI总结 针对扩散模型在文本到图像合成中交叉注意力图内文本-图像对齐不精确的问题,提出一种聚合与隔离交叉注意力方法(AI-T2I),通过聚合损失整合分散的令牌内激活并引入隔离损失分离令牌间激活,实现精确对齐。

Comments Accepted by IEEE Transactions on Multimedia (2026). 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28615 2026-05-28 cs.CV 92%

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization

基于区域感知双模态直接偏好优化的组合式文本到图像生成

Zhuohan Liu, Wujian Peng, Yitong Chen, Zuxuan Wu

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 文生图 :diffusion(summary_cn,abstract);image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 提出BiDPO框架,通过构建大规模偏好数据集BiComp和扩展Diffusion DPO联合优化图像与文本偏好,结合区域级引导方法,提升文本到图像模型对复杂组合提示的生成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28137 2026-05-28 cs.CV cs.LG 79%

No Safe Dose: How Training Data Drives Unsafe Image Generation

无安全剂量:训练数据如何驱动不安全图像生成

Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

机构 * Black Forest Labs(黑森林实验室) TU Darmstadt & hessian.AI(图腾达姆施塔特大学 & heessian.AI) DFKI(德意志联邦鹰嘴豆研究所) Lab1141(Lab1141实验室)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 通过控制训练数据中不安全图像的比例(0%至9.6%),发现输出不安全率随比例单调上升,且比例而非绝对数量是关键因素,同时文本编码器(如SafeCLIP)可降低基线风险,但剂量效应持续存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27595 2026-05-28 cs.CV cs.AI 70%

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

多模态大语言模型在农业图像解释与生成任务中的幻觉行为

Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid

机构 * Texas A&M University System(德克萨斯大学系统)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究系统评估了多模态大语言模型在农业图像解释(图像到文本)和生成(文本到图像)任务中的幻觉行为,发现模型存在生物不一致、上下文不准确和农学不合理等错误模式,并通过少样本提示等方法分析了幻觉的残留影响。

详情

展开后加载摘要…

URL PDF HTML 收藏