arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-08 至 2026-05-08 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2605.06170 2026-05-08 cs.CV 79%

DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models

DynT2I-Eval: 一种用于文本到图像模型的动态评估框架

Juntong Wang, Jiarui Wang, Huiyu Duan, Lewei Li, Guangtao Zhai, Xiongkuo Min

机构 * Institute of Image Communication and Network Engineering(图像通信与网络工程研究所)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出DynT2I-Eval框架,通过动态生成提示以提升文本到图像模型的评估鲁棒性,减少过拟合和基准污染影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06012 2026-05-08 cs.CV cs.AI 79%

T2I-VeRW: Part-level Fine-grained Perception for Text-to-Image Vehicle Retrieval

T2I-VeRW: 基于部件级细粒度感知的文本到图像车辆检索

Xiao Wang, Ziwen Wang, Weizhe Kong, Wentao Wu, Yuehang Li, Aihua Zheng, Chenglong Li, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出PFCVR模型,通过部件级局部对齐和双向掩码恢复模块实现文本到图像的车辆检索,构建了新的大规模数据集T2I-VeRW,实验结果显示PFCVR在两个基准数据集上均取得优异的检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06295 2026-05-08 cs.LG cs.AI stat.ML 67%

Attributions All the Way Down? The Metagame of Interpretability

逐层归因?可解释性中的元游戏

Hubert Baniecki, Przemyslaw Biecek, Fabian Fumagalli

机构 * University of Warsaw(华沙大学) Centre for Credible AI, Warsaw University of Technology(可信AI中心,华沙技术大学) Bielefeld University(比勒菲尔德大学) LMU Munich, MCML(慕尼黑大学LMU,MCML)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

AI总结 本文提出元游戏框架,通过将归因方法视为合作博弈计算Shapley值,研究模型解释的第二阶交互效应,揭示归因的层级分解及其在多领域可解释性应用中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06143 2026-05-08 cs.CV cs.AI 57%

AI-Generated Images: What Humans and Machines See When They Look at the Same Image

AI生成图像:当人类和机器注视同一张图像时的所见

Silvia Poletti, Justin Ilyes, Marcel Hasenbalg, David Fischinger, Martin Boyer

机构 * Austrian Institute of Technology(奥地利技术研究院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文探讨了如何通过多种架构和微调策略开发更有效的AI生成图像检测器,提供人类可理解的解释。研究基于大规模逼真伪造图像数据集,评估了最新文本到图像AI生成器的性能,并整合16种可解释AI方法,通过调查100名参与者收集的文本和视觉反馈,优化解释清晰度。

Comments Included in the main conference proceedings published by Springer Nature (CCIS Series)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00699 2026-05-08 cs.CR 50%

STARE: Step-wise Temporal Alignment and Red-teaming Engine for Multi-modal Toxicity Attack

STARE:分步时间对齐与红队引擎用于多模态毒性攻击

Xutao Mao, Liangjie Zhao, Tao Liu, Xiang Zheng, Hongying Zan, Cong Wang

专题命中 文生图 :image generation(abstract)

AI总结 STARE通过分步时间对齐和红队引擎,提升多模态毒性攻击的成功率,揭示优化诱导的相位对齐现象,为安全机制提供理论基础。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏