arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-12 至 2026-05-12 共收录 9 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 9 篇

2603.00918 2026-05-12 cs.CV cs.AI 88%

Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards

通过内在自信心奖励改进文本到图像生成

Seungwook Kim, Minsu Cho

机构 * POSTECH(POSTECH大学) RLWRLD(RLWRLD实验室) GenGenAI(GenGenAI研究院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出SOLACE框架,通过模型自身输出的重建误差生成自信心信号,用于强化学习,提升生成内容的组成、文本渲染和文本图像对齐能力。

Comments 22 pages, accepted to CVPR 2026. Project page https://wookiekim.github.io/SOLACE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25074 2026-05-12 cs.CV 85%

Z-Erase: Enabling Concept Erasure in Single-Stream Diffusion Transformers

Z-Erase:在单流扩散变换器中实现概念擦除

Nanxiang Jiang, Zhaoxin Fan, Baisen Wang, Daiheng Gao, Junhang Cheng, Jifeng Guo, Yalan Qin, Yeying Jin, Hongwei Zheng, Faguo Wu, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain(未来区块链与隐私计算北京创新中心) Privacy Computing, School of Artificial Intelligence, Beihang University(隐私计算,北京航空航天大学人工智能学院) University of Science(科学大学) Shanghai University(上海大学) Tencent(腾讯) Beijing Academy of Blockchain(北京区块链研究院)

专题命中 文生图 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Z-Erase,一种专为单流T2I模型设计的概念擦除方法,通过解耦更新和平衡擦除与保留的权衡,解决生成崩溃问题,实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03544 2026-05-12 cs.CV cs.AI cs.CR 83%

PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models

PromptGuard: 基于软提示的文本到图像模型不安全内容审查

Lingzhi Yuan, Xinfeng Li, Chejian Xu, Guanhong Tao, Xiaojun Jia, Yihao Huang, Wei Dong, Yang Liu, Bo Li

机构 * Department of Computer Science, University of Maryland(计算机科学系,马里兰大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机科学与数据科学学院) Kahlert School of Computing, The University of Utah(犹他大学Kahlert计算学院) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 PromptGuard通过引入软提示机制,有效抑制文本到图像模型生成不安全内容,同时保持生成质量,且比现有方法快3.8倍。

Comments Accepted for publication in IEEE Transactions on Information Forensics and Security (TIFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10937 2026-05-12 cs.CV 79%

Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

文本到图像模型的强化后训练与超线性优势塑造

Haoyuan Sun, Jing Wang, Yuxin Song, Yu Lu, Bo Fang, Yifu Luo, Jun Yin, Pengyu Zeng, Miao Zhang, Tiantian Zhang, Xueqian Wang, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Baidu Inc.(百度公司) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Jimei University(集美大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出超线性优势塑造方法,通过信息几何视角优化文本到图像模型的后训练过程,提升训练效率和生成质量,减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16836 2026-05-12 cs.CV cs.CL 79%

ColorConceptBench: A Benchmark for Probabilistic Color-Concept Understanding in Text-to-Image Models

ColorConceptBench:一种用于文本到图像模型中概率颜色-概念理解的基准

Chenxi Ruan, Yihan Hou, Yu Xiao, Guosheng Hu, Wei Zeng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) China Academy of Art(中国美术学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出ColorConceptBench,通过概率颜色分布系统评估颜色-概念关联,研究文本到图像模型对隐含概念如情感和视觉状态的理解能力,发现模型在抽象语义上的敏感性不足。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08836 2026-05-12 cs.MM 57%

Accelerating Multi-Condition T2I Generation via Adaptive Condition Offloading and Pruning

通过自适应条件卸载和剪枝加速多条件T2I生成

Yuxin Kong, Peng Yang, Chongbin Yi, Fan Wu, Feng Lyu

专题命中 文生图 :text-to-image(abstract);分类 cs.MM

AI总结 本文提出一种端边协作系统,通过自适应条件卸载和剪枝减少多条件T2I生成的延迟并提升生成质量。

Comments accepted by IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08724 2026-05-12 cs.CV 57%

SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment

SynerMedGen:通过任务对齐协同医疗多模态理解与生成

Weiren Zhao, Yi Dong, Cheng Chen

机构 * The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 SynerMedGen通过任务对齐实现医疗多模态理解与生成的协同,提出生成对齐理解任务和两阶段训练策略,实现零样本性能和跨数据集泛化,释放大规模数据集支持进一步研究。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08493 2026-05-12 cs.CV 57%

CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis

CapCLIP:一种用于无线胶囊内镜分析的视觉-语言表示对齐方法

Haroon Wahab, Irfan Mehmood, Hassan Ugail

机构 * School of Computer Science, AI and Electronics Faculty of Engineering and Digital Technologies(计算机科学与电子工程学院,工程与数字技术学院) School of Management Faculty of Mgmt, Law & Social Sciences(管理学院,管理、法律与社会科学学院) Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 CapCLIP通过将内镜图像与临床标准术语生成的文本描述对齐,提升无线胶囊内镜分析的泛化能力和语义解释性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08280 2026-05-12 cs.LG cs.AI 50%

Beyond the False Trade-off: Adaptive EWC for Stealthy and Generalizable T2I Backdoors

超越虚假的权衡:适应性EWC用于隐蔽且可泛化的T2I后门

Lu Bowen, Xinyu Tang, Yin Yin Low, Shu-Min Leong

机构 * Monash University(墨尔本大学)

专题命中 文生图 :text-to-image(abstract)

AI总结 本文提出Cosine-Aware Adaptive EWC,通过动态调整EWC正则化提升T2I后门攻击的ASR与模型保真度平衡,增强对域外数据集的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏