arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-25 至 2026-03-25 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2512.10766 2026-03-25 cs.CR cs.AI cs.CV 79%

Metaphor-based Jailbreak Attacks on Text-to-Image Models

基于隐喻的文本到图像模型劫持攻击

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, Yi Tu, An-An Liu

机构 * Huawei Technologies Co Ltd.(华为技术有限公司)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出基于隐喻的劫持攻击方法,通过生成隐喻对抗提示绕过未知或多样化的防御机制,实验表明其在攻击性能和查询效率方面优于基线方法。

Comments Code is available in \url{https://github.com/datar001/metaphor-based-jailbreaking-attack}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23500 2026-03-25 cs.CV 70%

UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation

UniGRPO:用于推理驱动视觉生成的统一策略优化

Jie Liu, Zilyu Ye, Linxiao Yuan, Shenhan Zhu, Yu Gao, Jie Wu, Kunchang Li, Xionghui Wang, Xiaonan Nie, Weilin Huang, Wanli Ouyang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出UniGRPO框架,通过统一强化学习方法优化文本和图像生成策略,解决多轮交错生成问题,提升生成质量与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23311 2026-03-25 cs.CV cs.LG 57%

ARGENT: Adaptive Hierarchical Image-Text Representations

ARGENT:自适应层次图像-文本表示

Chuong Huynh, Hossein Souri, Abhinav Kumar, Vitali Petsiuk, Deen Dayal Mohan, Suren Kumar

机构 * University of Maryland, College Park(马里兰大学 College Park分校) Samsung Research America, AI Center(三星美国研究院人工智能中心)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 ARGENT通过自适应蕴含损失和规范正则化解决超几何VLM的层级结构问题,引入角度基于的概率蕴含协议评估层次理解,提升图像分类、文本到图像检索及层次指标性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23041 2026-03-25 cs.CV cs.AI cs.LG 57%

HUydra: Full-Range Lung CT Synthesis via Multiple HU Interval Generative Modelling

HUydra: 通过多HU区间生成建模实现全范围肺CT合成

António Cardoso, Pedro Sousa, Tania Pereira, Hélder P. Oliveira

机构 * INESC TEC, Portugal(葡萄牙INESC TEC研究院) Faculty of Engineering, University of Porto, Portugal(葡萄牙波尔图大学工程学院) Faculty of Sciences, University of Porto, Portugal(葡萄牙波尔图大学科学学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种多HU区间生成建模方法,通过训练针对特定组织的生成模型并融合输出,实现全范围肺CT合成,优于传统2D基线,提升FID和MMD等指标。

Comments Submitted to iEEE TPAMI (Transactions on Pattern Analysis and Machine Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23029 2026-03-25 cs.CV 57%

WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval

WISER:更广的搜索、更深入的思考和自适应融合用于无训练零样本复合图像检索

Tianyue Wang, Leigang Qu, Tianyu Yang, Xiangzhao Hao, Yifan Xu, Haiyun Guo, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院) Minzu University of China(民族大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 WISER通过'检索-验证-细化'流程统一文本到图像和图像到图像检索,显式建模意图和不确定性意识,实现更广泛的搜索和更深入的思考,提升零样本复合图像检索性能。

Comments Accept to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏