arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-30 至 2026-06-30 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 8 篇

2606.30262 2026-06-30 cs.CV 88%

Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment

中间文本表示引导的文本到图像生成以增强唯一性对齐

Soyoun Won, Aryan Yazdan Parast, Basim Azam, Jean Honorio, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型在生成唯一性对象时因概念关联偏差导致对齐失败的问题,提出中间文本表示引导扩散方法,无需额外训练即可恢复被抑制的概念,在OAO-AttackBench上VQAScore提升高达19.1个百分点。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29013 2026-06-30 cs.CV 87%

Mural: Transferring LLM knowledge to image generation via Mixture-of-Transformers

Mural: 通过混合Transformer将LLM知识迁移到图像生成

Achin Jain, Jie An, Siddharth Chaudhary, Davide Modolo

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 提出Mixture-of-Transformers架构,将冻结的LLM与扩散图像生成器结合,仅用文本-图像对训练,在多个基准上取得优异性能,并涌现出跨语言生成、颜色引导构图等新能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28643 2026-06-30 cs.CV 83%

Obliviate: Erasing Concepts from Autoregressive Image Generation Models

Obliviate: 从自回归图像生成模型中擦除概念

Hossein Shakibania, Jonas Henry Grebe, Tobias Braun, Ege Aktemur, Saleh Aslani, Mehmet Görkem Yiğit, Marcus Rohrbach

机构 * TU Darmstadt, Germany(图宾根大学) Multimodal AI Lab, TU Darmstadt, Germany(多模态人工智能实验室) Zuse School ELIZA(祖斯学院ELIZA) hessian.AI, Germany(海西斯.AI)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出Obliviate方法,通过KL散度监督视觉token分布、轨迹级更新和对齐视觉前缀,有效擦除自回归文生图模型中的有害概念,在保持模型效用同时大幅降低不当内容生成。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30458 2026-06-30 cs.CV 79%

Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance

跨分辨率语义迁移用于低分辨率监控下的鲁棒文本-图像检索

Wenjie Qian, Bin Yang, Xiao Wang, Wenke Huang, Ling Mei, Xin Xu, Mang Ye

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University(武汉大学计算机学院,国家多媒体软件工程技术研究中心) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System, Wuhan University of Science and Technology(湖北省智能信息处理与实时工业系统重点实验室,武汉科技大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 针对低分辨率监控场景中文本-图像检索的可靠性崩溃和排序漂移问题,提出CLIP框架CRST,通过分辨率条件推理、文本引导精炼和跨分辨率邻域迁移,在三个数据集上平均提升超低分辨率Rank-1和mAP分别5.7%和5.3%。

Comments 10 pages,8 figures,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27122 2026-06-30 cs.CV 79%

InterPartAbility: Phrase-Region Grounding for Interpretable Text-to-Image Person Re-Identification

InterPartAbility: 基于文本引导的部分匹配用于可解释的人员重识别

Shakeeb Murtaza, Aryan Shukla, Rajarshi Bhattacharya, Maguelonne Heritier, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA系统工程系,蒙特利尔ÉTS学院,加拿大) Genetec Inc.(Genetec公司)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出InterPartAbility,通过显式部分匹配和短语-区域绑定提升TI-ReID的可解释性,引入PPIM模块实现概念级指导,生成 grounded 解释图谱,实验表明在CUHK-PEDES等基准上达到SOTA可解释性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15727 2026-06-30 cs.CV cs.AI cs.GR cs.LG eess.IV 73%

Spanning the Visual Analogy Space with a Weight Basis of LoRAs

通过LoRAs的权重基来跨越视觉类比空间

Hila Manor, Rinon Gal, Haggai Maron, Tomer Michaeli, Gal Chechik

专题命中 文生图 :text-to-image(abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 本文提出LoRWeB,通过在单次推理中为每个类比任务专门化模型,动态组合学习的变换原语,以提升视觉类比学习的泛化能力。

Comments Accepted to ECCV 2026; Code and data are in https://research.nvidia.com/labs/par/lorweb

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07778 2026-06-30 cs.CV 70%

Distribution Matching Variational AutoEncoder

分布匹配变分自编码器

Sen Ye, Jianning Pei, Mengde Xu, Shuyang Gu, Chunyu Wang, Liwei Wang, Han Hu

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出DMVAE,通过分布匹配约束将编码器的潜在分布与任意参考分布对齐,发现基于自监督学习的分布在图像生成中表现优异。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08307 2026-06-30 stat.ML cs.LG 67%

Concentration bounds on response-based vector embeddings of black-box generative models

基于响应的生成模型向量嵌入的集中界

Aranyak Acharyya, Joshua Agterberg, Youngser Park, Carey E. Priebe

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

AI总结 本文研究了基于响应的生成模型向量嵌入的集中界,通过数据核视角空间嵌入方法,在适当正则条件下推导出样本向量嵌入的高概率集中界,并确定所需样本响应数量以实现目标精度的群体嵌入近似。

详情

展开后加载摘要…

URL PDF HTML 收藏