arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-17 至 2026-03-17 共收录 11 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 11 篇

2603.13389 2026-03-17 cs.CV cs.LG 92%

High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding

通过分布条件扩散解码从预训练视觉-语言模型生成高保真的文本到图像

Ji Woo Hong, Hee Suk Yoon, Gwanhyeong Koo, Eunseop Yoon, SooHwan Eom, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于扩散解码的框架,通过训练仅需扩散解码器即可提升图像保真度,利用分布加权代码向量增强视觉质量,仅需ImageNet-1K短训练即可改进VQ-VAE重建和文本到图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02046 2026-03-17 cs.CV cs.AI 89%

Agentic Retoucher for Text-To-Image Generation

面向文本到图像生成的代理修复器

Shaocheng Shen, Jianfeng Liang, Chunlei Cai, Cong Geng, Huiyu Duan, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);inpainting(abstract)

AI总结 本文提出Agentic Retoucher框架,通过感知-推理-行动循环改进文本到图像生成的质量,引入GenBlemish-27K数据集进行评估,提升图像真实感与局部修正可靠性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03813 2026-03-17 cs.GR cs.AI cs.CV cs.LG 88%

Diverse Text-to-Image Generation via Contrastive Noise Optimization

通过对比噪声优化实现文本到图像生成的多样性

Byungjun Kim, Soobin Um, Jong Chul Ye

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出对比噪声优化方法,通过调整初始噪声提升文本到图像生成的多样性,同时保持图像质量,实验表明其在质量与多样性之间取得平衡。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13547 2026-03-17 cs.CV 88%

NumColor: Precise Numeric Color Control in Text-to-Image Generation

NumColor: 文本到图像生成中的精确数值颜色控制

Muhammad Atif Butt, Diego Hernandez, Alexandra Gomez-Villa, Kai Wang, Javier Vazquez-Corral, Joost Van De Weijer

机构 * Computer Vision Center, Spain(西班牙计算机视觉中心) Computer Sciences Department, Universitat Autònoma de Barcelona, Spain(西班牙巴塞罗那自治大学计算机科学系) Program of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学项目) City University of Hong Kong(香港城市大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 NumColor通过颜色标记聚合器和颜色书实现多扩散架构中的精确数值颜色控制,提升颜色准确性和和谐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15150 2026-03-17 cs.CV 87%

SNCE: Geometry-Aware Supervision for Scalable Discrete Image Generation

SNCE:面向可扩展离散图像生成的几何感知监督

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Aditya Grover, Jason Kuen

机构 * Adobe UCLA

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);image synthesis(abstract)

AI总结 本文提出SNCE,一种新的训练目标,通过构建软类别分布解决大代码书离散图像生成的优化问题,提升收敛速度和生成质量。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11542 2026-03-17 cs.CV 83%

Infinity and Beyond: Compositional Alignment in VAR and Diffusion T2I Models

无穷尽:VAR和扩散T2I模型中的组合对齐

Hossein Shahabadi, Niki Sepasian, Arash Marioriyad, Ali Sharifi-Zarchi, Mahdieh Soleymani Baghshah

专题命中 文生图 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文评估了六种T2I模型在组合对齐上的表现,发现Infinity-8B在整体对齐上表现最佳,而Infinity-2B在多个类别中表现优异,揭示了高效性能的平衡。

Comments Accepted at the ICLR 2026 Workshop on Multimodal Intelligence: Next Token Prediction and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13299 2026-03-17 cs.LG cs.AI 82%

DreamReader: An Interpretability Toolkit for Text-to-Image Models

DreamReader: 一种用于文本到图像模型的可解释性工具包

Nirmalendu Prakash, Narmeen Oozeer, Michael Lan, Luka Samkharadze, Phillip Howard, Roy Ka-Wei Lee, Dhruv Nathawani, Shivam Raval, Amirali Abdullah

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Martian Thoughtworks NVIDIA Harvard University(哈佛大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract)

AI总结 DreamReader提出了一种统一框架,通过可组合的表示操作分析扩散模型的可解释性,引入三种新干预机制,通过实验展示其在文本到图像模型中的应用,推动可解释性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19703 2026-03-17 cs.HC 78%

Interactive Discovery and Exploration of Visual Bias in Generative Text-to-Image Models

交互式发现和探索生成文本到图像模型中的视觉偏见

Johannes Eschner, Roberto Labadie-Tamayo, Matthias Zeppelzauer, Manuela Waldner

专题命中 文生图 :text-to-image(title,abstract)

AI总结 本文提出ViBEx工具,通过交互式界面和零样本偏见探测,帮助发现生成文本到图像模型中的视觉偏见,通过案例研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12101 2026-03-17 cs.RO cs.AI cs.LG 67%

Decoupled Action Expert: Confining Task Knowledge to the Conditioning Pathway

解耦动作专家:将任务知识限制在条件路径中

Jian Zhou, Sihao Lin, Shuai Fu, Zerui Li, Gengze Zhou, Qi WU

专题命中 文生图 :diffusion(abstract);image synthesis(abstract)

AI总结 本文提出解耦训练方法,将任务知识限制在条件路径中,使动作主干网络无任务依赖,通过Diffusion Policy验证,证明动作专家编码较少任务特定知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12459 2026-03-17 cs.CV cs.GR 62%

From Particles to Fields: Reframing Photon Mapping with Continuous Gaussian Photon Fields

从粒子到场:用连续高斯光场重新框架光子映射

Jiachen Tao, Benjamin Planche, Van Nguyen Nguyen, Junyi Wu, Yuchun Liu, Haoxuan Wang, Zhongpai Gao, Gengyu Zhang, Meng Zheng, Feiran Wang, Anwesa Choudhuri, Zhenghao Zhao, Weitai Kang, Terrence Chen, Yan Yan, Ziyan Wu

专题命中 文生图 :image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 本文提出高斯光场,通过学习表示将光子分布编码为各向异性3D高斯体,提升多视角渲染效率,实现光子级精度与神经场景表示的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22287 2026-03-17 cs.CV 57%

Match-and-Fuse: Consistent Generation from Unstructured Image Sets

匹配与融合:从无结构图像集实现一致生成

Kate Feingold, Omri Kaduri, Tali Dekel

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出Match-and-Fuse方法,通过图模型实现无结构图像集的一致生成,利用内部特征融合和密集输入对应关系,在无需掩码或人工监督的情况下生成一致且高质量的图像集。

Comments CVPR 2026. Project page: https://match-and-fuse.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏