arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-17 至 2026-03-17 共收录 186 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 11 篇

2603.13389 2026-03-17 cs.CV cs.LG 92%

High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding

通过分布条件扩散解码从预训练视觉-语言模型生成高保真的文本到图像

Ji Woo Hong, Hee Suk Yoon, Gwanhyeong Koo, Eunseop Yoon, SooHwan Eom, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于扩散解码的框架,通过训练仅需扩散解码器即可提升图像保真度,利用分布加权代码向量增强视觉质量,仅需ImageNet-1K短训练即可改进VQ-VAE重建和文本到图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02046 2026-03-17 cs.CV cs.AI 89%

Agentic Retoucher for Text-To-Image Generation

面向文本到图像生成的代理修复器

Shaocheng Shen, Jianfeng Liang, Chunlei Cai, Cong Geng, Huiyu Duan, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);inpainting(abstract)

AI总结 本文提出Agentic Retoucher框架,通过感知-推理-行动循环改进文本到图像生成的质量,引入GenBlemish-27K数据集进行评估,提升图像真实感与局部修正可靠性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03813 2026-03-17 cs.GR cs.AI cs.CV cs.LG 88%

Diverse Text-to-Image Generation via Contrastive Noise Optimization

通过对比噪声优化实现文本到图像生成的多样性

Byungjun Kim, Soobin Um, Jong Chul Ye

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出对比噪声优化方法,通过调整初始噪声提升文本到图像生成的多样性,同时保持图像质量,实验表明其在质量与多样性之间取得平衡。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13547 2026-03-17 cs.CV 88%

NumColor: Precise Numeric Color Control in Text-to-Image Generation

NumColor: 文本到图像生成中的精确数值颜色控制

Muhammad Atif Butt, Diego Hernandez, Alexandra Gomez-Villa, Kai Wang, Javier Vazquez-Corral, Joost Van De Weijer

机构 * Computer Vision Center, Spain(西班牙计算机视觉中心) Computer Sciences Department, Universitat Autònoma de Barcelona, Spain(西班牙巴塞罗那自治大学计算机科学系) Program of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学项目) City University of Hong Kong(香港城市大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 NumColor通过颜色标记聚合器和颜色书实现多扩散架构中的精确数值颜色控制,提升颜色准确性和和谐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15150 2026-03-17 cs.CV 87%

SNCE: Geometry-Aware Supervision for Scalable Discrete Image Generation

SNCE:面向可扩展离散图像生成的几何感知监督

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Aditya Grover, Jason Kuen

机构 * Adobe UCLA

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);image synthesis(abstract)

AI总结 本文提出SNCE,一种新的训练目标,通过构建软类别分布解决大代码书离散图像生成的优化问题,提升收敛速度和生成质量。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11542 2026-03-17 cs.CV 83%

Infinity and Beyond: Compositional Alignment in VAR and Diffusion T2I Models

无穷尽:VAR和扩散T2I模型中的组合对齐

Hossein Shahabadi, Niki Sepasian, Arash Marioriyad, Ali Sharifi-Zarchi, Mahdieh Soleymani Baghshah

专题命中 文生图 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文评估了六种T2I模型在组合对齐上的表现,发现Infinity-8B在整体对齐上表现最佳,而Infinity-2B在多个类别中表现优异,揭示了高效性能的平衡。

Comments Accepted at the ICLR 2026 Workshop on Multimodal Intelligence: Next Token Prediction and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13299 2026-03-17 cs.LG cs.AI 82%

DreamReader: An Interpretability Toolkit for Text-to-Image Models

DreamReader: 一种用于文本到图像模型的可解释性工具包

Nirmalendu Prakash, Narmeen Oozeer, Michael Lan, Luka Samkharadze, Phillip Howard, Roy Ka-Wei Lee, Dhruv Nathawani, Shivam Raval, Amirali Abdullah

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Martian Thoughtworks NVIDIA Harvard University(哈佛大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract)

AI总结 DreamReader提出了一种统一框架,通过可组合的表示操作分析扩散模型的可解释性,引入三种新干预机制,通过实验展示其在文本到图像模型中的应用,推动可解释性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19703 2026-03-17 cs.HC 78%

Interactive Discovery and Exploration of Visual Bias in Generative Text-to-Image Models

交互式发现和探索生成文本到图像模型中的视觉偏见

Johannes Eschner, Roberto Labadie-Tamayo, Matthias Zeppelzauer, Manuela Waldner

专题命中 文生图 :text-to-image(title,abstract)

AI总结 本文提出ViBEx工具,通过交互式界面和零样本偏见探测,帮助发现生成文本到图像模型中的视觉偏见,通过案例研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12101 2026-03-17 cs.RO cs.AI cs.LG 67%

Decoupled Action Expert: Confining Task Knowledge to the Conditioning Pathway

解耦动作专家:将任务知识限制在条件路径中

Jian Zhou, Sihao Lin, Shuai Fu, Zerui Li, Gengze Zhou, Qi WU

专题命中 文生图 :diffusion(abstract);image synthesis(abstract)

AI总结 本文提出解耦训练方法,将任务知识限制在条件路径中,使动作主干网络无任务依赖,通过Diffusion Policy验证,证明动作专家编码较少任务特定知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12459 2026-03-17 cs.CV cs.GR 62%

From Particles to Fields: Reframing Photon Mapping with Continuous Gaussian Photon Fields

从粒子到场:用连续高斯光场重新框架光子映射

Jiachen Tao, Benjamin Planche, Van Nguyen Nguyen, Junyi Wu, Yuchun Liu, Haoxuan Wang, Zhongpai Gao, Gengyu Zhang, Meng Zheng, Feiran Wang, Anwesa Choudhuri, Zhenghao Zhao, Weitai Kang, Terrence Chen, Yan Yan, Ziyan Wu

专题命中 文生图 :image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 本文提出高斯光场,通过学习表示将光子分布编码为各向异性3D高斯体,提升多视角渲染效率,实现光子级精度与神经场景表示的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22287 2026-03-17 cs.CV 57%

Match-and-Fuse: Consistent Generation from Unstructured Image Sets

匹配与融合:从无结构图像集实现一致生成

Kate Feingold, Omri Kaduri, Tali Dekel

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出Match-and-Fuse方法,通过图模型实现无结构图像集的一致生成,利用内部特征融合和密集输入对应关系,在无需掩码或人工监督的情况下生成一致且高质量的图像集。

Comments CVPR 2026. Project page: https://match-and-fuse.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 6 篇

2409.02374 2026-03-17 cs.CV cs.LG 90%

Exploring Low-Dimensional Subspaces in Diffusion Models for Controllable Image Editing

在扩散模型中探索低维子空间以实现可控图像编辑

Siyi Chen, Huijie Zhang, Minzhe Guo, Yifu Lu, Peng Wang, Qing Qu

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文通过分析扩散模型中后验均值预测器的局部线性和Jacobian奇异向量的低维特性,提出无需训练的LOCO Edit方法,实现精准局部图像编辑,并扩展至文本监督下的图像编辑。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM 81%

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01893 2026-03-17 cs.CV 79%

Generative Visual Chain-of-Thought for Image Editing

生成式视觉链式思维用于图像编辑

Zijin Yin, Tiankai Hang, Yiji Cheng, Shiyi Zhang, Runze He, Yu Xu, Chunyu Wang, Bing Li, Zheng Chang, Kongming Liang, Qinglin Lu, Zhanyu Ma

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出GVCoT框架,通过生成空间线索实现视觉推理与编辑,解决复杂场景下的编辑定位问题,提出GVCoT-Edit-Instruct数据集和SREdit-Bench基准,实验表明其在图像编辑任务中表现优异。

Comments Project page: https://pris-cv.github.io/GVCoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13388 2026-03-17 cs.CV 79%

VeloEdit: Training-Free Consistent and Continuous Instruction-Based Image Editing via Velocity Field Decomposition

VeloEdit: 无需训练的一致且连续的基于指令的图像编辑 via 速度场分解

Zongqing Li, Zhihui Liu, Yujie Xie, Shansiyuan Wu, Hongshen Lv, Songzhi Su

机构 * Xiamen University(厦门大学) Truesight

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 VeloEdit通过速度场分解实现无需训练的一致且连续的基于指令的图像编辑,通过动态识别编辑区域并采用速度插值控制编辑强度,提升视觉一致性和编辑连续性。

Comments 26 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 57%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14153 2026-03-17 cs.CV 57%

Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit-Level Virtual Try-On with Clothing and Accessories

Garments2Look:用于高保真服装级虚拟试穿的多参考数据集

Junyao Hu, Zhongwei Cheng, Waikeung Wong, Xingxing Zou

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出Garments2Look数据集,用于高保真的服装级虚拟试穿,包含8万对多件服装到一套搭配的样本,涵盖40大类和300+细分类别,通过合成流程提升数据质量和任务难度,验证现有方法在完整服装试穿和层叠推断上的不足。

Comments CVPR 2026; Project Page: https://artmesciencelab.github.io/Garments2Look

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 125 篇

2603.03125 2026-03-17 cs.CV 86%

AWDiff: An a trous wavelet diffusion model for lung ultrasound image synthesis

AWDiff:一种用于肺部超声图像合成的a trous小波扩散模型

Maryam Heidari, Nantheera Anantrasirichai, Steven Walker, Rahul Bhatnagar, Alin Achim

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 本文提出AWDiff模型,通过a trous小波变换与BioMedCLIP语义条件,提升肺部超声图像生成的结构精度与临床相关性。

Comments 5 pages5 pages, 4 figures. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13396 2026-03-17 cs.CV 86%

SERUM: Simple, Efficient, Robust, and Unifying Marking for Diffusion-based Image Generation

SERUM:一种简单、高效、鲁棒且统一的扩散图像生成标记方法

Jan Kociszewski, Hubert Jastrzębski, Tymoteusz Stępkowski, Filip Manijak, Krzysztof Rojek, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA 情报安全中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);分类 cs.CV

AI总结 SERUM通过在扩散模型生成的初始噪声中添加唯一水印噪声,并训练轻量级检测器识别水印图像,实现了高效且鲁棒的图像标记,同时保持图像质量影响极小。

Comments Accepted as an ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19917 2026-03-17 cs.CV 85%

Scale Where It Matters: Training-Free Localized Scaling for Diffusion Models

在关键区域进行扩展:无需训练的扩散模型局部化扩展

Qin Ren, Yufei Wang, Lanqing Guo, Wen Zhang, Zhiwen Fan, Chenyu You

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出LoTTS,一种无需训练的局部化测试时扩展方法,通过局部重采样缺陷区域提升图像质量并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14062 2026-03-17 cs.CV cs.LG 85%

TMPDiff: Temporal Mixed-Precision for Diffusion Models

TMPDiff:扩散模型的时序混合精度

Basile Lewandowski, Simon Kurz, Aditya Shankar, Robert Birke, Jian-Jia Chen, Lydia Y. Chen

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 TMPDiff通过为不同去噪时间步分配不同精度,优化扩散模型的推理效率,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22524 2026-03-17 cs.LG 85%

Inference-Time Scaling of Discrete Diffusion Models via Importance Weighting and Optimal Proposal Design

通过重要加权和最优提案设计实现离散扩散模型的推理时间扩展

Zijing Ou, Chinmay Pani, Yingzhen Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出基于SMC框架的重要加权和最优提案设计方法,提升离散扩散模型在推理时的可控制性和样本质量,适用于多个领域任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13739 2026-03-17 cs.CV cs.AI cs.MM 84%

UniVid: Pyramid Diffusion Model for High Quality Video Generation

UniVid:金字塔扩散模型用于高质量视频生成

Xinyu Xiao, Binbin Yang, Tingtian Li, Yipeng Yu, Sen Lei

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 UniVid通过融合文本提示和参考图像,结合时间金字塔交叉帧空间时间注意力模块,提升文本到视频、图像到视频及联合生成任务的时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05823 2026-03-17 cs.CV 83%

Boosting Latent Diffusion Models via Disentangled Representation Alignment

通过解耦表征对齐提升潜在扩散模型

John Page, Xuesong Niu, Kai Wu, Kun Gai

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Semantics-Disentangled VAE,通过非线性映射架构提升VAE的语义解耦能力,实现高质量图像生成,FID达1.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18706 2026-03-17 cs.CV 83%

CoD: A Diffusion Foundation Model for Image Compression

CoD:一种面向图像压缩的扩散基础模型

Zhaoyang Jia, Zihan Zheng, Naifu Xue, Jiahao Li, Bin Li, Zongyu Guo, Xiaoyi Zhang, Houqiang Li, Yan Lu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出CoD,一种面向图像压缩的扩散基础模型,通过端到端优化提升压缩效率和生成质量,在超低比特率下实现SOTA结果,同时降低训练成本并提供新研究视角。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14128 2026-03-17 cs.CV cs.AI cs.LG 83%

Diffusion Reinforcement Learning via Centered Reward Distillation

通过中心化奖励蒸馏实现扩散强化学习

Yuanzhi Zhu, Xi Wang, Stéphane Lathuilière, Vicky Kalogeiton

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出中心化奖励蒸馏框架,通过KL正则化奖励最大化和前向过程微调,解决扩散模型在细粒度提示保真度、组合正确性等任务中的表现问题,实现更稳定的奖励优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03608 2026-03-17 cs.CV 83%

Diffusion-Classifier Synergy: Reward-Aligned Learning via Mutual Boosting Loop for FSCIL

扩散-分类器协同:通过互boost循环实现奖励对齐学习以实现少样本类增量学习

Ruitao Wu, Yifan Zhao, Guangyao Chen, Jia Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Diffusion-Classifier Synergy框架,通过扩散模型与分类器的互boost循环,利用奖励对齐策略提升少样本类增量学习的性能,增强知识保留与新类学习能力。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25940 2026-03-17 cs.CV cs.LG 83%

Steer Away From Mode Collisions: Improving Composition In Diffusion Models

避免模式碰撞:改进扩散模型中的组合性能

Debottam Dutta, Jianchong Chen, Rajalaxmi Rajagopalan, Yu-Lin Wei, Romit Roy Choudhury

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过纠正采样策略改进文本到图像扩散模型中多概念提示的保真度,避免模式碰撞,提升概念平衡性和鲁棒性。

Comments Accepted to ICLR 2026. Code: https://github.com/debottam-dutta7/co3

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08801 2026-03-17 cs.CV cs.AI cs.MM 81%

Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective

Lumos-1:从统一模型视角看基于离散扩散的自回归视频生成

Hangjie Yuan, Weihua Chen, Jun Cen, Hu Yu, Jingyun Liang, Shuning Chang, Zhihui Lin, Tao Feng, Pengwei Liu, Jiazheng Xing, Hao Luo, Jiasheng Tang, Fan Wang, Yi Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 Lumos-1提出一种基于LLM的统一模型,通过改进的MM-RoPE和离散扩散机制,在高效生成视频方面超越现有模型,适用于多种视频评估基准。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://github.com/alibaba-damo-academy/Lumos

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15478 2026-03-17 cs.CV 79%

ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer

ViFeEdit:一种无需视频的视频扩散变换器调谐器

Ruonan Yu, Zhenxiong Tan, Zigeng Chen, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ViFeEdit框架,通过2D图像实现视频生成与编辑,无需视频训练数据,采用架构重参数化解耦空间独立性与全3D注意力,实现高质量视频编辑与生成。

Comments Working in progress, code is at https://github.com/Lexie-YU/ViFeEdit

详情

展开后加载摘要…

URL PDF HTML 收藏