arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69868 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69868 篇

2312.05390 2023-12-12 cs.CV 87%

NoiseCLR: A Contrastive Learning Approach for Unsupervised Discovery of Interpretable Directions in Diffusion Models

Yusuf Dalva, Pinar Yanardag

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments Project page: https://noiseclr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00079 2023-12-04 cs.CV cs.AI cs.CL cs.LG 87%

HiFi Tuner: High-Fidelity Subject-Driven Fine-Tuning for Diffusion Models

Zhonghao Wang, Wei Wei, Yang Zhao, Zhisheng Xiao, Mark Hasegawa-Johnson, Humphrey Shi, Tingbo Hou

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16090 2023-11-28 cs.CV 87%

Self-correcting LLM-controlled Diffusion Models

Tsung-Han Wu, Long Lian, Joseph E. Gonzalez, Boyi Li, Trevor Darrell

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10829 2023-11-28 cs.CV 87%

Exact Diffusion Inversion via Bi-directional Integration Approximation

Guoqiang Zhang, J. P. Lewis, W. Bastiaan Kleijn

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments arXiv admin note: text overlap with arXiv:2304.11328. Our code is available at https://github.com/guoqiang-zhang-x/BDIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11305 2023-07-04 cs.CV 87%

SVDiff: Compact Parameter Space for Diffusion Fine-Tuning

Ligong Han, Yinxiao Li, Han Zhang, Peyman Milanfar, Dimitris Metaxas, Feng Yang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments Added additional analysis and style-mixing results

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16576 2023-05-18 cs.CV 87%

WordStylist: Styled Verbatim Handwritten Text Generation with Latent Diffusion Models

Konstantina Nikolaidou, George Retsinas, Vincent Christlein, Mathias Seuret, Giorgos Sfikas, Elisa Barney Smith, Hamam Mokayed, Marcus Liwicki

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03142 2023-04-14 cs.CV cs.AI cs.LG 87%

On Distillation of Guided Diffusion Models

Chenlin Meng, Robin Rombach, Ruiqi Gao, Diederik P. Kingma, Stefano Ermon, Jonathan Ho, Tim Salimans

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract);inpainting(abstract)

Comments CVPR 2023, Award candidate

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13757 2023-03-17 cs.CV 87%

Diffusion-SDF: Conditional Generative Modeling of Signed Distance Functions

Gene Chou, Yuval Bahat, Felix Heide

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);inpainting(abstract);image synthesis(abstract)

Comments revised experiments and added link to code and supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00837 2026-06-02 cs.RO cs.LG 87%

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning

粗到细的组合扩散用于长时域规划

Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

机构 * KAIST(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,summary_cn);image generation(abstract)

AI总结 提出Coarse-to-Fine Compositional Diffusion (CoFi)方法,通过先形成全局骨架再细化局部细节,在长时域机器人规划、全景图像生成和长视频生成中提升全局一致性和局部质量,同时减少2-8倍去噪评估次数。

Comments Project page: https://cofi-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14304 2025-03-19 cs.GR cs.CV eess.IV 87%

Bracket Diffusion: HDR Image Generation by Consistent LDR Denoising

Mojtaba Bemana, Thomas Leimkühler, Karol Myszkowski, Hans-Peter Seidel, Tobias Ritschel

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);分类 cs.CV、cs.GR

Comments 11 pages, 14 figures, Accepted to Eurographics 2025, see https://bracketdiffusion.mpi-inf.mpg.de

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10886 2024-12-06 cs.CV cs.AI cs.GR cs.RO 87%

MetricGold: Leveraging Text-To-Image Latent Diffusion Models for Metric Depth Estimation

Ansh Shah, K Madhava Krishna

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05352 2024-07-09 cs.CV cs.MM 87%

Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model

Danni Yang, Ruohan Dong, Jiayi Ji, Yiwei Ma, Haowei Wang, Xiaoshuai Sun, Rongrong Ji

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV、cs.MM

Comments Accepted by ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04654 2023-12-11 cs.CV cs.AI cs.GR 87%

NeuSD: Surface Completion with Multi-View Text-to-Image Diffusion

Savva Ignatyev, Daniil Selikhanovych, Oleg Voynov, Yiqun Wang, Peter Wonka, Stamatios Lefkimmiatis, Evgeny Burnaev

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01875 2023-09-06 cs.CV cs.LG cs.MM cs.PF eess.IV 87%

Gradient Domain Diffusion Models for Image Synthesis

Yuanhao Gong

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06908 2023-02-28 cs.CV cs.AI cs.LG cs.MM 87%

DiffFaceSketch: High-Fidelity Face Image Synthesis with Sketch-Guided Latent Diffusion Model

Yichen Peng, Chunqi Zhao, Haoran Xie, Tsukasa Fukusato, Kazunori Miyata

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV、cs.MM

Comments 10 pages, 12 figures, and 2 tables, project page: https://puckikk1202.github.io/difffacesketch2023/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11605 2026-03-27 cs.CV cs.AI cs.LG 87%

Scalable High-Resolution Pixel-Space Image Synthesis with Hourglass Diffusion Transformers

可扩展的高分辨率像素空间图像合成与Hourglass扩散变换器

Katherine Crowson, Stefan Andreas Baumann, Alex Birch, Tanishq Mathew Abraham, Daniel Z. Kaplan, Enrico Shippole

机构 * Birchlabs, England, United Kingdom(英国英格兰Birchlabs实验室) Independent Researcher, Florida, United States(美国佛罗里达独立研究员)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 本文提出Hourglass Diffusion Transformer,通过线性扩展像素数量实现高分辨率图像生成,无需传统高分辨率训练技术, 在ImageNet和FFHQ数据集上取得新突破。

Comments 20 pages, 13 figures, project page and code available at https://crowsonkb.github.io/hourglass-diffusion-transformers/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13079 2026-08-17 cs.LG 版本更新 87%

Learning Discrete Decisions for MIPs with Constraint-Aware Diffusion

基于约束感知扩散的混合整数规划离散决策学习

Vincenzo Di Vito, Mehdi Taghizadeh, Deepjyoti Deka, Kaarthik Sundar, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学) MIT(麻省理工学院) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 该研究提出Constrained Graph Diffusion(CGD)框架,结合图扩散模型与可行性投影算子求解混合整数规划,在两类任务上较基线方法提升可行性与质量,且最高加速425倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07430 2026-08-10 cs.LG cs.AI 新提交 87%

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

扩散大语言模型作为目标与对抗者:机制性安全漏洞利用

Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本研究揭示扩散大语言模型(DLLMs)的安全机制漏洞,提出SN-Guided Diffusion黑盒越狱框架,实现高迁移攻击成功率且生成成本远低于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06210 2026-08-07 cs.RO 新提交 87%

VIDP: Variable Impedance Diffusion Policy for Compliant Robot Manipulation from Diverse Demonstrations

VIDP:用于柔顺机器人操作的可变阻抗扩散策略(Variable Impedance Diffusion Policy)

Hisham Khalil, Neil Fernandes, Thomas M. Kwok, Hsiu-Chin Lin, Yue Hu

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 该研究针对接触丰富的机器人操作问题,提出基于模仿学习的可变阻抗控制框架VIDP,利用TP-DAMM从多样本演示中提取物理一致的轨迹分布,无需力传感器即可联合预测位姿与柔顺性,在真实实验中任务成功率及力、跟踪误差表现均优于基线方法。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 87%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23626 2026-06-23 cs.LG cs.AI 新提交 87%

DiT-Reward: Generative Representations for Text-to-Image Reward Modeling

DiT-Reward:文本到图像奖励建模的生成式表示

Yuanming Yang, Guoqing Ma, Bo Wang, Yuan Zhang, Wei Tang, Chenyi Li, Haoyang Huang, Nan Duan

机构 * JD Explore Academy, JD.com(京东探索研究院,京东) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Peking University(北京大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract)

AI总结 提出DiT-Reward,利用预训练文本到图像扩散Transformer的生成表示进行奖励预测,在多个偏好基准上超越HPSv3,并实现1.65倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23391 2026-06-23 cs.LG cs.AI 新提交 87%

Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting

分布感知的扩散-大语言模型用于鲁棒的超长期时间序列预测

Falguni Ghosh, Vahid Hashemi, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Imperial College London(伦敦帝国学院) AUDI AG(奥迪股份公司)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Diffusion-LLM框架,将条件扩散模型集成到基于LLM的预测流程中,学习未来数据条件分布并改善语义对齐,在超长期和少样本预测中显著优于现有LLM基线。

Comments 18 pages, 6 figures, 8 tables. Accepted at 35th International Conference on Artificial Neural Networks (ICANN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17353 2026-06-16 cs.LG cs.AI 版本更新 87%

Learning Permutation Distributions via Reflected Diffusion on Ranks

通过秩上的反射扩散学习排列分布

Sizhuang He, Yangtian Zhang, Shiyang Zhang, David van Dijk

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Soft-Rank Diffusion框架,通过将排列松弛为软秩实现平滑扩散,并引入上下文广义Plackett-Luce去噪器,在排序和组合优化任务上优于现有扩散方法。

Comments 18 pages including the appendix, 7 figures, 9 tables, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13740 2026-06-15 cs.LG 新提交 87%

Efficient On-Device Diffusion LLM Inference with Mobile NPU

基于移动NPU的高效设备端扩散大语言模型推理

Tuowei Wang, Yanfan Sun, Ju Ren

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出首个NPU感知推理框架Diffusion-LLM-on-NPU,通过多块推测解码、双路径渐进修正和交换优化内存运行时,在移动设备上加速扩散大语言模型推理,相比CPU基线实现17-42倍延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07152 2026-06-02 cs.MA 87%

Agents of Diffusion: Enhancing Diffusion Language Models with Multi-Agent Reinforcement Learning for Structured Data Generation (Extended Version)

扩散代理:利用多智能体强化学习增强扩散语言模型以生成结构化数据(扩展版)

Aja Khanal, Kaushik T. Ranade, Rishabh Agrawal, Kalyan S. Basu, Apurva Narayan

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Agents of Diffusion (AoD)框架,通过多智能体强化学习结合扩散语言模型与自回归模型的推理能力,实现高语义新颖性和结构保真度的结构化数据生成。

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26756 2026-05-29 cs.LG 87%

Localizing Memorized Regions in Diffusion Models via Coordinate-Wise Curvature Differences

通过坐标曲率差异定位扩散模型中的记忆区域

Gwangho Kim, Sungyoon Lee

机构 * Department of Computer Science, Hanyang University, Seoul, South Korea(首尔国立大学计算机科学系)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出基于坐标曲率差异的方法,通过减去欠拟合基线的曲率来隔离过拟合驱动的记忆,从而在扩散模型中定位记忆区域,并在Stable Diffusion上优于先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02112 2026-05-22 cs.LG cs.AI cs.CL 87%

Unifying Masked Diffusion Models with Various Generation Orders and Beyond

统一多种生成顺序及超越的掩码扩散模型

Chunsan Hong, Sanghyun Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国延世大学人工智能研究生院)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Order-Expressive Masked Diffusion Model (OeMDM)和Learnable-Order Masked Diffusion Model (LoMDM),统一了不同生成顺序的扩散生成过程,并通过单目标学习生成顺序和扩散骨干,提升了文本生成性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20235 2026-05-21 cs.LG cs.AI 87%

Provably Learning Diffusion Models under the Manifold Hypothesis: Collapse and Refine

在流形假设下证明学习扩散模型:坍缩与细化

Wei Huang, Andi Han, Mingyuan Bai, Huanjian Zhou, Qixin Zhang, Taiji Suzuki, Kenji Fukumizu

机构 * RIKEN AIP & The Institute of Statistical Mathematics(日本理化学研究所AIP及统计数学研究所) University of Sydney(悉尼大学) Agency for Science, Technology and Research & The Institute of Statistical Mathematics(科技研究局及统计数学研究所) The University of Tokyo(东京大学) Nanyang Technological University(南洋理工大学) The Institute of Statistical Mathematics(统计数学研究所)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文在流形假设下研究扩散模型的学习问题,提出了一种由得分函数几何特性驱动的坍缩与细化机制,并通过Score-induced Latent Diffusion模型验证了其理论预测,证明样本复杂性依赖于内在维度而非外在维度。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06462 2026-05-20 cs.CL cs.LG 87%

Diffusion-State Policy Optimization for Masked Diffusion Language Models

扩散状态策略优化用于掩码扩散语言模型

Daisuke Oba, Hiroki Furuta, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究院)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Diffusion-State Policy Optimization(DiSPO),一种用于掩码扩散语言模型的插件信用分配层,通过直接优化中间填充决策来改进生成过程,实验表明其在数学和规划基准测试中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18775 2026-05-20 cs.IR cs.AI 87%

Query-Aware Flow Diffusion for Graph-Based RAG with Retrieval Guarantees

基于查询意识的流扩散图基RAG系统:具有检索保证

Zhuoping Zhou, Davoud Ataee Tarzanagh, Sima Didari, Wenjun Hu, Baruch Gutow, Oxana Verkholyak, Masoud Faraki, Heng Hao, Hankyu Moon, Seungjai Min

机构 * Samsung SDS Research America(三星SDS美国研究院)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出了一种无需训练的Query-Aware Flow Diffusion RAG(QAFD-RAG)系统,通过动态适应查询语义来改进图基RAG系统的检索能力,提供了首次统计保证,证明在弱信号-噪声条件下,QAFD-RAG能够以高概率恢复相关子图。

Comments Published at the International Conference on Learning Representations (ICLR) 2026. 38 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏