arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69953 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69953 篇

2306.17775 2024-11-26 stat.ML cs.LG q-bio.BM 85%

Practical and Asymptotically Exact Conditional Sampling in Diffusion Models

Luhuan Wu, Brian L. Trippe, Christian A. Naesseth, David M. Blei, John P. Cunningham

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

Comments Code: https://github.com/blt2114/twisted_diffusion_sampler

Journal ref NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03511 2024-07-01 cs.CV cs.LG cs.MM 85%

Kandinsky 3.0 Technical Report

Vladimir Arkhipkin, Andrei Filatov, Viacheslav Vasilev, Anastasia Maltseva, Said Azizov, Igor Pavlov, Julia Agafonova, Andrey Kuznetsov, Denis Dimitrov

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

Comments Project page: https://ai-forever.github.io/Kandinsky-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12401 2026-08-06 cs.LG cs.AI 版本更新 85%

Beyond the Dirac Delta: Mitigating Diversity Collapse in Reinforcement Fine-Tuning for Versatile Image Generation

超越狄拉克 delta:缓解强化微调中的多样性崩溃以实现多功能图像生成

Jinmei Liu, Haoru Li, Zhenhong Sun, Chaofeng Chen, Yatao Bian, Bo Wang, Daoyi Dong, Chunlin Chen, Zhi Wang

机构 * Nanjing University(南京大学) Australia National University(澳大利亚国立大学) Wuhan University(武汉大学) National University of Singapore(新加坡国立大学) University of Technology Sydney(技术科技大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract)

AI总结 DRIFT通过激励输出多样性缓解强化微调中的多样性崩溃,提升图像生成的多样性和任务对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21606 2026-07-27 cs.AI 新提交 85%

TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward

TILT:使用模型内在奖励改进扩散模型中的组合生成

Debottam Dutta, Jaehoon Hahm, Jianchong Chen, Romit Roy Choudhury

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 研究如何改进扩散模型的组合生成,提出无训练框架TILT,通过测试时奖励对齐,将组合失败解释为分布重叠模式并定义固有奖励,产生KL约束目标及指导步骤,实验表明该方法能在保图质时提升组合对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19919 2026-07-23 cs.RO cs.LG 新提交 85%

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

扩散重滚动:用于机器人序列预测的可修正去噪

Seonsoo Kim, Seongil Hong, Jun-Gill Kang

机构 * Agency for Defense Development(国防发展局)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 研究提出扩散重滚动框架用于机器人序列预测,能选择性重新去噪局部稳定区域,实现跨视野迭代修正。通过与其他方法对比评估,在多任务基准测试中取得更好性能,支持结构化重新去噪是可修正机器人序列生成的有效机制。

Comments Project Page: https://seonsoo-p1.github.io/DiffusionReRoll/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-06-17 cs.LG cs.AI 版本更新 85%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13955 2026-06-15 cs.LG 新提交 85%

Smoothing Dark Areas in Molecular Latent Diffusion

分子潜在扩散中的暗区平滑

Xi Wang, Jiahan Li, Yuxuan Xia, Yingcheng Wu, Shaoyi Zheng, Shengjie Wang

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract)

AI总结 针对分子潜在扩散中存在的暗区问题,提出拓扑优化VAE(TopVAE),通过训练时内化结构和化学约束,减少暗区,提升离后验鲁棒性,在QM9和GEOM-Drugs上取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02884 2026-06-03 cs.LG cs.AI 85%

Are we really tilting? The mechanics of reward guidance in flow and diffusion models

我们真的在倾斜吗?流模型和扩散模型中奖励引导的机制

Sanjit Dandapanthula, Nicholas M. Boffi

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文通过高斯混合模型和二次奖励的闭式分析,揭示了奖励引导扩散中奖励黑客现象源于Doob h函数的有限粒子插件估计,并提出了无额外计算的闭式奖励阻尼调度来纠正模式内偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25210 2026-05-26 cs.LG cs.AI stat.ML 85%

Multi-Objective Learning for Diffusion Models: A Statistical Theory under Semi-Supervised Learning

扩散模型的多目标学习:半监督学习下的统计理论

Ziheng Cheng, Yixiao Huang, Hanlin Zhu, Haoran Geng, Somayeh Sojoudi, Jitendra Malik, Pieter Abbeel, Xin Guo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 针对扩散模型在多目标学习中因模型容量增大导致统计成本高的问题,提出半监督两阶段训练方法,利用未标记数据通过伪样本蒸馏,证明所需配对样本量仅取决于专家模型复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23649 2026-05-25 eess.SP math.ST stat.TH 85%

Diffusion Fluid Antenna Systems for Resilient ISAC

扩散流体天线系统用于弹性ISAC

Noor Waqar, Kai-Kit Wong, Chan-Byoung Chae, Ross Murch

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出扩散流体天线系统,利用生成式AI驱动的空间自由度选择天线端口,重塑感知特征,实现目标隐身和干扰抑制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19037 2026-05-20 math.NA cs.NA 85%

DG = FEM + flat elements, Part I: Diffusion

DG = FEM + flat elements, Part I: Diffusion

Jiří Szotkowski, Václav Kučera, Chi-Wang Shu, Antoine Quiriny, Jonathan Lambrechts, Nicolas Moës, Jean-François Remacle

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文研究了连续有限元方法(FEM)与不连续Galerkin方法(DG)在泊松问题中的联系,通过在单元界面插入消失厚度的'虚拟'元素,并修改扩散系数以证明FEM公式收敛于Babuška-Zlámal DG方法,采用梯形边积分。该方法通过简单的网格编辑和单个雅可比阈值实现,能够在不修改原有FEM代码的情况下实现DG的简单实现,并支持适应性元素级的FEM与DG切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04663 2026-05-20 cs.LG cs.AI 85%

Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design

重新思考扩散模型强化学习的设计空间:超越损失设计的似然估计的重要性

Jaemoo Choi, Yuchen Zhu, Wei Guo, Petr Molodyk, Bo Yuan, Jinbin Bai, Yi Xin, Molei Tao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) National University of Singapore(新加坡国立大学) Nanjing university(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文研究了扩散模型强化学习设计空间中的关键问题,通过分解策略梯度目标、似然估计器和回放采样方案三个因素,发现基于证据下界(ELBO)的模型似然估计器是实现有效、高效和稳定强化学习优化的主要因素,优于特定策略梯度损失函数的影响。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21893 2026-05-19 cs.LG cs.AI 85%

SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models

SIPO: 用于对齐扩散模型的人类偏好优化的稳定与改进方法

Xiaomeng Yang, Mengping Yang, Junyan Wang, Zhijian Zhou, Zhiyu Tan, Hao Li

机构 * Shanghai Science and Intelligence Institute, Shanghai, China(上海科学与智能研究所) Fudan University, Shanghai, China(复旦大学) Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本研究提出SIPO框架,通过时间步感知的重要性重新加权和梯度稳定技术,解决扩散模型对齐中训练不稳定和策略偏差问题,提升了对齐效果和稳定性。

Comments This version supplements with more detailed content on reasoning and proof, additional experimental results, and ablation studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11480 2026-05-19 cs.LG 85%

Efficient Adjoint Matching for Fine-tuning Diffusion Models

高效对抗匹配用于扩散模型微调

Jeongwoo Shin, Dongsoo Shin, Yuchen Zhu, Wei Guo, Yongxin Chen, Joonseok Lee, Jaewoong Choi, Jaemoo Choi

机构 * Seoul National University(首尔国立大学) Georgia Institute of Technology(佐治亚理工学院) Sungkyunkwan University(庆尚大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出高效对抗匹配(EAM),通过改用线性基础漂移和修改终端成本,解决对抗匹配在扩散模型微调中的计算瓶颈,使训练效率提升4倍并在多个指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00975 2026-05-19 cs.LG cs.AI 85%

Forgetting is Competition: Rethinking Unlearning as Representation Interference in Diffusion Models

遗忘是竞争:重新思考扩散模型中的去学习作为表征干扰

Ashutosh Ranjan, Vivek Srivastava, Shirish Karande, Murari Mandal

机构 * TCS Research(印度 Tata Consulting Engineers 研究部) Kalinga Institute of Industrial Technology(卡林加工业技术学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本文提出SurgUn方法,通过可控竞争而非直接删除或一对一重分配来实现扩散模型的去学习,有效平衡遗忘与保留,提升模型在版权、安全等场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16098 2026-05-18 cs.CR cs.DC 85%

PCDM: A Diffusion-Based Data Poisoning Attack Against Federated Learning Systems

PCDM:一种基于扩散的数据污染攻击对抗联邦学习系统

Wei Sun, Yijun Chen, Bo Gao, Ke Xiong, Yuwei Wang, Pingyi Fan, Khaled Ben Letaief

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出基于扩散的数据污染框架,通过Poisoning-Oriented Conditional Diffusion Model实现对联邦学习系统中局部数据污染的精细控制,同时保证攻击效果与隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11485 2026-05-18 cs.RO 85%

Coordinated Diffusion: Generating Multi-Agent Behavior Without Multi-Agent Demonstrations

协同扩散:无需多智能体演示生成多智能体行为

Lasse Peters, Laura Ferranti, Andrea Bajcsy, Javier Alonso-Mora

机构 * University of California, Berkeley(加州大学伯克利分校) Delft University of Technology(代尔夫特理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Coordinated Diffusion框架,通过用户定义的多智能体成本函数将独立训练的单智能体扩散策略耦合,无需多智能体演示数据,实现多智能体行为协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06779 2026-05-13 cs.AI 85%

VASR: Variance-Aware Systematic Resampling for Reward-Guided Diffusion

VASR:基于奖励引导扩散的方差感知系统性重采样

Shivanshu Shekhar, Sagnik Mukherjee, Jia Yi Zhang, Tong Zhang

机构 * Siebel School of Computing and Data Science(计算与数据科学学院) Department of Statistics(统计学系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出VASR方法,通过分解延续方差与残余方差,解决奖励引导扩散SMC中的快速谱系崩溃问题,提升样本质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10198 2026-05-12 cs.LG cs.AI 85%

Empty SPACE: Cross-Attention Sparsity for Concept Erasure in Diffusion Models

空 SPACE:用于扩散模型概念擦除的交叉注意力稀疏性

Nicola Novello, Andrea M. Tonello

机构 * University of Klagenfurt(克雷格弗尔特大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本文提出SPACE方法,通过迭代修改交叉注意力参数实现概念擦除,提升大模型的擦除效果和鲁棒性,同时实现高稀疏性以降低存储需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08777 2026-05-12 stat.ML cs.LG math.PR 85%

Measuring and Decomposing Mode Separation via the Canonical Diffusion

通过规范扩散测量和分解模式分离

Shaul Tolkovsky, Ori Meidler, Or Zuk

机构 * Department of Statistics and Data Science(统计与数据科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出通过规范扩散的自相关矩阵提取SSA和DA,用于测量模式分离,适用于高维数据和生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06553 2026-05-08 cs.LG 85%

Diverse Sampling in Diffusion Models with Marginal Preserving Particle Guidance

扩散模型中的多样性采样与边际保持粒子引导

Gal Vinograd, Idan Achituve, Ethan Fetaya

机构 * Faculty of Engineering Bar-Ilan University(巴伊兰大学工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 EDDY通过利用福克-普朗克方程的对称性,利用漂移扰动改变粒子轨迹同时保持边际分布,提升样本多样性并保持质量,适用于扩散和流匹配模型。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09861 2026-04-14 cs.AI cs.NE 85%

Evolutionary Token-Level Prompt Optimization for Diffusion Models

扩散模型的进化令牌级提示优化

Domício Pereira Neto, João Correia, Penousal Machado

机构 * University of Coimbra(科英布拉大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出基于遗传算法的扩散模型令牌级提示优化方法,通过进化CLIP模型的token向量提升生成质量,实验显示比基线方法提升23.93%。

Comments 17 pages, 3 figures, 2 tables, 6 appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18960 2026-03-20 cs.HC 85%

Sketch2Topo: Using Hand-Drawn Inputs for Diffusion-Based Topology Optimization

Sketch2Topo: 利用手绘输入进行基于扩散的拓扑优化

Shuyue Feng, Cedric Caremel, Yoshihiro Kawahara

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract)

AI总结 Sketch2Topo通过结合图像到图像生成和图像编辑能力,提升扩散模型在拓扑优化中的定制化与用户交互体验,平衡功能与美学。

Comments 5 pages, 4 figures, accepted at CHI 2026 as a poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22524 2026-03-17 cs.LG 85%

Inference-Time Scaling of Discrete Diffusion Models via Importance Weighting and Optimal Proposal Design

通过重要加权和最优提案设计实现离散扩散模型的推理时间扩展

Zijing Ou, Chinmay Pani, Yingzhen Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出基于SMC框架的重要加权和最优提案设计方法,提升离散扩散模型在推理时的可控制性和样本质量,适用于多个领域任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00502 2026-03-09 cs.LG 85%

Diffusion Alignment as Variational Expectation-Maximization

扩散对齐作为变分期望最大化

Jaewoo Lee, Minsu Kim, Sanghyeok Choi, Inhyuck Song, Sujin Yun, Hyeongyu Kang, Woocheol Shin, Taeyoung Yun, Kiyoung Om, Jinkyoo Park

机构 * KAIST(韩国科学技术院) MongooseAI Mila - Quebec AI Institute(魁北克人工智能研究所) University of Edinburgh(爱丁堡大学) Mila, Université de Montréal(魁北克大学Mila) Omelet

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 DAV通过变分期望最大化框架,在文本生成和DNA设计中实现奖励优化与多样性保持。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02692 2026-03-04 cs.LG cs.AI 85%

Fine-Tuning Diffusion Models via Intermediate Distribution Shaping

通过中间分布塑形微调扩散模型

Gautham Govind Anil, Shaan Ul Haque, Nithish Kannen, Dheeraj Nagaraj, Sanjay Shakkottai, Karthikeyan Shanmugam

机构 * Google DeepMind(谷歌DeepMind) Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 通过中间分布塑形提升扩散模型微调效果,改进文本到图像生成质量

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25170 2026-02-12 cs.LG cs.AI stat.ML 85%

GLASS Flows: Transition Sampling for Alignment of Flow and Diffusion Models

GLASS Flows: 用于对齐流模型与扩散模型的过渡采样

Peter Holderrieth, Uriel Singer, Tommi Jaakkola, Ricky T. Q. Chen, Yaron Lipman, Brian Karrer

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) FAIR, Meta(FAIR与Meta)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 GLASS Flows通过在流匹配模型内部模拟来提升流和扩散模型的推理效率,结合ODE的效率和SDE的随机性,实现文本生成性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02927 2026-02-04 stat.ML cs.LG 85%

Training-Free Self-Correction for Multimodal Masked Diffusion Models

无需训练的多模态掩码扩散模型自校正

Yidong Ouyang, Panwen Hu, Zhengyan Wan, Zhe Wang, Liyan Xie, Dmitriy Bespalov, Ying Nian Wu, Guang Cheng, Hongyuan Zha, Qiang Sun

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) East China Normal University(华东师范大学) University of Virginia(弗吉尼亚大学) University of Minnesota(明尼苏达大学) Drexel university(德雷塞尔大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出无需训练的多模态掩码扩散模型自校正方法,通过减少采样步骤提升生成质量,适用于文本到图像和多模态理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02051 2026-02-03 cs.AI 85%

SIDiffAgent: Self-Improving Diffusion Agent

SIDiffAgent:自改进扩散代理

Shivank Garg, Ayush Singh, Gaurav Kumar Nayak

机构 * Indian Institute of Technology, Roorkee(印度理工学院罗尔基分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 SIDiffAgent通过自改进的扩散代理框架,利用Qwen系列模型提升文本到图像生成的可靠性与可控性,实现更高质量的图像输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22127 2026-01-30 cs.CV cs.GR cs.LG cs.MM 85%

EditYourself: Audio-Driven Generation and Manipulation of Talking Head Videos with Diffusion Transformers

EditYourself: 基于音频驱动的谈话头视频生成与操控的扩散变换器

John Flynn, Wolfgang Paier, Dimitar Dinev, Sam Nhut Nguyen, Hayk Poghosyan, Manuel Toribio, Sandipan Banerjee, Guy Gafni

机构 * Pipio AI Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 EditYourself通过音频驱动的视频到视频编辑框架,实现基于脚本的谈话头视频修改,包括内容的添加、删除和重新定时,同时保持唇同步和时间一致性。

Comments Project page: https://edit-yourself.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏