arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69953 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69953 篇

2607.01147 2026-07-02 cs.CV 新提交 83%

EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation

EquiSteer: 面向更公平的文本引导图像生成的交叉注意力引导

Tatiana Gaintseva, Akshit Achara, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Noah’s Ark(华为诺亚方舟实验室) King’s College London(伦敦国王学院) Imperial College London(帝国理工学院)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出EquiSteer,一种无需训练的方法,通过在推理时引导交叉注意力激活来减少文本到图像扩散模型中的性别偏见,平均减少高达87%的性别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00183 2026-07-02 cs.CV 新提交 83%

DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation

DriftScope: 测量扩散模型适应的隐藏效应

Héctor Laria, Yiping Han, Julian D. Santamaria, Kai Wang, Bogdan Raducanu, Joost van de Weijer, Alexandra Gomez-Villa

机构 * Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Universitat Autonoma de Barcelona, Barcelona, Spain(巴塞罗那自治大学) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机科学项目) City University of Hong Kong, HK SAR, China(香港城市大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对预训练文本到图像扩散模型的适应(概念定制或遗忘),提出DriftScope诊断工具,通过稀疏自编码器和零样本分类揭示模型权重修改导致语义无关概念系统性漂移,FID/KID无法早期检测,而特定类别零样本准确率下降高达18.9点。

Comments 22 pages, 5 figures, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27285 2026-07-02 cs.CV cs.CR 版本更新 83%

Rethinking Robust Adversarial Concept Erasure in Diffusion Models

重新思考扩散模型中的鲁棒对抗性概念擦除

Qinghong Yin, Yu Tian, Heming Yang, Xiang Chen, Xianlin Zhang, Yue Ming, Xueming Li, Yue Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对扩散模型中概念擦除的对抗训练忽视概念语义导致拟合不足的问题,提出语义引导的鲁棒对抗概念擦除方法S-GRACE,显著提升擦除性能26%并减少90%训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11925 2026-07-02 cs.CV 版本更新 83%

Continuous Speculative Decoding for Autoregressive Image Generation

连续推测解码用于自回归图像生成

Zili Wang, Zheng Zhang, Kun Ding, Qi Yang, Fei Li, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) JD.COM Inc(京东集团股份有限公司) China Tower Corporation Limited(中国铁塔股份有限公司)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出连续推测解码方法,通过近似准则、去噪轨迹对齐和接受-拒绝采样,加速连续视觉自回归模型,实现2倍以上加速且保持生成质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31683 2026-07-01 cs.CV cs.AI cs.LG 新提交 83%

Histogram-constrained Image Generation

直方图约束的图像生成

Haoming Liu, Yuanhe Guo, Yijia Cao, Shenji Wan, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) New York University(纽约大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出直方图约束图像生成(HIG)框架,通过最优传输理论在扩散模型中精确施加用户指定的分布约束,实现全局与局部之间的中间粒度控制,并展示其在颜色/潜在直方图约束生成和高容量信息嵌入中的应用。

Comments Accepted to ECCV 2026; 31 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31427 2026-07-01 cs.CV cs.CR 新提交 83%

No Prompt, No Leaks: A Robust Generative Steganography Framework via Prompt-Free Diffusion

无需提示,无泄漏:基于无提示扩散的鲁棒生成式隐写框架

Jingwen Cai, Fen Xiao, Shuhua Deng, Xieping Gao

机构 * MOE Key Laboratory of Intelligent Computing and Information Processing, Xiangtan University(湘潭大学智能计算与信息处理教育部重点实验室) College of Information Science and Engineering, Hunan Normal University(湖南师范大学信息科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出无提示扩散图像隐写框架,通过级联仿射耦合模块和风格语义先验控制隐写图像生成,并引入预测-校正机制优化生成轨迹,在安全性、重建精度和可控性上达到先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30332 2026-06-30 cs.CV 83%

UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception

UniGP:驯服扩散Transformer以实现先验保留的统一生成与感知

Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zeekr Automobile R&D Co., Ltd.(小鹏汽车研发有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出UniGP框架,基于MMDiT通过简单联合训练统一可控生成与密集预测,无需复杂任务设计,保留骨干先验,在多个任务上超越先前统一方法并与专用方法持平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29801 2026-06-30 cs.CV 83%

Concept Removal Guidance: Evidence-Calibrated Negative Guidance for Safe Diffusion Sampling

概念移除引导:用于安全扩散采样的证据校准负引导

Yoonseok Choi, Chaeyoung Oh, Hyunjun Choi, Seokin Seo, Kee-Eung Kim

机构 * KAIST(韩国科学技术院) KIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出概念移除引导(CRG),一种无需训练的方法,通过从模型噪声预测中估计不良概念存在并自适应校准负引导权重,在保持良性保真度的同时降低攻击成功率。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28628 2026-06-30 eess.IV cs.CV cs.LG 83%

Envisage: Diffusion-Based Rhinoplasty Goal Visualization with Mask-Decomposed Evaluation

Envisage:基于扩散的鼻整形目标可视化与掩码分解评估

Mudit Agarwal, Amit D. Bhrany

机构 * University of Washington(华盛顿大学) University of Washington School of Medicine(华盛顿大学医学院) Department of Otolaryngology–Head and Neck Surgery(耳鼻喉科–头颈外科部门)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出Envisage扩散修复管线,从单张正面照片可视化鼻整形目标,并引入SurgicalScore掩码分解协议评估局部编辑质量,克服全脸身份指标在硬合成编辑下的混淆。

Comments 29 pages, 4 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00654 2026-06-30 cs.CV 83%

Seed-to-Seed: Unpaired Image Translation in Diffusion Seed Space

种子到种子:扩散种子空间中的无配对图像翻译

Or Greenberg, Eran Kishon, Dani Lischinski

机构 * General Motors R&D(通用汽车研发中心) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出一种结合GAN和扩散模型的无配对图像翻译方法,通过利用预训练扩散模型的种子空间语义信息,实现复杂汽车场景的结构保持翻译,优于现有方法。

Comments British Machine Vision Conference (BMVC) 2025. Official proceedings: https://bmvc2025.bmva.org/proceedings/154/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05934 2026-06-30 cs.CV 83%

AD-DAE: Alzheimer's Disease Progression Modeling with Unpaired Longitudinal MRI using Diffusion Auto-Encoders

AD-DAE:利用未配对纵向MRI进行阿尔茨海默病进展建模的扩散自编码器

Ayantika Das, Arunima Sarkar, Keerthi Ram, Mohanasankar Sivaprakasam

机构 * Indian Institute of Technology Madras (IITM)(印度理工学院马德拉斯分校) Sudha Gopalakrishnan Brain Centre (SGBC), IITM(苏达·戈帕拉克里希南脑中心(SGBC),印度理工学院马德拉斯分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出AD-DAE框架,通过扩散自编码器在无配对纵向MRI数据中建模阿尔茨海默病进展,利用紧凑的潜在空间生成后续影像。

Comments Accepted in IEEE Journal of Biomedical and Health Informatics ( https://ieeexplore.ieee.org/document/11579738 )

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07711 2026-06-30 cs.CV cs.AI 83%

SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces

结构状态空间模型与视频扩散模型的结合:利用结构状态空间实现高效长时视频生成

Yuta Oshima, Shohei Taniguchi, Masahiro Suzuki, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出利用结构状态空间模型作为视频扩散模型的时序特征提取器,以解决传统注意力层在生成长视频序列时的计算成本问题,实验表明结构状态空间模型在内存使用和性能上更具优势。

Comments Accepted as a workshop paper at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27978 2026-06-29 cs.CV cs.AI 新提交 83%

Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation

像素空间自回归图像生成的并行展开近似

Jiayi Xu, Di He, Guolin Ke

机构 * Peking University(北京大学) DP Technology

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出并行展开近似(PRA)框架,通过生成低维中间状态并映射回像素令牌,解决像素空间连续令牌自回归生成中高维补丁误差大和训练-推理差距问题,在ImageNet-1K上以135M参数实现FID 2.58,511M参数达到1.94,创像素空间AR模型新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06668 2026-06-29 cs.CV cs.LG eess.IV 版本更新 83%

StableMotion: One-Step Motion Estimation with Diffusion Prior

StableMotion: 基于扩散先验的单步运动估计

Ziyi Wang, Haipeng Li, Lin Sui, Tianhao Zhou, Hai Jiang, Lang Nie, Bing Zeng, Shuaicheng Liu

机构 * Yingcai Honors College, University of Electronic Science and Technology of China(电子科技大学英才实验学院) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Paradigm Inc.(第四范式) School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(重庆邮电大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出StableMotion框架,利用预训练图像扩散模型的几何和内容先验,通过自适应集成策略和单步推理设计,在图像矫正任务中实现高效、高保真的运动估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01014 2026-06-29 cs.CV 版本更新 83%

An Expectation-Maximization Algorithm for Training Clean Diffusion Models from Corrupted Observations

一种从损坏观测中训练清洁扩散模型的期望最大化算法

Weimin Bai, Yifei Wang, Wenzheng Chen, He Sun

机构 * Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) College of Future Technology, Peking University(北京大学未来技术学院) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心) Yuanpei College, Peking University(北京大学元培学院) State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出EMDiffusion,一种期望最大化方法,通过交替重建和模型更新从损坏观测中训练扩散模型,在多种成像逆任务上达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27147 2026-06-26 cs.CV cs.AI 新提交 83%

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

安全自回归图像生成与迭代自改进码本

Yunqi Xue, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院) Torr Vision Group, University of Oxford(牛津大学Torr视觉组)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对自回归统一多模态模型生成图像的安全性问题,提出迭代自改进码本方法,利用模型自身判断不安全图像并修正码本映射,消除有害输出并保证生成质量。

Comments 10 pages including references, 8 figures, accepted for publication at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26764 2026-06-26 cs.CV cs.AI 新提交 83%

Anatomy-Guided Residual Motion Diffusion for Controllable 4D Cardiac MRI Synthesis

解剖引导的残差运动扩散用于可控4D心脏MRI合成

Yiheng Cao, Gustavo Andrade-Miranda, Jiatian Zhang, Lingxiao Zhao, Xin Gao

机构 * Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Science(中国科学院苏州生物医学工程技术研究所) Systemes Complexes et Intelligence Artificielle, IMT Mines Ales(复杂系统与人工智能实验室,IMT 阿莱斯矿业学院) School of Artificial Intelligence and Advanced Computing, Xi’an Jiaotong-Liverpool University(西交利物浦大学人工智能与先进计算学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出一种4D可控生成框架,通过半监督VAE解耦解剖与运动,利用级联潜扩散模型生成时序一致的心脏MRI,在跨厂商数据上提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24000 2026-06-24 cs.LG cond-mat.dis-nn cs.CR cs.CV 新提交 83%

Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models

循环去噪揭示扩散模型中的超稳定记忆

Rishabh Sharma, Stefano Martiniani

机构 * Simons Center for Computational Physical Chemistry, New York University(纽约大学西蒙斯计算物理化学中心) Center for Soft Matter Research, Department of Physics, New York University(纽约大学物理系软物质研究中心) Center for Neural Science, New York University(纽约大学神经科学中心) Courant Institute of Mathematical Sciences, New York University(纽约大学库朗数学科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出循环去噪方法,通过重复正向和反向扩散暴露扩散模型中的记忆化训练图像,无需梯度或提示,揭示超稳定吸引子及其隐私与版权影响。

Comments 22 pages, 7 main figures; supplementary material included. Supplementary movies available at the project webpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22958 2026-06-23 cs.LG cs.CV 新提交 83%

PG-MAP: Joint MAP Optimization for Inference-Time Alignment of Diffusion and Flow-Matching Models

PG-MAP:扩散与流匹配模型推理时对齐的联合MAP优化

Ruolan Sun, Pawel Polak

机构 * Stony Brook University(石溪大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出PG-MAP框架,通过轨迹级Gibbs-MAP/近端能量优化联合调节条件c和潜变量z_t,实现扩散与流匹配模型的推理时对齐,无需训练即可提升对齐指标。

Comments Code: https://github.com/sophialanlan/PG-MAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03448 2026-06-23 cs.CV cs.AI 版本更新 83%

Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation

多主体图像生成的层次化概念到外观引导

Yijia Xu, Zihao Wang, Haokun Gui, Jinshi Cui

机构 * Peking University(北京大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出层次化概念到外观引导框架(CAG),通过VAE dropout训练和对应感知掩码注意力模块,实现多主体图像生成中身份一致性和精确组合控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20310 2026-06-19 cs.CV 新提交 83%

Through the PRISM: Preference Representation in Intermediate States of Video Diffusion Models

通过PRISM:视频扩散模型中间状态中的偏好表示

Haoxuan Wu, Lai Man Po, Mengyang Liu, Kun Li, Hongzheng Yang, Wei Liu

机构 * City University of Hong Kong(香港城市大学) Video Rebirth The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PRISM方法,利用冻结的视频扩散骨干网络和轻量级查询聚合头从噪声潜变量中解码偏好信号,实现高精度偏好预测和噪声鲁棒性,支持早期最佳采样以降低计算成本并提升视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18554 2026-06-18 cs.CV 新提交 83%

Forged Calamity: Benchmark for Cross-Domain Synthetic Disaster Detection in the Age of Diffusion

伪造灾难:扩散时代跨域合成灾难检测基准

Duc-Manh Phan, Quoc-Duy Tran, Duy-Khang Do, Anh-Tuan Vo, Hai-Dang Nguyen, Trong Le Do, Mai-Khiem Tran, Vinh-Tiep Nguyen, Tam V. Nguyen, Isao Echizen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(胡志明市国家大学下属理科大学) Vietnam National University, Ho Chi Minh(胡志明市国家大学) University of Information Technology, VNU-HCM(胡志明市国家大学下属信息技术大学) University of Dayton(代顿大学) National Institute of Informatics(国立信息学研究所)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对扩散模型生成的逼真灾难图像难以检测的问题,提出包含30000张图像(6000张真实、24000张合成)的基准数据集,实验发现微调检测器在未知生成器上准确率下降50%,零样本检测器也不稳定,凸显了跨域检测的迫切需求。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05647 2026-06-18 eess.IV cs.CV 83%

Diffusion-Based Limited-Angle CT Reconstruction under Noisy Conditions

基于扩散的噪声条件下有限角度CT重建

Jiaqi Guo, Santiago López-Tapia

机构 * Dept. of Electrical and Computer Engineering, Northwestern University, Evanston, IL, USA(电气与计算机工程系,西北大学,埃文斯顿,伊利诺伊州,美国)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出基于扩散的有限角度CT重建方法,通过Mean-Reverting随机微分方程完成缺失角度视图,结合噪声感知校正机制提升鲁棒性,实验表明在不同噪声强度和采集条件下均表现优异。

Comments Accepted at the 2025 IEEE International Conference on Image Processing (ICIP), Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15236 2026-06-17 cs.CV 新提交 83%

Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion

展示信号,隐藏噪声:像素空间扩散的频谱强制

Weichen Fan, Haiwen Diao, Penghao Wu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出频谱强制方法,通过在像素空间扩散模型中对噪声输入施加时变低通滤波器,引导模型关注信号频带,提升训练效率和生成质量。

Comments Code link: https://github.com/WeichenFan/Spectral_Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15796 2026-06-16 cs.CV cs.AI 新提交 83%

DifFRACT: Diffusion Feature Reconstruction and Attribution for Circuit Tracing

DifFRACT:用于电路追踪的扩散特征重构与归因

Artyom Mazur, Nina Konovalova, Aibek Alanov

机构 * HSE University(高等经济学院) FusionBrain Lab(FusionBrain实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文扩展了基于转码器的电路追踪方法到多模态扩散Transformer,通过训练时间步条件转码器近似MLP子层,实现精确的特征级归因并恢复可解释电路,揭示了属性绑定和跨流语义传播机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14792 2026-06-16 cs.CV cs.AI 新提交 83%

Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

基于离散扩散模型的视觉-文本思维高效强化学习

Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai, Eunho Yang, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony AI(索尼AI) AITRICS Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出用离散扩散模型替代自回归模型进行多模态强化学习,通过局部视觉编辑减少计算量,并设计分解奖励分配策略解决跨模态干扰问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14756 2026-06-16 cs.CV cs.AI cs.LG 新提交 83%

Divide-and-Denoise: A Game-Theoretic Method for Fairly Composing Diffusion Models

分而除噪:一种公平组合扩散模型的博弈论方法

Abhi Gupta, Polina Barabanshchikova, Vikas Garg, Samuel Kaski, Tommi Jaakkola

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出Divide-and-Denoise方法,通过公平分配博弈协调多个预训练扩散模型,在采样时划分区域并引导各模型去噪,解决模型主导或冲突问题,在条件图像生成中优于基线。

Comments Accepted as spotlight at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00352 2026-06-16 cs.CV cs.AI 83%

Detecting AI-Generated Images via Diffusion Snap-Back Reconstruction: A Forensic Approach

通过扩散快回重建检测AI生成图像:一种取证方法

Mohd Ruhul Ameen, Akif Islam

机构 * Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology(1 计算机科学与工程系,孟加拉国工程与技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过扩散模型重建图像时的响应行为来检测AI生成图像,利用LPIPS等指标分析图像与扩散模型去噪行为的匹配程度,实验显示方法在识别准确率上表现优异。

Comments Accepted at the 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence and Networking (QPAIN 2026)

Journal ref 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence & Networking (QPAIN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10389 2026-06-16 cs.CV cs.AI 版本更新 83%

Region-Adaptive Sampling for Diffusion Transformers

扩散变压器的区域自适应采样

Ziming Liu, Yifan Yang, Chengruidong Zhang, Yiqi Zhang, Lili Qiu, Yang You, Yuqing Yang

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出RAS,一种无需训练的自适应采样策略,通过动态分配不同采样比例到图像区域,实现扩散变压器2.36-2.51倍加速且质量损失极小。

Comments CVPR'26 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14035 2026-06-15 cs.CV 新提交 83%

Toward 360-Degree Indoor Panorama Editing via Tuning-Free Diffusion Model with Refocusing Cross-Attention

面向360度室内全景编辑的基于重聚焦交叉注意力的免调优扩散模型

Dinh-Khoi Vo, Nhut-Thanh Le-Hinh, Viet-Tham Huynh, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 提出FocusDiff框架,通过重聚焦交叉注意力实现免调优的精确区域编辑,并扩展到360度室内全景编辑,在局部编辑基准LIMB上优于现有零样本方法。

Comments ICCCI 2026. Project page: https://vdkhoi20.github.io/FocusDiff

详情

展开后加载摘要…

URL PDF HTML 收藏