arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2193 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2193 篇

2607.04801 2026-07-07 cs.CV 新提交 83%

LILAC: Layer-Wise Independent LoRAs and Cascaded Conditioning for Multi-Concept Customization of Diffusion Models

LILAC:用于扩散模型多概念定制的分层独立LoRAs和级联条件处理

Marian Lupascu, Sebastian Ripa, Mihai Trascau, Mariana-Iuliana Georgescu, Ionut Mironica

机构 * Adobe Research, Romania(罗马尼亚Adobe研究院) Department of Computer Science, University of Bucharest, Romania(罗马尼亚布加勒斯特大学计算机科学系) International Computer High School of Bucharest, Romania(罗马尼亚布加勒斯特国际计算机高中)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究个性化文本到图像扩散模型渲染特定主题的难题,提出LILAC框架,通过分层独立训练低秩适配器并级联条件处理,避免参数干扰,无需联合训练,线性扩展且与主干无关,效果良好。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04461 2026-07-07 cs.CV 新提交 83%

Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models

Flash-BoN:扩散模型推理时缩放的即时草稿

Ruchit Rawal, Reza Shirkavand, Sayak Paul, Yuxin Wen, Heng Huang, Yizheng Chen, Tom Goldstein, Gowthami Somepalli

机构 * University of Maryland, College Park(美国马里兰大学帕克分校) Hugging Face(拥抱脸)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像生成推理时缩放,对比简单BoN与引导搜索方法,发现简单BoN在实际评估中表现良好。提出Flash-BoN,结合多种加速方法生成草稿候选,经多阶段验证选最有潜力的优化,在多基准和模型规模下优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03831 2026-07-07 cs.CV cs.AI 新提交 83%

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation

扩散分类器如何做出决策?以偏差为中心的评估

Saba Fathi, Fardin Ayar, Maryam Abdolali, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi

机构 * K. N. Toosi University of Technology(伊朗科技大学) Amirkabir University of Technology(伊朗阿米尔卡比尔理工大学) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究扩散分类器如何决策,通过ASOB-Bench从属性绑定、大小顺序偏差和背景依赖三维度评估,发现其偏差特征与视觉语言模型不同,为构建更稳健模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03517 2026-07-07 cs.LG cs.CV 新提交 83%

Mixture-of-Gaussians-Guided Schedule Design for Brownian Bridge Diffusion Models

用于布朗桥扩散模型的高斯混合引导调度设计

Ron Levi, Michael Elad

机构 * Technion, Israel(以色列理工学院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 研究为布朗桥扩散模型开发调度设计框架,基于高斯混合先验分析其反向动力学,得出理想后验和去噪器,据此制定两个调度设计目标,揭示权衡并证明通用调度存在,实验验证其价值。

Comments 66 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03397 2026-07-07 cs.AI cs.CV 新提交 83%

Efficient bias mitigation in T2I diffusion models using Concept Graphs

使用概念图在文本到图像扩散模型中有效减轻偏差

Mansi, Avinash Kori, Francesco Leofante

机构 * Department of Computing Imperial College London(伦敦帝国理工学院计算系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像扩散模型偏差问题,提出基于概念图对齐的CO-ALIGN方法,在模型内部概念本体上操作,能有效减轻偏差并保留生成完整性,性能优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03256 2026-07-07 cs.CV 新提交 83%

A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms

用于少步扩散模型的可分解探测器:跨主干家族和蒸馏范式的提示、潜在和分数选择性

Patrick Mu Haojie

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究少步蒸馏扩散模型质量差距,用可分解探测器沿三层在三种模式六种强度下注入扰动,报告选择性比率。结果表明不同层读取不同因素,潜在层是整流流主干的近二元探测器。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02563 2026-07-07 cs.CV cs.AI cs.HC 新提交 83%

Attention Dynamics in Diffusion Models: A Visual Analytics Framework for Human-AI Collaboration

扩散模型中的注意力动态:用于人机协作的视觉分析框架

Yiran Xiao, George Legrady

机构 * University of California, Santa Barbara(美国加利福尼亚大学圣巴巴拉分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对扩散模型语义结构难以解释问题,提出视觉分析框架,通过整合定量测度与数据驱动阶段识别,对注意力动态进行结构化分析,助力人机协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20971 2026-07-07 cs.CV 新提交 83%

UNITY: Attention Flow Networks for Adaptive Conditioning in Diffusion

UNITY: 用于扩散模型中自适应条件化的注意力流网络

Aryan Das, Koushik Biswas, Moloud Abdar, Vinay Kumar Verma

机构 * VIT Bhopal, India(印度VIT布巴尔学院) IIIT Delhi, India(印度德里理工学院) The University of Queensland, Australia(澳大利亚昆士兰大学) IIT Kanpur, India(印度坎普尔理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出UNITY,一种两阶段训练范式,通过可变形注意力流网络实现多模态条件共享与专化,在保持图像保真度的同时显著降低推理延迟和内存消耗。

Comments Acccepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01147 2026-07-02 cs.CV 新提交 83%

EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation

EquiSteer: 面向更公平的文本引导图像生成的交叉注意力引导

Tatiana Gaintseva, Akshit Achara, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Noah’s Ark(华为诺亚方舟实验室) King’s College London(伦敦国王学院) Imperial College London(帝国理工学院)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出EquiSteer,一种无需训练的方法,通过在推理时引导交叉注意力激活来减少文本到图像扩散模型中的性别偏见,平均减少高达87%的性别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00183 2026-07-02 cs.CV 新提交 83%

DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation

DriftScope: 测量扩散模型适应的隐藏效应

Héctor Laria, Yiping Han, Julian D. Santamaria, Kai Wang, Bogdan Raducanu, Joost van de Weijer, Alexandra Gomez-Villa

机构 * Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Universitat Autonoma de Barcelona, Barcelona, Spain(巴塞罗那自治大学) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机科学项目) City University of Hong Kong, HK SAR, China(香港城市大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对预训练文本到图像扩散模型的适应(概念定制或遗忘),提出DriftScope诊断工具,通过稀疏自编码器和零样本分类揭示模型权重修改导致语义无关概念系统性漂移,FID/KID无法早期检测,而特定类别零样本准确率下降高达18.9点。

Comments 22 pages, 5 figures, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31683 2026-07-01 cs.CV cs.AI cs.LG 新提交 83%

Histogram-constrained Image Generation

直方图约束的图像生成

Haoming Liu, Yuanhe Guo, Yijia Cao, Shenji Wan, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) New York University(纽约大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出直方图约束图像生成(HIG)框架,通过最优传输理论在扩散模型中精确施加用户指定的分布约束,实现全局与局部之间的中间粒度控制,并展示其在颜色/潜在直方图约束生成和高容量信息嵌入中的应用。

Comments Accepted to ECCV 2026; 31 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31427 2026-07-01 cs.CV cs.CR 新提交 83%

No Prompt, No Leaks: A Robust Generative Steganography Framework via Prompt-Free Diffusion

无需提示,无泄漏:基于无提示扩散的鲁棒生成式隐写框架

Jingwen Cai, Fen Xiao, Shuhua Deng, Xieping Gao

机构 * MOE Key Laboratory of Intelligent Computing and Information Processing, Xiangtan University(湘潭大学智能计算与信息处理教育部重点实验室) College of Information Science and Engineering, Hunan Normal University(湖南师范大学信息科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出无提示扩散图像隐写框架,通过级联仿射耦合模块和风格语义先验控制隐写图像生成,并引入预测-校正机制优化生成轨迹,在安全性、重建精度和可控性上达到先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27978 2026-06-29 cs.CV cs.AI 新提交 83%

Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation

像素空间自回归图像生成的并行展开近似

Jiayi Xu, Di He, Guolin Ke

机构 * Peking University(北京大学) DP Technology

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出并行展开近似(PRA)框架,通过生成低维中间状态并映射回像素令牌,解决像素空间连续令牌自回归生成中高维补丁误差大和训练-推理差距问题,在ImageNet-1K上以135M参数实现FID 2.58,511M参数达到1.94,创像素空间AR模型新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27147 2026-06-26 cs.CV cs.AI 新提交 83%

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

安全自回归图像生成与迭代自改进码本

Yunqi Xue, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院) Torr Vision Group, University of Oxford(牛津大学Torr视觉组)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对自回归统一多模态模型生成图像的安全性问题,提出迭代自改进码本方法,利用模型自身判断不安全图像并修正码本映射,消除有害输出并保证生成质量。

Comments 10 pages including references, 8 figures, accepted for publication at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26764 2026-06-26 cs.CV cs.AI 新提交 83%

Anatomy-Guided Residual Motion Diffusion for Controllable 4D Cardiac MRI Synthesis

解剖引导的残差运动扩散用于可控4D心脏MRI合成

Yiheng Cao, Gustavo Andrade-Miranda, Jiatian Zhang, Lingxiao Zhao, Xin Gao

机构 * Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Science(中国科学院苏州生物医学工程技术研究所) Systemes Complexes et Intelligence Artificielle, IMT Mines Ales(复杂系统与人工智能实验室,IMT 阿莱斯矿业学院) School of Artificial Intelligence and Advanced Computing, Xi’an Jiaotong-Liverpool University(西交利物浦大学人工智能与先进计算学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出一种4D可控生成框架,通过半监督VAE解耦解剖与运动,利用级联潜扩散模型生成时序一致的心脏MRI,在跨厂商数据上提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24000 2026-06-24 cs.LG cond-mat.dis-nn cs.CR cs.CV 新提交 83%

Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models

循环去噪揭示扩散模型中的超稳定记忆

Rishabh Sharma, Stefano Martiniani

机构 * Simons Center for Computational Physical Chemistry, New York University(纽约大学西蒙斯计算物理化学中心) Center for Soft Matter Research, Department of Physics, New York University(纽约大学物理系软物质研究中心) Center for Neural Science, New York University(纽约大学神经科学中心) Courant Institute of Mathematical Sciences, New York University(纽约大学库朗数学科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出循环去噪方法,通过重复正向和反向扩散暴露扩散模型中的记忆化训练图像,无需梯度或提示,揭示超稳定吸引子及其隐私与版权影响。

Comments 22 pages, 7 main figures; supplementary material included. Supplementary movies available at the project webpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22958 2026-06-23 cs.LG cs.CV 新提交 83%

PG-MAP: Joint MAP Optimization for Inference-Time Alignment of Diffusion and Flow-Matching Models

PG-MAP:扩散与流匹配模型推理时对齐的联合MAP优化

Ruolan Sun, Pawel Polak

机构 * Stony Brook University(石溪大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出PG-MAP框架,通过轨迹级Gibbs-MAP/近端能量优化联合调节条件c和潜变量z_t,实现扩散与流匹配模型的推理时对齐,无需训练即可提升对齐指标。

Comments Code: https://github.com/sophialanlan/PG-MAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20310 2026-06-19 cs.CV 新提交 83%

Through the PRISM: Preference Representation in Intermediate States of Video Diffusion Models

通过PRISM:视频扩散模型中间状态中的偏好表示

Haoxuan Wu, Lai Man Po, Mengyang Liu, Kun Li, Hongzheng Yang, Wei Liu

机构 * City University of Hong Kong(香港城市大学) Video Rebirth The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PRISM方法,利用冻结的视频扩散骨干网络和轻量级查询聚合头从噪声潜变量中解码偏好信号,实现高精度偏好预测和噪声鲁棒性,支持早期最佳采样以降低计算成本并提升视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18554 2026-06-18 cs.CV 新提交 83%

Forged Calamity: Benchmark for Cross-Domain Synthetic Disaster Detection in the Age of Diffusion

伪造灾难:扩散时代跨域合成灾难检测基准

Duc-Manh Phan, Quoc-Duy Tran, Duy-Khang Do, Anh-Tuan Vo, Hai-Dang Nguyen, Trong Le Do, Mai-Khiem Tran, Vinh-Tiep Nguyen, Tam V. Nguyen, Isao Echizen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(胡志明市国家大学下属理科大学) Vietnam National University, Ho Chi Minh(胡志明市国家大学) University of Information Technology, VNU-HCM(胡志明市国家大学下属信息技术大学) University of Dayton(代顿大学) National Institute of Informatics(国立信息学研究所)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对扩散模型生成的逼真灾难图像难以检测的问题,提出包含30000张图像(6000张真实、24000张合成)的基准数据集,实验发现微调检测器在未知生成器上准确率下降50%,零样本检测器也不稳定,凸显了跨域检测的迫切需求。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15236 2026-06-17 cs.CV 新提交 83%

Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion

展示信号,隐藏噪声:像素空间扩散的频谱强制

Weichen Fan, Haiwen Diao, Penghao Wu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出频谱强制方法,通过在像素空间扩散模型中对噪声输入施加时变低通滤波器,引导模型关注信号频带,提升训练效率和生成质量。

Comments Code link: https://github.com/WeichenFan/Spectral_Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15796 2026-06-16 cs.CV cs.AI 新提交 83%

DifFRACT: Diffusion Feature Reconstruction and Attribution for Circuit Tracing

DifFRACT:用于电路追踪的扩散特征重构与归因

Artyom Mazur, Nina Konovalova, Aibek Alanov

机构 * HSE University(高等经济学院) FusionBrain Lab(FusionBrain实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文扩展了基于转码器的电路追踪方法到多模态扩散Transformer,通过训练时间步条件转码器近似MLP子层,实现精确的特征级归因并恢复可解释电路,揭示了属性绑定和跨流语义传播机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14792 2026-06-16 cs.CV cs.AI 新提交 83%

Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

基于离散扩散模型的视觉-文本思维高效强化学习

Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai, Eunho Yang, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony AI(索尼AI) AITRICS Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出用离散扩散模型替代自回归模型进行多模态强化学习,通过局部视觉编辑减少计算量,并设计分解奖励分配策略解决跨模态干扰问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14756 2026-06-16 cs.CV cs.AI cs.LG 新提交 83%

Divide-and-Denoise: A Game-Theoretic Method for Fairly Composing Diffusion Models

分而除噪:一种公平组合扩散模型的博弈论方法

Abhi Gupta, Polina Barabanshchikova, Vikas Garg, Samuel Kaski, Tommi Jaakkola

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出Divide-and-Denoise方法,通过公平分配博弈协调多个预训练扩散模型,在采样时划分区域并引导各模型去噪,解决模型主导或冲突问题,在条件图像生成中优于基线。

Comments Accepted as spotlight at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14035 2026-06-15 cs.CV 新提交 83%

Toward 360-Degree Indoor Panorama Editing via Tuning-Free Diffusion Model with Refocusing Cross-Attention

面向360度室内全景编辑的基于重聚焦交叉注意力的免调优扩散模型

Dinh-Khoi Vo, Nhut-Thanh Le-Hinh, Viet-Tham Huynh, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 提出FocusDiff框架,通过重聚焦交叉注意力实现免调优的精确区域编辑,并扩展到360度室内全景编辑,在局部编辑基准LIMB上优于现有零样本方法。

Comments ICCCI 2026. Project page: https://vdkhoi20.github.io/FocusDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12987 2026-06-12 cs.CV cs.AI cs.LG cs.RO 新提交 83%

Diffusion Transformer World-Action Model for AV Scene Prediction

扩散Transformer世界-动作模型用于自动驾驶场景预测

Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出紧凑潜世界模型,结合扩散Transformer(DiT)预测未来场景,在nuScenes上实现4.8倍更好的KID,并实现动作可控性(转向ρ=0.81)。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12977 2026-06-12 cs.CV cs.AI cs.CR cs.LG 新提交 83%

Efficient, Robust, and Anti-Collusion Fingerprinting of Image Diffusion Models

图像扩散模型的高效、鲁棒且抗共谋指纹识别

Jianwei Fei, Yunshu Dai, Zhihua Xia, Xiaochun Cao, Jiantao Zhou, Alessandro Piva, Benedetta Tondi

机构 * University of Florence(佛罗伦萨大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) College of Cyber Security, Jinan University(暨南大学网络空间安全学院) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科技学院计算机与信息科学系) University of Siena(锡耶纳大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对生成式文本到图像模型指纹识别缺乏抗共谋攻击鲁棒性的问题,提出基于个性化归一化模块的编码方法,并引入无损函数不变参数变换的抗共谋机制,实现高保真、高鲁棒且首次主动抵御共谋攻击的指纹识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09909 2026-06-10 cs.CR cs.AI cs.CV 新提交 83%

Bypassing Copyright Protection in Diffusion-based Customization via Two-Stage Latent Feature Optimization

通过两阶段潜在特征优化绕过基于扩散的定制中的版权保护

Ziang Xu, Wenbo Yu, Hongyao Yu, Hao Fang, Jiawei Kong, Bin Chen, Hao Wu, Shu-Tao Xia, Zhiyong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出两阶段潜在特征优化(TS-LFO)攻击方法,通过潜在去噪和重建阶段恢复被防御破坏的映射,有效绕过扩散模型定制中的版权保护。

Comments accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07036 2026-06-08 cs.CV cs.AI cs.CE cs.LG 新提交 83%

STREAM: Stochastic Riemannian Flow Matching with Anisotropic Decoder for Digital Histopathology Image Generation

STREAM: 用于数字组织病理学图像生成的随机黎曼流匹配与各向异性解码器

Won June Cho, Daeky Jeong, Hyeongyeol Lim, Hongjun Yoon

机构 * DEEPNOID Inc.(DEEPNOID公司)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出STREAM框架,利用组织病理学视觉基础模型的patch-token特征作为潜在空间,通过黎曼流匹配生成高质量组织病理学图像,解决条件崩溃问题,并设计各向异性解码器提升生成质量。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20722 2026-06-23 cs.GR cs.CL cs.CV cs.LG 新提交 82%

Multimodal Image Colorization: Quantifying the Impact of Text-Conditioned Guidance on Grayscale-to-Color Translation

多模态图像着色:量化文本条件引导对灰度到彩色转换的影响

Colten Reissmann, Hugo Garrido-Lestache Belinchon

机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV、cs.GR

AI总结 本文通过U-Net和Stable Diffusion 1.5两种架构,量化了CLIP文本条件对灰度图像着色质量的影响,发现文本条件显著提升了PSNR、SSIM和色彩度,降低了LPIPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14401 2026-08-17 stat.ML cs.LG 新提交 82%

Offline Deep Q* Estimation with Diffusion Models

基于扩散模型的离线深度Q*估计

Xiaohong Chen, Yuling Jiao, Lican Kang, Jerry Zhijian Yang, Chen Zhong

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对离线RL中最优贝尔曼算子不可观测的问题,提出将算子估计与价值学习解耦的框架,用条件扩散模型估计奖励律和转移核,建立了无完备性假设的理论收敛速率,实验验证了方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏