arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2168 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2168 篇

2607.03752 2026-07-07 cs.CV cs.AI cs.CL cs.MA 新提交 92%

EmCom-Diffusion: Probing Visual Reflection in Emergent Languages via Image Generation

EmCom-Diffusion:通过图像生成探究新兴语言中的视觉反射

Haruumi Omoto, Tadahiro Taniguchi

机构 * Graduate School of Informatics, Kyoto University, Kyoto, Japan(京都大学信息学研究科) Research Organization of Science and Technology, Ritsumeikan University, Shiga, Japan(立命馆大学科学技术研究机构)

专题命中 扩散模型 :diffusion(title,title_cn);image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 研究新兴语言编码输入视觉内容程度的问题,提出EmCom-Diffusion框架,直接测量视觉反射,通过微调文本到图像扩散模型,以重建图像与原图的感知相似性评分,验证其优于现有指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07053 2026-06-08 cs.CV cs.LG 新提交 92%

TrioPose: Native Triple-Stream Diffusion Transformers for Pose-Guided Text-to-Image Generation

TrioPose: 用于姿态引导文本到图像生成的原生三流扩散变换器

Dian Gu, Zhengyi Yang

机构 * Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出TrioPose,基于SD3.5M架构的原生三流姿态感知DiT,通过逐层激活和零初始化双残差注入保持预训练稳定性,并设计可学习关系偏置掩码和姿态引导空间损失加权,在多人姿态引导生成中实现SOTA性能,Human-Art上AP达64.33。

Comments 15 pages (9 pages main body, 6 pages references and appendix), 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07079 2026-06-08 cs.CV 新提交 91%

AsyncPatch Diffusion: spatially-flexible image generation

异步补丁扩散:空间灵活的图像生成

Samuele Papa, Valentin De Bortoli, Guillaume Couairon, Daniel Sýkora, Romuald Elie, Klaus Greff

机构 * Google DeepMind(谷歌DeepMind) University of Amsterdam(阿姆斯特丹大学) The Netherlands Cancer Institute(荷兰癌症研究所)

专题命中 扩散模型 :diffusion(title,summary_cn);image generation(title);inpainting(abstract);分类 cs.CV

AI总结 提出AsyncPatch Diffusion框架,通过为不同空间区域分配不同噪声水平实现异质去噪轨迹,在保持生成质量的同时原生支持图像修复和自适应生成。

Comments 36 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07003 2026-08-10 cs.CV 新提交 90%

HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models

HRDiT:基于现成扩散Transformer模型的无需训练高分辨率图像生成

Yu Xue, Haoxuan Qu, Zhuoling Li, Hongbin Xu, Jianxiong Yin, Simon See, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) South China University of Technology(华南理工大学) NVIDIA AI Tech Centre(英伟达AI技术中心)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 本研究针对现成DiT模型适配高分辨率图像合成的空间紊乱、生成时间长两大挑战,提出新方法,经实验验证其有效性,代码公开。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06875 2026-06-08 cs.CV cs.CR 新提交 90%

Unified Safe In-context Image Generation in Multimodal Diffusion Transformers via Restricting Unsafe Information Flows

统一安全上下文图像生成:在多模态扩散变换器中通过限制不安全信息流

Xiang Yang, Feifei Li, Mi Zhang, Geng Hong, Xiaoyu You, Mi Wen, Min Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 提出UVR框架,通过分析注意力动态中的不安全信息流,在无需训练的情况下对输出补丁进行注意力调制,实现图像生成和编辑任务的安全控制,达到91%和77%的擦除率。

Comments ICML26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09816 2026-06-09 cs.CV cs.AI math.PR 新提交 90%

PTL-Diffusion: Manifold-Aware Diffusion with Periodic Terminal Laws

PTL-Diffusion: 具有周期终端定律的流形感知扩散

Danqi Zhuang, Jisui Huang, Xiaoyue Xi, Andrew Kiggins, Xiaojie Wang, Ke Chen, Yue Wu

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Harvard University(哈佛大学) MIT(麻省理工学院) University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV

AI总结 提出PTL-Diffusion,通过将前向噪声过程收敛到周期高斯终端族而非单一分布,显式嵌入相位结构,改善低维流形上的分布匹配,在点云和人脸数据集上降低误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26735 2026-07-30 cs.CV cs.AI cs.MM 新提交 90%

Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives

文本到图像扩散模型的双重逆推:从提示与噪声双视角

Xiaolong Liu, Junjian Li, Yuan Xiao, Jiaqi Deng, Dayong Ye, Tianqing Zhu, Huan Huo

机构 * University of Technology Sydney(悉尼科技大学) Geely(吉利) City University of Hong Kong(香港城市大学) City University of Macau(澳门城市大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.MM

AI总结 该研究针对现有文本到图像扩散模型提示逆推方法的局限,提出联合恢复语义提示与潜在噪声的Dualin方法,实现了高质量逆推提示与最优图像保真度,为可控图像编辑奠定基础。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06136 2026-07-08 cs.CV cs.MM 新提交 90%

Tuning-Free Latent Diffusion Models for Ultrahigh-Resolution Image Editing

用于超高分辨率图像编辑的免调优潜在扩散模型

Wanglong Lu, Lingming Su, Kaijie Shi, Minglun Gong, Xiaogang Jin, Hanli Zhao, Xianta Jiang

机构 * College of Computer Science and Artificial Intelligence, Wenzhou University(温州大学计算机科学与人工智能学院) Department of Computer Science, Memorial University of Newfoundland(纽芬兰纪念大学计算机科学系) AI Analytics Team, Nasdaq(纳斯达克人工智能分析团队) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);分类 cs.CV、cs.MM

AI总结 针对现有图像编辑方法在高分辨率处理上的局限,提出免调优的UltraDiffEdit框架,通过多尺度渐进编辑、多补丁编码、全局-局部一致性去噪及补丁混合采样等技术,实现高质量超高分辨率图像编辑,处理能力达8K且灵活性高。

Comments 29 pages, 29 figures. Published in IEEE Transactions on Neural Networks and Learning Systems

Journal ref IEEE Transactions on Neural Networks and Learning Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12328 2026-08-14 cs.CL 新提交 89%

LoRA-Diffusion: Parameter-Efficient Fine-Tuning via Low-Rank Trajectory Decomposition

LoRA-Diffusion:基于低秩轨迹分解的参数高效微调方法

Iman Khazrak, Narges Nejad, Mohammadhossein Homaei, Mostafa M. Rezaee, Robert C. Green

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文提出 LoRA-Diffusion,将低秩分解应用于扩散式语言模型的去噪轨迹而非权重,引入轨迹级适配器等技术,在 SST-2 等数据集上取得优异性能,为扩散式语言模型提供参数高效微调框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05722 2026-07-08 cs.CL 新提交 89%

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

Nemotron-Labs-Diffusion:一种统一自回归、扩散和自推测解码的三模式语言模型

Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 介绍了统一AR、扩散和自推测解码的三模式语言模型Nemotron-Labs-Diffusion,通过联合目标训练,能切换模式。研究表明其目标互补,自推测模式表现优,有长期潜力,该模型家族在精度和速度上优于现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26285 2026-06-26 cs.CR cs.AI 新提交 89%

TEMPO-Diffusion: Temporally Exposed Malicious Poisoning of Diffusion Models

TEMPO-Diffusion:扩散模型的时间暴露恶意投毒

William Aiken, Paula Branco, Guy-Vincent Jourdan, Iosif-Viorel Onut

机构 * School of Electrical Engineering and Computer Science, University of Ottawa(电气与计算机科学学院,渥太华大学)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出TEMPO-Diffusion框架,通过时间条件触发实现针对特定类别的后门攻击,支持多子图像后门和修复,并引入CALISA数据集验证攻击有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19315 2026-06-18 cs.LG 新提交 89%

Diffusion-Proof: Recipe for Formal Theorem Proving Beyond Auto-Regressive Generation

Diffusion-Proof:超越自回归生成的正式定理证明配方

Ruida Wang, Rui Pan, Pengcheng Wang, Shizhe Diao, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Diffusion-Proof框架,首次将扩散语言模型应用于形式定理证明,通过全证明生成和局部校正方法,在ProofNet和MiniF2F上分别提升1.61%和6.14%,并解决了一个DeepSeek-Prover-V2-7B无法解决的IMO问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08720 2026-08-11 cs.CV 新提交 89%

High-Quality Exposure Correction with Diffusion-Based Image Generation Priors

基于扩散模型图像生成先验的高质量曝光校正

Ziwen Li, Meng Cao, Jinpu Zhang, Chunyang Li, Long Bao, Heng Sun, Yuehuan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) National University of Defense Technology(国防科技大学) Xiaomi Communications Company Ltd.(小米通讯有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散先验的曝光校正框架DPEC,通过高效微调策略与联合交叉注意力模块,在多数据集上实现了优于现有方法的曝光校正性能。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03937 2026-08-05 cs.CV cs.CR 新提交 89%

Progressive Learning of a Diffusion-based Inpainting Model for Separating Overlapped Fingerprints

用于分离重叠指纹的基于扩散模型的修复模型的渐进式学习

Noor Hussein, Anil K. Jain, Karthik Nandakumar

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 本研究针对重叠指纹分离问题,提出渐进式学习的基于扩散的修复模型,结合指纹先验与多通道条件的感知重叠修复,在公开数据集上实现了高匹配度的组成指纹重建。

Comments Accepted to IJCB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25078 2026-07-29 cs.CV 新提交 89%

Diff-ID: Identity Consistent Facial Image Generation and Morphing via Diffusion Models

Diff-ID:通过扩散模型实现身份一致的面部图像生成与变形

Taimoor Rizwan, Sara Atito, Muhammad Awais, Zhenhua Feng, Josef Kittler

机构 * University of Surrey(萨里大学) Jiangnan University(江南大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 研究针对面部图像合成中高分辨率下身份保持难题,提出Diff-ID框架,通过自定义数据集、集成嵌入及新损失函数实现,实验表明其在身份-真实感权衡上表现出色,还展示了基于DDIM的变形管道,强调联合评估身份保持与真实感。

Comments 20 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22963 2026-07-28 eess.IV cs.CV 新提交 89%

PriSAR: 3D Geometric-Prior-Guided Diffusion for Parameter-Controlled SAR Image Generation

PriSAR:用于参数控制SAR图像生成的3D几何先验引导扩散

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 研究SAR图像在稀疏观测角度下的可控生成问题,提出用3D模型导出的几何先验引导扩散模型的方法,即GeoDiff-SAR,经实验在飞机和车辆数据集上取得较好结果,证明该轻量级3D几何先验可改善视点一致性,用作生成指导。

Comments 17 pages,15 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03180 2026-07-07 cs.CV 新提交 89%

FairFlow: Demystifying and Mitigating Stereotype Bias in Text-to-Image Diffusion Transformers

FairFlow:揭开文本到图像扩散变换器中刻板印象偏差的面纱并减轻其影响

Chen Chen, Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Xiaohan Zhang, Yun Xiong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(华东理工大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究文本到图像扩散变换器中刻板印象偏差问题,通过机理分析找到偏差根源,提出FairFlow框架,能有效中和刻板印象偏差,实现公平与保真平衡,且推理开销小、对复杂提示鲁棒。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04030 2026-08-06 cs.GR cs.AI cs.CV cs.CY cs.LG 新提交 89%

NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts

NuclearDiffusion:用于学习核能概念的文生成像基础模型

Mohammed I. Radaideh, Jeremy Moon, Andre Gala-Garza, Emma Son, Yug Shah, Majdi I. Radaideh

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract);image synthesis(abstract)

AI总结 本研究通过微调开源扩散模型构建核能文生成像模型,发现微调效果依赖生成架构,且微调后开源模型在专业核能图像生成上优于主流商业系统,证实领域特定微调是开发可信领域生成式AI的可行路径。

Comments 29 pages, 10 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03284 2026-08-05 cs.CV cs.AI 新提交 89%

Test-Time Scaling for Safe Text-Guided Image Generation via Intermediate Clean Estimates

通过中间干净图像估计实现安全文本引导图像生成的测试时缩放

Jinya Sakurai, Shueicheng Yan, Xun Xu

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 该研究针对文本到图像扩散模型的安全问题,提出利用中间干净图像估计和稀疏边际目标的测试时缩放方法,在 Stable Diffusion 上实现了更优的安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01775 2026-07-03 cs.LG 新提交 88%

Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding

Set Diffusion: 在自回归与扩散之间插值令牌顺序以实现快速灵活的解码

Marianne Arriola, Volodymyr Kuleshov

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Set Diffusion模型,通过将似然参数化为灵活位置和长度的令牌集,并设计集因果扩散架构,支持任意顺序解码和KV缓存更新,在数学推理、摘要和无条件生成上优于先前的扩散语言模型。

Comments ICML 2026. We provide the code at https://github.com/kuleshov-group/setdlms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04820 2026-08-06 cs.CV 新提交 88%

When Diffusion Models Forget Who You Are: Identity Preservation in Face Inpainting under Large Occlusions

当扩散模型忘记你是谁:大遮挡下人脸修复中的身份保留

Feng Ding, Shuhuai Xie, Yue Zhou, Yulan Zhang, Guopu Zhu, Mengyao Xiao

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 针对大遮挡和冲突文本引导下人脸修复的身份保留难题,提出级联扩散框架ReSem-Face,在CelebAHQ-IDI-5等数据集上验证其身份保留修复及文本编辑质量优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21904 2026-07-27 cs.CV cs.CL 新提交 88%

Diffusion Models in Medical Image Inpainting: Challenges, Solution Taxonomy, and Future Directions

医学图像修复中的扩散模型:挑战、解决方案分类及未来方向

Arthur Dantas Mangussi, Joana Cristo Santos, Ricardo Cardoso Pereira, Ana Carolina Lorena, Mário A. T. Figueiredo, Pedro Henriques Abreu

机构 * Aeronautics Institute of Technology(航空技术学院) Science and Technology Institute, Federal University of São Paulo(圣保罗联邦大学科学与技术研究所) LASIGE, Faculdade de Ciências, Universidade de Lisboa(里斯本大学理学院LASIGE实验室) University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra(科英布拉大学CISUC/LASI - 科英布拉大学信息与系统中心) Instituto Superior Técnico, Universidade de Lisboa, Instituto de Telecomunicações(里斯本大学高等技术学院、电信研究所)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 该研究对基于扩散的医学图像修复方法进行系统回顾,涵盖多方面内容并提出分类法。分析显示相关研究兴趣快速增长,扩散模型在生成合理重建结果及辅助临床任务上表现出色,但也面临缺乏标准化基准等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03899 2026-07-07 cs.CV 新提交 88%

DICT: Data Injection and Contrastive Trajectory Refinement for Conditional Image Generation with Diffusion Models

DICT:用于扩散模型条件图像生成的数据注入和对比轨迹细化

Chunnan Shang, Xin Zhang, Zhizhong Wang, Hongwei Wang

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 针对条件图像生成,提出DICT方法。通过数据注入将噪声扰动条件信号融入早期去噪阶段,结合对比轨迹细化,在统一扩散框架下提升生成质量,且无需引入任务相关架构,跨任务转移效果好。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00402 2026-07-02 cs.CV cs.AI cs.LG 新提交 88%

The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models

文本到图像扩散模型安全对齐中的高效用幻觉

Adeel Yousaf, Soumik Ghosh, James Beetham, Amrit Singh Bedi, Mubarak Shah

机构 * Institute of Artificial Intelligence University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 揭示安全对齐方法在粗粒度指标上看似高效用,但在细粒度语义正确性上显著下降,提出结构感知几何正则化(SAGE)以恢复结构化效用。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19718 2026-06-19 cs.CV 新提交 88%

One-Shot Novel View and Pose Human Image Synthesis via 3D Prior Guided Diffusion Model

基于3D先验引导扩散模型的单样本新视角与姿态人体图像合成

Shenjian Gong, Kangkan Wang, Shanshan Zhang, Jian Yang

机构 * PCA Lab, Key Lab of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, and Jiangsu Key Lab of Image and Video Understanding for Social Security, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院教育部高维信息智能感知与系统重点实验室、江苏省社会安全图像与视频理解重点实验室及PCA实验室) Advanced Laser Technology Laboratory of Anhui Province, Electronic Engineering Institute, National University of Defense Technology, and Jianghuai Advance Technology Center(国防科技大学电子工程学院安徽省先进激光技术实验室及江淮前沿技术中心)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

AI总结 提出一种基于条件去噪扩散模型的方法,利用3D人体先验(法线图和颜色提示)作为几何和颜色条件,从单张参考图像合成任意姿态和视角的高质量人体图像,包括被遮挡部分。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11732 2026-08-13 cs.CR cs.AI 新提交 88%

Fingerprinting Text-to-Image Diffusion Models via Collapsed Generation

基于塌陷生成的文本到图像扩散模型指纹识别

Yuanmin Huang, Chen Chen, Geng Hong, Xiaoyu You, Hui Xue, Zhenxing Qian, Mi Zhang, Min Yang

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract)

AI总结 本研究提出基于塌陷生成的非侵入式指纹框架,可在白盒和黑盒设置下验证文本到图像扩散模型的所有权,且对微调衍生模型及混淆具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06424 2026-08-10 cs.SD cs.CL cs.LG 新提交 88%

Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing

用于文本引导语音修复与编辑的多编解码器离散扩散模型

Iftach Shoham, Tali Dror, Oren Gal, Haim Permuter, Gilad Katz, Eliya Nachmani

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学) University of Haifa(海法大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 该研究提出基于分层编解码器令牌的离散扩散框架SIEDD,其核心架构HiCoDD结合音素级约束等技术,在RealEdit基准中实现最优语音编辑性能,且优于自回归基线,显著提升上下文保留的语音重建与编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03990 2026-08-05 cs.LG 新提交 88%

Assessment of Conditional Diffusion Model for Synthetic Histopathology Image Generation

用于合成组织病理学图像生成的条件扩散模型评估

Seyed Kahaki, Shijie Li, Weijie Chen, Nicholas Petrick

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract)

AI总结 本研究针对合成组织病理学图像生成的评估问题,提出基于数字病理学预训练基础模型改进的FID、IS及精确率-召回率指标,实验发现改进后的IS与下游细胞核分割性能相关性更高,且生成数据多样性对分割性能的提升作用强于单张图像视觉保真度。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07072 2026-07-09 cs.LG 新提交 88%

An Hybrid Quantum-Classical Diffusion Model for Image Generation

一种用于图像生成的混合量子-经典扩散模型

Qipeng Qian, Keli Deng, Yuntao Qian

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract)

AI总结 研究针对量子扩散模型应用于经典高维数据的限制,提出结合经典自动编码器与混合态量子去噪扩散概率模型的混合生成管道,用于图像生成,通过简化反向动力学算法展示该方法在MNIST图像生成上的效果及意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22428 2026-07-27 cs.HC cs.AI cs.LG cs.MM 新提交 87%

Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability

剖析艺术领域的扩散模型:交互式模型调整与基于实践的可解释性

Ahmed M. Abuzuraiq, Philippe Pasquier

机构 * School of Interactive Arts and Technology, Surrey, Canada(交互艺术与技术学院,英国苏城)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.MM

AI总结 研究探讨创意实践中可解释人工智能,提出以实验和干预为中心的方法,通过集成模型调整和交互界面到工作流程,经对Stable Diffusion 1.5分析,助艺术家理解模型组件对生成图像的影响,让大型模型成为创意材料。

Comments Under review for "Explainable AI for the Arts" (N. Bryan-Kinns, Ed.), Springer

详情

展开后加载摘要…

URL PDF HTML 收藏