arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-24 至 2026-03-24 共收录 97 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 97 篇

2603.22275 2026-03-24 cs.CV 85%

Repurposing Geometric Foundation Models for Multi-view Diffusion

将几何基础模型重新利用于多视图扩散

Wooseok Jang, Seonghu Jeon, Jisang Han, Jinhyeok Choi, Minkyung Kwon, Seungryong Kim, Saining Xie, Sainan Liu

机构 * KAIST AI(韩国科学技术院人工智能实验室) New York University(纽约大学) Intel Labs(英特尔实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Geometric Latent Diffusion框架,利用几何一致的特征空间作为多视图扩散的潜在空间,提升多视角生成的几何一致性和图像质量。

Comments project website: https://cvlab-kaist.github.io/GLD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22125 2026-03-24 cs.CV 83%

DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment

DA-VAE:通过细节对齐实现扩散模型的插件式潜在压缩

Xin Cai, Zhiyuan You, Zhoutong Zhang, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DA-VAE,通过轻量级调整预训练扩散模型,实现潜在空间压缩,使1024×1024图像生成使用32×32 tokens,比原模型减少40%,并支持2048×2048生成,保持图像质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19575 2026-03-24 cs.CV 83%

MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation

MagicSeg: 通过反事实扩散模型自动生成实现开放世界分割预训练

Kaixin Cai, Pengzhen Ren, Jianhua Han, Yi Zhu, Hang Xu, Jianzhuang Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) PengCheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 MagicSeg通过反事实扩散模型自动生成数据集,提升开放世界语义分割性能,实验在PASCAL VOC等数据集上取得SOTA结果。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21348 2026-03-24 cs.CV 83%

Efficient Coarse-to-Fine Diffusion Models with Time Step Sequence Redistribution

高效粗到细扩散模型与时间步序列重分布

Yu-Shan Tai, An-Yeu, Wu

机构 * Graduate Institute of Electrical Engineering(电气工程研究所) National Taiwan University(台湾大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出粗到细扩散模型与时间步序列重分布方法,通过减少粗特征生成计算和优化采样轨迹,实现CIFAR10和LSUN-Church上80%-90%的计算量减少,近无损性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21085 2026-03-24 cs.CV 83%

Taming Sampling Perturbations with Variance Expansion Loss for Latent Diffusion Models

通过方差扩展损失镇定采样扰动以提升潜在扩散模型

Qifan Li, Xingyu Zhou, Jinhua Zhang, Weiyi You, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出方差扩展损失,通过对抗重建与方差扩展的交互,提升潜在空间鲁棒性,改进扩散生成质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10634 2026-03-24 cs.CV cs.AI 83%

Symmetrical Flow Matching: Unified Image Generation, Segmentation, and Classification with Score-Based Generative Models

对称流匹配:基于分数生成模型的统一图像生成、分割与分类

Francisco Caetano, Christiaan Viviers, Peter H. N. De With, Fons van der Sommen

专题命中 扩散模型 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出对称流匹配方法,通过联合建模正反向变换实现图像生成、分割和分类的统一,采用对称学习目标确保双向一致性并保留生成多样性,实验表明其在多个基准上取得SOTA性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04058 2026-03-24 cs.LG 82%

Unlearning in Diffusion models under Data Constraints: A Variational Inference Approach

在数据约束下扩散模型的卸载:一种变分推断方法

Subhodip Panda, Varun M S, Shreyans Jain, Sarthak Kumar Maharana, Prathosh A. P

机构 * Department of ECE, Indian Institute of Science(印度科学研究院电子工程系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出变分扩散卸载方法,用于在数据受限条件下防止预训练扩散模型生成不良内容,通过优化损失函数中的可塑性诱导器和稳定性正则化器来提高效率。

Journal ref Transaction on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02929 2026-03-24 q-bio.QM 82%

Microscopy image reconstruction with physics-informed denoising diffusion probabilistic model

利用物理信息的去噪扩散概率模型进行显微图像重建

Rui Li, Gabriel della Maggiora, Vardan Andriasyan, Anthony Petkidis, Artsemi Yushkevich, Mikhail Kudryashev, Artur Yakimovich

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 本文提出将显微成像物理问题融入模型损失函数,通过合成数据训练,改进DDPM以减少伪影,提升显微图像重建质量。

Comments 16 pages, 5 figures

Journal ref Communications Engineering 3, no. 1 (2024): 186

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01003 2026-03-24 cs.LG cs.RO 82%

Contractive Diffusion Policies: Robust Action Diffusion via Contractive Score-Based Sampling with Differential Equations

收缩扩散策略:通过微分方程的收缩分数基采样实现鲁棒动作扩散

Amin Abyaneh, Charlotte Morissette, Mohamad H. Danesh, Anas El Houssaini, David Meger, Gregory Dudek, Hsiu-Chin Lin

机构 * Department of Electrical and Computer Engineering, McGill University(麦吉尔大学电气与计算机工程系) Department of Computer Science, McGill University(麦吉尔大学计算机科学系) Mila–Quebec AI Institute(魁北克人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出收缩扩散策略,通过引入收缩行为提升扩散采样动态的鲁棒性,减少求解和分数匹配误差,降低动作方差,在数据稀缺情况下表现优异。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21978 2026-03-24 cs.CV cs.GR 81%

GeoFusion-CAD: Structure-Aware Diffusion with Geometric State Space for Parametric 3D Design

GeoFusion-CAD:基于几何状态空间的结构感知扩散模型用于参数化3D设计

Xiaolei Zhou, Chuangjie Fang, Jie Wu, Jingyi Yang, Boyi Lin, Jianwei Zheng

机构 * Zhejiang University of Technology(之江大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北航)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出GeoFusion-CAD,一种端到端扩散框架,通过几何状态空间建模实现长序列参数化3D设计生成,解决了传统方法在复杂几何拓扑依赖下的扩展性问题。

Comments Accepted to CVPR 2026 (Findings). Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02246 2026-03-24 cs.CV cs.AI cs.LG stat.ML 80%

Conditional Variational Diffusion Models

条件变分扩散模型

Gabriel della Maggiora, Luis Alberto Croquevielle, Nikita Deshpande, Harry Horsley, Thomas Heinis, Artur Yakimovich

机构 * Center for Advanced Systems Understanding (CASUS)(先进系统理解中心) Helmholtz-Zentrum Dresden-Rossendorf e. V. (HZDR)(德累斯顿-罗斯托克亥姆霍尔茨研究中心) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Bladder Infection and Immunity Group (BIIG), UCL Centre for Kidney and Bladder Health(膀胱感染与免疫组(BIIG),UCL肾与膀胱健康中心) Division of Medicine, University College London(伦敦大学学院医学系) Institute of Computer Science, University of Wrocław(沃斯克大学计算机科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种在训练过程中学习方差调度的方法,用于解决逆问题,适用于超分辨率显微镜和定量相成像,实现高质量解决方案。

Comments Denoising Diffusion Probabilistic Models, Inverse Problems, Generative Models, Super Resolution, Phase Quantification, Variational Methods

Journal ref In The Twelfth International Conference on Learning Representations. 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21856 2026-03-24 cs.CV 79%

Climate Prompting: Generating the Madden-Julian Oscillation using Video Diffusion and Low-Dimensional Conditioning

气候提示:利用视频扩散和低维条件生成 Madden-Julian 振荡

Sulian Thual, Feiyang Cai, Jingjing Wang, Feng Luo

机构 * School of Computing(计算学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型生成MJO序列,通过低维指标条件化生成MJO,并通过理想化条件分析其物理驱动机制,为热带大气预测提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21547 2026-03-24 cs.CV 79%

PROBE: Diagnosing Residual Concept Capacity in Erased Text-to-Video Diffusion Models

PROBE: 诊断 erased 文本到视频扩散模型中的残余概念容量

Yiwei Xie, Zheng Zhang, Ping Liu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Department of Computer Science and Engineering, University of Nevada(内华达大学计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PROBE 通过多级评估框架揭示文本到视频扩散模型中被擦除概念的残余容量,发现所有测试方法留有可测量的残余能力,且其鲁棒性与干预深度相关,指出当前擦除方法仅实现输出级抑制而非表征移除。

Comments This preprint was posted after submission to IEEE Transactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16296 2026-03-24 cs.CV cs.AI cs.LG 79%

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑

Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

机构 * Adobe Research(Adobe研究实验室) KAIST AI(韩国科学技术院人工智能研究所) Adobe Internship(Adobe实习) Project Lead(项目负责人)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。

Comments Project page: https://dohunlee1.github.io/MemoryV2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04619 2026-03-24 cs.CV 79%

Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence

去噪以跟踪:利用视频扩散先验进行鲁棒对应

Tianyu Yuan, Yuanbo Yang, Lin-Zhuo Chen, Yao Yao, Zhuzhong Qian

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HeFT框架,利用预训练视频扩散模型的视觉先验进行零样本点跟踪,通过分析内部表示揭示注意力头在匹配、语义理解和位置编码中的不同专长,并提出基于头和频率的特征选择策略提升跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17699 2026-03-24 cs.CV cs.LG 79%

GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver

GAS:通过通用对抗求解器改进扩散ODE的离散化

Aleksandr Oganov, Ilya Bykov, Eva Neudachina, Mishan Aliev, Alexander Tolmachev, Alexander Sidorov, Aleksandr Zuev, Andrey Okhotin, Denis Rakitin, Aibek Alanov

机构 * HSE University(俄罗斯高等经济学院) Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学) FusionBrain Lab(FusionBrain实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通用对抗求解器,通过结合原蒸馏损失与对抗训练,提升扩散模型细节保真度,无需复杂训练技巧,实现更高效的ODE离散化。

Comments Accepted to ICLR 2026. Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04597 2026-03-24 cs.CV 79%

DisPatch: Disarming Adversarial Patches in Object Detection with Diffusion Models

DisPatch:基于扩散模型的物体检测对抗性补丁消除方法

Jin Ma, Mohammed Aldeen, Christopher Salas, Feng Luo, Mashrur Chowdhury, Mert Pesé, Long Cheng

机构 * Clemson University(克莱姆森大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DisPatch,一种基于扩散模型的物体检测防御框架,通过再生和修正策略消除对抗性补丁,有效提升检测鲁棒性,实验表明其在隐藏攻击和生成攻击中均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21166 2026-03-24 cs.CV 79%

Training-Free Instance-Aware 3D Scene Reconstruction and Diffusion-Based View Synthesis from Sparse Images

无需训练的实例感知3D场景重建与基于扩散的视图合成从稀疏图像

Jiatong Xia, Lingqiao Liu

机构 * The University of Adelaide(阿德莱德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的系统,从稀疏未定位RGB图像重建、理解并渲染3D室内场景,通过点云重建、2D到3D实例提升和扩散模型渲染实现高保真结果,支持实例编辑。

Comments Accepted by SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21129 2026-03-24 cs.CV 79%

ReDiffuse: Rotation Equivariant Diffusion Model for Multi-focus Image Fusion

ReDiffuse:用于多焦点图像融合的旋转等价扩散模型

Bo Li, Tingting Bao, Lingling Zhang, Weiping Fu, Yaxian Wang, Jun Liu

机构 * School of Computer Science and Technology, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) School of Information Engineering, Chang'an University(长安大学信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ReDiffuse模型,通过在扩散网络中嵌入旋转等价性,解决多焦点图像融合中因模糊导致的结构失真问题,提升融合图像的结构一致性。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20868 2026-03-24 cs.CV 79%

TAFG-MAN: Timestep-Adaptive Frequency-Gated Latent Diffusion for Efficient and High-Quality Low-Dose CT Image Denoising

TAFG-MAN:时间自适应频率门控潜在扩散用于高效高质量低剂量CT图像去噪

Tangtangfang Fang, Yang Jiao, Xiangjian He, Jingxi Hu, Jiaqi Yang

机构 * University of Nottingham Ningbo China(宁波大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TAFG-MAN框架,结合感知优化的自动编码器和紧凑潜在空间中的条件潜在扩散修复,以及轻量级时间自适应频率门控设计,提升低剂量CT图像去噪的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20584 2026-03-24 cs.CV 79%

Improving Diffusion Generalization with Weak-to-Strong Segmented Guidance

通过弱到强分段引导提升扩散模型泛化能力

Liangyu Yuan, Yufei Huang, Mingkun Lei, Tong Zhao, Ruoyu Wang, Changxi Chi, Yiwei Wang, Chi Zhang

机构 * Westlake University(西湖大学) Tongji University(同济大学) Zhejiang University(浙江大学) University of California at Merced(加州大学默塞德分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SGG方法,通过弱到强原则结合CFG和AG的优势,提升扩散模型泛化能力,并在训练和推理阶段验证其有效性。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05264 2026-03-24 cs.CV cs.AI 79%

SGDFuse: SAM-Guided Diffusion Model for High-Fidelity Infrared and Visible Image Fusion

SGDFuse: 基于SAM的扩散模型用于高保真红外与可见图像融合

Xiaoyang Zhang, jinjiang Li, Guodong Fan, Yakun Ju, Linwei Fan, Jun Liu, Alex C. Kot

机构 * School of Computer Science(计算机科学学院) Business University, Yantai, China(烟台商学院) College of Computer and Data Science(计算机与数据科学学院) Fuzhou University, Fuzhou, China(福州大学) School of Computing and Mathematical Sciences(计算与数学科学学院) University of Leicester, Leicester, United Kingdom(莱斯特大学) School of Computing and Artificial Intelligence(计算与人工智能学院) Director of the Rapid-Rich Object Search Laboratory(快速丰富对象搜索实验室主任) NTU-PKU Joint Research Institute, Nanyang Technological University, Singapore(NTU-PKU联合研究机构,新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SGDFuse,通过结合SAM的高阶语义先验与扩散模型的高保真生成能力,解决红外与可见图像融合中的语义盲问题,提升图像质量和下游任务性能。

Comments Published in Information Fusion

Journal ref Information Fusion, 2026: 104290

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16474 2026-03-24 cs.CV 79%

Foresight Diffusion: Improving Sampling Consistency in Predictive Diffusion Models

前瞻性扩散:改进预测扩散模型中的采样一致性

Yu Zhang, Xingzhuo Guo, Haoran Xu, Jialong Wu, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院,BNRist,清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Foresight Diffusion,通过解耦条件理解和目标去噪提升预测扩散模型的采样一致性,实验显示其在机器人视频预测和科学时空预测中表现优异。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20382 2026-03-24 cs.CV 79%

Uni-Classifier: Leveraging Video Diffusion Priors for Universal Guidance Classifier

Uni-Classifier: 利用视频扩散先验进行通用引导分类器

Yujie Zhou, Pengyang Ling, Jiazi Bu, Bingjie Gao, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Uni-Classifier,通过利用视频扩散先验引导前序模型的去噪过程,提升生成质量,适用于视频和3D生成任务。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02284 2026-03-24 cs.CV cs.AI cs.LG 79%

Learning to Generate Rigid Body Interactions with Video Diffusion Models

通过视频扩散模型学习生成刚体交互

David Romero, Ariana Bermudez, Viacheslav Iablochnikov, Hao Li, Fabio Pizzati, Ivan Laptev

机构 * MBZUAI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出KineMask方法,通过视频生成实现刚体交互的逼真控制与模拟,结合低级运动控制与高级文本条件,提升动态现象合成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21470 2026-03-24 cs.SI cs.CY 79%

Empirical Evaluation of Link Deletion Methods for Limiting Information Diffusion on Social Media

对限制社交媒体信息扩散的链接删除方法的实证评估

Shiori Furukawa, Sho Tsugawa

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过实际转发 cascades 日志评估链接删除方法的有效性,发现即使删除50%的链接,信息扩散规模仍仅减少至原规模的50%,表明该方法抑制信息扩散的效果有限。

Comments Social Network Analysis and Mining

Journal ref Furukawa, S., Tsugawa, S. Empirical evaluation of link deletion methods for limiting information diffusion on social media. Soc. Netw. Anal. Min. 12, 169 (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20582 2026-03-24 q-fin.MF stat.ML 79%

Generative Diffusion Model for Risk-Neutral Derivative Pricing

生成扩散模型用于风险中性衍生品定价

Nilay Tiwari

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用扩散模型生成风险中性资产价格动态,通过修正分数函数实现风险中性漂移,从而在衍生品定价中实现生成模型与经典定价方法的结合。

Comments 15 pages, 2 figures. Introduces a risk-neutral correction for diffusion models via a score function shift, with applications to derivative pricing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22177 2026-03-24 math.AP 78%

Cross-diffusion and fast-reaction in pattern formation: a structural analysis

交叉扩散与快速反应在模式形成中的作用:结构分析

Brocchieri Elisabetta, Soresina Cinzia

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了生物来源的交叉扩散对塔尔丁不稳定性的影响,分析了快速反应机制下交叉扩散函数的不稳定性条件,并探讨了反应雅可比矩阵符号结构与交叉扩散在模式形成起始中的相互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22075 2026-03-24 cs.CL 78%

Autoregressive vs. Masked Diffusion Language Models: A Controlled Comparison

自回归模型与掩码扩散语言模型:受控比较

Caio Vicentino

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文对比自回归与掩码扩散语言模型,发现两者在训练效率、收敛速度及生成多样性上存在差异,揭示不同训练策略的最优计算方案。

Comments 10 pages, 2 figures, 4 tables. Code and checkpoints at https://github.com/caiovicentino/arche

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21608 2026-03-24 eess.AS cs.AI cs.SD 78%

DiT-Flow: Speech Enhancement Robust to Multiple Distortions based on Flow Matching in Latent Space and Diffusion Transformers

DiT-Flow:基于潜在空间和扩散变换器的多失真鲁棒语音增强

Tianyu Cao, Helin Wang, Ari Frummer, Yuval Sieradzki, Adi Arbel, Laureano Moro Velazquez, Jesus Villalba, Oren Gal, Thomas Thebaud, Najim Dehak

机构 * Johns Hopkins University(约翰霍普金斯大学) Technion Israel Institute of Technology(技术学院以色列理工学院) University of Haifa(海法大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DiT-Flow,一种基于流匹配的语音增强框架,利用潜在扩散变换器构建,通过训练提升对噪声、回声和压缩等多失真鲁棒性,实验显示其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏