arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-24 至 2026-07-24 共收录 62 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 62 篇

2509.21913 2026-07-24 physics.med-ph cs.AI 版本更新 86%

Equivariant Conditional Diffusion Model for Head and Neck CT Image Synthesis from CBCT

用于从CBCT合成头颈CT图像的等变条件扩散模型

Alzahra Altalib, Chunhui Li, Alessandro Perelli

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title)

AI总结 针对CBCT图像有伪影、CT图像难捕捉治疗中解剖变化的问题,提出EqDiff-CT模型,基于扩散概率模型和群等变条件U-Net主干,从CBCT合成高质量CT图像,经实验验证在多方面有显著提升,为CBCT改进提供框架。

Comments 43 pages, 9 figures, 6 tables, accepted in Medical Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21591 2026-07-24 cs.CV 新提交 83%

Inference-Time Scaling of Diffusion Models via Progressive Seed Pruning

通过渐进式种子剪枝实现扩散模型的推理时间缩放

Rogerio Guimaraes, Pietro Perona

机构 * California Institute of Technology(加州理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究扩散模型推理时间缩放问题,提出渐进式种子剪枝方法,通过早期评估多种子并剪枝,有效利用固定计算预算,在扩散和流匹配主干上比其他基线方法在奖励引导选择及提示对齐评估上表现更优。

Comments Project page: https://www.vision.caltech.edu/psp. Code: https://github.com/rogerioagjr/psp

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04731 2026-07-24 cs.CV 版本更新 83%

When Does High-CFG Diffusion Inversion Fail? A Controlled Study of Prompt--Latent Interactions

高CFG扩散反演何时失败?对提示-潜在交互的对照研究

Yan Zeng, Yusuke Hosoya, Huyen T. T. Tran, Takayuki Okatani

机构 * GSIS Tohoku University(东北大学全球信息社会研究院) RIKEN AIP JAPAN(日本理化学研究所先进智能项目中心)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 研究在图像编辑中,高CFG轨迹生成的目标图像何时能被反演。通过对照实验,用现有基准的提示生成图像并反演,揭示提示重建行为类型,定义提示压力分析生成,文本分析表明主体和措辞影响反演,评估干预措施支持局部轨迹感知分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16615 2026-07-24 cs.CV 版本更新 83%

Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers

用于高效扩散变压器的可训练对数线性稀疏注意力

Yifan Zhou, Zeqi Xiao, Tianyi Wei, Shuai Yang, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究针对扩散变压器二次自注意力成本限制长序列扩展问题,提出可训练的对数线性稀疏注意力机制LLSA,通过分层结构降低成本,经实验验证其能加速注意力推理和DiT训练,为高效训练长序列DiTs提供方向。

Comments Code is available at: https://github.com/SingleZombie/LLSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20955 2026-07-24 cs.CR cs.LG 版本更新 82%

Enhancing Membership Inference Attacks on Diffusion Models from a Frequency-Domain Perspective

从频域角度增强扩散模型的成员推理攻击

Puwei Lian, Yujun Cai, Songze Li, Bingkun Bao

机构 * Southeast University(东南大学) The University of Queensland(昆士兰大学) Hefei University of Technology(合肥工业大学) Engineering Research Center of Blockchain Application, Supervision and Management (Southeast University), Ministry of Education(区块链应用、监督与管理工程研究中心(东南大学),教育部)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文从频域角度揭示扩散模型处理高频信息的缺陷导致成员推理攻击误分类,并提出即插即用的高频滤波模块以提升攻击性能。

Comments Accepted to Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16947 2026-07-24 cs.RO cs.AI 版本更新 82%

Drive As You Like: Multi-Head Diffusion with Reinforcement Learning for Personalized Driving

随心所欲驾驶:基于强化学习的多头部扩散个性化驾驶

Fan Ding, Xuewen Luo, Fucai Ke, Hwa Hui Tew, Susilawati Susilawati, Vishnu Monn Baskaran, Junn Yong Loo

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) Southwest University, China(西南大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究旨在解决自动驾驶规划器忽视人类驾驶行为多样性及难以理解用户意图的问题。提出基于强化学习的多策略框架,集成多头部扩散规划器与语义理解,采用两阶段训练范式。实验表明该方法在nuPlan基准测试中性能良好,能满足实时规划并对齐用户意图。

Comments Has been submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21594 2026-07-24 cs.CV 新提交 79%

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

具有世界状态寄存器的流式多智能体自回归扩散模型

Sicheng Mo, Yuheng Li, Ziyang Leng, Krishna Kumar Singh, Bolei Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究多智能体交互世界模型共享状态维护难题,提出WorldWeaver模型,利用跨智能体世界状态寄存器及混合变压器设计,经双智能体我的世界视频生成实验验证,该模型能提升逻辑一致性与生成质量。

Comments Project page: https://vail-ucla.github.io/worldweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21545 2026-07-24 cs.CV 新提交 79%

Towards Robust Iris Recognition Through Occlusion Identification and Conditional Diffusion-Based Reconstruction

通过遮挡识别和基于条件扩散的重建实现鲁棒虹膜识别

Kamrul Hasan, Mylene C. Q. Farias, Oleg V. Komogortsev

机构 * Texas State University(德克萨斯州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对虹膜纹理被遮挡时识别性能下降的问题,提出含遮挡类型识别、基于扩散重建及深度学习识别三个模块的框架,通过确定遮挡类别、重建受损区域并提取特征,提升了在CASIA-Iris-Thousand数据集上的虹膜识别性能。

Comments Accepted by IEEE International Joint Conference on Biometrics (IJCB) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21504 2026-07-24 cs.CV 新提交 79%

Texture++: Elevating 3D Asset Texture Resolution with a Region-Aware Diffusion Model

Texture++:使用区域感知扩散模型提升3D资产纹理分辨率

Shuaiwei Wang, Shi Li, Jieting Xu, Yuchi Huo, Qi Wang, Wenting Zheng, Rengan Xie

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) North China Electric Power University(华北电力大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对3D资产纹理分辨率低问题,提出Texture++框架,通过在UV空间重新表述超分辨率任务,采用自适应视图选择、四叉树纹理区域组织及基于扩散的超分辨率模型,提升纹理分辨率,相比现有方法显著改进了纹理细节与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21239 2026-07-24 cs.CV 新提交 79%

Stokes-Informed Diffusion for Robust Linear Polarization Estimation

用于稳健线性偏振估计的斯托克斯信息扩散

Yidong Luo, Chenggong Li, Yuchao Feng, Boxin Shi, Junchao Zhang, Xin Yuan

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工学院) School of Automation, Central South University(中南大学自动化学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究从单张RGB图像估计线性偏振问题,提出基于穆勒形式主义的GenPolar框架,通过预测斯托克斯分量并结合可观测性感知损失监督偏振角,采用两阶段训练策略,在多数据集实验中性能达先进水平,提升下游应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21174 2026-07-24 cs.CV 新提交 79%

Decoupling Cross-Modality Manifold Discrepancy: Leveraging Visible Diffusion Priors for Infrared Super-Resolution

解耦跨模态流形差异:利用可见光扩散先验实现红外超分辨率

Yunpeng Hua, Hongwei Yu, Jiawei Li, Qiankun Liu, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对红外图像超分辨率问题,提出双路径基于扩散的Shift-IISR框架,通过开发GRM模块提取特定模态信息、引入LSR模块关注结构信息,有效提高了分布和结构一致性,保持了超分辨率性能。

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026). Code: https://github.com/Assassink8/Shift-IISR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20545 2026-07-24 cs.AI cs.CV cs.SE 新提交 79%

StrideDiffusion: Accelerating Diffusion Models for Time-series Generation

StrideDiffusion:加速用于时间序列生成的扩散模型

Du Yin, Estrid He, Julián Jerónimo Bañuelos, Yang Yang, Feng Hu, Yuchen Luo, Hao Xue, Stephan Sigg, Flora Salim

机构 * UNSW(新南威尔士大学) RMIT(皇家墨尔本理工大学) Aalto University(阿尔托大学) HKUST(GZ)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散模型推理时去噪步骤多限制实际应用的问题,提出StrideDiffusion采样器,依据频带活动自适应选步长,经实验验证该方法能大幅加速时间序列生成,保持或提升质量,为快速采样提供实用信号。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11658 2026-07-24 cs.CV 版本更新 79%

EmoSpace: Immersive Affective Image Generation Guided by Fine-Grained Emotion Prototypes

EmoSpace: 细粒度情绪原型学习用于沉浸式情感内容生成

Bingyuan Wang, Xingbei Chen, Zongyang Qiu, Lin-Ping Yuan, Zeyu Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 EmoSpace通过视觉-语言对齐学习动态情绪原型,实现沉浸式情感内容生成的细粒度控制与多样化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20598 2026-07-24 eess.IV 新提交 78%

MedDiT4SR: Tri-Stream Joint Adaptation of Pre-Trained Diffusion Transformers for Medical Image Super-Resolution

MedDiT4SR:用于医学图像超分辨率的预训练扩散Transformer的三流联合自适应

Zhi Chen, Le Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对医学图像超分辨率难题,提出MedDiT4SR三流自适应框架,集成多种表示于扩散Transformer块,引入SR Adapter和SA Refiner,实验验证该框架能有效让预训练DiT模型适应不同医学成像域的超分辨率任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21200 2026-07-24 stat.ML cs.LG 新提交 78%

Transformer-based Diffusion models for Hydrological Time Series Probabilistic Imputation and Forecasting

基于Transformer的扩散模型用于水文时间序列概率插补和预测

Ferdinand Bhavsar, Lionel Benoit, Maxime Savatier, Edith Gabriel

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究探讨基于Transformer的扩散模型在水文时间序列模拟和重建中的应用,将其用于法国东北部多地点水量和水质联合建模,经校准验证后与其他方法比较,结果支持该方法有效性,凸显其捕捉复杂模式能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20909 2026-07-24 eess.SP cs.LG 新提交 78%

RadioTrace: Transmitter-Aware Diffusion for Radio Map Estimation without Deployment-Time Fine-Tuning

RadioTrace:用于无线电地图估计的发射机感知扩散,无需部署时微调

Liu Yang, Qiang Li, Zhuo Cao, Weijie Xiong, Guomin Sun, Jingran Lin

机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(信息与通信工程学院,电子科学与技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出RadioTrace框架,无需部署时微调,将稀疏RSS测量与预训练扩散先验集成,通过纳入Tx位置估计、传播引导的K均值初始化及稳定性分析,在随机和受限区域采样下展现出良好性能,提升了无线电地图估计的适应性、鲁棒性和实用性。

Comments IEEE Trans. Wireless Comm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21519 2026-07-24 cs.IR 新提交 78%

Diffusion Language Model for Recommendation

用于推荐的扩散语言模型

Chengyi Liu, Yongqi Zhou, Junwei Pan, Zhixiang Feng, Chengguo Yin, Haijie Gu, Jie Jiang, Yinghao Liu, Yujuan Ding, Qing Li, Wenqi Fan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对现有推荐系统中自回归范式的不足,受扩散语言模型启发,提出 DLMRec。该模型引入协作感知随机分词器、课程驱动训练策略、稳定性感知投票机制,为推荐提供了新的离散扩散语言模型及有效方法。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21403 2026-07-24 cs.LG stat.ME 新提交 78%

A Diffusion-Model Subpopulation Digital Twin for Mobile Health Deployment: A Case Study on the HeartSteps Intervention

用于移动健康部署的扩散模型亚群数字孪生:以HeartSteps干预为例

Ziping Xu, Yuyi Chang, Chenshun Ni, Nithin Sugavanam, Asim H. Gazi, Pedja Klasnja, Emre Ertin, Susan A. Murphy

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) The Ohio State University(俄亥俄州立大学) Harvard University(哈佛大学) University of Michigan(密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对移动健康干预算法设计问题,提出基于条件时间序列扩散模型开发“JITAI-Twins”数字孪生的方法,经多步更新,在HeartSteps干预部署预阶段验证,能更好再现目标亚群结构,为算法设计决策提供模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21372 2026-07-24 cs.LG cs.AI 新提交 78%

Mean-to-Score Discrete Diffusion: Posterior-Mean Denoisers for Score Entropy

均值到分数的离散扩散:用于分数熵的后验均值去噪器

Jingyuan Li, Xiaoyi Jiang, Yixuan Jiang, Wei Liu, Yi Zhu, Zuoqiang Shi, Pipi Hu

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院) Wuhan University(武汉大学) MathonAI(马松人工智能)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对分数熵离散扩散存在的问题,引入均值到分数(M2S)方法,通过预测后验均值并转换为分数,应用于特定马尔可夫链。在CIFAR-10等实验中,M2S降低了测试BPD和FID-50k,提升了生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21341 2026-07-24 cs.RO 新提交 78%

Grasp, Handover, Rotate: Bimanual Object Reorientation via Compositional Diffusion and Energy-Based Optimization

抓取、交接、旋转:通过组合扩散和基于能量的优化实现双手物体重新定向

Wun Lam Yeung, Wenjun Liu, Yui Cheung Yu, Zhengyan Lambo Qin, Qijin She, Heng Li, Ziqi Wang, Ping Tan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究双手物体重新定向问题,提出基于组合扩散和能量的BiCompoDiff框架,联合优化多方面任务,结合预训练模型与能量模型,通过梯度引导和采样优化抓取姿态,实验表明其成功率和轨迹平滑度优于基线,实现有效模拟到现实转移。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20992 2026-07-24 cs.RO 新提交 78%

Distributed Model-Based Diffusion For Scalable Multi-Robot Trajectory Optimization

用于可扩展多机器人轨迹优化的基于分布式模型的扩散算法

Haejoon Lee, Xinyi Wang, Taekyung Kim, Dimitra Panagou

机构 * Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对多机器人轨迹优化难题,提出分布式基于模型的扩散算法(DMBD),将反向扩散过程分解为局部条件反向扩散过程,使机器人能独立去噪,模拟显示其可扩展性强,能快速解决协调任务且优于现有基线。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20913 2026-07-24 cs.AI 新提交 78%

Source-Prior-Driven Selective Adaptation for Efficient Diffusion Model Finetuning

源先验驱动的选择性适应用于高效扩散模型微调

Yi Xiong, Yuan-Yuan Cheng, Xiao-Ming Fu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散模型微调中提升特定目标生成与保留预训练能力的权衡问题,提出源先验驱动的选择性适应方法,通过关键观察学习静态掩码并构建更新策略,实验证明比基线方法在适应 - 保留权衡上表现更好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20549 2026-07-24 cs.LG cs.RO cs.SY eess.SY 新提交 78%

SevDiff: Severity-Conditioned Diffusion for Long-Tail Conflict Trajectory Generation

SevDiff:用于长尾冲突轨迹生成的严重程度条件扩散

Eni Solomon Laughter

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对ADAS评估中冲突轨迹罕见及现有方法不足的问题,提出SevDiff严重程度条件扩散模型,以TTC值为调节信号生成配对轨迹,经训练在不同TTC目标下有高命中率,生成特征物理合理,命中率下降模式可精确表征生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20540 2026-07-24 cs.LG cs.AI 新提交 78%

From Atoms to Entropy: Optimal Noise Allocation for Diffusion Training in the Convex Regime

从原子到熵:凸域中扩散训练的最优噪声分配

Luca Ambrogioni, Giulio Franzese, Alberto Foresti, Gabriel Raya, Bac Nguyen, Georgios Batzolis, Yuhta Takida, Naoki Murata, Chieh-Hsin Lai, Yuki Mitsufuji

机构 * Radboud University(拉德堡德大学) EURECOM(欧洲电信系统研究所) Tilburg University(蒂尔堡大学) Sony AI(索尼人工智能公司) University of Cambridge(剑桥大学) Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究扩散模型训练时噪声水平分配问题,开发通用统计框架,在不同 regime 下得出最优分配结论,并通过实验验证,平方根熵调度能提升离散域训练效率且在连续图像上有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21460 2026-07-24 physics.ao-ph 新提交 78%

Diffusion posterior sampling enables zero shot kilometre scale wind forecasting over complex terrain

扩散后验采样实现复杂地形上千米尺度的零样本风速预测

Yujiang Cai, Ya Wang, Shuanglei Feng, Bo Wang, Yiming Liu, Hui Yuan, Xinyi Sun, Haijie Li, Shenming Fu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对复杂地形近地表风预测难题,开发KiloGen扩散后验采样框架,通过学习WRF模型先验并结合ECMWF预报约束后验采样,在山西应用效果良好,降低风速均方根误差,为千米尺度风预报增强提供有效途径。

Comments Main manuscript with 7 figures and Supplementary Information with 5 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21514 2026-07-24 cs.SI cond-mat.stat-mech cs.IT cs.LG math.IT physics.data-an 版本更新 78%

Conditional Entropy of Heat Diffusion on Temporal Networks

时间网络上热扩散的条件熵

Samuel Koovely, Alexandre Bovet

机构 * Department of Mathematical Modeling and Machine Learning(数学建模与机器学习系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了时间网络上热扩散的条件熵,提出了一种新的方法来检测时间网络中的相变点,并展示了其在信息论中的意义,类似于热力学第二定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17232 2026-07-24 cs.LG math.ST stat.ML stat.TH 版本更新 78%

Dimension-Free Convergence of Discrete Diffusion Models: Adjoint Equations Induce the Right Space

离散扩散模型的维度无关收敛性:伴随方程诱导了正确的空间

Kelvin Kan, Xingjian Li, Benjamin J. Zhang, Tuhin Sahai, Stanley Osher, Markos A. Katsoulakis

机构 * Department of Mathematics(数学系) Oden Institute School of Data Science and Society(数据科学与社会学院) UCLA(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Computational and Applied Sciences Group(计算与应用科学组) Department of Mathematics and Statistics(数学与统计学系) SRI International(SRI国际) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于伴随方程的统一框架,实现了任何积分概率度量(IPM)下的维度无关收敛保证,克服了传统KL和TV方法在处理大规模状态空间时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13026 2026-07-24 cs.LG cs.AI cs.CL 版本更新 78%

Understanding and Accelerating the Training of Masked Diffusion Language Models

理解并加速掩码扩散语言模型的训练

Chunsan Hong, Sanghyun Lee, Chieh-Hsin Lai, Satoshi Hayakawa, Yuhta Takida, Yuki Mitsufuji, Seungryong Kim, Jong Chul Ye

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) University of Tokyo(东京大学) Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了掩码扩散模型训练缓慢的原因,提出bell-shaped时间采样策略,显著提升训练效率和模型性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11052 2026-07-24 cs.SD 版本更新 78%

LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation

LaDA-Band:语言扩散模型用于人声到伴奏生成

Qi Wang, Zhexu Shen, Meng Chen, Guoxin Yu, Chaoxu Pang, Weifeng Zhao, Wenjiang Zhou

机构 * State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所人工智能安全国家重点实验室) Lyra Lab, Tencent Music Entertainment(腾讯音乐娱乐集团Lyra实验室) Pengcheng Laboratory(鹏城实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LaDA-Band通过引入离散掩码扩散模型,解决了人声到伴奏生成中保持音质真实、维持全局连贯性和产生动态编曲的三重挑战,提升了长距离结构一致性和时间同步性。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06846 2026-07-24 cs.SD 版本更新 78%

DynFOA: Generating First-Order Ambisonics with Conditional Diffusion for Dynamic and Acoustically Complex 360-Degree Videos

DynFOA: 基于条件扩散的动态和声学复杂的360度视频生成一阶混响

Ziyu Luo, Lin Chen, Qiang Qu, Xiaoming Chen, Yiran Shen

机构 * School of Computer and Artificial Intelligence, Beijing Technology and Business University, Beijing, China(计算机与人工智能学院,北京技术与商业大学) School of Computer Science, The University of Sydney, Sydney, NSW, Australia(计算机科学学院,悉尼大学) School of Software, Shandong University, Jinan, China(软件学院,山东大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DynFOA通过动态声学感知和条件扩散生成高质量的360度视频一阶混响,提升沉浸式音频体验。

Comments Revised version with updated content.This submission is the intended replacement of arXiv:2602.06846

详情

展开后加载摘要…

URL PDF HTML 收藏