arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-04 至 2026-08-04 共收录 142 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 142 篇

2608.01298 2026-08-04 cs.CV cs.AI cs.LG 新提交 83%

UDT: Reconciling U-Nets and Diffusion Transformers with Data-Adaptive Token Reduction

UDT:通过数据自适应令牌缩减协调U-Net与扩散Transformer

Junno Yun, Yaşar Utku Alçalar, Mehmet Akçakaya

机构 * University of Minnesota(明尼苏达大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本研究提出UDT架构,通过数据自适应令牌合并协调U-Net与DiTs,在ImageNet图像生成任务中收敛速度更快、FID指标更优,为DiTs提供了新的高效骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00444 2026-08-04 cs.CV 新提交 83%

Reconstruction-Shift Discrimination via Mask-Guided Latent Diffusion for Medical Anomaly Detection

基于掩码引导的潜在扩散的重构-偏移判别用于医学异常检测

Yibo Wan, Jinyu Cai, Yunhe Zhang, Yi Bin, See-kiong Ng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出判别式掩码引导扩散(DMD)框架,结合自监督分类的重构-偏移判别与残差定位,在五种医学影像数据集上实现了最优的无监督医学异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29471 2026-08-04 cs.CV 版本更新 83%

V2VCrafter: Consistent Street-View Image Generation Across Vehicles

V2XCrafter:学习生成跨智能体的驾驶场景

Yihang Tao, Yu Guo, Senkang Hu, Yanan Ma, Zihan Fang, Sam Kwong, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City(香港JC智能城市STEM实验室) City University of Hong Kong(香港城市大学) Lingnan University(岭南大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出V2XCrafter框架,通过渐进式多智能体扩散模型和跨智能体注意力模块,生成跨智能体相机视角的一致可控协作驾驶场景,以增强数据并提升下游协作3D目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00024 2026-08-04 cs.CL cs.AI 新提交 82%

Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance

探索更多以解决更多问题:通过基于熵的引导提升文本扩散模型的多样性

Jingwei Zhang, Haoyu Lei, Zijin Feng, Jiacheng Sun, Farzan Farnia

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 本研究提出无训练的SAKE引导方法,通过核Gram矩阵的二阶Rényi熵动态调整文本扩散模型的采样分布,实现更优的保真度与多样性平衡,提升了代码、数学等推理任务的多样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00730 2026-08-04 cs.RO 新提交 80%

Push-Wiper: Toward General-Purpose Robotic Cleaning across Varied Stains and Surfaces with Segmented Pushing Trajectories

Push-Wiper:基于分段推动轨迹的通用机器人清洁方案,用于处理不同污渍与表面

Renhao Lu, Mingxin Wang, Chenyang Cao, Yang Yang, Guoping Pan, Kangkang Dong, Yi Cheng, Houde Liu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Z-Lab, Zerith Robotics(Zerith机器人公司Z-Lab实验室) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 Push-Wiper 框架将粘性污渍清洁转化为聚合问题,通过分段推动轨迹结合 Diffusion Policy 与 ASPI 控制器,清洁得分比基线高130%,可零样本泛化至多种污渍与表面。

Comments 8 pages, 8 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17310 2026-08-04 cs.CR 版本更新 80%

Cryptanalysis of LDPC-Based Pseudorandom Error-Correcting Codes

基于LDPC的伪随机纠错码的密码分析

Tianrui Wang, Anyu Wang, Tianshuo Cong, Delong Ran, Jinyuan Liu, Xiaoyun Wang

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 首次对LDPC-PRC进行密码分析,提出三种攻击破坏其不可检测性和安全性,在DeepSeek和Stable Diffusion等模型上验证有效,并给出防御建议。

Comments Accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01845 2026-08-04 cs.LG cs.CV 新提交 79%

WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model

WorldDynCache:用于扩散世界模型的风险控制隐式动力学近似

Leyang Chen, Junyi Wu, Shaoqiu Zhang, Yulun Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出WorldDynCache框架,通过风险估计器和提升隐式代理解决扩散世界模型推理慢的问题,在两个数据集上实现加速并取得最优生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01821 2026-08-04 cs.CV cs.LG 新提交 79%

DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models

DAVET:面向扩散视觉-语言模型的降噪感知视觉证据轨迹分配

Yongkang Zhou, Xiang Xia, Cheng Yan, Fan Xu, Wuyang Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DAVET 是一种无需训练的框架,通过根据扩散视觉-语言模型的生成状态自适应分配视觉证据,实现平均 1.55 倍加速且仅 1.86% 的平均性能下降,降低了视觉条件成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01276 2026-08-04 cs.CV 新提交 79%

Astrolabe: Spherical-Map Guidance Across Diffusion Pipelines for Full-Body Capture from Unconstrained Images

Astrolabe:跨扩散管道的球面图引导,用于从非约束图像中捕获全身信息

Shuliang Zhu, Qi Wang, Ryugo Morita, Jinjia Zhou

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Astrolabe适配器,通过球面图转换为噪声偏移引导扩散管道,在Puzzle-IOI和4D-Dress数据集上提升全身捕获的图像与几何指标,后视图图像增益显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00588 2026-08-04 cs.CV 新提交 79%

InstancePin: Instance-Addressable Layout-to-Image Diffusion via Coordinate Pinning

InstancePin:通过坐标锚定实现实例可寻址的布局到图像扩散模型

Chaoyue Wu, Yunfei Zhang, Si Wu

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出InstancePin框架,通过坐标锚定与实例感知适配器等技术,解决布局到图像扩散模型的实例纠缠问题,在Cityscapes数据集上提升了图像保真度与语义一致性。

Comments Accepted to PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00543 2026-08-04 cs.CR cs.AI cs.CV 新提交 79%

Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor

鲁棒水印与中毒模型相遇:通过隐秘后门规避扩散语义水印

Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出GhostVAE方法,通过在VAE编码器植入隐秘后门,可在良性图像上保持94.4%的平均水印真阳性率,同时实现94.6%的平均水印规避成功率,突破了现有语义水印的安全性。

Comments To appear in USENIX Security 2026, August 12-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00486 2026-08-04 cs.CV 新提交 79%

DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

DreamTraj:通过读取未渲染视频扩散隐变量生成6自由度物体轨迹

Tongsheng Ding, Zhen Luo, Yixuan Yang, Boyu Wang, Luyang Xie, Jinyu Yang, Feng Zheng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DreamTraj利用含细粒度指令的MOVE数据集,从单张RGB图像和任务指令读取冻结视频扩散模型中间表示,直接解码6自由度物体轨迹,性能优于传统方法且速度提升4.6倍。

Comments 17 pages, 8 figures, 11 tables. Project page: https://whathappen0.github.io/DreamTraj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25940 2026-08-04 eess.IV cs.CV 79%

How Accurate are Video Quality Models for Diffusion-Based Video Super-Resolution?

扩散模型视频超分辨率中的视频质量模型有多准确?

Benjamin Herb, Steve Göring, Alexander Raake, Rakesh Rao Ramachandra Rao

机构 * Institute for Communications Engineering, RWTH Aachen University, Germany(通讯工程研究所,亚琛工业大学,德国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究通过主观测试比较了六种扩散模型视频超分辨率方法,评估现有视频质量模型(尤其是全参考和无参考模型)在扩散VSR上的准确性,发现基于CNN的全参考模型相关性较高但均不足以替代主观测试。

Comments Accepted for the 18th International Conference on Quality of Multimedia Experience (QoMEX 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23179 2026-08-04 cs.CV 版本更新 79%

Gimbal360: Canonicalizing Planar Diffusion for Spherical Panorama Completion

Gimbal360: 可微自动水平校准用于标准化360度全景图像补全

Yuqin Lu, Haofeng Liu, Yang Zhou, Yihua Dai, Guiqing Li, Shengfeng He, Jun Liang

机构 * orange-3dv-team(orange-3dv团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Gimbal360通过引入标准化视角空间和可微自动水平校准模块,解决360度全景图像补全中的几何与拓扑不匹配问题,实现高精度补全。

Comments Project page: https://orange-3dv-team.github.io/Gimbal360

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06741 2026-08-04 cs.LG cs.AI cs.CV 版本更新 79%

Heterogeneous Decentralized Diffusion Models

异构去中心化扩散模型

Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

机构 * bagel.com(Bagel公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种异构去中心化训练框架,通过支持不同专家使用不同目标(DDPM和Flow Matching)并统一推理、预训练检查点转换以及高效架构,大幅降低计算和数据需求,使单GPU(24-48GB VRAM)即可参与训练。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07163 2026-08-04 cs.RO cs.CV 版本更新 79%

Mamba Policy: Towards Efficient 3D Diffusion Policy with Hybrid Selective State Models

Mamba Policy:基于混合选择性状态模型的高效3D扩散策略

Jiahang Cao, Qiang Zhang, Jingkai Sun, Jiaxu Wang, Hao Cheng, Yulin Li, Jun Ma, Kun Wu, Zhiyuan Xu, Yecheng Shao, Wen Zhao, Gang Han, Yijie Guo, Renjing Xu

机构 * Microelectronics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)微电子领域) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴交叉领域 division) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Center for X-Mechanics, Zhejiang University(浙江大学X力学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出Mamba Policy,以XMamba Block融合Mamba与注意力机制,参数量减超80%,在Adroit等数据集上性能优异且计算资源需求低,长 horizon 场景鲁棒性更强。

Comments Accepted to IROS 2025. Project Page: https://sagecao1125.github.io/mamba_policy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18164 2026-08-04 cs.CV 版本更新 79%

CDG-MAE: Cross-view Masked Modeling using Diffusion Generated Views

CDG-MAE:基于扩散生成视图的跨视图掩码建模

Varun Belagali, Pierre Marza, Srikar Yellapragada, Zilinghan Li, Tarak Nath Nandi, Ravi K Madduri, Joel Saltz, Stergios Christodoulidis, Maria Vakalopoulou, Dimitris Samaras

机构 * Stony Brook University(石溪大学) MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎-萨克雷大学) Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学) Archimedes/Athena RC

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CDG-MAE是一种基于MAE的自监督方法,通过图像条件扩散模型生成多样化合成视图并采用多锚掩码策略,缩小了与基于视频的MAE方法的差距,同时保持仅图像MAE的数据优势。

Comments Accepted to TMLR 2026, Github link: https://github.com/cvlab-stonybrook/CDG-MAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01029 2026-08-04 cs.RO 新提交 79%

Diffusion-Based Body Schema Learning Enabling Abnormal-State Adaptation in Musculoskeletal Robots

基于扩散模型的身体模式学习:实现肌肉骨骼机器人的异常状态适应

Kento Kawaharazuka, Shuhei Ikemoto

机构 * The University of Tokyo(东京大学) Kyushu Institute of Technology(九州工业大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究针对肌肉骨骼机器人传统身体模式学习方法难以处理异常状态的问题,提出基于扩散模型的身体模式学习框架,通过仿真实验验证了其异常状态下自适应估计肌肉参数的有效性。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L), website - https://haraduka.github.io/muscle-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09916 2026-08-04 q-fin.PM stat.ML 版本更新 79%

Dynamic data generation and dynamic portfolio selection: an application of a score-based diffusion model

动态数据生成与动态投资组合选择:基于分数扩散模型的应用

Ahmad Aghapour, Erhan Bayraktar, Fengyi Yuan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出自适应分数扩散框架用于动态数据生成,将其应用于历史价格有限的动态均值-方差投资组合选择,实验显示该方法优于多个基准。

Comments Code available on https://github.com/fy-yuan/diffusion_dynamic_mv

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01972 2026-08-04 eess.AS cs.AI 新提交 78%

Music Restoration via Latent Operator Optimization and Diffusion Model Priors

基于潜在算子优化与扩散模型先验的音乐修复

Michal Švento, Eloi Moliner, Valtteri Kallinen, Lauri Juvela, Vesa Välimäki, Pavel Rajmic

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出LOUDAR方法,将未知失真建模为可学习潜在算子,结合预训练音频自编码器与潜在扩散模型先验,在歌声、吉他失真修复任务上表现优于退化输入且具竞争力。

Comments Accepted to the the 27th International Society for Music Information Retrieval Conference (ISMIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02602 2026-08-04 cs.CL 新提交 78%

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

AURORA-LM:用于连续潜在扩散语言建模的统一表示自动编码

Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan, Jiankun Zhang, ZY Cui, Jingkang Yang, Liucheng Guo, Shiqi Yang, B. Yang, Caifeng Shan, Ziwei Liu, Chenyang Si

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 AURORA-LM是一种分离文本表示构建与分布建模的连续潜在扩散语言模型,通过特定技术优化后,在OpenWebText自由生成和XSum摘要任务中性能优于同类模型。

Comments 40 pages, 17tables, project page: https://aurora-lm-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02502 2026-08-04 cs.AI 新提交 78%

CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization

CMuon:通过分块动量正交化加速并稳定扩散Transformer的训练

Chuyan Chen, Peng Sun, Kun Yuan

机构 * Peking University(北京大学) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散Transformer训练计算成本高、普通Muon优化器存在后期收敛问题的瓶颈,提出CMuon策略,通过分块权重实现训练加速与收敛优化,在ImageNet 256上200个epoch达FID1.18,训练速度超AdamW2倍

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02438 2026-08-04 cs.AI 新提交 78%

xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding

xPress:推测解码中扩散草稿模型的并行优化

Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM(国际商业机器公司(IBM))

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 xPress是恢复扩散草稿模型因果依赖的并行优化方法,在Qwen3-8B的7个基准上,可提升推测解码的接受长度与端到端吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02332 2026-08-04 cs.LG cs.AI cs.SY eess.SY 新提交 78%

Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning

面向离线强化学习的带行为优势修正的扩散策略

Botao Dong, Longyang Huang, Ning Pang, Hongtian Chen

机构 * School of Chemistry, Chemical Engineering and Biotechnology, Nanyang Technological University(南洋理工大学化学、化学工程与生物技术学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对离线强化学习中分布偏移导致的Q值估计偏差问题,提出带行为优势修正的扩散策略(DPBAC)算法,结合BAC-PE与扩散模型,在D4RL任务上实现优于SOTA的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01784 2026-08-04 cs.AI cs.CL 新提交 78%

REFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language Models

REFLEX:将MoE推理重新思考为扩散语言模型中的感知细化的计算分配

Xiang Xia, Cheng Yan, Yiming Zhang, Jiazheng Liu, Hongyu Zhang, Wuyang Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 REFLEX是一种无需训练的MoE推理方法,通过粗到细的专家预算分配和前沿进度分数,在扩散语言模型中平均减少15%专家计算量,同时保持或提升生成质量,实现更优的质量-计算权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01740 2026-08-04 cs.LG cs.AI 新提交 78%

Disagree to Accelerate: Closing the Loop on Diffusion Feature Forecasts

弃权以加速:闭合扩散特征预测的循环

Yanchao Li, Jiaqing Xie, Ben Gao, Wanhao Liu, Yanbo Wang, T. Y. Tsui, Jinfei Liu, Yuqiang Li, Tianfan Fu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出无需训练的闭环控制器RACER,利用预测分歧信号调整对扩散特征预测的信任度,在多模型多数据集上实现了相同评估次数下的性能提升或同等质量下的更快采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01717 2026-08-04 cs.LG 新提交 78%

Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models

超越在线策略探索:将外部策略 rollout 整合用于扩散语言模型中的强化学习

Wonseok Lee, Jimyeong Kim, Jungmin Ko, Wonjong Rhee

机构 * Seoul National University(首尔大学) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能交叉项目) Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究院) Department of Intelligence and Information, Seoul National University(首尔大学智能与信息系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对扩散大语言模型强化学习中在线策略 rollout 稀缺的问题,提出 ERILS 方法整合外部策略 rollout,在数独等任务上显著提升性能,验证了 rollout 构建与奖励处理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01093 2026-08-04 cs.SD 新提交 78%

Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion

分离与检测:通过潜在扩散实现统一鼓转录与音轨生成

Wei-Han Hsu, Chih-Cheng Chang, Bo-Yu Chen, Li Su, Yi-Hsuan Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出分离与检测框架,以5音轨潜在扩散模型为前端,结合起始点分支等辅助训练,实现鼓转录与音轨生成,性能优于基线,兼具分离音轨能力。

Comments 8 pages, 3 figures, 4 tables. Accepted at the 27th International Society for Music Information Retrieval Conference (ISMIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00605 2026-08-04 cs.AI 新提交 78%

Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs

逃离置信陷阱:扩散大语言模型数学推理的进化解码

Zhenhong Sun, Hanqing Zhao, Yatao Bian, Rongcheng Tu, Liuyue Xie, Xu Zhang, Jue Wang, Davide Modolo, Daoyi Dong, Dacheng Tao

机构 * Australian National University(澳大利亚国立大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊) University of Technology Sydney(悉尼科技大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散大语言模型数学推理的置信陷阱,提出无训练的进化解码框架,通过逐步选择与分块变异提升LLaDA 2.0的数学推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00011 2026-08-04 cs.CL cs.AI 新提交 78%

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

DLLM-TTS:用于文本到语音合成的块离散扩散语言模型

Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出 DLLM-TTS 框架,将 TTS 建模为基于 X-Codec2 的条件块离散扩散,通过块内掩码扩散与并行预测实现高效语音生成,在 Seed-TTS-eval 基准上取得良好性能,兼具实用性与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏