arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-13 至 2026-08-13 共收录 78 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2608.11452 2026-08-13 cs.CV cs.AI 新提交 79%

TangPoetryBench: A Multi-Dimensional Benchmark and Rubric-Conditioned Evaluator for Poetry-to-Image Generation

TangPoetryBench:面向诗歌到图像生成的多维度基准与基于评分规则的评估器

Haoqi Hu, Tongji Luo, Li Zhang, Boning Zhou

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 该研究推出TangPoetryBench多维度基准与PAE评估器,解决T2I模型生成诗歌插图的评估难题,PAE性能接近Claude且可泛化,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11343 2026-08-13 cs.AI cs.CV cs.IR cs.LG 新提交 74%

Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval

前沿大语言模型能否媲美原生多模态嵌入?在难负例文本到图像检索上的对比

Archan Dutta, Vyanktesh Kanungo

机构 * Westcliff University(韦克利夫大学)

专题命中 文生图 :text-to-image(title);分类 cs.CV

AI总结 本研究在Flickr30k数据集上对比Gemini Embedding 2等原生多模态嵌入与GPT-4.1、Claude Sonnet 4.6等前沿LLM的难负例文本到图像检索性能,发现二者表现相当,且多模态嵌入更适配低延迟应用

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2608.12122 2026-08-13 cs.RO cs.CV 新提交 79%

HandEdit: A Unified Benchmark for Egocentric Human-to-Robot Dexterous Hand Image Editing

HandEdit:用于自我中心视角下人类到机器人灵巧手图像编辑的统一基准

Zhenjie Yang, Xingyu Jiao, Guopeng Zhong, Shuzhe Yang, Shi Che, Chao Wu, Chenyu Jiang, Dongjie Zhang, Yideng Zhang, Zheng Zhang, Muyun Jiang, Haisheng Su, Shuang Jin, Donghang Zhang, Chao Yang, Li Chen, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 HandEdit是含2亿+实例、覆盖26种URDF的统一具身感知图像编辑基准,用于弥合人类与机器人数据差异,可评估11种图像编辑基线,助力具身人工智能发展。

Comments Technical Report. Project Page: https://handedit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10798 2026-08-13 cs.CV cs.AI cs.LG 版本更新 57%

Beyond Fixed Luminance: Towards Panchromatic and Orthochromatic Image Colorization

超越固定亮度:迈向全色与正色图像上色

Swarnim Maheshwari, Syed Imam Ali, Vineeth N. Balasubramanian

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 该研究针对固定亮度图像上色系统在正色摄影输入下不可靠的问题,提出基于基础图像编辑模型的亮度无关框架,结合混合灰度目标训练,提升了正色输入上色的鲁棒性并减少色彩伪影。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07826 2026-08-13 cs.CV 版本更新 57%

OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing

OpenVE-3M: 一种大规模高质量的指令引导视频编辑数据集

Haoyang He, Jie Wang, Jiangning Zhang, Zhucun Xue, Xingyuan Bu, Qiangpeng Yang, Shilei Wen, Lei Xie

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 OpenVE-3M是一个大规模高质量的指令引导视频编辑数据集,包含多种编辑类型,通过精心设计的数据管道生成,并展示了高效的5B模型在基准测试中的卓越性能。

Comments Accepted by ECCV'26. Project page: https://lewandofskee.github.io/projects/OpenVE

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 63 篇

2602.23783 2026-08-13 cs.CV 版本更新 89%

Diffusion Probe: Generated Image Result Prediction Using CNN Probes

扩散探针:利用CNN探针进行生成图像结果预测

Benlei Cui, Bukun Huang, Zhizeng Ye, Xuemei Dong, Tuo Chen, Hui Xue, Dingkang Yang, Longtao Huang, Jingqun Tang, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, School of Statistics and Data Science, Zhejiang Gongshang University(浙江工商大学统计与数据科学学院共同富裕统计监测与智能治理实验室) Southeast University(东南大学) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ByteDance Inc.(字节跳动有限公司)

专题命中 扩散模型 :diffusion(title,summary_cn);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Diffusion Probe框架,通过早期扩散交叉注意力分布预测最终图像质量,提升文本生成图像的效率与质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11732 2026-08-13 cs.CR cs.AI 新提交 88%

Fingerprinting Text-to-Image Diffusion Models via Collapsed Generation

基于塌陷生成的文本到图像扩散模型指纹识别

Yuanmin Huang, Chen Chen, Geng Hong, Xiaoyu You, Hui Xue, Zhenxing Qian, Mi Zhang, Min Yang

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract)

AI总结 本研究提出基于塌陷生成的非侵入式指纹框架,可在白盒和黑盒设置下验证文本到图像扩散模型的所有权,且对微调衍生模型及混淆具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11807 2026-08-13 cs.CV 新提交 83%

CoDiR: Confidence-Guided Diffusion Refinement for Semi-Supervised Histopathology Segmentation

CoDiR:用于半监督组织病理学分割的置信度引导扩散精调

Hoai Nhan Pham, Dang-Nguyen Bui, Le-Van Thai, Thanh-Hiep Vo, Lan Anh Dinh Thi, Tien Dat Nguyen, Duy-Dong Nguyen, Ngoc Lam Quang Bui, Tam Tran, Zhi Huang

机构 * AI VIETNAM Lab(AI VIETNAM实验室) Portland Community College(波特兰社区学院) University of Science, VNU-HCM(胡志明市国家大学科学大学) Hanoi University of Science and Technology(河内科技大学) Jeonbuk National University(全北国立大学) Washington University School of Medicine(华盛顿大学医学院) Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对半监督组织病理学分割的标注稀缺与伪标签不可靠问题,提出CoDiR框架,结合Mean Teacher与扩散模型精调伪标签,在GlaS、CRAG数据集上取得优异mDice指标,精调模块贡献显著

Comments Accepted to the MICCAI COMPAYL Workshop 2026 (11 pages, 2 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17585 2026-08-13 cs.CV 版本更新 83%

Pixel-Space Diffusion Transformers

像素空间扩散变换器

Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Yimao Cai, Kilian M. Pohl, Guoying Zhao

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学) University of Oulu(奥卢大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11475 2026-08-13 q-bio.QM cs.LG 新提交 82%

Probing and steering biology across Boltz-1s trunk-diffusion boundary

探测与操控Boltz-1主干-扩散边界处的生物学特性

Piotr Jedryszek, Tongmeng Xie, Adam Winnifrith, Alexander Hasson, Weronika Ślesak, George Wicks, Toby Winnifrith, Oliver M. Crook

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究以Boltz-1为对象,分析其主干与扩散模块的生物学信息传递差异,验证线性可解码方向的操控性,发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12308 2026-08-13 cs.CV cs.AI 新提交 79%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12175 2026-08-13 cs.CV 新提交 79%

TGRHuman: Text-Guided Realistic 3D Human Generation via Diffusion Renderer

TGRHuman:基于扩散渲染器的文本引导逼真3D人体生成

Muxin Zhang, Chaohui Yu, Yuanwang Yang, Min Wei, Zhuo Su, Kun Li

机构 * Tianjin University(天津大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出TGRHuman方法,解耦3D人体的几何与纹理生成,采用显式多视图优化结合扩散渲染器,实现高效高质量文本引导的逼真3D人体生成,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12155 2026-08-13 cs.CV 新提交 79%

Understanding Why Foundation Models Work for Diffusion-Generated Image Detection

探究基础模型为何适用于扩散生成图像检测

Davide Cozzolino, Giovanni Poggi, Luisa Verdoliva

机构 * University Federico II of Naples(那不勒斯费德里科二世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究探究基础模型用于扩散生成图像检测的原因,通过DDIM反演、频率交换及潜在空间分析,发现其利用中低频分布差异实现检测,为该类方法的可解释性提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12032 2026-08-13 cs.CV cs.AI 新提交 79%

LoSA: Near-Lossless Sparse Attention for Training-Free Video Diffusion Acceleration

LoSA:用于无训练视频扩散加速的近无损稀疏注意力

Enhuai Liu, Yunke Wang, Yutong Wang, Changming Sun, Chang Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LoSA是一种无训练稀疏注意力方法,通过固定99%的注意力质量阈值移除冗余计算,在多款视频扩散Transformer上实现最高3.2倍加速,且速度-质量权衡优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11942 2026-08-13 cs.CV 新提交 79%

Evaluating and Calibrating Diffusion Model-derived Uncertainty for Quantitative MRI Mapping

评估与校准扩散模型衍生的定量MRI成像不确定性

Shishuai Wang, Stefan Klein, Juan A. Hernandez-Tamames, Dirk H. J. Poot

机构 * Erasmus MC(伊拉斯姆斯医学中心) TU Delft(代尔夫特理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对深度学习定量MRI成像方法可靠性未明确表征的问题,评估了扩散模型衍生的不确定性,发现其与成像误差正相关,经校准后可用于可靠性评估与选择性预测。

Comments 11 pages, 6 figures. Accepted at the MICCAI 2026 Workshop on Uncertainty for Safe Utilization of Machine Learning in Medical Imaging (UNSURE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11913 2026-08-13 cs.CV 新提交 79%

HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion

HarmoniDPO:基于偏好优化扩散模型的视频引导音频生成

Wenshuo Peng, Kaipeng Zhang

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HarmoniDPO框架,采用双视频表示、online-DPO微调及DDS算法,实现更精准的视频到音频生成,在音视频同步性与主观质量上优于现有最优方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11765 2026-08-13 cs.CV 新提交 79%

ProBAG: Prototype-Guided Boundary-Aware Graph Diffusion for Weakly Supervised Histopathology Segmentation

ProBAG:用于弱监督组织病理学分割的原型引导边界感知图扩散

Duy-Dong Nguyen, Le-Van Thai, Hoai Nhan Pham, Ngoc Lam Quang Bui, Tam Tran, Zhi Huang

机构 * AI VIETNAM Lab(AI越南实验室) Washington University School of Medicine(华盛顿大学医学院) Jeonbuk National University(全北国立大学) Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ProBAG是一种新的弱监督组织病理学分割方法,通过结合视觉与文本原型、逐类功率重新校准及图扩散机制,在BCSS-WSSS和LUAD-HistoSeg数据集上取得优于现有方法的性能。

Comments 12 pages, 2 figures, 4 tables. Accepted by MICCAI Workshop (COMPAYL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11748 2026-08-13 cs.CV 新提交 79%

Dual Modality Prompted Diffusion Priors for Zero Shot Hyperspectral Pansharpening

用于零样本高光谱 pansharpening 的双模态提示扩散先验

Pengwei Xie, Fei Zhu, Jiajun Li, Xiangyuan Liu, Xiangyuan Liu, Kangqing Shen, Gemine Vivone

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Peking University(北京大学) National Center for Applied Mathematics Shenzhen (NCAMS), Southern University of Science and Technology(南方科技大学深圳应用数学国家中心) Department of Automation, Tsinghua University(清华大学自动化系) National Research Council of Italy, Institute of Integrated Methodologies for Earth Observation (CNR-IMIOT)(意大利国家研究委员会综合地球观测方法研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对零样本高光谱 pansharpening 问题,提出双模态提示扩散模型 DIDM,通过双模态提示注入与全色引导正则化实现空间细节与光谱保真的平衡,在多数据集实验中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11617 2026-08-13 cs.CV 新提交 79%

KANResDiff: Learning Local Residual Diffusion via Kolmogorov-Arnold Network for Ambiguous Medical Image Segmentation

KANResDiff:基于柯尔莫哥洛夫-阿诺德网络学习局部残差扩散以解决模糊医学图像分割问题

Fanding Li, Chenglin Wang, Xiangyu Li, Xingyu Qiu, Xinghua Ma, Xiangming Yin, Haiyang Li, Suyu Dong, Wei Wang, Kuanquan Wang, Gongning Luo, Shuo Li

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部) College of Computer and Control Engineering, Northeast Forestry University(东北林业大学计算机与控制工程学院) Case Western Reserve University(凯斯西储大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现有模糊医学图像分割方法无法形成渐进式语义建模的问题,提出KANResDiff模型,通过独立时间编码与残差薛定谔桥实现阶段感知模糊性建模,在公开数据集上取得SOTA性能。

Comments 10 pages, 3 figures, MICCAI 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11562 2026-08-13 cs.CV cs.AI eess.IV 新提交 79%

From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection

从合成到去除:基于物理的反射模拟与基于扩散的视频去反射

Zepeng Wang, Jiagao Hu, Fuhao Li, Yuxuan Chen, Fei Wang, Daiguo Zhou

机构 * Xiaomi Inc.(小米公司) MiLM Plus

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对视频反射去除数据与模型缺失问题,提出闭环框架S2R,含基于物理的反射模拟、首个扩散式视频去反射模型及专用基准,实现了更优性能与更快推理。

Comments Project page: https://codingwzp.github.io/VideoDereflection_S2R

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27345 2026-08-13 cs.CV 版本更新 79%

SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers

RayPE: 用于3D感知视频生成的射线空间位置编码

Minghao Yin, Jiahao Lu, Wenbo Hu, Wang Zhao, Shan Ying, Kai Han

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) ARC Lab, Tencent(腾讯ARC Lab)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出RayPE,通过向自注意力注入6D Plücker坐标编码射线几何关系,提升视频扩散Transformer的3D一致性和相机可控性。

Comments Project page: https://visual-ai.github.io/scope/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23726 2026-08-13 physics.med-ph cs.AI cs.CV 79%

q3-MuPa: Quick, Quiet, Quantitative Multi-Parametric MRI using Physics-Informed Diffusion Models

q3-MuPa: 快速、安静、定量的多参数MRI使用物理引导的扩散模型

Shishuai Wang, Florian Wiesinger, Noemi Sgambelluri, Carolin Pirkl, Stefan Klein, Juan A. Hernandez-Tamames, Dirk H. J. Poot

机构 * Erasmus University Medical Center(埃拉斯姆斯大学医学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的qMRI映射方法,结合物理数据一致性约束,提升映射性能并实现四倍加速的高质qMRI成像。

Journal ref Magnetic Resonance Imaging 131 (2026) 110699

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07661 2026-08-13 cs.CV 版本更新 79%

Optimization-Guided Diffusion for Interactive Scene Generation

基于优化的扩散生成交互场景

Shihao Li, Naisheng Ye, Tianyu Li, Kashyap Chitta, Tuo An, Peng Su, Boyang Wang, Haiou Liu, Chen Lv, Hongyang Li

机构 * Beijing Institute of Technology(北京理工大学) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Nanyang Technological University(南洋理工大学) NVIDIA Research(英伟达研究院) Yinwang Intelligent Tech. Co. Ltd.(银网智能科技有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OMEGA框架,通过优化引导扩散过程生成符合物理和行为约束的多智能体驾驶场景,提升生成场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02943 2026-08-13 cs.CV 版本更新 79%

TC-Padé: Trajectory-Consistent Padé Approximation for Diffusion Acceleration

TC-Padé:轨迹一致的Padé近似用于扩散加速

Benlei Cui, Shaoxuan He, Bukun Huang, Zhizeng Ye, Yunyun Sun, Longtao Huang, Hui Xue, Yang Yang, Jingqun Tang, Zhou Zhao, Haiwen Hong

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang Gongshang University(浙江工商大学) ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出轨迹一致的Padé近似方法,通过有理函数建模特征演变,实现低步数下的高效扩散模型加速。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16477 2026-08-13 cs.CV 79%

qMRI Diffuser: Quantitative T1 Mapping of the Brain using a Denoising Diffusion Probabilistic Model

Shishuai Wang, Hua Ma, Juan A. Hernandez-Tamames, Stefan Klein, Dirk H. J. Poot

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted by Deep Generative Models workshop at MICCAI 2024

Journal ref Deep Generative Models, Lecture Notes in Computer Science 15224 (2025) 129-138

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11514 2026-08-13 eess.IV 新提交 78%

SinoDiff: Physics-Consistent Self-Supervised Diffusion for Unified Low-Dose to Standard-Dose PET Sinogram Recovery

SinoDiff:用于统一低剂量到标准剂量PET正弦图恢复的物理一致性自监督扩散模型

Ghulam Nabi Ahmad Hassan Yar, Himashi Peiris, Sharna Jamadar, Alex Fornito, Zhaolin Chen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对现有PET恢复方法的泛化性或灵活性不足问题,提出SinoDiff物理一致性自监督扩散框架,通过泊松 thinning 与频域卷积实现统一剂量水平的PET正弦图恢复,在两类数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12083 2026-08-13 cs.LG cs.AI 新提交 78%

Faithful, Sufficient and Understandable: Rethinking Graph Counterfactual Explanations via Discrete Diffusion Inversion

忠实、充分且可解释:通过离散扩散反演重新思考图反事实解释

David Bechtoldt, Sidney Bender

机构 * TU Berlin(柏林工业大学) BIFOLD–Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对图神经网络预测缺乏内在解释的问题,提出GDCE-I方法,结合离散扩散反演技术,在统一评估框架下于四个基准测试中大幅优于相关工作,可生成符合领域规则的可解释图反事实解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11742 2026-08-13 cs.CL 新提交 78%

Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models

波纹枢轴搜索:扩散大语言模型的主动并行解码

Yushi Ye, Xu Chen, Haoyun Jiang, Jinsong Lan, Haihong Tang, Bo Han, Ivor Tsang, Yanfeng Wang, Bo Zheng, Jiangchao Yao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学合作中位数网络创新中心) Alibaba Group TMLR Group(阿里巴巴集团TMLR团队) Hong Kong Baptist University(香港浸会大学) A*STAR CFAR and Nanyang Technological University(新加坡科研局计算科学中心和南洋理工大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出RPS方法,利用dLLM解码的波纹效应,在保持生成质量的同时,大幅提升解码速度与准确率,适用于推理及代码生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11419 2026-08-13 cs.LG 新提交 78%

Diffusion-Based Data-Driven Assortment Optimization

基于扩散模型的数据驱动 assortment 优化

Junyi Liao, Xiaohui Jiang, Zhengwei Tong, Ethan X. Fang, Vahid Tarokh

机构 * Duke University(杜克大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对传统 assortment 优化模型对设定误差敏感、难以捕捉复杂客户行为的问题,提出基于引导离散扩散的模型无关框架,可高效生成高质量、多样化的 assortment,在高维场景下鲁棒性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11235 2026-08-13 cs.AI 新提交 78%

CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference

CORA-Diff:面向高效扩散语言模型推理的置信导向残差接受

Yifan Wu, Yufeng Zhang, Kenli Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出无需训练的CORA-Diff方法,利用原生置信度与持久性门控识别残差位置,在多基准测试中显著降低扩散语言模型推理的重复计算,同时保持任务性能。

Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/wyffffff/cora-diff-llada

详情

展开后加载摘要…

URL PDF HTML 收藏