arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-21 至 2026-07-21 共收录 133 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2607.17634 2026-07-21 cs.CV 新提交 93%

MixDiffusion: Mixing Diffusion-based Uni-condition Text-to-Image Generation Models for Multi-condition Image Synthesis

MixDiffusion:用于多条件图像合成的基于混合扩散的单条件文本到图像生成模型

Pengcheng Wan, Liang Han, Lin Xu, Bowen Xiao, Liqiang Nie

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract)

AI总结 研究针对现有基于扩散的文本到图像生成方法控制条件单一的问题,提出MixDiffusion框架,通过集成多个预训练单条件模型,支持多条件图像合成,具有无需训练、易部署和可扩展新模态的特点。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16828 2026-07-21 cs.CV 新提交 88%

UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation

UniNDM:文本到图像生成中针对性内容的统一噪声驱动检测与缓解框架

Yao Huang, Yitong Sun, Huanran Chen, Ruochen Zhang, Shouwei Ruan, Ranjie Duan, Maoxun Yuan, Yinpeng Dong, Hui Xue, Xiaochun Cao, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室人工智能研究院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) Security Department, Alibaba Group(阿里巴巴集团安全部) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像生成易受隐式性提示影响的问题,提出UniNDM统一噪声驱动框架。利用早期预测噪声的可分离性开发轻量级检测器,引入噪声增强自适应负引导缓解问题,扩展到扩散变压器架构,实验显示比现有方法有显著改进。

Comments 18 pages, 10 figures, accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16307 2026-07-21 cs.CV 新提交 88%

CoBind: Stage-Aware Compositional Binding for Training-Free Text-to-Image Generation

CoBind:用于无训练文本到图像生成的阶段感知组合绑定

Kaijie Chen, Ethan Caldwell, Mira Vossen, Julian Hartwell, Serena Whitlock, Adrian Bellamy

机构 * Mind Lab(思维实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 研究针对扩散文本到图像模型处理复杂提示失败的问题,提出CoBind框架,先解析提示为组合图,利用多种约束建立布局、绑定属性,去噪时调整引导强度,无需重新训练或注释,实验证明其在多方面有改进且视觉质量有竞争力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17779 2026-07-21 cs.AI 新提交 85%

Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models

动态防御剖析实现文本到图像模型的认知越狱

Dongdong Yang, Deyue Zhang, Zhao Liu, Zonghao Ying, Wenzhuo Xu, Jiankai Jin, Xiangzheng Zhang, Quanchen Zou

机构 * Alibaba Tongyi Lab(阿里巴巴通义实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn)

AI总结 研究文本到图像模型易受对抗性滥用问题,提出MIND认知越狱框架,将对抗提示生成重构为信念状态推理,集成多模态判断器等组件,经实验验证其在多个防御设置下显著优于现有方法,有效实现越狱生成。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 6 篇

2607.16291 2026-07-21 cs.CV 新提交 88%

Beyond Target Scores: Measuring Off-Target Drift in Diffusion-Based Medical Image Editing

超越目标分数:测量基于扩散的医学图像编辑中的偏离目标漂移

Todd Zhou

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 研究基于扩散的医学图像编辑中偏离目标漂移问题,引入CIB-Med-1基准及受约束扩散引导基线,通过多指标评估编辑效果,实验显示能保留目标进展并减少偏离目标漂移,强调应从轨迹级语义控制角度评估医学图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25578 2026-07-21 cs.CV 版本更新 81%

H-Adapter: Pose-Robust Hairstyle Transfer via Attention-Derived, Source-Aligned Hair Masks

H-Adapter: 通过注意力导出的源对齐头发掩码实现姿态鲁棒的发型迁移

Seulgi Jeong, Yunseong Cho, Sanghun Park

机构 * SNOW Corp.(SNOW公司)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);diffusion(abstract);inpainting(abstract)

AI总结 提出H-Adapter,利用区域特定损失解耦头发与非头发目标,导出源对齐头发编辑掩码引导扩散修复,实现大姿态差异下的鲁棒发型迁移,在FID、FID_CLIP和CLIP-I指标上取得最优。

Comments Accepted at ECCV 2026. Project page: https://sanghunpark.github.io/hadapter_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17768 2026-07-21 cs.CV 新提交 79%

To Blend In, First Decouple: Rethinking Camouflage Image Generation via Context-Decoupled Representations

为了融入,首先解耦:通过上下文解耦表示重新思考伪装图像生成

Wenzhuang Wang, Yifan Zhao, Mingcan Ma, Yunlong Che, Haoran Chen, Ming Liu, Jia Li

机构 * Beihang University(北京航空航天大学) Geely Automobile Research Institute (Ningbo) Co., Ltd(吉利汽车研究院(宁波)有限公司)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 研究伪装图像生成问题,提出上下文解耦生成范式CamoDreamer,通过设计对比感知上下文桥等方法,将潜在伪装特征解耦为物体和背景控制流,实验证明其显著优于现有方法且设计轻量。

Comments 14 pages, 11 figures, ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17140 2026-07-21 cs.CV 新提交 70%

STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs

STBridge:用于在统一多模态模型中弥合理解与生成的共享目标对齐

Ye Wang, Hongjun Wang, Hao Fang, Tongyuan Bai, Zuwei Long, Peixian Chen, Wei Liu, Weibo Gu, Xing Sun, Rui Ma

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 研究统一多模态模型中理解与生成的对齐差距,提出STBridge共享目标对齐框架,通过共同目标状态连接二者,采用对齐然后优化策略,经实验验证该框架能缩小模型描述与生成间差距,有效弥合理解与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13125 2026-07-21 cs.CV cs.AI 版本更新 70%

Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget

Boogu-Image-0.1:提升开源统一多模态理解与生成能力

Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S. Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 介绍开源统一多模态模型Boogu-Image-0.1,通过改进模型理解、数据质量和训练管道等,结合智能推理扩展,提升生成和编辑性能,在标准基准测试中表现出色,成本低,还分享实践讨论并开源代码等推动相关生态发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18227 2026-07-21 cs.CV 新提交 57%

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成及模态模仿

Dingyun Zhang, Lixue Gong, Wei Liu

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究探索在单一模型中整合视频和图像模态的生成与编辑能力,开发像素对时间扭曲流场实时生成视频编辑样本,设计模态模仿损失对齐模态能力,引入相关任务及损失让模型内化基于语言的视觉编辑能力。

Comments Due to file size constraints, the figures in the arXiv file have been heavily lossy-compressed. Please visit the uncompressed file at: https://huggingface.co/datasets/FlowMimic/Uncompressed/blob/main/main.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 102 篇

2602.04344 2026-07-21 cs.LG cs.AI 版本更新 89%

UnMaskFork: Test-Time Scaling for Masked Diffusion via Deterministic Action Branching

UnMaskFork:通过确定性动作分支实现Masked Diffusion的测试时扩展

Kou Misaki, Takuya Akiba

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 UnMaskFork通过确定性动作分支提升Masked Diffusion在测试时的扩展能力,优于现有方法并在复杂任务中表现优异。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16636 2026-07-21 cs.CV 版本更新 83%

REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion

利用全局和局部语义重新绑定潜在信息以进行纠缠扩散

Giorgos Petsangourakis, Christos Sgouropoulos, Bill Psomas, Theodoros Giannakopoulos, Giorgos Sfikas, Ioannis Kakogeorgiou

机构 * University of West Attica(西阿提卡大学) VRG, FEE, Czech Technical University in Prague(布拉格捷克技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 研究针对潜在扩散模型语义监督不足问题,提出REGLUE框架,联合建模VAE图像潜在信息、局部VFM语义和全局[CLS]令牌,用轻量级卷积语义压缩器聚合特征,经实验验证该框架能提升FID并加速收敛。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17657 2026-07-21 cs.CV 版本更新 83%

Improving Diffusion Generative Models via Truncated Karhunen--Loève Expansion

通过截断卡尔胡宁-勒夫展开改进扩散生成模型

Yumeng Ren, Yaofang Liu, Aitor Artola, Laurent Mertz, Raymond H. Chan, Jean-michel Morel

机构 * City University of Hong Kong(香港城市大学) Lingnan University of Hong Kong(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究预训练扩散模型训练-采样不匹配问题,提出基于截断卡尔胡宁-勒夫展开的无训练采样策略,通过相应方程实现,无需修改网络架构,在多数据集上改进预训练模型,加快收敛并降低生成误差。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00126 2026-07-21 cs.RO 版本更新 82%

Compositional Diffusion with Guided Search for Long-Horizon Planning

用于长期规划的带引导搜索的组合扩散

Utkarsh A Mishra, David He, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 研究针对组合生成模型在局部分布多模态时的模式平均问题,提出带引导搜索的组合扩散方法(CDGS),通过特定采样、过滤和重采样解决问题,在机器人操作任务上表现出色且跨领域通用。

Comments 38 pages, 18 figures, ICLR 2026 ORAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17411 2026-07-21 cs.GR cs.LG 新提交 79%

Feature-Guided Diffusion for Non-Differentiable Inverse Rendering

用于不可微逆渲染的特征引导扩散

Andrei-Timotei Ardelean, Michael Fischer, Tim Weyrich, Tomáš Iser

机构 * Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 研究逆渲染问题,提出完全黑箱框架FIDE,通过特征引导,利用视觉Transformer提取特征训练扩散模型,结合CMA进化策略优化,在多种逆问题上验证,显著提升收敛速度并逃离局部最小值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16656 2026-07-21 cs.CV 新提交 79%

DORS: Dynamic Attention Routing for Diffusion-based Object Removal in Dense Scenes

DORS:用于密集场景中基于扩散的目标移除的动态注意力路由

Haitong Tang, Haipeng Liu, Yang Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对密集场景目标移除中因语义干扰致移除不完整的问题,提出基于动态注意力路由机制的DORS框架,含实例过滤注意力和上下文引导路由组件,经实验验证其性能优于现有方法。

Comments 16 pages, 10 figures, to appear in ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16300 2026-07-21 cs.CV 新提交 79%

FedDP-PALD: A Privacy-Preserving Federated Latent Diffusion Framework with Prototype Aggregation for Medical Data Synthesis

FedDP-PALD:一种用于医学数据合成的具有原型聚合的隐私保护联邦潜在扩散框架

Md. Sajeebul Islam Sk., Khan Enaet Hossain, Md. Mehedi Hasan Shawon

机构 * BRAC University(BRAC大学) York University(约克大学) University of Maryland(马里兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对医学数据合成中隐私保护及合成数据预测结构问题,提出FedDP-PALD框架,通过带掩码的门控多头注意力联合处理多模态数据,引入DP-PMA维持差分隐私,实验表明该框架能生成隐私合成表示,保持决策性能并抵抗成员推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13247 2026-07-21 cs.CV 版本更新 79%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19499 2026-07-21 cs.LG math.OC stat.ML 版本更新 79%

On the Interpolation Effect of Score Smoothing in Diffusion Models

在扩散模型中分数平滑的插值效应

Zhengdao Chen

机构 * Google Research(谷歌研究)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究分数平滑如何通过去噪动态在一维子空间内插值训练数据,并通过理论和实验验证神经网络学习分数函数的自然效果。

Comments 35 pages, 14 figures. Code available at: https://github.com/google-research/diffusion-score-smoothing

Journal ref 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16685 2026-07-21 stat.ML cs.LG 新提交 78%

Semi-Supervised Conditional Diffusion via Label Augmentation

通过标签增强实现半监督条件扩散

Jin Su, Yuan Gao, Yong Zhou, Jian Huang

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学) School of Statistics and Data Science, Nankai University(统计与数据科学学院,南开大学) School of Statistics, East China Normal University(统计学院,华东师范大学) Department of Data Science and AI, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究如何利用未标记数据改进条件扩散模型,提出标签增强条件扩散方法(LACD),通过给未标记数据赋平凡标签并联合去噪,在理论上保证可识别性和收敛速度,实验证明该方法在样本效率和生成性能上优于纯监督估计器。

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17972 2026-07-21 cs.LG 新提交 78%

DiFA: Inference-Time Forward-Process Alignment for Diffusion Models

DiFA:扩散模型的推理时间前向过程对齐

Shigui Li, Delu Zeng

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出DiFA框架,将扩散模型推理时的数据预测细化转为顺序状态估计问题,受卡尔曼滤波启发建立前向对齐时间一致性,引入偏差引导机制,实验表明该方法在多个指标上显著提升CIFAR-10和ImageNet的生成保真度。

Comments Accepted to ICML 2026. 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17884 2026-07-21 cs.AI 新提交 78%

ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

ST-Veto:通过泰勒预测和视觉基础实现用于扩散多模态语言模型的时空令牌否决

Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散多模态大语言模型推理不足问题,提出无需训练的ST-Veto方法,利用二阶泰勒预测和图像注意力质量否决不稳定及弱基础令牌,与更安全候选交换,在多基准测试中优于其他方法,提升准确率且无额外成本。

Comments ICML 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17652 2026-07-21 cs.AI 新提交 78%

FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models

FlowBlock:用于自校正扩散语言模型的波前并行解码

Bing Tian, Haikun Liu, Xiaocheng Zhong, Zhuohui Duan, Zhaokai Luo, Huayi Jin, Zhiyong Wang, Xiaofei Liao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对块级扩散大语言模型块间解码串行问题,提出无需训练的\flowblock{}并行解码框架,基于门控波前解码和异构波前打包机制,相比串行模型提升了每秒令牌数、降低延迟并提高准确率,优于基于训练的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17257 2026-07-21 cs.RO cs.AI 新提交 78%

Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion

通过延迟感知引导融合实现异步多模态扩散策略组合

Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Noematrix(无矩阵) Shanghai Innovation Institute(上海创新研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对多模态扩散策略在模态差异下的融合问题,提出LAG - Fusion框架,通过延迟感知引导融合实现异步策略组合,推导参考帧重定位规则,在接触丰富操纵实验中提升了策略响应性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17037 2026-07-21 cs.LG cs.CE 新提交 78%

Apeliotes: A Diffusion-Based Modeling Framework for km-scale Multi-Level Atmospheric Fields

Apeliotes:一种用于千米尺度多层大气场的基于扩散的建模框架

Evangelia Rafaela Frastali, Achyut Paudel, Maryam Golbazi, Frank Liu

机构 * Old Dominion University(奥多明尼昂大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对高分辨率大气数据受限问题,Apeliotes框架基于全球再分析等数据构建,能提供千米尺度天气变量和多层大气场,经评估性能极具竞争力,预测垂直风廓线等有高精度表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16872 2026-07-21 cs.CL cs.AI cs.LG 新提交 78%

Trace-Based On-Policy Distillation for Masked Diffusion Language Models

基于轨迹的策略蒸馏用于掩码扩散语言模型

Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16674 2026-07-21 cs.LG 新提交 78%

CLDRoute: Conditional Latent Diffusion for Routability Map Generation in Physical Design

CLDRoute:用于物理设计中可布线性映射生成的条件潜扩散

Kiran Thorat, Nicole Meng, Caiwen Ding, Yingjie Lao, Zhijie Jerry Shi

机构 * University of Connecticut(康涅狄格大学) Tufts University(塔夫茨大学) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对物理设计中可布线性估计问题,提出CLDRoute框架,将其作为条件生成问题,用物理感知条件和特定任务潜变量建模,支持样本推理,在CircuitNet 2.0上取得较好实验结果,能生成预期结果及其不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16207 2026-07-21 cs.AI cs.CR 新提交 78%

JUMP: Single-Pass Membership Inference on Fine-Tuned Diffusion Language Models

JUMP:微调扩散语言模型的单通道成员推理

Yeachan Jun, Albert No

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究微调离散扩散语言模型的成员推理攻击,提出JUMP单通道评分攻击,利用dLLMs任意顺序可解码性和并行可解码性,在六个MIMIR域上的微调LLaDA - 8B - Base上提升了平均ROC - AUC并改善低FPR检测,且减少查询次数。

Comments 24 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16204 2026-07-21 cs.AI cs.LG 新提交 78%

Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL

掩码扩散语言模型是用于智能体强化学习的强大且可控的基于文本的世界模型

Darshan Deshpande

机构 * Patronus AI(守护神人工智能公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究强化学习中世界模型问题,对比自回归语言模型和掩码扩散语言模型,发现掩码扩散语言模型性能更优。引入GRPO训练框架,在三个OOD环境上零样本转移消融效果良好,还进行相关分析与评估,最后开源工作推动该领域研究。

Comments Dataset: https://huggingface.co/PatronusAI/world_model_corpus Training code: https://github.com/patronus-ai/mdlm_world_modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17522 2026-07-21 cs.LG cs.AI cs.IT math.IT math.PR 新提交 78%

One-step lowest-variance selection in a Gaussian random-field model motivated by masked diffusion: Total correlation and a square root collision threshold

由掩码扩散驱动的高斯随机场模型中的一步最低方差选择:总相关性和平方根碰撞阈值

Linjun Li

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 受掩码离散扩散启发,研究高斯随机场模型单步选择,用局部相关非负分数场表示不确定性,通过距离相关高斯模型衡量所选位置相关性,建立两个互补结果,为理解相关因素对掩码离散扩散中基于置信度一步选择的影响提供基线。

Comments 27 pages; welcome comments

详情

展开后加载摘要…

URL PDF HTML 收藏