arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-28 至 2026-07-28 共收录 141 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2607.24353 2026-07-28 cs.CV 新提交 88%

PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation

PRISM:通过基于图像的自我奖励机制进行文本到图像生成的提示优化

Guo Tang, HongJie Luo, Tianxu Wang, Ying Zhang, Hao Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Guangdong University of Technology(广东工业大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 针对文本到图像生成模型对提示制定敏感的问题,提出PRISM框架,通过基于图像的自我奖励机制,利用结构化视觉诊断和多任务监督微调等方法,提高图像质量和语义对齐,并提供可解释反馈。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24215 2026-07-28 cs.CV 新提交 79%

TreeAdapter: Hierarchical Taxonomy-Guided Adapter Composition for Fine-Grained Species Image Generation

TreeAdapter:用于细粒度物种图像生成的分层分类法引导适配器组合

Yuze Sun, Zhongjie Duan, Yingda Chen

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 针对通用文本到图像模型在生成稀有生物物种图像时性能下降的问题,提出TreeAdapter框架,利用分层分类数据,通过在分类树节点附加轻量级适配器及两阶段训练范式,实现准确的细粒度图像生成,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23271 2026-07-28 cs.CV cs.AI 新提交 70%

What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features

CLIP 所知道但无法表达的:从冻结的中间特征中恢复否定信息

Chen-Yi Lu, Yueh-Shao Chen, Somali Chaterji

机构 * Purdue University(普渡大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 对比视觉语言模型如CLIP对否定不敏感,研究发现是表征坍缩所致。提出轻量级事后校正系统PeakPatch,在不改变预训练权重下恢复否定信号,通过特定网络提取信号、预测偏差向量等,经实验验证其有效性及泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24729 2026-07-28 cs.CV 新提交 57%

MicroZoom: Structure-Preserving Detail Synthesis at Extreme Scale

MicroZoom:极端尺度下的结构保留细节合成

Huy Huynh, Jingwei Ma, Brian Curless, Ira Kemelmacher-Shlizerman, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 MicroZoom旨在解决微观尺度下基于参考的极端尺度超分辨率问题,通过两阶段级联设计,第一阶段恢复全局图案连贯性,第二阶段细化局部纹理细节,辅以分割掩码指导合成,实现了全局连贯、基于物质的千兆像素图像合成。

Comments Project page: https://microzoom-sr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22994 2026-07-28 cs.CV cs.LG 新提交 57%

Breaking the Synthetic-Real Domain Shortcut for Training-Free Generative Replay-based Class Incremental Learning

打破合成-真实域捷径用于无训练生成重放的类增量学习

Tao Zhang, Qixuan Fan, Yiyuan Liang, Yanjie Wang, Song Yan, Tian Tian, Jiahuan Zhou, Luxin Yan, Sheng Zhong, Xu Zou

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究类增量学习中合成旧数据与真实新数据混合导致性能下降的问题,提出DREAM模型,利用无训练生成器合成旧数据,通过子空间校正、正交投影及真实锚定原型正则化消除域捷径并加强语义对齐,取得最优性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2607.23920 2026-07-28 cs.CV 新提交 57%

What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape

我能编辑什么?开放式策略发现与情感可编辑性景观

Qing Li, Zeyu Dong, Yin Cui, Chuan Yan, Xiaojiang Peng

机构 * School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院) School of Innovation Design, Shenzhen Technology University(深圳技术大学创新设计学院) Stanford University(斯坦福大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究情感图像编辑,EmoScope多智能体框架将任务转变为‘能编辑什么’,先发现可编辑空间,再平衡内容与情感,通过情感条件作用的可供性推理选择策略,在大规模评估中受青睐,还指出相关指标盲点及优势变化情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22864 2026-07-28 cs.CV cs.AI 新提交 57%

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

空间智商:通过分层能力测试解构空间智能

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

机构 * NVIDIA Research(英伟达研究院) Yale University(耶鲁大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24538 2026-07-28 cs.RO 新提交 50%

NEO: NeRF It Once, Edit It Many Times for Continuous Object Manipulation

NEO:一次性NeRF,多次编辑以进行连续物体操纵

Mikołaj Zieliński, David Hall, Dominik Belter, Peyman Moghadam

机构 * Institute of Robotics and Machine Intelligence, Poznan University of Technology(波兹南理工大学机器人与机器智能研究所) CSIRO Robotics, CSIRO(联邦科学与工业研究组织机器人部)

专题命中 图像编辑 :inpainting(abstract)

AI总结 本文提出NEO框架,用于机器人操纵的语言引导NeRF编辑。结合神经场重采样与多视图修复实现物体移除,利用知识蒸馏进行NeRF权重编辑,还创建了评估基准NEO-Dataset。该方法在场景编辑任务中表现出色,优于现有基线。

Comments Accepted to IEEE ROBOTICS AND AUTOMATION LETTERS (RA-L) JULY, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 109 篇

2607.22963 2026-07-28 eess.IV cs.CV 新提交 89%

PriSAR: 3D Geometric-Prior-Guided Diffusion for Parameter-Controlled SAR Image Generation

PriSAR:用于参数控制SAR图像生成的3D几何先验引导扩散

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 研究SAR图像在稀疏观测角度下的可控生成问题,提出用3D模型导出的几何先验引导扩散模型的方法,即GeoDiff-SAR,经实验在飞机和车辆数据集上取得较好结果,证明该轻量级3D几何先验可改善视点一致性,用作生成指导。

Comments 17 pages,15 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15357 2026-07-28 cs.CV cs.LG 版本更新 89%

MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation

MaskAttn-SDXL:可控区域级文本到图像生成

Yu Chang, Jiahao Chen, Anzhe Cheng, Paul Bogdan

机构 * University of Southern California(南加州大学) University of Toronto(多伦多大学)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MaskAttn-SDXL模块,通过在softmax前注入token条件空间门控,解决扩散模型在多物体生成中的全局协调和可靠性问题,无需改变SDXL流程。

Comments Published in the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

Journal ref Proceedings of the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23488 2026-07-28 cs.LG cs.CV 新提交 85%

Learning Sampling Parameters for Diffusion Models

学习扩散模型的采样参数

Arisrei Lim, Yossi Gandelsman

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究针对扩散模型推理时采样参数固定的问题,提出LeSAMP框架,将参数选择转化为强化学习问题,通过人类偏好模型和VLM评判优化,实验表明该方法相比基线有更高胜率,为改进扩散模型输出提供补充途径。

Comments Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24249 2026-07-28 cs.CV cs.RO 新提交 83%

SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation

SILICA:将扩散先验用于联合玻璃分割和深度估计

Tarun R, Anuj Verma, Laksh Nanwani, Sourav Garg, K. Madhava Krishna

机构 * Robotics Research Center (RRC), IIIT Hyderabad(海得拉巴国际信息技术研究所机器人研究中心)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究透明表面深度估计难题,提出SILICA统一管道,利用文本到图像扩散模型先验联合预测玻璃分割和深度,无需真实世界玻璃深度注释,经实验验证其在不同环境中零样本转移性能出色,优于现有模型。

Comments IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23937 2026-07-28 cs.CV 新提交 83%

Manifold-Constrained Noise Optimization for Diverse Diffusion Sampling

用于多样化扩散采样的流形约束噪声优化

Qitan Shi, Cheng Jin, Ziyuan Liu, Yuantao Gu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究如何在推理时优化初始噪声以恢复几步蒸馏扩散模型的提示多样性。提出MoNO方法,在低维噪声流形上进行流形约束噪声优化,能大步长更新且无需辅助目标,实验表明该方法可保持图像质量并提升提示多样性。

Comments 19 pages, 14 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24110 2026-07-28 cs.CV cs.LG physics.optics 新提交 83%

BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion

超越融合:用于无校准红外超分辨率和红外-可见光融合的自对齐潜在扩散

Minchong Chen, Xiaoyun Yuan, Minyu Cao, Jianing Zhang, Jun Zhang, Shuyang Liu, Xiaokang Yang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对移动红外-可见光成像中跨传感器未对准问题,提出超越融合框架,通过引入跨模态自对齐模块及未对准增强模块,实现无校准条件下的红外超分辨率和红外-可见光融合,经实验验证了其有效性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17572 2026-07-28 cs.LG cs.CV cs.SY eess.SY 版本更新 83%

JAGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models

AGG:用于扩散模型高效GRPO训练的雅可比聚合组梯度

Ruiyi Ding, Jie Li, He Kang, Ziyan Liu, Chengru Song, Yuan cheng

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究GRPO扩展到扩散模型的计算瓶颈问题,提出JAGG方法,通过特定插值和聚合梯度,减少反向传播次数,实验表明该方法能在质量损失小的情况下显著加速T2I训练中的DiT RL训练。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23811 2026-07-28 cs.SD cs.CL 新提交 82%

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

基于解耦时间深度扩散变换器的内存高效音频合成

Dongseong Hwang, Prasanth Yadla, Kaan Elgin, Shifas Padinjaru Veettil, Sivanand Achanta, Dipjyoti Paul, Ramya Rasipuram, Tyler Johnson, Emad Soroush, Chung-Cheng Chiu, Zhifeng Chen

机构 * Apple(苹果公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出基于解耦时间深度扩散变换器的内存高效音频合成架构,通过特定设计将语义音频令牌转换为RVQ表示,用单个深度解码器和因果滑动窗口注意力降低内存复杂度,在AMX上实现高效合成,提升音频质量。

Comments 11 pages, ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07008 2026-07-28 cs.LG 版本更新 82%

Exact Evaluation of the Accuracy of Diffusion Models for Inverse Problems with Gaussian Data Distributions

高斯数据分布反问题扩散模型精度的精确评估

Emile Pierret, Bruno Galerne

机构 * Université d’Orléans, Université de Tours, CNRS, IDP, UMR 7013(奥尔良大学、图尔大学、国家科学研究中心、IDP、UMR 7013) Institut universitaire de France (IUF)(法国国家科学院(IUF))

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 研究高斯数据分布反问题中扩散模型精度,通过刻画迭代高斯过程及计算瓦瑟斯坦距离分析差异,比较两种算法,引入更精确的条件高斯扩散模型新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24665 2026-07-28 cs.CV cs.GR cs.LG 新提交 81%

MMOE: Modernizing Diffusion Transformers with Efficient Expert Design

MMOE:通过高效专家设计使扩散变压器现代化

Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong Li

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 研究AIGC基础模型中扩散变压器未平衡质量与成本问题,提出MMOE对其现代化改造,将多种专家设计应用于AIGC生成,实验表明MMOE能达更好质量成本平衡,使AIGC基础模型可循大语言模型平衡扩展路径。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12940 2026-07-28 cs.CV 版本更新 80%

Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

循环自回归扩散:全局记忆与局部注意力相结合

Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

机构 * Peking University(北京大学) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对超长视频生成中现有模型的不足,提出循环自回归扩散(RAD)框架,结合循环块与局部注意力,解决训练推理差距等问题,在相关数据集实验中展现出长视频生成的优越性。

Comments Published at ECCV 2026. Project page: https://yeyutaihan.github.io/recurrent-autoregressive-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24124 2026-07-28 cs.CV 新提交 79%

ViDS: Video Diffusion Shader using 3D Face Tracking

ViDS:使用3D面部跟踪的视频扩散着色器

Wenbo Ji, Davide Davoli, Zhe Chen, Liam Schoneveld, Matthias Nießner, Jiapeng Tang

机构 * Technical University of Munich(慕尼黑工业大学) Toyota Motor Europe NV/SA(丰田汽车欧洲股份公司) Woven by Toyota(丰田编织)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究利用3D面部跟踪实现肖像动画,先重建3DMM网格,再用驱动视频参数动画处理,借助视频扩散模型合成动画,引入自回归扩散采样过程,相比之前方法能更精细控制表情姿势,且保留身份外观,消融研究验证了有效性。

Comments 12 pages, 6 figures, and 8 tables. Project page: https://fusheng-ji.github.io/ViDS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23844 2026-07-28 cs.CV 新提交 79%

OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models

OmniCache:用于扩散模型的多维分层特征缓存

Zhaoyuan He, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对高分辨率图像和视频扩散模型推理成本高的问题,提出OmniCache框架,利用中间扩散特征冗余,通过多种缓存实现多维特征重用,减少推理延迟,在多模型上取得良好效果,且无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23680 2026-07-28 cs.CV 新提交 79%

Perturbation-Aware Diffusion-Guided Hybrid Segmentation for Robust and Annotation-Efficient Plant Stress Phenotyping

用于稳健且标注高效的植物胁迫表型分析的扰动感知扩散引导混合分割

Gurbhit Chaurakoti, Soumyashree Kar

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对农业图像语义分割实际部署问题,提出扩散引导混合分割框架,通过多种实验评估,结果显示最佳模型标注效率高,适应后模型可转移,表明合理配对主干和细化器并结合扰动感知再训练可提升分割效果和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22719 2026-07-28 cs.CV 新提交 79%

$γ$-Bridge: A Look-Parametric Diffusion Bridge

γ-桥:一种外观参数化扩散桥

Xuran Hu, Yujie Zhu, Tengxi Wang, Jilong Li, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Macquarie University(麦考瑞大学) Ningxia University(宁夏大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对乘法伽马噪声在相干成像中的问题,提出γ-桥这一外观参数化扩散桥,通过特定调度连接噪声观测与干净极限,结合均匀补丁外观估计器,能处理多传感器数据,实现零样本恢复且结果领先,还提供可物理解释的控制。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22696 2026-07-28 cs.CV cs.AI 新提交 79%

MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion

MegaSlide-DiT:用于高效视频扩散的以内存为中心的自适应和可变形局部注意力

Jiacheng Liu, Jason Liu

机构 * Trendinsight Lab / UC San Diego(趋势洞察实验室/加州大学圣地亚哥分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对高分辨率视频扩散模型内存消耗大问题,提出MegaSlide-DiT,通过让GPU不持有模型状态及用3D-DSA取代全局注意力,降低内存和计算复杂度,实现105B DiT在单H200 GPU上的适配,为大规模视频扩散模型全参数适配提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22544 2026-07-28 cs.AI cs.CV 新提交 79%

Concept-based Visual Counterfactual Explanations with Diffusion Models

基于扩散模型的基于概念的视觉反事实解释

Yassine Oueslati, Daniil Kirilenko, Martin Gjoreski, Marc Langheinrich

机构 * Università della Svizzera italiana(瑞士意大利语区大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究视觉反事实解释问题,提出C-VCE框架,通过概念瓶颈层将分类器融入生成模型,由概念引导反事实解释,在采样时可切换概念,添加正则化器和掩码控制编辑,在基准测试中表现良好,是实用工具且为模型理解和使用提供新思路。

Comments Accepted at the 4th World Conference on eXplainable Artificial Intelligence (XAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06173 2026-07-28 cs.CV 版本更新 79%

MobileWan: Closing the Quality Gap for Mobile Video Diffusion

MobileWan:弥合移动视频扩散的质量差距

Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibian

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究旨在弥合移动视频扩散质量差距,提出将5B参数视频扩散Transformer通过循环重公式化等方法高效部署在移动硬件上,经多种优化,成为首个可商用移动设备部署的该规模模型,取得新的端到端延迟和分数,建立移动视频生成新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21600 2026-07-28 cs.CV 79%

Locally Controlled Face Aging with Latent Diffusion Models

局部控制的面部老化与潜在扩散模型

Lais Isabelle Alves dos Santos, Julien Despois, Thibaut Chauffier, Sileye O. Ba, Giovanni Palma

机构 * L’Oréal AI Research(欧莱雅人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用潜在扩散模型实现局部控制的面部老化,通过细粒度控制提升生成结果的真实性和可控性。

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), 2025, pp. 6991-6999

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24507 2026-07-28 cs.LG cs.AI 新提交 78%

UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective

统一融合:在统一反向速率目标下将自回归语言模型适配到离散扩散

Xiaoyi Jiang, Jingyuan Li, Yixuan Jiang, Wei Liu, Yi Zhu, Zuoqiang Shi, Pipi Hu

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院) Wuhan University(武汉大学) MathonAI(未知(暂未找到合适中文翻译))

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究旨在将预训练的自回归语言模型适配到均匀噪声扩散。通过建立不同模型间联系并推导转换,提出UNIFUSION方法。经实验评估,该方法能改善生成困惑度与单字熵权衡,在相同规模模型中多项指标表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24306 2026-07-28 cs.CL 新提交 78%

Rethinking the Generation Order of Block Diffusion Language Models

重新思考块扩散语言模型的生成顺序

Kai Syun Hou, James Kwok

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究块扩散语言模型的采样,基于其更适合从左到右解码的特点,提出并行自回归解码方法PARD,该方法无需训练,能保留结构并允许并行令牌承诺,实验证明其在生成质量和速度上优于现有方法。

Comments 20 pages, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24296 2026-07-28 cs.RO 新提交 78%

PAC-DP: PAC-Bayesian Diffusion Policy Learning

PAC-DP:PAC贝叶斯扩散策略学习

Mohammad Hasan Yeganegi, Dian Yu, Andrea Del Prete, Majid Khadiv, Matteo Saveriano

机构 * University of Trento(特伦托大学) Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散策略在有限数据下泛化控制有限的问题,提出PAC-DP,将DP建模为贝叶斯神经网络并定义泛化界导出新训练目标。该方法理论上规范DP训练,实验显示在多基准测试中性能提升,尤其在低数据和复杂任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏