Diffusion Restore: Real-Time Markov Chain Monte Carlo Light Transport
Diffusion Restore: 实时马尔可夫链蒙特卡洛光运输
专题命中 扩散模型 :diffusion(title,title_cn)
AI总结 本文提出Diffusion Restore,一种基于扩散的实时MCMC光运输框架,通过改进局部探索能力,在保持非可逆性的同时提升对目标分布的探索效率,从而在不同场景中优于现有方法。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
Diffusion Restore: 实时马尔可夫链蒙特卡洛光运输
专题命中 扩散模型 :diffusion(title,title_cn)
AI总结 本文提出Diffusion Restore,一种基于扩散的实时MCMC光运输框架,通过改进局部探索能力,在保持非可逆性的同时提升对目标分布的探索效率,从而在不同场景中优于现有方法。
在流形假设下证明学习扩散模型:坍缩与细化
机构 * RIKEN AIP & The Institute of Statistical Mathematics(日本理化学研究所AIP及统计数学研究所) ; University of Sydney(悉尼大学) ; Agency for Science, Technology and Research & The Institute of Statistical Mathematics(科技研究局及统计数学研究所) ; The University of Tokyo(东京大学) ; Nanyang Technological University(南洋理工大学) ; The Institute of Statistical Mathematics(统计数学研究所)
专题命中 扩散模型 :diffusion(title,summary_cn)
AI总结 本文在流形假设下研究扩散模型的学习问题,提出了一种由得分函数几何特性驱动的坍缩与细化机制,并通过Score-induced Latent Diffusion模型验证了其理论预测,证明样本复杂性依赖于内在维度而非外在维度。
Comments 3 figures
Linear-DPO: 用于扩散和流匹配生成模型的线性直接偏好优化
机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; Alibaba Group(阿里巴巴集团)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出Linear-DPO,通过统一的反向时间SDE框架推导出涵盖扩散和流匹配的通用DPO目标,指出标准DPO目标在文本到图像生成中不最优,并通过定性定量实验验证了其在扩散模型和流匹配模型上的优越性。
Comments Code and models are available at: https://github.com/Whynot0101/Linear-DPO . Work done during an internship at Alibaba Group
FullFlow: 通过双向视觉-语言生成升级文本到图像流匹配模型
机构 * ETH Zurich(苏黎世联邦理工学院) ; Google(谷歌)
专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出FullFlow方法,通过仅训练LoRA适配器和轻量级文本头部,将预训练的rectified-flow文本到图像模型升级为双向视觉-语言生成器,从而在保持图像连续流的同时添加文本离散插入过程,提升文本到图像和图像到文本的生成质量。
Comments project page: https://ericbill21.github.io/fullflow/
Tiny-Engram: 生成视觉中的触发索引概念表
机构 * AutoArk-AI
专题命中 扩散模型 :generative vision(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出Tiny-Engram,一种紧凑的触发索引概念表,通过显式地为视觉记忆分配词汇地址和激活边界,实现对冻结图像和视频生成器中的概念的控制。该方法通过注册的n-gram匹配索引参数化每个概念,仅在匹配触发区域调节文本编码器的隐藏状态,从而在保持周围提示的组合控制的同时,将罕见触发短语绑定到目标身份。
Q-DiT4SR: 探索细节保留的扩散变换器量化以实现实景图像超分辨率
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huawei(华为)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出Q-DiT4SR,一种专门针对基于扩散变换器的实现实景图像超分辨率的后训练量化框架,通过引入层次化SVD和变异性感知时空混合精度方法,在保持细节的同时实现高效的模型压缩和加速。
Comments Accepted to ICML 2026. Our code and models will be available at https://github.com/xunzhang1128/Q-DiT4SR
伦勃朗的牛 - 分析文本到图像模型中艺术提示的解释
机构 * Department of Computer Science, Università degli Studi di Milano, Via Celoria, 18, 20133 Milan, Italy(米兰大学计算机科学系)
专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 本文研究了文本到图像扩散模型在生成艺术作品时如何解释内容和风格的概念,通过交叉注意力热图分析生成图像中像素与特定提示词的关联,揭示了不同艺术提示和风格下内容与风格分离的程度,为理解大规模生成模型内部如何表示复杂艺术概念提供了新见解。
Comments to be published in: Applications of AI in the Analysis of Cultural and Artistic Heritage, organized within the 35th IEEE International Workshop on Machine Learning for Signal Processing (MLSP) 2025
基于预训练域适应扩散模型生成异质性PET图像
机构 * Mallinckrodt Institute of Radiology, Washington University School of Medicine, St. Louis, USA(华盛顿大学医学院马林克罗德特放射医学研究所,圣路易斯,美国) ; Imaging Science Program, McKelvey School of Engineering, Washington University in St Louis, St. Louis, USA(华盛顿大学圣路易斯分校麦克雷高中工程学院成像科学计划,圣路易斯,美国) ; Department of Surgery, Washington University School of Medicine, St. Louis, USA(华盛顿大学医学院外科部,圣路易斯,美国) ; Department of Biomedical Engineering, Washington University in St Louis, St. Louis, USA(华盛顿大学圣路易斯分校生物医学工程部,圣路易斯,美国)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出了一种预训练域适应扩散模型,用于从均匀器官活动图生成临床相关的异质性PET图像,通过两阶段训练策略提高合成图像的定量精度和肿瘤分割性能。
Comments 18 pages, 7 figures
Mobile UMI: 用于移动操作的跨视角扩散策略与解耦动力学
机构 * Zhejiang University(浙江大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出了一种无需硬件的演示框架Mobile UMI,通过三个组件解决移动模仿学习中的两个瓶颈问题:运动污染的动作标签和推理导致的执行延迟。核心方法是通过双摄像头捕捉全局和局部上下文,结合空间锚点统一视觉-惯性框架,并利用异步递推地执行器进行在线状态匹配,从而实现解耦的动力学和基座轨迹。
一种用于南极 Landsat 7 ETM+ SLC-off 图像恢复的非参考扩散框架
机构 * College of Surveying and Geo-Informatics, Tongji University, Shanghai 200092, China(同济大学测绘与地理信息学院,上海200092,中国)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出 DiffGF 框架,通过非参考扩散方法恢复 Landsat 7 SLC-off 图像,无需外部参考数据,利用南极专用数据集 SLCANT 进行训练和评估,验证了其在恢复南极 SLC-off 图像方面的高保真度,并通过下游裂缝分割应用展示了其实际价值。
Comments Submitted to IEEE JSTARS
Q-ARVD: 对自回归视频扩散模型进行量化
机构 * National University of Singapore(新加坡国立大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文针对自回归视频扩散模型(ARVD)的量化问题,提出了一种新的框架Q-ARVD,解决了帧间量化敏感度不平衡和权重中异质性异常模式的问题,从而提高了模型效率。
Comments Code: https://github.com/tsa18/Q-ARVD
学习物理中的推理:通过表征对齐打破科学扩散中的捷径学习
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ; Shandong University(山东大学) ; LimX Dynamics Technology Co., Ltd.(LimX动态技术有限公司) ; Xidian University(西安电子科技大学) ; Peking University(北京大学) ; Institute of Deep Perception Technology, Jiangsu Industrial Technology Research Institute (JITRI)(感知技术研究院,江苏工业技术研究院(JITRI)) ; Griffith University(格里菲斯大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 该研究提出了一种无需教师的框架REPA-P,通过使用原理残差对中间特征与物理状态进行对齐,以解决物理信息扩散模型中中间表示在边界条件变化时容易产生捷径学习的问题,从而在四个PDE任务中提高了收敛速度、减少了物理残差并增强了分布外鲁棒性。
AttriStory: 基于扩散模型的视觉叙事中细粒度属性实现
机构 * Indian Institute of Science(印度科学研究院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出AttriStory基准,通过细粒度属性实现提升视觉叙事的质量,引入了在早期去噪步骤中操作的潜在优化模块,并通过AttriLoss目标增强属性-对象对的对齐度,从而实现更精确的属性定位。
Comments Accepted at CVPR AIStory Workshop, 2026
Diffuse to Detect: 基于伪标签扩散的双级样本再平衡点监督红外小目标检测
机构 * School of Software Technology, Dalian University of Technology, Dalian, China(大连理工大学软件学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种更适应且稳定的框架,通过利用热辐射模式与热扩散的内在一致性,提出了一种物理诱导的标注策略,扩展单点标签为可靠的伪掩码,并开发了双级双更新框架,联合优化检测器权重、样本权重和扩散参数,以提高监督效果并缓解样本不平衡问题。
RoPeSLR: 3D RoPE驱动的稀疏低秩注意力用于高效的扩散变换器
机构 * Peking University(北京大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本研究提出RoPeSLR,一种基于3D RoPE的稀疏低秩注意力框架,旨在解决扩散变换器中长序列生成的高复杂度问题,通过结合高频率语义尖峰集和极低秩背景连续体,实现子二次稀疏性和子线性秩增长,从而在超长视频推理中表现出色。
用自回归扩散模型加速视频逆问题求解器
机构 * KAIST(韩国科学技术院) ; EverEx
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出自回归视频逆问题求解器(AVIS),通过自回归扩散模型实现流式视频恢复,显著降低初始延迟并提高吞吐量,同时保持高质量的恢复效果,并进一步提出加速变体AVIS Flash,实现更高的吞吐量和更优的效率-性能权衡,为实时部署铺平道路。
Comments Project page is available here: https://avis-project.github.io/
注意生成细节:面向视频扩散模型的直接局部化细节偏好优化
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Alibaba Group - Taobao & Tmall Group(阿里巴巴集团-淘宝 & 天猫集团)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出LocalDPO,一种新的后训练框架,通过从真实视频中构建局部偏好对,并在时空区域层面优化对齐,以提高视频生成的质量和人类偏好评分。
Comments Accepted by CVPR 2026
基于表示空间扩散模型的Tippett最小融合多编码器异常检测
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种多编码器融合的表示空间扩散模型,通过统计分析每个编码器对特定分布偏移类型的敏感性,引入EncMin2L门控机制,无需使用OOD标签即可在较低参数成本下提升异常检测性能,同时在四种分布偏移类型上均达到0.94以上的AUROC。
Comments 14 pages
EPC-3D-Diff: 基于CBCT到CT合成的等价物理一致条件3D潜在扩散模型
机构 * School of Science and Engineering, University of Dundee UK(邓迪大学科学与工程学院) ; Faculty of Applied Sciences, Jordan University of Science and Technology(约旦科学技术大学应用科学学院) ; Experia Healthcare, Jordan(约旦Experia医疗) ; School of Cardiovascular and Metabolic Health, University of Glasgow UK(格拉斯哥大学心血管与代谢健康学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出EPC-3D-Diff,一种新的条件3D潜在扩散框架,用于体积CBCT到CT合成,通过引入从成像物理导出的投影域等价损失,提高了物理一致性。该方法在训练过程中通过正向投影旋转合成的CT体积,并将其与相应角度偏移的投影进行匹配,从而在扩散目标中集成物理一致的等价约束。
Comments 10 pages, 4 figures
PolycubeNet: 一种基于多立方体的双潜在扩散模型用于六面体网格生成
机构 * Dalian University of Technology(大连理工大学) ; Jiangxi University of Science and Technology(江西理工大学) ; School of Mathematical Sciences, Guangxi Minzu University(广西民族大学数学与计算机科学学院) ; Caohejing Hi-Tech Park Development Co., Ltd.(曹家京高科技园发展有限公司) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR
AI总结 本文提出了一种基于条件扩散模型的端到端框架,用于生成基于多立方体的六面体网格,通过双潜在条件扩散架构有效解耦了计算复杂度与输入输出分辨率,提高了生成效率和鲁棒性。
HITL-D: 有人参与的扩散辅助共享控制
机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出HITL-D框架,通过结合扩散策略和人类控制,提升多步骤、插入和精细操作任务的用户表现,减少 joystick 控制轴数量,降低认知负荷,并在多任务用户研究中显著提高任务完成速度和用户满意度。
Comments Accepted for presentation at ICRA 2026
扩散模型中的临界减慢现象
机构 * Laboratoire de Physique Statistique, École normale supérieure, PSL Research University(统计物理实验室,巴黎高等师范大学,PSL研究大学) ; Department of Physics, Duke University(杜克大学物理系) ; Department of Chemistry, Duke University(杜克大学化学系)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文研究了扩散模型在统计场理论O(n)模型中的应用,揭示了训练过程中参数学习的临界减慢现象,并通过引入局部得分近似方法,展示了通过适当架构设计可以克服这一现象,为统计物理中的采样方法提供了可控的改进框架。
Comments 17 pages, 8 figures
用于脑组织微尺度外周血清素动力学的隔室-反应扩散框架
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出了一种数学框架,用于研究脑组织中外周血清素的微尺度动力学,通过建立二维隔室-反应扩散系统,利用强局部扰动理论推导出非线性积分微分方程,以分析血清素的稳态和动力学特性,揭示了血清素释放、囊泡几何和摄取动力学对细胞外血清素的影响。
关于具有非局部扩散的动能 $p$-拉普拉斯方程
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文研究了动能 $p$-拉普拉斯方程的两种非局部版本:一种通过差分定义的加利多型模型,另一种通过傅里叶乘法定义的贝塞尔型模型。利用临界动能轨迹,推导出适应于动能输运-扩散几何的表示公式,并建立非局部扩散的齐次和标度不变的动能加利多-尼伦伯格不等式,从而为非局部扩散的动能 $p$-拉普拉斯方程的弱解获得积分性提升估计。
高效且简单的四阶紧致有限差分方法用于任意曲域上的对流-扩散-反应方程
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出了一种高效的四阶紧致有限差分方法,用于求解具有变量光滑系数的二维对流-扩散-反应方程及其在复杂、细长和曲域上的Dirichlet边界条件,该方法在任意不规则 stencil 中保持了简单且高阶的精度。
Comments 26 pages, 19 figures, and 7 tables
PulseCol: 周期性刷新的列稀疏注意力用于加速扩散语言模型
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出PulseCol,一种周期性刷新的列稀疏注意力方法,通过更细粒度的稀疏化策略提升扩散语言模型的计算效率和加速性能,同时保持模型质量。
关于对流-扩散方程的下界:与AI生成证明的探索
机构 * University of California, San Diego, La Jolla, United States(加州大学圣迭戈分校) ; Duke Kunshan University, Zu Chongzhi Center, No. 8 Duke Avenue, Kunshan, Jiangsu Province, 215316, P.R. China(杜克昆山大学,祖冲之中心)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文通过AI生成的证明方法,建立了对流-扩散方程在三种不同情形下的显式下界,包括无粘性剪切的多项式$\dot H^{-1}$界、扩散剪切的混合尺度正下界以及快速振荡时间周期性流动的指数$L^2$界。
Comments 63 pages
隐式流形上的扩散过程
机构 * Signal Processing Laboratory 2(信号处理实验室2) ; Institute of Artificial Intelligence(人工智能研究所) ; EPFL(瑞士联邦理工学院) ; Medical University of Vienna(维也纳医学大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文研究如何仅使用点云样本在数据流形上构建扩散过程,提出隐式流形估值扩散(IMDs)方法,通过近似扩散过程的无穷小生成元和carré-du-champ来定义高维空间中的随机微分方程,实现流形内在过程的外推,并通过实验验证其在数据流形上的约束性和探索性。
Comments Comments are more than welcome!
扩散模型在训练中记忆,而在推理中泛化
机构 * Heinrich-Heine-University Düsseldorf(杜伊斯堡-埃森大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文研究了扩散模型在训练中过度拟合去噪目标,导致训练样本与验证样本性能差距,但通过模型误差使采样轨迹远离训练样本分布,从而在推理中实现泛化。
Comments 31 pages and 29 figures
利用当前和未来实验解析遥远脉冲星晕的扩散特征
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文通过模拟两种先进伽马射线实验(LHAASO-KM2A和切伦科夫望远镜阵列CTA)的观测数据,研究了通过形态学判别识别脉冲星晕候选体的前景,发现增加光子统计和改进角分辨率能显著提升形态学判别能力,表明未来伽马射线观测有望扩展脉冲星晕样本并深入理解脉冲星周围宇宙射线传输。