arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2193 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2193 篇

2607.19459 2026-07-23 astro-ph.IM astro-ph.CO cs.CV stat.ML 新提交 79%

Strong Gravitational Lensing Posterior Sampling in Pixel-Space Using Diffusion Models and Recurrent Inference Machines

使用扩散模型和循环推理机在像素空间中进行强引力透镜后验采样

Guillaume Payeur, Laurence Perreault-Levasseur, Gabriel Missael Barco, Yashar Hezaveh

机构 * Department of Physics, Universit\'e de Montr\'eal, Montreal QC, Canada Mila - Quebec AI Institute, Montreal QC, Canada Ciela Institute, Institute for Astrophysics Trottier Space Institute, McGill University, Montreal QC, Canada Center for Computational Astrophysics, Flatiron Institute, New York, USA Perimeter Institute for Theoretical Physics, Waterloo ON, Canada

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究星系-星系强引力透镜问题,提出结合扩散生成建模与循环推理机的方法,能生成源星系和前景质量分布的联合后验样本作为像素化图像,可对含背景和前景星系的真实引力透镜模拟建模至噪声水平。

Comments 31 pages, 34 figures, Extension of an article accepted at the ICML 2026 Workshop on AI for Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18539 2026-07-22 cs.CV 新提交 79%

AniGS: Bridging Rendering and Diffusion Prior for 3D Scene Animation

AniGS:弥合3D场景动画的渲染与扩散先验

Yen-Chi Cheng, Chen Gao, Chuhan Chen, Tuotuo Li, Rajvi Shah, Ayush Saraf, Changil Kim, Liangyan Gui, Alexander Schwing, Johannes Kopf, Hung-Yu Tseng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Waymo(Waymo公司) Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 AniGS旨在为3DGS重建的大型场景添加动画,用规范3DGS表示场景,借时间条件变形场建模运动,利用预训练视频扩散模型及迭代更新策略,防止静态区域运动伪影,实验证明该方法能产生自然动态和高质量新视图视频。

Comments Preprint. Project page: https://yccyenchicheng.github.io/AniGS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17411 2026-07-21 cs.GR cs.LG 新提交 79%

Feature-Guided Diffusion for Non-Differentiable Inverse Rendering

用于不可微逆渲染的特征引导扩散

Andrei-Timotei Ardelean, Michael Fischer, Tim Weyrich, Tomáš Iser

机构 * Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 研究逆渲染问题,提出完全黑箱框架FIDE,通过特征引导,利用视觉Transformer提取特征训练扩散模型,结合CMA进化策略优化,在多种逆问题上验证,显著提升收敛速度并逃离局部最小值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16656 2026-07-21 cs.CV 新提交 79%

DORS: Dynamic Attention Routing for Diffusion-based Object Removal in Dense Scenes

DORS:用于密集场景中基于扩散的目标移除的动态注意力路由

Haitong Tang, Haipeng Liu, Yang Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对密集场景目标移除中因语义干扰致移除不完整的问题,提出基于动态注意力路由机制的DORS框架,含实例过滤注意力和上下文引导路由组件,经实验验证其性能优于现有方法。

Comments 16 pages, 10 figures, to appear in ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16300 2026-07-21 cs.CV 新提交 79%

FedDP-PALD: A Privacy-Preserving Federated Latent Diffusion Framework with Prototype Aggregation for Medical Data Synthesis

FedDP-PALD:一种用于医学数据合成的具有原型聚合的隐私保护联邦潜在扩散框架

Md. Sajeebul Islam Sk., Khan Enaet Hossain, Md. Mehedi Hasan Shawon

机构 * BRAC University(BRAC大学) York University(约克大学) University of Maryland(马里兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对医学数据合成中隐私保护及合成数据预测结构问题,提出FedDP-PALD框架,通过带掩码的门控多头注意力联合处理多模态数据,引入DP-PMA维持差分隐私,实验表明该框架能生成隐私合成表示,保持决策性能并抵抗成员推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15650 2026-07-20 cs.CV 新提交 79%

DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

DiTango:基于选择性注意力状态重用的经济高效并行扩散生成

Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) University of Science and Technology Beijing(北京科技大学) PJlab(PJ实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散变换器并行化技术在多节点环境下通信开销大的问题,提出DiTango框架,通过选择性注意力状态机制及锚点引导的状态选择规划器等,在多节点设置中实现加速并保持生成质量。

Journal ref The 35th International Symposium on High-Performance Parallel and Distributed Computing (HPDC'26), July 13--16, 2026, Cleveland, OH, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15585 2026-07-20 cs.MM 新提交 79%

SPEED: One-Step Pixel Diffusion for High-quality Video Frame Interpolation

SPEED:用于高质量视频帧插值的单步像素扩散

Zihao Zhang, Haoyu Zhao, Siqian Yang, Yidi Wu, Yudong Jiang, Zuxuan Wu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 研究针对视频帧插值中现有扩散模型的问题,提出SPEED单步像素扩散框架。采用渐进多阶段架构、仅噪声更新注意力机制和漂移感知时间步采样策略,实现高质量单步推理,在多个基准测试中性能超越现有方法。

Comments ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15527 2026-07-20 cs.CV 新提交 79%

Physics-aware Masked Diffusion-based Flood Simulation for Urban Fisheye Disaster Detection

基于物理感知的掩码扩散的洪水模拟用于城市鱼眼灾害检测

Sodtavilan Odonchimed, Tsogt Enkhbayar, Oyunzul Munkhtamga, Munkhjargal Gochoo

机构 * The University of Tokyo(东京大学) Mongolian University of Science and Technology(蒙古科技大学) United Arab Emirates University(阿联酋大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现实中洪水数据短缺及鱼眼图像失真致高精度洪水模拟难的问题,提出PhysFlood系统,利用扩散模型从单张鱼眼图像合成逼真洪水,可自由控制生成多样场景,实验证明其模拟图像有逼真度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15128 2026-07-17 cs.CV 新提交 79%

DAPGNet: Dynamic Adaptive Physics-Guided Graph Diffusion Network for Hyperspectral Image Classification

DAPGNet:用于高光谱图像分类的动态自适应物理引导图扩散网络

Pengkun Wang, Weijia Cao, Ning Wang, Xiaofei Yang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) Guangzhou University(广州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对高光谱图像分类中像素关系建模问题,提出DAPGNet。该网络将物理先验融入图学习,经多步骤构建拓扑、进行图扩散等操作,通过跨尺度融合优化。实验表明其在多个数据集上性能最优,提升了分类准确率,验证了各模块的互补作用。

Comments 9 figures and 9 tables. Pengkun Wang and Weijia Cao contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15041 2026-07-17 cs.CV 新提交 79%

Weakly-Supervised RGB-D Salient Object Detection via SAM-driven Pseudo Annotation and State Space Interaction-based Diffusion

通过基于 SAM 的伪标注和基于状态空间交互的扩散进行弱监督 RGB-D 显著目标检测

Wenqi Si, Gongyang Li, Shixiang Shi, Weisi Lin

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究弱监督 RGB-D 显著目标检测,提出由 SAM-PAG 和 $S^2$Diff 组成的方法,前者扩展稀疏涂鸦为伪标注,后者在条件信息引导下细化显著图,二者合作使方法性能优异。

Comments 13 pages, 9 figures, accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14836 2026-07-17 cs.CV 新提交 79%

Physics-Informed Diffusion for Biomechanically Plausible 3D Sign Language Generation

用于生物力学合理的3D手语生成的物理信息扩散

Emanuele Colonna, Moises Diaz, Gennaro Vessio, Miguel Angel Ferrer, Giovanna Castellano

机构 * Department of Computer Science, University of Bari Aldo Moro(巴里阿尔多·莫罗大学计算机科学系) Institute for Technological Development and Innovation in Communications, University of Las Palmas de Gran Canaria(拉斯帕尔马斯大加那利大学通信技术发展与创新研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究手语生成问题,提出物理信息扩散模型PIDiffSign,将解剖学约束融入架构与训练目标,用Transformer编码器 - 解码器及可微几何模块训练,实验证明该模型能提升手语生成的运动真实感和语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13927 2026-07-16 cs.CV 新提交 79%

Cyclone: Diffusion Model for Cycle-Consistent Weather Editing from Unpaired Driving Data

Cyclone:基于未配对驱动数据的循环一致天气编辑扩散模型

Thang-Anh-Quan Nguyen, Moussab Bennehar, Luis Guillermo Roldao Jimenez, Nathan Piasco, Dzmitry Tsishkou, Laurent Caraffa, Jean-Philippe Tarel, Roland Brémond

机构 * Huawei Paris Research Center(华为巴黎研究中心) Gustave Eiffel University(古斯塔夫·埃菲尔大学) IGN-ENSG(法国国家地理信息与森林和环境信息研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对自动驾驶系统在不同天气条件下可靠感知的挑战,提出Cyclone框架,基于潜在扩散,利用循环一致约束和图像-文本模型知识,无需配对数据生成多种天气条件,实验表明其输出更优,还可提炼为视频扩散模型。

Comments Project page: https://ntaquan0125.github.io/weather-cyclone/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13563 2026-07-16 cs.CV 新提交 79%

Nexus: Native Mesh Generation with Diffusion

Nexus:基于扩散的原生网格生成

Hanxiao Wang, Ying-Tian Liu, Yuan-Chen Guo, Qi-Yuan Feng, Zi-Xin Zou, Ding Liang, Biao Zhang, Yan-Pei Cao

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VAST(无(暂未找到合适中文名,VAST可音译为“瓦斯特”,但这并非一个正式的中文机构名,所以保留英文)) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对高质量三角形网格生成问题,提出Nexus扩散方法,通过解耦顶点与拓扑生成实现整体网格生成,经实验验证其性能优于现有基线,有效克服顺序网格建模局限且获从业者青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13371 2026-07-16 cs.CV 新提交 79%

RoughNet: Mapping Arctic Sea Ice Roughness Using Diffusion-Based Super-Resolution of Satellite Imagery

RoughNet:利用基于扩散的卫星图像超分辨率绘制北极海冰粗糙度

Tessa Cannon, Michel Tsamados, Petru Manescu, Thomas Newman, Christian Haas, Veit Helm, Weibin Chen, Randall Scharien

机构 * University College London(伦敦大学学院) Alfred Wegener Institute Helmholtz Centre for Polar and Marine Research(阿尔弗雷德·韦格纳极地与海洋研究所亥姆霍兹中心) University of Victoria(维多利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究旨在准确估计北极海冰粗糙度,采用RoughNet方法,通过条件扩散框架从光学卫星图像重建海冰地形,经训练和评估,能在不同冰况下泛化,为高分辨率海冰测绘和粗糙度估计提供可扩展途径。

Comments Code available at https://github.com/tessacannon48/RoughNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13164 2026-07-16 cs.CL cs.CV cs.LG 新提交 79%

Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation

文本到手语:用于文本到手语视频生成的单 GPU 扩散基线

Ruize Xia

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究文本到手语视频生成,提出Text2Sign模型,结合冻结视觉语言文本编码器等技术,降低全视频注意力成本。在特定分割上有一定验证损失等结果,虽提示敏感性弱,但为单GPU研究提供了基线。

Journal ref IEEE Access, vol. 14, pp. 64003-64017, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12937 2026-07-15 eess.IV cs.CV 新提交 79%

Exact and Calibrated Diffusion Reconstruction for Digital Breast Tomosynthesis

数字乳腺断层合成的精确校准扩散重建

Imade Bouftini

机构 * Imade Bouftini

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对有限角度数字乳腺断层合成,提出用精确欧几里得投影替换近端更新来确保数据一致性,通过等渗重新校准解决不确定性问题,修复投影仪伴随不匹配,实现首个数据一致、不确定性校准的学习重建,提高了重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13031 2026-07-15 cs.LG cs.CV 新提交 79%

The Seriality Gap in Video Diffusion Models

视频扩散模型中的序列性差距

Jorge Diaz Chao, Konpat Preechakul, Yuxi Liu, Yutong Bai

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究视频扩散模型在多球动力学实验中的表现,发现其存在序列性差距,即任务所需串行计算与模型去噪循环不匹配,增加有效串行计算的方法可提升性能,还证明去噪步骤在串行推理和模拟任务上有结构障碍。

Comments Jorge Diaz Chao and Konpat Preechakul contributed equally. 24 pages, 12 figures, and 5 tables. Project page: https://seriality-gap.jdiazchao.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12464 2026-07-15 cs.CV cs.LG 新提交 79%

Steering Diffusion Models via Class-Contrastive Influence for Few-Shot Medical Classification

通过类对比影响引导扩散模型进行少样本医学分类

Jeeyung Kim, Erfan Esmaeili, Qiang Qiu

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对少样本医学分类中标记数据稀缺,现有方法忽视样本对分类有用性衡量与优化的问题,提出类对比影响(C2I)准则,通过强化学习用C2I奖励微调扩散模型,引导生成类信息丰富样本,提高了下游准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11941 2026-07-15 cs.CV cs.LG 新提交 79%

GenDiff: A Dose and Anatomy Aware Diffusion Model with Structural Prior Refinement for Low-Dose CT Reconstruction and Generalization

GenDiff:一种具有结构先验细化的剂量和解剖感知扩散模型,用于低剂量CT重建和泛化

Md Imam Ahasan, Guangchao Yang, A F M Abdun Noor, Kah Ong Michael Goh, S. M. Hasan Mahmud, Md Mahfuzur Rahman

机构 * Faculty of Information Science & Technology, Multimedia University, Malaysia(马来西亚多媒体大学信息科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对低剂量CT重建中现有方法局限性,提出GenDiff框架,联合建模剂量与解剖信息,集成多种模块,经多数据集实验验证,该方法在不同条件下鲁棒性强且重建质量优,是低剂量CT成像的有前途方案。

Comments 20 pages, 8 figures, 4 tables. Under review at PeerJ Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11578 2026-07-14 cs.LG cs.AI cs.CV eess.SP 新提交 79%

DiffEEG: A Self-Supervised Denoising Diffusion Model for Learning EEG Generic Representations

DiffEEG:用于学习脑电通用表示的自监督去噪扩散模型

Abdulkader Helwan, Lina Abou-Abbas, Hussein El Amouri, Belkacem Chikhaoui, Khadidja Henni

机构 * Lebanese American University(黎巴嫩美国大学) Institute of Applied Artificial Intelligence, TÉLUQ University(应用人工智能研究所,泰鲁克大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对基于脑电的癫痫检测面临的注释稀缺和类别不平衡问题,提出DiffEEG自监督基础模型,通过去噪扩散预训练和强化学习微调学习通用神经表示,在癫痫检测中取得较好效果,证明该方法能以最少标记数据实现临床可部署监测。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11533 2026-07-14 cs.CV cs.LG 新提交 79%

Adaptive Routing for Efficient Diffusion Transformer-Based PNI Prediction

基于高效扩散变压器的PNI预测的自适应路由

Youngung Han, Dohyun Kweon, Kyeonghun Kim, Hyunsu Go, Jina Jeong, Suah Park, Induk Um, Junga Kim, Anna Jung, Yului Jeong, Sungha Park, Jinyong Jun, Pa Hong, Woo Kyoung Jeong, Won Jae Lee, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) Kyung Hee University(庆熙大学) OUTTA Chung-Ang University(Chung-Ang 大学) Seoul National University School of Medicine(首尔国立大学医学院) Samsung Changwon Hospital(三星昌原医院) Samsung Medical Center(三星医疗中心) NVIDIA AI Technology Center(NVIDIA AI 技术中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对胆管癌PNI术前MRI预测难题,传统方法有局限。本文将PNI预测设为扩散分类问题,用基于Transformer的表示实现去噪网络,并引入自适应路由提高效率,实验取得了0.731的AUC及257.57 GFLOPs的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11081 2026-07-14 cs.CV cs.AI 新提交 79%

Controlling Motion Transfer in Diffusion Transformers via Attention Heads

通过注意力头控制扩散变换器中的运动传递

Sunyoung Jung, Jiwoo Park, Yoonseok Choi, Kyobin Choo, Ming-Hsuan Yang, Seong Jae Hwang

机构 * Yonsei University(延世大学) LG Electronics(LG电子) University of California, Merced(加州大学默塞德分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究如何控制扩散变换器中的运动传递,通过在注意力头层面分析,提出无需参数更新的头感知可控运动传递框架,利用语义对应引导和选择性特征注入,实现精确运动传递并为可控视频生成提供可解释基础。

Comments Accepted to ECCV 2026, Project page: https://sunyj-hxppy.github.io/halo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10984 2026-07-14 cs.CV cs.AI cs.HC cs.LG 新提交 79%

EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion

EquiFusion:通过等变潜扩散实现与运动学无关的人体运动预测

Cecilia Curreli, Florian Hofherr, Dominik Muhle, Abhishek Saroha, Riccardo Marin, Daniel Cremers

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对现有3D人体运动预测模型受骨骼运动学硬编码限制的问题,提出EquiFusion模型,通过排列等变架构实现潜扩散,对未见运动学有跨数据集泛化能力,在基准测试中成果领先,建立了新的人体运动预测标准。

Comments Accepted to ECCV 2026. Visit our webpage at https://ceveloper.github.io/publications/equifusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10580 2026-07-14 cs.CV cs.AI 新提交 79%

DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders

DiffUE:通过扩散自动编码器增强不可学习示例的效用-不可学习性权衡

Syed Irfan Ali Meerza, Oktay Ozturk, Amir Sadovnik, Jian Liu

机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校) Oak Ridge National University, Knoxville(橡树岭国家实验室诺克斯维尔分部) University of Georgia, Athens(佐治亚大学雅典分校) Virginia Commonwealth University, Richmond(弗吉尼亚联邦大学里士满分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对AI模型利用个人图像致隐私侵犯问题,DiffUE通过在图像语义空间注入噪声,利用扩散自动编码器框架操纵语义特征,增强图像不可学习性,显著提升了图像质量和不可学习性之间的权衡,保障个人数据安全。

Comments To appear at the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09753 2026-07-14 cs.CV cs.AI cs.LG 新提交 79%

Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis

通过内部潜变量分析对扩散模型进行统一骨干细化

Haksoo Lim, Myeongjin Lee, Wonjoon Chang, Jaesik Choi

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) INEEJI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型骨干细化问题,提出DUNE框架,通过分析内部潜变量检测突变偏差,对选定条目进行骨干特定抑制,可自然扩展到基于Transformer的模型,经实验验证该方法能提高保真度并减少幻觉。

Comments 45 pages, 23 figures. Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08808 2026-07-13 cs.CV 新提交 79%

StereoSplat+: Feed-Forward Stereo Gaussian Splatting with Diffusion-Assisted Progressive Inference

StereoSplat+:具有扩散辅助渐进推理的前馈立体高斯点云渲染

Zihua Liu, Masatoshi Okutomi

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究从单目立体观察恢复高质量3DGS场景的问题,提出StereoSplat+框架,包含StereoSplat估计器及扩散增强单步渐进推理方案,实验表明该方法提升了新视图渲染质量和几何精度,优于现有前馈3DGS基线。

Comments 8 pages, accepted as a conference paper for IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08770 2026-07-10 cs.CV 新提交 79%

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

LongE2V:基于视频扩散模型的长时程基于事件的视频重建、预测和帧插值

Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究从稀疏事件流恢复高质量视频的难题,提出LongE2V方法,利用预训练视频扩散先验,通过微调基础模型实现联合处理视频重建、预测和帧插值,在多任务上优于现有方法,有高数据效率、时间连贯性和零样本泛化能力。

Comments SIGGRAPH 2026. Project page: https://cdfan0627.github.io/LongE2V-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08241 2026-07-10 cs.CV cs.LG 新提交 79%

Closing the Null Space: Guidance-Aware Quantization for Classifier-Free Diffusion

消除零空间:用于无分类器扩散的引导感知量化

Abdullah Al Shafi, Sumaiya Rahim Suma

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究在实际计算预算下部署CFG扩散模型的量化问题,针对现有方法忽略其结构导致的问题,提出引导感知混合精度方法,通过直接校准引导预测等操作防止无条件分支漂移,实现更好量化效果。

Comments 6 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08086 2026-07-10 cs.CV 新提交 79%

GRE-Diff: Gaussian Room Embeddings for Structured Layout Diffusion

GRE-Diff:用于结构化布局扩散的高斯房间嵌入

Jing Wang, Haoran Xiong, Zihao Yan, Minglun Gong, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence, CSSE, Shenzhen University(广东省视觉媒体与多维智能重点实验室,计算机科学与软件学院,深圳大学) School of Computer Science, University of Guelph(圭尔夫大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GRE-Diff框架,结合AI建议与人工编辑,通过大语言模型或图形用户界面让用户指定房间相关约束和操作,利用高斯房间嵌入生成多样合理设计,实验表明其能产生高质量布局,助力空间设计中AI与人类创造力结合。

Comments 37 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06553 2026-07-10 cs.CV 新提交 79%

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

从 RGB 生成到密集场读出:使用文本到图像模型进行像素空间密集预测

Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li

机构 * UCSD(加州大学圣地亚哥分校) HKUST(香港科技大学)

专题命中 扩散模型 :text-to-image(title,abstract);分类 cs.CV

AI总结 研究利用文本到图像模型进行像素空间密集预测,提出ReChannel方法,保留DiT输入分布的VAE编码器,去掉目标侧解码器,用任务LoRA调整,通过线性头映射令牌到像素空间补丁,在多个密集预测任务上表现出色,比对比方法更准确快速。

详情

展开后加载摘要…

URL PDF HTML 收藏