arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2869 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2193 篇

2606.13366 2026-06-12 cs.CV cs.MM 新提交 81%

Dual-Constrained Diffusion Image Compression for Operational Rate-Distortion-Perception Optimization

双约束扩散图像压缩用于操作率失真感知优化

Sanxin Jiang, Jiro Katto, Heming Sun

机构 * Shanghai University of Electric Power(上海电力大学) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出DCIC框架,结合学习编解码器和基于扩散的解码器,通过联合失真和等幂约束实现率失真感知帕累托前沿的连续导航,无需额外码率开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10183 2026-06-10 cs.CV cs.AI cs.MM 新提交 81%

Making Time Editable in Video Diffusion Transformers

在视频扩散Transformer中实现时间可编辑性

Konstantin Kuklev, Viacheslav Vasilev, Alexander Kunitsyn, Andrei Ivaniuta, Denis Dimitrov

机构 * Kandinsky Lab(坎迪斯基实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出一种时间控制方法,通过轻量级时间模块扩展预训练DiT,实现运动速度和时序结构的编辑,无需重新设计骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08734 2026-08-11 cs.CV 新提交 80%

IDATA: Scalable Invertible Diffusion for Unrestricted Adversarial Transfer Attack

IDATA:用于无限制对抗迁移攻击的可扩展可逆扩散模型

Yi Pan, Jun-Jie Huang, Tianrui Liu, Zihan Chen, Lin Liu, Zhao Wentao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 IDATA是一种用于无限制对抗迁移攻击的内存高效扩散框架,通过可逆扩散模块与低频约束模块提升攻击性能,在多基准测试中优于现有方法,可用于评估深度视觉模型黑盒鲁棒性。

Comments Adversarial attack,Invertible diffusion model,Memory-efficient,Low-frequency

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06717 2026-08-10 cs.CV 新提交 80%

WaveFreqAnchor: Wave-Structural Anchoring and Frequency Correction Diffusion for Training-Free Face Restoration

WaveFreqAnchor:用于无训练人脸修复的波结构锚定与频率校正扩散

Zelin Du, Wenjie Li, Zhengxue Wang, Juncheng Li, Cailing Wang, Guangwei Gao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对现有扩散模型人脸修复的结构漂移与保真度问题,提出无训练框架WaveFreqAnchor,通过ASWG、MWFI、SHE设计实现高质量人脸修复,性能优于现有方法。

Comments training-free wavelet-structural diffusion sampling framework for face restoration that improves structural stability, identity consistency, and real-world perceptual quality without task-specific fine-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11385 2026-07-14 eess.IV cs.CV 新提交 80%

Diffusion MRI preprocessing affects ADC estimation and automatic PI-RADS v2.1 classification in bi-parametric prostate MRI

扩散加权磁共振成像预处理影响双参数前列腺磁共振成像中表观扩散系数估计和自动PI-RADS v2.1分类

Christos Kanakis, Mathias Perslev, Tim Schakel, Silvia Ingala, Akshay Pai, Dennis Klomp, Chantal M. W. Tax

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究不同DWI预处理策略对前列腺MRI中ADC估计及PI-RADS分类的影响,通过对268个病例应用多种处理方法,比较不同算法下的ADC图,训练分类器预测PI-RADS分数,发现预处理可提升ADC图质量及分类预测能力。

Comments 19 pages, 10 figures, ISMRM Diffusion workshop 2025, ESMRMB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31065 2026-07-01 cs.CV 新提交 80%

Diffusion-Based Material Regularization for Physics-Based Inverse Rendering

基于扩散的材料正则化用于物理逆渲染

Jingwang Ling, Lifan Wu, Feng Xu, Shuang Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达) BNRist and School of Software, Tsinghua University(清华大学软件学院及北京国家信息科学与技术研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出将扩散模型预测作为相似性核,通过正则化损失约束材料优化,联合重建几何、材质和光照,在多个数据集上显著优于现有方法。

Comments Accepted to ECCV 2026. Includes supplementary material. Project page: https://gerwang.github.io/diffusion-regularized-inverse-rendering/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23610 2026-06-23 cs.CV 新提交 80%

Vera: A Layered Diffusion Model for Content-Preserving Video Editing

Vera: 一种用于内容保持视频编辑的分层扩散模型

Hongkai Zheng, Ta-Ying Cheng, Benjamin Klein, Yisong Yue, Zhuoning Yuan

机构 * California Institute of Technology(加州理工学院) Netflix, Inc(Netflix公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Vera分层扩散框架,通过生成编辑层和alpha遮罩与源视频合成,利用混合Transformer架构和高质量分层数据集,在保持内容的同时实现高质量编辑。

Comments https://vera-layered-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10280 2026-06-10 eess.IV cs.CV 新提交 80%

Overlapped Wavelet Diffusion for Low-Light Image Enhancement

重叠小波扩散用于低光照图像增强

Fen Peng, Taizo Suzuki, Seisuke Kyochi

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出重叠小波扩散框架OWDiff,通过重叠小波变换消除块伪影,并引入低频引导的高频增强模块恢复细节,在LOLv1和LOLv2-real数据集上优于现有方法。

Comments Advance published in IEICE Transactions on Information and Systems. DOI: 10.1587/transinf.2026PCP0006. Code: https://github.com/FinnPeg/Overlapped-Wavelet-Diffusion

Journal ref IEICE Transactions on Information and Systems, Advance online publication, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03938 2026-08-05 cs.RO cs.SY eess.SY 新提交 80%

Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson

8 GB预算内的双臂操作:入门级Jetson上的零拷贝感知与量化ACT

Ekansh Singh, Eva Samuel, Alessandra Reneau, Ryan Schmeelk, Yashvi Gandhi

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 该研究在8 GB入门级Jetson上实现了双臂操作,采用零拷贝感知、量化ACT,发现ACT在相同演示下优于Diffusion Policy,INT8量化可大幅降低延迟且保留任务成功率。

Comments 9 pages, 8 tables. Work conducted at the Georgia Tech Research Institute (GTRI), Aerospace, Transportation and Advanced Systems Laboratory (ATAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00730 2026-08-04 cs.RO 新提交 80%

Push-Wiper: Toward General-Purpose Robotic Cleaning across Varied Stains and Surfaces with Segmented Pushing Trajectories

Push-Wiper:基于分段推动轨迹的通用机器人清洁方案,用于处理不同污渍与表面

Renhao Lu, Mingxin Wang, Chenyang Cao, Yang Yang, Guoping Pan, Kangkang Dong, Yi Cheng, Houde Liu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Z-Lab, Zerith Robotics(Zerith机器人公司Z-Lab实验室) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 Push-Wiper 框架将粘性污渍清洁转化为聚合问题,通过分段推动轨迹结合 Diffusion Policy 与 ASPI 控制器,清洁得分比基线高130%,可零样本泛化至多种污渍与表面。

Comments 8 pages, 8 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14430 2026-08-17 cs.LG cs.CV stat.ML 新提交 79%

Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View

为扩散模型设计强化学习:统一的路径空间视角

Yixian Xu, Yuanrui Zhang, Shengjie Luo, Liwei Wang, Di He

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文从路径空间视角统一了扩散模型RL算法的原理,推导得到降方差值梯度形式,提出多样本KDE估计器和尺度受限权重族,在SD3.5-M等模型上验证了方法有效性并优于基线。

Comments 29 pages, 9 figures, 4 tables; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13669 2026-08-17 cs.CV 新提交 79%

Multiphase-Diff: Diffusion-Based Generative Modeling for High-Contrast Multiphase Physical Systems with Sharp Interfaces

Multiphase-Diff:面向具有尖锐界面的高对比度多相物理系统的基于扩散的生成建模

Yining Huang, Zhenyu Liang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对高对比度多相物理系统的扩散生成建模难题,提出Multiphase-Diff方法,通过三项改进实现更优的物理与分布保真度,在多相基准上优于7个基线模型,适用于该场景的科学样本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13255 2026-08-14 cs.CV cs.AI 新提交 79%

GeoCache: Training-Free Acceleration of Multi-View Texture Diffusion via Geometric Delta Transport

GeoCache:通过几何增量传输实现多视图纹理扩散的无训练加速

Haotang Li, Zhenyu Qi, Shaohan Henry Wang, Kebin Peng, Yutong Zhao, Zi Wang, Bo Liu, Huanrui Yang, Sen He

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出无训练插件GeoCache,通过传输锚点视图的几何对齐更新实现多视图纹理扩散加速,在三个基准数据集上实现优于时间缓存和步骤缩减的速度-保真度权衡,2倍以上加速时表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12308 2026-08-13 cs.CV cs.AI 新提交 79%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12175 2026-08-13 cs.CV 新提交 79%

TGRHuman: Text-Guided Realistic 3D Human Generation via Diffusion Renderer

TGRHuman:基于扩散渲染器的文本引导逼真3D人体生成

Muxin Zhang, Chaohui Yu, Yuanwang Yang, Min Wei, Zhuo Su, Kun Li

机构 * Tianjin University(天津大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出TGRHuman方法,解耦3D人体的几何与纹理生成,采用显式多视图优化结合扩散渲染器,实现高效高质量文本引导的逼真3D人体生成,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12155 2026-08-13 cs.CV 新提交 79%

Understanding Why Foundation Models Work for Diffusion-Generated Image Detection

探究基础模型为何适用于扩散生成图像检测

Davide Cozzolino, Giovanni Poggi, Luisa Verdoliva

机构 * University Federico II of Naples(那不勒斯费德里科二世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究探究基础模型用于扩散生成图像检测的原因,通过DDIM反演、频率交换及潜在空间分析,发现其利用中低频分布差异实现检测,为该类方法的可解释性提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12032 2026-08-13 cs.CV cs.AI 新提交 79%

LoSA: Near-Lossless Sparse Attention for Training-Free Video Diffusion Acceleration

LoSA:用于无训练视频扩散加速的近无损稀疏注意力

Enhuai Liu, Yunke Wang, Yutong Wang, Changming Sun, Chang Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LoSA是一种无训练稀疏注意力方法,通过固定99%的注意力质量阈值移除冗余计算,在多款视频扩散Transformer上实现最高3.2倍加速,且速度-质量权衡优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11942 2026-08-13 cs.CV 新提交 79%

Evaluating and Calibrating Diffusion Model-derived Uncertainty for Quantitative MRI Mapping

评估与校准扩散模型衍生的定量MRI成像不确定性

Shishuai Wang, Stefan Klein, Juan A. Hernandez-Tamames, Dirk H. J. Poot

机构 * Erasmus MC(伊拉斯姆斯医学中心) TU Delft(代尔夫特理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对深度学习定量MRI成像方法可靠性未明确表征的问题,评估了扩散模型衍生的不确定性,发现其与成像误差正相关,经校准后可用于可靠性评估与选择性预测。

Comments 11 pages, 6 figures. Accepted at the MICCAI 2026 Workshop on Uncertainty for Safe Utilization of Machine Learning in Medical Imaging (UNSURE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11913 2026-08-13 cs.CV 新提交 79%

HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion

HarmoniDPO:基于偏好优化扩散模型的视频引导音频生成

Wenshuo Peng, Kaipeng Zhang

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HarmoniDPO框架,采用双视频表示、online-DPO微调及DDS算法,实现更精准的视频到音频生成,在音视频同步性与主观质量上优于现有最优方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11765 2026-08-13 cs.CV 新提交 79%

ProBAG: Prototype-Guided Boundary-Aware Graph Diffusion for Weakly Supervised Histopathology Segmentation

ProBAG:用于弱监督组织病理学分割的原型引导边界感知图扩散

Duy-Dong Nguyen, Le-Van Thai, Hoai Nhan Pham, Ngoc Lam Quang Bui, Tam Tran, Zhi Huang

机构 * AI VIETNAM Lab(AI越南实验室) Washington University School of Medicine(华盛顿大学医学院) Jeonbuk National University(全北国立大学) Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ProBAG是一种新的弱监督组织病理学分割方法,通过结合视觉与文本原型、逐类功率重新校准及图扩散机制,在BCSS-WSSS和LUAD-HistoSeg数据集上取得优于现有方法的性能。

Comments 12 pages, 2 figures, 4 tables. Accepted by MICCAI Workshop (COMPAYL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11748 2026-08-13 cs.CV 新提交 79%

Dual Modality Prompted Diffusion Priors for Zero Shot Hyperspectral Pansharpening

用于零样本高光谱 pansharpening 的双模态提示扩散先验

Pengwei Xie, Fei Zhu, Jiajun Li, Xiangyuan Liu, Xiangyuan Liu, Kangqing Shen, Gemine Vivone

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Peking University(北京大学) National Center for Applied Mathematics Shenzhen (NCAMS), Southern University of Science and Technology(南方科技大学深圳应用数学国家中心) Department of Automation, Tsinghua University(清华大学自动化系) National Research Council of Italy, Institute of Integrated Methodologies for Earth Observation (CNR-IMIOT)(意大利国家研究委员会综合地球观测方法研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对零样本高光谱 pansharpening 问题,提出双模态提示扩散模型 DIDM,通过双模态提示注入与全色引导正则化实现空间细节与光谱保真的平衡,在多数据集实验中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11617 2026-08-13 cs.CV 新提交 79%

KANResDiff: Learning Local Residual Diffusion via Kolmogorov-Arnold Network for Ambiguous Medical Image Segmentation

KANResDiff:基于柯尔莫哥洛夫-阿诺德网络学习局部残差扩散以解决模糊医学图像分割问题

Fanding Li, Chenglin Wang, Xiangyu Li, Xingyu Qiu, Xinghua Ma, Xiangming Yin, Haiyang Li, Suyu Dong, Wei Wang, Kuanquan Wang, Gongning Luo, Shuo Li

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部) College of Computer and Control Engineering, Northeast Forestry University(东北林业大学计算机与控制工程学院) Case Western Reserve University(凯斯西储大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现有模糊医学图像分割方法无法形成渐进式语义建模的问题,提出KANResDiff模型,通过独立时间编码与残差薛定谔桥实现阶段感知模糊性建模,在公开数据集上取得SOTA性能。

Comments 10 pages, 3 figures, MICCAI 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11562 2026-08-13 cs.CV cs.AI eess.IV 新提交 79%

From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection

从合成到去除:基于物理的反射模拟与基于扩散的视频去反射

Zepeng Wang, Jiagao Hu, Fuhao Li, Yuxuan Chen, Fei Wang, Daiguo Zhou

机构 * Xiaomi Inc.(小米公司) MiLM Plus

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对视频反射去除数据与模型缺失问题,提出闭环框架S2R,含基于物理的反射模拟、首个扩散式视频去反射模型及专用基准,实现了更优性能与更快推理。

Comments Project page: https://codingwzp.github.io/VideoDereflection_S2R

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10173 2026-08-12 cs.CV 新提交 79%

DoseBridge: Denoising Diffusion Bridge Model for Dose Prediction in Lung Intensity-Modulated Proton Therapy

DoseBridge:用于肺调强质子治疗剂量预测的去噪扩散桥模型

Zerun Zhang, Xiaoda Cong, Xiangkun Xu, Peter Y. Chen, Xuanfeng Ding

机构 * Corewell Health William Beaumont University Hospital(Corewell Health William Beaumont大学医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对肺调强质子治疗剂量预测问题,提出DoseBridge去噪扩散桥模型,融合CT与射野几何信息,在52例患者数据上的多项指标优于对比模型,为放疗剂量预测提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10162 2026-08-12 cs.CV 新提交 79%

MAD-HOI: Masked Autoregressive Diffusion for Generating Articulated Hand Object Interactions from Text

MAD-HOI:用于从文本生成关节手-物体交互的掩码自回归扩散模型

Ananya Bal, Kartik Sharma, Ethan Lai, Samyak Tiwari, Liza Dahiya, Chaitanya Chawla, Laszlo A. Jeni

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MAD-HOI是一种结合掩码自回归与扩散的HOI生成模型,可生成多样且符合物理规律的手-物体交互序列,支持可变长度生成、运动补全填充等功能,在ARCTIC和GRAB数据集上优于开源基线。

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09445 2026-08-11 cs.CR cs.CV 新提交 79%

DiffSafeMerge: Mitigating Backdoor Inheritance in Diffusion Model Merging

DiffSafeMerge:缓解扩散模型合并中的后门继承问题

Jiayang Zhang, Ji Guo, Jiachen Li, Wenshu Fan, Wenbo Jiang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffSafeMerge是一种缓解扩散模型合并中后门继承的方法,通过评分源模块、收缩可疑贡献并在干净去噪损失预算下选择衰减,在多组实验中实现低攻击成功率和低FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09133 2026-08-11 cs.CV cs.AI 新提交 79%

When Latents Forget Pixels: Restoring Fidelity in Diffusion Transformer Super-Resolution

当潜变量遗忘像素时:在扩散Transformer超分辨率中恢复保真度

Yu Shi, Yuyao Zhang, Yu-wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对扩散Transformer超分辨率中VAE压缩导致的保真度下降问题,提出像素锚定超分辨率框架,通过复用VAE前的像素证据提升结果的忠实度,实验验证其性能优于现有潜变量生成式超分辨率方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08999 2026-08-11 cs.CV cs.AI 新提交 79%

DeepFreqMark: End-To-End Learnable Frequency-Domain Watermarking with Spherical Attack Simulation for Latent Diffusion Models

DeepFreqMark:面向潜在扩散模型的、结合球形攻击模拟的端到端可学习频域水印

Chen-Hsiu Huang, Mario Köppen, Ja-Ling Wu

机构 * National Taiwan University(台湾大学) Kyushu Institute of Technology(九州工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对潜在扩散模型生成图像的版权与虚假信息问题,提出DeepFreqMark频域水印框架,结合球形攻击模拟规避计算瓶颈,其误码率显著低于基线,消息容量可达256位。

Comments accepted by APSIPA ASC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08555 2026-08-11 cs.CV 新提交 79%

SC-Diff: Semantically Calibrated Diffusion for Visible-to-Infrared Image Translation

SC-Diff:用于可见光到红外图像转换的语义校准扩散模型

Junyin Zhang, Siyu Huang, Jianxiong Ye, Haowei Gong, Ruicheng Zhang, Deyu Meng, Chenqiang Gao

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区智能系统工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SC-Diff 是一种语义校准潜扩散框架,通过结合语义先验作为条件与自注意力校准,提升可见光转红外图像的语义一致性,生成更适用于红外目标检测的合成训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08519 2026-08-11 cs.CV 新提交 79%

eBIRD: Event-based Intensity Image Reconstruction Using Controllable Diffusion Models

eBIRD:基于可控扩散模型的事件驱动强度图像重建

Ignacio Bugueno-Cordova, Fabian Valderrama, Rodrigo Verschae

机构 * Institute of Engineering Sciences, Universidad de O’Higgins(奥伊金斯大学工程科学学院) The Iniciativa de Datos e Inteligencia Artificial, University of Chile(智利大学数据与人工智能倡议)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出eBIRD框架,结合DDPM与ControlNet实现事件引导强度图像重建,在N-MNIST和RGBE-Gaze数据集上验证了通用与专用扩散学习策略的效果,表明可控扩散模型是该任务的有前景方法。

Journal ref The 19th European Conference on Computer Vision Workshops (ECCVW 2026); Workshop on Neuromorphic Vision (NeVi)

详情

展开后加载摘要…

URL PDF HTML 收藏