arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2193 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2193 篇

2607.27842 2026-07-31 cs.CV cs.LG 新提交 79%

FeatFix: Reuse What You Verify through Local Exact-Feature Correction for Faster Cached Diffusion Inference

FeatFix:通过局部精确特征校正重用已验证特征以实现更快的缓存扩散模型推理

Hanshuai Cui, Zhiqing Tang, Zhi Yao, Qianli Ma, Fanshuai Meng, Weijia Jia

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对扩散模型推理计算密集的问题,提出FeatFix方法,通过重用已验证的局部精确特征校正草稿,实现最高6.70倍的生成加速且保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27800 2026-07-31 cs.CV 新提交 79%

FDDWAN: A Frequency-Decoupled Diffusion Network for Watermarking Attack

FDDWAN:用于水印攻击的频率解耦扩散网络

Chunpeng Wang, Yuxin Li, Xiaoyu Wang, Jidong Yang, Suo Gao, Qi Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对现有水印去除方法的权衡缺陷,提出FDDWAN框架,经实验验证其在水印去除与视觉保真度间的表现优于传统及学习型攻击方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27537 2026-07-31 cs.CV 新提交 79%

ProgFormer: Hierarchical Voxel Diffusion Transformer for Longitudinal Brain MRI Prediction

ProgFormer:用于纵向脑部MRI预测的分层体素扩散Transformer

Dexuan Ding, Yuankai Qi, Luping Zhou, Jian Yang, Quan Z. Sheng, Ming-Hsuan Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ProgFormer是一种分层体素扩散Transformer,通过粗-细通路结合条件流匹配,在ADNI等三个基准上实现了更优的纵向脑部MRI预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26715 2026-07-30 cs.CV 新提交 79%

FreeShadow: Training-Free Shadow Removal via Illumination Transfer and Selective Content Preservation in Diffusion Models

FreeShadow:基于扩散模型的无需训练的光照迁移与选择性内容保留去阴影方法

Yinan Wang, Yan Huang, Yong Xu, Patrick Le Callet

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Pazhou Lab(琶洲实验室) Polytech Nantes, Université de Nantes(南特大学南特理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FreeShadow是基于预训练扩散模型的无需训练去阴影方法,通过光照迁移注意力等技术解决传统方法泛化差、易生伪影等问题,实验表明其泛化能力强且生成图像逼真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26706 2026-07-30 cs.CV 新提交 79%

TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models

TPD:用于文本到视频扩散模型的时间先验解耦

Taewon Kang, Matthias Zwicker

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对文本到视频扩散模型的时间先验抑制问题,提出无需训练的TPD框架,通过帧选择性下界约束恢复被抑制的后期片段信号,提升后期概念实现效果且与骨干无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26292 2026-07-30 cs.CV 新提交 79%

Eddeep: a deep-learning framework for fast eddy-current distortion correction in diffusion MRI

Eddeep:用于扩散MRI中快速涡流畸变校正的深度学习框架

Antoine Legouhy, Ross Callaghan, Yuchuan Qiao, Whitney Stee, Philippe Peigneux, Hojjat Azadbakht, Hui Zhang

机构 * Hawkes Institute(霍克斯研究所) University College London(伦敦大学学院) Institut Pasteur(巴斯德研究所) Université Paris Cité(巴黎西岱大学) AINOSTICS ltd.(AINOSTICS有限公司) Fudan University(复旦大学) Université Libre de Bruxelles (ULB)(布鲁塞尔自由大学) University of Liège (ULiège)(列日大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对dMRI中涡流畸变校正方法计算成本高的问题,提出深度学习框架Eddeep,其通过两阶段网络实现与FSL Eddy相当的校正质量,同时大幅缩短推理时间,为大规模研究和临床部署提供支持。

Comments Associated GitHub repo: https://github.com/CIG-UCL/eddeep

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26203 2026-07-30 cs.CV 新提交 79%

WildShadowRemover: In-the-Wild Video Shadow Removal via Detail-Preserving Video Diffusion Models

WildShadowRemover:基于细节保留视频扩散模型的野外视频阴影去除方法

Jiamin Xu, Cong Wang, Zheng Dong, Chi Wang, Renshu Gu, Weiwei Xu, Gang Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对野外视频阴影去除难题,提出WildShadowRemover框架,通过LoRA微调适配视频扩散模型,结合细节注入、频率分解调制及Depth Anything 3深度先验,构建对应数据集,在阴影去除质量与时间一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25503 2026-07-29 cs.CV 新提交 79%

Group Equivariant Diffusion for Anomaly Detection in Computational Cytology

用于计算细胞学异常检测的群等变扩散

Swarnadip Chatterjee, Ssharvien Kumar Sivakumar, Anirban Mukhopadhyay

机构 * Uppsala University(乌普萨拉大学) Technical University of Darmstadt(达姆施塔特工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 计算细胞学中恶性细胞检测难,现有方法有局限。本文提出D4等变扩散框架,通过结构和推理时的对称强制,实现变换一致的重建与稳定异常排名,在两个细胞学数据集上表现优于其他方法,降低分数方差。

Comments 11 pages, 2 figures, 1 table, 1 algorithm. Accepted for publication in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25092 2026-07-29 cs.CV 新提交 79%

MorphUNet: Alpha-Controlled Biometric Transport for Diffusion-Based Face Morphing Attacks

MorphUNet:基于扩散的人脸变形攻击的α控制生物特征传输

Taimoor Rizwan, Sara Atito, Zhenhua Feng, Muhammad Awais, Josef Kittler

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对人脸变形攻击威胁,提出MorphUNet框架,将双亲生成设为α控制生物特征传输,用可训练双亲分离双交叉注意力,经实验评估其在多个指标上表现出色,在变形攻击潜力等方面优于基线,且难被检测。

Comments 37 pages, 23 figures, 8 tables. Includes supplementary material (additional robustness analysis, CFD stress tests, and conditioning ablations) appended after the references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24124 2026-07-28 cs.CV 新提交 79%

ViDS: Video Diffusion Shader using 3D Face Tracking

ViDS:使用3D面部跟踪的视频扩散着色器

Wenbo Ji, Davide Davoli, Zhe Chen, Liam Schoneveld, Matthias Nießner, Jiapeng Tang

机构 * Technical University of Munich(慕尼黑工业大学) Toyota Motor Europe NV/SA(丰田汽车欧洲股份公司) Woven by Toyota(丰田编织)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究利用3D面部跟踪实现肖像动画,先重建3DMM网格,再用驱动视频参数动画处理,借助视频扩散模型合成动画,引入自回归扩散采样过程,相比之前方法能更精细控制表情姿势,且保留身份外观,消融研究验证了有效性。

Comments 12 pages, 6 figures, and 8 tables. Project page: https://fusheng-ji.github.io/ViDS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23844 2026-07-28 cs.CV 新提交 79%

OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models

OmniCache:用于扩散模型的多维分层特征缓存

Zhaoyuan He, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对高分辨率图像和视频扩散模型推理成本高的问题,提出OmniCache框架,利用中间扩散特征冗余,通过多种缓存实现多维特征重用,减少推理延迟,在多模型上取得良好效果,且无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23680 2026-07-28 cs.CV 新提交 79%

Perturbation-Aware Diffusion-Guided Hybrid Segmentation for Robust and Annotation-Efficient Plant Stress Phenotyping

用于稳健且标注高效的植物胁迫表型分析的扰动感知扩散引导混合分割

Gurbhit Chaurakoti, Soumyashree Kar

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对农业图像语义分割实际部署问题,提出扩散引导混合分割框架,通过多种实验评估,结果显示最佳模型标注效率高,适应后模型可转移,表明合理配对主干和细化器并结合扰动感知再训练可提升分割效果和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22719 2026-07-28 cs.CV 新提交 79%

$γ$-Bridge: A Look-Parametric Diffusion Bridge

γ-桥:一种外观参数化扩散桥

Xuran Hu, Yujie Zhu, Tengxi Wang, Jilong Li, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Macquarie University(麦考瑞大学) Ningxia University(宁夏大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对乘法伽马噪声在相干成像中的问题,提出γ-桥这一外观参数化扩散桥,通过特定调度连接噪声观测与干净极限,结合均匀补丁外观估计器,能处理多传感器数据,实现零样本恢复且结果领先,还提供可物理解释的控制。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22696 2026-07-28 cs.CV cs.AI 新提交 79%

MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion

MegaSlide-DiT:用于高效视频扩散的以内存为中心的自适应和可变形局部注意力

Jiacheng Liu, Jason Liu

机构 * Trendinsight Lab / UC San Diego(趋势洞察实验室/加州大学圣地亚哥分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对高分辨率视频扩散模型内存消耗大问题,提出MegaSlide-DiT,通过让GPU不持有模型状态及用3D-DSA取代全局注意力,降低内存和计算复杂度,实现105B DiT在单H200 GPU上的适配,为大规模视频扩散模型全参数适配提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22544 2026-07-28 cs.AI cs.CV 新提交 79%

Concept-based Visual Counterfactual Explanations with Diffusion Models

基于扩散模型的基于概念的视觉反事实解释

Yassine Oueslati, Daniil Kirilenko, Martin Gjoreski, Marc Langheinrich

机构 * Università della Svizzera italiana(瑞士意大利语区大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究视觉反事实解释问题,提出C-VCE框架,通过概念瓶颈层将分类器融入生成模型,由概念引导反事实解释,在采样时可切换概念,添加正则化器和掩码控制编辑,在基准测试中表现良好,是实用工具且为模型理解和使用提供新思路。

Comments Accepted at the 4th World Conference on eXplainable Artificial Intelligence (XAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22386 2026-07-27 cs.CV cs.CR 新提交 79%

Correlation-Aware and Gaussianity-Preserving Robust Latent Angular Watermarking for Diffusion Models

用于扩散模型的相关感知和高斯性保持的鲁棒潜在角水印

Yebin Zheng, Haonan An, Guang Hua, Zhiping Lin, Yuguang Fang

机构 * Singapore Institute of Technology(新加坡理工学院) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型潜在域水印问题,提出潜在角水印(LAW)及变体LAW-M,通过对映角编码保持高斯性,解决现有方法易受攻击及相关性退化问题,理论上严格表征相关性退化并推导自相关结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22231 2026-07-27 cs.CV cs.AI 新提交 79%

TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution

TRaM-VSR:用于一步扩散视频超分辨率的重要性感知令牌路由与合并

Sicheng Gao, Zhuyun Zhou, Yixuan Liu, Tong Shen, Zongwei Wu, Radu Timofte

机构 * Advanced Micro Devices Inc.(超威半导体公司) Computer Vision Lab, CAIDAS & IFI, University of Würzburg(维尔茨堡大学CAIDAS与IFI计算机视觉实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对视频超分辨率中扩散模型计算成本高及现有方法存在问题,提出TRaM-VSR框架,通过融合线索估计令牌重要性,经离线规划器校准调整,在路由组内分处理关键与非关键令牌,实现加速推理且保持质量和一致性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22091 2026-07-27 cs.CV 新提交 79%

Spectral Prior for Reducing Exposure Bias in Diffusion Models

用于减少扩散模型中曝光偏差的频谱先验

Yuya Kobayashi, Masato Ishii, Yuhta Takida, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散模型曝光偏差问题,提出频谱对齐(SPA)方法,通过离线拟合参数频谱模型及推理时基于快速傅里叶变换的梯度计算引导,减少计算开销且与CFG互补,在多种架构上实现一致改进。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21594 2026-07-24 cs.CV 新提交 79%

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

具有世界状态寄存器的流式多智能体自回归扩散模型

Sicheng Mo, Yuheng Li, Ziyang Leng, Krishna Kumar Singh, Bolei Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究多智能体交互世界模型共享状态维护难题,提出WorldWeaver模型,利用跨智能体世界状态寄存器及混合变压器设计,经双智能体我的世界视频生成实验验证,该模型能提升逻辑一致性与生成质量。

Comments Project page: https://vail-ucla.github.io/worldweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21545 2026-07-24 cs.CV 新提交 79%

Towards Robust Iris Recognition Through Occlusion Identification and Conditional Diffusion-Based Reconstruction

通过遮挡识别和基于条件扩散的重建实现鲁棒虹膜识别

Kamrul Hasan, Mylene C. Q. Farias, Oleg V. Komogortsev

机构 * Texas State University(德克萨斯州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对虹膜纹理被遮挡时识别性能下降的问题,提出含遮挡类型识别、基于扩散重建及深度学习识别三个模块的框架,通过确定遮挡类别、重建受损区域并提取特征,提升了在CASIA-Iris-Thousand数据集上的虹膜识别性能。

Comments Accepted by IEEE International Joint Conference on Biometrics (IJCB) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21504 2026-07-24 cs.CV 新提交 79%

Texture++: Elevating 3D Asset Texture Resolution with a Region-Aware Diffusion Model

Texture++:使用区域感知扩散模型提升3D资产纹理分辨率

Shuaiwei Wang, Shi Li, Jieting Xu, Yuchi Huo, Qi Wang, Wenting Zheng, Rengan Xie

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) North China Electric Power University(华北电力大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对3D资产纹理分辨率低问题,提出Texture++框架,通过在UV空间重新表述超分辨率任务,采用自适应视图选择、四叉树纹理区域组织及基于扩散的超分辨率模型,提升纹理分辨率,相比现有方法显著改进了纹理细节与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21239 2026-07-24 cs.CV 新提交 79%

Stokes-Informed Diffusion for Robust Linear Polarization Estimation

用于稳健线性偏振估计的斯托克斯信息扩散

Yidong Luo, Chenggong Li, Yuchao Feng, Boxin Shi, Junchao Zhang, Xin Yuan

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工学院) School of Automation, Central South University(中南大学自动化学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究从单张RGB图像估计线性偏振问题,提出基于穆勒形式主义的GenPolar框架,通过预测斯托克斯分量并结合可观测性感知损失监督偏振角,采用两阶段训练策略,在多数据集实验中性能达先进水平,提升下游应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21174 2026-07-24 cs.CV 新提交 79%

Decoupling Cross-Modality Manifold Discrepancy: Leveraging Visible Diffusion Priors for Infrared Super-Resolution

解耦跨模态流形差异:利用可见光扩散先验实现红外超分辨率

Yunpeng Hua, Hongwei Yu, Jiawei Li, Qiankun Liu, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对红外图像超分辨率问题,提出双路径基于扩散的Shift-IISR框架,通过开发GRM模块提取特定模态信息、引入LSR模块关注结构信息,有效提高了分布和结构一致性,保持了超分辨率性能。

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026). Code: https://github.com/Assassink8/Shift-IISR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20545 2026-07-24 cs.AI cs.CV cs.SE 新提交 79%

StrideDiffusion: Accelerating Diffusion Models for Time-series Generation

StrideDiffusion:加速用于时间序列生成的扩散模型

Du Yin, Estrid He, Julián Jerónimo Bañuelos, Yang Yang, Feng Hu, Yuchen Luo, Hao Xue, Stephan Sigg, Flora Salim

机构 * UNSW(新南威尔士大学) RMIT(皇家墨尔本理工大学) Aalto University(阿尔托大学) HKUST(GZ)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散模型推理时去噪步骤多限制实际应用的问题,提出StrideDiffusion采样器,依据频带活动自适应选步长,经实验验证该方法能大幅加速时间序列生成,保持或提升质量,为快速采样提供实用信号。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20293 2026-07-23 cs.CV 新提交 79%

Evolving Cache Schedules for Fast Diffusion Policy Inference

用于快速扩散策略推理的演进缓存调度

Siying Wang, Kangye Ji, Di Wang, Fei Cheng

机构 * School of Telecommunications Engineering, Xidian University(西安电子科技大学通信工程学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散策略实时部署计算需求大的问题,提出演进缓存调度(EVO)框架,通过进化搜索全局调度缓存刷新,引入冗余感知初始化和目标条件早期停止,大幅减少计算量并保留性能,实现动作生成加速和FLOPs降低。

Comments 15 pages, 3 figures, supplementary material included. Accepted by PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20048 2026-07-23 cs.CV 新提交 79%

Importance-Aware OBS Pruning for Diffusion Models

用于扩散模型的重要性感知OBS剪枝

Ba-Thinh Lam, Srijan Das, Hieu Le

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散模型提出重要性感知剪枝框架,通过纳入空间重要性映射到剪枝目标,在MS-COCO数据集上高压缩率下保持主题保真度和结构正确性,证明内容感知目标对生成模型感知忠实压缩很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19943 2026-07-23 cs.CV 新提交 79%

SIINR: Structurally Informed Implicit Neural Representations for super-resolution with uncertainty quantification of clinical quality diffusion MRI datasets

SIINR:用于临床质量扩散MRI数据集超分辨率及不确定性量化的结构信息隐式神经表示

Tom Hendriks, William Consagra, Anna Vilanova, Yogesh Rathi, Maxime Chamberland

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of South Carolina(南卡罗来纳大学) Brigham and Women’s Hospital, Harvard Medical School(布莱根妇女医院,哈佛医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对临床dMRI数据集平面外分辨率低的问题,提出SIINR框架,利用监督3D U-net和自监督INR结合,实现超分辨率及不确定性量化,在多数据集和临床病例实验中表现优异,为临床dMRI增强及指标解释提供方法。

Comments 27 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19886 2026-07-23 cs.CV 新提交 79%

MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation

MTVDiff:用于增强热红外到可见光面部翻译的多模态条件潜扩散

Zhiyuan Xia, Haojie Li, Jingyu Lin, Yiguo Qiao, Cunjian Chen

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(新一代人工智能技术及其交叉应用重点实验室(东南大学)) Monash University(莫纳什大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对热红外到可见光面部翻译的挑战,提出MTVDiff框架,通过双分支交叉注意力融合等三个核心技术,整合深度和文本信息,在多指标上优于现有方法,提升图像质量和面部验证性能,推动跨光谱面部图像翻译发展。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19701 2026-07-23 cs.CV 新提交 79%

SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving

SafeGen:基于视觉语言模型的自动驾驶安全关键场景的目标条件视频扩散

Jiangfan Liu, Zexuan Cui, Tianyuan Zhang, Zonglei Jing, Zonghao Ying, Yaoyuan Zhang, Jiakai Wang, Xiaoqi Jiang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北京航空航天大学) Zhongguancun Laboratory(中关村实验室) Chery Automobile Co., Ltd.(奇瑞汽车股份有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对VLM在自动驾驶系统中的应用,提出SafeGen框架,将场景生成设为目标条件扩散过程,引入上下文接地最终状态推理和最终状态条件下的视频演化,实验表明该框架能提升评判得分,微调后可提高真实驾驶场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19522 2026-07-23 cs.LG cs.CV 新提交 79%

Geospatial Diffusion-based Evolution Synthesis (GeoDES) for Storm-Centered Weather Augmentation

基于地理空间扩散的风暴中心天气增强演化合成(GeoDES)

Sonia Cromp, Satya Sai Srinath Namburi GNVV, Youran Wang, Grace Kisslinger, Frederic Sala, James Booth, Allegra LeGrande

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对机器学习天气模型预测风暴结构难题,提出基于地理空间扩散的演化合成(GeoDES)模型,该模型能合成高保真天气事件,经评估在关键指标上优于先前方法,可用于测试预测模型和扩展气象数据集。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏