arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-18 至 2026-08-18 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 图像修复 3 篇

2608.15259 2026-08-18 cs.CV cs.AI cs.RO 新提交 74%

UAV Video Deblurring via Motion-Aware Diffusion: A Path to Robust Target Detection

基于运动感知扩散的无人机视频去模糊:通往鲁棒目标检测的路径

Zhiqiang Hu, Shouren Huang, Masatoshi Ishikawa

机构 * Research Institute for Science & Technology, Tokyo University of Science(东京理科大学科学技术研究所)

专题命中 图像修复 :diffusion(title);分类 cs.CV

AI总结 该研究针对无人机视频运动模糊问题,提出自适应潜在尺度选择器与多帧对齐可学习门控模块,实现高效去模糊,提升无人机目标检测性能,适用于鲁棒航拍视觉任务。

Comments 8 pages, 8 figures. Published in the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22924 2026-08-18 cs.CV 版本更新 57%

Layering Virtual Try-On

分层虚拟试穿

Chun Feng, Bowei Chen, Mengyi Shan, Ira Kemelmacher-Shlizerman

机构 * University of Washington(华盛顿大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 研究针对现实中服装分层搭配的虚拟试穿难题,提出LVTON方法。先通过自动数据生成管道训练获取一般VTON先验知识,再在专用数据集微调学习分层逻辑,在LVTON基准及传统VTON基准上取得优异成果,展现零样本能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16681 2026-08-18 eess.AS cs.SD eess.SP 版本更新 50%

A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models

音频超分辨率和带宽扩展从判别模型到生成模型的综述

Ningyuan Yang, Yize Li, Diego A. Cuji, Ryan M. Corey, Pu Zhao, Xue Lin, Andrew C. Singer

机构 * Discovery Partners Institute(发现伙伴研究所)

专题命中 图像修复 :diffusion(abstract)

AI总结 本文综述了音频超分辨率和带宽扩展领域,从判别模型向生成模型的转变,总结了早期判别模型的局限性以及生成模型在表示域、架构、条件机制等方面的改进,探讨了大语言模型和多模态基础模型等新兴方向,并指出了感知评估、相位建模和实际应用泛化等开放挑战。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏