arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-05-04 至 2026-05-04 共收录 5
2603.28980 2026-05-04 cs.CV

Stepper: Stepwise Immersive Scene Generation with Multiview Panoramas

Stepper:基于多视角全景图的分步沉浸式场景生成

Felix Wimbauer, Fabian Manhardt, Michael Oechsle, Nikolai Kalischek, Christian Rupprecht, Daniel Cremers, Federico Tombari

机构 * Google(谷歌) University of Oxford(牛津大学) MCML Technical University of Munich(慕尼黑技术大学)

AI总结 Stepper通过分步扩展多视角全景图,解决传统方法在视觉保真度与可探索性之间的权衡问题,实现高质量沉浸式3D场景生成。

Comments Accepted at CVPR 2026 Findings; Find our project page under https://fwmb.github.io/stepper/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00495 2026-05-04 cs.SD cs.CV

MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video

MMAudio-LABEL: 通过音频生成实现静音视频的音频事件标注

Kazuya Tateishi, Akira Takahashi, Atsuo Hiroe, Hirofumi Takeda, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

AI总结 本文提出MMAudio-LABEL框架,通过联合生成音频和帧对齐的声学事件预测,提升静音视频的音频事件标注精度,实验显示在起始点检测和材料分类任务中性能显著提升。

Comments Accepted to the CVPR 2026 Sight and Sound Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00431 2026-05-04 cs.SD cs.CV cs.LG eess.AS

MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation

MMAudioReverbs: 视频引导的声学建模用于去混响和房间脉冲响应估计

Akira Takahashi, Ryosuke Sawata, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

AI总结 本文提出MMAudioReverbs框架,利用预训练视频到音频模型进行去混响和房间脉冲响应估计,通过小数据集微调实现无需修改网络结构的统一处理。

Comments Accepted to the CVPR 2026 Sight and Sound Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00090 2026-05-04 cs.CV cs.LG

It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models

迟到也不晚:通过噪声优化在训练好的扩散模型中恢复崩溃

Anne Harrington, A. Sophia Koepke, Shyamgopal Karthik, Trevor Darrell, Alexei A. Efros

机构 * UC Berkeley(加州大学伯克利分校) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) TU Munich, MCML(慕尼黑工业大学,MCML)

AI总结 本文通过噪声优化提升扩散模型生成多样性,减少模式崩溃,同时保持基础模型的保真度。

Comments CVPR 2026. Project page at https://akoepke.github.io/divgen/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23116 2026-05-04 cs.CV

Residual Diffusion Bridge Model for Image Restoration

残差扩散桥模型用于图像修复

Hebaixu Wang, Jing Zhang, Haoyang Chen, Haonan Guo, Di Wang, Jiayi Ma, Bo Du

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) School of Robotics, Wuhan University(武汉大学机器人学院)

AI总结 本文提出残差扩散桥模型,通过理论重构扩散桥的随机微分方程,利用残差调节噪声注入与去除,实现自适应修复受损区域并保留完整区域,验证了模型的最优性。

Comments Accepted by CVPR 2026 as Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏