arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-19 至 2026-05-19 共收录 13 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 13 篇

2605.16873 2026-05-19 cs.CV 83%

HAD: Hallucination-Aware Diffusion Priors for 3D Reconstruction

HAD:面向3D重建的幻觉感知扩散先验

Xi Liu, Weiwei Sun, Zhou Ren, Chris Broaddus, Siyu Huang, Laurent Guigues

机构 * Amazon AWS(亚马逊AWS) Clemson University(克莱姆森大学)

专题命中 三维重建 :3D reconstruction(title,abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出HAD,一种面向3D重建的幻觉感知扩散先验,通过利用预训练在大规模3D数据上的馈送式新视角合成(NVS)网络的多视角推理能力,估计增强图像的像素级幻觉分数图,从而在逐步3D重建过程中选择性地屏蔽不可靠像素,减少幻觉伪影,提升3D重建质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00392 2026-05-19 cs.RO cs.AI cs.CV 81%

SonarSweep: Fusing Sonar and Vision for Robust 3D Reconstruction via Plane Sweeping

SonarSweep: 通过平面扫描融合声纳与视觉以实现鲁棒的3D重建

Lingpeng Chen, Jiakun Tang, Apple Pui-Yi Chui, Ziyang Hong, Junfeng Wu

机构 * Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Chinese University of Hong Kong, Hong Kong(香港中文大学) Department of Automation, Harbin Institute of Technology(哈尔滨工业大学自动化系)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV、cs.RO

AI总结 本文提出SonarSweep,一种端到端的深度学习框架,通过将平面扫描算法应用于声纳与视觉数据的跨模态融合,克服了单一模态方法在 underwater 环境中3D重建的局限性,实现了更精确和稳定的深度图生成。

Comments 8 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16981 2026-05-19 cs.CV 79%

Rethinking the State Update Gate for Long-Sequence Recurrent 3D Reconstruction

重新思考长序列递归3D重建中的状态更新门

Kejun Ren, Lei Jin, Tianxin Huang, Lianming Xu, Li Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算机与数据科学学院)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 本文针对长序列递归3D重建中状态更新门的结构瓶颈问题,提出一个基于帧级的门控机制,通过闭式解推导出无需参数、训练和额外前向传递的标量帧级门,从而在多个基准测试中显著提升了精度并保持了常量内存使用。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18052 2026-05-19 cs.CV 77%

Efficient 3D Content Reconstruction and Generation

高效3D内容重建与生成

Jiahao Li

机构 * TOYOTA TECHNOLOGICAL INSTITUTE AT CHICAGO(丰田技术研究所芝加哥分校)

专题命中 三维重建 :3D reconstruction(abstract);novel view synthesis(abstract);3D generation(abstract);分类 cs.CV

AI总结 本文提出了一种高效的3D内容生成和重建方法,通过结合多视图扩散和稀疏视图3D重建,实现了高质量的3D资产生成,并开发了FastMap算法以提高3D重建的速度和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20353 2026-05-19 cs.RO 74%

Quality-guided UAV Surface Exploration for 3D Reconstruction

基于质量引导的无人机表面探索用于3D重建

Benjamin Sportich, Kenza Boubakri, Olivier Simonin, Alessandro Renzaglia

机构 * Inria(法国国家信息与自动化技术研究所) INSA Lyon(里昂国立应用科学学院) CITI(信息与通信技术研究所)

专题命中 三维重建 :3D reconstruction(title);分类 cs.RO

AI总结 本文提出了一种新的模块化Next-Best-View规划框架,通过使用重建质量目标来指导探索规划,以提高3D重建的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16795 2026-05-19 cs.CV cs.AI cs.GR 73%

3DPhysVideo: Consistency-Guided Flow SDE for Video Generation via 3D Scene Reconstruction and Physical Simulation

3DPhysVideo: 通过3D场景重建和物理模拟的一致性引导流SDE用于视频生成

Hwidong Kim, Yunho Kim, Tae-Kyun Kim

机构 * KAIST(韩国科学技术院)

专题命中 三维重建 :3D reconstruction(abstract);point cloud(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种无需训练的管道,通过3D场景重建和物理模拟生成逼真视频,利用一致性引导流SDE分解预测速度以确保条件输入的一致性,从而在多物体和流体交互场景中实现从单张图像到物理合理视频的过渡。

Comments Project page: https://hwidong-kim.github.io/projects/3DPhysVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18735 2026-05-19 cs.CV cs.GR cs.LG 62%

PIXLRelight: Controllable Relighting via Intrinsic Conditioning

PIXLRelight: 通过内在条件实现可控的图像重照明

Miguel Farinha, Ronald Clark

机构 * Department of Computer Science(计算机科学系) University of Oxford(牛津大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.GR

AI总结 PIXLRelight通过内在条件将物理基础渲染与学习图像合成相结合,实现对单图像重照明的可控性,其核心方法是利用真实照片或PBR渲染得到的内在条件进行训练和推理,从而在保证图像细节的同时实现高质量的重照明效果。

Comments Project page: https://mlfarinha.github.io/pixl-relight/. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18197 2026-05-19 cs.RO cs.AI cs.CV 62%

RGB-only Active 3D Scene Graph Generation for Indoor Mobile Robots

仅RGB的主动3D场景图生成用于室内移动机器人

Giorgia Modi, Davide Buoso, Giuseppe Averta, Daniele De Martini

机构 * Mobile Robotics Group (MRG)(移动机器人小组) Visual and Multimodal Applied Learning Lab (VANDAL)(视觉与多模态应用学习实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 本文提出了一种仅使用RGB输入的主动3D场景图生成方法,通过统一感知与规划的结构化表示,解决了传统方法对专用传感器的依赖问题,并在Replica数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18184 2026-05-19 cs.RO cs.AI cs.CV 62%

Fixed External Cameras as Common Prior Maps for Active 3D Scene Graph Generation

固定外部摄像头作为主动3D场景图生成的共同先验地图

Giorgia Modi, Davide Buoso, Giuseppe Averta, Daniele De Martini

机构 * Mobile Robotics Group (MRG)(移动机器人组) Visual and Multimodal Applied Learning Lab (VANDAL)(视觉与多模态应用学习实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 本文提出利用固定外部RGB摄像头作为共同先验地图,以实现主动、渐进式的3D场景图生成,通过融合机器人 onboard 摄像头和固定外部摄像头的数据,提高场景理解的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16266 2026-05-19 cs.GR cs.CV cs.LG 62%

Patchwork: A compact representation for 3D polygonal shapes

Patchwork: 3D多边形形状的紧凑表示

Ruichen Zheng, Biao Zhang, Michael Birsak, Mikhail Skopenkov, Peter Wonka

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学)

专题命中 三维重建 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 Patchwork提出了一种新的通用形状表示方法,通过少量参数建模2D和3D几何,提供可证明的复杂度界和任意精度近似能力,结合高效梯度优化和新型正则化损失,实现高紧凑性,适用于几何学习与重建任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17593 2026-05-19 cs.RO 57%

Motion-Uncertainty-Aware Next-Best-View Planning for Moving Object Reconstruction

考虑运动不确定性的移动物体重建最佳下视角规划

Karen Li, Mattia Mantovani, Robert J. Wood, Lorenzo Sabattini, Stephanie Gil

机构 * Harvard University(哈佛大学) University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 本文提出了一种考虑运动不确定性的最佳下视角规划框架,用于重建未知的刚体目标,该框架利用噪声的平面位置测量和移动机器人深度观测,通过固定滞后高斯过程平滑器估计和预测目标状态,从而生成候选视角并提高重建完整性。

Comments This paper is accepted for publication for Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16775 2026-05-19 cs.CV cs.AI cs.LG 57%

VolTA-3D: Self-Supervised Learning for Brain MRI using 3D Volumetric Token Alignment

VolTA-3D: 基于3D体积分块对齐的脑MRI自监督学习

Amy Makawana, Abhijeet Parida, Marius George Linguraru, Julia Ive, Syed Muhammad Anwar

机构 * Institute of Health Informatics(健康信息学研究所) Sheikh Zayed Institute for Pediatric Surgical Innovation(谢赫扎耶德儿童外科创新研究所) School of Medicine and Health Sciences(医学与健康科学学院)

专题命中 三维重建 :3D vision(abstract);分类 cs.CV

AI总结 本文提出VolTA-3D,一种用于脑MRI自监督学习的3D视觉Transformer框架,通过联合对齐全局类风格标记和局部块标记,增强体积分块表示的可迁移性,从而在多个下游任务中表现出更好的泛化能力和鲁棒性。

Comments Accepted at EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16628 2026-05-19 cs.CV 57%

SCARED-C: Corrected Camera Poses for Endoscopic Depth Estimation

SCARED-C:用于内窥镜深度估计的修正相机姿态

John J. Han, Adam Schmidt, Max Allan, Jie Ying Wu, Omid Mohareri

机构 * Vanderbilt University(范德比大学) Intuitive Surgical, Inc.(Intuitive Surgical公司)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 SCARED-C通过修正相机姿态,将可靠RGB-D配对数从35增加到17135,采用COLMAP和尺度恢复步骤提升内窥镜深度估计的精度与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏