arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-06-19 至 2026-06-19 共收录 13 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 1 篇

2606.20322 2026-06-19 cs.RO 新提交 57%

Towards 3D karst underwater scene reconstruction from rotating sonar data

基于旋转声纳数据的3D喀斯特水下场景重建

Georgios Evangelos Margaritis, Lionel Lapierre, Simon Rohou, Zhi Yan, Andreas Nüchter, François Goulette

机构 * U2IS, ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院ENSTA学院U2IS实验室) Lab-STICC, ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院ENSTA学院Lab-STICC实验室) Informatics XVII – Robotics, Julius-Maximilians-Universität Würzburg(尤利乌斯-马克西米利安-维尔茨堡大学信息学XVII – 机器人学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 针对声纳数据稀疏噪声大、导航漂移导致3D重建困难的问题,提出结合连续时间SLAM校正轨迹与两阶段深度学习表面重建的流水线,生成可沉浸导航的3D网格。

Comments 1st Workshop on Long-term Deployments in the Wild (LoWi)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2606.19718 2026-06-19 cs.CV 新提交 70%

One-Shot Novel View and Pose Human Image Synthesis via 3D Prior Guided Diffusion Model

基于3D先验引导扩散模型的单样本新视角与姿态人体图像合成

Shenjian Gong, Kangkan Wang, Shanshan Zhang, Jian Yang

机构 * PCA Lab, Key Lab of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, and Jiangsu Key Lab of Image and Video Understanding for Social Security, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院教育部高维信息智能感知与系统重点实验室、江苏省社会安全图像与视频理解重点实验室及PCA实验室) Advanced Laser Technology Laboratory of Anhui Province, Electronic Engineering Institute, National University of Defense Technology, and Jianghuai Advance Technology Center(国防科技大学电子工程学院安徽省先进激光技术实验室及江淮前沿技术中心)

专题命中 NeRF :NeRF(abstract,abstract_cn);分类 cs.CV

AI总结 提出一种基于条件去噪扩散模型的方法,利用3D人体先验(法线图和颜色提示)作为几何和颜色条件,从单张参考图像合成任意姿态和视角的高质量人体图像,包括被遮挡部分。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 5 篇

2606.20103 2026-06-19 cs.CV 新提交 90%

Geometry-Preserving in 3D Gaussian Splatting for LiDAR-Camera Extrinsic Calibration

3D高斯溅射中保持几何结构的LiDAR-相机外参标定

Kyoleen Kwak, Daeho Kim, Jeong Woon Lee, Hyoseok Hwang

机构 * Kyung Hee University(庆熙大学)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 针对LiDAR-相机标定中跨模态特征稀缺问题,提出通过多视图LiDAR深度监督和阻止光度梯度更新高斯空间参数来保持3DGS代理的度量几何,提升标定精度。

Comments Accepted to ECCV 2026. 15 pages (excluding references), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20424 2026-06-19 cs.RO 新提交 79%

LIT-GS: LiDAR-Inertial-Thermal Gaussian Splatting for Illumination-Robust Mapping

LIT-GS: 面向光照鲁棒建图的激光雷达-惯性-热高斯泼溅

Shikuan Shi, Chunran Zheng, Jiaming Xu, Tianyong Ye, Tao Yu, Yukang Cui

机构 * College of Mechatronics and Control Engineering, Shenzhen University(深圳大学机电与控制工程学院) Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.RO

AI总结 提出LIT-GS框架,利用激光雷达平面几何约束联合优化位姿与高斯,解决光照变化和纹理缺失场景下RGB依赖的脆弱性问题,提升几何精度与渲染质量。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19908 2026-06-19 cs.CV 新提交 57%

Gaussian Process Prior Variational Autoencoder for Endoscopic Videos

用于内窥镜视频的高斯过程先验变分自编码器

Ivan De Boi, Xinxing Shi, Xiaoyu Jiang, Tim J. M. Jaspers, Francisco Caetano, Mauricio A. Alvarez, Fons van der Sommen, Sam Van der Jeught

机构 * Department of Electromechanics, InViLab, University of Antwerp(安特卫普大学机电工程系InViLab实验室) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Department of Electrical Engineering, Eindhoven University of Technology(埃因霍温理工大学电气工程系)

专题命中 Gaussian Splatting :3D reconstruction(abstract);分类 cs.CV

AI总结 提出高斯过程先验变分自编码器(GPVAE),通过时间高斯过程先验替代因子化先验,结合两种可扩展GP近似和镜面反射掩码,实现内窥镜视频缺失帧的插值与修复,在C3VDv2数据集上平均降低RMSE 21.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19609 2026-06-19 cs.HC cs.GR 新提交 57%

Building Drift: Documenting On-Site Construction Adaptations Across Material Lifecycles

建筑漂移:记录跨材料生命周期的现场施工适应

Ritik Batra, Martin Tamke, Tom Svilans, Jan Hüls, Amritansh Kwatra, Steven J. Jackson, Thijs Roumen, Mette Ramsgaard Thomsen

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.GR

AI总结 提出“建筑漂移”概念,通过案例研究建立分类法,并开发Pentimento工具,利用视频和3D高斯泼溅记录现场适应,促进再生材料循环利用。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19586 2026-06-19 cs.RO 新提交 57%

One Demo is Worth a Thousand Trajectories: Action-View Augmentation for Visuomotor Policies

一个演示胜过千条轨迹:用于视觉运动策略的动作-视角增强

Chuer Pan, Litian Liang, Dominik Bauer, Eric Cousineau, Benjamin Burchfiel, Siyuan Feng, Shuran Song

机构 * Stanford University(斯坦福大学) Columbia University(哥伦比亚大学) Toyota Research Institute(丰田研究所)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.RO

AI总结 提出一种数据增强框架,通过高斯泼溅和轨迹优化生成逼真的鱼眼图像序列和物理可行的动作轨迹,提升操作策略在场景变化和障碍物下的成功率。

Comments Project website: https://chuerpan.com/1001-demos.github.io/. Published at CoRL 2025

Journal ref Proceedings of The 9th Conference on Robot Learning, PMLR 305:3902-3914, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 3 篇

2606.20455 2026-06-19 cs.CV 新提交 79%

PCFootprint: A Large-Scale Dataset and Benchmark for Vectorized Building Footprint Extraction from Aerial LiDAR Point Clouds

PCFootprint:用于从航空LiDAR点云中提取矢量化建筑足迹的大规模数据集与基准

Haoyuan Shen, Kuihao Wang, Ruisheng Wang, Yujun Liu

机构 * School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出首个大规模航空激光扫描点云建筑足迹提取数据集PCFootprint,含33000个瓦片及跨域测试集,通过评估主流方法揭示复杂地理环境下的挑战。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19915 2026-06-19 cs.CV 新提交 70%

SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision

SpatialSV: 通过任务导向的视觉监督在多模态大语言模型中内化可解释的3D空间感知

Jiayu Tang, Yuchen Zhou, Chao Gou

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)

专题命中 点云 :3D reconstruction(abstract);point cloud(abstract);分类 cs.CV

AI总结 提出SpatialSV框架,通过任务导向的视觉监督将MLLM的2D特征提升为显式3D表示(深度图、相机姿态、点云),实现可解释的3D空间感知内化,无需外部工具,并在半监督设置中展现强泛化能力。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19767 2026-06-19 eess.IV cs.CV physics.med-ph 新提交 57%

Contour-Constrained Deformable Registration with Parameter Characterization for Head and Neck Surgical Guidance

面向头颈外科引导的带参数表征的轮廓约束可变形配准

Qingyun Yang, Jon S. Heiselman, Ayberk Acar, Morgan J. Ringel, Michael I. Miga, Matthieu Chabanas, Michael C. Topf, Jie Ying Wu

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出一种基于正则化Kelvinlet基函数的可变形配准框架,通过表面点云、基准标记和轮廓约束校正术后组织变形,在9例头颈标本上将配准误差从刚性配准的11.11mm降至5.62mm,降幅达49.41%。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 3D生成 1 篇

2606.20364 2026-06-19 cs.LG 新提交 71%

Judging to Improve: A De-biased VLM-as-3D-Judge Protocol for Single-Image 3D Generation

评判以改进:一种去偏的 VLM-as-3D-Judge 协议用于单图像 3D 生成

Ali Asaria, Tony Salomone, Deep Gandhi

机构 * Transformer Lab

专题命中 3D生成 :3D generation(title)

AI总结 本文提出一种去偏的跨模型 VLM-as-3D-Judge 协议,将评判者从排序扩展到优化,通过训练与评估评判者分离、位置偏差校正及修复三种失效模式,实现轻量级适应下与强基线的匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 1 篇

2606.19776 2026-06-19 cs.CV 新提交 70%

Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding

Occ-VLM: 面向室内场景理解的占用接地视觉语言模型

Jianing Li, Zhou Fang, Yijiang Liu, Li Du

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)

专题命中 空间理解 :3D vision(abstract);point cloud(abstract);分类 cs.CV

AI总结 提出Occ-VLM,仅用姿态RGB图像和单一2D视觉编码器,通过重建3D占用作为几何先验,实现统一的3D场景理解,在占用预测、3D VQA和密集描述任务上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. SLAM与定位 1 篇

2606.19874 2026-06-19 cs.RO cs.CV 新提交 82%

MMD-SLAM: Structure-Enhanced Multi-Meta Gaussian Distribution-Guided Visual SLAM

MMD-SLAM:结构增强的多元高斯分布引导视觉SLAM

Fan Zhu, Ziyu Chen, Peichen Liu, Yifan Zhao, Zhisong Xu, Hui Zhu, Hongxing Zhou, Sixun Liu, Chunmao Jiang

机构 * HFIPS, Chinese Academy of Sciences(中国科学院合肥物质科学研究院) University of Science and Technology of China(中国科学技术大学) Aarhus University(奥胡斯大学) University of Tokyo(东京大学) Beijing University of Chemical Technology(北京化工大学) North China Electric Power University(华北电力大学)

专题命中 SLAM与定位 :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV、cs.RO

AI总结 提出MMD-SLAM,利用亚特兰大世界假设引导多元高斯表示,通过点线融合、主导方向编码和高斯进化策略,提升视觉SLAM的跟踪精度与建图质量。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏