arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-03-11 至 2026-03-11 共收录 24 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2603.09319 2026-03-11 cs.RO cs.CV 81%

NLiPsCalib: An Efficient Calibration Framework for High-Fidelity 3D Reconstruction of Curved Visuotactile Sensors

NLiPsCalib:一种高效的高保真3D重建弯曲视觉触觉传感器校准框架

Xuhao Qin, Feiyu Zhao, Yatao Leng, Runze Hu, Chenxi Xiao

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV、cs.RO

AI总结 NLiPsCalib通过可控光源和近光光度立体技术,实现高效且高保真的弯曲视觉触觉传感器3D重建与校准,降低定制开发门槛。

Comments 8 pages, 8 figures, accepted to 2026 IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09925 2026-03-11 cs.CV cs.GR 62%

On the Structural Failure of Chamfer Distance in 3D Shape Optimization

关于3D形状优化中法线距离结构失效的分析

Chang-Yong Song, David Hyde

机构 * Vanderbilt University(范德比大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV、cs.GR

AI总结 本文揭示了3D形状优化中法线距离优化的结构性失效问题,提出通过全局耦合抑制坍塌的方法,显著提升了复杂拓扑结构的优化效果。

Comments 27 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09259 2026-03-11 cs.CV cs.RO 62%

Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos

从网络视频中隐式几何表示的视觉-语言导航

Mingfei Han, Haihong Hao, Liang Ma, Kamila Zhumakhanova, Ekaterina Radionova, Jingyi Zhang, Xiaojun Chang, Xiaodan Liang, Ivan Laptev

机构 * Department of Computer Vision, Mohamed Bin Zayed University of Artificial Intelligence(计算机视觉系,Mohamed Bin Zayed人工智能大学) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 本研究提出基于网络视频的隐式几何表示方法,用于视觉-语言导航,通过提升数据利用率和鲁棒性,实现更广泛的应用。

Comments Extension of CVPR 2025 RoomTour3D with implicit geometric representations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09774 2026-03-11 cs.AI 50%

World2Mind: Cognition Toolkit for Allocentric Spatial Reasoning in Foundation Models

World2Mind: 用于基础模型的方位认知工具包

Shouwei Ruan, Bin Wang, Zhenyu Wu, Qihui Zhu, Yuxiang Zhang, Hang Su, Yubin Wang

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学人工智能院计算机科学与技术系、清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学)

专题命中 三维重建 :3D reconstruction(abstract)

AI总结 World2Mind通过构建空间认知地图和三阶段推理链,提升基础模型的空间推理能力,使纯文本模型也能实现复杂3D空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 10 篇

2412.18380 2026-03-11 cs.CV cs.GR 90%

ARSGaussian: 3D Gaussian Splatting with LiDAR for Aerial Remote Sensing Novel View Synthesis

ARSGaussian:基于LiDAR的3D高斯点分布用于航空遥感新视角合成

Yiling Yao, Bing Zhang, Wenjuan Zhang, Lianru Gao, Dailiang Peng, Bocheng Li, Yaning Wang, Bowen Wang

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);novel view synthesis(title,abstract);point cloud(abstract);分类 cs.CV、cs.GR

AI总结 ARSGaussian通过整合LiDAR点云约束,改进3D高斯点分布方法,解决航空遥感中视角合成的漂浮物和过度生长问题,提升几何估计精度。

Comments This is the author's version of a work that was accepted for publication in [ISPRS]. Changes resulting from the publishing process... may not be reflected in this document

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing,Volume 231,2026,Pages 288-306,ISSN 0924-2716,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09673 2026-03-11 cs.CV 85%

VarSplat: Uncertainty-aware 3D Gaussian Splatting for Robust RGB-D SLAM

VarSplat: 一种具有不确定性的3D高斯点划法用于鲁棒的RGB-D SLAM

Anh Thuan Tran, Jana Kosecka

机构 * Department of Computer Science(计算机科学系)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 VarSplat通过显式学习每个点划的外观方差,提升RGB-D SLAM的鲁棒性和稳定性,实现更可靠的跟踪与建图。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09968 2026-03-11 cs.CV 83%

ReCoSplat: Autoregressive Feed-Forward Gaussian Splatting Using Render-and-Compare

ReCoSplat: 基于渲染与比较的自回归前馈高斯点云生成

Freeman Cheng, Botao Ye, Xueting Li, Junqi You, Fangneng Zhan, Ming-Hsuan Yang

机构 * University of California Merced(加州大学默塞德分校) ETH Zurich(苏黎世联邦理工学院) NVIDIA Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 ReCoSplat通过引入渲染与比较模块,解决高斯点云生成中姿态误差问题,实现高效稳定的视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09718 2026-03-11 cs.CV 83%

GSStream: 3D Gaussian Splatting based Volumetric Scene Streaming System

GSStream: 基于3D高斯点云的体积分流系统

Zhiye Tang, Qiudan Zhang, Lei Zhang, Junhui Hou, You Yang, Xu Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);分类 cs.CV

AI总结 GSStream通过协作视口预测和深度强化学习比特率适应,实现高效的3D高斯点云体积分流交付。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09703 2026-03-11 cs.CV 83%

ProGS: Towards Progressive Coding for 3D Gaussian Splatting

ProGS:迈向3D高斯散射的渐进编码

Zhiye Tang, Lingzhuo Liu, Shengjie Jiao, Qiudan Zhang, Junhui Hou, You Yang, Xu Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);分类 cs.CV

AI总结 ProGS通过八叉树结构实现3D高斯散射的高效渐进编码,显著提升压缩效率和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09291 2026-03-11 cs.CV cs.AI 83%

DenoiseSplat: Feed-Forward Gaussian Splatting for Noisy 3D Scene Reconstruction

DenoiseSplat: 用于噪声3D场景重建的前馈高斯点散布

Fuzhen Jiang, Zhuoran Li, Yinlin Zhang

机构 * Hangzhou Dianzi University(杭州电子科技大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);NeRF(abstract);分类 cs.CV

AI总结 DenoiseSplat通过前馈高斯点散布方法,在噪声多视图图像中实现更准确的3D场景重建,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04859 2026-03-11 cs.CV 83%

CoRe-GS: Coarse-to-Refined Gaussian Splatting with Semantic Object Focus

CoRe-GS:基于语义对象聚焦的粗到细 Gaussian Splatting

Hannah Schieber, Dominik Frischmann, Victor Schaack, Simon Boche, Angela Schoellig, Stefan Leutenegger, Daniel Roth

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 CoRe-GS通过任务驱动的语义对象聚焦优化,实现高效且高质量的3D场景重建,适用于机器人应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08983 2026-03-11 cs.RO cs.CV 81%

SurgCalib: Gaussian Splatting-Based Hand-Eye Calibration for Robot-Assisted Minimally Invasive Surgery

SurgCalib: 基于高斯点散的机器人辅助微创手术手眼标定

Zijian Wu, Shuojue Yang, Yu Chung Lee, Eitan Prisman, Yueming Jin, Septimiu E. Salcudean

机构 * Robotics and Control Laboratory, University of British Columbia(机器人与控制实验室,不列颠哥伦比亚大学) Department of Biomedical Engineering, National University of Singapore(生物医学工程系,新加坡国立大学) Division of Otolaryngology – Head and Neck Surgery, University of British Columbia(耳鼻喉科–头颈外科部,不列颠哥伦比亚大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV、cs.RO

AI总结 SurgCalib通过基于高斯点散的无标记方法实现手术机器人手眼标定,提升手术精度与无菌环境合规性。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09277 2026-03-11 cs.CV 77%

Speeding Up the Learning of 3D Gaussians with Much Shorter Gaussian Lists

用更短的高斯列表加速3D高斯学习

Jiaqi Liu, Zhizhong Han

机构 * Machine Perception Lab, Wayne State University(机器感知实验室,韦恩州立大学)

专题命中 Gaussian Splatting :NeRF(abstract);Gaussian Splatting(abstract);3DGS(abstract);分类 cs.CV

AI总结 通过缩短高斯列表提升3D高斯学习效率,采用尺度重置和熵约束优化渲染效率。

Comments Accepted to CVPR 2026. Project page: https://github.com/MachinePerceptionLab/ShorterSplatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01949 2026-03-11 cs.CV cs.AI cs.GR 73%

LAYOUTDREAMER: Physics-guided Layout for Text-to-3D Compositional Scene Generation

LAYOUTDREAMER:基于物理的布局用于文本到3D组合场景生成

Yang Zhou, Zongjin He, Qixuan Li, Chao Wang

机构 * ShangHai University(上海大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);3DGS(abstract);分类 cs.CV、cs.GR

AI总结 LayoutDreamer通过结合3D高斯点云和物理引导,实现了高质量的文本到3D组合场景生成,提升了场景的真实性和可控性。

Journal ref Pattern Recognition, Volume 178, 2026, 113427

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 8 篇

2603.09826 2026-03-11 cs.CV 79%

VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models

基于视觉-语言模型的点云地图定位

Shuhao Kang, Youqi Liao, Peijie Wang, Wenlong Liao, Qilin Zhang, Benjamin Busam, Xieyuanli Chen, Yun Liu

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 VLM-Loc通过视觉-语言模型的空间推理能力,实现了更准确的文本到点云定位,提升了复杂环境中的定位鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09173 2026-03-11 cs.CV 79%

Point Cloud as a Foreign Language for Multi-modal Large Language Model

点云作为多模态大语言模型的外语

Sneha Paul, Zachary Patterson, Nizar Bouguila

机构 * Concordia University(康科迪亚大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 SAGE是首个端到端3D多模态大语言模型,通过轻量级3D分词器直接处理点云,提升3D任务的推理能力与鲁棒性。

Comments Accepted in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25268 2026-03-11 cs.RO cs.AI cs.CV 62%

SynHLMA:Synthesizing Hand Language Manipulation for Articulated Object with Discrete Human Object Interaction Representation

SynHLMA:基于离散人类物体交互表示的合成手语操纵

Wang zhi, Yuyan Liu, Liu Liu, Li Zhang, Ruixuan Lu, Dan Guo

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 SynHLMA通过离散人类物体交互表示生成可变形物体的手语操纵序列,实现抓取生成、预测和插值任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09035 2026-03-11 cs.CV cs.LG cs.RO 62%

Exploring Single Domain Generalization of LiDAR-based Semantic Segmentation under Imperfect Labels

探索基于LiDAR的语义分割在不完美标签下的单域泛化

Weitong Kong, Zichao Zeng, Di Wen, Jiale Wei, Kunyu Peng, June Moh Goo, Jan Boehm, Rainer Stiefelhagen

机构 * Institute for Anthropomatics and Robotics, Karlsruhe Institute of Technology(自动化与机器人研究所,卡尔斯鲁厄技术大学) Department of Civil, Environmental and Geomatic Engineering, University College London(土木、环境与地理工程系,伦敦大学学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出DuNe框架,通过双视图和置信度感知过滤,实现基于LiDAR的语义分割在噪声标签下的域泛化,取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09415 2026-03-11 cs.RO cs.AI 57%

From Flow to One Step: Real-Time Multi-Modal Trajectory Policies via Implicit Maximum Likelihood Estimation-based Distribution Distillation

从流到一步:通过隐式最大似然估计基于的分布蒸馏实现实时多模轨迹策略

Ju Dong, Liding Zhang, Lei Zhang, Yu Fu, Kaixin Bai, Zoltan-Csaba Marton, Zhenshan Bing, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院TAMS(多模态系统技术方面)) Technical University of Munich(慕尼黑技术大学) Agile Robots SE(敏捷机器人公司)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 通过隐式最大似然估计基于的分布蒸馏,实现实时多模轨迹策略,提升机器人操作的高频闭环控制与鲁棒性。

Comments https://sites.google.com/view/flow2one, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09320 2026-03-11 cs.CV cs.AI 57%

SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation

SpaceSense-Bench: 一个大规模多模态基准用于航天器感知与姿态估计

Aodi Wu, Jianhong Zuo, Zeyuan Zhao, Xubo Luo, Ruisuo Wang, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 SpaceSense-Bench通过大规模多模态数据集提升航天器感知与姿态估计的鲁棒性与准确性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00124 2026-03-11 cs.CV cs.AI 57%

OrthoAI: A Neurosymbolic Framework for Evidence-Grounded Biomechanical Reasoning in Clear Aligner Orthodontics

OrthoAI:一个用于清晰矫治器正畸的神经符号框架,用于基于证据的生物力学推理

Edouard Lansiaux, Margaux Leman, Mehdi Ammi

机构 * STaR-AI, Emergency Department, Lille University Hospital(STaR-AI急诊部,利尔大学医院) Artificial Intelligence and Data Semantics Laboratory, Paris 8 University(人工智能与数据语义实验室,巴黎第八大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 OrthOAI通过神经符号框架实现基于证据的生物力学推理,提升清晰矫治器正畸的自动化决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18451 2026-03-11 quant-ph eess.IV 50%

Rydberg Vision via frugal Quantum Image Fingerprinting

通过廉价量子图像指纹进行原子跃迁视觉

Vikrant Sharma, Neel Kanth Kundu

专题命中 点云 :point cloud(abstract)

AI总结 通过廉价量子图像指纹技术,在中性原子模拟量子计算机上实现图像匹配与机器学习。

Comments 13 pages, 9 figures. In comparison to the version 1, we have changed the classical image matching step "Chamfer Distance" with quantum native "Correlations+Structure Factor" approach. We have also used this approach in a proof-of-concept QRC experiment in this version 2 paper

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 2 篇

2411.13862 2026-03-11 eess.IV cs.CV cs.RO 81%

Image Compression Using Novel View Synthesis Priors

利用新颖视角合成先验的图像压缩

Luyuan Peng, Mandar Chitre, Hari Vishnu, Yuen Min Too, Bharath Kalyan, Rajat Mishra, Soo Pieng Tan

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV、cs.RO

AI总结 本文提出了一种基于新颖视角合成先验的图像压缩方法,通过优化潜在表示提升压缩比和图像质量,适用于无缆遥控车辆的实时视觉反馈需求。

Comments Preprint submitted to IEEE Journal of Oceanic Engineering (v2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09819 2026-03-11 cs.CV 70%

ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation

ConfCtrl: 通过置信度感知插值实现视频扩散中的精确相机控制

Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Yang Bai, Chi Zhang, Ziyuan Liu, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 新视角合成 :point cloud(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 ConfCtrl通过置信度感知插值实现视频扩散中的精确相机控制,解决大视角变化下新视角生成问题,提升几何一致性与视觉合理性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏