arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-03-11 至 2026-03-11 共收录 8 信号源:cs.CV, cs.GR, cs.RO

1. 点云 8 篇

2603.09826 2026-03-11 cs.CV 79%

VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models

基于视觉-语言模型的点云地图定位

Shuhao Kang, Youqi Liao, Peijie Wang, Wenlong Liao, Qilin Zhang, Benjamin Busam, Xieyuanli Chen, Yun Liu

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 VLM-Loc通过视觉-语言模型的空间推理能力,实现了更准确的文本到点云定位,提升了复杂环境中的定位鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09173 2026-03-11 cs.CV 79%

Point Cloud as a Foreign Language for Multi-modal Large Language Model

点云作为多模态大语言模型的外语

Sneha Paul, Zachary Patterson, Nizar Bouguila

机构 * Concordia University(康科迪亚大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 SAGE是首个端到端3D多模态大语言模型,通过轻量级3D分词器直接处理点云,提升3D任务的推理能力与鲁棒性。

Comments Accepted in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25268 2026-03-11 cs.RO cs.AI cs.CV 62%

SynHLMA:Synthesizing Hand Language Manipulation for Articulated Object with Discrete Human Object Interaction Representation

SynHLMA:基于离散人类物体交互表示的合成手语操纵

Wang zhi, Yuyan Liu, Liu Liu, Li Zhang, Ruixuan Lu, Dan Guo

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 SynHLMA通过离散人类物体交互表示生成可变形物体的手语操纵序列,实现抓取生成、预测和插值任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09035 2026-03-11 cs.CV cs.LG cs.RO 62%

Exploring Single Domain Generalization of LiDAR-based Semantic Segmentation under Imperfect Labels

探索基于LiDAR的语义分割在不完美标签下的单域泛化

Weitong Kong, Zichao Zeng, Di Wen, Jiale Wei, Kunyu Peng, June Moh Goo, Jan Boehm, Rainer Stiefelhagen

机构 * Institute for Anthropomatics and Robotics, Karlsruhe Institute of Technology(自动化与机器人研究所,卡尔斯鲁厄技术大学) Department of Civil, Environmental and Geomatic Engineering, University College London(土木、环境与地理工程系,伦敦大学学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出DuNe框架,通过双视图和置信度感知过滤,实现基于LiDAR的语义分割在噪声标签下的域泛化,取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09415 2026-03-11 cs.RO cs.AI 57%

From Flow to One Step: Real-Time Multi-Modal Trajectory Policies via Implicit Maximum Likelihood Estimation-based Distribution Distillation

从流到一步:通过隐式最大似然估计基于的分布蒸馏实现实时多模轨迹策略

Ju Dong, Liding Zhang, Lei Zhang, Yu Fu, Kaixin Bai, Zoltan-Csaba Marton, Zhenshan Bing, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院TAMS(多模态系统技术方面)) Technical University of Munich(慕尼黑技术大学) Agile Robots SE(敏捷机器人公司)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 通过隐式最大似然估计基于的分布蒸馏,实现实时多模轨迹策略,提升机器人操作的高频闭环控制与鲁棒性。

Comments https://sites.google.com/view/flow2one, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09320 2026-03-11 cs.CV cs.AI 57%

SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation

SpaceSense-Bench: 一个大规模多模态基准用于航天器感知与姿态估计

Aodi Wu, Jianhong Zuo, Zeyuan Zhao, Xubo Luo, Ruisuo Wang, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 SpaceSense-Bench通过大规模多模态数据集提升航天器感知与姿态估计的鲁棒性与准确性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00124 2026-03-11 cs.CV cs.AI 57%

OrthoAI: A Neurosymbolic Framework for Evidence-Grounded Biomechanical Reasoning in Clear Aligner Orthodontics

OrthoAI:一个用于清晰矫治器正畸的神经符号框架,用于基于证据的生物力学推理

Edouard Lansiaux, Margaux Leman, Mehdi Ammi

机构 * STaR-AI, Emergency Department, Lille University Hospital(STaR-AI急诊部,利尔大学医院) Artificial Intelligence and Data Semantics Laboratory, Paris 8 University(人工智能与数据语义实验室,巴黎第八大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 OrthOAI通过神经符号框架实现基于证据的生物力学推理,提升清晰矫治器正畸的自动化决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18451 2026-03-11 quant-ph eess.IV 50%

Rydberg Vision via frugal Quantum Image Fingerprinting

通过廉价量子图像指纹进行原子跃迁视觉

Vikrant Sharma, Neel Kanth Kundu

专题命中 点云 :point cloud(abstract)

AI总结 通过廉价量子图像指纹技术,在中性原子模拟量子计算机上实现图像匹配与机器学习。

Comments 13 pages, 9 figures. In comparison to the version 1, we have changed the classical image matching step "Chamfer Distance" with quantum native "Correlations+Structure Factor" approach. We have also used this approach in a proof-of-concept QRC experiment in this version 2 paper

详情

展开后加载摘要…

URL PDF HTML 收藏