arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-03-31 至 2026-03-31 共收录 45 信号源:cs.CV, cs.GR, cs.RO

1. 点云 16 篇

2603.28224 2026-03-31 cs.CV 57%

Ghost-FWL: A Large-Scale Full-Waveform LiDAR Dataset for Ghost Detection and Removal

Ghost-FWL: 一种大规模全波形激光雷达数据集用于鬼影检测与去除

Kazuma Ikeda, Ryosei Hara, Rokuto Nagata, Ozora Sako. Zihao Ding, Takahiro Kado, Ibuki Fujioka, Taro Beppu, Mariko Isogawa, Kentaro Yoshioka

机构 * Keio University(庆应义塾大学) Sony Semiconductor Solutions(索尼半导体解决方案)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出Ghost-FWL数据集,用于解决移动激光雷达中鬼影点的检测与去除问题,通过全波形激光雷达数据提升3D映射和定位精度,实验表明其在SLAM和目标检测任务中效果显著。

Comments Accepted to CVPR 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27969 2026-03-31 cs.CV 57%

Hg-I2P: Bridging Modalities for Generalizable Image-to-Point-Cloud Registration via Heterogeneous Graphs

Hg-I2P:通过异构图实现通用的图像到点云配准

Pei An, Junfeng Ding, Jiaqi Yang, Yulong Wang, Jie Ma, Liangliang Nan

机构 * Huazhong University of Science and Technology(华中科技大学) Northwestern Polytechnical University(西北工业大学) Huazhong Agricultural University(华中农业大学) Delft University of Technology(代尔夫特理工大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出Hg-I2P方法,通过异构图融合多模态特征,提升图像与点云配准的泛化能力和精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13689 2026-03-31 cs.CV 57%

LitePT: Lighter Yet Stronger Point Transformer

LitePT: 更轻更强大的点云变换器

Yuanwen Yue, Damien Robert, Jianyuan Wang, Sunghwan Hong, Jan Dirk Wegner, Christian Rupprecht, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) University of Oxford(牛津大学) University of Zurich(苏黎世大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出LitePT模型,通过在早期阶段使用卷积层,后期切换至注意力机制,减少参数并提升效率,同时在多个任务和数据集上表现优异。

Comments CVPR 2026, Project page: https://litept.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23227 2026-03-31 cs.CV 57%

PointCNN++: Performant Convolution on Native Points

PointCNN++: 针对原始点的高效卷积

Lihan Li, Haofeng Zhong, Rui Bu, Mingchao Sun, Wenzheng Chen, Baoquan Chen, Yangyan Li

机构 * Peking University(北京大学) Ant Group(蚂蚁集团) AMAP(高德地图)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 PointCNN++提出了一种新的架构设计,通过将稀疏卷积从体素扩展到点,解决了精度与性能之间的权衡问题,实现了高保真和高效3D学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27663 2026-03-31 cs.CV 57%

LiDAR for Crowd Management: Applications, Benefits, and Future Directions

激光雷达用于人群管理:应用、优势与未来方向

Abdullah Khanfor, Chaima Zaghouani, Hakim Ghazzai, Ahmad Alsharoa, Gianluca Setti

机构 * College of Computer Science and Information Systems, Najran University(纳吉兰大学计算机科学与信息系统学院) College of Innovation & Technology, University of Michigan-Flint(密歇根大学弗林特分校创新与技术学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文探讨了激光雷达在人群管理中的应用与优势,分析了其在隐私保护、恶劣天气适应性和三维建模方面的优势,并提出未来研究方向,包括数据集稀缺性、传感器融合与点云处理等。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27573 2026-03-31 cs.GR 57%

SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion

SPREAD:通过几何感知扩散进行空间-物理推理

Minzhang Li, Kuixiang Shao, Xuebing Li, Yuyang Jiao, Yinuo Bai, Hengan Zhou, Sixian Shen, Jiayuan Gu, Jingyi Yu

专题命中 点云 :point cloud(abstract);分类 cs.GR

AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23153 2026-03-31 cs.CV cs.AI 57%

Efficient Encoder-Free Fourier-based 3D Large Multimodal Model

高效无编码器的基于傅里叶的3D大多模态模型

Guofeng Mei, Wei Lin, Luigi Riz, Yujiao Wu, Yiming Wang, Fabio Poiesi

机构 * Fondazione Bruno Kessler, Italy(意大利布鲁诺·凯斯勒基金会) JKU Linz, Austria(奥地利林茨约翰·开普勒大学) CSIRO, Australia(澳大利亚联邦科学与工业研究组织)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出Fase3D,一种基于傅里叶变换的无编码器3D多模态模型,通过结构化超点和空间填充曲线实现高效全局上下文建模,显著提升计算效率和参数效率。

Journal ref CVPR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01349 2026-03-31 cs.LG stat.ML 50%

To Augment or Not to Augment? Diagnosing Distributional Symmetry Breaking

增强还是不增强?诊断分布对称性破坏

Hannah Lawrence, Elyssa Hofgard, Vasco Portilheiro, Yuxuan Chen, Tess Smidt, Robin Walters

机构 * MIT(麻省理工学院) University College London(伦敦大学学院) Northeastern University(东北大学)

专题命中 点云 :point cloud(abstract)

AI总结 本文提出了一种评估数据集对称性破坏的指标,揭示了点云数据集中的严重偏见问题,并展示了对称性破坏对模型性能的影响。

Comments Published as a conference paper at ICLR 2026. A short version of this paper appeared at the ICLR AI4Mat workshop in April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 空间理解 4 篇

2505.05800 2026-03-31 cs.RO cs.CV 62%

3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks

3D CAVLA:利用深度和3D上下文来泛化视觉语言动作模型以应对未见任务

Vineet Bhat, Yu-Hsiang Lan, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) New York University Courant Institute of Mathematical Sciences(纽约大学库朗数学科学研究所)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 本文提出3D-CAVLA框架,通过引入链式推理、深度感知和任务导向的感兴趣区域检测,提升视觉语言动作模型在未见任务中的泛化能力,实验表明其在模拟和现实任务中均表现出色。

Comments Accepted at the 1st Workshop on 3D LLM/VLA, CVPR 2025. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14498 2026-03-31 cs.RO cs.CV 62%

R3DP: Real-Time 3D-Aware Policy for Embodied Manipulation

R3DP:实时3D感知策略用于具身操作

Yuhao Zhang, Wanxi Dong, Yue Shi, Yi Liang, Jingnan Gao, Qiaochu Yang, Yaxing Lyu, Zhixuan Liang, Yibin Liu, Congsheng Xu, Xianda Guo, Wei Sui, Yaohui Jin, Xiaokang Yang, Yanyan Xu, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) D-Robotics(地平线机器人) Southern University of Science and Technology(南方科技大学) Xspark AI(星火科技) The University of Hong Kong(香港大学) Wuhan University(武汉大学) Xiamen University Malaysia(厦门大学马来西亚分校) Northeastern University(东北大学)

专题命中 空间理解 :3D vision(abstract);分类 cs.CV、cs.RO

AI总结 R3DP通过异步快慢协作模块整合大尺度3D先验知识,提升实时操作性能,实验显示在成功率和推理时间上均优于现有方法。

Comments Project Page: https://dazazh.github.io/r3dp-project-page/ Github Repo: https://github.com/dazazh/R3DP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27970 2026-03-31 cs.CV 57%

AffordMatcher: Affordance Learning in 3D Scenes from Visual Signifiers

AffordMatcher: 从视觉符号中学习3D场景中的 affordance

Nghia Vu, Tuong Do, Khang Nguyen, Baoru Huang, Nhat Le, Binh Xuan Nguyen, Erman Tjiputra, Quang D. Tran, Ravi Prakash, Te-Chuan Chiu, Anh Nguyen

机构 * University of Liverpool(利物浦大学) AIOZ Ltd.(AIOZ有限公司) National Tsing Hua University(国立清华大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Western Australia(西澳大学) Indian Institute of Science(印度科学理工学院) NVIDIA(英伟达)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 本文提出AffordMatcher,通过结合点云和图像实例,利用视觉符号实现更精确的affordance区域识别,基于大规模数据集验证了方法有效性。

Comments 14 pages. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27294 2026-03-31 cs.CV 57%

Class-Distribution Guided Active Learning for 3D Occupancy Prediction in Autonomous Driving

基于类分布的主动学习用于自动驾驶中的3D占用预测

Wonjune Kim, In-Jae Lee, Sihwan Hwang, Sanmin Kim, Dongsuk Kum

机构 * KAIST(韩国科学技术院) Seoul National University(首尔大学) Kookmin University(国民大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出一种基于类分布的主动学习框架,通过三种互补标准选择训练样本,以解决自动驾驶中3D占用预测的类别不平衡和标注成本问题,实现在仅42.4%标注数据下达到26.62 mIoU的性能。

Comments IEEE RA-L 2026

Journal ref IEEE Robotics and Automation Letters (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. SLAM与定位 2 篇

2603.26810 2026-03-31 cs.CV eess.IV 70%

Unblur-SLAM: Dense Neural SLAM for Blurry Inputs

Unblur-SLAM:用于模糊输入的密集神经SLAM

Qi Zhang, Denis Rozumny, Francesco Girlanda, Sezer Karaoglu, Marc Pollefeys, Theo Gevers, Martin R. Oswald

机构 * University of Amsterdam(阿姆斯特丹大学) Meta Reality Labs(Meta现实实验室) ETH Zürich(苏黎世联邦理工学院)

专题命中 SLAM与定位 :3DGS(abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出Unblur-SLAM,一种针对模糊图像输入的RGB SLAM pipeline,能够处理多种模糊类型,在运动模糊和失焦模糊情况下表现出最佳性能,通过调整计算量和多视图优化提升重建效果。

Comments 14 pages, 9 figures (based on the document's total length and the final Figure 9 ). Accepted By CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27533 2026-03-31 cs.CV cs.AI 57%

Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation

Demo-Pose: 深度-单目模态融合用于物体姿态估计

Rachit Agarwal, Abhishek Joshi, Sathish Chalasani, Woo Jin Kim

机构 * Samsung Electronics Suwon, Republic of Korea(三星电子水原,韩国)

专题命中 SLAM与定位 :3D vision(abstract);分类 cs.CV

AI总结 本文提出Demo-Pose,通过新颖的多模态融合策略融合单目语义特征与基于深度的图卷积表示,提升物体姿态估计的几何推理能力,在REAL275数据集上优于现有方法。

Comments Accepted at ICASSP 2026, 5 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他3D视觉 1 篇

2511.17209 2026-03-31 cs.CV 57%

Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

基于体素CT的自监督与跨模态预训练的扩展

Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) ARIA Lab(ARIA实验室) AIMS Lab(AIMS实验室)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 SPECTRE通过可扩展的3D视觉Transformer架构和现代自监督与视觉-语言预训练策略,学习通用CT表示,克服了体素CT的极端标记扩展、几何各向异性及临床监督弱的问题,实现了大规模3D注意力计算。

详情

展开后加载摘要…

URL PDF HTML 收藏