arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-15 至 2026-05-15 共收录 5 信号源:cs.CV, cs.GR, cs.RO

1. 点云 5 篇

2602.00807 2026-05-15 cs.CV cs.RO 84%

Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds

Any3D-VLA:通过多样化点云增强VLA鲁棒性

Xianzhe Fan, Shengliang Deng, Xiaoyang Wu, Yuxiang Lu, Zhuoling Li, Mi Yan, Yujia Zhang, Zhizheng Zhang, He Wang, Hengshuang Zhao

机构 * School of Computing and Data Science, The University of Hong Kong, Hong Kong SAR, China(计算与数据科学学院,香港大学,香港特别行政区,中国) School of Computing(计算学院) Peking University, Beijing, China(北京大学,北京,中国)

专题命中 点云 :point cloud(title,abstract);spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 本文提出Any3D-VLA,通过整合点云与2D表示,提升VLA在复杂场景中的鲁棒性,解决3D数据稀缺和领域差距问题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15088 2026-05-15 cs.CV 79%

SAGE3D: Soft-guided attention and graph excitation for 3D point cloud corner detection

SAGE3D:基于软引导注意力和图激发的3D点云角点检测

Batuhan Arda Bekar, Can Sarı, Hüseyin Can Gülkan, Barış Özcan

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出SAGE3D模型,通过分层编码器-解码器架构实现多阶段点云角点检测,结合软引导注意力和图激发网络提升精度与召回率。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14950 2026-05-15 cs.CV cs.RO 73%

Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model

Evo-Depth:一种轻量化的深度增强视觉-语言-动作模型

Tao Lin, Yuxin Du, Jiting Liu, Nuobei Zhu, Yunhe Li, Yuqian Fu, Yinxinyu Chen, Hongyi Cai, Zewei Ye, Bing Cheng, Kai Ye, Yiran Mao, Yilei Zhong, MingKang Dong, Junchi Yan, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 大学科学与技术大学) Nanyang Technological University(南洋理工大学) SJTU-Quic Robot Joint Lab(上海交通大学-Quick 机器人联合实验室)

专题命中 点云 :point cloud(abstract);spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 本文提出Evo-Depth模型,通过轻量隐式深度编码模块和空间增强模块提升视觉-语言-动作任务中的空间感知能力,实现高效部署与高精度操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03532 2026-05-15 cs.CV 57%

OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation

OpenTrack3D: 向准确且通用的开放词汇3D实例分割迈进

Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出OpenTrack3D框架,通过在线构建跨视角一致的对象提案和多模态大语言模型提升开放词汇3D实例分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04499 2026-05-15 cs.CV 57%

FALO: Fast and Accurate LiDAR 3D Object Detection on Resource-Constrained Devices

FALO:在资源受限设备上快速且准确的激光雷达3D目标检测

Shizhong Han, Hsin-Pai Cheng, Hong Cai, Jihad Masri, Soyeb Nagori, Fatih Porikli

机构 * Qualcomm AI Research(高通AI研究)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出FALO,一种适用于资源受限设备的激光雷达3D目标检测方法,结合大核卷积、Hadamard乘积和线性层,实现高精度与快速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏