arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-07-02 至 2026-07-02 共收录 2 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 激光雷达 2 篇

2607.01079 2026-07-02 cs.RO 新提交 81%

Where Am I? Semantic Map Grounding via Vision-Language Models for Multi-Modal Localization

我在哪里?基于视觉-语言模型的语义地图定位用于多模态定位

Suraj Borate, Aarav Shah, Madhu Vadali

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校)

专题命中 激光雷达 :LiDAR(summary_cn,abstract);分类 cs.RO

AI总结 将机器人定位重构为语义推理任务,使用微调的Qwen2.5-VL-7B模型融合摄像头、LiDAR和语义地图预测位姿,在室内数据集上达到98.23%位置精度,并展现出跨模态互补性和对新场景的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00514 2026-07-02 cs.CV cs.AI 新提交 73%

Cross4D-JEPA: Dense Cross-modal Correspondence Distillation for 4D Point Cloud Representation Learning

Cross4D-JEPA: 用于4D点云表示学习的密集跨模态对应蒸馏

Trung Thanh Nguyen, Hai Nguyen-Truong, Tu Vo, Hoang M. Truong, Tuan-Anh Vu

机构 * Nagoya University(名古屋大学) Northeastern University(东北大学) KC Machine Learning Lab(KC机器学习实验室) University of Science, Vietnam National University Ho Chi Minh City(胡志明市越南国立大学理科大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 激光雷达 :LiDAR(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Cross4D-JEPA,通过教师-学生框架将冻结的2D基础模型(如DINOv2或V-JEPA 2)的密集补丁特征蒸馏到4D点编码器,实现每点对应和潜在空间匹配,在四个基准上优于模态内和全局跨模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏