arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-07-02 至 2026-07-02 共收录 10 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 5 篇

2606.29963 2026-07-02 cs.CV cs.CR 版本更新 87%

Explainability-Aware Frustum Attack: Exposing Structural Vulnerabilities in LiDAR-Based 3D Object Detectors

可解释性感知的视锥攻击:揭示基于LiDAR的3D目标检测器中的结构脆弱性

Chengzeng You, Binbin Xu, Soteris Demetriou

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 感知 :LiDAR(title,title_cn);分类 cs.CV

AI总结 提出可解释性引导的对抗分析方法,通过SALL方法生成通用显著性图,并设计EFA攻击,仅扰动最关键的视锥区域,在KITTI和nuScenes上使检测召回率下降超15个百分点,同时减少25-50%的扰动视锥数。

Comments European Conference on Computer Vision (ECCV), September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06254 2026-07-02 cs.CV cs.RO eess.IV 版本更新 78%

NOVA: Next-step Open-Vocabulary Autoregression for 3D Multi-Object Tracking in Autonomous Driving

NOVA:自动驾驶中3D多目标跟踪的下一步开放词汇自回归

Kai Luo, Xu Wang, Rui Fan, Kailun Yang

机构 * College of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与运载工程学院) State Key Laboratory of Intelligent Autonomous Systems, Tongji University(同济大学智能自主系统国家重点实验室)

专题命中 感知 :autonomous driving(title);分类 cs.RO、cs.CV、eess.IV

AI总结 提出NOVA方法,通过自回归关联将3D多目标跟踪转化为轨迹条件时空语义序列完成,利用大语言模型实现开放词汇泛化,在nuScenes等数据集上显著提升新类别跟踪性能。

Comments Accepted to IROS 2026. Code will be available at https://github.com/xifen523/NOVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00654 2026-07-02 cs.CV 版本更新 77%

RC-GeoCP: Geometric Consensus for Radar-Camera Collaborative Perception

RC-GeoCP:雷达-相机协同感知的几何一致性

Xiaokai Bai, Lianqing Zheng, Runwei Guan, Siyuan Cao, Songkai Wang, Huiliang Shen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Automotive Studies, Tongji University(同济大学汽车学院) Thrust of Artificial Intelligence, Hong Kong University of Science and Technology(香港科技大学人工智能研究所)

专题命中 感知 :LiDAR(abstract,abstract_cn);BEV(abstract);分类 cs.CV

AI总结 提出首个4D雷达与相机协同感知框架RC-GeoCP,通过雷达锚定几何一致性解决深度模糊和空间分散导致的错位,实现高效通信与全局一致表示。

Comments 11 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11173 2026-07-02 cs.RO 版本更新 70%

Learning Category-level Last-meter Navigation from RGB Demonstrations of a Single-instance

从单实例RGB演示中学习类别级最后米导航

Tzu-Hsien Lee, Fidan Mahmudova, Karthik Desingh

机构 * University of Minnesota, Twin Cities(明尼苏达大学 Twin Cities 分校)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出面向对象的模仿学习框架,利用RGB观测实现四足移动机械臂在最后米阶段的精确导航,无需深度或地图先验,在类别级泛化中达到高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07254 2026-07-02 cs.CV cs.RO 版本更新 62%

Towards Accurate State Estimation: Motion Dynamics Kalman Filter for 3D Multi-Object Tracking

迈向精确状态估计:用于3D多目标跟踪的运动动力学卡尔曼滤波器

Mohamed Nagy, Naoufel Werghi, Bilal Hassan, Jorge Dias, Majid Khonji

机构 * Khalifa University(哈利法大学) New York University of Abu Dhabi(纽约大学阿布扎比分校)

专题命中 感知 :self-driving(abstract);分类 cs.RO、cs.CV

AI总结 提出运动动力学卡尔曼滤波器(MD-KF),通过将连续测量间运动变化建模为高斯分布并自适应调整加权运动模型,克服恒定运动假设,在保持模型单一性的同时提升遮挡和静止目标的状态估计精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 1 篇

2601.04453 2026-07-02 cs.CV 版本更新 83%

UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving

UniDrive-WM:面向自动驾驶的统一理解、规划和生成世界模型

Zhexiao Xiong, Xin Ye, Burhan Yaman, Sheng Cheng, Yiren Lu, Jingru Luo, Nathan Jacobs, Liu Ren

机构 * Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究院与博世人工智能中心) Washington University in St. Louis(圣路易斯华盛顿大学) Arizona State University(亚利桑那州立大学) Case Western Reserve University(凯斯西储大学)

专题命中 规划控制 :autonomous driving(title,abstract);trajectory planning(abstract);分类 cs.CV

AI总结 提出UniDrive-WM,一个基于VLM的统一世界模型,联合执行场景理解、轨迹规划和未来图像生成,在Bench2Drive上轨迹误差降低7.3%,碰撞率降低10.4%。

Comments Accepted to ECCV 2026. Project Page: https://unidrive-wm.github.io/UniDrive-WM

详情

展开后加载摘要…

URL PDF HTML 收藏

3. BEV与占用 2 篇

2603.08279 2026-07-02 cs.CV 版本更新 79%

OSCAR: Occupancy-based Shape Completion via Acoustic Neural Implicit Representations

OSCAR: 基于占用率的声学神经隐式表示形状补全

Magdalena Wysocki, Kadir Burak Buldu, Miruna-Alexandra Gafencu, Mohammad Farid Azampour, Nassir Navab

机构 * Chair for Computer Aided Medical Procedures (CAMP) Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序教席(CAMP)) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠人工智能卓越学校(relAI))

专题命中 BEV与占用 :occupancy(title,abstract);分类 cs.CV

AI总结 提出基于占用率的形状补全方法,利用声学神经隐式表示从部分超声观测中重建完整3D解剖结构,无需标签,在HD95指标上优于现有方法80%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18011 2026-07-02 cs.CV 版本更新 70%

RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

RoadBench: 在城市道路场景下对多模态大语言模型进行细粒度空间理解与推理的基准测试

Jun Zhang, Xin Zhang, Jie Feng, Long Chen, Junhui Wang, Zhicheng Liu, Depeng Jin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心) Zhongguancun Academy(中关村学院) Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 BEV与占用 :BEV(abstract,abstract_cn);分类 cs.CV

AI总结 针对城市复杂场景中多模态大语言模型在细粒度空间理解与推理能力上的不足,提出RoadBench基准,包含8个任务、3040个测试用例,通过鸟瞰图和第一人称视角图像评估模型性能,揭示现有模型在此类任务上的显著缺陷。

Comments Accepted by ECCV 2026, the code and data are publicly available at: https://github.com/tsinghua-fib-lab/RoadBench

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仿真评测 2 篇

2603.14354 2026-07-02 cs.LG cs.AI cs.RO 版本更新 81%

Deconfounded Lifelong Learning for Autonomous Driving via Dynamic Knowledge Spaces

通过动态知识空间实现自动驾驶的去混淆终身学习

Jiayuan Du, Yuebing Song, Yiming Zhao, Xianghui Pan, Jiawei Lian, Yuchu Lu, Liuyi Wang, Chengju Liu, Qijun Chen

机构 * Tongji University(同济大学)

专题命中 仿真评测 :autonomous driving(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出DeLL框架,结合DPMM与因果推理的front-door调整机制,构建动态知识空间以解决自动驾驶中的灾难性遗忘和知识迁移问题,并引入进化轨迹解码器提升规划能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04198 2026-07-02 cs.CV cs.RO 版本更新 62%

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA: 视频动作模型是零样本驱动器

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Michael Ying Yang, Francesco Nex, Hao Cheng

机构 * University of Twente(特温特大学) Xiaomi EV(小米电动汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。

Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏