arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-05-21 至 2026-05-21 共收录 8 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 8 篇

2605.20390 2026-05-21 cs.CV cs.AI cs.LG cs.RO 88%

STELLAR: Scaling 3D Perception Large Models for Autonomous Driving

STELLAR: 为自动驾驶扩展3D感知大模型

Yingwei Li, Xin Huang, Yang Liu, Yang Fu, Alex Zihao Zhu, Chen Song, Junwen Yao, Anant Subramanian, Hao Xiang, Weijing Shi, Yuliang Zou, Tom Hoddes, Zhaoqi Leng, Govind Thattai, Dragomir Anguelov, Mingxing Tan

机构 * Waymo UCSD(加州大学圣地亚哥分校)

专题命中 感知 :autonomous driving(title,abstract);LiDAR(abstract,abstract_cn);driving perception(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文研究了大规模训练在自动驾驶感知系统中的应用,通过扩展输入模态并训练大规模模型,实现了在Waymo数据集上的新状态-of-the-art性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21309 2026-05-21 cs.CV cs.RO 79%

Hyper-V2X: Hypernetworks for Estimating Epistemic and Aleatoric Uncertainty in Cooperative Bird's-Eye-View Semantic Segmentation

Hyper-V2X: 基于超网络的协作鸟瞰图语义分割中epistemic和aleatoric不确定性的估计

Abhishek Dinkar Jagtap, Sanath Tiptur Sadashivaiah, Andreas Festag

机构 * CARISSMA Institute for Electric, COnnected, and Secure Mobility (C-ECOS), Technische Hochschule Ingolstadt(CARISSMA电动、连接与安全移动研究所(C-ECOS)、因戈尔施塔特技术大学) University of Applied Sciences Aschaffenburg(阿施发堡应用科学大学)

专题命中 感知 :BEV(abstract,abstract_cn);autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Hyper-V2X框架,通过超网络估计协作V2X感知中的epistemic和aleatoric不确定性,采用部分权重生成方案和V2X上下文嵌入模块,条件化贝叶斯超网络生成随机鸟瞰图分割的权重分布,提升感知可靠性。

Comments Accepted for IEEE Intelligent Vehicle Symposium (IV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21112 2026-05-21 cs.CV 77%

RCGDet3D: Rethinking 4D Radar-Camera Fusion-based 3D Object Detection with Enhanced Radar Feature Encoding

RCGDet3D: 重新思考基于增强雷达特征编码的4D雷达-相机融合3D目标检测

Weiyi Xiong, Bing Zhu

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)

专题命中 感知 :BEV(abstract,abstract_cn);autonomous driving(abstract);分类 cs.CV

AI总结 本文提出RCGDet3D,通过增强雷达特征编码而非复杂的多模态融合策略,实现了在3D目标检测中更高的准确性和实时性,为实时部署设定了新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21308 2026-05-21 cs.CV cs.AI 73%

Deformba: Vision State Space Model with Adaptive State Fusion

Deformba:具有自适应状态融合的视觉状态空间模型

Hongyu Ke, Jack Morris, Yongkang Liu, Satoshi Kitai, Kentaro Oguchi, Yi Ding, Haoxin Wang

机构 * Department of Computer Science, Georgia State University(佐治亚州立大学计算机科学系) University of Tennessee Knoxville(田纳西大学肯纳邦克分校)

专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出Deformba,一种能够动态增强空间结构信息并保持状态空间模型线性复杂度的自适应方法,通过多模态融合(如交叉注意力)提升视觉任务的性能,展示了在2D和3D视觉任务中的广泛适用性。

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18034 2026-05-21 cs.CV cs.AI cs.RO 67%

Can VLMs Unlock Semantic Anomaly Detection? A Framework for Structured Reasoning

VLMs能否解锁语义异常检测?一个结构化推理的框架

Roberto Brusnicki, David Pop, Yuan Gao, Mattia Piccinini, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems TUM School of Engineering Design, Technical University of Munich Munich, Germany

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出SAVANT框架,通过结构化推理方法提升VLM在语义异常检测中的性能,实现对自动驾驶场景中罕见异常情况的更准确识别。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20666 2026-05-21 cs.RO 57%

A Semantic and Occlusion-Aware GM-PHD Filter

一种语义和遮挡感知的GM-PHD滤波器

Jovan Menezes, Mark Campbell

机构 * Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学机械与航空航天工程系)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出了一种包含从深度学习中提取的语义信息的新出生模型,以创建一种遮挡感知的高斯混合概率假说密度(GM-PHD)滤波器。与以往依赖简单或统一假设的方法不同,所提出的语义-遮挡感知(S-OA)出生模型通过显式考虑遮挡区域并利用环境的语义信息来定义初始化项。这使滤波器能够准确表示新物体更可能出现的位置,从而在复杂和高密度的驾驶场景中提高跟踪性能。该方法通过蒙特卡洛模拟和KITTI数据集的实验进行评估。性能通过测量首次检测与跟踪初始化之间的延迟、平均绝对数量误差以及最优子模式分配(OSPA)度量来评估。结果表明,S-OA出生模型在遮挡密集的环境中减少了初始化延迟,在约70%的情况下匹配或优于最强基线。还提供了出生模型权重的敏感性分析。总体而言,研究结果强调了在自动驾驶中将遮挡推理和语义先验整合到贝叶斯跟踪框架中的优势。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06750 2026-05-21 cs.CV 57%

How Well Do Vision-Language Models Understand Sequential Driving Scenes? A Sensitivity Study

视觉-语言模型对连续驾驶场景的理解有多好?一项敏感性研究

Roberto Brusnicki, Mattia Piccinini, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems(自动驾驶系统教授职位) TUM School of Engineering and Design(技术大学慕尼黑工程与设计学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文通过系统分析视觉-语言模型(VLMs)在连续驾驶场景中的表现,揭示了输入配置对模型性能的影响,发现即使顶级模型在连续驾驶场景中的准确率仅为57%,远低于人类在相似约束下的65%,并暴露了VLMs在理解车辆动态和时间关系上的显著差距。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20241 2026-05-21 cs.LG cs.AI cs.CL 57%

Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry

Geometry-Lite: 通过层间边际几何进行可解释的安全探测

Woo Seob Sim, Yu Rang Park

机构 * Yonsei University(延世大学) Yonsei University College of Medicine(延世大学医学院) Department Biomedical Systems Informatics(生物医学系统信息学部门)

专题命中 感知 :occupancy(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在提示级别上的安全探测问题,提出了一种名为Geometry-Lite的紧凑探测器,通过层间边际几何分析来提高安全检测的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏