arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-03-30 至 2026-03-30 共收录 6 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6 篇

2502.00262 2026-03-30 cs.CV cs.AI 84%

INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation

洞察:通过基于视觉-语言模型的上下文感知危险检测与边缘案例评估提升自动驾驶安全性

Dianwei Chen, Zifan Zhang, Lei Cheng, Yuchen Liu, Xianfeng Terry Yang

机构 * University of Maryland(马里兰大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 感知 :autonomous driving(title,abstract);end-to-end driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出INSIGHT框架,通过多模态数据融合提升自动驾驶中危险检测和边缘案例评估的准确性和泛化能力,实验表明在BDD100K数据集上显著提高了危险预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26018 2026-03-30 cs.CV cs.RO 62%

GeoReFormer: Geometry-Aware Refinement for Lane Segment Detection and Topology Reasoning

GeoReFormer:基于几何的车道线段检测与拓扑推理 refinement

Danny Abraham, Nikhil Kamalkumar Advani, Arun Das, Nikil Dutt

机构 * University of California, Irvine(加州大学尔湾分校) Bosch North America(博世北美)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 GeoReFormer 提出一种统一的查询架构,通过嵌入几何和拓扑诱导偏差,提升车道线段检测和拓扑推理的精度与一致性,实现在 OpenLane-V2 上 34.5% 的 mAP 成绩。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16816 2026-03-30 cs.CV cs.DL 57%

WildDepth: A Multimodal Dataset for 3D Wildlife Perception and Depth Estimation

WildDepth:用于野生动物感知和深度估计的多模态数据集

Muhammad Aamir, Naoya Muramatsu, Sangyun Shin, Matthew Wijers, Jia-Xing Zhong, Xinyu Hou, Amir Patel, Andrew Loveridge, Andrew Markham

机构 * University of Oxford(牛津大学) University of Cape Town(开普敦大学) University College London(伦敦大学学院)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出WildDepth数据集,通过同步RGB和LiDAR数据提升动物深度估计和3D重建性能,实验表明多模态数据使深度可靠性提升10%RMSE,3D重建精度提高12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15812 2026-03-30 cs.CV 57%

ModTrack: Sensor-Agnostic Multi-View Tracking via Identity-Informed PHD Filtering with Covariance Propagation

ModTrack:通过身份感知的PHD滤波与协方差传播实现传感器无关的多视角跟踪

Aditya Iyer, Jack Roberts, Nora Ayanian

机构 * Brown University(布朗大学)

专题命中 感知 :BEV(abstract);分类 cs.CV

AI总结 ModTrack通过身份感知的PHD滤波与协方差传播实现多视角多目标跟踪,提供跨模态、传感器无关的泛化能力及可追溯的不确定性。系统将学习限制在检测和特征提取阶段,利用闭式分析方法进行融合、关联和跟踪,实现95.5 IDF1和91.4 MOTA的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26654 2026-03-30 physics.optics 50%

Silicon Photonic Beam Steerer Based on Metalens Focal Plane Array

基于金属透镜焦平面阵列的硅光束转向器

Chung-Yu Hsu, Ping-Yen Hsieh, Hsun-Sung Chiu, Li-Jun Tung, Chieh-Chih Yu, Ko-Chi Chen, Yu-Heng Hong, Hao-Chung Kuo, Chi-Wai Chow, You-Chia Chang

专题命中 感知 :LiDAR(abstract)

AI总结 本文提出一种集成光束转向器,利用金属透镜焦平面阵列实现芯片内光束连续调节,消除盲区并提升分辨率,适用于LiDAR和自由空间光通信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25793 2026-03-30 physics.data-an cs.LG hep-ex 50%

Vision Transformers and Graph Neural Networks for Charged Particle Tracking in the ATLAS Muon Spectrometer

基于视觉变换器和图神经网络的ATLAS缪子谱仪带电粒子跟踪

Jonathan Renusch

机构 * CERN(欧洲核子研究中心) Geneva, Switzerland(瑞士日内瓦)

专题命中 感知 :occupancy(abstract)

AI总结 本文提出利用图神经网络和视觉变换器提升ATLAS缪子谱仪的带电粒子识别效率,前者提升重建速度15%,后者实现超快速近似重建。

详情

展开后加载摘要…

URL PDF HTML 收藏