arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-03-30 至 2026-03-30 共收录 25 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6 篇

2502.00262 2026-03-30 cs.CV cs.AI 84%

INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation

洞察:通过基于视觉-语言模型的上下文感知危险检测与边缘案例评估提升自动驾驶安全性

Dianwei Chen, Zifan Zhang, Lei Cheng, Yuchen Liu, Xianfeng Terry Yang

机构 * University of Maryland(马里兰大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 感知 :autonomous driving(title,abstract);end-to-end driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出INSIGHT框架,通过多模态数据融合提升自动驾驶中危险检测和边缘案例评估的准确性和泛化能力,实验表明在BDD100K数据集上显著提高了危险预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26018 2026-03-30 cs.CV cs.RO 62%

GeoReFormer: Geometry-Aware Refinement for Lane Segment Detection and Topology Reasoning

GeoReFormer:基于几何的车道线段检测与拓扑推理 refinement

Danny Abraham, Nikhil Kamalkumar Advani, Arun Das, Nikil Dutt

机构 * University of California, Irvine(加州大学尔湾分校) Bosch North America(博世北美)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 GeoReFormer 提出一种统一的查询架构,通过嵌入几何和拓扑诱导偏差,提升车道线段检测和拓扑推理的精度与一致性,实现在 OpenLane-V2 上 34.5% 的 mAP 成绩。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16816 2026-03-30 cs.CV cs.DL 57%

WildDepth: A Multimodal Dataset for 3D Wildlife Perception and Depth Estimation

WildDepth:用于野生动物感知和深度估计的多模态数据集

Muhammad Aamir, Naoya Muramatsu, Sangyun Shin, Matthew Wijers, Jia-Xing Zhong, Xinyu Hou, Amir Patel, Andrew Loveridge, Andrew Markham

机构 * University of Oxford(牛津大学) University of Cape Town(开普敦大学) University College London(伦敦大学学院)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出WildDepth数据集,通过同步RGB和LiDAR数据提升动物深度估计和3D重建性能,实验表明多模态数据使深度可靠性提升10%RMSE,3D重建精度提高12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15812 2026-03-30 cs.CV 57%

ModTrack: Sensor-Agnostic Multi-View Tracking via Identity-Informed PHD Filtering with Covariance Propagation

ModTrack:通过身份感知的PHD滤波与协方差传播实现传感器无关的多视角跟踪

Aditya Iyer, Jack Roberts, Nora Ayanian

机构 * Brown University(布朗大学)

专题命中 感知 :BEV(abstract);分类 cs.CV

AI总结 ModTrack通过身份感知的PHD滤波与协方差传播实现多视角多目标跟踪,提供跨模态、传感器无关的泛化能力及可追溯的不确定性。系统将学习限制在检测和特征提取阶段,利用闭式分析方法进行融合、关联和跟踪,实现95.5 IDF1和91.4 MOTA的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26654 2026-03-30 physics.optics 50%

Silicon Photonic Beam Steerer Based on Metalens Focal Plane Array

基于金属透镜焦平面阵列的硅光束转向器

Chung-Yu Hsu, Ping-Yen Hsieh, Hsun-Sung Chiu, Li-Jun Tung, Chieh-Chih Yu, Ko-Chi Chen, Yu-Heng Hong, Hao-Chung Kuo, Chi-Wai Chow, You-Chia Chang

专题命中 感知 :LiDAR(abstract)

AI总结 本文提出一种集成光束转向器,利用金属透镜焦平面阵列实现芯片内光束连续调节,消除盲区并提升分辨率,适用于LiDAR和自由空间光通信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25793 2026-03-30 physics.data-an cs.LG hep-ex 50%

Vision Transformers and Graph Neural Networks for Charged Particle Tracking in the ATLAS Muon Spectrometer

基于视觉变换器和图神经网络的ATLAS缪子谱仪带电粒子跟踪

Jonathan Renusch

机构 * CERN(欧洲核子研究中心) Geneva, Switzerland(瑞士日内瓦)

专题命中 感知 :occupancy(abstract)

AI总结 本文提出利用图神经网络和视觉变换器提升ATLAS缪子谱仪的带电粒子识别效率,前者提升重建速度15%,后者实现超快速近似重建。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 4 篇

2603.26081 2026-03-30 eess.SY cs.CV cs.SY 79%

Experimental study on surveillance video-based indoor occupancy measurement with occupant-centric control

基于监控视频的室内占用测量实验研究:以以 occupant-centric 控制为中心

Irfan Qaisar, Kailai Sun, Qingshan Jia, Qianchuan Zhao

机构 * Center for Intelligent and Networked Systems, Department of Automation, BNRist, Tsinghua University(清华大学自动化系智能与网络化系统中心,北京信息科学与技术国家研究中心) Urban Mobility Lab, Massachusetts Institute of Technology(麻省理工学院城市移动实验室) Singapore-MIT Alliance for Research and Technology Centre, Massachusetts Institute of Technology(麻省理工学院新加坡-麻省理工学院研究与技术联盟中心)

专题命中 规划控制 :occupancy(title,abstract);分类 cs.CV

AI总结 本文研究了基于监控视频的室内占用测量方法,通过比较检测、跟踪和LLM优化流程,展示了LLM对提高测量精度和减少误报的影响,最终在HVAC控制中实现了17.94%的节能潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26462 2026-03-30 cs.RO 57%

DTP-Attack: A decision-based black-box adversarial attack on trajectory prediction

DTP-Attack:一种基于决策的黑盒对抗攻击用于轨迹预测

Jiaxiang Li, Jun Yan, Daniel Watzenig, Huilin Yin

机构 * Tongji University(同济大学) Graz University of Technology(格拉茨技术大学) Virtual Vehicle Research(虚拟车辆研究院)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出DTP-Attack,一种针对轨迹预测系统的基于决策的黑盒对抗攻击方法,通过二进制决策输出实现高可控性和可靠性,有效提升攻击成功率并降低对模型内部信息的依赖。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26050 2026-03-30 eess.SY cs.SY 50%

Hierarchical Control Framework Integrating LLMs with RL for Decarbonized HVAC Operation

分层控制框架:整合大语言模型与强化学习用于去碳化暖通空调操作

Dianyu Zhong, Tian Xing, Kailai Sun, Xu Yang, Heye Huang, Irfan Qaisar, Tinggang Jia, Shaobo Wang, Qianchuan Zhao

专题命中 规划控制 :occupancy(abstract)

AI总结 本文提出一种分层控制框架,结合大语言模型与强化学习,通过生成状态依赖的可行动作掩码,优化多区暖通空调系统的去碳化操作,提升探索效率和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25799 2026-03-30 eess.SP 50%

Occlusion-Aware Multimodal Beam Prediction and Pose Estimation for mmWave V2I

面向毫米波V2I的遮挡感知多模态波束预测与姿态估计

Abidemi Orimogunje, Hyunwoo Park, Kyeong-Ju Cha, Igbafe Orikumhi, Sunwoo Kim, Dejan Vukobratovic

专题命中 规划控制 :LiDAR(abstract)

AI总结 本文提出一种受SLAM启发的多模态学习框架,用于动态遮挡下的毫米波V2I波束管理,通过融合RGB图像、LiDAR点云、雷达范围-角度图、GNSS和短时毫米波功率历史,实现波束索引、遮挡概率和2D位置的联合预测,验证了感知与通信结合在6G V2I系统中的价值。

Comments IEEE VTC

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 2 篇

2603.25946 2026-03-30 cs.CV cs.AI cs.LG 81%

Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets

面向端到端驾驶的碰撞感知视觉-语言学习:多模态违规数据集

Alex Koran, Dimitrios Sinodinos, Hadi Hojjati, Takuya Nanri, Fangge Chen, Narges Armanfard

机构 * McGill University(麦吉尔大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Nissan Motor Corporation(日产汽车公司)

专题命中 端到端驾驶 :end-to-end driving(title);autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLAAD模型,通过多实例学习获取碰撞信号,提升驾驶评分,并在真实数据集上验证其泛化能力。

Comments 33 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20432 2026-03-30 cond-mat.mtrl-sci 50%

Autonomous epitaxial atomic-layer synthesis via real-time computer vision of electron diffraction

通过实时电子衍射计算机视觉实现自主自组装原子层合成

Haotong Liang, Yunlong Sun, Ryan Paxson, Chih-Yu Lee, Alex T. Hall, Zoey Warecki, John Cumings, Hideomi Koinuma, Aaron Gilad Kusne, Mikk Lippmaa, Ichiro Takeuchi

专题命中 端到端驾驶 :self-driving(abstract)

AI总结 本文通过实时计算机视觉实现电子衍射的多维合成参数空间自主导航,显著减少实验次数,用于制备稳定的非稳态功能氧化物相的单相 epitaxial 薄膜。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. BEV与占用 3 篇

2603.25963 2026-03-30 cs.CV 83%

BEVMAPMATCH: Multimodal BEV Neural Map Matching for Robust Re-Localization of Autonomous Vehicles

BEVMapMatch:多模态鸟瞰神经地图匹配用于自动驾驶车辆的鲁棒重定位

Shounak Sural, Ragunathan Rajkumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 BEV与占用 :BEV(title,abstract);LiDAR(abstract);分类 cs.CV

AI总结 本文提出BEVMapMatch框架,利用多模态传感器融合生成鸟瞰图分割,通过交叉注意力机制检索地图片段,实现无需GNSS的鲁棒重定位,实验表明其在GNSS受限环境下的召回率显著提升。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20055 2026-03-30 physics.chem-ph 78%

Occupancy Extrapolation: Reaching Many Excited Electronic States from Ground State Calculations

占据外推:从基态计算中获得许多激发电子态

Yichen Fan, Weitao Yang

专题命中 BEV与占用 :occupancy(title,abstract)

AI总结 本文提出占据外推方法,通过基态计算高效获得激发态能量,保留ΔSCF物理特性并提供激发能量的物理解释,实现高精度计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26314 2026-03-30 cs.RO 57%

Line-of-Sight-Constrained Multi-Robot Mapless Navigation via Polygonal Visible Regions

视距约束下的多机器人无图导航:基于多边形可见区域

Ruofei Bai, Shenghai Yuan, Xinhang Xu, Xingyu Ji, Xiaowei Li, Hongliang Guo, Wei-Yun Yau, Lihua Xie

专题命中 BEV与占用 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出一种基于多边形可见区域的多机器人无图导航方法,通过分布式通信建立视距约束,提升在障碍物密集环境下的连接稳定性与导航效率。

Comments 10 pages, 7 figures. See videos and code: https://github.com/bairuofei/LoS_constrained_navigation

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 激光雷达 2 篇

2603.26263 2026-03-30 cs.CV cs.RO 81%

DRUM: Diffusion-based Raydrop-aware Unpaired Mapping for Sim2Real LiDAR Segmentation

DRUM:基于扩散的反射率感知无配对映射用于Sim2Real激光雷达分割

Tomoya Miyawaki, Kazuto Nakashima, Yumi Iwashita, Ryo Kurazume

机构 * Kyushu University(九州大学) Jet Propulsion Laboratory, California Institute of Technology(喷气推进实验室,加州理工学院)

专题命中 激光雷达 :LiDAR(title,abstract);分类 cs.RO、cs.CV

AI总结 DRUM通过利用未标记真实数据预训练的扩散模型,结合反射强度和射线丢失噪声特性,提升Sim2Real激光雷达分割性能。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26206 2026-03-30 cs.CV cs.RO 81%

4DRaL: Bridging 4D Radar with LiDAR for Place Recognition using Knowledge Distillation

4DRaL: 通过知识蒸馏将4D雷达与LiDAR结合用于地点识别

Ningyuan Huang, Zhiheng Li, Zheng Fang

机构 * Faculty of Robot Science and Engineering, Northeastern University, Shenyang, China(东北大学机器人科学与工程学院,沈阳,中国)

专题命中 激光雷达 :LiDAR(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出4DRaL框架,利用知识蒸馏提升4D雷达的地点识别性能,通过高精度LiDAR-to-LiDAR模型指导训练,解决4D雷达数据噪声和稀疏性问题,实验表明在正常和恶劣天气下均取得最佳性能。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多传感器融合 2 篇

2603.25766 2026-03-30 cs.RO cs.AI 62%

ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models

ETA-VLA:通过时间融合和内在LLM稀疏化实现高效标记适应的视觉-语言-动作模型

Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Zichong Gu, Hao Sun

机构 * Bosch Corporate Research, Bosch (China) Investment Ltd.(博世企业研究,博世(中国)投资有限公司) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院)

专题命中 多传感器融合 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本文提出ETA-VLA框架,通过时间融合和内在LLM稀疏化技术,减少视觉-语言-动作模型的计算负担,实验表明在保持高精度的同时,显著降低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15219 2026-03-30 cs.CV cs.LG cs.MA cs.MM cs.RO 62%

Out-of-Sight Embodied Agents: Multimodal Tracking, Sensor Fusion, and Trajectory Forecasting

视线外的具身智能体:多模态跟踪、传感器融合与轨迹预测

Haichao Zhang, Yi Xu, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Khoury College of Computer Sciences, Northeastern University(东北大学库里计算机科学学院)

专题命中 多传感器融合 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 本文提出改进的视线外轨迹预测方法,通过视觉定位去噪模块提升轨迹预测性能,实验表明在Vi-Fi和JRDB数据集上达到最优效果,为自动驾驶、机器人和监控提供新方向。

Comments Published in IEEE Transactions on Pattern Analysis and Machine Intelligence (Early Access), pp. 1-14, March 23, 2026

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 仿真评测 4 篇

2601.07855 2026-03-30 cs.CV cs.AI 84%

RoAD Benchmark: How LiDAR Models Fail under Coupled Domain Shifts and Label Evolution

RoAD基准:LiDAR模型在耦合域偏移和标签演变下为何失效

Subeen Lee, Siyeong Lee, Namil Kim, Jaesik Choi

机构 * LG AI Research(LG AI 研究院) NAVER LABS(NAVER 实验室) KAIST(韩国科学技术院)

专题命中 仿真评测 :LiDAR(title,abstract);autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 RoAD基准评估LiDAR目标分类在域偏移与标签演变交织下的模型鲁棒性,通过三种学习场景测试模型适应能力,揭示子类细化和未见类插入导致的有限迁移性和持续学习中的快速遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26067 2026-03-30 cs.CV cs.AI 62%

R-PGA: Robust Physical Adversarial Camouflage Generation via Relightable 3D Gaussian Splatting

R-PGA:通过可重照明的3D高斯点散布实现鲁棒的物理对抗伪装生成

Tianrui Lou, Siyuan Liang, Jiawei Liang, Yuze Gao, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区网络空间安全学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Intelligent Systems Engineering, Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区智能工程学院)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出R-PGA框架,通过可重照明的3D高斯点散布技术,解决自动驾驶系统中对抗性伪装生成的鲁棒性问题,提升复杂动态场景下的泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24989 2026-03-30 cs.RO cs.AI 62%

Learning Rollout from Sampling:An R1-Style Tokenized Traffic Simulation Model

从采样中学习:一种R1风格的分词交通仿真模型

Ziyan Wang, Peng Chen, Ding Li, Chiwei Li, Qichao Zhang, Zhongpu Xia, Guizhen Yu

机构 * State Key Laboratory of Intelligent Transportation System, Key Laboratory of Autonomous Transportation Technology for Special Vehicles, Ministry of Industry and Information Technology, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院,智能交通系统国家重点实验室,特种车辆自主运输技术重点实验室(工业和信息化部)) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所,多模态人工智能系统国家重点实验室)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本文提出R1Sim模型,通过分词交通仿真结合熵引导采样和GRPO优化,实现探索与利用的平衡,生成真实安全的多智能体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22498 2026-03-30 cs.RO 57%

HELIOS: Hierarchical Exploration for Language-Grounded Interaction in Open Scenes

HELIOS:面向开放场景的语言引导交互的分层探索

Katrina Ashton, Chahyon Ku, Shrey Shah, Saumit Vedula, Tingrui Zhang, Wen Jiang, Kostas Daniilidis, Bernadette Bucher

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Michigan(密歇根大学)

专题命中 仿真评测 :occupancy(abstract);分类 cs.RO

AI总结 HELIOS通过分层场景表示和搜索目标,解决开放环境中语言指令与部分观测场景的语义关联及动态更新问题,实现高仿真实验和现实场景中的语言引导抓取放置任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他自动驾驶 2 篇

2506.06909 2026-03-30 cs.CV 57%

Gaussian Mapping for Evolving Scenes

高斯映射用于动态场景

Vladimir Yugay, Thies Kersten, Luca Carlone, Theo Gevers, Martin R. Oswald, Lukas Schmid

机构 * University of Amsterdam(阿姆斯特丹大学) University of Technology Nuremberg(纽伦堡工业大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他自动驾驶 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出GaME方法,通过动态场景适应机制持续更新3DGS,结合新颖的关键帧管理机制,提升动态场景重建性能,在PSNR和L1深度误差上分别提升29.7%和3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08079 2026-03-30 cs.SE stat.ME 50%

BayesFLo: Bayesian fault localization of complex software systems

BayesFLo:复杂软件系统的贝叶斯故障定位

Yi Ji, Simon Mak, Ryan Lekivetz, Joseph Morgan

专题命中 其他自动驾驶 :autonomous driving(abstract)

AI总结 本文提出BayesFLo框架,通过贝叶斯模型结合领域知识,提升复杂系统故障定位的准确性与概率评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏