arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-05-22 至 2026-05-22 共收录 18 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 5 篇

2605.18507 2026-05-22 cs.CV 70%

Weakly Supervised Cross-Modal Learning for 4D Radar Scene Flow Estimation

弱监督跨模态学习用于4D雷达场景流估计

Jingyun Fu, Zhiyu Xiang, Na Zhao

机构 * Zhejiang University, Hangzhou, Zhejiang, China(浙江大学) Zhejiang Provincial Key Laboratory of Multi-Modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出了一种弱监督的雷达场景流学习框架,利用图像和里程计进行辅助监督,通过实例感知的自监督损失和静态区域的刚性损失,实现了更高效的场景流估计。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22455 2026-05-22 cs.CV cs.AI cs.LG physics.optics 62%

Making the Discrete Continuous: Synthetic RAW Augmentations for Fine-Grained Evaluation of Person Detection Performance in Low Light

使离散的成为连续的:合成RAW增强用于细粒度评估人检测性能在低光环境

Valeria Pais, Malena Mendilaharzu, Daniele Faccio, Luis Oala, Christoph Clausen, Bruno Sanguinetti

机构 * University of Glasgow(格拉斯哥大学) Dotphoton

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种合成RAW增强方法,用于在低光条件下更准确地评估人检测模型的性能,通过生成与相机传感器噪声模型匹配的低光样本,以改善基准测试的数据覆盖。

Comments Accepted non-archival paper at the CVPR 2026 AUTOPILOT Workshop (Autonomous Understanding Through Open-world Perception and Integrated Language Models for On-road Tasks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22578 2026-05-22 cs.CV 57%

Beyond Chamfer Distance: Granular Order-aware Evaluation Metric For Online Mapping

超越形变距离:面向在线制图的粒度化顺序感知评估度量

Chouaib Bencheikh Lehocine, Adam Lilja, Junsheng Fu, Lars Hammarstrand

机构 * Zenseact AB(Zenseact公司) Chalmers University of Technology(楚姆勒斯技术大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出一种粒度化顺序感知评估度量,用于评估在线制图方法,通过引入序列最优子模式分配(SOSPA)和多实例评估框架中的多段线定位与检测(PLD),改进了传统基于形变距离的评估方法,揭示了当前方法中检测能力是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01369 2026-05-22 eess.SP cs.AI cs.LG 57%

MU-SHOT-Fi: Self-Supervised Multi-User Wi-Fi Sensing with Source-free Unsupervised Domain Adaptation

MU-SHOT-Fi: 基于源无关无监督域适应的多用户Wi-Fi感知

Ahmed Y. Radwan, Hina Tabassum

机构 * department of Electrical Engineering and Computer Science(电气工程与计算机科学系)

专题命中 感知 :occupancy(abstract);分类 cs.AI

AI总结 本文提出MU-SHOT-Fi框架,通过源无关无监督域适应方法,在单用户和多用户Wi-Fi感知中实现准确的活动分类和占用估计,同时防止模型崩溃。

Journal ref IEEE Internet of Things Journal, Early Access, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02127 2026-05-22 cs.CV 57%

Enhancing Event-based Object Detection with Monocular Normal Maps

通过单目法线图增强基于事件的目标检测

Mingjie Liu, Hanqing Liu, Luoping Cui, Chuang Zhu

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出NRE-Net框架,结合法线图的结构先验、RGB图像的外观上下文和事件的高频动态,通过自适应双流融合模块和事件模态感知融合模块提升自动驾驶中复杂光照下的目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 3 篇

2605.22600 2026-05-22 cs.RO 57%

Branch-Stochastic Model Predictive Control for Motion Planning under Multi-Modal Uncertainty with Scenario Clustering

基于分支随机优化的运动规划在多模态不确定性下的场景聚类

Zekun Xing, Ramkrishna Chaudhari, Marion Leibold, Dirk Wollherr, Martin Buss

机构 * Chair of Automatic Control Engineering(自动控制工程教授会)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出一种结合随机模型预测控制与分支结构的方法,用于在多模态不确定性下进行运动规划,通过场景聚类提高实时计算性能并减少保守性。

Comments This work has been accepted for presentation at IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21273 2026-05-22 cs.CV 57%

DriveMA: Rethinking Language Interfaces in Driving VLAs with One-Step Meta-Actions

DriveMA: 重新思考驾驶VLAs中的语言接口以单步元动作

Weicheng Zheng, Yixin Huang, Qiao Sun, Derun Li, Hang zhao

专题命中 规划控制 :end-to-end driving(abstract);分类 cs.CV

AI总结 本文提出DriveMA,通过单步元动作替代传统的自然语言推理,解决了驾驶VLAs中语言接口的三个瓶颈问题,实现了更高效的端到端规划。

Comments We withdraw this submission because the current version contains a mismatch between the paper title, conceptual framing, and the intended contribution of the work. To avoid potential misunderstanding by readers, the authors have decided to withdraw this version and substantially revise the title, organization, and presentation before any future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22508 2026-05-22 cs.RO cs.SY eess.SY 57%

Parallel OctoMapping: A Scalable Framework for Enhanced Path Planning in Autonomous Navigation

并行八叉树映射:一种用于自主导航中路径规划增强的可扩展框架

Yihui Mao, Tian Tan, Xuehui Shen, Warren E. Dixon, Rushikesh Kamalapurkar

机构 * Department of Mechanical and Aerospace Engineering, University of Florida(佛罗里达大学机械与航空航天工程系) Department of Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系)

专题命中 规划控制 :occupancy(abstract);分类 cs.RO

AI总结 本文提出并行八叉树映射(POMP),一种高效的基于八叉树的映射技术,通过在固定占用网格分辨率下优化自由空间表示,提升路径规划效率和成功率,特别是在复杂环境中。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 1 篇

2605.22089 2026-05-22 cs.CV cs.AI 81%

LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model

LVDrive: 基于潜在视觉表征的视觉-语言-动作自动驾驶模型

Xiaodong Mei, Diankun Zhang, Hongwei Xie, Guang Chen, Hangjun Ye, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaomi EV(小米电动车)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LVDrive,一种增强视觉-语言-动作能力的自动驾驶模型,通过引入未来场景预测任务,在高维潜在空间中学习语义丰富的场景表示,从而提升闭环驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. BEV与占用 3 篇

2605.22036 2026-05-22 cs.CV cs.AI 88%

GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation

GA-VLN: 用于高效视觉-语言导航的几何感知鸟瞰图表示

Jiahao Yang, Zihan Wang, Xiangyang Li, Xing Zhu, Yujun Shen, Yinghao Xu, Shuqiang Jiang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Robbyant School of Computing, National University of Singapore(新加坡国立大学计算机学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 BEV与占用 :BEV(title,summary_cn);分类 cs.CV、cs.AI

AI总结 本文提出GA-VLN框架,通过引入几何感知的鸟瞰图表示(GA-BEV),整合显式和隐式几何信息,提升视觉-语言导航的效率和性能,实验表明其在仅使用导航数据的情况下取得了最先进的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22189 2026-05-22 cs.RO 83%

Learning A Unified Risk Map for Autonomous Driving in Partially Observable Environments

在部分可观察环境中学习统一的风险图

Jie Jia, Yaofeng Su, Zeyu Bao, Yun Hong, Bingzhao Gao, Zhongxue Gan, Wenchao Ding

机构 * Fudan University(复旦大学) Tongji University(同济大学)

专题命中 BEV与占用 :autonomous driving(title,abstract);分类 cs.RO

AI总结 本文提出了一种统一的风险图建模与学习框架,用于部分可观察环境中的自动驾驶,通过时空建模整合交通流风险和碰撞风险,以更精细地评估遮挡引起的危险,并引入扩散基场景生成框架来解决遮挡交互场景稀缺的问题,实验表明该方法在Waymo Open Motion Dataset上显著优于现有方法。

Comments Published in IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04209 2026-05-22 cond-mat.str-el quant-ph 50%

Phonon state tomography of electron correlation dynamics in optically excited solids

光子态成像用于光学激发固体中电子关联动力学的研究

Mattia Moroder, Matteo Mitrano, Ulrich Schollwöck, Sebastian Paeckel, John Sous

专题命中 BEV与占用 :occupancy(abstract)

AI总结 本文提出了一种光子态成像(PST)方法,用于研究由激光脉冲初始时间激发声子的固体中电子动力学,通过投影纯化矩阵积状态算法,将精确的电子-声子波函数分解为纯电子态的贡献,从而实现电子动力学的'成像'重建。

Comments Added one paragraph to the main text and uploaded the Supporting Information

Journal ref Nano Lett. 24, 15693 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 激光雷达 4 篇

2605.22328 2026-05-22 cs.CV 90%

3D LULC classification using multispectral LiDAR and deep learning: current and prospective schemes

基于多光谱LiDAR和深度学习的3D土地利用/覆盖分类:当前和未来方案

Narges Takhtkeshha, Aldino Rizaldy, Markus Hollaus, Juha Hyyppä, Fabio Remondino, Gottfried Mandlburger

机构 * D Optical Metrology (3DOM) Unit, Bruno Kessler Foundation (FBK)(3D光学计量(3DOM)单元,布鲁诺·凯塞尔基金会(FBK)) Department of Geodesy and Geoinformation, TU Wien(测绘与地理信息系,维也纳技术大学) Helmholtz-ZentrumDresden-Rossendorf (HZDR), Helmholtz Institute Freiberg for Resource Technology (HIF)(德累斯顿-罗斯托克赫尔姆霍尔茨研究中心(HZDR),资源技术赫尔姆霍尔茨研究所(HIF)) Freie Universität Berlin, Remote Sensing and Geoinformatics(柏林自由大学,遥感与地理信息学) Department of Remote Sensing and Photogrammetry, Finnish Geospatial Research Institute FGI, The National Land Survey of Finland(芬兰地理研究所(FGI),芬兰国家土地测绘局)

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.CV

AI总结 本文提出了一种基于多光谱LiDAR和深度学习的3D土地利用/覆盖分类方法,介绍了NMCA对齐的L1和L2分类方案,并引入了一个新的多光谱LiDAR基准数据集,评估了七种最先进的深度学习模型,并展示了光谱信息对分类性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21747 2026-05-22 cs.CV cs.RO 84%

Improving 3D Labeling in Self-Driving by Inferring Vehicle Information using Vision Language Models

通过利用视觉语言模型推断车辆信息以改进自动驾驶中的3D标注

Steven Chen, Shivesh Khaitan, Nemanja Djuric

机构 * Aurora Innovation, Inc.(Aurora创新公司)

专题命中 激光雷达 :self-driving(title,abstract);LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种利用视觉语言模型推断车辆信息以提高自动驾驶中3D车辆标注精度的方法,通过零样本推理车辆信息,结合车辆型号和型号识别方法,提升了标注效率和质量。

Comments To appear in Proceedings of the IEEE Intelligent Vehicles Symposium (IV), 2026. Accepted for oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18047 2026-05-22 cs.RO 70%

FUSE: A Framework for Unified State Estimation in Vehicular and Robotic SLAM Systems

FUSE:一种用于车辆和机器人SLAM系统统一状态估计的框架

Wei Wu, Honglin Chen, Wenhan Cao, Yao Lyu, Shaobing Xu, Kun Jiang, Jiangtao Li, Tao Zhang, Lei Guo, Shengbo Eben Li

机构 * State Key Lab of Intelligent Green Vehicle and Mobility, Tsinghua University(智能绿色车辆与移动国家重点实验室,清华大学) School of VM and College of AI, Tsinghua University(车辆学院与人工智能学院,清华大学) SunRisingAI Ltd.(SunRisingAI有限公司) China Intelligent and Connected Vehicles (Beijing) Research Institute Co., Ltd.(中国汽车智能互联车辆(北京)研究院有限公司)

专题命中 激光雷达 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出FUSE框架,用于统一车辆和机器人SLAM系统中的状态估计,通过分离时间处理、局部几何关联、估计器公式和地图更新策略,提高状态估计设计的灵活性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28280 2026-05-22 eess.SP 67%

Multimodal-NF: A Wireless Dataset for Near-Field Low-Altitude Sensing and Communications

Multimodal-NF: 一种用于近场低空传感与通信的无线数据集

Mengyuan Li, Qianfan Lu, Jiachen Tian, Hongjun Hu, Yu Han, Xiao Li, Chao-Kai Wen, Shi Jin

专题命中 激光雷达 :LiDAR(abstract,abstract_cn)

AI总结 本文提出Multimodal-NF数据集,用于近场低空极端大规模多输入多输出系统,通过融合多种模态数据提升无线传感与通信任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仿真评测 1 篇

2605.22420 2026-05-22 cs.CV cs.AI cs.RO 75%

Diffusion-guided Generalizable Enhancer for Urban Scene Reconstruction

基于扩散的通用增强器用于城市场景重建

Henry Che, Jingkang Wang, Yun Chen, Ze Yang, Sivabalan Manivasagam, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 仿真评测 :autonomous driving(abstract);self-driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出GenRe,一种基于扩散的通用增强器,用于城市场景重建,通过学习不同场景中的生成先验,高效地生成稳健且高保真的表示,能够可靠地泛化到挑战性的未见过的视角,从而在自动驾驶中实现鲁棒和可扩展的传感器模拟。

Comments ICRA 2026. Project page: https://waabi.ai/genre

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他自动驾驶 1 篇

2605.21820 2026-05-22 cs.LG cond-mat.mtrl-sci 50%

Beyond Scalar Objectives: Expert-Feedback-Driven Autonomous Experimentation for Scientific Discovery at the Nanoscale

超越标量目标:基于专家反馈的自主实验探索用于纳米尺度科学发现

Ralph Bulanadi, Jefferey Baxter, Arpan Biswas, Hiroshi Funakubo, Dennis Meier, Jan Schultheiß, Rama Vasudevan, Yongtao Liu

机构 * Center for Nanophase Materials Sciences, Oak Ridge National Laboratory(橡树岭国家实验室纳米相材料中心) University of Tennessee-Oak Ridge Innovation Institute, University of Tennessee(田纳西大学橡树岭创新研究所) Department of Material Science and Engineering, School of Materials and Chemical Technology, Institute of Science Tokyo(东京科学大学材料科学与工程系、材料与化学技术学院) Department of Materials Science and Engineering, Norwegian University of Science and Technology (NTNU)(挪威科学技术大学(NTNU)材料科学与工程系) Faculty of Physics and Center for Nanointegration Duisburg-Essen (CENIDE), University of Duisburg-Essen(杜伊斯堡- Essen大学物理系和杜伊斯堡- Essen纳米集成中心(CENIDE)) Research Center Future Energy Materials and Systems, Research Alliance Ruhr(鲁尔研究联盟未来能源材料与系统研究中心)

专题命中 其他自动驾驶 :self-driving(abstract)

AI总结 本文提出了一种名为深度核成对学习(DKPL)的方法,通过整合专家知识和跨学科科学知识,改进自主显微实验,从而在纳米尺度上更有效地发现科学现象。

详情

展开后加载摘要…

URL PDF HTML 收藏