arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-06-09 至 2026-06-09 共收录 26 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 14 篇

2606.08680 2026-06-09 cs.CV cs.RO 新提交 92%

Distortion-Aware PETR for BEV Object Detection with Mixed Pinhole-Fisheye Cameras

畸变感知的PETR用于混合针孔-鱼眼相机的BEV目标检测

Xiangzhong Liu

机构 * fortiss GmbH(fortiss有限公司)

专题命中 感知 :BEV(title,title_cn);autonomous driving(abstract);driving perception(abstract);分类 cs.RO、cs.CV

AI总结 针对鱼眼相机径向畸变破坏BEV检测器均匀采样假设的问题,提出DAPETR,通过畸变感知位置编码和双向特征-几何协同调制模块,在KITTI-360基准上优于基线方法,并揭示了学习适应与显式几何重参数化之间的冲突。

Comments 8 pages, 5 figures, accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07626 2026-06-09 cs.CV cs.AI 新提交 91%

Eyes All Around: Design and Analysis of 360-Degree LiDAR Perception Using Equivariant Feature Learning in Unstructured Traffic

全方位视角:非结构化交通中基于等变特征学习的360度LiDAR感知设计与分析

Pranav Darshan, Raghuveer Narayanan Rajesh, M Uttara Kumari

机构 * RV College of Engineering(RV工程学院)

专题命中 感知 :LiDAR(title,title_cn);autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 针对非结构化城市交通中感知难题,提出结合扇形全景处理与旋转等变稀疏卷积的360度LiDAR感知框架,在印度城市交通数据集上验证了多类别检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09143 2026-06-09 cs.CV 新提交 89%

CAMF-Det: Closure-Aware Multimodal Fusion for LiDAR-Camera 3D Object Detection on UAV Platforms

CAMF-Det: 面向无人机平台的激光雷达-相机闭合感知多模态融合3D目标检测

Yanze Jiang, Yanfeng Gu, Xian Li

机构 * School of Electronics and Information Engineering, Harbin Institute of Technology(哈尔滨工业大学电子与信息工程学院)

专题命中 感知 :BEV(summary_cn,abstract);LiDAR(title,abstract);分类 cs.CV

AI总结 针对无人机俯视场景中树冠遮挡导致的多模态信息退化问题,提出基于比尔-朗伯定律的闭合感知融合框架CAMF-Det,通过显式建模双模态遮挡强度并注入检测流程,在自建数据集上实现困难级别mAP_BEV提升9.43%和4.88%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08844 2026-06-09 cs.CV cs.RO 新提交 86%

Geometry-Aware Fisheye-LiDAR Fusion for Robust 3D Object Detection in Low-Overlap Setups

几何感知鱼眼-激光雷达融合用于低重叠设置下的鲁棒3D目标检测

Xiangzhong Liu, Xihao Wang, Hao Shen

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 感知 :LiDAR(title,abstract);BEV(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 针对稀疏视角下鱼眼相机与激光雷达的几何畸变和低重叠问题,提出几何感知混合融合框架,通过畸变感知LSS模块和双注意力校正模块实现极坐标与笛卡尔特征融合,在三个基准上提升检测精度。

Comments 8 pages, 4 figures, submitted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09634 2026-06-09 cs.CV cs.AI 新提交 84%

ATN3D: Density-Aware LiDAR-Radar Early 3D Object Detection Under Extreme Sparsity

ATN3D:面向极端稀疏性的密度感知激光雷达-雷达早期3D目标检测

Debojyoti Biswas, Xianbiao Hu

机构 * University of California, Berkeley(加州大学伯克利分校) Tsinghua University(清华大学)

专题命中 感知 :LiDAR(title,abstract);occupancy(abstract);分类 cs.CV、cs.AI

AI总结 针对远距离稀疏感知下早期融合丢失信息、通道监督不均衡的问题,提出ATN3D框架,通过密度感知融合、占用门控邻域聚合、证据条件通道自注意力和距离感知损失,在VoD数据集上显著提升远距离检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09569 2026-06-09 cs.RO cs.CV 新提交 81%

Efficient Minimal Solvers for Relative Pose Estimation in Autonomous Driving Applications

自动驾驶应用中相对位姿估计的高效最小求解器

Tao Li, Liang Liu, Jianli Han, Weimin Lv

机构 * College of Aerospace Science and Engineering, Naval Aviation University(海军航空大学航空航天科学与工程学院)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 提出基于新平移参数化和一阶旋转近似的统一框架,设计三种最小求解器(利用IMU垂直方向、转向旋转轴方向、平面运动假设),减少点对应数量和代数复杂度,在RANSAC中加速假设生成,平衡速度与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09350 2026-06-09 cs.RO cs.CV 新提交 81%

Taming Perception Jitter: Uncertainty-Aware LiDAR Object Detection for Reliable Motion Classification

驯服感知抖动:面向可靠运动分类的不确定性感知激光雷达目标检测

Cornelius Schröder, Žygimantas Marcinkus, Markus Lienkamp

机构 * Technical University of Munich(慕尼黑工业大学) Institute for Automotive Engineering, Munich Institute of Robotics and Machine Intelligence, School of Engineering and Design(汽车工程研究所,慕尼黑机器人与机器智能研究所,工程与设计学院)

专题命中 感知 :LiDAR(title);autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出一种部署友好的策略,通过不确定性估计和统计检验减少静态物体的虚假动态预测,在真实驾驶中显著降低误报和不必要停车。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09362 2026-06-09 cs.CV cs.LG 新提交 79%

Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study

零样本语义重识别用于自动驾驶:一项VLM基线研究

Eduardo Borges, Manuel Abreu, Luís Garrote, Urbano J. Nunes

机构 * Autonomous Mobile Robot(自主移动机器人) University of Minho(明德大学)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV

AI总结 提出使用视觉-语言模型生成语义描述进行零样本重识别,在自动驾驶场景中实现与监督CNN基线相当的检索性能,并增强可解释性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08470 2026-06-09 cs.RO 新提交 79%

LUNA-AD: Lightweight Uncertainty-Aware Language Model with Lifelong Learning for Autonomous Driving

LUNA-AD: 面向自动驾驶的轻量级不确定性感知语言模型与终身学习

Ruoyu Yao, Pei Liu, Ruiguo Zhong, Mingxing Peng, Rui Yang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 感知 :autonomous driving(title,abstract);分类 cs.RO

AI总结 提出LUNA-AD,一种结合三系统架构、多智能体分析、双头轻量模型和反思驱动终身学习的轻量级不确定性感知语言模型,在nuPlan上实现高成功率与低推理延迟。

Comments 16 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09268 2026-06-09 cs.RO 新提交 70%

VGP-Nav: Metric-Aware Visual Geometric Perception for Robot Navigation

VGP-Nav:用于机器人导航的度量感知视觉几何感知

Hewei Pan, Weiye Zhu, Zekai Zhang, Zitong Huang, Rongtao Xu, Jinbao Wang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Shenzhen University(深圳大学) SpatialTemporal AI(时空人工智能)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出VGP-Nav,一种仅依赖单目RGB输入的框架,通过地面平面几何约束解决尺度模糊,实现度量定位与障碍物感知的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08029 2026-06-09 cs.RO 新提交 70%

IntentNav: Learning Spatial-Visual Object Navigation from Human Demonstrations

IntentNav: 从人类演示中学习空间-视觉物体导航

Yuxin Cai, Zongtai Li, Maonan Wang, Muyi Bao, Haokun Zhu, Ruofei Bai, Ding Zhao, Zirui Li, Wenshan Wang, Wei-Yun Yau, Ji Zhang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) A*STAR Institute for Infocomm Research (I2R)(新加坡科技研究局资讯通信研究院)

专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.RO

AI总结 提出IntentNav框架,通过人类演示学习类人物体导航策略,利用前沿标注和意图对齐目标实现最优性能,并零样本迁移到多种机器人平台。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09200 2026-06-09 cs.DC cs.AI 新提交 57%

Resource-aware Computation-Communication Overlap for multi-GPU ML Workloads

面向多GPU机器学习工作负载的资源感知计算-通信重叠

Minyu Cui, Miquel Pericas

机构 * Chalmers University of Technology and University of Gothenburg(查尔姆斯理工大学和哥德堡大学)

专题命中 感知 :occupancy(abstract);分类 cs.AI

AI总结 针对多GPU训练中通信瓶颈,提出通过共享内存占用整形和通信流优先级提升实现计算与通信重叠,在多种GPU上减少执行时间达25.5%。

Comments To appear at the AI on HPC Workshop at ISC 2026, held in conjunction with ISC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08197 2026-06-09 cs.CL cs.DC 新提交 50%

AlignFed: Alignment-Aware Asynchronous Federated Fine-Tuning for Large Language Models in Heterogeneous Edge Environments

AlignFed: 异构边缘环境中大语言模型的对齐感知异步联邦微调

Yan Wang, Ziyi Gao, Rui Wang

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 感知 :autonomous driving(abstract)

AI总结 提出AlignFed框架,通过多阶段语义对齐机制(版本感知更新分组、跨版本语义对齐、公平性感知聚合)解决异步联邦微调中大语言模型在异构边缘环境中的模型漂移、客户端漂移和聚合不公平问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07657 2026-06-09 cs.NE cs.LG 新提交 50%

QDS-SNN: Energy-efficient Quantum Deeply-Supervised Spiking Neural Network Algorithm for Traffic Sign Recognition

QDS-SNN:用于交通标志识别的节能量子深度监督脉冲神经网络算法

Zhiguo Qu, Keqi Li, Le Sun, Wenjie Liu, Yimin Yu, Saif Al-Kuwari, Ahmed Farouk

机构 * School of Computer Science, School of Software, Nanjing University of Information Science and Technology(计算机科学系、软件学院、信息科学技术大学)

专题命中 感知 :autonomous driving(abstract)

AI总结 提出量子深度监督脉冲神经网络(QDS-SNN),结合量子神经网络与时空自适应LIF神经元,在GTSRB数据集上以6个时间步达到99.72%准确率,能耗降低55.77%。

Comments 13 pages, 10 Figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 3 篇

2606.08725 2026-06-09 cs.RO cs.SY eess.SY 新提交 79%

Real-Time and Accurate Collision-Free Teleoperation via Differentiable Constraint-Based Trajectory Planning

基于可微约束轨迹规划的实时精确无碰撞遥操作

Max Grobbel, Tristan Schneider, Daniel Flögel, Sören Hohmann

机构 * FZI - Forschungszentrum Informatik(FZI 信息技术研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 规划控制 :trajectory planning(title,abstract);分类 cs.RO

AI总结 针对遥操作中自碰撞与环境碰撞问题,提出基于对偶可微碰撞约束的轨迹规划方法,采用胶囊体与多面体建模,实现更低计算时间和更精确障碍物建模,保证平滑无碰撞遥操作。

Comments 8 pages, 4 figures, accepted at ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09719 2026-06-09 cs.RO 新提交 77%

Safe Polytope-in-Polytope Motion Planning and Control with Control Barrier Functions

基于控制障碍函数的安全多面体在多面体内的运动规划与控制

Alejandro Gonzalez-Garcia, Dries Dirckx, Jan Swevers, Wilm Decré

机构 * KU Leuven(鲁汶大学)

专题命中 规划控制 :LiDAR(abstract,abstract_cn);occupancy(abstract);分类 cs.RO

AI总结 提出一种安全局部运动规划与控制方法,通过模型预测控制器中的离散时间控制障碍函数约束,保证多面体机器人足迹始终位于连续更新的凸自由空间内,计算时间随障碍物数量增加最多降低91倍。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09188 2026-06-09 cs.RO cs.CV 新提交 62%

Trajectory Optimization in Single and Dual-UAV Bearing-Only Target Localization

单无人机和双无人机仅方位目标定位中的轨迹优化

Zhijian Xiao, Huayu Huang, Bin Li, Yang Shang, Banglei Guan

机构 * College of Aerospace Science and Engineering, National University of Defense Technology(国防科技大学航天科学与工程学院) Hunan Key Laboratory of Image Measurement and Visual Navigation(湖南省图像测量与视觉导航重点实验室)

专题命中 规划控制 :trajectory planning(abstract);分类 cs.RO、cs.CV

AI总结 提出基于Fisher信息矩阵的轨迹优化方法,通过谱加权目标函数和交叉角正弦项改善观测几何,结合改进粒子群算法,显著降低定位误差。

Comments 16 pages, 13 figures and 6 tables. Submitted to Measurement

详情

展开后加载摘要…

URL PDF HTML 收藏

3. BEV与占用 2 篇

2606.09273 2026-06-09 cs.CV 新提交 90%

EditSSC: Toward Editable Semantic Occupancy Scenes with Unconditional Diffusion Models

EditSSC: 基于无条件扩散模型的可编辑语义占用场景

Fatima Balde, Raoul de Charette, Alexandre Boulch

机构 * Inria(法国国家信息与自动化研究所) Valeo.ai(法雷奥人工智能实验室)

专题命中 BEV与占用 :BEV(summary_cn,abstract);occupancy(title,abstract);autonomous driving(abstract);分类 cs.CV

AI总结 提出EditSSC方法,利用2D BEV表示和现成潜扩散网络实现3D语义场景生成与免训练编辑,在SemanticKITTI上优于现有3D专用基线。

Comments Accepted at CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07708 2026-06-09 cs.CV cs.AI 新提交 73%

Cross-View Urban Traffic Dataset: Drone-Supervised Ground Truth for Monocular Bird's-Eye View Localization

跨视角城市交通数据集:用于单目鸟瞰图定位的无人机监督地面真值

Prakhar Bhardwaj, Simone Weikl, Kilian Mang, Elia Jonas Sandtner

机构 * OTH Regensburg(雷根斯堡应用技术大学)

专题命中 BEV与占用 :BEV(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出一个由同步自行车视角和无人机视角视频构建的跨视角城市交通数据集,支持跨视角身份匹配和鸟瞰图预测任务,提供身份级对齐和标准化评估。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 激光雷达 1 篇

2606.08876 2026-06-09 physics.geo-ph 新提交 89%

RO-LiDAR GeoQuickView: A Web Platform for Exploring Public LiDAR-Derived Elevation Data in Romania

RO-LiDAR GeoQuickView:探索罗马尼亚公共LiDAR衍生高程数据的Web平台

Alexandru Hegyi

专题命中 激光雷达 :LiDAR(title,title_cn)

AI总结 提出一个非商业Web-GIS平台RO-LiDAR GeoQuickView,整合公共LiDAR衍生数字地形模型等高程数据,提供标准化山体阴影可视化、参与式景观记录和空间索引,以解决数据碎片化和专业处理限制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真评测 4 篇

2606.09644 2026-06-09 cs.CL cs.CV 新提交 79%

Where Does the Answer Come From? Benchmarking View-Level Visual Evidence Identification in Multi-View MLLMs for Autonomous Driving

答案从何而来?面向自动驾驶的多视角MLLMs中视角级视觉证据识别基准

Yimu Wang, Yee Man Choi, Barry Zhang, Mozhgan Nasr Azadani, Sean Sedwards, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学)

专题命中 仿真评测 :autonomous driving(title,abstract);分类 cs.CV

AI总结 针对多视角自动驾驶场景,提出一个基准测试,评估多模态大模型在视觉问答中识别支持性相机视角的能力,包含122个冲突中心问题对,并区分视角选择与答案正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08170 2026-06-09 cs.RO 新提交 79%

Learning from Human Driving: A Human-in-the-Loop Online Behavior Cloning Framework for Autonomous Driving

从人类驾驶中学习:一种用于自动驾驶的人机协同在线行为克隆框架

Yuhong Shi, Jianyi Liu, Lihang Sun, Li Li, Xudong Dong

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室)

专题命中 仿真评测 :autonomous driving(title,abstract);分类 cs.RO

AI总结 提出人机协同在线行为克隆框架HiL-OBC,通过人类干预初始化策略、贝叶斯潜在行为建模和在线更新,结合大模型感知与人类驾驶智能,在CARLA基准上显著提升驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09746 2026-06-09 cs.CV cs.AI cs.LG 新提交 62%

Hybrid Robustness Verification for Spatio-Temporal Neural Networks

时空神经网络的混合鲁棒性验证

Sherwin Varghese, Matthew Wicker, Alessio Lomuscio

机构 * Imperial College London(伦敦帝国学院)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 针对3D CNN在视频和体素输入中的鲁棒性验证,提出时空约束建模和STBP框架,实现精确闭式传播与可扩展近似,在UCF-101等基准上提升1.7倍认证鲁棒准确率。

Comments Accepted at the 9th International Symposium on AI Verification (SAIV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08729 2026-06-09 cs.RO cs.LG 新提交 57%

IR-SIM: A Lightweight Skill-Native Simulator for Navigation, Learning, and Benchmarking

IR-SIM:一种用于导航、学习和基准测试的轻量级技能原生模拟器

Ruihua Han, Shuai Wang, Chengyang Li, Rui Gao, Xinyi Wang, Zhe Liu, Guoliang Li, Yupu Lu, Qi Hao, Jia Pan, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) Southern University of Science and Technology(南方科技大学) University of Michigan(密歇根大学) University of Macau(澳门大学)

专题命中 仿真评测 :LiDAR(abstract);分类 cs.RO

AI总结 提出轻量级技能原生导航模拟器IR-SIM,通过YAML配置完全定义场景,支持文本提示生成与修改,用于导航算法基准测试和训练数据自动生成,并桥接高保真模拟器和真实部署。

Comments 12 pages, 6 figures, project website: https://github.com/hanruihua/ir-sim

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他自动驾驶 2 篇

2606.08684 2026-06-09 cs.CV 新提交 79%

BLUE: Toward Better Language Use in Efficient Vision-Language-Action Models for Autonomous Driving

BLUE:迈向自动驾驶高效视觉-语言-动作模型中更好的语言使用

George Ling, Lijin Yang, Hao Yang, Zhongzhan Huang

机构 * Bosch Research(博世研究院)

专题命中 其他自动驾驶 :autonomous driving(title,abstract);分类 cs.CV

AI总结 提出BLUE方法,通过轻量门控机制在视觉-语言-动作模型中按帧决定是否激活语言生成,实现性能提升和2.54倍推理加速。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09109 2026-06-09 cs.CV cs.IR cs.LG 新提交 57%

Driving Video Retrieval for Complex Queries with Structured Grounding

面向复杂查询的驾驶视频检索与结构化对齐

Manyi Yao, Sparsh Garg, Christian Shelton, Amit Roy-Chowdhury, Abhishek Aich

机构 * NEC Laboratories, America(美国NEC实验室) University of California, Riverside(加州大学河滨分校)

专题命中 其他自动驾驶 :autonomous driving(abstract);分类 cs.CV

AI总结 提出STRIVE-D框架,通过弱监督领域视频校准规则、融合视觉语言与关键词检索信号,在驾驶视频检索中实现高达84%的top-1准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏