arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-08-14 至 2026-08-14 共收录 13 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 4 篇

2608.13147 2026-08-14 cs.CV 新提交 85%

Geometry-Grounded Unified 3D Perception for Autonomous Driving

面向自动驾驶的基于几何的统一3D感知

Longfei Xu, Xiaohui Wang, Zehao Huang, Han Li, Ya Yang, Naiyan Wang, Si Liu

专题命中 感知 :autonomous driving(title,abstract);occupancy(abstract);driving perception(abstract);分类 cs.CV

AI总结 该研究针对现有自动驾驶3D感知框架无法保留显式度量几何的问题,提出GeoUP框架,通过分解跨图像交互并注入射线图编码实现统一3D感知,在多数据集上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13395 2026-08-14 cs.RO 新提交 74%

FIRE-VLA: Failure-Informed Self-Evolution for Vision-Language-Action Models in Autonomous Driving

FIRE-VLA:面向自动驾驶的视觉-语言-动作模型的故障感知自演化

Hao Dou

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 感知 :autonomous driving(title);分类 cs.RO

AI总结 该研究针对自动驾驶VLA模型,提出FIRE-VLA故障感知自演化框架,结合GRPO与自蒸馏,在nuScenes数据集上降低了规划误差与故障流行率,提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11143 2026-08-14 cs.RO 版本更新 70%

APEX: Learning Adaptive High-Platform Traversal for Humanoid Robots

APEX: 为双足机器人学习适应性高平台穿越

Yikai Wang, Tingxuan Leng, Changyi Lin, Shiqi Liu, Shir Simon, Bingqing Chen, Jonathan Francis, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 APEX通过感知和攀爬行为实现双足机器人高平台穿越,结合地形适应和安全正则化,实现高效探索与稳健适应。

Comments Project Website: https://apex-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12608 2026-08-14 cs.CV 版本更新 57%

A Data Efficiency Study of Synthetic Fog for Object Detection Using the Clear2Fog Pipeline

使用Clear2Fog管道研究合成雾的数据效率

Mohamed Ahmed Mohamed, Xiaowei Huang

机构 * Waymo Open Dataset(Waymo开放数据集)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出Clear2Fog管道,通过物理模拟生成雾数据,研究环境多样性对模型鲁棒性的影响,发现混合密度数据训练模型优于固定密度数据,且通过调整学习率可克服合成偏见。

Comments Accepted to Neurocomputing. Project code and experimental configs available at https://github.com/mmohamed28/Clear2Fog

Journal ref Neurocomputing, Vol. 703, 134798, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 1 篇

2511.06990 2026-08-14 eess.SY cs.SY 67%

Koopman-Based Dynamic Environment Prediction for Safe UAV Navigation

Vitor Bueno, Ali Azarbahram, Marcello Farina, Lorenzo Fagiano

专题命中 规划控制 :LiDAR(abstract);trajectory planning(abstract)

Journal ref 2026 European Control Conference (ECC), IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 2 篇

2608.12854 2026-08-14 cs.RO cs.AI cs.CV 新提交 85%

BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving

BrainWAM:面向自动驾驶的语义先验与预测动力学的动作空间协调框架

Bing Zhan, Shuyao Shang, Jiahao Gu, Shuo Lu, Yuan Xu, Zhao Wang, Yida Wang, Xueyang Zhang, Kun Zhan, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Li Auto Inc.(理想汽车)

专题命中 端到端驾驶 :autonomous driving(title,abstract);end-to-end driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究针对自动驾驶中语义与预测动力学的规划需求,提出BrainWAM框架,通过结构化动作空间协调及异步整流流推理,在NAVSIM数据集上实现最优性能,优于仅VLA或仅WAM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12932 2026-08-14 cs.AI 新提交 79%

FlashDrive: Flash Vision-Language-Action Inference for Autonomous Driving

FlashDrive:面向自动驾驶的Flash视觉-语言-动作推理

Zekai Li, Yihao Liang, Hongfei Zhang, Jian Chen, Yesheng Liang, Zhijian Liu

机构 * Princeton(普林斯顿大学) UC San Diego(加州大学圣迭戈分校)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.AI

AI总结 FlashDrive通过算法-系统协同设计解决VLA推理的四个级联瓶颈,使Alpamayo 1.5-10B的端到端自动驾驶延迟降4.7倍,推理频率提升至6.6Hz,逼近实时部署。

Comments 15 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. BEV与占用 4 篇

2512.17897 2026-08-14 cs.CV cs.AI cs.LG cs.RO 版本更新 83%

RadarGen: Automotive Radar Point Cloud Generation from Cameras

RadarGen:从摄像头生成汽车雷达点云

Tomer Borreda, Fangqiang Ding, Sanja Fidler, Shengyu Huang, Or Litany

机构 * Technion(技术学院) MIT(麻省理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 BEV与占用 :BEV(summary_cn,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 RadarGen通过扩散模型从摄像头图像生成逼真的雷达点云,结合BEV对齐的深度、语义和运动线索,提升雷达生成的物理合理性与多模态模拟能力。

Comments ECCV 2026. Project page: https://radargen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13095 2026-08-14 cs.RO cs.CV 新提交 62%

Semantic Radiance Fields as Simulators for Spatial Reasoning in Real-World Scenes

语义辐射场作为真实场景空间推理的模拟器

Nico Heider, Michał Jan Włodarczyk, Katarzyna Wasielewska-Michniewska, Przemysław Hołda, Martin Schieck, Marcin Paprzycki, Maria Ganzha, Bogdan Franczyk

机构 * Leipzig University(莱比锡大学) Systems Research Institute Polish Academy of Sciences(波兰科学院系统研究所) Wrocław University of Economics(弗罗茨瓦夫经济大学)

专题命中 BEV与占用 :occupancy(abstract);分类 cs.RO、cs.CV

AI总结 该研究提出用语义辐射场(SRF)构建兼具几何真实性与语义可查询性的真实场景模拟器,用于训练评估具身智能体的空间推理能力,还将其应用于果园苹果采摘任务。

Comments Accepted at the IJCAI 2026 Workshop on Spatio-Temporal Reasoning and Learning (STRL), oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13238 2026-08-14 cond-mat.str-el 新提交 50%

Emergent Symmetry-Protected Topological Phases via Polyakov Confinement in Quantum Spin Systems

量子自旋系统中通过Polyakov禁闭实现的涌现对称性保护拓扑相

Li-Wei He, Shun-Li Yu, Jian-Xin Li

专题命中 BEV与占用 :occupancy(abstract)

AI总结 本研究利用Polyakov禁闭机制,将狄拉克自旋液体转化为对称性保护拓扑态,通过变分蒙特卡洛模拟提供微观证据,为SPT物理开辟了新路径并架起跨领域桥梁。

Journal ref Rep. Prog. Phys. 89 (2026) 080503

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12867 2026-08-14 cond-mat.quant-gas quant-ph 新提交 50%

One-sided stripe supersolidity from engineered non-axisymmetric dipolar interactions

Chao Zhang

专题命中 BEV与占用 :occupancy(abstract)

Comments main 7 pages+supplemental

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多传感器融合 1 篇

2608.13102 2026-08-14 cs.CV 新提交 57%

RbFT-Net: Rectify-Before-Fuse Temporal Radar Anchors for 4D Radar-Camera Depth Completion

RbFT-Net:用于4D雷达-相机深度补全的融合前校正时间雷达锚点

Wentao Zhao, Shouxuan Wu, Yongtao Cen, Tianchen Deng, Yuyang Zhang, Jingchuan Wang

专题命中 多传感器融合 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出RbFT-Net框架,通过图像条件校正模块校正雷达锚点并选择性传播,解决雷达测量的稀疏与干扰问题,在相关数据集上的深度补全性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仿真评测 1 篇

2608.12354 2026-08-14 cs.AR 新提交 50%

SCALE-Sim EVA: Design Principles for an Extensible, Visualizable, and Adaptable Accelerator Simulation Framework

SCALE-Sim EVA:可扩展、可可视化且可适配的加速器模拟框架的设计原则

Jingtian Dang, Ritik Raj, Tushar Krishna

专题命中 仿真评测 :occupancy(abstract)

AI总结 SCALE-Sim EVA是一款面向IR感知加速器建模的可扩展、可可视化、可适配的模拟框架,通过张量命令与命令分解机制计算周期时序,可生成轨迹用于分析执行相关指标,解决了固定加速器模拟器难以扩展的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏