arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-08-14 至 2026-08-14 共收录 9 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 2 篇

2608.13147 2026-08-14 cs.CV 新提交 85%

Geometry-Grounded Unified 3D Perception for Autonomous Driving

面向自动驾驶的基于几何的统一3D感知

Longfei Xu, Xiaohui Wang, Zehao Huang, Han Li, Ya Yang, Naiyan Wang, Si Liu

专题命中 感知 :autonomous driving(title,abstract);occupancy(abstract);driving perception(abstract);分类 cs.CV

AI总结 该研究针对现有自动驾驶3D感知框架无法保留显式度量几何的问题,提出GeoUP框架,通过分解跨图像交互并注入射线图编码实现统一3D感知,在多数据集上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13395 2026-08-14 cs.RO 新提交 74%

FIRE-VLA: Failure-Informed Self-Evolution for Vision-Language-Action Models in Autonomous Driving

FIRE-VLA:面向自动驾驶的视觉-语言-动作模型的故障感知自演化

Hao Dou

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 感知 :autonomous driving(title);分类 cs.RO

AI总结 该研究针对自动驾驶VLA模型,提出FIRE-VLA故障感知自演化框架,结合GRPO与自蒸馏,在nuScenes数据集上降低了规划误差与故障流行率,提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 端到端驾驶 2 篇

2608.12854 2026-08-14 cs.RO cs.AI cs.CV 新提交 85%

BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving

BrainWAM:面向自动驾驶的语义先验与预测动力学的动作空间协调框架

Bing Zhan, Shuyao Shang, Jiahao Gu, Shuo Lu, Yuan Xu, Zhao Wang, Yida Wang, Xueyang Zhang, Kun Zhan, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Li Auto Inc.(理想汽车)

专题命中 端到端驾驶 :autonomous driving(title,abstract);end-to-end driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究针对自动驾驶中语义与预测动力学的规划需求,提出BrainWAM框架,通过结构化动作空间协调及异步整流流推理,在NAVSIM数据集上实现最优性能,优于仅VLA或仅WAM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12932 2026-08-14 cs.AI 新提交 79%

FlashDrive: Flash Vision-Language-Action Inference for Autonomous Driving

FlashDrive:面向自动驾驶的Flash视觉-语言-动作推理

Zekai Li, Yihao Liang, Hongfei Zhang, Jian Chen, Yesheng Liang, Zhijian Liu

机构 * Princeton(普林斯顿大学) UC San Diego(加州大学圣迭戈分校)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.AI

AI总结 FlashDrive通过算法-系统协同设计解决VLA推理的四个级联瓶颈,使Alpamayo 1.5-10B的端到端自动驾驶延迟降4.7倍,推理频率提升至6.6Hz,逼近实时部署。

Comments 15 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. BEV与占用 3 篇

2608.13095 2026-08-14 cs.RO cs.CV 新提交 62%

Semantic Radiance Fields as Simulators for Spatial Reasoning in Real-World Scenes

语义辐射场作为真实场景空间推理的模拟器

Nico Heider, Michał Jan Włodarczyk, Katarzyna Wasielewska-Michniewska, Przemysław Hołda, Martin Schieck, Marcin Paprzycki, Maria Ganzha, Bogdan Franczyk

机构 * Leipzig University(莱比锡大学) Systems Research Institute Polish Academy of Sciences(波兰科学院系统研究所) Wrocław University of Economics(弗罗茨瓦夫经济大学)

专题命中 BEV与占用 :occupancy(abstract);分类 cs.RO、cs.CV

AI总结 该研究提出用语义辐射场(SRF)构建兼具几何真实性与语义可查询性的真实场景模拟器,用于训练评估具身智能体的空间推理能力,还将其应用于果园苹果采摘任务。

Comments Accepted at the IJCAI 2026 Workshop on Spatio-Temporal Reasoning and Learning (STRL), oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13238 2026-08-14 cond-mat.str-el 新提交 50%

Emergent Symmetry-Protected Topological Phases via Polyakov Confinement in Quantum Spin Systems

量子自旋系统中通过Polyakov禁闭实现的涌现对称性保护拓扑相

Li-Wei He, Shun-Li Yu, Jian-Xin Li

专题命中 BEV与占用 :occupancy(abstract)

AI总结 本研究利用Polyakov禁闭机制,将狄拉克自旋液体转化为对称性保护拓扑态,通过变分蒙特卡洛模拟提供微观证据,为SPT物理开辟了新路径并架起跨领域桥梁。

Journal ref Rep. Prog. Phys. 89 (2026) 080503

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12867 2026-08-14 cond-mat.quant-gas quant-ph 新提交 50%

One-sided stripe supersolidity from engineered non-axisymmetric dipolar interactions

Chao Zhang

专题命中 BEV与占用 :occupancy(abstract)

Comments main 7 pages+supplemental

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多传感器融合 1 篇

2608.13102 2026-08-14 cs.CV 新提交 57%

RbFT-Net: Rectify-Before-Fuse Temporal Radar Anchors for 4D Radar-Camera Depth Completion

RbFT-Net:用于4D雷达-相机深度补全的融合前校正时间雷达锚点

Wentao Zhao, Shouxuan Wu, Yongtao Cen, Tianchen Deng, Yuyang Zhang, Jingchuan Wang

专题命中 多传感器融合 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出RbFT-Net框架,通过图像条件校正模块校正雷达锚点并选择性传播,解决雷达测量的稀疏与干扰问题,在相关数据集上的深度补全性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真评测 1 篇

2608.12354 2026-08-14 cs.AR 新提交 50%

SCALE-Sim EVA: Design Principles for an Extensible, Visualizable, and Adaptable Accelerator Simulation Framework

SCALE-Sim EVA:可扩展、可可视化且可适配的加速器模拟框架的设计原则

Jingtian Dang, Ritik Raj, Tushar Krishna

专题命中 仿真评测 :occupancy(abstract)

AI总结 SCALE-Sim EVA是一款面向IR感知加速器建模的可扩展、可可视化、可适配的模拟框架,通过张量命令与命令分解机制计算周期时序,可生成轨迹用于分析执行相关指标,解决了固定加速器模拟器难以扩展的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏