arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-04-22 至 2026-04-22 共收录 25 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 11 篇

2604.18940 2026-04-22 cs.CV cs.RO 89%

Localization-Guided Foreground Augmentation in Autonomous Driving

基于定位的前景增强在自动驾驶中

Jiawei Yong, Deyuan Qu, Qi Chen, Kentaro Oguchi, Shintaro Fukushima

机构 * Toyota Motor Corporation, Japan(日本电产公司) Toyota Motor North America, USA(美国电产北美公司)

专题命中 感知 :BEV(summary_cn,abstract);autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出LG-FA模块,通过在线增强几何上下文提升自动驾驶中的前景感知,提高BEV表示的几何完整性和时间稳定性,减少定位误差,并实现全局一致的车道和拓扑重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19379 2026-04-22 cs.CV 85%

PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving

PanDA: 无监督领域自适应用于自动驾驶中的多模态3D全景分割

Yining Pan, Shijie Li, Yuchen Wu, Xulei Yang, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Institute for Infocomm Research (I2R), A*STAR, Singapore(新加坡资讯通信研究院(I2R),A*STAR,新加坡)

专题命中 感知 :autonomous driving(title,abstract);LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出PanDA框架,针对多模态3D全景分割的无监督领域自适应问题,通过不对称多模态增强和双专家伪标签细化模块提升鲁棒性和伪标签完整性,实验表明在多种领域转移场景下超越现有SOTA方法。

Comments Accepted at the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18831 2026-04-22 cs.CV cs.RO 84%

Feasibility of Indoor Frame-Wise Lidar Semantic Segmentation via Distillation from Visual Foundation Model

基于视觉基础模型的知识蒸馏的室内点云语义分割可行性

Haiyang Wu, Juan J. Gonzales Torres, George Vosselman, Ville Lehtola

机构 * 1 Department of Earth Observation Science, Faculty of Geo-Information Science Earth Observation (ITC), University of Twente, 7522 NB Enschede, The Netherlands

专题命中 感知 :LiDAR(title,abstract);autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 本文探讨了通过知识蒸馏从视觉基础模型中学习的方法,用于室内点云语义分割,展示了在无人工标注的情况下,该方法在室内场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19145 2026-04-22 cs.CV cs.AI 81%

ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving

ST-Prune:面向自动驾驶的视觉-语言模型中无训练的时空令牌修剪

Lin Sha, Haiyun Guo, Tao Wang, Cong Zhang, Min Huang, Jinqiao Wang, Qinghai Miao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carizon Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI

AI总结 针对自动驾驶中多视角相机和多帧视频输入的计算开销问题,ST-Prune提出无训练的时空令牌修剪框架,通过MTP和RSP模块有效压缩时空冗余,实现90%令牌减少下的近无损性能。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13571 2026-04-22 cs.CV 70%

Radar-Informed 3D Multi-Object Tracking under Adverse Conditions

基于雷达的三维多目标跟踪在恶劣条件下的应用

Bingxue Xu, Emil Hedemalm, Ajinkya Khoche, Patric Jensfelt

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出RadarMOT框架,利用雷达点云提升远距离目标跟踪精度,在MAN-TruckScenes数据集上提升了AMOTA指标12.7%和10.3%。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18993 2026-04-22 cs.CV cs.AI cs.MM 62%

AutoAWG: Adverse Weather Generation with Adaptive Multi-Controls for Automotive Videos

AutoAWG:用于自动驾驶视频的自适应多控逆境天气生成

Jiagao Hu, Daiguo Zhou, Danzhen Fu, Fuhao Li, Zepeng Wang, Fei Wang, Wenhua Liao, Jiayi Xie, Haiyang Sun

机构 * MiLM Plus, Xiaomi Inc.(小米 MiLM Plus) Xiaomi Inc.(小米公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AutoAWG,通过自适应多控生成逆境天气视频,提升自动驾驶感知鲁棒性,实验表明其在FID和FVD指标上显著优于现有方法。

Comments Accepted by ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19267 2026-04-22 cs.RO 57%

Multimodal embodiment-aware navigation transformer

多模态具身感知导航Transformer

Louis Dezons, Quentin Picard, Rémi Marsal, François Goulette, David Filliat

机构 * LARIAD

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出ViLiNT,通过融合多模态数据提升机器人导航鲁棒性,利用Transformer和扩散模型生成可导航路径,实现在不同环境中导航成功率提升166%。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19206 2026-04-22 cs.CV 57%

When Can We Trust Deep Neural Networks? Towards Reliable Industrial Deployment with an Interpretability Guide

当我们可以信任深度神经网络?迈向可靠工业部署的可解释性指南

Hang-Cheng Dong, Yuhao Jiang, Yibo Jiao, Lu Zou, Kai Zheng, Bingguo Liu, Dong Ye, Guodong Liu

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出一种基于事后解释的指标,用于检测二分类缺陷检测网络中的假阴性,通过计算类别特定判别热图与类别无关热图的交并比差异作为可靠性评分,并引入对抗增强方法以放大差异,实验证明该方法能有效识别假阴性,尽管牺牲了真阴性率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16251 2026-04-22 cs.LG cs.CV cs.DC cs.ET 57%

RESFL: An Uncertainty-Aware Framework for Responsible Federated Learning by Balancing Privacy, Fairness and Utility

RESFL: 一种通过平衡隐私、公平性和效用来实现负责任的联邦学习的不确定性感知框架

Dawood Wasif, Terrence J. Moore, Jin-Hee Cho

机构 * Virginia Tech(弗吉尼亚理工大学) U.S. Army Research Laboratory(美国陆军研究实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 RESFL框架通过结合对抗性隐私解耦和不确定性引导的公平性感知聚合,提升联邦学习中隐私与公平性的平衡,实验表明其在自动驾驶场景中提升了检测性能并降低了对抗攻击成功率。

Comments Accepted at ICLR 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19162 2026-04-22 cs.CL stat.AP 50%

Mind the Unseen Mass: Unmasking LLM Hallucinations via Soft-Hybrid Alphabet Estimation

注意未见的质量:通过软混合字母估计揭示LLM幻觉

Hongxing Pan, Yingying Guo, Wenqing Kuang, Jiashi Lu

机构 * School of Data Science(数据科学学院)

专题命中 感知 :occupancy(abstract)

AI总结 本文提出SHADE方法,通过结合通用Good-Turing覆盖与图谱特征,解决小样本下LLM语义字母估计问题,提升不确定性量化性能。

Comments 7 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18911 2026-04-22 eess.SP cs.DS cs.IT math.IT 50%

Safety-Certified CRT Sparse FFT: $Ω(k^2)$ Lower Bound and $O(N \log N)$ Worst-Case

安全认证的CRT稀疏FFT:$Ω(k^2)$下界和$O(N \log N)$最坏情况

Aaron R. Flouro, Shawn P. Chadwick

专题命中 感知 :occupancy(abstract)

AI总结 本文研究了CRT稀疏FFT的最坏情况复杂度,证明了$Ω(k^2)$的下界,并提出了一种鲁棒框架以保证性能。

Comments 20 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 4 篇

2411.09887 2026-04-22 cs.RO 79%

Planning by Simulation: Motion Planning with Learning-based Parallel Scenario Prediction for Autonomous Driving

通过模拟进行规划:基于学习的并行场景预测用于自动驾驶的运动规划

Tian Niu, Kaizhao Zhang, Zhongxue Gan, Wenchao Ding

机构 * Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(代尔夫特理工大学电子工程、数学与计算机科学学院) Department of Electrical Engineering, Wright State University(威斯汀大学电气工程系)

专题命中 规划控制 :autonomous driving(title,abstract);分类 cs.RO

AI总结 本文提出一种基于学习的并行场景预测方法,用于自动驾驶中的运动规划,通过模拟可能场景并计算成本,平衡和剪枝不合理动作,提升安全性和规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05540 2026-04-22 cs.RO cs.AI cs.CV cs.LG cs.NE 67%

Constructing the Umwelt: Cognitive Planning through Belief-Intent Co-Evolution

构建环境:通过信念-意图共演的认知规划

Shiyao Sang

机构 * Shiyao Sang(桑世尧)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出基于信念-意图共演的认知规划方法,通过MBCWM和TIWM模型实现环境与现实的认知一致性,提升自动驾驶规划性能并展现类人认知行为。

Comments 12 pages, 8 figures. A paradigm shift from reconstructing the world to understanding it: planning through Belief-Intent Co-Evolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22650 2026-04-22 cs.CV cs.RO 62%

MAGICIAN: Efficient Long-Term Planning with Imagined Gaussians for Active Mapping

MAGICIAN: 通过想象高斯分布实现高效的长期规划用于主动建图

Shiyao Li, Antoine Guédon, Shizhe Chen, Vincent Lepetit

机构 * LIGM, École Nationale des Ponts et Chaussées, IP Paris, Univ Gustave Eiffel, CNRS, France(LIGM,巴黎国立桥梁与道路学院,IP巴黎,格雷夫埃菲尔大学,法国国家科学研究中心,法国) École Polytechnique, France(法国高等理工学院,法国) Inria, École normale supérieure, CNRS, PSL Research University, France(法国国家科学研究中心,巴黎高等师范学院,法国国家信息与自动化技术研究院,法国)

专题命中 规划控制 :occupancy(abstract);分类 cs.RO、cs.CV

AI总结 MAGICIAN通过想象高斯分布实现高效长期规划,提升主动建图的探索效率与重建完整性,适用于不同动作空间的室内和室外基准测试。

Comments Accepted at CVPR 2026 (Oral). Project webpage: https://shiyao-li.github.io/magician/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19710 2026-04-22 cs.CV 57%

SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model

SpanVLA: 一种高效的视觉-语言-动作模型,通过负样本恢复学习实现动作桥接与学习

Zewei Zhou, Ruining Yang, Xuewei, Qi, Yiluan Guo, Sherry X. Chen, Tao Feng, Kateryna Pistunova, Yishan Shen, Lili Su, Jiaqi Ma

机构 * University of California, Los Angeles, USA(加州大学洛杉矶分校) Motional, USA(Motional公司) Northeastern University, USA(东北大学)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出SpanVLA,一种端到端自动驾驶框架,结合自回归推理与流匹配动作专家,通过高效桥接和负样本恢复学习提升推理效率和鲁棒性。

Comments Project page: https://spanvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 1 篇

2604.06665 2026-04-22 cs.CV 57%

VDPP: Video Depth Post-Processing for Speed and Scalability

VDPP:用于速度和可扩展性的视频深度后处理

Daewon Yoon, Injun Baek, Sangyu Han, Yearim Kim, Nojun Kwak

机构 * Seoul National University(首尔国立大学) Samsung Electronics(三星电子)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出VDPP框架,通过改进视频深度估计的后处理速度和精度,采用几何细化方法提升效率,实现与端到端系统同等的时序一致性,同时具备RGB-free架构,支持实时边缘部署。

Comments 8 pages, 6 figures. Accepted to CVPR 2026 ECV Workshop. Project page: https://github.com/injun-baek/VDPP

详情

展开后加载摘要…

URL PDF HTML 收藏

4. BEV与占用 2 篇

2604.19411 2026-04-22 cs.CV cs.AI 90%

GOLD-BEV: GrOund and aeriaL Data for Dense Semantic BEV Mapping of Dynamic Scenes

GOLD-BEV:地面和空中数据用于动态场景的密集语义BEV映射

Joshua Niemeijer, Alaa Eddine Ben Zekri, Reza Bahmanyar, Philipp M. Schmälzle, Houda Chaabouni-Chouayakh, Franz Kurz

机构 * German Aerospace Center (DLR)(德国航空航天中心(DLR)) Digital Research Center of Sfax(锡夫克斯数字研究中心)

专题命中 BEV与占用 :BEV(title,title_cn);分类 cs.CV、cs.AI

AI总结 本文提出GOLD-BEV框架,通过时间同步的空中影像监督学习密集鸟瞰图语义环境地图,结合空中与地面数据实现动态场景的高精度BEV映射。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14159 2026-04-22 cond-mat.mtrl-sci 50%

Supercell formation in epitaxial rare-earth ditelluride thin films

在原子平面上生长的稀土二telluride超薄膜中的超晶格形成

Adrian Llanos, Salva Salmani-Rezaie, Jinwoong Kim, Nicholas Kioussis, David A. Muller, Joseph Falson

专题命中 BEV与占用 :occupancy(abstract)

AI总结 研究通过分子束外延在MgO(001)上生长DyTe₂−δ薄膜,发现其超晶格结构与Te缺陷相关,通过第一性原理计算揭示费米面嵌套条件导致导电Te平方网的周期性占据并打开能级间隙。

Journal ref Cryst. Growth Des. 2024, 24, 1, 115-121

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 激光雷达 3 篇

2604.18790 2026-04-22 cs.CV 90%

EfficientPENet: Real-Time Depth Completion from Sparse LiDAR via Lightweight Multi-Modal Fusion

EfficientPENet:通过轻量多模态融合实现稀疏LiDAR的实时深度补全

Johny J. Lopez, Md Meftahul Ferdaus, Mahdi Abdelguerfi, Anton Netchaev, Steven Sloan, Ken Pathak, Kendall N. Niles

机构 * Canizaro Livingston Gulf States Center for Environmental Informatics, the University of New Orleans, New Orleans, USA(Canizaro Livingston Gulf States环境信息中心,新奥尔良大学,美国新奥尔良) US Army Corps of Engineers, Engineer Research and Development Center, Vicksburg, Mississippi, USA(美国陆军工程兵团,工程师研究与发展中心,密西西比州维克斯堡,美国)

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.CV

AI总结 本文提出EfficientPENet,通过轻量级多模态融合网络,在稀疏LiDAR和RGB图像上实现实时深度补全,具有更少的参数和更高的速度,同时保持竞争力的精度。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15471 2026-04-22 cs.RO eess.SP 79%

On the Derivation of Tightly-Coupled LiDAR-Inertial Odometry with VoxelMap

关于基于VoxelMap的紧密耦合激光雷达-惯性里程计的推导

Zhihao Zhan

专题命中 激光雷达 :LiDAR(title,abstract);分类 cs.RO

AI总结 本文基于VoxelMap,推导了紧密耦合激光雷达-惯性里程计的数学模型,通过一致的符号和显式公式统一几何建模与概率状态估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12942 2026-04-22 cs.RO 57%

RMGS-SLAM: Real-time Multi-sensor Gaussian Splatting SLAM

RMGS-SLAM:基于3D高斯散射的实时多传感器SLAM

Dongen Li, Yi Liu, Junqi Liu, Zewen Sun, Zefan Huang, Shuo Sun, Jiahui Liu, Chengran Yuan, Hongliang Guo, Francis E. H. Tay, Marcelo H. Ang

机构 * Advanced Robotics Centre, National University of Singapore(新加坡国立大学先进机器人中心) School of Aeronautics and Astronautics, Shanghai Jiao Tong University(上海交通大学航空宇航学院) College of Computer Science, Sichuan University(四川大学计算机学院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟)

专题命中 激光雷达 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出一种实时多传感器SLAM框架,结合激光雷达、惯性导航和视觉数据,通过高斯散射实现高精度定位与真实感映射,解决了大规模环境中的实时SLAM挑战。

Comments The manuscript has been improved, with refined content and updated and corrected experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多传感器融合 1 篇

2602.06400 2026-04-22 cs.CV cs.AI cs.RO 85%

TFusionOcc: T-Primitive Based Object-Centric Multi-Sensor Fusion Framework for 3D Occupancy Prediction

TFusionOcc:基于T-原语的对象中心多传感器融合框架用于3D占用预测

Zhenxing Ming, Yaoqi Huang, Julie Stephany Berrio, Mao Shan, Stewart Worrall

机构 * Australian Centre for Robotics(澳大利亚机器人中心)

专题命中 多传感器融合 :occupancy(title,abstract);LiDAR(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出TFusionOcc框架,通过T-原语实现3D语义占用预测,结合概率模型和多阶段融合架构,实验显示其在nuScenes数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 仿真评测 2 篇

2604.18918 2026-04-22 cs.SE cs.LG 78%

From Particles to Perils: SVGD-Based Hazardous Scenario Generation for Autonomous Driving Systems Testing

从粒子到危险:基于SVGD的危险场景生成用于自动驾驶系统测试

Linfeng Liang, Xiao Cheng, Tsong Yueh Chen, Xi Zheng

机构 * Macquarie University(麦考瑞大学) Swinburne University of Technology(斯威本理工大学)

专题命中 仿真评测 :autonomous driving(title,abstract)

AI总结 本文提出PtoP框架,结合自适应随机种子生成与Stein Variational Gradient Descent,生成多样化的初始条件以发现自动驾驶系统中的故障场景,提升测试安全性与场景多样性。

Journal ref Proceedings of the ACM on Software Engineering, Vol. 3, FSE, Article FSE146, July 2026. Article FSE146 (July 2026),

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19257 2026-04-22 cs.CV 57%

Unposed-to-3D: Learning Simulation-Ready Vehicles from Real-World Images

未置姿到3D:从真实世界图像学习仿真准备的车辆

Hongyuan Liu, Bochao Zou, Qiankun Liu, Haochen Yu, Qi Mei, Jianfei Jiang, Chen Liu, Cheng Bi, Zhao Wang, Xueyang Zhang, Yifei Zhan, Jiansheng Chen, Huimin Ma

机构 * University of Science and Technology Beijing(北京科技大学) Li Auto Inc(利汽车公司)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出Unposed-to-3D框架,通过图像-only监督从真实驾驶图像重建3D车辆,解决现有方法在真实世界分布上的领域差距问题,实现姿态一致且符合仿真的3D模型生成。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他自动驾驶 1 篇

2411.18275 2026-04-22 cs.CV 79%

Visual Adversarial Attack on Vision-Language Models for Autonomous Driving

面向自动驾驶的视觉对抗攻击研究

Tianyuan Zhang, Lu Wang, Xinwei Zhang, Yitong Zhang, Boyi Jia, Siyuan Liang, Shengshan Hu, Qiang Fu, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航) National University of Singapore(国立新加坡大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 其他自动驾驶 :autonomous driving(title,abstract);分类 cs.CV

AI总结 本文提出ADvLM框架,针对自动驾驶中视觉语言模型的特殊需求,解决文本指令变异性和视觉场景时间序列性问题,实现高效对抗攻击。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏