arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-06-05 至 2026-06-05 共收录 17 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 5 篇

2601.21288 2026-06-05 cs.AI cs.CV 81%

Drive-KD: Multi-Teacher Distillation for VLMs in Autonomous Driving

Drive-KD:自动驾驶中用于视觉语言模型的多教师知识蒸馏

Weitong Lian, Zecong Tang, Haoran Li, Tianjian Gao, Yifei Wang, Zixu Wang, Lingyi Meng, Tengju Ru, Zhejun Cui, Yichen Zhu, Hangshuo Cao, Qi Kang, Tianxing Chen, Kaixuan Wang, Yu Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Drive-KD框架,通过将自动驾驶分解为感知-推理-规划三元组,并利用知识蒸馏转移能力,构建了专用教师模型,并通过异构梯度投影缓解跨能力梯度冲突,验证了方法在不同模型家族和规模上的泛化能力,展示了蒸馏模型在自动驾驶任务中的优越性能。

Comments Preprint. 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06396 2026-06-05 cs.AI 79%

Risk Assessment of Autonomous Driving: Integrating Technical Failures, Ethical Dilemmas, and Policy Frameworks

自动驾驶风险评估:整合技术故障、伦理困境与政策框架

Boyi Chen, Shengqin Chu, Zicheng Wang, Brian Baetz, Zhen Gao

机构 * Faculty of Engineering, McMaster University(麦斯特大学工程学院)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.AI

AI总结 本文通过分析NHTSA事故数据、DMV脱离报告、MIT道德机器数据集及五辖区法规对比,发现感知与分类错误是主要技术故障模式,并指出不同伦理框架和法规不一致性增加应用不确定性,建议采用适应性协同治理方法。

Comments 19 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06103 2026-06-05 cs.CV 57%

MS-DKC: A Dataset Knowledge Card Framework for Designing and Adapting Medical Image Segmentation Models

MS-DKC:用于设计和适配医学图像分割模型的数据集知识卡片框架

Tariq M. Khan, Syed Saud Naqvi, Thantrira Porntaveetus, Hamid Alinejad-Rokny, Shahzaib Iqbal, Imran Razzak, Mohammad AU Khan

机构 * Center of Excellence in Precision Medicine and Digital Health, Faculty of Dentistry, Chulalongkorn University, Bangkok, Thailand(精准医学与数字健康中心,朱拉隆功大学牙科学院,泰国曼谷) Department of Computer Engineering, COMSATS University Islamabad, Islamabad, Pakistan(计算机工程系,COMSATS伊斯兰堡大学,巴基斯坦伊斯兰堡) School of Biomedical Engineering, UNSW, Sydney, NSW, Australia(生物医学工程学院,新南威尔士大学,澳大利亚悉尼,新南威尔士) Visiting Scholar (Collaborative Projects), Center of Excellence in Precision Medicine and Digital Health, Chulalongkorn University, Bangkok, Thailand(访问学者(合作项目),精准医学与数字健康中心,朱拉隆功大学,泰国曼谷) Department of Computing, Abasyn University Islamabad Campus (AUIC), Islamabad, Pakistan(计算系,阿巴斯扬大学伊斯兰堡校区(AUIC),巴基斯坦伊斯兰堡) Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(Mohamed bin Zayed人工智能大学,阿布扎比,阿拉伯联合酋长国) College of Computer and Information Sciences, prince Sultan University, Riyadh, SAudi Arabia(计算机与信息科学学院,苏丹王子大学,沙特阿拉伯利雅得)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 提出MS-DKC框架,通过显式记录数据集特征(如前景占有率、形态、边界模糊性等)并映射到失败模式、设计先验和风险对齐标准,指导医学图像分割模型的设计与适配,在DRIVE、ISIC2018和ACDC数据集上验证了数据集条件化设计的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01822 2026-06-05 cs.CV 57%

Hierarchically Decoupled Mixture-of-Experts for Robust Traffic Sign Recognition in Complex Driving Scenarios

用于复杂驾驶场景中鲁棒交通标志识别的分层解耦混合专家模型

Mingxiao Wang, Xiaozhen Qu, Bolin Gao, Tong Wang, Lei He

机构 * School of Automotive and Traffic Engineering, Liaoning University of Technology(辽宁科技学院汽车与交通工程学院) State Key Laboratory of Intelligent Green Vehicles and Mobility, School of Vehicle and Mobility, Tsinghua University(智能绿色车辆与移动State Key Laboratory,清华大学车辆与移动学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出分层解耦异构混合专家框架CBDES MoE TSR,通过图像级动态路由机制选择最优专家模型,在复合交通标志数据集上mAP50-95达76.8%,比基线提升2.3%且计算开销降低39.4%。

Comments 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19741 2026-06-05 cs.CV 57%

CityRAG: Stepping Into a City via Spatially-Grounded Video Generation

CityRAG: 通过空间感知的视频生成进入城市

Gene Chou, Charles Herrmann, Kyle Genova, Boyang Deng, Songyou Peng, Bharath Hariharan, Jason Y. Zhang, Noah Snavely, Philipp Henzler

机构 * Google(谷歌) Cornell University(康奈尔大学) Stanford University(斯坦福大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 CityRAG通过利用地理注册数据的大型语料库,生成空间一致且可导航的真实环境视频,其核心方法是结合学习的先验知识和时空不一致训练数据,以实现复杂的运动和外观变化。

Comments Project page: cityrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 5 篇

2606.06014 2026-06-05 cs.AI cs.RO 81%

PLAN-S: Bridging Planning with Latent Style Dynamics for Autonomous Driving World Models

PLAN-S:通过潜在风格动态桥接规划以实现自动驾驶世界模型

Xiaoyun Qiu, Jingtao He, Yijie Chen, Yusong Huang, Haotian Wang, Yixuan Wang, Xinhu Zheng

机构 * Intelligent Transportation Thrust, Systems Hub, and Center of Seamless Connectivity & Connected Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(智能交通 thrust、系统中心及无缝连接与智能连接研究院,香港科学与技术大学(广州))

专题命中 规划控制 :autonomous driving(title,abstract);分类 cs.RO、cs.AI

AI总结 提出PLAN-S框架,通过从潜在表示解码风格条件语义成本图,解决自动驾驶中潜在世界模型规划的可控性问题,在nuScenes和NAVSIM上降低了碰撞率并提升了驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06366 2026-06-05 cs.RO 79%

Waypoints Matter: A Systematic Study for Sampling-Based Trajectory Planning

航点至关重要:基于采样的轨迹规划的系统研究

Josep M. Barbera, Antonio Artuñedo, Jorge Villagra

机构 * AUTOPIA Program at the Centre for Automation and Robotics, CSIC-Universidad Politécnica de Madrid(自动化与机器人中心,CSIC-马德里理工大学)

专题命中 规划控制 :trajectory planning(title);autonomous driving(abstract);分类 cs.RO

AI总结 本文系统研究了航点放置策略(均匀间隔、RDP*变体、曲率条件分配)对采样轨迹规划器性能的影响,发现标称航点间距是主要性能驱动因素,均匀采样在适当间距下表现最佳。

Comments 8 pages, 5 figures, 3 tables; accepted at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06312 2026-06-05 cs.RO 57%

Meridian: Metric-Semantic Primitive Matching for Cross-View Geo-Localization Beyond Urban Environments

Meridian: 超越城市环境的跨视角地理定位的度量-语义基元匹配

Mason Peterson, Qingyuan Li, Yixuan Jia, Fernando Cladera, Carlos Nieto-Granda, Camillo Jose Taylor, Jonathan P. How

机构 * Massachusetts Institute of Technology(麻省理工学院) GRASP Laboratory, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) U.S. Army Combat Capabilities Development Command, Army Research Laboratory(美国陆军战斗能力发展指挥部,陆军研究实验室)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.RO

AI总结 提出Meridian方法,通过匹配航拍图像与地面机器人RGB-D数据中的高层度量-语义基元,无需特定区域训练即可实现跨多种环境的全局定位,平均轨迹误差2.4米。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01935 2026-06-05 cs.CV 57%

Unified Driving Tokens: Representation- and Geometry-Guided Discrete Tokenizer for Driving World Models and Planning

统一驾驶令牌:面向驾驶世界模型和规划的表示与几何引导的离散分词器

Ziyang Yao, Zeyu Zhu, YunCheng Jiang, Zibin Guo, Huijing Zhao

机构 * Peking University(北京大学) Xiaomi EV(小米电动车)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.CV

AI总结 提出一种表示引导与几何增强的离散分词器,通过联合监督学习紧凑令牌,同时优化重建保真度、表示一致性和规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17256 2026-06-05 cs.CL 50%

Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations

大型语言模型的可解释性:朝着生成可信解释的方向机遇与挑战

Shahin Atakishiyev, Housam K. B. Babiker, Jiayi Dai, Nawshad Farruque, Teruaki Hayashi, Nafisa Sadaf Hriti, Md Abed Rahman, Iain Smith, Mi-Young Kim, Osmar R. Zaïane, Randy Goebel

机构 * University of Alberta(阿尔伯塔大学) University of Tokyo(东京大学)

专题命中 规划控制 :autonomous driving(abstract)

AI总结 本文探讨了大型语言模型的可解释性问题,分析了局部可解释性和机械可解释性方法,并在医疗和自动驾驶两个关键领域进行了实验研究,总结了当前可解释性领域存在的问题和未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 2 篇

2606.06219 2026-06-05 cs.RO cs.AI 81%

CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving

CLEAR:端到端自动驾驶中的认知与潜在评估自适应路由

Yining Xing, Zehong Ke, Zhiyuan Liu, Yanbo Jiang, Wenhao Yu, Jianqiang Wang

机构 * Qwen 3.5 0.8B

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.RO、cs.AI

AI总结 提出CLEAR框架,通过单步条件漂移替代扩散模型的多步去噪,结合视觉编码器Drive-JEPA和微调Qwen 3.5 0.8B进行语义推理,实现高效多模态规划,在NAVSIM v1上达到93.7 PDMS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10145 2026-06-05 cs.CV 79%

RoCA: Robust Cross-Domain End-to-End Autonomous Driving

RoCA: 面向鲁棒跨域端到端自动驾驶的框架

Rajeev Yasarla, Shizhong Han, Hsin-Pai Cheng, Apratim Bhattacharyya, Shweta Mahajan, Litian Liu, Yunxiao Shi, Risheek Garrepalli, Hong Cai, Fatih Porikli

机构 * University of California, Berkeley(加州大学伯克利分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, San Diego(加州大学圣地亚哥分校) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Davis(加州大学戴维斯分校)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.CV

AI总结 本文提出RoCA框架,通过联合概率分布建模端到端自动驾驶管道中的 ego 和周围车辆信息,提升跨域自动驾驶的泛化能力和鲁棒性,无需额外推理计算。

Comments accepted for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. BEV与占用 1 篇

2601.02730 2026-06-05 cs.CV 77%

HOLO: Homography-Guided Pose Estimator Network for Fine-Grained Visual Localization on SD Maps

HOLO:基于单应图的细粒度视觉定位网络用于标准定义(SD)地图的视觉定位

Xuchang Zhong, Xu Cao, Jinke Feng, Hao Fang

机构 * Beijing Institute of Technology(北京理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 BEV与占用 :BEV(abstract,abstract_cn);autonomous driving(abstract);分类 cs.CV

AI总结 本文提出了一种基于单应图的视觉定位网络,用于多视角图像与标准定义地图之间的细粒度视觉定位,通过构建满足单应约束的输入对,利用单应关系引导特征融合并限制姿态输出到有效区域,提高了训练效率和定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 激光雷达 2 篇

2606.06255 2026-06-05 cs.RO cs.CV cs.DC 79%

RadiusFPS: Efficient Farthest Point Sampling on CPUs and GPUs via Spherical Voxel Pruning

RadiusFPS:通过球形体素剪枝在CPU和GPU上实现高效最远点采样

Ziyang Yu, Xiang Li, Qiong Chang, Jun Miyazaki

机构 * School of Computing(计算学院) Institute of Science(科学研究院) Tokyo(东京)

专题命中 激光雷达 :LiDAR(abstract,abstract_cn);autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出RadiusFPS框架,利用球形体素剪枝加速最远点采样(FPS),在保持标准更新规则的同时,通过保守几何边界和坐标点跳过测试减少冗余计算,并在GPU上实现融合核,显著提升速度并降低内存占用。

Comments 28 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06250 2026-06-05 cs.RO 57%

Breaking Time: A Fully Gaussian Framework for Distributed and Continuous-Time SLAM

打破时间:一种用于分布式和连续时间SLAM的全高斯框架

Davide Ceriola, Simone Ferrari, Luca Di Giammarino, Leonardo Brizi, Giorgio Grisetti

机构 * Department of Computer, Control, and Management Engineering "Antonio Ruberti", Sapienza University of Rome(计算机、控制与管理工程系(Antonio Ruberti), 罗马萨皮恩扎大学) University of Stuttgart(斯图加特大学)

专题命中 激光雷达 :LiDAR(abstract);分类 cs.RO

AI总结 提出G-solver,结合高斯信念传播和高斯过程运动先验的分布式连续时间轨迹估计框架,支持异构异步传感器和多相机场景。

Comments To be published in RA-L. Open-source implementation is released at https://github.com/rvp-group/gsolver

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仿真评测 2 篇

2606.06130 2026-06-05 cs.RO 70%

Towards Realistic 3D Sonar Simulation

面向真实3D声纳仿真

Youssef Attia, Davide Costa, Francesco Wanderlingh, Filippo Campagnaro, Enrico Simetti

机构 * IEEE

专题命中 仿真评测 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出一种模块化架构,结合GPU加速图形引擎与物理声学传播原理,在NVIDIA Isaac Sim中实现基于Water Linked 3D-15传感器的体积3D声纳模型,并通过硬件在环配置验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06423 2026-06-05 cs.RO cs.AI 62%

RiskFlow: Fast and Faithful Safety-Critical Traffic Scenario Generation

RiskFlow: 快速且保真的安全关键交通场景生成

Qi Lan, Yining Tang, Yu Shen, Yi Zhou, Yuhao Wei, Jie Li, Guofa Li

机构 * National University of Singapore(新加坡国立大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 提出RiskFlow框架,通过动作空间中的单次前向传输替代迭代去噪,实现快速、保真的安全关键多智能体交通场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏