arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 725 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 端到端驾驶 725 篇

2603.16050 2026-03-18 cs.RO cs.CV eess.IV 67%

The Era of End-to-End Autonomy: Transitioning from Rule-Based Driving to Large Driving Models

端到端自主时代:从基于规则的驾驶转向大型驾驶模型

Eduardo Nebot, Julie Stephany Berrio Perez

机构 * The Australian Centre for Robotics, School of Aeronautical, Mechanical and Mechatronic Engineering, The University of Sydney(澳大利亚机器人中心,航空航天、机械及机电工程学院,悉尼大学)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、eess.IV

AI总结 本文探讨自动驾驶从模块化规则系统向端到端学习系统过渡,分析大型驾驶模型在复杂环境中的表现及行业影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16178 2025-12-19 cs.CV cs.AI cs.RO 67%

Towards Closing the Domain Gap with Event Cameras

通过事件相机缩小领域差距

M. Oltan Sevinc, Liao Wu, Francisco Cruz

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) School of Mechanical and Manufacturing Engineering, University of New South Wales(新南威尔士大学机械与制造工程学院) Escuela de Ingeniería, Universidad Central de Chile(智利中央大学工程学院)

专题命中 端到端驾驶 :end-to-end driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出使用事件相机以解决昼夜光照差异带来的领域差距问题,展示其在不同光照条件下更稳定的性能和更优的跨领域表现。

Comments Accepted to Australasian Conference on Robotics and Automation (ACRA), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05865 2025-10-08 cs.AI cs.CV cs.RO 67%

The Safety Challenge of World Models for Embodied AI Agents: A Review

Lorenzo Baraldi, Zifan Zeng, Chongzhe Zhang, Aradhana Nayak, Hongbo Zhu, Feng Liu, Qunli Zhang, Peng Wang, Shiming Liu, Zheng Hu, Angelo Cangelosi, Lorenzo Baraldi

机构 * University of Pisa(比萨大学) Huawei RAMS Lab(华为RAMS实验室) Technical University of Munich(慕尼黑技术大学) Technical University of Berlin(柏林技术大学) University of Manchester(曼彻斯特大学) University of Modena and Reggio Emilia(莫德纳和雷吉奥艾米利亚大学)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14017 2025-04-22 cs.NI stat.AP 67%

Statistical Analysis and End-to-End Performance Evaluation of Traffic Models for Automotive Data

Marcello Bullo, Amir Ashtari Gargari, Paolo Testolina, Michele Zorzi, Marco Giordani

专题命中 端到端驾驶 :autonomous driving(abstract);LiDAR(abstract)

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19548 2024-12-02 cs.CV cs.AI cs.LG cs.RO 67%

ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration

Chaojun Ni, Guosheng Zhao, Xiaofeng Wang, Zheng Zhu, Wenkang Qin, Guan Huang, Chen Liu, Yuyin Chen, Yida Wang, Xueyang Zhang, Yifei Zhan, Kun Zhan, Peng Jia, Xianpeng Lang, Xingang Wang, Wenjun Mei

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Project Page: https://recondreamer.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14095 2023-07-31 cs.CV cs.RO eess.IV 67%

PanoVPR: Towards Unified Perspective-to-Equirectangular Visual Place Recognition via Sliding Windows across the Panoramic View

Ze Shi, Hao Shi, Kailun Yang, Zhe Yin, Yining Lin, Kaiwei Wang

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、eess.IV

Comments Accepted to ITSC 2023. Code and datasets will be made available at https://github.com/zafirshi/PanoVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04021 2023-06-08 cs.CV cs.AI cs.LG cs.RO 67%

Energy-Based Models for Cross-Modal Localization using Convolutional Transformers

Alan Wu, Michael S. Ryoo

专题命中 端到端驾驶 :LiDAR(abstract);分类 cs.RO、cs.CV、cs.AI

Comments ICRA 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04303 2022-10-11 cs.CV cs.AI cs.LG cs.NE cs.RO 67%

Are All Vision Models Created Equal? A Study of the Open-Loop to Closed-Loop Causality Gap

Mathias Lechner, Ramin Hasani, Alexander Amini, Tsun-Hsuan Wang, Thomas A. Henzinger, Daniela Rus

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.03998 2022-01-12 cs.NI 67%

Smooth and Low Latency Video Streaming for Autonomous Cars during Handover

O. El Marai, T. Taleb

专题命中 端到端驾驶 :self-driving(abstract);LiDAR(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.07218 2020-07-15 cs.CV cs.AI cs.RO 67%

Learning Accurate and Human-Like Driving using Semantic Maps and Attention

Simon Hecker, Dengxin Dai, Alexander Liniger, Luc Van Gool

专题命中 端到端驾驶 :end-to-end driving(abstract);分类 cs.RO、cs.CV、cs.AI

Comments IROS 2020 final version. arXiv admin note: text overlap with arXiv:1903.10995

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05883 2025-06-09 cs.CV cs.AI 66%

HMVLM: Multistage Reasoning-Enhanced Vision-Language Model for Long-Tailed Driving Scenarios

Daming Wang, Yuhao Song, Zijian He, Kangliang Chen, Xing Pan, Lu Deng, Weihao Gu

专题命中 端到端驾驶 :end-to-end driving(abstract,comments);分类 cs.CV、cs.AI

Comments WOD Vision-based End-to-End Driving Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25570 2026-07-30 cs.CV cs.AI cs.SE 版本更新 62%

The LAIA Dataset: Labelled Attention for Intelligent Automobiles

LAIA数据集:智能汽车的标记注意力

A. Contreras, D. Porres, R. Abad, P. Cano, A. Levy, G. Villalonga, A. M. López, A. Hernández-Sabaté

机构 * Computer Vision Center(计算机视觉中心) Computer Science Department of Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机科学系)

专题命中 端到端驾驶 :end-to-end driving(abstract);分类 cs.CV、cs.AI

AI总结 研究针对自动驾驶端到端驾驶范式的可解释性挑战,提出LAIA数据集,通过CARLA模拟器收集含多种数据的驾驶数据,可用于训练注意力感知模型等多种应用,并用其比较人类与模型注意力以洞察模型行为。

Comments 11 pages, 12 figures, 3 tables. Dataset and supplementary information available from the project website. Added an author who was inadvertently omitted from the previous version. No changes to the scientific content

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12593 2026-07-15 eess.IV cs.RO cs.SY eess.SY 新提交 62%

Improving Autonomous Nano-drones Performance via Automated End-to-End Optimization and Deployment of DNNs

通过深度神经网络的自动化端到端优化和部署提高自主纳米无人机性能

Vlad Niculescu, Lorenzo Lamberti, Francesco Conti, Luca Benini, Daniele Palossi

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、eess.IV

AI总结 研究如何通过自动化端到端优化和部署DNN提高自主纳米无人机性能,聚焦PULP-Dronet在Crazyflie 2.1纳米无人机上的部署,实现内存占用减少、推理时间加速,提升了无人机在避障、自由飞行和车道跟随等方面的性能,还开源了相关软件设计。

Comments 16 pages, 8 figures, 5 tables. This paper has been accepted for publication in the IEEE Journal on Emerging and Selected Topics in Circuits and Systems (JETCAS) copyright 2021 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18735 2026-07-09 cs.CV cs.AI 版本更新 62%

Thinking Ahead: Foresight Intelligence in MLLMs and World Model

提前思考:多模态语言模型和世界模型中的预见智能

Zhantao Gong, Liaoyuan Fan, Qing Guo, Xun Xu, Xulei Yang, Shijie Li

机构 * College of Software, Nankai University, China(南开大学软件学院) The University of Hong Kong, China(香港大学) NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28489 2026-07-07 eess.IV cs.CV 版本更新 62%

Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms

视频生成模型作为世界模型:高效的范式、架构和算法

Muyang He, Hanzhong Guo, Junxiong Lin, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、eess.IV

AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16663 2026-07-07 cs.RO cs.CV cs.LG cs.SY eess.SY 版本更新 62%

Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models

使用潜在空间生成世界模型减轻自动驾驶模仿学习中的协变量转移

Alexander Popov, Alperen Degirmenci, David Wehr, Shashank Hegde, Ryan Oldja, Alexey Kamenev, Bertrand Douillard, David Nistér, Urs Muller, Ruchi Bhargava, Stan Birchfield, Nikolai Smolyanskiy

机构 * NVIDIA

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出用潜在空间生成世界模型解决自动驾驶协变量转移问题,训练时利用世界模型减轻该问题,无需大量训练数据,还引入新感知编码器,实验显示相比之前有显著改进。

Comments 8 pages, 6 figures, original September 2024, accepted at ICRA 2025 Workshop "Robots in the Wild", for associated video file, see https://youtu.be/7m3bXzlVQvU

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20383 2026-06-30 cs.CV eess.IV 62%

Neural Stereo Video Compression with Hybrid Disparity Compensation

神经立体视频压缩与混合视差补偿

Shiyin Jiang, Zhenghao Chen, Minghao Han, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科技大学) The University of Newcastle(纽卡斯尔大学)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、eess.IV

AI总结 本文提出混合视差补偿策略,结合显式像素位移与隐式交叉注意力机制,提升立体视频压缩性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14010 2026-06-15 cs.CV cs.LG cs.RO 新提交 62%

RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation

RT-VLA:通过知识蒸馏实现实时视觉-语言-动作模型

Xiangyu Huang, Zhenlin Hua, Han Zhou, Shounak Sural, Ragunathan Rajkumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出RT-VLA,通过多级监督蒸馏将SimLingo模型的能力压缩至轻量学生模型,在保持竞争性能的同时将推理时间降低44.8倍(纯视觉模式)和7.9倍(视觉+语言模式),实现实时可解释的VLA自动驾驶。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17855 2026-06-09 cs.AI cs.RO 版本更新 62%

QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Agents

QuickLAP: 为半自主代理快速语言-动作偏好学习

Jordan Abi Nader, David Lee, Nathaniel Dennler, Andreea Bobu

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本研究提出QuickLAP,一种融合物理和语言反馈的贝叶斯框架,用于实时推断奖励函数,通过大规模语言模型提取奖励特征注意力掩码和偏好偏移,从而在半自主驾驶模拟器中将奖励学习误差降低70%,并通过用户研究验证其可理解性和协作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18895 2026-05-20 cs.RO cs.AI 62%

KG-ASG: Collision-Knowledge-Guided Closed-Loop Adversarial Scenario Generation With Primary-Support Attribution

KG-ASG: 基于碰撞知识的闭环对抗场景生成与主支持属性

Cheng Wang, Chen Xiong, Ziwen Wang, Yuchen Zhou, Qiang Liu

机构 * Guangdong Provincial Key Laboratory of Intelligent Transportation System, School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(广东省智能交通系统重点实验室,智能系统工程学院,中山大学深圳校区)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本文提出KG-ASG框架,通过碰撞知识引导和主支持属性,提高自动驾驶系统安全验证的对抗有效性、可解释性和可执行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12625 2026-05-15 cs.RO cs.CV 62%

Driving Intents Amplify Planning-Oriented Reinforcement Learning

意图驱动强化学习放大规划导向的强化学习

Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang, Pengfei Jing, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto(力 auto) Tsinghua University(清华大学) CUHK MMLab(香港大学MMLab)

专题命中 端到端驾驶 :end-to-end driving(abstract);分类 cs.RO、cs.CV

AI总结 本文提出DIAL框架,通过两阶段方法解决连续动作策略在偏好对齐中的模式崩溃问题,通过意图引导的采样扩展分布并提升性能。

Comments Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00080 2026-05-04 cs.RO cs.CV 62%

World Model for Robot Learning: A Comprehensive Survey

机器人学习的世界模型:全面综述

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr, Oier Mees, Marc Pollefeys, Zhuang Liu, Jiajun Wu, Pieter Abbeel, Jitendra Malik, Yilun Du, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) The University of Tokyo(东京大学) University of Oxford(牛津大学) Microsoft(微软公司) ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 综述从机器人学习角度系统回顾世界模型的快速发展,探讨其与机器人策略的耦合、作为强化学习模拟器的作用以及机器人视频世界模型的发展,总结关键范式与挑战。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01605 2026-04-03 cs.CV cs.RO 62%

F3DGS: Federated 3D Gaussian Splatting for Decentralized Multi-Agent World Modeling

F3DGS:联邦3D高斯点云用于去中心化多智能体世界建模

Morui Zhu, Mohammad Dehghani Tezerjani, Mátyás Szántó, Márton Vaitkus, Song Fu, Qing Yang

机构 * University of North Texas(北德克萨斯大学) Budapest University of Technology and Economics(布达佩斯技术与经济大学)

专题命中 端到端驾驶 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 F3DGS通过联邦学习实现去中心化多智能体3D重建,利用共享几何框架和可见性感知聚合解决部分观测问题,实现分布式优化。

Comments Accepted to the CVPR 2026 SPAR-3D Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25327 2026-03-31 cs.CV cs.AI cs.LG 62%

MMEdge: Accelerating On-device Multimodal Inference via Pipelined Sensing and Encoding

MMEdge: 通过流水线传感和编码加速设备端多模态推理

Runxi Huang, Mingxuan Yu, Mingyu Tsoi, Xiaomin Ouyang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 MMEdge提出一种基于流水线传感和编码的设备端多模态推理框架,通过细粒度传感和编码单元实现增量计算,结合轻量级时间聚合模块和自适应配置优化器,降低延迟并保持高精度。

Comments Code available at: https://github.com/HKUST-MINSys-Lab/MMEdge. Accepted by SenSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21104 2026-03-24 cs.RO cs.CV 62%

CounterScene: Counterfactual Causal Reasoning in Generative World Models for Safety-Critical Closed-Loop Evaluation

CounterScene: 生成世界模型中的反事实因果推理用于安全关键闭环评估

Bowen Jing, Ruiyang Hao, Weitao Zhou, Haibao Yu

机构 * Tuojing Intelligence(途京智能) King's College London(伦敦大学国王学院) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 端到端驾驶 :BEV(abstract);分类 cs.RO、cs.CV

AI总结 CounterScene通过结构化反事实推理生成安全关键驾驶场景,通过因果对抗代理识别和冲突感知交互世界模型,提升长周期碰撞率并保持轨迹真实性。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08264 2026-03-06 cs.RO cs.AI 62%

Automatic Curriculum Learning for Driving Scenarios: Towards Robust and Efficient Reinforcement Learning

自动驾驶场景的自动课程学习:迈向更鲁棒和高效的强化学习

Ahmed Abouelazm, Tim Weinstein, Tim Joseph, Philip Schörner, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗赖堡信息科技研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种自动课程学习框架,通过动态生成适应性复杂的驾驶场景,提升强化学习在自动驾驶中的鲁棒性和效率。

Comments Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04333 2026-02-10 cs.CV cs.RO 62%

RAP: 3D Rasterization Augmented End-to-End Planning

RAP: 3D 像素化增强端到端规划

Lan Feng, Yang Gao, Eloi Zablocki, Quanyi Li, Wuyang Li, Sichao Liu, Matthieu Cord, Alexandre Alahi

机构 * EPFL(苏黎世联邦理工学院) Sorbonne Université(索邦大学)

专题命中 端到端驾驶 :end-to-end driving(abstract);分类 cs.RO、cs.CV

AI总结 RAP通过3D像素化增强端到端规划,利用轻量级像素化和特征对齐实现可扩展的数据增强,提升闭环鲁棒性和长尾泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08931 2026-01-28 cs.CV cs.AI cs.LG 62%

Astra: General Interactive World Model with Autoregressive Denoising

Astra:通用交互世界模型与自回归去噪

Yixuan Zhu, Jiaqi Feng, Wenzhao Zheng, Yuan Gao, Xin Tao, Pengfei Wan, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 Astra提出了一种通用交互世界模型,通过自回归去噪和动作感知适配器实现长周期视频预测与多样化交互。

Comments Accepted in ICLR 2026. Code is available at: https://github.com/EternalEvan/Astra

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18878 2025-12-23 cs.CV cs.AI 62%

CrashChat: A Multimodal Large Language Model for Multitask Traffic Crash Video Analysis

CrashChat: 一种多模态大语言模型用于多任务交通事故视频分析

Kaidi Liang, Ke Li, Xianbiao Hu, Ruwen Qin

机构 * Stony Brook University(石溪大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 CrashChat是一种多模态大语言模型,用于多任务交通事故视频分析,通过任务解耦和分组策略提升事故识别、定位等任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13162 2025-12-12 cs.CV cs.AI cs.LG 62%

Orbis: Overcoming Challenges of Long-Horizon Prediction in Driving World Models

Orbis:克服驾驶世界模型中长周期预测的挑战

Arian Mousakhan, Sudhanshu Mittal, Silvio Galesso, Karim Farid, Thomas Brox

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 Orbis通过简单设计实现自动驾驶世界模型在长周期预测和复杂场景中的高性能,采用连续自回归模型优于离散token模型。

Comments Project page: https://lmb-freiburg.github.io/orbis.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏