arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 344 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 79 篇

2407.04277 2026-07-03 cs.CV 版本更新 57%

Event-based vision sensing and its application to pedestrian detection for intelligent transportation and surveillance

基于事件的视觉感知及其在智能交通与监控中行人检测的应用

Han Wang, Juntao Wu, Jingyuan Bao, Min Liu, Yaoxiong Wang, Saiao Zhou, Yuman Nie, Yun Li

机构 * Han Wang, Juntao Wu, Jingyuan Bao, Min Liu, Yaoxiong Wang, Saiao Zhou, Yuman Nie, Yun Li(未知)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 综述事件视觉感知原理及其在行人检测中的应用,比较事件驱动与传统帧方法的优劣,分析现有方法并讨论开放挑战与未来方向。

Comments Published in Advanced Engineering Informatics, Vol. 76, Part B, 104989 (2026). Received 31 December 2025; Revised 3 June 2026; Accepted 18 June 2026; Available online 23 June 2026. DOI: 10.1016/j.aei.2026.104989

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06887 2026-07-01 cs.RO 版本更新 57%

VertiAdaptor: Online Kinodynamics Adaptation for Vertically Challenging Terrain

VertiAdaptor: 针对垂直挑战地形的在线运动学动力学自适应

Tong Xu, Chenhui Pan, Aniket Datar, Xuesu Xiao

机构 * George Mason University(乔治梅森大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 提出VertiAdaptor在线自适应框架,通过函数编码器融合高程与语义嵌入,实现地形感知的运动学动力学建模与规划,在仿真和实物平台上预测精度提升23.9%,自适应速度提高5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23866 2026-06-25 cs.LG cs.AI 版本更新 57%

Towards Understanding The Calibration Benefits of Sharpness-Aware Minimization

理解锐度感知最小化的校准优势

Chengli Tan, Yubo Zhou, Haishan Ye, Guang Dai, Junmin Liu, Zengjie Song, Jiangshe Zhang, Zixiang Zhao, Yunda Hao, Yong Xu

机构 * Northwestern Polytechnical University(西北工业大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Xi’an Jiaotong University(西安交通大学) ETH Zürich(苏黎世联邦理工学院) Chinese University of Hong Kong(香港中文大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 本文通过理论分析揭示锐度感知最小化(SAM)通过隐式最大化预测分布熵来改善模型校准,并提出变体CSAM进一步降低校准误差。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21583 2026-06-18 cs.CV 版本更新 57%

HACMatch Semi-Supervised Rotation Regression with Hardness-Aware Curriculum Pseudo Labeling

HACMatch: 基于难度感知课程伪标签的半监督旋转回归

Mei Li, Huayi Zhou, Suizhi Huang, Yuxiang Lu, Yue Ding, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出一种难度感知课程学习框架,通过动态选择伪标签样本和结构化数据增强,在少量标注数据下提升半监督旋转回归性能。

Comments This is an accepted manuscript of an article published in Computer Vision and Image Understanding

Journal ref Computer Vision and Image Understanding (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04513 2026-06-17 cs.AI 版本更新 57%

MapAgent: An Industrial-Grade Agentic Framework for City-scale Lane-level Map Generation

MapAgent: 一个工业级的城市规模车道级地图生成智能框架

Deguo Xia, Zihan Li, Haochen Zhao, Dong Xie, Yuyao Kong, Xiyan Liu, Jizhou Huang, Mengmeng Yang, Diange Yang

机构 * Tsinghua University(清华大学) Baidu(百度) University of Macau(澳门大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 提出MapAgent框架,通过结合视觉语言模型和约束感知推理,在验证驱动的Judge-Planner-Worker循环中修正车道地图生成中的规范违规问题,实现城市规模的高自动化生产。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10523 2026-06-16 cs.CV 版本更新 57%

Reasoning in Computer Vision: Taxonomy, Models, Tasks, and Methodologies

计算机视觉中的推理:分类、模型、任务与方法论

Ayushman Sarkar, Zhenyu Yu, Mohd Yamani Idna Idris

机构 * Department of Computer Science and Engineering, Birbhum Institute of Engineering and Technology(计算机科学与工程系,比罗尔理工学院) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Faculty of Computer Science and Information Technology, Universiti Malaya(计算机科学与信息技术学院,马来亚大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文对计算机视觉中的推理进行系统分类,涵盖关系、符号、时间、因果和常识推理,并综述了从图模型到多模态大语言模型的实现方法及评估协议,指出开放挑战并设定未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24119 2026-06-11 cs.CV 版本更新 57%

TopoHR: Hierarchical Centerline Representation for Cyclic Topology Reasoning in Driving Scenes with Point-to-Instance Relations

TopoHR: 面向驾驶场景中循环拓扑推理的层次化中心线表示与点到实例关系

Yifeng Bai, Zhirong Chen, Bo Song, Erkang Cheng, Haibin Ling

机构 * Institute of Intelligent Machines, HFIPS, Chinese Academy of Sciences(智能机器研究所,HFIPS,中国科学院) University of Science and Technology of China(中国科学技术大学) NullMax Westlake University(西湖大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出TopoHR框架,通过层次化中心线表示和统一架构中的点到实例与实例到实例关系,实现中心线检测与拓扑推理的循环交互,在OpenLane-V2上取得显著性能提升。

Comments Accepted at CVPR 2026 (camera ready version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03528 2026-06-09 cs.CV 版本更新 57%

Coop-WD: Cooperative Perception with Weighting and Denoising for Robust V2V Communication

Coop-WD:具有加权和去噪的协作感知用于鲁棒V2V通信

Chenguang Liu, Jianjun Chen, Yunfei Chen, Yubei He, Zhuangkun Wei, Hongjian Sun, Haiyan Lu, Qi Hao

机构 * Department of Engineering, Durham University(工程系,达勒姆大学) Faculty of Engineering and Information Technology, University of Technology, Sydney(工程与信息技术学院,悉尼技术大学) Research Institute of Trustworthy Autonomous Systems, Southern University of Science and Technology(可信自主系统研究院,南方科技大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对V2V通信损伤对协作感知的影响,提出联合加权与去噪框架Coop-WD,通过自监督对比模型和条件扩散概率模型分层增强特征,并设计高效变体Coop-WD-eco降低计算开销,在各类信道下优于传统方法。

Comments submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25316 2026-08-11 eess.SP 版本更新 50%

An Extended Object Poisson Multi-Bernoulli Filter with Zero-Inflated Poisson Measurement Model Using Belief Propagation

基于零膨胀泊松模型和置信传播的扩展目标PMB滤波器

Xueqi Qiu, Yuxuan Xia, Hyowon Kim, Chaoqun Yang

专题命中 感知 :LiDAR(abstract)

AI总结 提出一种利用粒子置信传播高效实现零膨胀泊松模型下扩展目标泊松多伯努利滤波器的方法,通过因子图分解数据关联,提高估计精度和运行速度。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26665 2026-08-05 cs.ET 版本更新 50%

OpenCSI: Self-Calibration Layer for Heterogeneous Mesh Wireless Sensor Networks

OpenCSI:面向异构网状无线传感器网络的自校准层

Karim Khamaisi, Simon Sigg, Bruno Rodrigues

专题命中 感知 :occupancy(abstract)

AI总结 OpenCSI是面向异构网状无线传感器网络的自校准层,通过在线学习空房间基线实现WiFi CSI感知模型零样本跨环境迁移,在二元占用任务上F1最高达0.99,无需目标域数据或重训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04966 2026-07-24 cs.IT cs.LG eess.SP math.IT 版本更新 50%

Environment-Aware Channel Inference via Cross-Modal Flow: From Multimodal Sensing to Wireless Channels

通过跨模态流进行环境感知信道推断:从多模态感知到无线信道

Guangming Liang, Mingjie Yang, Dongzhu Liu, Paul Henderson, Lajos Hanzo

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院) School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院)

专题命中 感知 :LiDAR(abstract)

AI总结 研究在高多普勒环境下无需导频的信道推断,提出数据驱动框架将传感到信道映射设为跨模态流匹配问题,通过融合多模态特征、学习速度场等实现实时CSI估计,实验表明该方法在信道估计精度和频谱效率上优于基准。

Comments 17 pages, 15 figures, 44 references, to appear in IEEE Transactions on Mobile Computing (TMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12381 2026-07-23 quant-ph 版本更新 50%

Enhanced quantum illumination of a lossy target: A sequential interaction model

增强的损失性目标量子照明:一个顺序交互模型

Shilpi Srivastava, Shubhrangshu Dasgupta

专题命中 感知 :LiDAR(abstract)

AI总结 研究在现实环境中量子照明对损失性目标的有效性,比较高斯双模压缩态与最优经典协议的性能,发现TMSS在低反射率目标下具有更高的SNR和更强的抗热噪声能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13494 2026-07-22 cs.LG cs.IT math.IT 版本更新 50%

A VAE-Driven Multi-Task Satellite-Aided Semantic Communication Framework for 6G-Enabled Connected Autonomous Vehicles

用于支持6G的联网自动驾驶车辆的基于VAE的多任务卫星辅助语义通信框架

S. M. Abtahiul Alam, Niloy Das, Apurba Adhikary, Yu Qiao, Zhu Han, Choong Seon Hong

专题命中 感知 :autonomous driving(abstract)

AI总结 针对智能交通系统中联网自动驾驶车辆的通信需求,提出基于VAE的多任务卫星辅助语义通信框架,利用概率潜在表示编码,经噪声信道传输特征进行交通标志重建与分类,能显著降低带宽并保持性能稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12923 2026-07-21 eess.SY cs.SY 版本更新 50%

Information-Optimal Formation Geometry Design for Multimodal UAV Cooperative Perception

多模态无人机协同感知的信息最优编队几何设计

Kai Xiong, Xingyu Wu, Anna Duan, Gang Li, Yongjun Huang, Supeng Leng, Jianhua He

专题命中 感知 :LiDAR(abstract)

AI总结 针对多模态无人机协同感知,提出信息最优优化框架,通过最大化Fisher信息矩阵行列式优化分配与控制,引入等效编队转换策略及稳定飞行控制方案,相比传统方法,视场覆盖、通信信号强度和能耗等方面有显著提升,验证了任务驱动几何分配的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14997 2026-07-21 q-bio.PE q-bio.BM 版本更新 50%

The proportional scaling of mRNA and ribosome concentrations controls eukaryotic cell growth

mRNA和核糖体浓度的比例缩放控制真核细胞生长

Xin Gao, Michael Lanz, Rosslyn Grosely, Jonas Cremer, Joseph Puglisi, Jan M. Skotheim

专题命中 感知 :occupancy(abstract)

AI总结 研究真核细胞生长定量原理,运用多种技术在出芽酵母多条件下研究,发现核糖体浓度与生长速率线性缩放,mRNA浓度与核糖体成比例增加,建立简单模型预测相关指标,揭示细胞通过缩放mRNA和核糖体丰度加速增殖并建立定量框架。

Comments 71 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26477 2026-07-20 cs.LG 版本更新 50%

Variational Inference for Evidential Deep Learning

证据深度学习的变分推断

Jiawei Tang, Xinyan Du, Hui Liu, Junhui Hou, Yuheng Jia

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Computing Information Sciences, Saint Francis University(圣弗朗西斯大学计算信息科学学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用关键实验室(东南大学),中华人民共和国教育部,中国)

专题命中 感知 :autonomous driving(abstract)

AI总结 针对传统证据深度学习(EDL)中KL惩罚项导致证据过高和参数设置缺乏理论保证的问题,提出基于变分推断的VI-EDL框架,通过推导证据下界(ELBO)抑制证据过度增长,并建立泛化界理论,在视觉和医学数据集上实现最先进的分布外检测、噪声检测和自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02369 2026-07-07 hep-ex 版本更新 50%

Continual Learning via Ensemble-Based Depth-Wise Masked Autoencoders for Data Quality Monitoring in High-Energy Physics

基于集成的深度掩蔽自动编码器的持续学习用于高能物理中的数据质量监测

Dale Julson, Eric Reinhardt, Andrii Krutsylo, Resham Sohal, Guillermo Fidalgo, Sergei Gleyzer, Emanuele Usai, The CMS HCAL Collaboration

专题命中 感知 :occupancy(abstract)

AI总结 研究高能物理数据质量监测,提出轻量级掩蔽自动编码器DepthViT,用独特深度嵌入和注意力实现高效异常检测,构建持续学习框架,集成新旧模型提升抗数据偏移能力,多场景测试效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19482 2026-07-03 hep-ex physics.data-an physics.ins-det 版本更新 50%

Transformer-Based Approach to Enhance Positron Tracking Performance in MEG II

基于Transformer的方法提升MEG II正电子追踪性能

Lapo Dispoto, Fedor Ignatov, Atsushi Oya, Yusuke Uchiyama, Antoine Venturini

专题命中 感知 :occupancy(abstract)

AI总结 提出Transformer模式识别方法,用于MEG II实验正电子径迹重建,通过分类去除漂移室中的堆积击中,在35-50%堆积率下将击中纯度提升15%,追踪效率和分辨率分别提升15%和5%,使μ→eγ分支比测量灵敏度提高约10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11445 2026-06-15 cs.DC 版本更新 50%

OpenDT: Exploring Datacenter Performance and Sustainability with a Self-Calibrating Digital Twin -- Technical Report

OpenDT:利用自校准数字孪生探索数据中心性能与可持续性——技术报告

Radu Nicolae, Jules van der Toorn, Stavriana Kraniti, Houcen Liu, Alexandru Iosup

专题命中 感知 :autonomous driving(abstract)

AI总结 提出开源数字孪生OpenDT,通过自校准离散事件仿真和SLO感知反馈循环,实现数据中心性能与能效优化,校准精度MAPE达4.39%。

Comments Companion of the 17th ACM/SPEC International Conference on Performance Engineering (ICPE 2026), May 04-08, 2026, Florence, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 64 篇

2605.14832 2026-08-06 cs.RO cs.CV 版本更新 86%

Learning Direct Control Policies with Flow Matching for Autonomous Driving

通过流匹配学习自动驾驶的直接控制策略

Marcello Ceresini, Federico Pirazzoli, Andrea Bertogalli, Lorenzo Cipelli, Filippo D'Addeo, Anthony Dell'Eva, Alessandro Paolo Capasso, Alberto Broggi

机构 * Università degli Studi di Parma(帕尔马大学) Alma Mater Studiorum - Università di Bologna(博洛尼亚大学) VisLab (an Ambarella Inc. company)(VisLab(安柏莱拉公司))

专题命中 规划控制 :autonomous driving(title,abstract);BEV(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出一种基于流匹配的自动驾驶规划器,直接输出由加速度和曲率剖面定义的可控轨迹,通过鸟瞰图栅格输入,在少量常微分方程积分步骤中生成控制序列,实现低延迟推理。在真实城市场景上训练并在多车道高速公路等新环境中评估,证明模型能可靠泛化。

Comments 16 pages, 6 figures, 2 tables. Accepted for oral presentation at the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29879 2026-07-01 cs.CV cs.AI 版本更新 86%

LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving

LWDrive: 基于逐层世界模型的视觉-语言模型自动驾驶规划

Chen Yang, Yuhao Wei, Ze Xu, Ziheng Zou, Shuang Liang, Delin Ouyang, Lingfeng Qi, Jie Li, Guofa Li

机构 * Chongqing University(重庆大学)

专题命中 规划控制 :autonomous driving(title,abstract);BEV(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出LWDrive框架,通过逐层世界模型引导,将VLM输出的粗轨迹逐步细化为几何精确、多视角感知的规划轨迹,在NAVSIM基准上取得92.0分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15038 2026-08-04 cs.AI 版本更新 83%

LADY: Linear Attention for Autonomous Driving Efficiency without Transformers

LADY:用于自动驾驶效率的线性注意力,无需Transformer

Jihao Huang, Xi Xia, Zhiyuan Li, Tianle Liu, Jingke Wang, Junbo Chen, Tengju Ye

机构 * Udeer AI Zhejiang University(浙江大学) Yuanshi Intelligence(元世智能)

专题命中 规划控制 :autonomous driving(title,abstract);LiDAR(abstract_cn);分类 cs.AI

AI总结 LADY是首个基于线性注意力的端到端自动驾驶生成模型,通过常数时间与内存复杂度实现高效长时序建模与跨模态交互。

Comments Accepted by IEEE RAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17521 2026-07-24 cs.RO 版本更新 83%

GeoWorldAD: Geometry World Action Model for Autonomous Driving

GeoWorldAD:用于自动驾驶的几何世界行动模型

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学) Harvard University(哈佛大学)

专题命中 规划控制 :autonomous driving(title,abstract);trajectory planning(abstract);分类 cs.RO

AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04453 2026-07-02 cs.CV 版本更新 83%

UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving

UniDrive-WM:面向自动驾驶的统一理解、规划和生成世界模型

Zhexiao Xiong, Xin Ye, Burhan Yaman, Sheng Cheng, Yiren Lu, Jingru Luo, Nathan Jacobs, Liu Ren

机构 * Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究院与博世人工智能中心) Washington University in St. Louis(圣路易斯华盛顿大学) Arizona State University(亚利桑那州立大学) Case Western Reserve University(凯斯西储大学)

专题命中 规划控制 :autonomous driving(title,abstract);trajectory planning(abstract);分类 cs.CV

AI总结 提出UniDrive-WM,一个基于VLM的统一世界模型,联合执行场景理解、轨迹规划和未来图像生成,在Bench2Drive上轨迹误差降低7.3%,碰撞率降低10.4%。

Comments Accepted to ECCV 2026. Project Page: https://unidrive-wm.github.io/UniDrive-WM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00919 2026-08-04 cs.CV cs.RO 版本更新 81%

DriveCode: Domain Specific Numerical Encoding for LLM-Based Autonomous Driving

DriveCode: 针对基于LLM的自动驾驶的领域特定数值编码

Zhiye Wang, Yanbo Jiang, Rui Zhou, Bo Zhang, Fang Zhang, Zhenhua Xu, Yaqin Zhang, Jianqiang Wang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) The School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) The Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) DiDi, Beijing, China(滴滴出行) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动性国家重点实验室)

专题命中 规划控制 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出DriveCode,一种将数字表示为专用嵌入而非离散文本标记的新型数值编码方法,提升LLM在自动驾驶中的数值推理与解码效率。

Comments The project page is available at https://shiftwilliam.github.io/DriveCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19194 2026-07-23 cs.RO cs.CV 版本更新 81%

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency

基于结构化场景知识和可验证推理-行动一致性的自动驾驶认知双过程规划

Zhongyao Yang, Haoyu Li, Yu Yan, Zhuangxuan Yu, Jiangfeng Nan, Jinrui Nan

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) National Engineering Research Center of Electric Vehicles, Beijing Institute of Technology(北京理工大学电动车辆国家工程研究中心) School of Mechanical Engineering, Southeast University(东南大学机械工程学院)

专题命中 规划控制 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 研究自动驾驶高级规划问题,提出认知双过程规划框架,用S-CoT模式表示场景知识,通过自动数据引擎、视觉仲裁器及验证器实现自适应推理和规则验证,提升规划准确性、逻辑一致性并降低延迟,明确性能下降条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13636 2026-07-20 cs.CV cs.RO 版本更新 81%

MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning

MindDrive: 一种通过在线强化学习实现自动驾驶的视觉-语言-动作模型

Haoyu Fu, Diankun Zhang, Zongchuang Zhao, Jianfeng Cui, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

专题命中 规划控制 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 MindDrive通过在线强化学习实现自动驾驶中的视觉-语言-动作模型,结合决策专家和动作专家,提升复杂场景下的驾驶决策与探索效率。

Comments Accepted by ECCV 2026; Project Page: https://xiaomi-mlab.github.io/MindDrive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01762 2026-06-17 cs.RO cs.CV 版本更新 81%

AlignDrive: Aligned Lateral-Longitudinal Planning for End-to-End Autonomous Driving

AlignDrive: 用于端到端自动驾驶的对齐横向-纵向规划

Yanhao Wu, Haoyang Zhang, Fei He, Rui Wu, Yanhu Shan, Congpei Qiu, Liang Gao, Wei Ke, Tong Zhang

机构 * School of Software Engineering, XJTU(软件工程学院,西安交通大学) Horizon Robotics Shenzhen Loop Area Institute(深圳河套学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划控制 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种 cascaded 框架,通过将纵向规划转化为路径条件推理过程,提升自动驾驶的协调性和安全性。方法引入锚点回归设计和规划导向的数据增强策略,实现在 Bench2Drive 上达到 SOTA 性能。

Comments underreview

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01755 2026-08-05 cs.AI 版本更新 79%

Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

用于自动驾驶视觉语言模型可验证推理的未来轨迹延迟暴露

Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie, Yakun Zhu, Hao Geng, Xiaozhi Chen, Yikun Ban, Deqing Wang

专题命中 规划控制 :autonomous driving(title,abstract);分类 cs.AI

AI总结 该研究针对自动驾驶VLA模型的轨迹锚定偏差问题,提出AD-MCQ规划框架与DEFT-RLVR方法,将未来轨迹转化为决策后验证目标,提升了自动驾驶推理能力并保留了通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31226 2026-07-29 cs.CV 版本更新 79%

ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving

ForgeDrive: 自动驾驶中统一视觉-动作生成的双向交叉条件

Xuchang Zhong, He Zheng, Chenxu Zhao, Tianxiong Lv, Hangqi Fan, Bohua Wang, Yushan Liu, Li Gao, Zhihao Liao, Leigang Luo, Congyang Zhao, Yang Cai

机构 * Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 规划控制 :autonomous driving(title,abstract);分类 cs.CV

AI总结 提出ForgeDrive统一自回归扩散框架,通过“先动作后想象”范式实现视觉与动作的双向交叉条件,解决级联误差问题,在NAVSIM上优于现有规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏