arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 140 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 自动驾驶 140 篇

2603.14908 2026-03-17 cs.RO cs.CV 71%

PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning

PerlAD:基于伪模拟的强化学习在闭环端到端自动驾驶中的应用

Yinfeng Gao, Qichao Zhang, Deqing Liu, Zhongpu Xia, Guang Li, Kun Ma, Guang Chen, Hangjun Ye, Long Chen, Da-Wei Ding, Dongbin Zhao

机构 * School of Automation and Electrical Engineering, University of Science and Technology Beijing(北京科技大学自动化与电气工程学院) Xiaomi EV(小牛电动车) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 PerlAD通过伪模拟强化学习方法解决闭环端到端自动驾驶中训练与现实需求不匹配的问题,利用向量空间构建伪模拟环境,结合预测世界模型和分层解耦规划器,实现高效训练和规划,实验表明其在Bench2Drive和DOS基准上均表现优异。

Comments Accepted by IEEE RA-L. Submitted: 2025.12.2; Revised: 2026.2.4; Accepeted: 2026.3.7

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24712 2026-01-06 cs.RO cs.AI 71%

LSRE: Latent Semantic Rule Encoding for Real-Time Semantic Risk Detection in Autonomous Driving

LSRE: 隐式语义规则编码用于自动驾驶中的实时语义风险检测

Qian Cheng, Weitao Zhou, Cheng Jing, Nanshan Deng, Junze Wen, Zhaoyang Liu, Kun Jiang, Diange Yang

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

AI总结 LSRE通过隐式语义规则编码实现自动驾驶中的实时语义风险检测,以10 Hz速度提供高效准确的危险预判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17685 2025-11-12 cs.CV 71%

FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving

Shuang Zeng, Xinyuan Chang, Mengwei Xie, Xinran Liu, Yifan Bai, Zheng Pan, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团) DAMO Academy, Alibaba Group(阿里巴巴达摩院)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV;dynamics model(abstract)

Comments Accepted to NeurIPS 2025 as Spotlight Presentation. Code: https://github.com/MIV-XJTU/FSDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19713 2025-09-10 cs.RO cs.CV 71%

Semi-SMD: Semi-Supervised Metric Depth Estimation via Surrounding Cameras for Autonomous Driving

Yusen Xie, Zhengmin Huang, Shaojie Shen, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统方向,香港科学与技术大学(广州)) Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01440 2025-06-19 cs.RO cs.LG 71%

Closed-Loop Long-Horizon Robotic Planning via Equilibrium Sequence Modeling

Jinghan Li, Zhicheng Sun, Yadong Mu

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.10249 2022-06-22 cs.HC cs.CL cs.CV cs.LG cs.SD eess.AS 70%

Incorporating Voice Instructions in Model-Based Reinforcement Learning for Self-Driving Cars

Mingze Wang, Ziyang Zhang, Grace Hui Yang

专题命中 自动驾驶 :model-based reinforcement learning(title);分类 cs.LG、cs.CV

Comments NeurIPS 2021 Workshop on Machine Learning for Autonomous Driving

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.08712 2022-05-27 cs.LG cs.RO 70%

CARNet: A Dynamic Autoencoder for Learning Latent Dynamics in Autonomous Driving Tasks

Andrey Pak, Hemanth Manjunatha, Dimitar Filev, Panagiotis Tsiotras

专题命中 自动驾驶 :latent dynamics(title);分类 cs.LG、cs.RO

Comments 13 pages, 14 figures, 8 tables, removed submission info, bios

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31226 2026-07-29 cs.CV 版本更新 69%

ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving

ForgeDrive: 自动驾驶中统一视觉-动作生成的双向交叉条件

Xuchang Zhong, He Zheng, Chenxu Zhao, Tianxiong Lv, Hangqi Fan, Bohua Wang, Yushan Liu, Li Gao, Zhihao Liao, Leigang Luo, Congyang Zhao, Yang Cai

机构 * Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 自动驾驶 :world-model(abstract);world-model(abstract);分类 cs.CV

AI总结 提出ForgeDrive统一自回归扩散框架,通过“先动作后想象”范式实现视觉与动作的双向交叉条件,解决级联误差问题,在NAVSIM上优于现有规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17521 2026-07-24 cs.RO 版本更新 69%

GeoWorldAD: Geometry World Action Model for Autonomous Driving

GeoWorldAD:用于自动驾驶的几何世界行动模型

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学) Harvard University(哈佛大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29374 2026-06-30 cs.CV cs.GR 69%

L2D2-GS: Learning to Densify for Feedforward Dynamic Gaussian Scene Reconstruction

L2D2-GS: 学习致密化以实现前馈动态高斯场景重建

Zetian Song, Chenming Wu, Junnan Liu, Chitian Sun, Liangliang He, Hangjun Ye, Jiaqi Zhang, Siwei Ma, Wen Gao

机构 * Xiaomi EV, Beijing(小米电动车,北京)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 提出L2D2-GS框架,将可泛化重建转化为迭代优化与致密化过程,通过自监督致密化策略和几何正则化机制,实现动态城市场景的高保真重建,在PandaSet和Waymo数据集上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29286 2026-06-30 cs.CV 69%

ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving

ASTAD:自动驾驶中合成到真实适应的非对称风格迁移

Dingyi Yao, Xinqi Zhang, Lihui Peng, Jianming Hu, Danya Yao, Yi Zhang

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 提出ASTAD任务,针对合成数据有标注而真实数据无标注的不对称性,设计无训练两阶段框架ASTModel,通过粗语义先验提取和动态精炼实现类一致风格迁移,显著提升下游感知性能并加速推理。

Comments Accepted for publication at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09529 2026-06-02 cs.CV 69%

RESBev: Making BEV Perception More Robust

RESBev:使BEV感知更加鲁棒

Lifeng Zhuo, Kefan Jin, Zhe Liu, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 提出RESBev,一种即插即用的鲁棒BEV感知方法,通过构建潜在世界模型学习时空相关性来预测干净BEV特征,从而在无需修改骨干网络的情况下增强对自然扰动和对抗攻击的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24313 2026-03-24 cs.RO 69%

Learning to Sample: Reinforcement Learning-Guided Sampling for Autonomous Vehicle Motion Planning

学习采样:强化学习引导的自主车辆运动规划采样

Korbinian Moller, Roland Stroop, Mattia Piccinini, Alexander Langmann, Johannes Betz

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 本文提出一种结合强化学习的采样方法,用于提升自动驾驶车辆在复杂城市环境中的运动规划效率与可靠性。

Comments 8 pages, submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08113 2026-03-10 cs.CV 69%

SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving

SAMoE-VLA:一种面向自动驾驶的场景自适应混合专家视觉-语言-动作模型

Zihan You, Hongwei Liu, Chenxu Dang, Zhe Wang, Sining Ang, Aoqi Wang, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) School of Instrument Science and Engineering, Southeast University(仪器科学与工程学院,东南大学) Zhili College, Tsinghua University(紫荆学院,清华大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学) Department of Automation, University of Science and Technology of China(自动化学院,中国科学技术大学) Department of Automation, University of Science and Technology Beijing(自动化学院,北京科技大学)

专题命中 自动驾驶 :world-model(abstract);world-model(abstract);分类 cs.CV

AI总结 SAMoE-VLA通过场景自适应混合专家机制提升自动驾驶中的视觉-语言-动作推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09864 2025-12-11 cs.CV 69%

UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving

UniUGP:统一理解、生成与规划以实现端到端自动驾驶

Hao Lu, Ziyang Liu, Guangfeng Jiang, Yuanfei Luo, Sheng Chen, Yangang Zhang, Ying-Cong Chen

机构 * ByteDance Seed(字节跳动种子)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 UniUGP通过整合预训练视觉模型和视频生成模型,实现端到端自动驾驶中的场景推理、视频生成和轨迹规划,提升复杂场景下的性能和泛化能力。

Comments Project Page: https://seed-uniugp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06865 2025-12-09 cs.CV 69%

Spatial Retrieval Augmented Autonomous Driving

空间检索增强的自动驾驶

Xiaosong Jia, Chenhe Zhang, Yule Jiang, Songbur Wong, Zhiyuan Zhang, Chen Chen, Shaofeng Zhang, Xuanhe Zhou, Xue Yang, Junchi Yan, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Jiao Tong University(上海交通大学) Key Laboratory of Target Cognition and Application Technology, Aerospace Information Research Institute, Chinese Academy of Sciences(目标认知与应用技术重点实验室,航天信息研究所,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出空间检索范式,通过引入离线地理图像提升自动驾驶任务性能,扩展nuScenes数据集并建立多个基准测试。

Comments Demo Page: https://spatialretrievalad.github.io/ with open sourced code, dataset, and checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16500 2025-10-21 cs.RO 69%

Advancing Off-Road Autonomous Driving: The Large-Scale ORAD-3D Dataset and Comprehensive Benchmarks

Chen Min, Jilin Mei, Heng Zhai, Shuai Wang, Tong Sun, Fanjie Kong, Haoyang Li, Fangyuan Mao, Fuyang Liu, Shuo Wang, Yiming Nie, Qi Zhu, Liang Xiao, Dawei Zhao, Yu Hu

机构 * Research Center for Intelligent Computing Systems, SKLP, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China, 100190(中国科学院计算技术研究所,智能计算系统研究中心,SKLP,北京,中国,100190) Tongji University, Shanghai, China, 200092(同济大学,上海,中国,200092) Xi’an Jiaotong University, Shaanxi, China, 710049(西安交通大学,陕西,中国,710049) Nanchang University, Jiangxi, China, 330047(南昌大学,江西,中国,330047) Defense Innovation Institute, Beijing, China, 100073(国防科技创新院,北京,中国,100073)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.RO

Comments Off-road robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07944 2025-10-17 cs.CV 69%

CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving

Tianrui Zhang, Yichen Liu, Zilin Guo, Yuxin Guo, Jingcheng Ni, Chenjing Ding, Dan Xu, Lewei Lu, Zehuan Wu

机构 * Sensetime Research(商汤科技研究院) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10960 2025-10-14 cs.RO 69%

Game-Theoretic Risk-Shaped Reinforcement Learning for Safe Autonomous Driving

Dong Hu, Fenqing Hu, Lidong Yang, Chao Huang

机构 * Department of Industrial and Systems Engineering, the Hong Kong Polytechnic University(工业与系统工程系,香港理工大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19239 2025-05-27 cs.CV 69%

DriveX: Omni Scene Modeling for Learning Generalizable World Knowledge in Autonomous Driving

Chen Shi, Shaoshuai Shi, Kehua Sheng, Bo Zhang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01407 2024-12-04 cs.CV 69%

HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving

Zehuan Wu, Jingcheng Ni, Xiaodong Wang, Yuxin Guo, Rui Chen, Lewei Lu, Jifeng Dai, Yuwen Xiong

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12144 2024-01-08 cs.CV 69%

Applications of Large Scale Foundation Models for Autonomous Driving

Yu Huang, Yue Chen, Zhu Li

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV

Comments 23 pages. A survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27418 2026-05-28 cs.MA cs.RO 64%

Differentiable Model Predictive Safety for Heterogeneous Mobility at Urban Intersections

城市交叉口异构移动体的可微分模型预测安全

Wenzhe Song, Hao Zhang

机构 * School of Business(商学院) Department of Mechanical Engineering(机械工程系) Stevens Institute of Technology(史蒂文斯理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 自动驾驶 :latent dynamics(abstract);分类 cs.RO、cs.MA;dynamics model(abstract);predictive model(abstract)

AI总结 提出可微分模型预测安全(DMPS)框架,将模型预测控制的前瞻性嵌入数据驱动的端到端强化学习架构,通过可微分安全评价器实现精确在线安全校正,在高密度混合交通仿真中将碰撞率降至5.6%以下。

Comments 6 pages. Published in IEEE IARCE 2025

Journal ref 2025 IEEE 5th International Conference on Industrial Automation, Robotics and Control Engineering (IARCE), Chongqing, China, 2025, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10079 2025-03-24 cs.CV cs.GR cs.LG cs.RO 62%

Data-driven Camera and Lidar Simulation Models for Autonomous Driving: A Review from Generative Models to Volume Renderers

Hamed Haghighi, Xiaomeng Wang, Hao Jing, Mehrdad Dianati

专题命中 自动驾驶 :simulation model(title,abstract);分类 cs.LG、cs.CV、cs.RO

Comments To be published in IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04775 2026-06-04 cs.LG cs.AI cs.CV cs.SY eess.SY math.OC 60%

Activation Steering of Video Generation Models via Reduced-Order Linear Optimal Control

通过降阶线性最优控制引导视频生成模型的激活

Jihoon Hong, Alice Chan, Qiyue Dai, Julian Skifstad, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 自动驾驶 :latent dynamics(abstract);分类 cs.AI、cs.LG、cs.CV

AI总结 提出LA-LQR框架,将文本到视频推理建模为动态系统,通过降阶最优控制实现最小干预的激活引导,减少不安全内容生成同时保持视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19033 2026-05-20 cs.RO cs.AI cs.CV cs.LG cs.MA 60%

RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuning

RLFTSim: 通过强化学习微调实现逼真且可控的多智能体交通仿真

Ehsan Ahmadi, Hunter Schofield, Behzad Khamidehi, Fazel Arasteh, Jinjun Shan, Lili Mou, Dongfeng Bai, Kasra Rezaee

机构 * University of Alberta(阿尔伯塔大学) Huawei Technologies Canada(华为加拿大技术有限公司) York University(约克大学) Canada CIFAR AI Chair, Amii(加拿大 CIFAR 人工智能主席,Amii)

专题命中 自动驾驶 :分类 cs.AI、cs.LG、cs.CV;simulation model(abstract)

AI总结 本文提出RLFTSim框架,通过强化学习微调提升交通仿真场景的真实感,并通过目标条件化方法实现对交通仿真可控性的提炼,实验表明其在真实感和可控性方面均优于其他启发式搜索方法。

Comments CVPR 2026 Highlight; Project page at https://ehsan-ami.github.io/rlftsim

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.08726 2020-07-08 cs.RO cs.CV cs.LG 60%

Interpretable End-to-end Urban Autonomous Driving with Latent Deep Reinforcement Learning

Jianyu Chen, Shengbo Eben Li, Masayoshi Tomizuka

专题命中 自动驾驶 :environment model(abstract);分类 cs.LG、cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16923 2025-04-24 cs.RO cs.LG cs.SY eess.SY 58%

Meta-Learning Online Dynamics Model Adaptation in Off-Road Autonomous Driving

Jacob Levy, Jason Gibson, Bogdan Vlahov, Erica Tevere, Evangelos Theodorou, David Fridovich-Keil, Patrick Spieler

机构 * Jet Propulsion Laboratory, California Institute of Technology(喷气推进实验室、加州理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 自动驾驶 :dynamics model(title,abstract);分类 cs.LG、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16073 2026-06-08 cs.RO cs.AI cs.LO cs.SY eess.SY 版本更新 56%

ScenicRules: An Autonomous Driving Benchmark with Multi-Objective Specifications and Abstract Scenarios

ScenicRules:具有多目标规范和抽象场景的自动驾驶基准测试

Kevin Kai-Chun Chang, Ekin Beyazit, Alberto Sangiovanni-Vincentelli, Tichakorn Wongpiromsarn, Sanjit A. Seshia

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 自动驾驶 :environment model(abstract);分类 cs.AI、cs.RO

AI总结 提出ScenicRules基准,通过层次化规则框架和形式化场景模型,在随机环境下评估自动驾驶系统对优先级多目标规范的满足程度。

Comments v2: Minor numerical corrections for Table V. 16 pages, 14 figures, 7 tables. Extended version of paper accepted to 2026 IEEE Intelligent Vehicles Symposium (IV 2026). ScenicRules benchmark available at https://github.com/BerkeleyLearnVerify/ScenicRules

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02133 2025-02-05 eess.SY cs.AI cs.LG cs.SY 56%

Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification

Rudolf Reiter, Jasper Hoffmann, Dirk Reinhardt, Florian Messerer, Katrin Baumgärtner, Shamburaj Sawant, Joschka Boedecker, Moritz Diehl, Sebastien Gros

专题命中 自动驾驶 :environment model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏