OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
Comments Code is available at: https://github.com/wzzheng/OccSora
视觉与机器人
面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
Comments Code is available at: https://github.com/wzzheng/OccSora
DriveMind: 一种基于双视觉语言模型的强化学习框架,用于自动驾驶
专题命中 自动驾驶 :model-based reinforcement learning(title);world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 DriveMind结合对比视觉语言模型和动态提示生成,实现自动驾驶的语义奖励框架,提升适应性和安全性,实测性能优于基线4%以上。
Comments Submitted to IEEE Transactions on Intelligent Vehicles (T-IV)
LaGen:迈向自主驾驶的自回归激光雷达场景生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学)
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本文提出LaGen,首个支持长时交互生成的自回归框架,能基于单帧输入生成高保真4D激光雷达场景,并通过场景解耦和噪声调节模块提升生成质量。
Comments Accepted to ECCV 2026
ReWorld:为世界动作模型学习更好的表示
机构 * Huazhong University of Science and Technology(华中科技大学) ; Xiaomi EV(小米汽车)
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。
Comments 19 pages,3 figures
主动推理作为物理AI代理的测试时缩放定律
机构 * Bradley Department of Electrical and Computer Engineering(布拉德利电气与计算机工程系) ; Institute for Advanced Computing(先进计算研究所) ; Virginia Tech(弗吉尼亚理工大学) ; Department of Electrical and Computer Engineering(电气与计算机工程系) ; Worcester Polytechnic Institute(沃思堡理工学院) ; Khalifa University of Science and Technology(卡利法科学与技术大学) ; CentraleSupelec(中央超导研究所) ; University Paris Saclay(巴黎萨克雷大学) ; Queen Square Institute of Neurology(伦敦大学学院神经科学研究所) ; School of Psychological Sciences(心理学系) ; Monash University(莫纳什大学) ; CIFAR Global Scholars Program(CIFAR全球学者计划) ; Queen Square Institute of Neurology, University College London(伦敦大学学院神经科学研究所)
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 提出基于主动推理第一性原理的测试时缩放定律,使物理AI代理通过世界模型推理在非平稳环境中泛化,并利用变分推理更新策略,在自动驾驶任务中提升36%以上推理效率。
Comments 53 pages, 13 figures
世界-动作交互模型的黎明
机构 * COWARobot Co. Ltd(COWARobot有限公司) ; Shanghai Jiao Tong University(上海交通大学) ; Hohai University(河海大学)
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本文提出WAIMs,通过DAWN模型在语义潜在空间中实现世界预测与动作生成的交互,提升自动驾驶中的规划性能与安全性。
预见未来,立即行动:基于预见的自动驾驶
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Shanghai Innovation Institute(上海创新研究院) ; Imperial College London(伦敦帝国理工学院) ; University of Surrey(萨里大学)
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本文提出ForeSight框架,通过生成未来场景并据此规划动作,实现前瞻性决策,实验表明其在动态场景中优于现有方法。
Comments CVPR Findings 2026
ProDrive:通过自我环境共演实现自动驾驶的前瞻性规划
机构 * Southern University of Science and Technology(南方科技大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 自动驾驶 :world model(abstract);world-model(abstract);world model(abstract);world-model(abstract)
AI总结 ProDrive通过自我环境共演实现自动驾驶前瞻性规划,结合查询导向的轨迹规划器和鸟瞰图世界模型,提升安全性和规划效率。
Comments Accepted to CVPR 2026 GigaBrain Challenge Workshop
DriveLaW:在潜在驾驶世界中统一规划与视频生成
机构 * Huazhong University of Science and Technology(华中科技大学) ; Xiaomi EV(小米电动车)
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 DriveLaW通过统一视频生成与运动规划,提升自动驾驶中的预测与规划性能,实现视频生成与轨迹规划的一致性,取得新的state-of-the-art结果。
Comments 18 pages, 6 figures, CVPR 2026
LaST-VLA: 在自动驾驶的视觉-语言-动作中思考于潜在的空间-时间空间
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 LaST-VLA通过潜在空间-时间推理框架,结合双特征对齐机制和渐进式SFT训练策略,提升自动驾驶中的视觉-语言-动作处理能力,实现更安全的物理基础推理。
OpenTwinMap: 一种用于城市自动驾驶的开源数字孪生生成器
机构 * Vanderbilt University(范德比大学)
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 OpenTwinMap是一种基于Python的开源框架,用于生成高保真的3D城市数字孪生,通过整合LiDAR和OSM数据,支持自动驾驶模拟和扩展性。
机构 * Li Auto Inc. ; Autolab, Westlake University(Autolab,西lake大学)
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
Comments (Book) To Appear in Foundation and Trends in Robotics. 163 pages, 40 figures, 13 tables
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
Comments Github Repo: https://github.com/zhanghm1995/Forge_VFM4AD
掌控全局:关于自动驾驶系统测试现状的多公司研究
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 针对自动驾驶系统测试复杂且缺乏标准的问题,通过对九家公司专家访谈,经主题分析总结行业测试情况、挑战与趋势,提出以证据为中心的闭环测试框架,为ADS测试提供指导并指明未来方向。
Comments 34 pages, 6 figures, 3 tables
自动驾驶系统中的基础模型:初步路线图
专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本文探讨了基础模型在自动驾驶系统中的应用,分析了在基础设施、车载集成和实际部署三个维度中的现状、挑战和研究方向,旨在为构建安全可靠的自动驾驶系统提供指导。
Comments To appear in ACM Transactions on Software Engineering and Methodology (TOSEM)
专题命中 自动驾驶 :model-based reinforcement learning(title);environment model(abstract);model-based RL(abstract);分类 cs.LG、cs.RO
CorrectionPlanner:基于强化学习的自主驾驶自纠正规划器
机构 * Department of Computer Science, Johns Hopkins University, Baltimore, USA.(约翰霍普金斯大学计算机科学系)
专题命中 自动驾驶 :world model(abstract);world model(abstract);model-based reinforcement learning(abstract);分类 cs.AI、cs.RO
AI总结 本文提出CorrectionPlanner,通过自纠正机制在规划过程中生成安全动作,减少碰撞率,提升规划性能。
专题命中 自动驾驶 :model-based reinforcement learning(title);model based RL(abstract);分类 cs.RO
BrainWAM:面向自动驾驶的语义先验与预测动力学的动作空间协调框架
机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) ; Li Auto Inc.(理想汽车)
专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO
AI总结 该研究针对自动驾驶中语义与预测动力学的规划需求,提出BrainWAM框架,通过结构化动作空间协调及异步整流流推理,在NAVSIM数据集上实现最优性能,优于仅VLA或仅WAM方法。
Vega:通过自然语言指令学习驾驶
机构 * Tsinghua University(清华大学) ; GigaAI
专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO
AI总结 本文提出Vega模型,通过自然语言指令生成和规划,提升自动驾驶的灵活性和个性化水平,基于大规模驾驶数据集InstructScene进行实验验证。
Comments Code is available at https://github.com/zuosc19/Vega
专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO
Comments Accepted to ECCV 2024, code and the pre-trained models can be found at https://kuis-ai.github.io/CarFormer/
专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO
AEGIS:用于开源液体处理机器人的检测感知协议验证和运行时监测
机构 * Data Science and Learning Division, Argonne National Laboratory(阿贡国家实验室数据科学与学习部) ; Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)
专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 研究开源液体处理机器人运行问题,提出AEGIS两层防护系统。一层结合检测规则库与大语言模型验证协议,二层用主成分分析模型监测运行轨迹,经实验验证有效,统一了检测感知验证与视觉监测,且开源。
WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型
机构 * Tongji University(同济大学) ; Nanyang Technological University(南洋理工大学)
专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV
AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。
Comments 20 pages, 7 figures
基于结构化自回归建模的长期交通仿真
机构 * The University of Hong Kong(香港大学)
专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO
AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。
Comments ECCV 2026 Accepted
蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV
AI总结 提出蒙特卡洛传球搜索(MCPS),结合价值模型、世界模型和反事实策略,基于3D轨迹数据评估足球传球,通过两种执行盈余分数实现分布感知的传球分析。
Comments CVPR 2026, CVSports Workshop
蒸馏思考,预见行动:面向自动驾驶的认知-物理强化学习
机构 * NJU(南京大学) ; SJTU(上海交通大学) ; FDU(福建大学)
专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV
AI总结 提出CoPhy框架,通过蒸馏VLM知识到BEV编码器实现零推理成本的认知能力,并构建自回归BEV世界模型预测未来语义地图以提供可解释的物理沙盒,结合双奖励机制(物理奖励和安全约束、认知奖励和意图对齐)优化驾驶策略,在NAVSIM基准上取得最优结果。
LVDrive: 基于潜在视觉表征的视觉-语言-动作自动驾驶模型
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Xiaomi EV(小米电动车)
专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV
AI总结 本文提出LVDrive,一种增强视觉-语言-动作能力的自动驾驶模型,通过引入未来场景预测任务,在高维潜在空间中学习语义丰富的场景表示,从而提升闭环驾驶性能。
EvoQRE: 通过进化量化反应均衡建模安全关键交通仿真中的有限理性
专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.RO、cs.MA
AI总结 本文提出EvoQRE框架,通过量化反应均衡和进化博弈动态建模安全关键交通交互,理论证明其在弱单调性假设下收敛到Logit-QRE,并在Waymo和nuPlan数据集上验证了其在真实性和安全指标上的优越性。
Comments This article is being withdrawn due to identified issues in the experimental evaluation and theoretical assumptions that may affect the validity of some reported conclusions. The authors plan to revise the methodology and provide a corrected version in future work.