arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 35 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 端到端驾驶 35 篇

2601.22032 2026-07-03 cs.CV 版本更新 85%

Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving

Drive-JEPA:视频JEPA结合多模态轨迹蒸馏实现端到端驾驶

Linhan Wang, Zichong Yang, Chen Bai, Guoxiang Zhang, Xiaotong Liu, Xiaoyin Zheng, Xiao-Xiao Long, Chang-Tien Lu, Cheng Lu

机构 * Virginia Tech(弗吉尼亚理工学院) Purdue University(普渡大学) XPENG Motors(小鹏汽车) Nanjing University(南京大学)

专题命中 端到端驾驶 :end-to-end driving(title,abstract);autonomous driving(abstract);trajectory planning(abstract);分类 cs.CV

AI总结 提出Drive-JEPA框架,结合视频联合嵌入预测架构(V-JEPA)与多模态轨迹蒸馏,通过自监督视频预训练和动量感知选择机制提升端到端驾驶的规划性能,在NAVSIM上达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04049 2026-06-29 cs.CV cs.RO 版本更新 84%

DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving

DIVER:强化扩散突破端到端自动驾驶的模仿瓶颈

Ziying Song, Lin Liu, Hongyu Pan, Bencheng Liao, Mingzhe Guo, Lei Yang, Yongchang Zhang, Shaoqing Xu, Caiyan Jia, Yadan Luo

机构 * School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science and Technology, Beijing Jiaotong University(北京交通大数据挖掘与具身智能关键实验室,北京交通大学计算机科学与技术学院) Horizon Robotics(地平线机器人) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) University of Macau(澳门大学) School of Electrical Engineering and Computer Science, The University of Queensland(昆士兰大学电子工程与计算机科学学院)

专题命中 端到端驾驶 :autonomous driving(title,abstract);end-to-end driving(abstract);分类 cs.RO、cs.CV

AI总结 DIVER通过融合强化学习与扩散生成,生成多样化可行轨迹,提升自动驾驶的泛化能力,解决模仿学习中的模式崩溃问题。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13460 2026-08-07 cs.CV 版本更新 83%

VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models

VISA: VLM引导的实例语义审计用于3D占据世界模型

Ruiqi Xian, Yuehan Xian, Jing Liang, Xuewei Qi, Dinesh Manocha

机构 * University of Maryland College Park(马里兰大学帕克分校) Nanjing University of Posts and Telecommunications(南京邮电大学) Stanford University(斯坦福大学) Motional AD Inc.(Motional AD公司)

专题命中 端到端驾驶 :occupancy(title,abstract);autonomous driving(abstract);分类 cs.CV

AI总结 提出VISA方法,利用离线VLM对每个物理对象实例进行结构化语义审计,并通过可靠性加权损失蒸馏到3D占据模型中,无需VLM推理即可提升封闭集占据mIoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24354 2026-06-23 cs.CV 版本更新 83%

SparseWorld: Enhancing End-to-End Autonomous Driving via World Models with Sparse Scene Representation

SparseWorld: 通过具有稀疏场景表示的世界模型增强端到端自动驾驶

Ruoyu Wang, Jingke Wang, Yukai Ma, Yuehao Huang, Shuangming Lei, Guanglin Xu, Aixue Ye, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学控制系统研究所) Labs, Huawei(华为2012实验室) State Key Laboratory of Industrial Control Technology(国家工业控制技术重点实验室)

专题命中 端到端驾驶 :autonomous driving(title);trajectory planning(abstract);end-to-end driving(abstract);分类 cs.CV

AI总结 提出SparseWorld,一种基于稀疏场景表示的轻量级世界模型,通过自回归预测未来地图元素和周围智能体,并利用预测结果优化下游运动预测和轨迹规划,在nuScenes数据集上实现0.05%的碰撞率,达到开放循环规划指标的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17386 2026-07-17 cs.CV cs.AI cs.RO 版本更新 82%

TerraTransfer: Learning End-to-End Driving Policies Without Expert Demonstrations

TerraTransfer: 无需专家示范的端到端驾驶策略学习

Zikang Xiong, Weixin Li, Zhouchonghao Wu, Akshay Rangesh, Saarth Bonde, Grantland Hall, Chen Tang, Yihan Hu, Wei Zhan

机构 * Applied Intuition UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校)

专题命中 端到端驾驶 :end-to-end driving(title);autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出一种无需专家示范的端到端驾驶方法,通过向量化模拟器中的自博弈预训练策略,再与预训练视觉骨干对齐,降低了数据成本并达到或超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21581 2026-06-26 cs.RO cs.CV 版本更新 82%

CogAD: Cognitive-Hierarchy Guided End-to-End Autonomous Driving

CogAD: 认知层次引导的端到端自动驾驶

Zhennan Wang, Jianing Teng, Canqun Xiang, Kangliang Chen, Xing Pan, Lu Deng, Weihao Gu

机构 * HAOMO.AI Technology Co., Ltd(HAOMO.AI技术有限公司)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 提出CogAD模型,通过全局到局部的层次感知和意图条件多模态轨迹生成,模拟人类驾驶员的认知层次机制,在nuScenes和Bench2Drive上实现端到端规划的最优性能,尤其在长尾场景和复杂真实驾驶条件下表现优异。

Comments CVPR2026 Workshop on Autonomous Driving

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13840 2026-08-13 cs.RO cs.CV 版本更新 81%

Multi-Agent Embodied Autonomous Driving: From V2X Information Exchange to Shared World Models

多智能体具身自动驾驶:从V2X信息交换到共享世界模型

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Yiqin Deng, Yuguang Fang

机构 * Lingnan University, Hong Kong(岭南大学(香港))

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08072 2026-07-15 cs.CV cs.RO 版本更新 81%

Post-Training in End-to-End Autonomous Driving

端到端自动驾驶中的训练后处理

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

机构 * Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24108 2026-07-09 cs.RO cs.CV 版本更新 81%

Zero-Human Demonstration End-to-end Autonomous Driving with Trajectory Scorer

基于轨迹评分器的零人类示范端到端自动驾驶

Zhenxin Li, Nadine Chang, Wenhao Yao, Xinglong Sun, Zi Wang, Maying Shen, Jingde Chen, Jingyu Song, Kailin Li, Zuxuan Wu, Shiyi Lan, Jose M. Alvarez

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究所) Fudan University(复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) NVIDIA University of Michigan(密歇根大学) East China Normal University(华东师范大学)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 研究提出ZTRS,一种基于强化学习的端到端自动驾驶规划范式,仅依靠真实世界图像和规则奖励训练,无需人类示范。通过详尽策略优化,能更好推广到长尾驾驶场景,在相关数据集上展现出优于模仿学习方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14329 2026-06-17 cs.RO cs.AI 版本更新 81%

SSIL: Self-Supervised Imitation Learning for End-to-End Driving

SSIL: 用于端到端驾驶的自监督模仿学习

Jin Bok Park, Jinkyu Lee, Muhyun Back, Hyun Min Han, Tianwei Ma, Sang Min Won, Sung Soo Hwang, Il Yong Chun

机构 * R & D Center, SL Corporation(SL公司研发中心) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) Department of Information and Communication Engineering, Handong Global University(翰林全球大学信息与通信工程系) College of Engineering, Texas A & M University-Corpus Christi(德克萨斯A&M大学科珀斯克里斯蒂分校工程学院) School of Computer Science and Electrical Engineering, Handong Global University(翰林全球大学计算机科学与电子工程学院)

专题命中 端到端驾驶 :end-to-end driving(title);autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 提出自监督模仿学习框架SSIL,利用车辆位姿生成伪转向角数据,无需驾驶命令或预训练模型,结合交叉注意力条件方法CACA,在三个基准数据集上达到与监督学习相当的驾驶精度。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18714 2026-06-16 cs.RO cs.AI cs.LG 版本更新 81%

Explainable deep learning improves human mental models of self-driving cars

可解释深度学习提升人类对自动驾驶汽车的心理模型

Eoin M. Kenny, Akshay Dharmavaram, Sang Uk Lee, Tung Phan-Minh, Shreyas Rajesh, Yunqing Hu, Laura Major, Momchil S. Tomov, Julie A. Shah

机构 * Computer Science & Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL),麻省理工学院) Motional AD Inc.(Motional AD公司) Department of Psychology and Center for Brain Science, Harvard University(心理学系和大脑科学中心,哈佛大学) Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(航空与宇航系,麻省理工学院)

专题命中 端到端驾驶 :self-driving(title,abstract);分类 cs.RO、cs.AI

AI总结 提出概念包装网络(CW-Net),在真实自动驾驶车上实现可解释规划,通过因果性概念解释提升驾驶员对车辆行为的预测能力,尤其在意外场景中。

Comments MST & JAS contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12560 2026-06-16 cs.CV cs.LG cs.RO 版本更新 81%

CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving

CoIRL-AD:面向自动驾驶的潜在世界模型中的协作-竞争模仿-强化学习

Xiaoji Zheng, Ziyuan Yang, Yanhao Chen, Yuhang Peng, Yuanrong Tang, Gengyuan Liu, Bokui Chen, Jiangtao Gong

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 提出CoIRL-AD框架,通过解耦模仿学习与强化学习、利用潜在世界模型进行长时程奖励估计以及引入竞争机制,在离线训练中提升自动驾驶的鲁棒性,尤其在跨城市泛化和长尾场景中表现优异。

Comments 19 pages, 22 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18757 2026-07-14 cs.CV 版本更新 79%

Driving Like Yourself: A Benchmark for Closed-Loop Personalized End-to-End Autonomous Driving

驾驶千面:一个闭环个性化端到端自动驾驶的基准

Xiaoru Dong, Ruiqin Li, Xiao Han, Zhenxuan Wu, Jiamin Wang, Jian Chen, Qi Jiang, SM Yiu, Xinge Zhu, Yuexin Ma

机构 * The University of Hong Kong(香港大学) ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.CV

AI总结 本文提出Person2Drive平台,通过个性化数据集、评价指标和框架,解决自动驾驶个性化难题,实现细粒度分析与有效个性化。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11417 2026-06-18 cs.CV cs.LG 版本更新 79%

Zero-Shot Cross-City Generalization in End-to-End Autonomous Driving: Self-Supervised versus Supervised Representations

端到端自动驾驶中的零样本跨城市泛化:自监督与监督表示

Fatemeh Naeinian, Ali Hamza, Haoran Zhu, Anna Choromanska

机构 * Department of Electrical and Computer Engineering, NYU Tandon School of Engineering(电气工程系,纽约大学Tandon工程学院)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.CV

AI总结 研究端到端自动驾驶模型在跨城市零样本迁移中的泛化能力,发现自监督预训练(如I-JEPA、DINOv2、MAE)相比监督预训练能显著减少位移和碰撞退化,提升闭环评估中的分布外PDMS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14438 2026-08-05 cs.RO cs.AI 版本更新 76%

CADET: Physics-Grounded Causal Auditing and Training-Free Deconfounding of End-to-End Driving Planners

CADET: 基于物理的因果审计与无训练去混杂的端到端驾驶规划器

Zikun Guo, Yuanyuan Li, Rongjin Zou

机构 * School of Electronics Engineering, Kyungpook National University(庆北国立大学电子工程学院)

专题命中 端到端驾驶 :end-to-end driving(title);分类 cs.RO、cs.AI

AI总结 提出CADET框架,无需重新训练即可审计和修复预训练端到端驾驶规划器中的虚假关联,通过物理因果图识别混杂因素并干预测试时输入。

Comments 8pages 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10719 2026-08-04 cs.RO cs.CV 版本更新 76%

From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving

从表征互补性到双系统:协同VLM和纯视觉骨干网络用于端到端驾驶

Sining Ang, Yuguang Yang, Chenxu Dang, Canyu Chen, Cheng Chi, Haiyan Liu, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) National Superior College for Engineers, Beihang University(北京航空航天大学国家级工程师学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Lenovo Group Limited(联想集团有限公司) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院)

专题命中 端到端驾驶 :end-to-end driving(title);分类 cs.RO、cs.CV

AI总结 本文通过协同VLM和纯视觉骨干网络,提出HybridDriveVLA和DualDriveVLA,提升端到端驾驶的PDMS性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07996 2026-07-21 cs.CV cs.RO 版本更新 73%

3D and 4D World Modeling: A Survey

3D和4D世界建模:一项综述

Lingdong Kong, Yu Yang, Jianbiao Mei, Youquan Liu, Ao Liang, Dekai Zhu, Dongyue Lu, Wei Yin, Xiaotao Hu, Mingkai Jia, Junyuan Deng, Kaiwen Zhang, Yang Wu, Tianyi Yan, Shenyuan Gao, Song Wang, Linfeng Li, Liang Pan, Yong Liu, Jianke Zhu, Wei Tsang Ooi, Steven C. H. Hoi, Ziwei Liu

机构 * WorldBench Team(WorldBench团队)

专题命中 端到端驾驶 :LiDAR(abstract);occupancy(abstract);分类 cs.RO、cs.CV

AI总结 该综述针对世界建模中对3D和4D表示利用不足及定义分类缺失的问题,通过建立精确概念、引入结构化分类法,系统总结相关数据集和评估指标,讨论应用、挑战与方向,为3D和4D世界建模领域提供基础参考。

Comments Survey; Project Page at https://worldbench.github.io/survey GitHub Repo at https://github.com/worldbench/awesome-3d-4d-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18313 2026-06-23 cs.CV 版本更新 70%

OmniNWM: Omniscient Driving Navigation World Models

OmniNWM:全知驾驶导航世界模型

Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, Xin Jin, Hao Zhao, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) PhiGent National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Wuhan University(武汉大学)

专题命中 端到端驾驶 :autonomous driving(abstract);occupancy(abstract);分类 cs.CV

AI总结 提出OmniNWM全知全景导航世界模型,在统一概率框架下处理状态、动作和奖励三个维度,实现多模态全景视频生成、零样本轨迹控制及内在奖励机制,在生成保真度和控制精度上达到SOTA。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25570 2026-07-30 cs.CV cs.AI cs.SE 版本更新 62%

The LAIA Dataset: Labelled Attention for Intelligent Automobiles

LAIA数据集:智能汽车的标记注意力

A. Contreras, D. Porres, R. Abad, P. Cano, A. Levy, G. Villalonga, A. M. López, A. Hernández-Sabaté

机构 * Computer Vision Center(计算机视觉中心) Computer Science Department of Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机科学系)

专题命中 端到端驾驶 :end-to-end driving(abstract);分类 cs.CV、cs.AI

AI总结 研究针对自动驾驶端到端驾驶范式的可解释性挑战,提出LAIA数据集,通过CARLA模拟器收集含多种数据的驾驶数据,可用于训练注意力感知模型等多种应用,并用其比较人类与模型注意力以洞察模型行为。

Comments 11 pages, 12 figures, 3 tables. Dataset and supplementary information available from the project website. Added an author who was inadvertently omitted from the previous version. No changes to the scientific content

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18735 2026-07-09 cs.CV cs.AI 版本更新 62%

Thinking Ahead: Foresight Intelligence in MLLMs and World Model

提前思考:多模态语言模型和世界模型中的预见智能

Zhantao Gong, Liaoyuan Fan, Qing Guo, Xun Xu, Xulei Yang, Shijie Li

机构 * College of Software, Nankai University, China(南开大学软件学院) The University of Hong Kong, China(香港大学) NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28489 2026-07-07 eess.IV cs.CV 版本更新 62%

Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms

视频生成模型作为世界模型:高效的范式、架构和算法

Muyang He, Hanzhong Guo, Junxiong Lin, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、eess.IV

AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16663 2026-07-07 cs.RO cs.CV cs.LG cs.SY eess.SY 版本更新 62%

Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models

使用潜在空间生成世界模型减轻自动驾驶模仿学习中的协变量转移

Alexander Popov, Alperen Degirmenci, David Wehr, Shashank Hegde, Ryan Oldja, Alexey Kamenev, Bertrand Douillard, David Nistér, Urs Muller, Ruchi Bhargava, Stan Birchfield, Nikolai Smolyanskiy

机构 * NVIDIA

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出用潜在空间生成世界模型解决自动驾驶协变量转移问题,训练时利用世界模型减轻该问题,无需大量训练数据,还引入新感知编码器,实验显示相比之前有显著改进。

Comments 8 pages, 6 figures, original September 2024, accepted at ICRA 2025 Workshop "Robots in the Wild", for associated video file, see https://youtu.be/7m3bXzlVQvU

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17855 2026-06-09 cs.AI cs.RO 版本更新 62%

QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Agents

QuickLAP: 为半自主代理快速语言-动作偏好学习

Jordan Abi Nader, David Lee, Nathaniel Dennler, Andreea Bobu

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本研究提出QuickLAP,一种融合物理和语言反馈的贝叶斯框架,用于实时推断奖励函数,通过大规模语言模型提取奖励特征注意力掩码和偏好偏移,从而在半自主驾驶模拟器中将奖励学习误差降低70%,并通过用户研究验证其可理解性和协作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02953 2026-08-11 cs.CV 版本更新 57%

RealWeather: Realistic and Scene-Faithful Weather Translation with Driving World Models

RealWeather:基于驾驶世界模型的逼真且场景忠实的天气转换

Yuwei Ning, Liangzhi Wang, Yi Xiao, Zhenhua Wu, Yun Pang, Mingkun Chang, Jichang Li, Guanbin Li

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV

AI总结 RealWeather是一种驾驶世界模型,通过渐进式逼真度引导和场景忠实度强化学习优化实现逼真且场景忠实的天气转换,在视觉逼真度、结构保留等方面优于现有方法,支持长尾天气场景生成与零样本泛化。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10804 2026-08-06 cs.CV 版本更新 57%

SCAIL-2: Unifying Controlled Character Animation with End-to-End In-Context Conditioning

SCAIL-2:通过端到端上下文条件统一受控角色动画

Wenhao Yan, Fengjia Guo, Zhuoyi Yang, Jie Tang

机构 * Z.ai Tsinghua University(清华大学)

专题命中 端到端驾驶 :end-to-end driving(abstract);分类 cs.CV

AI总结 提出SCAIL-2框架,通过端到端上下文条件统一受控角色动画,绕过中间表示直接利用驱动视频,并合成MotionPair-60K数据集,采用上下文掩码和模式RoPE实现统一,结合Bias-Aware DPO减少误差,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02851 2026-07-20 cs.RO 版本更新 57%

EmbodiedDiffusion: End-to-End Traversability-Guided Visual Diffusion for Heterogeneous Robot Navigation

EmbodiedDiffusion:用于异构机器人导航的端到端可通行性引导视觉扩散

Iana Zhura, Sausar Karaf, Faryal Batool, Nipun Dhananjaya Weerakkodi Mudalige, Valerii Serpiva, Ali Alridha Abdulkarim, Aleksey Fedoseev, Didar Seyidov, Hajira Amjad, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科沃科学与技术研究所)

专题命中 端到端驾驶 :trajectory planning(abstract);分类 cs.RO

AI总结 针对自主导航中视觉可通行性估计问题,EmbodiedDiffusion框架利用无规划器合成监督等,同时预测可通行性地图与生成可行轨迹,经训练提炼语义到轻量级模型,能快速适应新平台,在多机器人室内环境中实现高效导航与轨迹生成。

Comments This work has been submitted for publication and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31271 2026-07-13 cs.CV 版本更新 57%

DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions

DriveMA:基于可验证元动作的驾驶视觉-语言-动作模型

Weicheng Zheng, Yixin Huang, Qiao Sun, Derun Li, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) Tongji University(同济大学)

专题命中 端到端驾驶 :trajectory planning(abstract);分类 cs.CV

AI总结 提出DriveMA框架,通过可验证元动作弥合语言与动作的差距,结合动作中心监督训练和强化学习实现端到端驾驶规划,在Waymo Open Dataset上取得最优性能。

Comments arXiv admin note: text overlap with arXiv:2605.21273

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16923 2026-07-07 cs.CR cs.AI cs.LG 版本更新 57%

UNDREAM: Bridging Differentiable Rendering and Photorealistic Simulation for End-to-end Adversarial Attacks

UNDREAM:为端到端对抗攻击弥合可微渲染与逼真模拟的差距

Mansi Phute, Matthew Hull, Haoran Wang, Alec Helbling, ShengYun Peng, Willian Lunardi, Martin Andreoni, Wenke Lee, Duen Horng Chau

机构 * Georgia Institute of Technology(佐治亚理工学院) Technology Innovation Institute(技术创新研究院)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.AI

AI总结 针对自动驾驶等安全关键应用中深度学习模型对抗攻击测试问题,介绍UNDREAM框架,通过弥合逼真模拟器与可微渲染器差距,实现对3D物体对抗扰动的端到端优化,开启物理对抗攻击研究新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16732 2026-06-29 cs.CV 版本更新 57%

A Comprehensive Survey on World Models for Embodied AI

具身AI世界模型综述

Xinqing Li, Xin He, Le Zhang, Min Wu, Xiaoli Li, Yun Liu

机构 * College of Computer Science and the Academy for Advanced Interdisciplinary Studies, Nankai University(南开大学计算机科学学院与前沿交叉学科研究院) School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Institute for Infocomm Research (I2R), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局资讯通信研究院) Information Systems Technology and Design (ISTD) Pillar, Singapore University of Technology and Design (SUTD)(新加坡科技设计大学信息系统科技与设计系)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV

AI总结 本文系统综述了具身AI中的世界模型,提出了功能、时间建模和空间表示的三轴分类法,并总结了数据资源、评估指标及开放挑战。

Comments https://github.com/Li-Zn-H/AwesomeWorldModels

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03609 2026-06-17 cs.RO cs.LG 版本更新 57%

A 3D Isovist World Model -- Revealing a City's Unseen Geometry and Its Emergent Cross-City Signature

3D 等视域世界模型——揭示城市不可见几何及其涌现的跨城市特征

Xuhui Lin, Stephen Law, Nanjiang Chen, Kunyao Li, Tao Yang

机构 * The Bartlett School of Sustainable Construction University College London, UK(可持续建设学院伦敦大学学院,英国) Department of Geography University College London, UK(地理系伦敦大学学院,英国) School of Project Management, Faculty of Engineering The University of Sydney, AU(工程学院项目管理学院悉尼大学,澳大利亚) School of Engineering Cardiff University, UK(工程学院卡迪夫大学,英国) School of Architecture Tsinghua University, Beijing, CN(建筑学院清华大学,北京,中国)

专题命中 端到端驾驶 :occupancy(abstract);分类 cs.RO

AI总结 提出一种预测3D等视域(球形可见性深度图)的具身世界模型,通过深度残差和自滚动调度采样训练,发现跨城市空间特征可从时间潜变量中线性解码。

详情

展开后加载摘要…

URL PDF HTML 收藏