arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-06-02 至 2026-06-02 共收录 49 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 15 篇

2307.06647 2026-06-02 cs.RO cs.AI cs.CV 91%

DeepIPCv2: LiDAR-powered Robust Environmental Perception and Navigational Control for Autonomous Vehicle

DeepIPCv2: 基于LiDAR的鲁棒环境感知与自动驾驶导航控制

Oskar Natan, Jun Miura

机构 * Department of Computer Science and Electronics, Universitas Gadjah Mada(计算机科学与电子系,加查马达大学) Department of Computer Science and Engineering, Toyohashi University of Technology(计算机科学与工程系,toyohashi技术大学)

专题命中 感知 :LiDAR(title,title_cn);autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出DeepIPCv2端到端自动驾驶框架,通过融合LiDAR点云分割与多视图投影构建鲁棒场景表示,结合门控循环单元、命令特定多层感知器和PID控制器实现路径点与导航控制命令的联合估计,在光照变化下取得最低总指标误差和最少驾驶干预。

Comments This work has been accepted for publication in IEEE Access. https://ieeexplore.ieee.org/document/11313052

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20301 2026-06-02 cs.CV cs.AI 85%

Co-Fusion4D: Spatio-temporal Collaborative Fusion for Robust 3D Object Detection

Co-Fusion4D:面向鲁棒3D目标检测的时空协同融合

Wenxuan Li, Qin Zou, Shoubing Chen, Chi Chen, Yingyi Yang, Qingxiang Meng

机构 * Tsinghua University(清华大学)

专题命中 感知 :BEV(summary_cn,abstract);autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出Co-Fusion4D框架,通过当前帧主导-历史帧互补机制和双注意力融合模块,解决BEV检测器中跨帧时空不一致问题,在nuScenes上达到74.9% mAP和75.6% NDS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00416 2026-06-02 cs.CV 83%

4D Radar Meets LiDAR and Camera: Cooperative Perception under Adverse Weather

4D雷达与激光雷达和相机的结合:恶劣天气下的协同感知

Melih Yazgan, Iramm Hamdard, Qiyuan Wu, J. Marius Zoellner

机构 * FZI Research Center for Information Technology(FZI信息技术研究所以) Karlsruhe Institute of Technology(卡尔斯鲁厄大学)

专题命中 感知 :LiDAR(title,abstract);autonomous driving(abstract);分类 cs.CV

AI总结 针对恶劣天气下相机和激光雷达性能下降的问题,提出集成4D成像雷达作为鲁棒模态,并引入多普勒引导的空间注意力机制进行多智能体融合,显著提升雾雨环境下的协同感知鲁棒性。

Comments Accepted by CVPR - DriveX Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00069 2026-06-02 cs.RO eess.IV 81%

Invascal: Inverse-Vacuity Self-Calibration for Uncertainty-Aware LiDAR Range-View Semantic Segmentation

Invascal: 面向不确定性感知激光雷达距离视图语义分割的逆空性自校准

Kerim Turacan, Hannes Reichert, Andrei Bolandut, Konrad Doll

机构 * Faculty of Engineering and Computer Science, University of Applied Sciences Aschaffenburg(工程与计算机科学学院,阿施费尔德应用科学大学)

专题命中 感知 :LiDAR(title,abstract);分类 cs.RO、eess.IV

AI总结 提出一种与架构无关的不确定性感知适配器头,通过偏好头和强度头分解预测,并设计逆空性自校准目标(Invascal)来监督强度信号,实现可靠且校准良好的不确定性估计,同时保持分割精度。

Comments Accepted for publication at the 2026 IEEE 29th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01777 2026-06-02 cs.RO 79%

Trans2Occ: Voxel Occupancy Estimation and Grasp for Transparent Objects from Simulation to Reality

Trans2Occ: 从仿真到现实的透明物体体素占用估计与抓取

Yixuan Yang, Sha Zhang, Rui Li, Zhenfei Yin, Xinzhu Ma, Yiran Qin, Lei Bai, Xudong Xu, Shilin Shan, Wangmeng Zuo, Yanyong Zhang, Wanli Ouyang, Feng Zheng, Shixiang Tang, Dongzhan Zhou

机构 * Shanghai AI Laboratory(上海人工智能实验室) SUSTech(南方科技大学) CUHK(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) University of Oxford(牛津大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 感知 :occupancy(title,abstract);分类 cs.RO

AI总结 提出基于单视图RGB输入的体素占用预测框架,结合仿真数据生成与规则抓取策略,实现透明物体的鲁棒3D感知与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06182 2026-06-02 cs.RO cs.SY eess.SY 79%

Situation-Aware Interactive MPC Switching for Autonomous Driving

自动驾驶中的情境感知交互式MPC切换

Shuhao Qi, Qiling Aori, Luyao Zhang, Mircea Lazar, Sofie Haesaert

机构 * Eindhoven University of Technology(埃因霍温理工大学) Delft University of Technology(代尔夫特理工大学)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.RO

AI总结 针对自动驾驶中交互场景的挑战,提出一种基于神经网络的分类器,根据情境需求在不同MPC控制器间切换,以平衡性能和计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01757 2026-06-02 cs.CV 77%

PillarDETR: YOLO-Backbone and RT-DETR Head for Real-Time 3D Object Detection

PillarDETR:基于YOLO骨干和RT-DETR头的实时3D目标检测

Smit Kadvani, Shriya Gumber, Kriti Faujdar, Harsh Dave

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 感知 :LiDAR(abstract,abstract_cn);autonomous driving(abstract);分类 cs.CV

AI总结 提出PillarDETR架构,结合YOLOv8的CSP骨干和RT-DETR解码器,实现无需NMS的端到端实时3D目标检测,在KITTI和nuScenes上取得精度与速度的良好平衡。

Comments 6 pages, 1 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01549 2026-06-02 cs.CV 70%

ForestMamba: Sparse Mamba with Geometry-guided Queries for 3D Forest Point Cloud Segmentation

ForestMamba: 基于几何引导查询的稀疏Mamba用于3D森林点云分割

Trung Thanh Nguyen, Tuan-Anh Vu, Duc Viet Le, Yasutomo Kawanishi, Takahiro Komamizu, Ichiro Ide, Teja Kattenborn

机构 * Nagoya University(名古屋大学) RIKEN Seika(日本理化学研究所Seika研究中心) University of California, Los Angeles(加州大学洛杉矶分校) University of Twente(埃因霍温理工大学) Ritsumeikan University(立命馆大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 提出ForestMamba方法,通过稀疏编码器、几何引导查询初始化和Mamba查询解码器,实现高效且结构感知的森林点云分割,在七个森林区域上优于现有方法,推理速度提升3倍,GPU内存降低2.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00576 2026-06-02 cs.RO 70%

Dynamic Resilient Spatio-Semantic Memory with Hybrid Localization for Mobile Manipulation

面向移动操作的动态弹性时空语义记忆与混合定位

Zhijie Yan, Shufei Li, Ze Zhang, Xin Liu, Yuhang Zheng, Zuoxu Wang

机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出DREAM框架,通过在线构建时空语义体素记忆、冗余感知记忆剪枝和混合定位,实现无预建地图的动态室内移动操作,将长时任务成功率提升至55%-70%。

Comments Code, CAD model, and real-robot demonstrations are available at https://bjhyzj.github.io/dream-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12724 2026-06-02 cs.RO 70%

TRANS: Terrain-aware Reinforcement Learning for Agile Navigation of Quadruped Robots under Social Interactions

TRANS:面向社交互动下四足机器人敏捷导航的地形感知强化学习

Wei Zhu, Irfan Tito Kurniawan, Ye Zhao, Mitsuhiro Hayashibe

机构 * Department of Robotics, Graduate School of Engineering, Tohoku University(东邦大学机器人学系) Laboratory for Intelligent Decision and Autonomous Robots, Woodruff School of Mechanical Engineering, Georgia Institute of Technology(佐治亚理工学院智能决策与自主机器人实验室)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出一个名为TRANS的两阶段深度强化学习框架,通过三个DRL流水线(TRANS-Loco、TRANS-Nav和统一TRANS)实现四足机器人在非结构化地形上的社交导航,克服了传统方法中运动规划与运动控制分离、缺乏地形感知以及假设静态环境等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01689 2026-06-02 cs.CV cs.AI 62%

RPCASSM: Robust PCA State Space Model For Infrared Small Target Detection

RPCASSM: 基于鲁棒主成分分析的状态空间模型用于红外小目标检测

Pingping Liu, Aohua Li, Yubing Lu, Jin Kuang, Tongshun Zhang, Qiuzhan Zhou

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(教育部符号计算与知识工程重点实验室) College of Software, Jilin University(吉林大学软件学院) School of Geosciences, Yangtze University(长江大学地球科学学院) College of Communication Engineering, Jilin University(吉林大学通信工程学院)

专题命中 感知 :occupancy(abstract);分类 cs.CV、cs.AI

AI总结 针对红外小目标检测中主流状态空间模型难以准确建模目标边缘的问题,提出基于鲁棒主成分分析(RPCA)的RPCASSM网络,通过设计背景状态空间模块(BSSM)和目标状态空间模块(TSSM)分别利用空间异质信号显著性和目标稀疏局部高亮特性进行状态空间建模,有效解决了边缘建模难题。

Comments 12 pages, 8 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01192 2026-06-02 cs.CV 57%

PairedGTA: Generating Driving Datasets for Controlled Photometric Shift Analysis

PairedGTA:用于受控光度偏移分析的驾驶数据集生成

Andrea Chianese, Giulio Rossolini, Alessandro Biondi, Marco Cococcioni, Giorgio Buttazzo

机构 * Scuola Superiore Sant’Anna(圣安娜高等学院) Department of Excellence in Robotics & AI(机器人与人工智能卓越部门) University of Pisa(比萨大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出基于高保真游戏引擎的PairedGTA框架,通过生成完美配对的图像,实现独立于几何和语义变化的光度偏移分析,并用于评估语义分割模型在恶劣条件下的性能退化。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00688 2026-06-02 cs.CV 57%

Shape-Prior-Based Point Cloud Completion for Single-Stage Fully Sparse 3D Object Detection

基于形状先验的点云补全用于单阶段全稀疏3D目标检测

Kaizheng Wang, Mingqian Ji, Jian Yang, Shanshan Zhang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对单阶段全稀疏3D检测器中点云稀疏和不完整的问题,提出一种基于形状先验的点云补全方法,通过实例选择和对齐补全模块显著提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21361 2026-06-02 cs.CV cs.LG 57%

Domain Adaptation with a Single Vision-Language Embedding

基于单一视觉-语言嵌入的域适应

Mohammad Fahes, Tuan-Hung Vu, Andrei Bursuc, Patrick Pérez, Raoul de Charette

机构 * Inria(法国国家信息与自动化研究所) Kyutai(Kyutai公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出一种利用单一视觉-语言(VL)嵌入进行域适应的框架,通过提示/照片驱动的实例归一化(PIN)挖掘多种视觉风格,实现零样本和单样本无监督域适应,在语义分割任务上优于基线方法。

Comments International Journal of Computer Vision (IJCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02232 2026-06-02 cs.LG 50%

A Doeblin-Anchored Contrastive Chart for Learning Markov Transition Kernels

Doeblin锚定对比图:学习马尔可夫转移核

Ao Xu

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 感知 :occupancy(abstract)

AI总结 提出一种基于Doeblin锚定的对比坐标框架,通过对比目标学习有效的马尔可夫转移核,并引入可测马尔可夫化算子保证核有效性,实现非参数收敛率与有限时域误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 10 篇

2606.00519 2026-06-02 cs.RO 79%

DriveAnchor: Progressive Anchor-based Flow Learning for Autonomous Driving Planning

DriveAnchor: 用于自动驾驶规划的渐进式基于锚点的流学习

Limin Yan, Haoyun Tang, Yutao Qiu, Hongqing Liu, Haoyu Xu

机构 * Meituan Autonomous Driving(美团自动驾驶) Xi’an Jiaotong University(西安交通大学) Beijing Institute of Technology(北京理工大学)

专题命中 规划控制 :autonomous driving(title,abstract);分类 cs.RO

AI总结 提出三阶段框架DriveAnchor,通过示范流预训练、引导流后训练和奖励精炼流微调,实现行为多样性、可控性和安全性,在200万场景中近距碰撞率降低89%,平均奖励提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00470 2026-06-02 cs.RO 79%

LAP: Fast LAtent Diffusion Planner for Autonomous Driving

LAP:面向自动驾驶的快速潜在扩散规划器

Jinhao Zhang, Wenlong Xia, Zhexuan Zhou, Haoming Song, Youmin Gong, Jie Mei

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划控制 :autonomous driving(title,abstract);分类 cs.RO

AI总结 提出LAP框架,在VAE学习的潜在空间中进行规划,通过单步去噪实现高质量规划,在nuPlan基准上达到学习型规划方法的最优闭环性能,推理速度提升高达10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01367 2026-06-02 cs.RO cs.CV 73%

ActMVS: Active Scene Reconstruction with Monocular Multi-View Stereo

ActMVS:基于单目多视图立体的主动场景重建

Guo Pu, Yixuan Han, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 规划控制 :occupancy(abstract);trajectory planning(abstract);分类 cs.RO、cs.CV

AI总结 提出ActMVS框架,通过视图因子图构建和全局深度优化,实现单目相机在线生成高质量、全局一致的密集深度图,支持机器人/UAV的主动场景重建与安全轨迹规划。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00153 2026-06-02 cs.CV cs.AI 73%

DiffCrossGait: Trajectory-Level Alignment for 2D-3D Cross-Modal Gait Recognition via Latent Diffusion

DiffCrossGait:基于潜在扩散的2D-3D跨模态步态识别轨迹级对齐

Zhiyang Lu, Ming Cheng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划控制 :LiDAR(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对2D-3D跨模态步态识别中的域差异问题,提出DiffCrossGait,通过潜在扩散空间中的轨迹级对齐实现连续模态对齐,并引入三阶段对齐策略确保身份锚定、动态一致性和跨模态结构可恢复性,在SUSTech1K和FreeGait基准上达到最优性能。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00857 2026-06-02 cs.RO cs.AI 62%

From Cues to Horizons: Dynamic Risk Horizon Profiling for Trajectory Prediction

从线索到视野:轨迹预测的动态风险视界剖面

Xinyi Ning, Zilin Bian, Dachuan Zuo, Semiha Ergan, Kaan Ozbay

机构 * Department of Civil and Urban Engineering, New York University(纽约大学土木与城市工程系) Department of Civil Engineering Technology and Environmental Management Safety, Rochester Institute of Technology(罗切斯特理工学院土木工程技术与环境安全管理系)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 提出风险视界剖面(RHP)模块,通过连续可学习的势场模型对未来风险分布进行建模,以提升轨迹预测的准确性,在highD和SHRP2数据集上分别降低5秒RMSE 25.0%和5秒minFDE 29.1%。

Comments 11 pages, 7 figures, submitted to IEEE Transactions on Intelligent Transportation Systems (T-ITS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00933 2026-06-02 cs.RO 57%

Generative Multi-Robot Motion Planning via Diffusion Modeling with Multi-Agent Reinforcement Learning Guidance

基于扩散建模与多智能体强化学习引导的生成式多机器人运动规划

Suk Ki Lee, Venkata Sai Deepak Mutta, Hyunwoong Ko

机构 * School of Manufacturing Systems and Networks, Arizona State University, Mesa, AZ(1制造系统与网络学院,亚利桑那州立大学,梅萨,AZ) Michael W. Hall School of Mechanical Engineering, Mississippi State University, Starkville, MS(2迈克尔·W·霍尔机械工程学院,密西西比州立大学,斯塔克维尔,MS)

专题命中 规划控制 :trajectory planning(abstract);分类 cs.RO

AI总结 提出一种结合扩散模型与多智能体强化学习的框架,通过值函数引导反向扩散过程实现交互感知的轨迹生成,降低多机器人冲突率。

Comments 11 pages, 6 figures, 1 table. This paper has been accepted for publication in the proceedings of ASME IDETC-CIE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00471 2026-06-02 cs.CV 57%

MUSCLE-NET: Predicted-Multiscale-Aware Network for Pedestrian Trajectory Forecasting

MUSCLE-NET:面向行人轨迹预测的预测多尺度感知网络

Yu Liu, Ming Huang, Xiao Ren, Zhijie Liu, Youfu Li, He Kong

机构 * Guangdong Provincial Key Laboratory of Fully Actuated System Control Theory and Technology, School of Automation and Intelligent Manufacturing, Southern University of Science and Technology (SUSTech), Shenzhen(广东省全主动系统控制理论与技术重点实验室,自动化与智能制造学院,南方科技大学(SUSTech),深圳) Department of Mechanical Engineering, City University of Hong Kong, Hong Kong SAR, China(香港城市大学机械工程系,香港特别行政区,中国)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.CV

AI总结 提出MUSCLE-NET,通过多尺度多模态特征提取和尺度自适应预测机制,解决现有方法对观测信息利用不足及忽视未来运动尺度依赖的问题,在JAAD和PIE数据集上取得竞争性能。

Comments This manuscript has been accepted to the IEEE Transactions on Intelligent Transportation Systems as a regular paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01972 2026-06-02 eess.SY cs.SY 50%

AI-Based KPI Prediction Methods in Future 6G Networks: A Survey

基于AI的未来6G网络KPI预测方法:综述

Niloofar Mehrnia, Gourav Prateek Sharma, Samie Mostafavi, Andreas Johnsson, Sinem Coleri, Carlo Fischione, James Gross

专题命中 规划控制 :autonomous driving(abstract)

AI总结 本文系统综述了面向未来6G网络的数据驱动KPI预测方法,提出了多维分类法,分析了从经典统计模型到深度学习和强化学习的代表性方法,并讨论了部署挑战和未来研究方向。

Comments Submitted to IEEE Communications Surveys and Tutorials, 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01839 2026-06-02 cs.DC cs.AR cs.LG 50%

Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving

观察而非预测:面向智能体服务的对话级解耦调度

Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

机构 * Anonymous Authors(匿名作者)

专题命中 规划控制 :occupancy(abstract)

AI总结 提出将调度单元从单轮提升至整个对话,利用对话中首轮计算密集与后续内存密集的两阶段可观察特性,实现无需预测的解耦调度,显著降低延迟并提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30190 2026-06-02 cs.LG 50%

Mean-Field Diffuser: Scaling Offline MARL to Thousands of Agents

均场扩散器:将离线多智能体强化学习扩展到数千个智能体

Wenhao Li, Xiangfeng Wang, Bo Jin

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 规划控制 :trajectory planning(abstract)

AI总结 提出MF-Diffuser框架,通过将轨迹规划提升到轨迹分布的Wasserstein空间,并利用混沌传播和分层粗到细策略,将离线多智能体强化学习扩展到数千个智能体,理论证明均场近似误差为$O(H^2/\sqrt{N})$且离线分布偏移不随群体规模增长,实验在三个均场RL基准上取得最佳回报。

Comments 62 pages, 15 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 5 篇

2606.02105 2026-06-02 cs.CV 83%

Multimodal Action Diffusion for Robust End-to-End Autonomous Driving

多模态动作扩散用于鲁棒的端到端自动驾驶

Jorge Daniel Rodríguez-Vidal, Diego Porres, Gabriel Villalonga Pineda, Antonio M. López Peña

机构 * Computer Vision Center (CVC)(计算机视觉中心) Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学)

专题命中 端到端驾驶 :autonomous driving(title,abstract);end-to-end driving(abstract);分类 cs.CV

AI总结 提出动作扩散变换器(ADT),通过多模态动作建模和最近邻匹配,在闭环Bench2Drive基准上超越先前最优方法,同时延迟降低十倍。

Comments Preprint. June 1st, 2026. Corresponding author: Jorge Daniel Rodríguez-Vidal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00191 2026-06-02 cs.RO cs.CV 81%

Safe2Drive: Evaluating Safe Driving Behaviors of E2E Autonomous Driving Models

Safe2Drive: 评估端到端自动驾驶模型的安全驾驶行为

Nishad Sahu, Kalpana Panda, Congyuan Yu, Changzhong Qian, Shounak Sural, Ragunathan Rajkumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Birla Institute of Technology and Science Pilani(比拉理工学院和科学帕利尼)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 针对端到端自动驾驶模型在常见安全关键场景中表现脆弱的问题,提出Safe2Drive测试集和安全驾驶评分(SDS),评估发现领先模型在安全场景中驾驶得分大幅下降且SDS较低。

Journal ref CVPR Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00267 2026-06-02 cs.CV cs.AI cs.LG cs.RO 67%

StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement

StressDream: 引导视频世界模型实现鲁棒的策略评估与改进

Junwon Seo, Sushant Veer, Ran Tian, Wenhao Ding, Apoorva Sharma, Karen Leung, Edward Schmerling, Marco Pavone, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA Research(NVIDIA研究) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出StressDream方法,通过优化扩散视频世界模型的初始噪声,在推理时引导生成高影响且合理的未来场景,以支持鲁棒的策略评估与改进。

Comments Project page: https://junwon.me/StressDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01164 2026-06-02 cs.CV 57%

Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends

迈向交互式视频世界建模:前沿、挑战、基准与未来趋势

Jiuming Liu, Chaojun Ni, Mengmeng Liu, Chensheng Peng, Fangjinhua Wang, Sitian Shen, Marc Pollefeys, Masayoshi Tomizuka, Ayush Tewari, Per Ola Kristensson

机构 * Department of Engineering, University of Cambridge, U.K.(剑桥大学工程系) Peking University(北京大学) University of Twente(埃因霍温理工大学) Mechanical Systems Control Laboratory, University of California, Berkeley, USA(加州大学伯克利分校机械系统控制实验室) ETH Zurich(苏黎世联邦理工学院) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV

AI总结 本文系统综述了交互式世界建模的研究趋势、技术挑战、评估基准,并提出了未来方向,重点在于动作条件可控性、长程交互与记忆以及实时响应性。

Comments Under review. The GitHub repository is publicly available at: https://github.com/liujiuming123/Awesome-Interactive-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05335 2026-06-02 cs.RO 57%

State-Conditional Adversarial Learning: An Off-Policy Visual Domain Transfer Method for End-to-End Imitation Learning

状态条件对抗学习:一种用于端到端模仿学习的离策略视觉域迁移方法

Yuxiang Liu, Shengfan Cao

机构 * University of California, Berkeley, CA, USA(加州大学伯克利分校)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO

AI总结 针对目标域数据严格离策略、无专家且稀缺的挑战,提出状态条件对抗学习(SCAL),通过状态条件潜在KL散度的判别器估计对齐分布,实现鲁棒的视觉域迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏