arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-06-12 至 2026-06-12 共收录 12 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 5 篇

2606.12628 2026-06-12 cs.CV 新提交 79%

Context-Aware Feature-Fusion for Co-occurring Object Detection in Autonomous Driving

面向自动驾驶中共现对象检测的上下文感知特征融合

Binay Kumar Singh, Niels Da Vitoria Lobo

机构 * Department of Computer Science, University of Central Florida(中佛罗里达大学计算机科学系)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV

AI总结 提出上下文中心特征融合框架CCFF,通过局部上下文融合模块和全局上下文注意力模块分别处理小/遮挡对象与共现先验,提升共现对象检测性能,在Cityscapes和BDD100K上实现类别一致性策略0.973和0.969,小目标检测AP_S提升14.1%。

Comments 8 pages, 3 figures, CVPR 2026 Precognition Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13222 2026-06-12 cs.RO cs.AI 新提交 62%

Proprioceptive-visual correspondence enables self-other distinction in humanoid robots

本体感觉-视觉对应使能人形机器人的自我-他人区分

Yurun Chen, Tianyuan Gao, Yizhong Ge, Shikun Ban, Yizhou Wang, Hongkai Xiong, Wenjun Zeng, Wentao Zhu

机构 * Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) East China Normal University(华东师范大学) Ningbo Institute of Digital Twin(宁波数字孪生研究院)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI

AI总结 提出通过本体感觉与视觉的对应学习自我-他人区分,无需身份标签或运动学模型,并建立预测性自我模型,支持目标到达、碰撞感知运动规划和运动重定向。

Comments 23 pages, 9 figures, 1 supplementary table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12603 2026-06-12 cs.RO cs.AI 新提交 62%

From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation

从模仿到对齐:面向长距离人行道导航的人类偏好流策略

Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 提出FlowPilot,一种仅使用单目RGB相机的无地图导航策略,通过锚定流匹配进行预训练,并引入人类偏好学习实现对齐,在长距离人行道导航中提升鲁棒性和社会合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13049 2026-06-12 cs.RO 新提交 57%

Y-BotFrame: An Extensible Embodied Agent Framework for Quadruped Robot Assistants

Y-BotFrame:一种用于四足机器人助手的可扩展具身智能体框架

Luyao Zhang, Ke Li, Yuan Ding, Xulong Zhao, Guo Yu, Chengwei Yan, Fuyu Dong, Jiawei Hu, Di Wang, Nan Luo, Gang Liu, Quan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 提出Y-BotFrame框架,集成多模态感知与大语言模型认知核心,将自然语言指令映射为可执行任务单元,实现无遥控器的人机协作,支持模块化扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12579 2026-06-12 cs.RO 新提交 57%

G-MAPP: GPU-accelerated Multi-Agent Planning and Perception for Reactive Motion Generation

G-MAPP: 基于GPU加速的多智能体规划与感知用于反应式运动生成

Tanmay Bishnoi, Riddhiman Laha, Tobias Löw, Jose Alex Chandy, Luis F. C. Figueredo, Sami Haddadin

机构 * Department of Electrical, Computer, and Biomedical Engineering, Toronto Metropolitan University(多伦多都会大学电气、计算机与生物医学工程系) Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所) Institute for Experiential Robotics, Northeastern University(东北大学体验式机器人研究所) Idiap Research Institute(Idiap 研究所) EPFL(瑞士联邦理工学院洛桑) CHART Group at the School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院 CHART 小组) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 提出GPU加速的框架,通过并行状态探索和紧密耦合感知-动作循环,实现非结构化环境中的实时反应式运动生成,在7自由度机器人上达到5倍加速并成功避障。

Comments The implementation is available at: https://github.com/chart-research/g-mapp

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7516-7523, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 4 篇

2606.12706 2026-06-12 cs.CV 新提交 74%

VLADriveBench: Evaluating CoT-Action Relationship in VLA for Autonomous Driving

VLADriveBench:评估自动驾驶VLA中的CoT-动作关系

Thach Nguyen, Danhua Guo, Tom Lampo, Fei Wu, Burhan Yaman

机构 * Uber AV Labs(优步自动驾驶实验室)

专题命中 规划控制 :autonomous driving(title);分类 cs.CV

AI总结 提出VLADriveBench框架,结合观察指标和CoT干预协议评估VLA模型中思维链与驾驶动作的相关性和因果性,发现不同模型表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12783 2026-06-12 cs.AI 新提交 57%

A Tutorial on World Models and Physical AI

世界模型与物理AI教程

Il-Seok Oh

机构 * Department of Computer Science and Artificial Intelligence/CAIIT, Jeonju, Jeonbuk, South Korea(韩国全北全州计算机科学与人工智能系/CAIIT)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.AI

AI总结 本文提出统一框架,区分显式与隐式世界模型,并探讨其在机器人、自动驾驶等物理AI领域的应用,以及迈向通用人工智能的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12774 2026-06-12 eess.SY cs.AI cs.CL cs.SY 新提交 57%

Agentic MPC for Semantic Control System Resynthesis

用于语义控制系统再综合的智能体MPC

Yuya Miyaoka, Masaki Inoue

机构 * University of Tokyo(东京大学)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.AI

AI总结 提出智能体MPC框架,通过集成大语言模型智能体实现上下文感知的语义自适应控制综合,在自动驾驶场景中验证其根据个人偏好或社交情境(如避让应急车辆)调整控制的能力。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13605 2026-06-12 math.OC cs.LG cs.SY eess.SY 新提交 50%

Distribution-Agnostic Robust Trajectory Optimization via Chance-Constrained Reinforcement Learning

基于机会约束强化学习的分布无关鲁棒轨迹优化

Yashdeep Chaudhary, Roberto Armellin, Harry Holt, Marco Sagliano

机构 * Auckland University(奥克兰大学)

专题命中 规划控制 :trajectory planning(abstract)

AI总结 提出一种分布无关的鲁棒轨迹优化框架,通过机会约束强化学习处理初始条件和过程噪声的不确定性,采用离线标称轨迹与在线仿射闭环校正,在两种不同轨迹设计问题上验证了概率可行性与燃料效率。

Comments Preprint. 39 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. BEV与占用 1 篇

2606.12981 2026-06-12 cs.CV 新提交 93%

Camera and LiDAR BEV Fusion for Cooperative 3D Object Detection on TUMTraf V2X

用于TUMTraf V2X协同3D目标检测的相机与LiDAR BEV融合

Muhammad Shahbaz, Shaurya Agarwal

机构 * Department of Civil, Environmental and Construction Engineering, University of Central Florida(中佛罗里达大学土木、环境与建筑工程系)

专题命中 BEV与占用 :BEV(title,title_cn);LiDAR(title,title_cn);分类 cs.CV

AI总结 提出一种融合路边相机与基础设施-车辆点云的BEV空间检测器,采用CenterPoint风格头部和IoU重排序,在DriveX 2026挑战赛公开测试集上达到0.85 mAP,并分析了训练/验证与测试集重叠对分数的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 激光雷达 1 篇

2606.13503 2026-06-12 cs.CV cs.AI cs.RO 新提交 88%

Heterogeneous LiDAR Early Fusion and Learned Re-Ranking Strategy for Robust Long-Term Place Recognition in Unstructured Environments

异构激光雷达早期融合与学习重排序策略用于非结构化环境中的鲁棒长期地点识别

Judith Vilella-Cantos, Juan José Cabrera, Mónica Ballesta, David Valiente, Luis Payá

机构 * Miguel Hernández University of Elche(米格尔·埃尔南德斯·德埃尔切大学)

专题命中 激光雷达 :LiDAR(title,summary_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 提出MinkUNeXt-VINE++方法,通过异构LiDAR数据早期融合和学习重排序策略,在非结构化环境(如葡萄园)中显著提升长期地点识别性能,Recall@1指标提升20%-30%。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真评测 1 篇

2606.12236 2026-06-12 cs.RO cs.CV 新提交 81%

DrivingAgent: Design and Scheduling Agents for Autonomous Driving Systems

DrivingAgent: 自动驾驶系统的设计与调度智能体

Zhongyu Xia, Wenhao Chen, Yongtao Wang, Ming-Hsuan Yang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) University of California, Merced(加州大学默塞德分校)

专题命中 仿真评测 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 提出DrivingAgent框架,通过自动化模块开发(设计阶段)和强化学习训练的轻量级LLM实时调度(调度阶段),解决自动驾驶系统集成新模型和满足实时约束的挑战,在nuScenes和Bench2Drive上取得更优速度-精度权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏