arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-04-21 至 2026-04-21 共收录 6 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6 篇

2507.20879 2026-04-21 cs.CV 79%

DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking

DriveAgent-R1: 通过主动感知和混合思维推进基于视觉语言模型的自动驾驶

Weicheng Zheng, Xiaofei Mao, Nanfei Ye, Pengxiang Li, Kun Zhan, Xianpeng Lang, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) LiAuto Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV

AI总结 DriveAgent-R1通过主动感知和混合思维框架,提升自动驾驶中的视觉推理能力,采用三阶段训练策略,在复杂场景中实现高效决策,展现与顶级模型相当的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17651 2026-04-21 cs.CV cs.RO 79%

Infrastructure-Centric World Models: Bridging Temporal Depth and Spatial Breadth for Roadside Perception

以基础设施为中心的世界模型:弥合时间深度与空间广度以实现道路感知

Siyuan Meng, Chengbo Ai

机构 * Department of Civil and Environmental Engineering, University of Massachusetts Amherst(土木与环境工程系,马萨诸塞大学阿默斯特分校)

专题命中 感知 :LiDAR(abstract,abstract_cn);autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 本文提出以基础设施为中心的世界模型,通过时空互补性提升道路感知能力,提出三阶段框架和双层架构,结合多模态数据引擎和开放源代码基础,推动基础设施理解交通。

Comments 18 pages, 7 tables, 1 figure, vision paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18476 2026-04-21 cs.CV 70%

SemLT3D: Semantic-Guided Expert Distillation for Camera-only Long-Tailed 3D Object Detection

SemLT3D: 基于语义的专家蒸馏用于仅相机的长尾3D目标检测

Hao Vo, Khoa Vo, Thinh Phan, Ngo Xuan Cuong, Gianfranco Doretto, Hien Nguyen, Anh Nguyen, Ngan Le

机构 * AICV Lab, University of Arkansas, USA(AICV实验室,阿肯色大学,美国) University of Utah, USA(犹他大学,美国) University of Houston, USA(休斯顿大学,美国) University of Liverpool, UK(利物浦大学,英国)

专题命中 感知 :autonomous driving(abstract);LiDAR(abstract);分类 cs.CV

AI总结 针对仅相机3D目标检测中长尾不平衡问题,提出SemLT3D框架,通过语义先验增强稀有类别表示,结合语言引导的专家混合模块和语义投影蒸馏流程,提升模型对长尾分布和复杂场景的识别能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03191 2026-04-21 cs.CV 70%

CORP: A Multi-Modal Dataset for Campus-Oriented Roadside Perception Tasks

CORP:面向校园道路感知任务的多模态数据集

Beibei Wang, Zijian Yu, Lu Zhang, Jingjing Huang, Yao Li, Haojie Ren, Yuxuan Xiao, Yuru Peng, Jianmin Ji, Yu Zhang, Yanyong Zhang

机构 * Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 感知 :autonomous driving(abstract);LiDAR(abstract);分类 cs.CV

AI总结 本文提出CORP数据集,首个针对校园场景的多模态道路感知任务基准数据集,包含205k张图像和102k点云,用于提升校园区域的3D跟踪和实例分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16857 2026-04-21 cs.CV cs.RO 62%

BOP-ASK: Object-Interaction Reasoning for Vision-Language Models

BOP-ASK:面向视觉-语言模型的对象交互推理

Vineet Bhat, Sungsu Kim, Valts Blukis, Greg Heinrich, Prashanth Krishnamurthy, Ramesh Karri, Stan Birchfield, Farshad Khorrami, Jonathan Tremblay

机构 * New York University(纽约大学) NVIDIA(英伟达)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.CV

AI总结 本文提出BOP-ASK数据集,用于训练和评估视觉-语言模型的对象交互推理能力,包含15万张图像和3300万对问题答案,涵盖六个任务,验证了模型在复杂环境中的空间推理能力。

Comments Accepted at CVPR 2026. Code, Datasets & Benchmark available at https://bop-ask.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16582 2026-04-21 cs.CV cs.AI 62%

Camo-M3FD: A New Benchmark Dataset for Cross-Spectral Camouflaged Pedestrian Detection

Camo-M3FD:一种新的跨光谱伪装行人检测基准数据集

Henry O. Velesaca, Andrea Mero, Guillermo A. Castillo, Angel D. Sappa

机构 * ESPOL Polytechnic University(ESPOL理工大学) Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心) Software Engineering Department, Research Center for Information and Communication Technologies (CITIC-UGR), University of Granada(格拉纳达大学软件工程系,信息与通信技术研究中心(CITIC-UGR)) Università della Svizzera Italiana(瑞士意大利大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Camo-M3FD数据集,用于跨光谱伪装行人检测,通过高精度图像对和标准化评估框架提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏