arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-05-01 至 2026-05-01 共收录 6 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6 篇

2512.14044 2026-05-01 cs.CV cs.AI 81%

OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving

OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶

Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) MEGVII Technology(美科维七科技) AFARI

专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27414 2026-05-01 cs.CV cs.CR cs.LG 79%

Understanding Adversarial Transferability in Vision-Language Models for Autonomous Driving: A Cross-Architecture Analysis

理解视觉语言模型在自动驾驶中的对抗转移性:跨架构分析

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Mert D. Pese

机构 * School of Computing, Clemson University, USA(克莱姆森大学计算机学院)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV

AI总结 本文通过跨架构研究探讨视觉语言模型在自动驾驶中的对抗转移性,评估了三种架构在不同场景下的对抗效果,发现高跨架构有效性。

Comments 9 pages, 2 figures. Accepted at SAE WCX 2026

Journal ref SAE Technical Paper 2026-01-0170, SAE WCX 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12414 2026-05-01 cs.CV cs.AI cs.LG cs.RO 69%

AutoVDC: Automated Vision Data Cleaning Using Vision-Language Models

AutoVDC:利用视觉-语言模型实现自动化视觉数据清洗

Santosh Vasa, Aditi Ramadwar, Jnana Rama Krishna Darabattula, Md Zafar Anwar, Stanislaw Antol, Andrei Vatavu, Thomas Monninger, Sihao Ding

机构 * Mercedes-Benz Research & Development North America(梅赛德斯-奔驰北美研发公司) University of Stuttgart, Institute for Artificial Intelligence(斯图加特大学人工智能研究所)

专题命中 感知 :autonomous driving(abstract,comments);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出AutoVDC框架,利用视觉-语言模型自动识别视觉数据集中的错误标注,提升数据质量。通过KITTI和nuImages数据集验证,展示了方法在错误检测和数据清洗中的高性能。

Comments Accepted to IV 2026 Drive-X Foundation Models for Autonomous Driving (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27499 2026-05-01 cs.CV 57%

Towards All-Day Perception for Off-Road Driving: A Large-Scale Multispectral Dataset and Comprehensive Benchmark

迈向全天候越野驾驶的感知:一个大规模多光谱数据集和全面基准

Shuo Wang, Jilin Mei, Wenfei Guan, Shuai Wang, Yan Xing, Chen Min, Yu Hu

机构 * Research Center for Intelligent Computing Systems, Institute of Computing Technology, Chinese Academy of Sciences, Beijing(智能计算系统研究中心,计算技术研究所,中国科学院,北京) Beijing Institute of Control Engineering(北京控制工程研究所)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出IRON数据集和IRONet框架,解决越野夜间驾驶中可见光感知不可靠的问题,通过多光谱数据和内存注意力机制提升全天候自由空间检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22046 2026-05-01 cs.CV cs.CR 57%

Backdoor Attacks on Prompt-Driven Video Segmentation Foundation Models

针对提示驱动视频分割基础模型的后门攻击

Zongmin Zhang, Zhen Sun, Yifan Liao, Wenhan Dong, Xinlei He, Xingshuo Han, Shengmin Xu, Xinyi Huang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Fujian Normal University(福建师范大学) Jinan University(暨南大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文研究了针对提示驱动视频分割基础模型的后门攻击,提出BadVSFM框架,通过两阶段策略实现可控的后门效果,实验表明其在多种模型和数据集上具有有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17435 2026-05-01 cs.RO 57%

ImagineNav++: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination

ImagineNav++: 通过场景想象促使视觉语言模型作为具身导航器

Teng Wang, Xinxin Zhao, Wenzhe Cai, Changyin Sun

机构 * School of Automation, Southeast University(东南大学自动化学院)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 本文提出ImagineNav++,通过场景想象将视觉语言模型用于无地图导航,利用想象模块生成高探索潜力的视点,并通过选择性聚焦记忆机制实现空间一致性,实验表明其在无地图导航中表现优异。

Comments 17 pages, 10 figures. arXiv admin note: text overlap with arXiv:2410.09874

详情

展开后加载摘要…

URL PDF HTML 收藏