arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-05-13 至 2026-05-13 共收录 9 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 9 篇

2605.08133 2026-05-13 cs.CV cs.AI 81%

VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving

VLADriver-RAG:基于检索增强的视觉-语言-动作模型用于自动驾驶

Rui Zhao, Haofeng Hu, Zhenhai Gao, Jiaqiao Liu, Gao Fei

机构 * College of Automotive Engineering(汽车工程学院) The National Key Laboratory of Automotive Chassis Integration and Bionics(汽车底盘集成与生物力学国家级重点实验室) ReeFocus AI Technology(ReeFocus人工智能技术)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLADriver-RAG,通过构建结构化的历史知识,提升自动驾驶中长尾场景的泛化能力,采用视觉到场景机制和场景对齐嵌入模型,结合查询驱动的VLA骨干网络,实现高精度轨迹合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13311 2026-05-13 cs.CV cs.AI 79%

A Resource Efficient Fusion Network for Object Detection in Bird's-Eye View using Camera and Raw Radar Data

一种用于鸟瞰图中物体检测的资源高效融合网络:使用摄像头和原始雷达数据

Kavin Chandrasekaran, Sorin Grigorescu, Gijs Dubbelman, Pavol Jancura

机构 * ElektroBit Automotive GmbH Eindhoven University of Technology(埃因霍温理工大学) Transilvania University of Brasov(布拉索夫特拉扬大学)

专题命中 感知 :BEV(abstract,abstract_cn);autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种资源高效的融合网络,通过直接使用雷达原始范围-多普勒谱数据和摄像头图像处理,提升鸟瞰图中物体检测的准确性和效率。

Comments IEEE Intelligent Transportation Systems Conference (ITSC) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11520 2026-05-13 cs.CV cs.AI 62%

PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splatting

PointGS: 基于3D高斯散射的语义一致无监督3D点云分割

Yixiao Song, Qingyong Li, Wen Wang, Zhicheng Yan

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能在交通运输中的关键实验室(北京交通大学),教育部) Frontiers Science Center for Smart High-speed Railway System, Beijing Jiaotong University(智能高速铁路系统前沿科学中心,北京交通大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 PointGS通过3D高斯散射统一中间表示,解决3D点云与2D图像的语义一致性问题,实现无监督分割,优于现有方法,在ScanNet-V2和S3DIS上分别提升0.9%和2.8%的mIoU。

Comments Accepted by Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10201 2026-05-13 cs.RO cs.AI 62%

HeteroGenManip: Generalizable Manipulation For Heterogeneous Object Interactions

HeteroGenManip:异构物体交互的通用操作

Zhenhao Shen, Zeming Yang, Yue Chen, Yuran Wang, Shengqiang Xu, Mingleyang Li, Hao Dong, Ruihai Wu

机构 * Peking University(北京大学) Tianjin University(天津大学)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.AI

AI总结 本文提出HeteroGenManip框架,通过两阶段方法解决机器人异构物体交互中的接触点定位和轨迹规划问题,实现跨类型物体的鲁棒泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05077 2026-05-13 cs.CV 57%

FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching

FlowDIS:基于流匹配的语言引导二元图像分割

Andranik Sargsyan, Shant Navasardyan

机构 * Picsart AI Research (PAIR)(Picsart AI研究院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出FlowDIS,一种基于流匹配框架的二元图像分割方法,通过文本提示实现精确像素级对象分割,实验表明其在DIS-TE测试集上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11678 2026-05-13 cs.AI 57%

OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models

无需显存的Alpamayo通过CPU-GPU内存交换用于视觉-语言-动作模型

Seungwoo Roh, Huiyeong Kim, Jong-Chan Kim

机构 * Graduate School of Automobile and Mobility, Kookmin University, Korea(汽车与移动研究生院,韩国高垣大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 本文提出一种无需修改模型的内存高效方法,通过系统级优化实现视觉-语言-动作模型在显存受限的GPU上的推理,提升性能并保持精度。

Comments Submitted to IEEE RTCSA on March 26, 2026 (KST); Accepted on May 4, 2026 (KST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11521 2026-05-13 cs.CV 57%

XWOD: A Real-World Benchmark for Object Detection under Extreme Weather Conditions

XWOD:面向极端天气条件的现实世界目标检测基准

Chih-Hsin Chen, Yu-Tung Liu, Amar Fadillah, Kuan-Ting Lai, Dong Liu

机构 * Department of Electronic Engineering(电子工程系) National Taipei University of Technology(台北科技大学) Adobe Inc.(Adobe公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出XWOD基准,包含10010张图像和42924个边界框,涵盖七种极端天气条件,通过训练标准YOLO模型在其他基准上取得显著提升,验证了数据质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04647 2026-05-13 cs.RO 57%

ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving

ReflectDrive-2: 用于离散扩散驾驶的强化学习对齐的自我编辑

Huimin Wang, Yue Wang, Bihao Cui, Pengxiang Li, Ben Lu, Mingqian Wang, Tong Wang, Chuan Tang, Teng Zhang, Kun Zhan

机构 * LiAuto

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 ReflectDrive-2通过平行掩码解码生成离散轨迹令牌,结合强化学习训练提升驾驶性能,实现轨迹实时修正,达到91.0 PDMS成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12677 2026-05-13 astro-ph.IM astro-ph.CO 50%

Murriyang cryogenic phased array feed: spectral-line results and noise-reduction methods

Murriyang低温相控阵馈源:谱线结果与噪声削减方法

L. Staveley-Smith, S. Barker, R. Berangi, A. B. Bolin, S. Broadhurst, J. D. Bunton, N. Carter, S. Castillo, W. Chandler, A. Chippendale, J. R. Dawson, F. Di Dio, A. R. Dunning, S. Gordon, J. A. Green, A. Hafner, D. B. Hayman, D. Humphrey, A. Jameson, S. Johnston, J. F. Kaczmarek, J. Ma, G. Perry, M. Pilawa, J. Rhee, L. Toomey, J. van Aardt, N. Wang

专题命中 感知 :occupancy(abstract)

AI总结 本文介绍了Murriyang望远镜Parkes的新型低温相控阵馈源(cryoPAF)的谱线结果及噪声削减方法,展示了其在视场、 aperture效率、带宽等方面的优势,并通过HI观测验证了其性能。

Comments 20 pages, 18 figures, accepted by PASA (11 February 2026), abbreviated abstract

Journal ref Publ. Astron. Soc. Aust. 43 (2026) e057

详情

展开后加载摘要…

URL PDF HTML 收藏