arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-05-13 至 2026-05-13 共收录 24 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 9 篇

2605.08133 2026-05-13 cs.CV cs.AI 81%

VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving

VLADriver-RAG:基于检索增强的视觉-语言-动作模型用于自动驾驶

Rui Zhao, Haofeng Hu, Zhenhai Gao, Jiaqiao Liu, Gao Fei

机构 * College of Automotive Engineering(汽车工程学院) The National Key Laboratory of Automotive Chassis Integration and Bionics(汽车底盘集成与生物力学国家级重点实验室) ReeFocus AI Technology(ReeFocus人工智能技术)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLADriver-RAG,通过构建结构化的历史知识,提升自动驾驶中长尾场景的泛化能力,采用视觉到场景机制和场景对齐嵌入模型,结合查询驱动的VLA骨干网络,实现高精度轨迹合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13311 2026-05-13 cs.CV cs.AI 79%

A Resource Efficient Fusion Network for Object Detection in Bird's-Eye View using Camera and Raw Radar Data

一种用于鸟瞰图中物体检测的资源高效融合网络:使用摄像头和原始雷达数据

Kavin Chandrasekaran, Sorin Grigorescu, Gijs Dubbelman, Pavol Jancura

机构 * ElektroBit Automotive GmbH Eindhoven University of Technology(埃因霍温理工大学) Transilvania University of Brasov(布拉索夫特拉扬大学)

专题命中 感知 :BEV(abstract,abstract_cn);autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种资源高效的融合网络,通过直接使用雷达原始范围-多普勒谱数据和摄像头图像处理,提升鸟瞰图中物体检测的准确性和效率。

Comments IEEE Intelligent Transportation Systems Conference (ITSC) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11520 2026-05-13 cs.CV cs.AI 62%

PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splatting

PointGS: 基于3D高斯散射的语义一致无监督3D点云分割

Yixiao Song, Qingyong Li, Wen Wang, Zhicheng Yan

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能在交通运输中的关键实验室(北京交通大学),教育部) Frontiers Science Center for Smart High-speed Railway System, Beijing Jiaotong University(智能高速铁路系统前沿科学中心,北京交通大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 PointGS通过3D高斯散射统一中间表示,解决3D点云与2D图像的语义一致性问题,实现无监督分割,优于现有方法,在ScanNet-V2和S3DIS上分别提升0.9%和2.8%的mIoU。

Comments Accepted by Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10201 2026-05-13 cs.RO cs.AI 62%

HeteroGenManip: Generalizable Manipulation For Heterogeneous Object Interactions

HeteroGenManip:异构物体交互的通用操作

Zhenhao Shen, Zeming Yang, Yue Chen, Yuran Wang, Shengqiang Xu, Mingleyang Li, Hao Dong, Ruihai Wu

机构 * Peking University(北京大学) Tianjin University(天津大学)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.AI

AI总结 本文提出HeteroGenManip框架,通过两阶段方法解决机器人异构物体交互中的接触点定位和轨迹规划问题,实现跨类型物体的鲁棒泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05077 2026-05-13 cs.CV 57%

FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching

FlowDIS:基于流匹配的语言引导二元图像分割

Andranik Sargsyan, Shant Navasardyan

机构 * Picsart AI Research (PAIR)(Picsart AI研究院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出FlowDIS,一种基于流匹配框架的二元图像分割方法,通过文本提示实现精确像素级对象分割,实验表明其在DIS-TE测试集上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11678 2026-05-13 cs.AI 57%

OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models

无需显存的Alpamayo通过CPU-GPU内存交换用于视觉-语言-动作模型

Seungwoo Roh, Huiyeong Kim, Jong-Chan Kim

机构 * Graduate School of Automobile and Mobility, Kookmin University, Korea(汽车与移动研究生院,韩国高垣大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 本文提出一种无需修改模型的内存高效方法,通过系统级优化实现视觉-语言-动作模型在显存受限的GPU上的推理,提升性能并保持精度。

Comments Submitted to IEEE RTCSA on March 26, 2026 (KST); Accepted on May 4, 2026 (KST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11521 2026-05-13 cs.CV 57%

XWOD: A Real-World Benchmark for Object Detection under Extreme Weather Conditions

XWOD:面向极端天气条件的现实世界目标检测基准

Chih-Hsin Chen, Yu-Tung Liu, Amar Fadillah, Kuan-Ting Lai, Dong Liu

机构 * Department of Electronic Engineering(电子工程系) National Taipei University of Technology(台北科技大学) Adobe Inc.(Adobe公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出XWOD基准,包含10010张图像和42924个边界框,涵盖七种极端天气条件,通过训练标准YOLO模型在其他基准上取得显著提升,验证了数据质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04647 2026-05-13 cs.RO 57%

ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving

ReflectDrive-2: 用于离散扩散驾驶的强化学习对齐的自我编辑

Huimin Wang, Yue Wang, Bihao Cui, Pengxiang Li, Ben Lu, Mingqian Wang, Tong Wang, Chuan Tang, Teng Zhang, Kun Zhan

机构 * LiAuto

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 ReflectDrive-2通过平行掩码解码生成离散轨迹令牌,结合强化学习训练提升驾驶性能,实现轨迹实时修正,达到91.0 PDMS成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12677 2026-05-13 astro-ph.IM astro-ph.CO 50%

Murriyang cryogenic phased array feed: spectral-line results and noise-reduction methods

Murriyang低温相控阵馈源:谱线结果与噪声削减方法

L. Staveley-Smith, S. Barker, R. Berangi, A. B. Bolin, S. Broadhurst, J. D. Bunton, N. Carter, S. Castillo, W. Chandler, A. Chippendale, J. R. Dawson, F. Di Dio, A. R. Dunning, S. Gordon, J. A. Green, A. Hafner, D. B. Hayman, D. Humphrey, A. Jameson, S. Johnston, J. F. Kaczmarek, J. Ma, G. Perry, M. Pilawa, J. Rhee, L. Toomey, J. van Aardt, N. Wang

专题命中 感知 :occupancy(abstract)

AI总结 本文介绍了Murriyang望远镜Parkes的新型低温相控阵馈源(cryoPAF)的谱线结果及噪声削减方法,展示了其在视场、 aperture效率、带宽等方面的优势,并通过HI观测验证了其性能。

Comments 20 pages, 18 figures, accepted by PASA (11 February 2026), abbreviated abstract

Journal ref Publ. Astron. Soc. Aust. 43 (2026) e057

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 5 篇

2605.11987 2026-05-13 cs.AI cs.LG stat.AP stat.ML 57%

Random-Set Graph Neural Networks

随机集图神经网络

Tommy Woodley, Shireen Kudukkil Manchingal, Matteo Tolloso, Davide Bacciu, Fabio Cuzzolin

机构 * School of Engineering, Computing and Mathematics(工程、计算与数学学院) Oxford Brookes University(奥克斯福德布鲁克斯大学) Department of Computer Science(计算机科学系) University of Pisa(比萨大学) Oxford Brookes Institute for Artificial Intelligence, Data Analysis and Systems (AIDAS)(奥克斯福德布鲁克斯人工智能、数据分析与系统研究所(AIDAS))

专题命中 规划控制 :autonomous driving(abstract);分类 cs.AI

AI总结 本文提出了一种新的图神经网络框架,通过信念函数形式建模节点层面的epistemic不确定性,通过随机集头预测类别列表上的随机集,实现精确概率预测和epistemic不确定性度量。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07637 2026-05-13 cs.AI cs.LG cs.MA 57%

Learning to Communicate Locally for Large-Scale Multi-Agent Pathfinding

为大规模多智能体路径规划学习本地通信

Valeriy Vyaltsev, Alsu Sagirova, Anton Andreychuk, Oleg Bulichev, Yuri Kuratov, Konstantin Yakovlev, Aleksandr Panov, Alexey Skrynnik

专题命中 规划控制 :trajectory planning(abstract);分类 cs.AI

AI总结 本文提出LC-MAPF,通过多轮本地通信提升多智能体协作,优于现有基于强化学习和模仿学习的MAPF求解器,且保持可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11594 2026-05-13 cs.CV 57%

PointForward: Feedforward Driving Reconstruction through Point-Aligned Representations

PointForward:通过点对齐表示实现馈送驾驶重建

Cheng Chi, Xianqi Wang, Hongcheng Luo, Mingfei Tu, Gangwei Xu, Zehan Zhang, Bing Wang, Guang Chen, Hangjun Ye, Sida Peng, Xin Yang, Haiyang Sun

机构 * Xiaomi EV(小米电动车) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.CV

AI总结 PointForward通过点对齐表示实现驾驶场景重建,采用空间时间融合提升多视角一致性,引入场景图处理动态实例,实现高精度驾驶场景重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11550 2026-05-13 cs.CV 57%

The DAWN of World-Action Interactive Models

世界-动作交互模型的黎明

Hongbo Lu, Liang Yao, Chenghao He, Haoyu Wang, Xiang Gu, Xianfei Li, Wenlong Liao, Tao He, Pai Peng

机构 * COWARobot Co. Ltd(COWARobot有限公司) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出WAIMs,通过DAWN模型在语义潜在空间中实现世界预测与动作生成的交互,提升自动驾驶中的规划性能与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05884 2026-05-13 cs.CY cs.LG 50%

Integrating the Expected Future in Load Forecasts with Contextually Enhanced Transformer Models

将预期未来整合到负载预测中:基于上下文增强的Transformer模型

Raffael Theiler, Leandro Von Krannichfeldt, Giovanni Sansavini, Michael F. Howland, Olga Fink

机构 * Intelligent Maintenance and Operations Systems (IMOS)(智能维护与运营系统) École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校) Department of Mechanical and Process Engineering(机械与过程工程系) Eidgenössische Technische Hochschule (ETH)(瑞士联邦理工学院(ETH)) Department of Civil and Environmental Engineering(土木与环境工程系) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 规划控制 :occupancy(abstract)

AI总结 本文提出一种结合预测与回归的任务,通过上下文增强的Transformer模型提升能源预测准确性,通过铁路和建筑能耗案例验证了方法的有效性,显著降低预测误差。

Comments 39 pages, 8 figures and tables, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏

3. BEV与占用 4 篇

2506.08902 2026-05-13 cs.LG cs.AI 79%

Intention-Conditioned Flow Occupancy Models

意图条件流占用模型

Chongyi Zheng, Seohong Park, Sergey Levine, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 BEV与占用 :occupancy(title,abstract);分类 cs.AI

AI总结 本文提出意图条件流占用模型(InFOM),通过引入用户意图的隐变量,提升模型对长期依赖的建模能力,在36个状态基和4个图像基基准任务中实现回报提升1.8倍和成功率提升36%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11142 2026-05-13 cs.LG 71%

Rank Is Not Capacity: Spectral Occupancy for Latent Graph Models

秩不是容量:潜在图模型的谱占用

Nikolaos Nakis, Panagiotis Promponas, Konstantinos Tsirkas, Katerina Mamali, Eftychia Makri, Leandros Tassiulas, Nicholas A. Christakis

机构 * Human Nature Lab, Yale University(耶鲁大学人类本质实验室) Department of Electrical and Computer Engineering, Yale University(耶鲁大学电气与计算机工程系) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系) Department of Computer Science, Yale University(耶鲁大学计算机科学系)

专题命中 BEV与占用 :occupancy(title)

AI总结 本文提出Spectra方法,通过谱分析替代秩作为分析单位,以更准确衡量模型容量,从而在预测精度与实际维度之间建立可可视化权衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11900 2026-05-13 cs.CV 70%

Mobile Traffic Camera Calibration from Road Geometry for UAV-Based Traffic Surveillance

基于道路几何的移动交通摄像头校准用于无人机交通监控

Alexey Popov, Natalia Trukhina, Vadim Vashkelis

机构 * Embedded Intelligence Lab(嵌入式智能实验室)

专题命中 BEV与占用 :BEV(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出一种轻量级管道,将单目倾斜无人机交通视频转换为局部度量鸟瞰视图表示,利用可见道路几何估算道路平面的homography,以实现车辆轨迹的估计和动态3D立方体的可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10955 2026-05-13 cond-mat.soft physics.flu-dyn 50%

Time-dependent pore-network modelling of Ostwald ripening in porous media

时间依赖性孔隙网络建模用于多孔介质中奥斯特瓦尔德成核过程

Ademola Isaac Adebimpe, Sajjad Foroughi, Branko Bijeljic, Martin J. Blunt

专题命中 BEV与占用 :occupancy(abstract)

AI总结 本文提出了一种时间依赖性孔隙网络模型,结合瞬态质量传输、毛细压力异质性和真实孔隙喉道几何形状,研究多孔介质中奥斯特瓦尔德成核过程的动力学演化。模型应用于Bentheimer砂岩,研究湿气后残留气体饱和度下的奥斯特瓦尔德成核过程,揭示了吸湿和排水事件对局部毛细压力的影响。

Comments 14 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 激光雷达 3 篇

2602.13267 2026-05-13 cs.CV cs.RO eess.IV 85%

SOAR: Regression-based LiDAR Relocalization for UAVs

SOAR:基于回归的无人机激光雷达重定位

Hengyu Mu, Jianshi Wu, Yuxin Guo, XianLian Lin, Qingyong Hu, Sheng Ao, Chenglu Wen, Cheng Wang

机构 * Fujian Key Laboratory of Sensing and Computing for Smart Cities, Xiamen University(厦门大学智慧城市感知与计算重点实验室) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室) Department of Computer Science at the University of Oxford(牛津大学计算机科学系)

专题命中 激光雷达 :LiDAR(title,abstract);autonomous driving(abstract);分类 cs.RO、cs.CV、eess.IV

AI总结 本文提出SOAR框架,通过局部滑动窗口注意力模块和坐标无关特征初始化模块,提升无人机在GNSS拒止环境下的激光雷达重定位精度,实验表明其在UAVLoc上提升了40%的成功率并降低了10米以上的均误差。

Comments 24 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05269 2026-05-13 cs.CV 83%

B4DL: A Benchmark for 4D LiDAR LLM in Spatio-Temporal Understanding

B4DL:用于空间时间理解的4D激光雷达LLM基准

Changho Choi, Youngwoo Shin, Gyojin Han, Dong-Jae Lee, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 激光雷达 :LiDAR(title,abstract);分类 cs.CV

AI总结 本文提出B4DL基准,用于训练和评估多模态大语言模型对4D激光雷达数据的理解,结合可扩展的数据生成管道和新模型,实现动态户外环境的空间时间推理。

Comments Accepted at ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11799 2026-05-13 cs.CV 77%

SB-BEVFusion: Enhancing the Robustness against Sensor Malfunction and Corruptions

SB-BEVFusion:增强对传感器故障和损坏的鲁棒性

Markus Essl, Marta Moscati, Mubashir Noman, Muhammad Zaigham Zaheer, Usman Naseem, Shah Nawaz, Markus Schedl

机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨分校) MBZUAI(穆罕默德·本·拉希德人工智能研究所) Macquarie University(麦考瑞大学) Linz Institute of Technology(林茨技术学院)

专题命中 激光雷达 :BEV(abstract,abstract_cn);LiDAR(abstract);分类 cs.CV

AI总结 本文提出SB-BEVFusion框架,通过处理缺失或损坏的相机和激光雷达数据,提升自动驾驶3D目标检测在传感器故障和损坏场景下的鲁棒性。

Comments Accepted at ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多传感器融合 1 篇

2605.11824 2026-05-13 cs.CV cs.AI 73%

REFNet++: Multi-Task Efficient Fusion of Camera and Radar Sensor Data in Bird's-Eye Polar View

REFNet++:多任务高效融合摄像头和雷达传感器数据的鸟瞰极坐标视图

Kavin Chandrasekaran, Sorin Grigorescu, Gijs Dubbelman, Pavol Jancura

机构 * ElektroBit Automotive GmbH Eindhoven University of Technology(埃因霍温理工大学) Transilvania University of Brasov(布拉索夫特拉扬大学)

专题命中 多传感器融合 :BEV(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出REFNet++,通过统一域对齐摄像头和雷达数据,实现车辆检测和自由空间分割的高效多模态融合,提升环境感知的准确性和效率。

Comments IEEE Intelligent Transportation Systems Conference (ITSC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仿真评测 2 篇

2501.08083 2026-05-13 cs.CV 74%

Benchmarking Vision Foundation Models for Input Monitoring in Autonomous Driving

在自动驾驶中基于视觉基础模型的输入监控基准测试

Mert Keser, Halil Ibrahim Orhan, Niki Amini-Naieni, Gesina Schwalbe, Alois Knoll, Matthias Rottmann

机构 * Continental AG(大陆汽车集团) Technical University of Munich(慕尼黑技术大学) University of Lübeck(吕贝克大学) University of Oxford(牛津大学) University of Wuppertal(伍珀塔尔大学)

专题命中 仿真评测 :autonomous driving(title);分类 cs.CV

AI总结 本文提出了一种基于视觉基础模型和密度建模技术的统一方法,用于检测语义和协变量偏移,通过全面基准测试评估了VFM在复杂条件下的OOD分类能力,并证明其在识别高风险输入方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11991 2026-05-13 physics.flu-dyn 50%

Intermittent two-phase flow in porous media: insights from pore-scale direct numerical simulation

孔隙介质中间歇两相流:来自孔尺度直接数值模拟的见解

Alexandra Karabasova, Sajjad Foroughi, Martin J. Blunt, Branko Bijeljic

专题命中 仿真评测 :occupancy(abstract)

AI总结 研究通过孔尺度直接数值模拟揭示了多相流中间歇性现象,展示了压力重分布与非润湿相流动的强耦合,阐明了间歇性如何导致从线性到亚线性区域的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏