arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-05-19 至 2026-05-19 共收录 12 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 12 篇

2508.13977 2026-05-19 cs.CV 83%

ROVR-Open-Dataset: A Large-Scale Depth Dataset for Autonomous Driving

ROVR-Open-Dataset: 一个大规模深度数据集用于自动驾驶

Xianda Guo, Ruijun Zhang, Yiqun Duan, Ruilin Wang, Matteo Poggi, Keyuan Zhou, Wenzhao Zheng, Wenke Huang, Gangwei Xu, Yanlun Peng, Yuan Si, Qin Zou

机构 * Wuhan University(武汉大学) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) University of Technology Sydney(悉尼大学) University of Bologna(博洛尼亚大学) Zhejiang University(浙江大学) University of California, Berkeley(加州大学伯克利分校) Huazhong University of Science and Technology(华中科技大学) Great Wall Motor(长城汽车) ROVR Labs, Inc.(ROVR实验室)

专题命中 感知 :autonomous driving(title,abstract);LiDAR(abstract);分类 cs.CV

AI总结 本文提出ROVR-Open-Dataset,一个大规模、多样化且成本效益高的深度数据集,用于提升自动驾驶中空间感知的能力,通过提供丰富的场景、光照和天气条件数据,以及经过验证的地面真实数据,支持鲁棒的模型训练,并识别出当前架构共享的三种失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18178 2026-05-19 cs.CV cs.AI 81%

VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events

VLM-AutoDrive: 事后训练视觉-语言模型用于安全关键的自动驾驶事件

Mohammad Qazim Bhat, Yufan Huang, Niket Agarwal, Hao Wang, Michael Woods, John Kenyon, Tsung-Yi Lin, Xiaodong Yang, Ming-Yu Liu, Kevin Xie

机构 * NVIDIA

专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLM-AutoDrive框架,通过整合元数据生成的描述、LLM生成的描述、视觉问答对和推理监督,提升预训练视觉语言模型在安全关键自动驾驶事件中的检测性能。

Comments 16 pages, 9 figures, submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18197 2026-05-19 cs.RO cs.AI cs.CV 75%

RGB-only Active 3D Scene Graph Generation for Indoor Mobile Robots

仅RGB的主动3D场景图生成用于室内移动机器人

Giorgia Modi, Davide Buoso, Giuseppe Averta, Daniele De Martini

机构 * Mobile Robotics Group (MRG)(移动机器人小组) Visual and Multimodal Applied Learning Lab (VANDAL)(视觉与多模态应用学习实验室)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出了一种仅使用RGB输入的主动3D场景图生成方法,通过统一感知与规划的结构化表示,解决了传统方法对专用传感器的依赖问题,并在Replica数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17661 2026-05-19 cs.RO cs.CV 73%

Mono-Hydra++: Real-Time Monocular Scene Graph Construction with Multi-Task Learning for 3D Indoor Mapping

Mono-Hydra++: 基于多任务学习的实时单目场景图构建用于3D室内映射

U. V. B. L. Udugama, George Vosselman, Francesco Nex

机构 * Department of Earth Observation Science, University of Twente(特文特大学地球观测科学系)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出Mono-Hydra++,一种基于多任务学习的实时单目RGB加IMU流水线,用于3D室内度量语义映射和分层3D场景图构建,通过结合M2H-MX多任务模型和深度特征视觉惯性里程计前端,实现了在资源受限的机器人平台上无需主动深度传感器的实时度量语义映射和场景图构建。

Comments Submitted to ISPRS Journal of Photogrammetry and Remote Sensing. 50 pages, figures and tables included. Code: https://github.com/BavanthaU/mono-hydra-pp.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16859 2026-05-19 cs.CV cs.AI 62%

VGGT-CD: Training-Free Robust Registration for 3D Change Detection

VGGT-CD:无训练的鲁棒三维变化检测注册

Wei Zhang, Songhua Li, Yihang Wu, Qiang Li, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VGGT-CD方法,通过解耦跨时间注册与动态变化干扰,实现无训练的鲁棒三维变化检测注册,有效减少轨迹误差并提升注册速度。

Comments 13 pages, 5 figures. Code is available at: https://github.com/WZ-CS/VGGT-CD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17822 2026-05-19 cs.CV 57%

Unleashing the Representational Power of Fourier Shapes for Attacking Infrared Object Detection

释放傅里叶形状的表示能力以攻击红外目标检测

Yixing Yong, Jian Wang, Ming Lei, Lijun He, Fan Li

机构 * School of Information and Communications Engineering, Faculty of Electronic and Information Engineering, Xi'an Jiaotong University, Xi'an, China(信息与通信工程学院,电子与信息工程学院,西安交通大学,西安,中国) School of Physics, Xi'an Jiaotong University, Xi'an, China(物理学院,西安交通大学,西安,中国)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出了一种基于傅里叶形状的红外目标检测攻击方法,通过引入可学习的傅里叶形状,克服了传统形状方法在表示能力和优化能力之间的根本权衡问题,实现了高效的梯度优化生成具有欺骗性的形状,使人类目标逃避检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17421 2026-05-19 cs.RO 57%

MUSE: Multimodal Uncertainty Quantification of State Estimation

MUSE:多模态状态估计不确定性量化

Minkyung Kim, Henry Che, Bhargav Chandaka, Bhumsitt Pramuanpornsatid, Chengyu Yang, Sheng Cheng, Xiaofeng Wang, Naira Hovakimyan, Shenlong Wang

机构 * Department of Mechanical Science and Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校塞贝尔计算与数据科学学院) Department of Electrical Engineering, University of South Carolina(南卡罗来纳大学电气工程系)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出MUSE,一种基于学习的实时框架,利用Mamba的强效序列建模能力,从多个异步传感器流中估计定位不确定性,提高了状态估计的可靠性和鲁棒性。

Comments Code and dataset: https://github.com/hungdche/MUSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16979 2026-05-19 cs.RO 57%

NORM-Nav: Zero-Shot Mobile Robot Navigation with Natural Language Behavioral Constraints

NORM-Nav: 通过自然语言行为约束实现零样本移动机器人导航

Dongjie Huo, Junhui Wang, Chao Gao, Yan Qiao, Dong Zhang, Guyue Zhou

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(北京化工大学信息科学与技术学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute of Systems Engineering and Collaborative Laboratory for Intelligent Science and Systems, Macau University of Science and Technology(澳门大学系统工程与智能科学与系统联合实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出NORM-Nav框架,通过将自然语言行为约束整合到基于成本图的规划中,提升移动机器人在人类环境中导航的社交适应性,实验表明其在任务成功率和轨迹贴近人类参考方面优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16925 2026-05-19 cs.CV 57%

P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstruction

P2GS: 基于物理先验的高斯点云法用于光度一致的城市重建

Kota Shimomura, Hidehisa Arai, Tsubasa Takahashi, Takayoshi Yamashita, Hironobu Fujiyoshi

机构 * Chubu University(名古屋大学) Turing Inc.(图灵公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出P2GS,一种基于物理先验的高斯点云法,用于解决自动驾驶中由于异质相机管道和动态户外照明导致的光度不一致问题,通过联合分解视图不变的线性HDR光场、每视图曝光尺度和色调映射函数,提升光度一致性与光照一致性。

Comments Accepted CVPR2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06037 2026-05-19 cs.CV 57%

Thinking with Geometry: Active Geometry Integration for Spatial Reasoning

基于几何的思考:用于空间推理的主动几何整合

Haoyuan Li, Qihang Cao, Tao Tang, Kun Xiang, Zihan Guo, Jianhua Han, JiaWang Bian, Hang Xu, Xiaodan Liang

机构 * Shenzhen campus of Sun Yet-sen University(中山大学深圳校区) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司) Shanghai Jiao Tong University(上海交通大学) Shanghai innovation institute(上海创新研究院) Nanyang Technological University(南洋理工大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出GeoThinker框架,通过主动感知机制改进空间推理,通过空间接地融合和重要性门控实现几何与语义的精准整合,提升空间智能性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16397 2026-05-19 cs.DB cs.LG 50%

Compass: SLO-aware Query Planner for Compound AI Serving at Scale

Compass: 一种面向大规模复合AI服务的SLO感知查询计划器

Banruo Liu, Wei-Yu Lin, Minghao Fang, Yihan Jiang, Fan Lai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 感知 :autonomous driving(abstract)

AI总结 本文提出Compass,一种首个面向大规模复合AI工作负载的SLO感知查询计划器,通过分解多查询、多SLO规划问题为可处理的子问题,利用查询间和查询内的计划相似性减少搜索步骤,并通过计划分析器提高每步效率,从而在资源竞争下最大化SLO良好吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16466 2026-05-19 q-bio.OT 50%

An exponential logarithmic measure of drug receptor binding and saturation

药物受体结合与饱和的指数对数度量

Arturo Tozzi

专题命中 感知 :occupancy(abstract)

AI总结 本文提出一种整合配体可用性和热力学结合倾向的指数对数描述符,用于描述药物受体结合与饱和的动态范围和敏感性。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏