arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 4754 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 自动驾驶多传感器融合 261 篇

2309.09080 2023-09-20 cs.RO cs.CV 62%

Multi-camera Bird's Eye View Perception for Autonomous Driving

David Unger, Nikhil Gosala, Varun Ravi Kumar, Shubhankar Borse, Abhinav Valada, Senthil Yogamani

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

Comments Taylor & Francis (CRC Press) book chapter. Book title: Computer Vision: Challenges, Trends, and Opportunities

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01807 2023-07-06 cs.CV cs.RO 62%

SUIT: Learning Significance-guided Information for 3D Temporal Detection

Zheyuan Zhou, Jiachen Lu, Yihan Zeng, Hang Xu, Li Zhang

专题命中 自动驾驶多传感器融合 :information fusion(abstract);分类 cs.CV、cs.RO

Comments Accepted to IROS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13814 2023-05-24 cs.CV cs.RO 62%

Leveraging BEV Representation for 360-degree Visual Place Recognition

Xuecheng Xu, Yanmei Jiao, Sha Lu, Xiaqing Ding, Rong Xiong, Yue Wang

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10594 2023-05-19 cs.RO cs.CV 62%

Improving Extrinsics between RADAR and LIDAR using Learning

Peng Jiang, Srikanth Saripalli

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

Comments accepted in IV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.04557 2022-11-10 cs.CV cs.RO 62%

Estimation of Appearance and Occupancy Information in Birds Eye View from Surround Monocular Images

Sarthak Sharma, Unnikrishnan R. Nair, Udit Singh Parihar, Midhun Menon S, Srikanth Vidapanakal

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09770 2022-06-22 cs.CV cs.RO 62%

Real-time Full-stack Traffic Scene Perception for Autonomous Driving with Roadside Cameras

Zhengxia Zou, Rusheng Zhang, Shengyin Shen, Gaurav Pandey, Punarjay Chakravarty, Armin Parchami, Henry X. Liu

专题命中 自动驾驶多传感器融合 :information fusion(abstract);分类 cs.CV、cs.RO

Comments This paper is accepted and presented in ICRA 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.02173 2022-03-04 cs.RO cs.AI cs.CV cs.LG cs.MA 62%

Multi-Agent Variational Occlusion Inference Using People as Sensors

Masha Itkina, Ye-Ji Mun, Katherine Driggs-Campbell, Mykel J. Kochenderfer

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

Comments 12 pages, 9 figures, International Conference on Robotics and Automation (ICRA) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.10490 2021-10-19 cs.CV cs.RO 62%

FIERY: Future Instance Prediction in Bird's-Eye View from Surround Monocular Cameras

Anthony Hu, Zak Murez, Nikhil Mohan, Sofía Dudas, Jeffrey Hawke, Vijay Badrinarayanan, Roberto Cipolla, Alex Kendall

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

Comments ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.09672 2020-08-25 cs.CV cs.RO 62%

Towards Autonomous Driving: a Multi-Modal 360$^{\circ}$ Perception Proposal

Jorge Beltrán, Carlos Guindel, Irene Cortés, Alejandro Barrera, Armando Astudillo, Jesús Urdiales, Mario Álvarez, Farid Bekka, Vicente Milanés, Fernando García

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

Comments Accepted for publication in IEEE ITSC 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.08394 2020-02-21 cs.CV cs.LG cs.RO 62%

MonoLayout: Amodal scene layout from a single image

Kaustubh Mani, Swapnil Daga, Shubhika Garg, N. Sai Shankar, Krishna Murthy Jatavallabhula, K. Madhava Krishna

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

Comments To be presented at WACV 2020 Video: https://www.youtube.com/watch?v=HcroGyo6yRQ Project page: https://hbutsuak95.github.io/monolayout

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.08689 2018-12-06 cs.CV cs.RO 62%

Object Detection and Classification in Occupancy Grid Maps using Deep Convolutional Networks

Sascha Wirges, Tom Fischer, Jesus Balado Frias, Christoph Stiller

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

Comments 6 pages, 4 tables, 4 figures

Journal ref 2018 IEEE Intelligent Transportation Systems Conference (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05249 2024-05-06 cs.RO 61%

Evaluating Visual Odometry Methods for Autonomous Driving in Rain

Yu Xiang Tan, Marcel Bartholomeus Prasetyo, Mohammad Alif Daffa, Deshpande Sunny Nitin, Malika Meghjani

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract,comments);分类 cs.RO

Comments A version of the paper presented at IEEE International Conference on Automation Science and Engineering (CASE) 2023. Fixed grammar and phrasing to improve clarity of the statements made. Emphasized on the need for a more robust sensor fusion based approach for localization in rain for autonomous driving

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15230 2026-08-18 cs.CV 新提交 57%

PersonaDrive: Controllable Trajectory Prediction with Multi-Dimensional Driving Personas

PersonaDrive:基于多维驾驶 personas 的可控轨迹预测

Chan Lee, Kimin Yun, Yuseok Bae, Seong Tae Kim, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学) ETRI(韩国电子通信研究院)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对现有轨迹预测方法可控性不足的问题,提出 PCT 数据集与 PersonaDrive 框架,通过多轴设计实现可控轨迹生成,性能优于基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24805 2026-07-08 cs.CV 新提交 57%

DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection

DDStereo: 用于立体3D道路异常检测的高效双解码器Transformer

Shiyi Mu, Zichong Gu, Zhiqi Ai, Yilin Gao, Shugong Xu

机构 * Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 自动驾驶多传感器融合 :feature-level fusion(abstract);分类 cs.CV

AI总结 提出DDStereo,一种双解码器立体Transformer,通过轻量级解码器分支和紧凑视差特征提取器,实现实时开放集3D目标检测,在封闭和开放集协议下均达到最先进精度。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04098 2026-07-07 cs.CV 新提交 57%

Sparse4D-Radar: An Efficient and Robust Framework for Surround-View 3D Object Detection via 4D Radar-Camera Fusion

Sparse4D-Radar:一种通过4D雷达-相机融合实现高效且稳健的环视3D目标检测框架

Fuyuan Ai, Yuchen Tan, Jiehui Chen, Zhiwei Xu, Chunyi Song

机构 * State Key Laboratory of Ocean Sensing and Ocean College, Zhejiang University(浙江大学海洋传感与海洋学院海洋传感技术国家重点实验室) Engineering Research Center of Oceanic Sensing Technology and Equipment, Ministry of Education, Zhejiang University(浙江大学海洋传感技术与装备教育部工程研究中心) Donghai Laboratory(东海实验室) Ocean College, Institute of Marine Electronics and Intelligent Systems, Zhejiang University(浙江大学海洋学院海洋电子与智能系统研究所)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对4D成像雷达在环视感知缺乏成熟方案的问题,提出Sparse4D-Radar框架。设计可变形融合模块等,经实验验证该框架在环视3D检测性能上达先进水平,兼顾精度、鲁棒性与效率。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06105 2026-07-07 cs.RO cs.AI cs.LG 57%

Uncertainty-Aware Hybrid Machine Learning in Virtual Sensors for Vehicle Sideslip Angle Estimation

面向车辆侧倾角估计的不确定性感知混合机器学习虚拟传感器

Abinav Kalyanasundaram, Karthikeyan Chandra Sekaran, Philipp Stauber, Michael Lange, Wolfgang Utschick, Michael Botsch

机构 * CARISSMA Institute of Automated Driving, Technische Hochschule Ingolstadt(CARISSMA自动化驾驶研究所,因戈尔施塔特技术大学) GeneSys Elektronik GmbH(GeneSys电子 GmbH) Technische Universität München(慕尼黑技术大学)

专题命中 自动驾驶多传感器融合 :hybrid fusion(abstract);分类 cs.RO

AI总结 本文提出不确定性感知混合学习架构,通过融合机器学习与车辆运动模型,提升车辆状态估计精度,同时引入新的数据集ReV-StED验证方法有效性。

Comments Accepted at the 2025 IEEE Intelligent Vehicles Symposium (IV)

Journal ref 2025 IEEE Intelligent Vehicles Symposium (IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23058 2026-06-23 cs.CV 新提交 57%

Three-Step Hierarchical Transformer for Multi-Pedestrian Trajectory Prediction

三步层次Transformer用于多人轨迹预测

Raphaël Delécluse, Hazem Wannous, Laurent Grisoni, Laurent Guimas

机构 * IMT Nord Europe, University of Lille, CNRS UMR 9189 - CRIStAL(IMT 北欧洲、里尔大学、法国国家科学研究中心 UMR 9189 - CRIStAL) University of Lille, CNRS UMR 9189 - CRIStAL(里尔大学、法国国家科学研究中心 UMR 9189 - CRIStAL) Explain

专题命中 自动驾驶多传感器融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出三步层次Transformer,通过分离时间编码、多模态融合和场景交互推理,在JRDB和城市数据集上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16354 2026-06-16 cs.CV 新提交 57%

GraphBEV++: Multi-Modal Feature Alignment for Autonomous Driving

GraphBEV++: 自动驾驶中的多模态特征对齐

Ziying Song, Caiyan Jia, Lin Liu, Shaoqing Xu, Lei Yang, Yadan Luo

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院,交通数据挖掘与具身智能北京市重点实验室) School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) University of Macau(澳门大学) Nanyang Technological University(南洋理工大学) The University of Queensland(昆士兰大学)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对自动驾驶中BEV感知的特征未对齐问题,提出GraphBEV++框架,通过局部对齐(LocalAlign-v2)和全局对齐(GlobalAlign-v2)模块,利用图匹配、可变形偏移和扩散去噪方法,在多种基准上实现最优性能。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09634 2026-06-09 cs.CV cs.AI 新提交 57%

ATN3D: Density-Aware LiDAR-Radar Early 3D Object Detection Under Extreme Sparsity

ATN3D:面向极端稀疏性的密度感知激光雷达-雷达早期3D目标检测

Debojyoti Biswas, Xianbiao Hu

机构 * University of California, Berkeley(加州大学伯克利分校) Tsinghua University(清华大学)

专题命中 自动驾驶多传感器融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对远距离稀疏感知下早期融合丢失信息、通道监督不均衡的问题,提出ATN3D框架,通过密度感知融合、占用门控邻域聚合、证据条件通道自注意力和距离感知损失,在VoD数据集上显著提升远距离检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00470 2026-06-02 cs.RO 57%

LAP: Fast LAtent Diffusion Planner for Autonomous Driving

LAP:面向自动驾驶的快速潜在扩散规划器

Jinhao Zhang, Wenlong Xia, Zhexuan Zhou, Haoming Song, Youmin Gong, Jie Mei

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 自动驾驶多传感器融合 :information fusion(abstract);分类 cs.RO

AI总结 提出LAP框架,在VAE学习的潜在空间中进行规划,通过单步去噪实现高质量规划,在nuPlan基准上达到学习型规划方法的最优闭环性能,推理速度提升高达10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30983 2026-06-01 cs.CV 57%

Can BEV Perception Gracefully Degrade under Sensor Failures?

BEV感知能否在传感器故障下优雅降级?

Haifa Zhang, Yijing Wang, Haoyu Wang, Zheng Li, Zhiqiang Zuo

机构 * Tianjin Key Laboratory of Intelligent Unmanned Swarm Technology and System(天津智能无人群技术与系统重点实验室) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理重点实验室,中华人民共和国教育部)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对多模态BEV感知在传感器损坏时性能骤降的问题,提出Grace-BEV框架,通过主动可靠性评估和动态特征重校准实现优雅降级,在极端LiDAR故障下将mAP从0.0%恢复至34.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22550 2026-05-22 cs.CV 57%

MOTOR: A Multimodal Dataset for Two-Wheeler Rider Behavior Understanding

MOTOR: 两轮车骑行行为理解的多模态数据集

Varun A. Paturkar, Shankar Gangisetty, C. V. Jawahar

机构 * CVIT, IIIT-Hyderabad(IIIT-海得拉巴学院计算机视觉研究所)

专题命中 自动驾驶多传感器融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出MOTOR数据集,用于研究两轮车在密集无结构交通中的骑行行为,通过多视角、多模态数据融合,为自动驾驶辅助系统提供新的研究基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21308 2026-05-21 cs.CV cs.AI 57%

Deformba: Vision State Space Model with Adaptive State Fusion

Deformba:具有自适应状态融合的视觉状态空间模型

Hongyu Ke, Jack Morris, Yongkang Liu, Satoshi Kitai, Kentaro Oguchi, Yi Ding, Haoxin Wang

机构 * Department of Computer Science, Georgia State University(佐治亚州立大学计算机科学系) University of Tennessee Knoxville(田纳西大学肯纳邦克分校)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出Deformba,一种能够动态增强空间结构信息并保持状态空间模型线性复杂度的自适应方法,通过多模态融合(如交叉注意力)提升视觉任务的性能,展示了在2D和3D视觉任务中的广泛适用性。

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21112 2026-05-21 cs.CV 57%

RCGDet3D: Rethinking 4D Radar-Camera Fusion-based 3D Object Detection with Enhanced Radar Feature Encoding

RCGDet3D: 重新思考基于增强雷达特征编码的4D雷达-相机融合3D目标检测

Weiyi Xiong, Bing Zhu

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出RCGDet3D,通过增强雷达特征编码而非复杂的多模态融合策略,实现了在3D目标检测中更高的准确性和实时性,为实时部署设定了新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11824 2026-05-13 cs.CV cs.AI 57%

REFNet++: Multi-Task Efficient Fusion of Camera and Radar Sensor Data in Bird's-Eye Polar View

REFNet++:多任务高效融合摄像头和雷达传感器数据的鸟瞰极坐标视图

Kavin Chandrasekaran, Sorin Grigorescu, Gijs Dubbelman, Pavol Jancura

机构 * ElektroBit Automotive GmbH Eindhoven University of Technology(埃因霍温理工大学) Transilvania University of Brasov(布拉索夫特拉扬大学)

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV

AI总结 本文提出REFNet++,通过统一域对齐摄像头和雷达数据,实现车辆检测和自由空间分割的高效多模态融合,提升环境感知的准确性和效率。

Comments IEEE Intelligent Transportation Systems Conference (ITSC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11799 2026-05-13 cs.CV 57%

SB-BEVFusion: Enhancing the Robustness against Sensor Malfunction and Corruptions

SB-BEVFusion:增强对传感器故障和损坏的鲁棒性

Markus Essl, Marta Moscati, Mubashir Noman, Muhammad Zaigham Zaheer, Usman Naseem, Shah Nawaz, Markus Schedl

机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨分校) MBZUAI(穆罕默德·本·拉希德人工智能研究所) Macquarie University(麦考瑞大学) Linz Institute of Technology(林茨技术学院)

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV

AI总结 本文提出SB-BEVFusion框架,通过处理缺失或损坏的相机和激光雷达数据,提升自动驾驶3D目标检测在传感器故障和损坏场景下的鲁棒性。

Comments Accepted at ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22835 2026-04-28 cs.CV cs.AI 57%

ParkingScenes: A Structured Dataset for End-to-End Autonomous Parking in Simulation Scenes

ParkingScenes: 一个用于模拟场景中端到端自动驾驶泊车的结构化数据集

Haonan Chen, Kaiwen Xiao, Bin Tian, Jun Fu

机构 * Institute of Automation(自动化研究所) Chinese Academy of Sciences(中国科学院) School of Art and Design(艺术与设计学院)

专题命中 自动驾驶多传感器融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出ParkingScenes数据集,通过结构化轨迹生成提升泊车性能,展示结构化监督对自主泊车政策学习的有效性。

Comments Accepted by CAC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05668 2026-04-08 eess.SP 57%

A BEV-Fusion Based Framework for Sequential Multi-Modal Beam Prediction in mmWave Systems

基于BEV融合的毫米波系统中顺序多模束预测框架

Jiaming Zeng, Cunhua Pan, Haoyang Weng, Ruijing Liu, Hong Ren, Jiangzhou Wang

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 eess.SP

AI总结 本文提出基于BEV融合的框架,通过统一相机、激光雷达、雷达和GPS模态,在共享鸟瞰图表示中实现空间一致的多模融合,提升毫米波系统中束预测的准确性。

Comments 13pages,7figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22852 2026-03-25 cs.CV 57%

Gau-Occ: Geometry-Completed Gaussians for Multi-Modal 3D Occupancy Prediction

Gau-Occ:用于多模态3D占用预测的几何完备高斯分布

Chengxin Lv, Yihui Li, Hongyu Yang, YunHong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,北京航空航天大学,北京,中国) School of Computer Science and Engineering, Beihang University, Beijing, China(计算机科学与工程学院,北京航空航天大学,北京,中国) School of Artificial Intelligence, Beihang University, Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 Gau-Occ通过几何完备的3D高斯分布实现多模态3D占用预测,利用LiDAR完成扩散器恢复缺失结构并融合多视角图像语义,提升空间一致性和语义区分性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21589 2026-02-26 cs.CV 57%

SEF-MAP: Subspace-Decomposed Expert Fusion for Robust Multimodal HD Map Prediction

SEF-MAP:子空间分解专家融合用于鲁棒多模态高精度地图预测

Haoxiang Fu, Lingfeng Zhang, Hao Li, Ruibing Hu, Zhengrong Li, Guanjing Liu, Zimu Tan, Long Chen, Hangjun Ye, Xiaoshuai Hao

机构 * National University of Singapore(新加坡国立大学) Xiaomi EV(小米电动车) Chinese University of Hong Kong(香港中文大学) The University of Manchester(曼彻斯特大学) Renmin University of China(中国人民大学)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 SEF-MAP通过子空间分解和专家融合,提升多模态HD地图预测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏