arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-05-13 至 2026-05-13 共收录 6 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 多聚焦/多曝光融合 1 篇

2605.11115 2026-05-13 cs.CV cs.GR cs.LG 57%

LatentHDR: Decoupling Exposure from Diffusion via Conditional Latent-to-Latent Mapping for Text/Image-to-Panoramic HDR

LatentHDR: 通过条件潜变量到潜变量映射解耦曝光以生成文本/图像到全景HDR

Pedram Fekri, WenChen Li, William Chen, Peter Altamirano

机构 * Monks AI Research Lab(Monks AI研究院)

专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV

AI总结 本文提出LatentHDR框架,通过在潜在空间中解耦场景生成与曝光建模,实现高效且结构一致的HDR生成,实验表明其在动态范围和感知质量上优于现有方法,并显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 自动驾驶多传感器融合 2 篇

2605.11824 2026-05-13 cs.CV cs.AI 57%

REFNet++: Multi-Task Efficient Fusion of Camera and Radar Sensor Data in Bird's-Eye Polar View

REFNet++:多任务高效融合摄像头和雷达传感器数据的鸟瞰极坐标视图

Kavin Chandrasekaran, Sorin Grigorescu, Gijs Dubbelman, Pavol Jancura

机构 * ElektroBit Automotive GmbH Eindhoven University of Technology(埃因霍温理工大学) Transilvania University of Brasov(布拉索夫特拉扬大学)

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV

AI总结 本文提出REFNet++,通过统一域对齐摄像头和雷达数据,实现车辆检测和自由空间分割的高效多模态融合,提升环境感知的准确性和效率。

Comments IEEE Intelligent Transportation Systems Conference (ITSC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11799 2026-05-13 cs.CV 57%

SB-BEVFusion: Enhancing the Robustness against Sensor Malfunction and Corruptions

SB-BEVFusion:增强对传感器故障和损坏的鲁棒性

Markus Essl, Marta Moscati, Mubashir Noman, Muhammad Zaigham Zaheer, Usman Naseem, Shah Nawaz, Markus Schedl

机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨分校) MBZUAI(穆罕默德·本·拉希德人工智能研究所) Macquarie University(麦考瑞大学) Linz Institute of Technology(林茨技术学院)

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV

AI总结 本文提出SB-BEVFusion框架,通过处理缺失或损坏的相机和激光雷达数据,提升自动驾驶3D目标检测在传感器故障和损坏场景下的鲁棒性。

Comments Accepted at ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 2 篇

2602.07668 2026-05-13 cs.CV cs.AI cs.LG cs.RO 73%

Looking and Listening Inside and Outside: Multimodal Artificial Intelligence Systems for Driver Safety Assessment and Intelligent Vehicle Decision-Making

观察与聆听内外:多模态人工智能系统用于驾驶员安全评估和智能车辆决策

Ross Greer, Laura Fleig, Maitrayee Keskar, Erika Maquiling, Giovanni Tapia Lopez, Angel Martinez-Sanchez, Parthib Roy, Jake Rattigan, Mira Sur, Alejandra Vidrio, Thomas Marcotte, Mohan Trivedi

机构 * Machine Intelligence, Interaction, and Imagination (Mi3) Laboratory(机器智能、交互与想象实验室) Laboratory for Intelligent and Safe Automobiles (LISA)(智能与安全汽车实验室) Johns Hopkins University(约翰霍普金斯大学) Center for Medicinal Cannabis Research (CMCR)(医药大麻研究中心)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);sensor fusion(abstract);分类 cs.CV、cs.RO

AI总结 本文提出L-LIO框架,通过融合音频与视觉数据提升驾驶员状态评估和环境理解,探讨音频在车辆安全中的作用,包括驾驶员语音分类、乘客指令分析及视觉不足时的音频辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11048 2026-05-13 cs.RO cs.AI 57%

ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching

ForceFlow: 通过接触驱动的流匹配学习感知与行动

Shuoheng Zhang, Yifu Yuan, Hongyao Tang, Yan Zheng, Qiaojun Yu, Pengyi Li, Guowei Huang, Helong Huang, Xingyue Quan, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah's Ark Lab(华为诺亚实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO

AI总结 本文提出ForceFlow框架,通过融合力信号与多模态信息,提升机器人在复杂接触任务中的鲁棒性和泛化能力,实验显示其在六个真实任务中成功率提升37%。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 1 篇

2605.12031 2026-05-13 cs.LG cs.CV 57%

Resilient Vision-Tabular Multimodal Learning under Modality Missingness

在模态缺失下的视觉-表格多模态学习的鲁棒性

Camillo Maria Caruso, Valerio Guarrasi, Paolo Soda

机构 * Research Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统研究单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与干预系,辐射物理,生物医学工程,乌梅大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出一种多模态Transformer框架,用于在普遍存在模态缺失的情况下进行视觉-表格联合学习,通过可学习的模态标记和中间融合实现鲁棒的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏