arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-06-16 至 2026-06-16 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 机器人多传感器融合 1 篇

2410.16089 2026-06-16 cs.AI eess.SP 版本更新 84%

Multi-Sensor Fusion for UAV Classification Based on Feature Maps of Image and Radar Data

基于图像和雷达数据特征图的多传感器融合无人机分类

Nikos Sakellariou, Antonios Lalas, Konstantinos Votis, Dimitrios Tzovaras

机构 * Information Technologies Institute(信息科技研究所) Centre for Research & Technology – Hellas(希腊研究中心) Thessaloniki, Greece(塞萨洛尼基,希腊)

专题命中 机器人多传感器融合 :sensor fusion(title);multi-sensor fusion(title);分类 eess.SP

AI总结 提出一种融合热成像、光电和雷达数据特征的多传感器深度学习网络,通过堆叠图像特征提高无人机分类精度。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 融合架构与评测 2 篇

2510.05888 2026-06-16 cs.CV 版本更新 57%

BioAutoML-NAS: An End-to-End AutoML Framework for Multimodal Insect Classification via Neural Architecture Search on Large-Scale Biodiversity Data

BioAutoML-NAS:基于大规模生物多样性数据通过神经架构搜索进行多模态昆虫分类的端到端AutoML框架

Arefin Ittesafun Abian, Debopom Sutradhar, Md Rafi Ur Rashid, Reem E. Mohamed, Md Rafiqul Islam, Asif Karim, Kheng Cher Yeo, Sami Azam

机构 * Department of Computer Science and Engineering, United International University, Dhaka, Bangladesh(乌姆国际大学计算机科学与工程系,达卡,孟加拉国) Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory, 1217, Dhaka, Bangladesh(应用人工智能与智能系统实验室(AAIINS),1217号,达卡,孟加拉国) Department of Computer Science and Engineering, Penn State University, University Park, PA, USA(宾夕法尼亚州立大学计算机科学与工程系,University Park,PA,美国) Faculty of Science and Information Technology, Charles Darwin University, Sydney, NSW, Australia(查尔斯达尔文大学科学与信息技术学院,悉尼,新南威尔士州,澳大利亚) Faculty of Science and Technology, Charles Darwin University, Casuarina, 0909, NT, Australia(查尔斯达尔文大学科学与技术学院,Casuarina,0909,北领地,澳大利亚)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出首个多模态BioAutoML模型BioAutoML-NAS,利用神经架构搜索自动学习图像操作,结合元数据融合与交替双层优化,在BIOSCAN-5M数据集上以96.81%准确率超越现有方法。

Comments Accepted in IEEE Transactions on Big Data

Journal ref IEEE Transactions on Big Data (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08597 2026-06-16 cs.AI 版本更新 50%

An Attention Mechanism for Robust Multimodal Integration in a Global Workspace Architecture

全局工作空间架构中用于鲁棒多模态集成的注意力机制

Roland Bertin-Johannet, Lara Scipio, Leopold Maytié, Rufin VanRullen

机构 * CerCo, CNRS, Université de Toulouse(CerCo、CNRS、图卢兹大学) ANITI, Artificial and Natural Intelligence Toulouse Institute(ANITI、图卢兹人工智能与自然智能研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出一种轻量级自上而下的模态选择器,在冻结的多模态全局工作空间上运行,通过注意力机制提升系统在模态噪声或缺失下的鲁棒性,并在两个数据集上验证了其高效性和可迁移性。

Comments 21 pages, 6 figures, 2 tables. Accepted at ICANN 2026. Code: https://github.com/RolandBERTINJOHANNET/GW_attention

详情

展开后加载摘要…

URL PDF HTML 收藏