arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-03 至 2026-04-03 共收录 8 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 2 篇

2604.01579 2026-04-03 cs.CV cs.AI 79%

Harmonized Tabular-Image Fusion via Gradient-Aligned Alternating Learning

通过梯度对齐交替学习实现表-图像融合

Longfei Huang, Yang Yang

机构 * Nanjing University of Science and Technology(南京理工大学)

专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV

AI总结 本文提出GAAL方法,通过对齐模态梯度解决多模态表-图像融合中的梯度冲突问题,提升融合性能。

Comments ICME 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24379 2026-04-03 cs.CV 79%

A Luminance-Aware Multi-Scale Network for Polarization Image Fusion with a Multi-Scene Dataset

一种考虑亮度的多尺度网络用于极化图像融合与多场景数据集

Zhuangfan Huang, Xiaosong Li, Gao Wang, Tao Ye, Haishu Tan, Huafeng Li

机构 * Guangdong-HongKong-Macao Joint Laboratory for Intelligent Micro-Nano Optoelectronic Technology, School of Physics and Optoelectronic Engineering, Foshan University(广东-香港-澳门智能微纳光电子技术联合实验室,物理与光电工程学院,佛山大学) State Key Laboratory of Dynamic Measurement Technology, North University of China(动态测试技术国家重点实验室,中北大学) School of Information Engineering and Automation, Kunming University of Science and Technology(信息工程与自动化学院,昆明理工大学)

专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV

AI总结 本文提出考虑亮度的多尺度网络,通过多尺度空间权重矩阵和全局-局部特征融合机制,提升极化图像融合在复杂光照环境下的性能,使用多场景数据集验证了方法的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 2 篇

2604.01900 2026-04-03 cs.CV 79%

FTPFusion: Frequency-Aware Infrared and Visible Video Fusion with Temporal Perturbation

FTPFusion:基于时序扰动的频率感知红外与可见视频融合

Xilai Li, Chusheng Fang, Xiaosong Li

机构 * Foshan University(佛山大学)

专题命中 红外-可见光融合 :infrared and visible(title,abstract);分类 cs.CV

AI总结 本文提出FTPFusion方法,通过时序扰动和稀疏跨模态交互实现红外与可见视频融合,提升时序稳定性和空间细节保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01766 2026-04-03 cs.CV cs.AI 57%

FSKD: Monocular Forest Structure Inference via LiDAR-to-RGBI Knowledge Distillation

FSKD:通过LiDAR到RGBI知识蒸馏推断单目森林结构

Taimur Khan, Hannes Feilhauer, Muhammad Jazib Zafar

机构 * Helmholtz Centre for Environmental Research – UFZ(亥姆霍兹环境研究中心) Leipzig University(莱比锡大学) Georg-August University of Göttingen(哥廷根大学)

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出FSKD框架,利用多模态教师模型融合RGBI影像与LiDAR衍生的平面指标和垂直剖面,通过交叉注意力机制,使RGBI-only的SegFormer学生模型在零样本情况下实现最先进的CHM性能,同时预测PAI和FHD等多指标。

Comments Paper in-review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 1 篇

2604.02108 2026-04-03 cs.RO cs.LG 57%

Cross-Modal Visuo-Tactile Object Perception

跨模态视觉-触觉物体感知

Anirvan Dutta, Simone Tasciotti, Claudia Cusseddu, Ang Li, Panayiota Poirazi, Julijana Gjorgjieva, Etienne Burdet, Patrick van der Smagt, Mohsen Kaboli

机构 * BMW Group AG(宝马集团) Imperial College of Science, Technology and Medicine(帝国理工学院) University of Crete(克里特大学) Institute of Molecular Biology and Biotechnology, Foundation for Research and Technology-Hellas(分子生物学与生物技术研究所,研究与技术基金会-希腊) Technical University of Munich(慕尼黑工业大学) Eötvös Loránd University(罗兰大学) Foundation Robotics Labs(基础机器人实验室) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 本文提出跨模态潜在滤波器(CMLF),通过贝叶斯推断实现视觉与触觉信息的双向传递,提升机器人在不确定性下的物理属性估计效率与鲁棒性,同时展现类人感知耦合现象。

Comments 23 pages, 8 figures, 1 table. Submitted for review to journal

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 3 篇

2604.01667 2026-04-03 cs.AI cs.CV 57%

M3D-BFS: a Multi-stage Dynamic Fusion Strategy for Sample-Adaptive Multi-Modal Brain Network Analysis

M3D-BFS:一种多阶段动态融合策略用于样本自适应的多模态脑网络分析

Rui Dong, Xiaotong Zhang, Jiaxing Li, Yueying Li, Jiayin Wei, Youyong Kong

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出M3D-BFS,通过多阶段动态融合策略提升多模态脑网络分析的样本适应性,设计了不同专家模块以适应输入样本变化,并引入多模态解耦损失提升表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01924 2026-04-03 cs.CL 50%

Is Clinical Text Enough? A Multimodal Study on Mortality Prediction in Heart Failure Patients

临床文本足够吗?关于心力衰竭患者死亡预测的多模态研究

Oumaima El Khettari, Virgile Barthet, Guillaume Hocquet, Joconde Weller, Emmanuel Morin, Pierre Zweigenbaum

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本研究比较了文本、结构化数据和多模态方法在心力衰竭患者短期死亡预测中的表现,发现实体层面的表示能提升预测性能,而监督多模态融合表现最佳。

Comments Accepted in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01733 2026-04-03 cs.IR cs.CL 50%

From BM25 to Corrective RAG: Benchmarking Retrieval Strategies for Text-and-Table Documents

从BM25到纠正性RAG:文本与表格文档检索策略的基准测试

Meftun Akarsu, Recep Kaan Karaman, Christopher Mierbach

专题命中 融合架构与评测 :hybrid fusion(abstract)

AI总结 本文对比了十种检索策略,发现混合检索与神经重排序结合的方法在金融问答基准上表现优异,BM25在金融文档中优于最新密集检索,查询扩展方法对精确数值查询帮助有限。

Comments 11 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏