arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-15 至 2026-04-15 共收录 4 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 遥感融合与全色锐化 2 篇

2604.12463 2026-04-15 cs.CV cs.AI 79%

Euler-inspired Decoupling Neural Operator for Efficient Pansharpening

受欧拉启发的解耦神经算子用于高效全色增强

Anqi Zhu, Mengting Ma, Yizhen Jiang, Xiangdong Li, Kai Zheng, Jiaxin Li, Wei Zhang

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) School of Computer Science and Technology , Chongqing University of Post and Telecommunications(重庆邮电大学计算机科学与技术学院)

专题命中 遥感融合与全色锐化 :pansharpening(title,abstract);分类 cs.CV

AI总结 本文提出EDNO框架,通过欧拉公式将特征转换为极坐标系统,实现显式-隐式交互机制,提升全色增强的效率与性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10584 2026-04-15 cs.CV 79%

CoFusion: Multispectral and Hyperspectral Image Fusion via Spectral Coordinate Attention

CoFusion:通过光谱坐标注意力实现多谱段和超谱图像融合

Baisong Li

机构 * School of Integrated Circuits, Tsinghua University, Beijing 100084, China(集成电路学院,清华大学,北京100084,中国)

专题命中 遥感融合与全色锐化 :image fusion(title,abstract);分类 cs.CV

AI总结 本文提出CoFusion框架,通过建模跨尺度和跨模态依赖,提升多谱段和超谱图像融合的空谱协同效果,实现空谱细节增强与光谱保真度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音视频/视觉语言融合 1 篇

2603.29977 2026-04-15 cs.LG cs.AI q-bio.QM 50%

Quantifying Cross-Modal Interactions in Multimodal Glioma Survival Prediction via InterSHAP: Evidence for Additive Signal Integration

通过InterSHAP量化多模态胶质瘤生存预测中的跨模态交互:证据显示信号整合是加性的

Iain Swift, JingHua Ye, Ruairi O'Reilly

机构 * Department of Computer Science, Munster Technological University, Cork, Ireland(莫斯堡技术大学计算机科学系,爱尔兰科克)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文通过InterSHAP评估多模态深度学习在胶质瘤生存预测中的跨模态交互,发现性能提升源于互补信号聚合而非协同效应,为模型审计和联邦学习提供新视角。

Comments 8 pages, 1 figure, under review at XAI 2026 LBW

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 1 篇

2604.12145 2026-04-15 eess.AS cs.SD 78%

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization

为何您的分词器在信息融合中失败:一种面向时间的预量化融合用于视频增强的音频分词

Xiangyu Zhang, Benjamin John Southwell, Siqi Pan, Xinlei Niu, Beena Ahmed, Julien Epps

机构 * School of Electrical Engineering and Telecommunications, University of New South Wales(新南威尔士大学电气工程与电信学院) Dolby Laboratories(杜比实验室)

专题命中 融合架构与评测 :information fusion(title);multimodal fusion(abstract)

AI总结 本文研究了视频增强音频分词中重建质量下降的根本原因,提出了一种面向时间的预量化融合方法,通过在分词器架构中合理定位融合位置,结合时间轴上的特征融合,实现了高保真重建和下游任务的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏