arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-14 至 2026-04-14 共收录 10 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2406.13621 2026-04-14 cs.CL cs.CV cs.LG 79%

LaMI: Augmenting Large Language Models via Late Multi-Image Fusion

LaMI:通过晚期多图像融合增强大型语言模型

Guy Yariv, Idan Schwartz, Yossi Adi, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Bar-Ilan University(巴伊兰大学)

专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV

AI总结 LaMI通过在测试时融合多个图像提升视觉常识推理能力,同时保持文本推理性能,适用于视觉和NLP任务。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 医学影像融合 1 篇

2604.10116 2026-04-14 cs.CV cs.AI 57%

A Dual Cross-Attention Graph Learning Framework For Multimodal MRI-Based Major Depressive Disorder Detection

一种双交叉注意力图学习框架用于多模态MRI基于重大抑郁障碍检测

Nojod M. Alotaibi, Areej M. Alhothali

机构 * King Abdulaziz University(阿卜杜勒阿齐兹国王大学)

专题命中 医学影像融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出双交叉注意力融合框架,通过建模结构性MRI与功能型MRI的双向交互,提升多模态MRI在重大抑郁障碍检测中的性能,实验显示其在多种脑图谱类型中表现优异。

Comments 19 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 3 篇

2604.11570 2026-04-14 cs.HC cs.MM 57%

From Multimodal Signals to Adaptive XR Experiences for De-escalation Training

从多模态信号到自适应XR体验的降级训练

Birgit Nierula, Karam Tomotaki-Dawoud, Daniel Johannes Meyer, Iryna Ignatieva, Mina Mottahedin, Thomas Koch, Sebastian Bosse

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 本文提出了一种多模态实时通信分析系统,用于自适应VR训练的基础交互层,整合了语音、手势、情感分析、脑电波和生理信号,通过同步技术实现用户意识和无意识沟通线索的连续评估,结合社会符号学和象征互动理论,构建了连接低层信号到冲突缓解的解释层。

Comments 16 pages, 5 figures, ACM Intelligent User Interfaces (IUI) Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14170 2026-04-14 cs.CV cs.AI cs.ET 57%

Progressive Multimodal Interaction Network for Reliable Quantification of Fish Feeding Intensity in Aquaculture

渐进多模态交互网络用于水产养殖中鱼摄食强度的可靠量化

Shulong Zhang, Mingyuan Yao, Jiayin Zhao, Daoliang Li, Yingyi Chen, Haihua Wang

机构 * National Innovation Center for Digital Fishery(国家数字渔业创新中心) Key Laboratory of Smart Farming Technologies for Aquatic Animal and Livestock, Ministry of Agriculture and Rural Affairs(农业农村部水产动物与畜禽智慧养殖技术重点实验室) State Key Laboratory of Efficient Utilization of Agricultural Water Resources(农业水资源高效利用全国重点实验室) Beijing Engineering and Technology Research Center for Internet of Things in Agriculture(北京市农业物联网工程技术研究中心) Key Laboratory of Digital Fisheries of Shandong Province(山东省数字渔业重点实验室) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出渐进多模态交互网络PMIN,通过整合图像、音频和水波数据,有效解决多模态数据不一致性和决策冲突问题,提升鱼摄食强度量化可靠性,实验表明其在精度、参数和计算成本上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10460 2026-04-14 cs.CV cs.AI cs.CR cs.ET 57%

Toward Accountable AI-Generated Content on Social Platforms: Steganographic Attribution and Multimodal Harm Detection

迈向社交平台可问责的AI生成内容:隐写术溯源与多模态危害检测

Xinlei Guan, David Arosemena, Tejaswi Dhandu, Kuan Huang, Meng Xu, Miles Q. Li, Bingyu Shen, Ruiyang Qin, Umamaheswara Rao Tida, Boyang Li

机构 * Kean University(基恩大学) North Dakota State University(北达科他州立大学) McGill University(麦吉尔大学) Villanova University(维拉诺瓦大学) University of Notre Dame(圣母大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出一种隐写术溯源框架,结合多模态危害检测,用于追踪AI生成图像的有害部署,提升合成媒体环境中的问责能力。

Comments 12 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 5 篇

2604.10086 2026-04-14 astro-ph.IM 71%

A Multi-modal Fusion Network for Star-Galaxy Classification from CSST Simulated Datasets

基于CSST模拟数据的多模态融合网络用于星系分类

Zhuoming Han, Tianmeng Zhang, Chao Liu, Chenxiaoji Ling

专题命中 融合架构与评测 :multi-modal fusion(title)

AI总结 本文提出基于ResNet-50和BiLSTM的多模态融合网络,利用CSST模拟数据提升星系和恒星分类性能,达到99.81%的召回率。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10000 2026-04-14 cs.CV 57%

SwinTextUNet: Integrating CLIP-Based Text Guidance into Swin Transformer U-Nets for Medical Image Segmentation

SwinTextUNet:将基于CLIP的文本引导整合到Swin Transformer U-Nets中用于医学图像分割

Ashfak Yeafi, Parthaw Goswami, Md Khairul Islam, Ashifa Islam Shamme

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出SwinTextUNet,结合CLIP文本嵌入与Swin Transformer U-Net,提升医学图像分割的鲁棒性和准确性,在QaTaCOV19数据集上取得86.47%的Dice和78.2%的IoU成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09932 2026-04-14 cs.LG cs.AI eess.SP 57%

A Hybrid Intelligent Framework for Uncertainty-Aware Condition Monitoring of Industrial Systems

一种用于工业系统不确定性感知条件监测的混合智能框架

Maryam Ahang, Todd Charter, Masoud Jalayer, Homayoun Najjaran

机构 * University of Victoria(维多利亚大学) Aalto University(阿尔托大学)

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 eess.SP

AI总结 本文提出一种结合数据驱动学习与物理模型的混合框架,通过残差和时间特征提升诊断准确率,实验显示混合方法在非线性工业系统中提高了准确性和决策可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15198 2026-04-14 eess.SP 57%

Space-Time-Frequency Synthetic Integrated Sensing and Communication Networks

时空频合成集成感知与通信网络

Henglin Pu, Xuefeng Wang, Lu Su, Husheng Li

专题命中 融合架构与评测 :information fusion(abstract);分类 eess.SP

AI总结 本文提出一种时空频合成ISAC架构,融合分布式发射机和接收机的观测,推导CRLB并比较MLE与TSIF方法的性能,证明全合成网络处理对低SNR下估计精度至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11334 2026-04-14 cs.AI 50%

Dynamic Summary Generation for Interpretable Multimodal Depression Detection

动态摘要生成用于可解释的多模态抑郁症检测

Shiyu Teng, Jiaqing Liu, Hao Sun, Yu Li, Shurong Chai, Ruibo Hou, Tomoko Tateyama, Lanfen Lin, Yen-Wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Faculty of Engineering, University of the Ryukyus(琉球大学工学部)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出一种粗到细的多阶段框架,利用大语言模型实现准确且可解释的多模态抑郁症检测,通过生成临床摘要指导多模态融合模块,提升诊断准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏