arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-31 至 2026-07-31 共收录 4 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 医学影像融合 1 篇

2607.28565 2026-07-31 cs.CV 新提交 88%

MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion

MIND:基于扩散Transformer的多模态意图驱动网络用于医学图像融合

Yunzhan Fu, Xiangyu Shen, Yifei Sun, Yuhan Chen, Jian Wu, Hongxia Xu

机构 * Transvascular Implantation Devices Research Institute, Zhejiang University(浙江大学血管内植入器械研究院) Zhejiang University(浙江大学) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 医学影像融合 :image fusion(title,abstract);medical image fusion(title,abstract);分类 cs.CV

AI总结 该研究针对现有医学图像融合方法缺乏对诊断意图深度理解的问题,提出基于DiTs的MIND网络,通过BioMedGPT、多尺度潜在适配器和医学语义一致性损失优化,在多数据集上取得优异效果,可提升脑肿瘤分割精度并支持交互式融合。

Comments 14pages, 14 figures, accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 1 篇

2607.28158 2026-07-31 eess.SY cs.SY 新提交 67%

Stochastic Average Consensus Filtering and Distributed State Estimation for Boolean Control Networks

布尔控制网络的随机平均共识滤波与分布式状态估计

Rong Yang, Chi Huang

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract)

AI总结 针对布尔控制网络集中式估计的缺陷,本文结合概率测度变换等方法提出分布式随机平均共识滤波器,证明其收敛性,实现基于局部通信的全局状态估计。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 2 篇

2607.27289 2026-07-31 cs.LG 新提交 78%

TIER-MoE: Trust-Informed Expert Routing via Conditional Modality Risk for Multimodal Fusion in Biomedical Classification

TIER-MoE:用于生物医学分类多模态融合的、基于条件模态风险的信任感知专家路由

Yu Chang, Anzhe Cheng, Chenwei Wu, Zhuoran Wang, Jiahao Chen, Tamoghna Chattopadhyay, Sophia I. Thomopoulos, Paul M. Thompson, Liyue Shen, Paul Bogdan

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 该研究提出TIER-MoE风险引导子空间混合专家模型,用于生物医学分类多模态融合,可提升预测性能与概率校准,在多数据集上优于现有最优方法且具备强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28375 2026-07-31 cs.AI cs.MM 新提交 57%

HyperClaim: Fine-Grained Cross-Modal Hypergraph Reasoning for Video Misinformation Detection

HyperClaim:用于视频虚假信息检测的细粒度跨模态超图推理

Xiangbo Wang, Jiasheng Zhang, Xingtong Yu, Luoqiang Lei, Delvin Ce Zhang

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 HyperClaim是一种用于视频虚假信息检测的判别式时间超图框架,通过细粒度跨模态超图推理,在FactGuard协议下的三个数据集上准确率优于基线方法。

Comments 13 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏