arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-23 至 2026-03-23 共收录 2 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 2 篇

2603.19681 2026-03-23 cs.CV 74%

Unbiased Dynamic Multimodal Fusion

无偏动态多模态融合

Shicai Wei, Kaijie Zhang, Luyi Chen, Tao He, Guiduo Duan

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV

AI总结 本文提出UDML框架,通过引入噪声感知不确定性估计器和模态dropout量化模态依赖偏置,解决动态多模态融合中模态质量评估不准确和模态贡献分配不合理的问题。

Comments CVPR2026 Findings, 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18062 2026-03-23 cs.CV cs.AI 57%

S3T-Former: A Purely Spike-Driven State-Space Topology Transformer for Skeleton Action Recognition

S3T-Former:一种纯粹由脉冲驱动的状态空间拓扑变换器用于骨骼动作识别

Naichuan Zheng, Hailun Xia, Zepeng Sun, Weiyi Li, Yujia Wang

机构 * School of Information and Communication Engineering(信息与通信工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) International School(国际学校) School of Economics and Management(经济管理学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出S3T-Former,一种专为高效骨骼动作识别设计的脉冲驱动变换器,通过多流解剖脉冲嵌入和横向脉冲拓扑路由实现稀疏事件流,提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏