arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-23 至 2026-03-23 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 2 篇

2507.23508 2026-03-23 cs.CV 79%

Hyperbolic Cycle Alignment for Infrared-Visible Image Fusion

双曲循环对齐用于红外-可见图像融合

Timing Li, Bing Cao, Jiahe Feng, Haifang Cao, Qinghau Hu, Pengfei Zhu

机构 * College of Intelligence and Computing(智能与计算学院)

专题命中 红外-可见光融合 :image fusion(title,abstract);分类 cs.CV

AI总结 本文提出基于双曲空间的双曲循环对齐网络,通过双路径交叉模态循环对齐框架和双曲层次对比对齐模块,实现更有效的多模态图像对齐与融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19565 2026-03-23 cs.CV cs.AI cs.LG 57%

PFM-VEPAR: Prompting Foundation Models for RGB-Event Camera based Pedestrian Attribute Recognition

基于RGB事件相机的行人属性识别的PFM-VEPAR:用于基础模型的提示方法

Minghe Xu, Rouying Wu, ChiaWei Chu, Xiao Wang, Yu Li

机构 * City University of Macau(澳门城市大学) Zhuhai College of Science and Technology(珠海科学技术学院) Macau University of Science and Technology(澳门科学大学) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 红外-可见光融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出PFM-VEPAR,通过轻量级DCT和IDCT提取事件域特征,结合外部记忆库和Hopfield网络提升行人属性识别的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 3 篇

2603.19914 2026-03-23 cs.HC cs.RO 57%

Sense4HRI: A ROS 2 HRI Framework for Physiological Sensor Integration and Synchronized Logging

Sense4HRI: 一种基于ROS 2的人机交互框架,用于生理传感器集成与同步日志记录

Manuel Scheibl, Julian Leichert, Sinem Görmez, Britta Wrede

机构 * Medical Assistance Systems, Medical School OWL, Bielefeld University(比勒菲尔德大学医疗援助系统,医学学校OWL)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO

AI总结 本文提出Sense4HRI框架,用于在ROS 2中整合生理信号并提供标准化的多模态分析,支持可扩展的生理传感器集成与同步日志记录。

Comments 6 pages, 3 figures, submitted at IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16931 2026-03-23 cs.AI cs.RO 57%

Multimodal Fused Learning for Solving the Generalized Traveling Salesman Problem in Robotic Task Planning

多模态融合学习用于解决机器人任务规划中的广义旅行商问题

Jiaqi Cheng, Mingfeng Fan, Xuefeng Zhang, Jingsong Liang, Yuhong Cao, Guohua Wu, Guillaume Adrien Sartoretti

机构 * Central South University(中南大学) National University of Singapore(新加坡国立大学)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO

AI总结 本文提出多模态融合学习框架,通过图和图像表示捕捉问题互补方面,生成高质量实时任务规划方案,实验表明其在各类GTSP实例中性能优于现有方法。

Comments 14 pages, 6 figures, Proceedings of the Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19529 2026-03-23 cs.CV cs.HC cs.LG 57%

SurfaceXR: Fusing Smartwatch IMUs and Egocentric Hand Pose for Seamless Surface Interactions

SurfaceXR: 结合智能手表IMU与第一人称手姿态实现无缝表面交互

Vasco Xu, Brian Chen, Eric J. Gonzalez, Andrea Colaço, Henry Hoffmann, Mar Gonzalez-Franco, Karan Ahuja

机构 * University of Chicago(芝加哥大学) Northwestern University(西北大学) Northwestern University and Google(西北大学和谷歌) Google(谷歌)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV

AI总结 SurfaceXR通过融合智能手表IMU与第一人称手姿态数据,提升表面交互的准确性和舒适性,实验验证其在触控跟踪和8类手势识别上的显著优势。

Comments Accepted to IEEE VR 2026 as a TVCG journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 2 篇

2603.19681 2026-03-23 cs.CV 74%

Unbiased Dynamic Multimodal Fusion

无偏动态多模态融合

Shicai Wei, Kaijie Zhang, Luyi Chen, Tao He, Guiduo Duan

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV

AI总结 本文提出UDML框架,通过引入噪声感知不确定性估计器和模态dropout量化模态依赖偏置,解决动态多模态融合中模态质量评估不准确和模态贡献分配不合理的问题。

Comments CVPR2026 Findings, 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18062 2026-03-23 cs.CV cs.AI 57%

S3T-Former: A Purely Spike-Driven State-Space Topology Transformer for Skeleton Action Recognition

S3T-Former:一种纯粹由脉冲驱动的状态空间拓扑变换器用于骨骼动作识别

Naichuan Zheng, Hailun Xia, Zepeng Sun, Weiyi Li, Yujia Wang

机构 * School of Information and Communication Engineering(信息与通信工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) International School(国际学校) School of Economics and Management(经济管理学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出S3T-Former,一种专为高效骨骼动作识别设计的脉冲驱动变换器,通过多流解剖脉冲嵌入和横向脉冲拓扑路由实现稀疏事件流,提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏