arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-05-28 至 2026-05-28 共收录 4 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 机器人多传感器融合 1 篇

2605.28412 2026-05-28 cs.RO cs.LG 79%

Tactile-Proprioceptive Sensor Fusion for Contact Wrench Estimation in Whole-Body Physical Human-Robot Interaction

触觉-本体感觉传感器融合用于全身物理人机交互中的接触力估计

Junha Min, Junghyeon Ma, Jiwung Kwon, Sunggyu Bae, Joohyung Kim, Kyungseo Park

机构 * Department of Robotics and Mechatronics Engineering, DGIST (Daegu Gyeongbuk Institute of Science and Technology)(机器人与机电工程系,DGIST(大邱庆尚科学技术研究所)) Kinetic Intelligent Machine Lab (KIMLAB), University of Illinois Urbana-Champaign(动能智能机器实验室(KIMLAB),伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);分类 cs.RO

AI总结 提出触觉-本体感觉融合框架,利用气动皮肤垫的触觉线索作为接触指示器,结合基于电机电流的本体感觉,通过时间卷积网络消除摩擦滞后,实现多轴接触力重建,提高物理人机交互的灵敏度和响应性。

Comments 8 pages, 6 figures. Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音视频/视觉语言融合 1 篇

2605.24302 2026-05-28 cs.CV 57%

Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies

基于Mamba的第一人称视频跨模态动作识别:通过CLS令牌融合策略整合RGB和手部骨架流

Juan Ignacio Bustos Gorostegui, Maria Elena Buemi

机构 * Univ. of Buenos Aires. Faculty of Exact and Natural Sciences. Dept. of Computer Science (DC)(布宜诺斯艾利斯大学。精确与自然科学学院。计算机科学系) CONICET-Univ. of Buenos Aires. Institute of Computer Sciences (ICC)(布宜诺斯艾利斯大学CONICET联合体。计算机科学研究所)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出一种基于Mamba的跨模态架构,通过四种CLS令牌融合策略(朴素、平均、加权和基于上下文)整合RGB视频和手部骨架数据,在H2O数据集上平均策略达到最佳性能,Top-1准确率在Tiny配置下提升超10%。

Comments 4 pages , 2 figures , Egovis2026 , CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 2 篇

2605.27417 2026-05-28 quant-ph cs.AI cs.LG 50%

Quantum Machine Learning-based 6G edge Network: Enabling Adaptive Communication and Model Aggregation

基于量子机器学习的6G边缘网络:实现自适应通信与模型聚合

Wenjing Xiao, Jiatai Yan, Chenglong Shi, Shixin Chen, Miaojiang Chen, Min Chen, Saif Al-Kuwari, Ahmed Farouk

机构 * School of Computer, Electronics and Information, Guangxi University(广西大学计算机电子信息学院) Guangxi Key Laboratory of Multimedia Communications and Network Technology(广西多媒体通信与网络技术重点实验室) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Pazhou Laboratory(琶洲实验室) Qatar Center for Quantum Computing, College of Science and Engineering, Hamad Bin Khalifa University(卡塔尔量子计算中心,哈马德·本·哈利法大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 针对6G V2X通信中的高维状态空间、异构节点和动态环境挑战,提出量子增强框架,包含信道自适应语义通信、多模态融合、模型迁移和联邦聚合四个模块,利用量子卷积神经网络、量子注意力、量子强化学习和量子张量分解提升效率、泛化能力和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13743 2026-05-28 cs.LG 50%

GHGbench: A Unified Multi-Entity, Multi-Task Benchmark for Carbon Emission Prediction

GHGbench:一个统一的多实体、多任务碳排放预测基准

Yifan Duan, Siyuan Zheng, Lihuan Li, Chao Xue, Flora Salim

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出GHGbench,一个包含公司和建筑层面温室气体排放预测的统一开放数据集与基准,通过多模态数据融合和标准化评估揭示结构化难度与分布外泛化差距。

详情

展开后加载摘要…

URL PDF HTML 收藏