arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-06 至 2026-04-06 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2604.02396 2026-04-06 cs.CV cs.AI 57%

Environment-Aware Channel Prediction for Vehicular Communications: A Multimodal Visual Feature Fusion Framework

面向环境的车用通信信道预测:一种多模态视觉特征融合框架

Xuejian Zhang, Ruisi He, Minseok Kim, Inocent Calist, Mi Yang, Ziyi Qi

机构 * Graduate School of Science and Technology, Niigata University(新潟大学研究生院科学与技术系)

专题命中 通用Image Fusion :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出一种多模态视觉特征融合框架,利用GPS数据、车辆全景RGB图像及语义分割和深度估计提取语义、深度和位置特征,通过三分支架构和 squeeze-excitation 注意力门控模块实现自适应多模态融合,实现路径损耗、时延扩展、到达方位扩展、离开方位扩展和角功率谱的联合预测。

Comments 13 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 1 篇

2604.02896 2026-04-06 cs.CV 88%

EvaNet: Towards More Efficient and Consistent Infrared and Visible Image Fusion Assessment

EvaNet:迈向更高效且一致的红外与可见图像融合评估

Chunyang Cheng, Tianyang Xu, Xiao-Jun Wu, Tao Zhou, Hui Li, Zhangyong Tang, Josef Kittler

机构 * Jiangnan University(江南大学) University of Surrey(萨里大学)

专题命中 红外-可见光融合 :image fusion(title,abstract);infrared and visible(title,abstract);分类 cs.CV

AI总结 本文提出EvaNet框架,通过轻量网络高效近似常用指标,结合对比学习和大语言模型感知评估,实现更一致的图像融合评估。

Comments 20 figures,accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 遥感融合与全色锐化 2 篇

2604.02818 2026-04-06 physics.ao-ph 71%

MAG-Net: Physics-Aware Multi-Modal Fusion of Geostationary Satellite and Radar for Severe Convective Precipitation Nowcasting

MAG-Net:融合静止卫星和雷达的物理感知多模态融合用于强对流降水nowcasting

Dandan Chen, Yaqiang Wang, Anyuan Xiong, Enda Zhu

专题命中 遥感融合与全色锐化 :multi-modal fusion(title)

AI总结 MAG-Net通过融合静止卫星和雷达数据,利用物理约束提升对强对流降水的nowcasting性能,优于现有确定性和生成性模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03094 2026-04-06 cs.CV cs.AI 57%

A Data-Centric Vision Transformer Baseline for SAR Sea Ice Classification

一种面向数据的视觉Transformer基线用于SAR海冰分类

David Mike-Ewewie, Panhapiseth Lim, Priyanka Kumar

机构 * The University of Texas Permian Basin(德克萨斯大学二叠纪盆地分校)

专题命中 遥感融合与全色锐化 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出一种基于SAR的视觉Transformer基线,用于解决极地海冰分类中的类别不平衡问题,通过对比不同损失函数的性能,验证了聚焦损失在稀有冰类中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 1 篇

2506.03198 2026-04-06 cs.CV cs.AI 57%

FLEX: A Largescale Multimodal, Multiview Dataset for Learning Structured Representations for Fitness Action Quality Assessment

FLEX:一个大规模多模态、多视角数据集,用于学习结构化表示以评估健身动作质量

Hao Yin, Lijun Gu, Paritosh Parmar, Lin Xu, Tianxiao Guo, Xiujin Liu, Weiwei Fu, Yang Zhang, Tianyou Zheng

机构 * School of Biomedical Engineering (Suzhou), USTC(中国科学技术大学苏州生物医学工程学院) Suzhou Institute of Biomedical Engineering and Technology, CAS(中国科学院苏州生物医学工程技术研究所) Institute of High-Performance Computing, A*STAR, Singapore(新加坡科技研究局高性能计算研究所) School of Psychology, Beijing Sports University(北京体育大学心理学院) School of Competitive Sports, Beijing Sports University(北京体育大学竞技体育学院) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 FLEX数据集通过多模态融合和结构化知识图谱提升健身动作质量评估的准确性与解释性,支持跨模态预测和生物力学导向的表示学习。

Comments Dataset and code are available at https://github.com/HaoYin116/FLEX . Link to Project page https://haoyin116.github.io/FLEX_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 2 篇

2604.02759 2026-04-06 cs.RO 57%

OMNI-PoseX: A Fast Vision Model for 6D Object Pose Estimation in Embodied Tasks

OMNI-PoseX:一种用于具身任务中6D物体姿态估计的高效视觉模型

Michael Zhang, Wei Ying, Fangwen Chen, Shifeng Bai, Hanwen Kang

机构 * KernalMind Tech Co., Ltd.(KernalMind科技有限公司)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.RO

AI总结 本文提出OMNI-PoseX,一种结合开放词汇感知与SO(3)感知的高效视觉模型,通过轻量级多模态融合策略实现稳定且高效的6D姿态估计,并在多个基准测试中展示了SOTA的精度和实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02397 2026-04-06 cs.CV cs.AI 57%

Variational Encoder--Multi-Decoder (VE-MD) for Privacy-by-functional-design (Group) Emotion Recognition

变分编码器-多解码器(VE-MD)用于隐私-by-功能设计(群体)情绪识别

Anderson Augusma, Dominique Vaufreydaz, Fédérique Letué

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学, 法国国家科学研究中心, 格勒诺布尔国立理工学院, 信息学实验室) Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学, 法国国家科学研究中心, 格勒诺布尔国立理工学院, 让·库尔坦研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出VE-MD框架,通过约束模型仅预测群体层面情绪,避免个体监控,提升群体情绪识别性能,实验显示其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏