arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-08-11 至 2026-08-11 共收录 9 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 2 篇

2608.07582 2026-08-11 cs.CV 新提交 83%

Predictive Failure Detection in Network Hardware Using Thermal Imaging and Deep Learning with Sensor Fusion

基于热成像与传感器融合深度学习的网络硬件预测性故障检测

Ashly Joseph

专题命中 红外-可见光融合 :sensor fusion(title,abstract);multi-modal fusion(abstract);分类 cs.CV

AI总结 该研究提出结合热成像与电源传感器数据的多模态深度学习模型,经ROI预处理后可实现网络硬件早期故障的高精度预测,为数据中心主动维护提供支撑。

Journal ref Proceedings of the 2025 3rd International Conference on Data Science and Network Security (ICDSNS), Tiptur, India, 25-26 July 2025, Institute of Electrical and Electronics Engineers (IEEE), pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07848 2026-08-11 cs.CV 新提交 57%

IRPol-Fuse: Energy-structure coordination for infrared polarization fusion under low visibility

IRPol-Fuse:低能见度下红外偏振图像的能量-结构协同融合方法

Zhuangfan Huang, Chusheng Fang, Xiaosong Li, Yang Liua, Xiaoqi Cheng, Haishu Tan

机构 * Foshan University(佛山大学)

专题命中 红外-可见光融合 :image fusion(abstract);分类 cs.CV

AI总结 该研究针对低能见度下红外偏振图像融合的缺陷,提出IRPol-Fuse框架,构建LI-PI数据集,实验验证其在目标与细节保留及下游任务中的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多聚焦/多曝光融合 1 篇

2608.07962 2026-08-11 astro-ph.GA astro-ph.IM 新提交 50%

A Two-level Radial-velocity Zero-point Calibration for LAMOST MRS with Gaia and APOGEE and a Value-added RV Catalogue

基于Gaia和APOGEE的LAMOST MRS的两级视向速度零点校准及增值视向速度星表

Jinming Zhang, Haibo Yuan

专题命中 多聚焦/多曝光融合 :multi-exposure(abstract)

AI总结 该研究针对LAMOST MRS的RV零点系统误差,提出两级校准方法并发布增值星表,使RV精度提升约2倍,支持跨多维度的一致视向速度分析。

Comments 18 pages, 12 figures. Catalogue available at https://doi.org/10.5281/zenodo.21467895 ; pipeline at https://github.com/CrotRest/lamost-mrs-rvzp. Accepted by ApJS

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 1 篇

2608.09830 2026-08-11 cs.LG 新提交 78%

Deep Multimodal Wearable Sensor Fusion for Detection of Body-Focused Repetitive Behaviors

用于聚焦身体重复行为检测的深度多模态可穿戴传感器融合

Samaneh Rezaeimanesh, Mohsen Behradfar, Mohammad Fili, Guiping Hu

机构 * George Mason University(乔治梅森大学)

专题命中 机器人多传感器融合 :sensor fusion(title,abstract)

AI总结 本研究开发多模态深度学习框架,利用腕戴式传感器数据检测聚焦身体的重复行为,在二元及九分类任务中均优于单模态基线,为可穿戴辅助心理健康诊断奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 2 篇

2608.09202 2026-08-11 cs.AI 新提交 78%

CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving

CRUISE:面向鲁棒自动驾驶的视觉语言模型引导的不确定性感知跨模态传感器融合

Junyao Wang, Yulin Xu, Yu Li, Pramod Khargonekar, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 音视频/视觉语言融合 :sensor fusion(title,abstract)

AI总结 针对现有不确定性感知融合方法泛化性差的问题,提出CRUISE框架,结合VLM引导的UQ模块与动态自适应机制,实现鲁棒的自动驾驶跨模态传感器融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08915 2026-08-11 cs.CL 新提交 50%

Investigating Multimodal Informativity under Different Partner Visibility Conditions in Video-Mediated Dialogue

视频介导对话中不同伙伴可见性条件下的多模态信息性研究

Esam Ghaleb, Hugh Mee Wong, Kristina Kobrock

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本研究针对视频介导对话,构建基于语音、手势或两者的模型识别指称对象,发现手势可单独预测指称,融合模型在转录模型不确定时效果最佳,还揭示了伙伴可见性对互动的语用效应。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 3 篇

2608.07574 2026-08-11 cs.CV cs.RO 新提交 62%

Multimodal Skin Lesion Classification with Swin Transformer and Clinical Metadata Fusion

基于Swin Transformer与临床元数据融合的多模态皮肤病变分类

Nethmi Pathirana, Isuru Munasinghe, Dileeka Alwis

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV、cs.RO

AI总结 该研究针对皮肤病变分类的自动化挑战,提出结合Swin Transformer图像特征与临床元数据的多模态框架,在公开数据集上实现92.55%测试准确率,兼具强少数类性能与预测可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09550 2026-08-11 cs.CV 新提交 57%

PressureMesh: 3D Human Mesh Estimation from Multi-Device Pressure Images

PressureMesh:基于多设备压力图像的3D人体网格估计

Changhai Ma, Ziyu Wu, Yunkang Zhang, Fangting Xie, Mengting Niu, Heyu Ding, Quan Wan, Jiayue Yuan, Boyan Liu, Yi Ke, Xiaohui Cai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对单设备压力监测范围有限的问题,提出端到端网络MDP-Net,结合MoE框架的多模态融合机制,构建MDP数据集,实现跨设备压力数据的3D人体网格估计,关节位置误差为12.6cm。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08307 2026-08-11 cs.CV cs.AI 新提交 57%

Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering

用于医学视觉问答的频域双分支融合

Yusra Tariq, Rakesh Chandra Joshi

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出频域双分支融合模块,结合BiomedCLIP与BioBART,在PMC-VQA预训练后于VQA-RAD、SLAKE微调,提升医学VQA性能且架构轻量高效。

Comments 7 Pages, 4 figures, under review at AAAI 27

详情

展开后加载摘要…

URL PDF HTML 收藏