arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-01 至 2026-04-01 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 遥感融合与全色锐化 1 篇

2603.29784 2026-04-01 cs.CV 57%

MAPLE: Multi-Path Adaptive Propagation with Level-Aware Embeddings for Hierarchical Multi-Label Image Classification

MAPLE:多路径自适应传播与层次感知嵌入用于层次多标签图像分类

Boshko Koloski, Marjan Stoimchev, Jurica Levatić, Dragi Kocev, Sašo Džeroski

机构 * Jožef Stefan Institute(约热夫·斯特凡研究所) Jožef Stefan International Postgraduate School(约热夫·斯特凡国际研究生院)

专题命中 遥感融合与全色锐化 :multi-modal fusion(abstract);分类 cs.CV

AI总结 MAPLE通过结合层次语义初始化、图结构编码和自适应多模态融合,有效提升遥感图像的层次多标签分类性能,在少样本场景下提升42%,参数开销仅增加2.6%。

Comments REO: Advances in Representation Learning for Earth Observation, accepted workshow paper at EurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 2 篇

2603.29126 2026-04-01 cs.NI 88%

A Multi-Sensor Fusion Parking Barrier System with Lightweight Vision on Edge

一种基于边缘轻量视觉的多传感器融合停车栏系统

Yuwen Zhu, Feiyang Qi, Zhengzhe Xiang

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);multi-sensor fusion(title,abstract)

AI总结 本文提出一种基于深度学习和多传感器融合的智能停车栏系统,通过边缘计算和轻量化设计提升检测精度、实时性和低功耗性能,实验表明其在准确率、响应速度和能耗方面均具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06686 2026-04-01 cs.LG 50%

Balancing Multi-modal Sensor Learning via Multi-objective Optimization

通过多目标优化平衡多模态传感器学习

Heshan Fernando, Quan Xiao, Parikshit Ram, Yi Zhou, Horst Samulowitz, Nathalie Baracaldo, Tianyi Chen

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院) Cornell University(康奈尔大学)

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 本文提出MIMO方法,通过多目标优化平衡多模态传感器学习,提升系统可靠性并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 1 篇

2603.29676 2026-04-01 cs.LG cs.CL cs.CV 57%

A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models

大型视觉-语言模型的全面信息分解分析

Lixin Xiu, Xufang Luo, Hideki Nakayama

机构 * The University of Tokyo(东京大学) Microsoft Research(微软研究院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文通过信息分解方法分析大型视觉-语言模型的信息谱,揭示任务模式和模型策略,为模型设计提供新视角。

Comments Accepted at ICLR 2026. Project page: https://riishin.github.io/pid-lvlm-iclr26/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 3 篇

2603.29291 2026-04-01 cs.CV cs.AI 57%

MELT: Improve Composed Image Retrieval via the Modification Frequentation-Rarity Balance Network

MELT:通过修改频繁性-稀有性平衡网络改进组合图像检索

Guozhi Qiu, Zhiwei Chen, Zixu Li, Qinlei Huang, Zhiheng Fu, Xuemeng Song, Yupeng Hu

机构 * School of Software, Shandong University(山东大学软件学院) Southern University of Science and Technology(南方科技大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 MELT通过解决罕见语义定位不对称和硬负样本下的鲁棒相似性估计问题,改进组合图像检索的性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29029 2026-04-01 cs.CV cs.AI 57%

MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

MMFace-DiT:一种双流扩散变换器用于高保真多模态人脸生成

Bharath Krishnamurthy, Ajita Rattani

机构 * University of North Texas(北德克萨斯大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 MMFace-DiT通过双流Transformer实现多模态人脸生成,融合空间和语义信息,提升生成质量与控制能力,相比现有方法提升40%的视觉保真度和提示对齐度。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 22 pages (Main Text + Supplementary), 14 figures, 5 tables, 4 algorithms. Project page: https://vcbsl.github.io/MMFace-DiT/ and Code Repository: https://github.com/Bharath-K3/MMFace-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02350 2026-04-01 cs.HC 50%

FIRMED: A Peak-Centered Multimodal Dataset with Fine-Grained Annotation for Emotion Recognition

FIRMED:一种以峰值为中心的多模态数据集,用于情感识别的细粒度标注

Hao Tang, Songyun Xie, Xinzhou Xie, Can Liao, Bohan Li, Zhongyu Tian, Dalu Zheng

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 FIRMED通过即时回忆标注方法,提供同步的EEG、ECG、GSR、PPG和面部记录,以峰值为中心的标注减少了动态情感识别中的时间标签噪声,实验表明其在八种EEG分类器上平均提升3.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏