arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-05 至 2026-03-05 共收录 4 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 1 篇

2603.03871 2026-03-05 cs.CV 88%

Bridging Human Evaluation to Infrared and Visible Image Fusion

将人类评估与红外与可见图像融合相结合

Jinyuan Liu, Xingyuan Li, Qingyun Mei, Haoyuan Xu, Zhiying Jiang, Long Ma, Risheng Liu, Xin Fan

机构 * School of Mechanical Engineering, Dalian University of Technology(大连理工大学机械工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology & DUT-RU International School of ISE, Dalian University of Technology(大连理工大学软件学院) College of Information Science and Technology, Dalian Maritime University(大连海事大学信息科学与技术学院)

专题命中 红外-可见光融合 :image fusion(title,abstract);infrared and visible(title,abstract);分类 cs.CV

AI总结 本文提出了一种反馈强化框架,通过引入大规模人类反馈数据集和领域特定奖励函数,提升红外与可见图像融合的感知质量,使其更符合人类审美。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 医学影像融合 1 篇

2603.03618 2026-03-05 cs.CV 57%

CoRe-BT: A Multimodal Radiology-Pathology-Text Benchmark for Robust Brain Tumor Typing

CoRe-BT:一种多模态放射科-病理科-文本基准,用于鲁棒性脑肿瘤分类

Juampablo E. Heras Rivera, Daniel K. Low, Xavier Xiong, Jacob J. Ruzevick, Daniel D. Child, Wen-wai Yim, Mehmet Kurt, Asma Ben Abacha

机构 * University of Washington(华盛顿大学) University of Washington School of Medicine(华盛顿大学医学院) Microsoft Health AI(微软健康人工智能)

专题命中 医学影像融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 CoRe-BT提出一个多模态基准,用于在缺失模态条件下提升脑肿瘤分类的鲁棒性,通过整合MRI、病理图像和报告,推动多模态学习与表示学习的发展。

Comments Under review, MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 2 篇

2603.03615 2026-03-05 cs.CV 57%

Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compression

视差对齐所有内容:一种用于分布式多视图图像压缩的 OmniParallax 注意机制

Haotian Zhang, Feiyue Long, Yixin Yu, Jian Xue, Haocheng Tang, Tongda Xu, Zhenning Shi, Yan Wang, Siwei Ma, Jiaqi Zhang

机构 * The National Engineering Laboratory for Video Technology, School of Computer Science, Peking University(国家视频技术工程实验室,计算机科学学院,北京大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 ParaHydra通过OmniParallax注意机制和多信息融合模块,实现了分布式多视图图像压缩的高效编码与解码,显著提升压缩效率并降低计算开销

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03544 2026-03-05 cs.CV 57%

PinCLIP: Large-scale Foundational Multimodal Representation at Pinterest

PinCLIP:Pinterest的规模化多模态基础表示

Josh Beal, Eric Kim, Jinfeng Rao, Rex Wu, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest Inc.(Pinterest公司)

专题命中 融合架构与评测 :hybrid fusion(abstract);分类 cs.CV

AI总结 PinCLIP通过多模态表示学习提升Pinterest的检索和排序模型,解决冷启动问题并提高用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏