arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-05-15 至 2026-05-15 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 1 篇

2605.14626 2026-05-15 cs.CV 74%

UniTriGen: Unified Triplet Generation of Aligned Visible-Infrared-Label for Few-Shot RGB-T Semantic Segmentation

UniTriGen: 一致的可见-红外-标签三元组生成用于少样本RGB-T语义分割

Ping Zhou, Haoyu Wang, Mengmeng Zheng, Lei Zhang, Wei Wei, Chen Ding, Fei Zhou

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) School of Computer Science & Technology, Xi’an University of Posts & Telecommunications(西安邮电大学计算机科学与技术学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 红外-可见光融合 :visible-infrared(title);分类 cs.CV

AI总结 UniTriGen提出统一三元组生成框架,通过共享潜在空间和扩散过程生成一致的可见-红外-标签三元组,解决少样本RGB-T语义分割中的对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多聚焦/多曝光融合 1 篇

2605.14703 2026-05-15 cs.CV 57%

Generating HDR Video from SDR Video

从SDR视频生成HDR视频

SaiKiran Tedla, Francesco Banterle, Trevor Canham, Karanpreet Raja, David B. Lindell, Kiriakos N. Kutulakos, Jiacheng Li, Feiran Li, Daisuke Iso

机构 * Sony Research(索尼研究实验室) York University(约克大学) Vector Institute(向量研究所) University of Toronto(多伦多大学)

专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV

AI总结 本文提出利用大规模生成视频模型从普通SDR视频生成HDR视频,引入多曝光视频模型和可学习视频合并模型,通过实验验证了其在真实场景和电影中的HDR转换能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 遥感融合与全色锐化 1 篇

2602.04473 2026-05-15 cs.CV 79%

CC-Pan: Channel-wise Compression based Diffusion for Efficient Pan-Sharpening

CC-Pan: 基于通道压缩的扩散模型用于高效全色锐化

Junjie Li, Congyang Ou, Haokui Zhang, Guoting Wei, Shengqin Jiang, Ying Li

机构 * School of Cyberspace Security, Northwestern Polytechnical University(网络安全学院,西北工业大学) Nanjing University of Science and Technology(南京理工大学) School of Computer Science, Nanjing University of Information Science and Technology(计算机科学学院,南京信息工程大学)

专题命中 遥感融合与全色锐化 :pan-sharpening(title,abstract);分类 cs.CV

AI总结 本文提出CC-Pan,一种跨传感器潜在扩散框架,通过带级单通道变分自编码器编码高分辨率多谱段图像,结合轻量级区域基于跨带注意力模块,提升全色锐化精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 医学影像融合 1 篇

2605.14710 2026-05-15 cs.CV cs.AI 70%

Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke

基于视觉核心的对比学习用于脑卒中平衡多模态预后预测

Liren Chen, Lidong Sun, Mingyan Huang, Junzhe Tang, Yinghui Zhu, Guanjie Wang, Yiqing Xia, Ting Xiao

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 医学影像融合 :multimodal fusion(abstract);multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出三模态融合模型,通过大语言模型生成半结构化诊断文本并设计VDAFM模块,提升多模态融合鲁棒性,实现脑卒中预后预测的高精度。

Comments Corresponding author: Ting Xiao

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 音视频/视觉语言融合 1 篇

2506.01015 2026-05-15 cs.CV 57%

AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

AuralSAM2:通过金字塔音频视觉特征提示实现SAM2的听觉能力

Yuyuan Liu, Yuanhong Chen, Chong Wang, Junlin Han, Junde Wu, Can Peng, Jingkun Chen, Yu Tian, Gustavo Carneiro

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) Stanford University(斯坦福大学) University of Central Florida(佛罗里达中央大学) University of Surrey(萨里大学)

专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV

AI总结 AuralSAM2通过金字塔音频视觉特征提示整合音频,保持SAM2的可提示分割能力,引入AuralFuser融合音频和视觉特征,并通过音频引导对比损失对齐模态,提升分割精度。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 融合架构与评测 2 篇

2605.14878 2026-05-15 cs.MA 71%

Decision-Level Fusion for Robust Wearable Affect Recognition

决策级融合用于鲁棒的可穿戴情感识别

Lokesh Singh, Athina Georgara, Jayati Deshmukh, Tan Viet Tuyen Nguyen, Sarvapali D. Ramchurn

专题命中 融合架构与评测 :decision-level fusion(title)

AI总结 本文研究了可穿戴生理数据中情感状态自动识别的鲁棒性问题,提出结合傅里叶-贝塞尔级数展开与EWT的非稳态处理流程,通过决策级融合提升在异构和部分可靠传感下的识别鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14458 2026-05-15 cs.AI 50%

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

OmniDrop:通过查询引导的分层令牌剪枝实现多模态大语言模型

Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

机构 * Samsung Research(三星研究院)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 本文提出OmniDrop,通过查询引导的分层令牌剪枝方法,提升多模态大语言模型的效率与性能,实验表明其在多个音频视频基准测试中表现优异,减少预填充延迟和内存使用。

详情

展开后加载摘要…

URL PDF HTML 收藏