arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-06 至 2026-03-06 共收录 8 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 1 篇

2603.04745 2026-03-06 cs.CV 57%

Toward Real-world Infrared Image Super-Resolution: A Unified Autoregressive Framework and Benchmark Dataset

迈向真实世界红外图像超分辨率:一个统一的自回归框架和基准数据集

Yang Zou, Jun Ma, Zhidong Jiao, Xingyuan Li, Zhiying Jiang, Jinyuan Liu

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) School of Software Technology & DUT-RU International School of ISE, Dalian University of Technology(大连理工大学软件学院及DUT-RU国际信息工程学院) School of Computer Science, Zhejiang University(浙江大学计算机学院) College of Information Science and Technology, Dalian Maritime University(大连海事大学信息科学与技术学院)

专题命中 红外-可见光融合 :infrared and visible(abstract);分类 cs.CV

AI总结 本文提出Real-IISR框架和FLIR-IISR数据集,通过热-结构引导的自回归方法提升真实世界红外图像超分辨率性能。

Comments This paper was accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多聚焦/多曝光融合 1 篇

2603.05133 2026-03-06 eess.IV 57%

Anti-Aliasing Snapshot HDR Imaging Using Non-Regular Sensing

利用非规则传感的抗锯齿快照HDR成像

Teresa Stürzenhofäcker, Moritz Klimm, Jürgen Seiler, André Kaup

专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 eess.IV

AI总结 本文提出了一种基于非规则像素排列的快照HDR传感器,通过空间变化孔径和非规则排列减少锯齿效应,实现高动态范围图像采集。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 遥感融合与全色锐化 1 篇

2603.04562 2026-03-06 cs.CV cs.LG 70%

Fusion and Grouping Strategies in Deep Learning for Local Climate Zone Classification of Multimodal Remote Sensing Data

深度学习中多模态遥感数据局部气候区分类的融合与分组策略

Ancymol Thomas, Jaya Sreevalsan-Nair

机构 * Graphics-Visualization-Computing Lab, International Institute of Information Technology Bangalore, Karnataka 560100, India(图形可视化计算实验室,国际信息学院班加罗尔,卡纳塔克邦560100,印度)

专题命中 遥感融合与全色锐化 :decision-level fusion(abstract);hybrid fusion(abstract);分类 cs.CV

AI总结 本研究提出了一种基于深度学习的多模态遥感数据局部气候区分类方法,通过融合与分组策略提升分类准确率,最终达到76.6%的整体准确率。

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人多传感器融合 2 篇

2512.04772 2026-03-06 cs.RO cs.SY eess.SY 79%

TEMPO-VINE: A Multi-Temporal Sensor Fusion Dataset for Localization and Mapping in Vineyards

TEMPO-VINE:一个多时序传感器融合数据集用于葡萄园的定位与建图

Mauro Martini, Marco Ambrosio, Judith Vilella-Cantos, Alessandro Navone, Marcello Chiaberge

机构 * Department of Electronics and Communications, Politecnico di Torino(电子与通信系,politecnico di torino大学) University Institute for Engineering Research, Miguel Hernández University(工程研究大学学院,miguel hernández大学)

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);分类 cs.RO

AI总结 TEMPO-VINE数据集通过多时序传感器融合数据,为葡萄园的定位与建图提供全面的基准测试资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04705 2026-03-06 cs.RO cs.HC 57%

LEGS-POMDP: Language and Gesture-Guided Object Search in Partially Observable Environments

LEGS-POMDP:语言和手势引导的在部分可观测环境中的对象搜索

Ivy Xiao He, Stefanie Tellex, Jason Xinyu Liu

机构 * Brown University(布朗大学)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO

AI总结 LEGS-POMDP通过整合语言、手势和视觉信息,在部分可观测环境中实现高效的开放世界对象搜索,显著提升了多模态感知和不确定性处理能力。

Comments 10 pages, 8 figures, accepted at ACM/IEEE International Conference on Human-Robot Interaction (HRI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 音视频/视觉语言融合 1 篇

2603.05465 2026-03-06 cs.CV 57%

HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token

在不生成单个标记的情况下检测视觉-语言模型中的幻觉

Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun, Jiawei Zhou

机构 * Stony Brook University(石英溪大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 通过探测模型内部表示在生成前检测视觉-语言模型的幻觉风险,展示不同架构中信息丰富的层和模态差异,并验证轻量级探测器在提升安全性和效率方面的潜力。

Journal ref The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 融合架构与评测 2 篇

2506.07080 2026-03-06 cs.CV 57%

FLAIR-HUB: Large-scale Multimodal Dataset for Land Cover and Crop Mapping

FLAIR-HUB:大规模多模态数据集用于土地覆盖和作物制图

Anatol Garioud, Sébastien Giordano, Nicolas David, Nicolas Gonthier

机构 * Institut national de l’information géographique et forestière (IGN), France(法国国家地理与森林信息研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 FLAIR-HUB是一个大规模多模态数据集,用于提升土地覆盖和作物制图的准确性,通过多模态融合和深度学习模型实现高精度分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04887 2026-03-06 cs.CV 57%

Federated Modality-specific Encoders and Partially Personalized Fusion Decoder for Multimodal Brain Tumor Segmentation

联邦模态特定编码器和部分个性化融合解码器用于多模态脑肿瘤分割

Hong Liu, Dong Wei, Qian Dai, Xian Wu, Yefeng Zheng, Liansheng Wang

机构 * National Institute for Data Science in Health and Medicine(国家医学数据科学研究院) Department of Computer Science at School of Informatics(信息学院计算机科学系) Jarvis Research Center(Jarvis研究中心) Medical Artificial Intelligence Lab(医学人工智能实验室)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出FedMEPD框架,通过联邦模态特定编码器和部分个性化融合解码器,解决多模态医学图像分析中的模态间异质性和个性化需求问题。

Comments Medical Image Analysis 2025. arXiv admin note: substantial text overlap with arXiv:2403.11803

详情

展开后加载摘要…

URL PDF HTML 收藏