arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 14 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 14 篇

2608.03252 2026-08-05 cs.CV 新提交 88%

Clarity Contrast and Similarity Selection for Multi-Focus Image Fusion

用于多聚焦图像融合的清晰度对比与相似性选择

Yicheng Zhang, Haoyou Deng, Zhiqiang Li, Wenti Yin, Nong Sang, Changxin Gao

专题命中 通用Image Fusion :image fusion(title,abstract);multi-focus(title,abstract);分类 cs.CV

AI总结 该研究针对多聚焦图像融合中源图像交互不足的问题,提出CSNet模型,通过CCAM和相似性选择策略实现信息交互,在定量和定性评估中达到当前最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12303 2026-06-11 cs.CV 新提交 88%

From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion

从二维网格到一维标记:重塑多模态图像融合的共享表示

Yuchen Xian, Yunqiu Xu, Yang He, Yi Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 通用Image Fusion :image fusion(title,abstract);multimodal image fusion(title,abstract);分类 cs.CV

AI总结 提出基于冻结预训练图像标记器的紧凑一维标记接口,通过选择性标记编辑(STE)稀疏更新关键标记,在保持融合骨干网络不变的同时引导全局外观一致性,实现全局连贯与局部保真的最佳平衡。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02572 2026-07-07 cs.CV cs.AI 新提交 83%

Additive Causal Construction for Transferable and Reconfigurable Cross-System Learning in Multi-Source Image Fusion

多源图像融合中用于可转移和可重构跨系统学习的加性因果构建

Zhizhong Fu, Wei Zhou, Zhaoyang Jiang, Yulong Lin, Yifu Hou, Xiaorong Ding, Qiang Yan, Yifan Chen

机构 * School of Life Science and Technology, University of Electronic Science and Technology of China(电子科技大学生命科学与技术学院) School of Health and Wellbeing, University of Glasgow(格拉斯哥大学健康与幸福学院) Department of Organ Transplantation, Sichuan Provincial People’s Hospital, University of Electronic Science and Technology of China(电子科技大学附属四川省人民医院器官移植科) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Department of Radiology, Huzhou Maternity & Child Health Care Hospital(湖州市妇幼保健院放射科) Hepatological Surgery Department, Huzhou Central Hospital, Fifth School of Clinical Medicine of Zhejiang Chinese Medical University(浙江中医药大学附属湖州中医院第五临床医学院湖州市中心医院肝外科)

专题命中 通用Image Fusion :image fusion(title,abstract);information fusion(abstract);分类 cs.CV

AI总结 针对多源图像融合中跨系统差异和纠缠问题,提出加性因果构建框架,通过干预一致性建立共享因果‘锚’实现因果图可转移,将融合过程形式化为因果构建并量化不确定性确保可重构,改进因果表示学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07985 2026-06-09 cs.CV cs.CL 新提交 83%

FMRFusion: Frequency-Aware Multi-View Representation Learning for Heterogeneous Image Fusion

FMRFusion: 面向异质图像融合的频率感知多视图表示学习

Tao Zhoua, Yunlong Liu, Qinghui Chen, Zekai Zhang, Minlong Sun, Changlin Biana, Dagang Li, Wenmin Wang, Jinglin Zhang

机构 * Shandong University(山东大学) Macau University of Science and Technology(澳门科技大学)

专题命中 通用Image Fusion :image fusion(title,abstract);infrared and visible(abstract);分类 cs.CV

AI总结 提出FMRFusion网络,通过多尺度结构感知模块、双线性频率分解和跨视图互补交互,结合流匹配优化,实现红外与可见光图像融合,在夜间场景表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03643 2026-07-07 eess.IV cs.CV 新提交 81%

Model Confidence-Guided Multi-Image Fusion of Fundus Images for Diabetic Retinopathy Diagnosis

模型置信度引导的多图像融合眼底图像糖尿病视网膜病变诊断方法

Ananya Raghu, Anisha Raghu, Alice S. Tang, Yannis M. Paulus, Tyson N. Kim, Tomiko T. Oskotsky

机构 * Massachusetts Institute of Technology(麻省理工学院) Wilmer Eye Institute, Department of Ophthalmology, Johns Hopkins University(约翰霍普金斯大学威尔默眼科研究所) Department of Biomedical Engineering, Johns Hopkins University(约翰霍普金斯大学生物医学工程系) Bakar Computational Health Sciences Institute, University of California San Francisco(加州大学旧金山分校巴卡计算健康科学研究所) Department of Ophthalmology, University of California San Francisco(加州大学旧金山分校眼科系) Division of Clinical Informatics and Digital Transformation, University of California San Francisco(加州大学旧金山分校临床信息学与数字化转型 division)

专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV、eess.IV

AI总结 针对资源有限地区糖网病早期筛查需求,提出置信度引导的多图像融合框架,整合多眼底视图提升诊断置信度与准确率,性能优于传统图像质量级联流水线,适配低延迟移动筛查场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00530 2026-08-04 cs.CV cs.AI 新提交 79%

Unleashing the Power of Text: Text-Guided Flow Matching for Image Fusion under Complex Degradations

释放文本的力量:面向复杂退化场景的文本引导流匹配图像融合

Axi Niu, Jieheng Li, Kang Zhang, Qingsen Yan, Jinqiu Sun, Yanning Zhang

专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV

AI总结 针对复杂退化下红外-可见光图像融合的挑战,提出文本引导的TGFusion框架,通过多流联合流Transformer实现动态文本引导,在多类退化场景下取得优异融合性能。

Comments 12 pages, 9 figures, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26812 2026-06-26 cs.CV 新提交 79%

Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction

恶劣天气下的多模态图像融合:掩码引导的特征恢复与交互

Xilai Li, Xiaosong Li, Haishu Tan, Tao Ye, Huafeng Li, Hongbin Wang

机构 * Foshan University(佛山大学) China University of Mining and Technology, Beijing(中国矿业大学(北京)) Kunming University of Science and Technology(昆明理工大学)

专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV

AI总结 提出一种掩码引导的多模态图像融合方法,通过伪真实标签和掩码生成机制同时实现特征恢复与跨模态交互,在合成和真实数据集上超越现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25338 2026-07-29 cs.AI 新提交 78%

Dual-Domain Manifold Modeling for Hyperspectral Image Fusion

用于高光谱图像融合的双域流形建模

Chengxin Xie, Qiya Song, Yangbangyan Jiang, Renwei Dian, Xudong Kang

机构 * College of Information Science and Engineering, Hunan Normal University(湖南师范大学信息科学与工程学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 通用Image Fusion :image fusion(title,abstract)

AI总结 针对高光谱图像融合中几何约束建模难题,提出双域流形建模框架,通过拓扑感知Transformer和频率解耦的空间 - 光谱协同融合模块,有效整合光谱与空间信息,在多数据集实验中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03107 2026-08-05 cs.CV 新提交 74%

A Unified Resolution-Conditioned Framework for Orthogonal Line-Scanning Image Fusion

一种用于正交线扫描图像融合的统一分辨率条件框架

Yiming Gong, Kai Wang

专题命中 通用Image Fusion :image fusion(title);分类 cs.CV

AI总结 针对正交线扫描图像融合,提出基于RELA和FiLM的统一分辨率条件框架,可跨狭缝宽度适配,性能优于现有方法,能平滑泛化到未见过的中间配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20689 2026-06-23 cs.CV cs.LG 新提交 70%

NeoJaundice-AI: Smartphone-Based Neonatal Jaundice Detection Using Dual-Input Deep Learning and Synthetic Augmentation

NeoJaundice-AI: 基于智能手机的新生儿黄疸检测,采用双输入深度学习与合成增强

Rahul Patel, Nirjala Jarpula

机构 * Indian Institute of Information Technology Surat(印度信息技术学院苏拉特分校)

专题命中 通用Image Fusion :image fusion(abstract);multimodal image fusion(abstract);分类 cs.CV

AI总结 提出NeoJaundice-AI系统,通过双分支EfficientNet-B0处理皮肤和巩膜图像,融合手工YCbCr颜色特征,实现四类严重度分类和胆红素回归,采用合成黄疸生成和肤色归一化,在印度新生儿数据集上达到91.8%准确率。

Comments 7 pages, 10 figures, 8 tables. IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09351 2026-07-13 cs.CV 新提交 57%

Simon-SR: Spatially Adaptive Modulation and Visual Prompt Adaptation for Text-Reinforced Super-Resolution

Simon-SR:用于文本增强超分辨率的空间自适应调制和视觉提示适配

Haotong Cheng, Yuxuan Li, Zijie Cui, Rongling Tan, Chenyuan Wang

机构 * College of Electronic Science and Engineering, Jilin University(吉林大学电子科学与工程学院)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 针对单图像超分辨率问题,提出Simon-SR框架,利用可学习提示进行语义挖掘和文本-图像融合,结合对比提示学习与空间自适应细化,实验证明该方法超越现有技术,在多项指标上有明显提升。

Comments Multi-modal Single Image Super-Resolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00595 2026-07-03 cs.CV 新提交 57%

GADA: Geometry-Aware Deformable Aggregation for Image-Based Gaussian Splatting

GADA: 基于图像的高斯泼溅的几何感知可变形聚合

Siwoo Lim, Sunjae Yoon, Gwanhyeong Koo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Chung-Ang University(中央大学)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 提出几何感知可变形聚合(GADA),通过可变形偏移迭代校正空间错位,并引入隐式置信加权机制抑制不可靠证据,在保持高频细节的同时实现2.13倍FPS提升。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07651 2026-06-09 cs.LG cs.CV 新提交 57%

KITE: A Tri-Modal Transformer Integrating Text, Images, and Knowledge Graphs for Fake News Detection

KITE:一种融合文本、图像和知识图谱的三模态假新闻检测Transformer

Kevin Patel, Shashi Bhushan Jha

机构 * Department of Computer Science, University of West Florida(威斯福大学计算机科学系)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 提出三模态假新闻检测框架KITE,联合建模文本、视觉和知识表示,利用跨模态注意力整合特征,在基准数据集上显著优于单双模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02394 2026-07-03 stat.AP stat.ME 新提交 50%

Masked complex non-decimated wavelet features for patient-level classification of contrast-enhanced mammography

掩蔽复值非抽取小波特征用于对比增强乳腺X线摄影的患者级分类

Sara Antonijevic, Brani Vidakovic

专题命中 通用Image Fusion :image fusion(abstract)

AI总结 针对对比增强乳腺X线摄影(CESM)图像分类中图像类型信号可比性和患者多图像融合问题,提出掩蔽复值非抽取小波特征结合弹性网逻辑回归,在无泄漏评估下两种图像类型在患者级AUC上无统计差异,且特征可解释。

Comments 29 pages, 9 figures. Code available at https://github.com/saraantonijevic/Masked_Mammograms

详情

展开后加载摘要…

URL PDF HTML 收藏