Unregistered Spectral Image Fusion: Unmixing, Adversarial Learning, and Recoverability
未配准光谱图像融合:解混、对抗学习与可恢复性
专题命中 通用Image Fusion :image fusion(title);分类 cs.CV、eess.IV
AI总结 提出无监督框架,通过耦合光谱解混和潜在空间对抗学习同时超分辨未配准的高光谱和多光谱图像,并首次建立可恢复性理论保证。
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
未配准光谱图像融合:解混、对抗学习与可恢复性
专题命中 通用Image Fusion :image fusion(title);分类 cs.CV、eess.IV
AI总结 提出无监督框架,通过耦合光谱解混和潜在空间对抗学习同时超分辨未配准的高光谱和多光谱图像,并首次建立可恢复性理论保证。
DreamOmni3:基于涂鸦的编辑与生成
机构 * CUHK(香港中文大学) ; ByteDance Inc(字节跳动公司) ; HKUST(香港科技大学)
专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV
AI总结 DreamOmni3通过结合文本、图像和自由手绘涂鸦,实现更灵活的图形用户界面编辑与生成,解决了复杂编辑任务中的数据创建和框架设计问题。
基于大语言模型的视觉编码器分层预训练
机构 * University of Cincinnati(辛辛那提大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 通用Image Fusion :multimodal fusion(abstract);分类 cs.CV
AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。
Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026
通过结构细化减轻生成式AI图像编辑中的内容偏移和幻觉
机构 * Department of Electrical Engineering & Computer Science(电气工程与计算机科学系)
专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV
AI总结 提出一种后处理框架,通过建立粗空间和光度对应关系并融合输入图像与GenAI增强图像,在保留感知增强的同时抑制幻觉内容,从而解决黑盒GenAI图像编辑中的结构保持问题。
超越文本:为多模态电子商务检索对齐视觉与语言
专题命中 通用Image Fusion :image fusion(abstract)
AI总结 研究电子商务领域双塔检索模型的统一文本-图像融合,指出特定领域微调及查询与产品文本和图像模态的两阶段对齐很关键,提出新型模态融合网络并验证其有效性。
EPOFusion:一种针对红外和可见图像融合的曝光感知渐进优化方法
机构 * College of Information Engineering, Zhejiang University of Technology(浙江工业大学信息工程学院) ; College of Information Science and Technology, Zhejiang Shuren University(浙江树人大学信息科技学院) ; Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电机电子工程系)
专题命中 红外-可见光融合 :image fusion(title,abstract);infrared and visible(title,abstract);分类 cs.CV
AI总结 本文提出EPOFusion方法,通过引入指导模块和迭代解码器提升曝光区域的融合效果,同时构建首个高质红外引导标注的曝光数据集,实验表明其在视觉保真度和下游任务表现上优于现有方法。
MAVFusion: 基于运动感知稀疏交互的高效红外与可见光视频融合
机构 * Foshan University(佛山大学) ; Kunming University of Science and Technology(昆明理工大学) ; China University of Mining and Technology(中国矿业大学)
专题命中 红外-可见光融合 :infrared and visible(title,abstract);image fusion(abstract);分类 cs.CV
AI总结 提出MAVFusion端到端视频融合框架,通过运动感知稀疏交互机制,利用光流识别动态区域并分配跨模态注意力,对静态区域使用轻量弱交互模块,在保持时间一致性和细节的同时加速推理,达到14.16 FPS。
Comments Accepted at ECCV 2026
以人类方式进行图像融合排序:用于红外-可见光融合评估的学习型成对偏好度量
专题命中 红外-可见光融合 :image fusion(title,abstract);分类 cs.CV
AI总结 针对红外-可见光图像融合缺乏理想参考、成对比较成本高的问题,提出LPIFM模型,利用新偏好语料库训练,可准确复现人类成对判断,性能优于传统度量,还公开了相关数据集与代码。
Comments 23 pages, 8 figures
CLIP4VI-ReID:通过CLIP语义桥学习模态共享表征用于可见光-红外行人重识别
机构 * Shandong Key Laboratory of Ubiquitous Intelligent Computing, School of Information Science and Engineering, University of Jinan(山东 ubiquitous 智能计算重点实验室,信息科学与工程学院,济南大学) ; College of Information Science and Technology & College of Artificial Intelligence, Nanjing Forestry University(信息科学与技术学院及人工智能学院,南京林业大学) ; Computer Systems Engineering Department, Universidad Politécnica de Madrid(计算机系统工程系,马德里理工大学)
专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV
AI总结 本文提出CLIP4VI-ReID网络,通过TSG、IFE、HSA模块及CLIP语义桥实现跨模态对齐,在VI-ReID任务上取得优于现有方法的性能。
Comments This article has been accepted for publication in IEEE Transactions on Biometrics, Behavior, and Identity Science
基于语言驱动的序列级模态不变表示学习用于视频可见光-红外行人重识别
机构 * Shandong Key Laboratory of Ubiquitous Intelligent Computing, School of Information Science and Engineering, University of Jinan(山东省 Ubiquitous Intelligent Computing 重点实验室,济南大学信息科学与工程学院) ; College of Information Science and Technology & Artificial Intelligence, Nanjing Forestry University(信息科学与技术及人工智能学院,南京林业大学) ; Department of Informatics, Modeling, Electronics, and Systems, University of Calabria(信息学、建模、电子与系统系,卡利博大学)
专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV
AI总结 提出LSMRL方法,通过CLIP的时空特征学习、语义扩散和跨模态交互模块,结合模态级损失,学习序列级模态不变表示,在VVI-ReID任务上超越现有方法。
复用融合时频谱可靠性用于RGB-红外目标检测的自适应融合与专家路由
机构 * Tsinghua University(清华大学)
专题命中 红外-可见光融合 :multimodal fusion(title);分类 cs.CV
AI总结 提出一种无参数的7维频谱可靠性描述符,通过频谱可靠性融合和可靠性条件专家路由,提升RGB-红外目标检测在退化条件下的性能。
SpectraDINO:跨红外波段的RGB视觉基础模型的模态条件适配
专题命中 红外-可见光融合 :visible-infrared(abstract);分类 cs.CV
AI总结 SpectraDINO是适配RGB视觉基础模型的跨红外波段统一骨干网络,通过分阶段蒸馏与微调技术,在7个检测和分割基准上性能优于或媲美特定模态方法。
Comments Updated with the revised model results
G-MAD:用于多视图RGB-T航空目标检测的基于游戏的数据生成框架
机构 * LIG Defense&Aerospace(LIG国防与航空航天公司) ; GIST(韩国科学技术院)
专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 研究针对航空目标检测中数据集构建的问题,提出基于游戏的G-MAD数据生成框架,可解决视点控制、数据对齐及标注成本等问题,支持多视图相机放置等功能,还构建并发布了AMOD基准。
Comments ACM Multimedia 2026 (Supplementary Material Included)
CMCC-ReID: 跨模态服装变化人员重识别
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; School of Informatics, Xiamen University(厦门大学信息学院)
专题命中 红外-可见光融合 :visible-infrared(abstract);分类 cs.CV
AI总结 本文提出CMCC-ReID任务,解决跨模态和服装变化的人员匹配问题,构建SYSU-CMCC基准数据集,并提出PIA网络,通过DBDL和BPL模块提升重识别性能。
Comments ECCV2026
M2I2HA:基于模态内和模态间超图注意力的多模态目标检测
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 针对多模态目标检测中模态内和模态间信息提取及跨模态对齐的挑战,提出基于超图理论的M2I2HA网络,通过多个模块实现多模态特征的有效处理,在多模态目标检测任务中取得了最优性能。
Comments 43 pages, 13 figures, The theoretical derivation was refined, some data was updated, and experiments were added
面向工业多模态监测的非对称感知路由:一个诊断框架
专题命中 红外-可见光融合 :multimodal fusion(abstract)
AI总结 提出非对称感知路由框架,通过三步诊断(单模态性能差距、门权重归因、模态损坏测试)决定多模态融合策略,在三个数据集上验证了其有效性。
Comments A subsequent extension of this analysis to a larger corpus found that the heterogeneity predictor is collinear with the industrial-versus-general domain split, so the corresponding effect is not identifiable on the available data
面向非朗伯表面的鲁棒单目深度估计
专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV
AI总结 该研究针对单目深度估计在非朗伯表面预测鲁棒性不足的问题,提出梯度域约束的区域引导方法及可选光照融合模块,在相关数据集和竞赛测试中取得优于Depth Anything V2的性能。
Comments Accepted to ECCV 2024 Workshop TRICKY
Bricker到BRACE:用于闪烁条纹的括号曝光RAW数据集和恢复模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huawei Consumer Business Group(华为消费者业务集团)
专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV
AI总结 针对屏幕拍摄图像中的闪烁条纹问题,提出基于多帧括号RAW的恢复模型BRACE,利用频率感知条纹先验和多尺度空间交叉注意力调制器,在合成和真实基准上达到最优性能。
GMODiff:基于扩散先验的单步增益图优化用于高动态范围重建
专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV
AI总结 本文提出GMODiff,通过单步扩散框架优化增益图,提升多曝光HDR重建的动态范围和效率,实验表明其性能优于现有方法且速度提升100倍。
Comments This paper is accepted by ECCV2026
FMA-Net++:运动与曝光感知的联合视频超分辨率与去模糊
机构 * KAIST(韩国科学技术院) ; CMLab, Chung-Ang University(中央大学CMLab)
专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV
AI总结 提出非循环序列级框架FMA-Net++,通过层次细化双向聚合块实现并行处理与长时域建模,引入曝光时间感知调制层处理曝光依赖模糊,在合成数据上训练达到SOTA性能。
Comments Accepted to ECCV 2026. Project Page: https://kaist-viclab.github.io/fmanetpp_site/
DPA4: 利用EMFA SO(2)卷积推动原子间势的精度-成本前沿
专题命中 多聚焦/多曝光融合 :multi-focus(abstract)
AI总结 本文提出DPA4架构,通过EMFA SO(2)等变卷积和编译器友好的训练路径,在降低参数和训练成本的同时,在Matbench Discovery等基准上达到最优精度-成本平衡。
通用全分辨率融合基础模型
机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) ; Zhongguancun Academy(中关村学院)
专题命中 遥感融合与全色锐化 :pansharpening(title,abstract);information fusion(abstract);分类 cs.CV
AI总结 FoundPS是一种通用全分辨率融合基础模型,通过模态交错Transformer和潜在扩散桥梁模型实现跨传感器和场景的稳健融合,提升全分辨率融合的泛化能力和鲁棒性。
G-ZAP:一种通用的零样本框架用于任意尺度的全色融合
专题命中 遥感融合与全色锐化 :pansharpening(title,abstract);分类 cs.CV
AI总结 本文提出G-ZAP框架,通过多尺度半监督训练方案实现跨分辨率、跨场景和跨传感器的泛化能力,在多个真实世界数据集上取得SOTA结果,支持权重重用以提高实际部署效率。
面向口腔病变分类的患者感知多模态RGB-HSI融合:通过增量启发式元学习
机构 * 1 School of Medical Science \& Technology, IIT Kharagpur, India 2 Department of Electrical Engineering, IIT Kharagpur, India 3 Dr. B.C. Roy Multispeciality Medical Research Centre, IIT Kharagpur, India
专题命中 遥感融合与全色锐化 :multimodal fusion(title);分类 cs.CV、eess.IV
AI总结 本文提出了一种面向口腔病变分类的患者感知多模态RGB-HSI融合方法,结合深度学习、光谱分析和人口统计数据,通过增量启发式元学习提升诊断鲁棒性。
Comments Accepted at MICCAI MultiTab Workshop 2026
IB-HFN: 信息瓶颈驱动的SAR-光学融合网络用于高保真云去除
机构 * Institute of Geospatial Information, Information Engineering University(测绘信息研究院,信息工程大学)
专题命中 遥感融合与全色锐化 :multimodal fusion(abstract);分类 cs.CV
AI总结 提出IB-HFN网络,通过双流骨干、空间信息瓶颈融合模块和联合优化策略,抑制SAR散斑噪声并保留光学细节,实现高保真云去除。
利用可操纵地球观测卫星自动化野火检测与调度流程
专题命中 遥感融合与全色锐化 :sensor fusion(abstract)
AI总结 提出WildFIRE-DS框架,集成CNN传感器融合检测、贝叶斯统计更新和多星调度优化,实现野火自动检测与卫星调度,仿真实验验证其有效性。
Comments 46 pages, Journal of Aerospace Information Systems (Published)
可解释的阿尔茨海默病诊断:基于区域脑专家的多模态融合
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 医学影像融合 :multimodal fusion(title);分类 cs.CV、eess.IV
AI总结 提出MREF-AD多模态区域专家融合模型,采用混合专家框架将各模态脑区域视为独立专家,通过门控网络学习个性化融合权重,实现可解释的AD诊断。
Comments Published at IEEE ICHI 2026
基于KAN的隐式神经表示的可变形医学图像配准
机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)
专题命中 医学影像融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 提出基于KAN的INR框架KAN-IDIR与RandKAN-IDIR,用于无需数据集级训练的逐对优化可变形医学图像配准,在多模态医学图像上实现高准确性、低开销与稳定性,适用于临床研究。
Comments Accepted at Machine Learning and Knowledge Extraction
模态隔离门控融合:用于稳健多模态前列腺MRI分割的架构无关方法
机构 * The Second Xiangya Hospital of Central South University(中南大学湘雅医学院第二医院) ; The Third Xiangya Hospital of Central South University(中南大学湘雅医学院第三医院) ; School of Life Sciences, Central South University(中南大学生命科学学院) ; Hunan Provincial Key Laboratory of Medical Information Research (Central South University)(湖南省医学信息研究重点实验室(中南大学)) ; Hunan Provincial Clinical Medical Research Center for Cardiovascular Intelligent Medicine(湖南省心血管智能医学临床医学研究中心)
专题命中 医学影像融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 本文提出模态隔离门控融合(MIGF)方法,通过独立编码流和门控阶段提升多模态前列腺MRI分割的鲁棒性,实验表明其在不同模态缺失和伪影情况下均有效。
Comments Major revision. Single-fold analysis replaced by 5-fold cross-validation (180 trained models) plus a direct gate-mechanism analysis; conclusions updated to show that modality gating is backbone-conditional. Supersedes v1
端到端3D时空感知与多模态融合及V2X协作
机构 * National Center for Materials Service Safety(材料服务安全国家中心) ; University of Science and Technology Beijing(北京科技大学)
专题命中 自动驾驶多传感器融合 :multimodal fusion(title,abstract);分类 cs.CV
AI总结 XET-V2X通过多模态融合与V2X协作,实现端到端3D时空感知,提升复杂交通场景下的检测与跟踪性能。
Comments 21 pages, 10 figures
Journal ref IEEE Internet of Things Journal, vol. 13, no. 15, pp. 33456-33475, 1 Aug.1, 2026