arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 87 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 5 篇

2603.21510 2026-06-08 eess.IV cs.CV 版本更新 76%

Unregistered Spectral Image Fusion: Unmixing, Adversarial Learning, and Recoverability

未配准光谱图像融合:解混、对抗学习与可恢复性

Jiahui Song, Sagar Shrestha, Xiao Fu

专题命中 通用Image Fusion :image fusion(title);分类 cs.CV、eess.IV

AI总结 提出无监督框架,通过耦合光谱解混和潜在空间对抗学习同时超分辨未配准的高光谱和多光谱图像,并首次建立可恢复性理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22525 2026-08-12 cs.CV 版本更新 57%

DreamOmni3: Scribble-based Editing and Generation

DreamOmni3:基于涂鸦的编辑与生成

Bin Xia, Bohao Peng, Jiyang Liu, Sitong Wu, Jingyao Li, Junjia Huang, Xu Zhao, Yitong Wang, Ruihang Chu, Bei Yu, Jiaya Jia

机构 * CUHK(香港中文大学) ByteDance Inc(字节跳动公司) HKUST(香港科技大学)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 DreamOmni3通过结合文本、图像和自由手绘涂鸦,实现更灵活的图形用户界面编辑与生成,解决了复杂编辑任务中的数据创建和框架设计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00086 2026-08-04 cs.CV cs.AI cs.CL cs.LG 版本更新 57%

Hierarchical Pre-Training of Vision Encoders with Large Language Model

基于大语言模型的视觉编码器分层预训练

Eugene Lee, Ting-Yu Chang, Jui-Huang Tsai, Jiajie Diao, Chen-Yi Lee

机构 * University of Cincinnati(辛辛那提大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 通用Image Fusion :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。

Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30437 2026-06-11 cs.CV 版本更新 57%

Mitigating Content Shift and Hallucination in GenAI Image Editing via Structural Refinement

通过结构细化减轻生成式AI图像编辑中的内容偏移和幻觉

Luxi Zhao, Michael S. Brown

机构 * Department of Electrical Engineering & Computer Science(电气工程与计算机科学系)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 提出一种后处理框架,通过建立粗空间和光度对应关系并融合输入图像与GenAI增强图像,在保留感知增强的同时抑制幻觉内容,从而解决黑盒GenAI图像编辑中的结构保持问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04836 2026-07-07 cs.IR 版本更新 50%

Beyond Text: Aligning Vision and Language for Multimodal E-Commerce Retrieval

超越文本:为多模态电子商务检索对齐视觉与语言

Qujiaheng Zhang, Guangyue Xu, Fengjie Li

专题命中 通用Image Fusion :image fusion(abstract)

AI总结 研究电子商务领域双塔检索模型的统一文本-图像融合,指出特定领域微调及查询与产品文本和图像模态的两阶段对齐很关键,提出新型模态融合网络并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 11 篇

2603.16130 2026-07-03 cs.CV 版本更新 88%

EPOFusion: Exposure aware Progressive Optimization Method for Infrared and Visible Image Fusion

EPOFusion:一种针对红外和可见图像融合的曝光感知渐进优化方法

Zhiwei Wang, Defeng He, Li Zhao, Xiaoqin Zhang, Yuxing Li, Edmund Y. Lam

机构 * College of Information Engineering, Zhejiang University of Technology(浙江工业大学信息工程学院) College of Information Science and Technology, Zhejiang Shuren University(浙江树人大学信息科技学院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电机电子工程系)

专题命中 红外-可见光融合 :image fusion(title,abstract);infrared and visible(title,abstract);分类 cs.CV

AI总结 本文提出EPOFusion方法,通过引入指导模块和迭代解码器提升曝光区域的融合效果,同时构建首个高质红外引导标注的曝光数据集,实验表明其在视觉保真度和下游任务表现上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01958 2026-06-26 cs.CV 版本更新 83%

MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction

MAVFusion: 基于运动感知稀疏交互的高效红外与可见光视频融合

Xilai Li, Weijun Jiang, Xiaosong Li, Yang Liu, Hongbin Wang, Tao Ye, Huafeng Li, Haishu Tan

机构 * Foshan University(佛山大学) Kunming University of Science and Technology(昆明理工大学) China University of Mining and Technology(中国矿业大学)

专题命中 红外-可见光融合 :infrared and visible(title,abstract);image fusion(abstract);分类 cs.CV

AI总结 提出MAVFusion端到端视频融合框架,通过运动感知稀疏交互机制,利用光流识别动态区域并分配跨模态注意力,对静态区域使用轻量弱交互模块,在保持时间一致性和细节的同时加速推理,达到14.16 FPS。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01301 2026-08-10 cs.CV cs.AI 版本更新 79%

Ranking Image Fusion the Way Humans Do: A Learned Pairwise Preference Measure for Infrared-Visible Fusion Assessment

以人类方式进行图像融合排序:用于红外-可见光融合评估的学习型成对偏好度量

Haoran Liu, Mingzhe Liu, Peng Li, Guibin Zan

专题命中 红外-可见光融合 :image fusion(title,abstract);分类 cs.CV

AI总结 针对红外-可见光图像融合缺乏理想参考、成对比较成本高的问题,提出LPIFM模型,利用新偏好语料库训练,可准确复现人类成对判断,性能优于传统度量,还公开了相关数据集与代码。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10309 2026-08-05 cs.CV 版本更新 79%

CLIP4VI-ReID: Learning Modality-shared Representations via CLIP Semantic Bridge for Visible-Infrared Person Re-identification

CLIP4VI-ReID:通过CLIP语义桥学习模态共享表征用于可见光-红外行人重识别

Xiaomei Yang, Xizhan Gao, Sijie Niu, Fa Zhu, Guang Feng, Xiaofeng Qu, David Camacho

机构 * Shandong Key Laboratory of Ubiquitous Intelligent Computing, School of Information Science and Engineering, University of Jinan(山东 ubiquitous 智能计算重点实验室,信息科学与工程学院,济南大学) College of Information Science and Technology & College of Artificial Intelligence, Nanjing Forestry University(信息科学与技术学院及人工智能学院,南京林业大学) Computer Systems Engineering Department, Universidad Politécnica de Madrid(计算机系统工程系,马德里理工大学)

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 本文提出CLIP4VI-ReID网络,通过TSG、IFE、HSA模块及CLIP语义桥实现跨模态对齐,在VI-ReID任务上取得优于现有方法的性能。

Comments This article has been accepted for publication in IEEE Transactions on Biometrics, Behavior, and Identity Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12062 2026-06-26 cs.CV 版本更新 79%

Learning Language-Driven Sequence-Level Modal-Invariant Representations for Video-Based Visible-Infrared Person Re-Identification

基于语言驱动的序列级模态不变表示学习用于视频可见光-红外行人重识别

Xiaomei Yang, Antai Liu, Xizhan Gao, Fa Zhu, Sijie Niu, Giancarlo Fortino

机构 * Shandong Key Laboratory of Ubiquitous Intelligent Computing, School of Information Science and Engineering, University of Jinan(山东省 Ubiquitous Intelligent Computing 重点实验室,济南大学信息科学与工程学院) College of Information Science and Technology & Artificial Intelligence, Nanjing Forestry University(信息科学与技术及人工智能学院,南京林业大学) Department of Informatics, Modeling, Electronics, and Systems, University of Calabria(信息学、建模、电子与系统系,卡利博大学)

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 提出LSMRL方法,通过CLIP的时空特征学习、语义扩散和跨模态交互模块,结合模态级损失,学习序列级模态不变表示,在VVI-ReID任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01173 2026-08-04 cs.CV 版本更新 74%

Bridging Multimodal Fusion and Expert Routing via Spectral Reliability Descriptors for Robust Object Detection

复用融合时频谱可靠性用于RGB-红外目标检测的自适应融合与专家路由

Yefeng Wu

机构 * Tsinghua University(清华大学)

专题命中 红外-可见光融合 :multimodal fusion(title);分类 cs.CV

AI总结 提出一种无参数的7维频谱可靠性描述符,通过频谱可靠性融合和可靠性条件专家路由,提升RGB-红外目标检测在退化条件下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02258 2026-07-30 cs.CV 版本更新 57%

SpectraDINO: Modality-Conditioned Adaptation of RGB Vision Foundation Models Across Infrared Bands

SpectraDINO:跨红外波段的RGB视觉基础模型的模态条件适配

Yagiz Nalcakan, Hyeongjin Ju, Incheol Park, Sanghyeop Yeo, Youngwan Jin, Shiho Kim

专题命中 红外-可见光融合 :visible-infrared(abstract);分类 cs.CV

AI总结 SpectraDINO是适配RGB视觉基础模型的跨红外波段统一骨干网络,通过分阶段蒸馏与微调技术,在7个检测和分割基准上性能优于或媲美特定模态方法。

Comments Updated with the revised model results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19942 2026-07-28 cs.CV cs.AI 版本更新 57%

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

G-MAD:用于多视图RGB-T航空目标检测的基于游戏的数据生成框架

Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

机构 * LIG Defense&Aerospace(LIG国防与航空航天公司) GIST(韩国科学技术院)

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 研究针对航空目标检测中数据集构建的问题,提出基于游戏的G-MAD数据生成框架,可解决视点控制、数据对齐及标注成本等问题,支持多视图相机放置等功能,还构建并发布了AMOD基准。

Comments ACM Multimedia 2026 (Supplementary Material Included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02808 2026-07-21 cs.CV 版本更新 57%

CMCC-ReID: Cross-Modality Clothing-Change Person Re-Identification

CMCC-ReID: 跨模态服装变化人员重识别

Haoxuan Xu, Hanzi Wang, Guanglin Niu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 红外-可见光融合 :visible-infrared(abstract);分类 cs.CV

AI总结 本文提出CMCC-ReID任务,解决跨模态和服装变化的人员匹配问题,构建SYSU-CMCC基准数据集,并提出PIA网络,通过DBDL和BPL模块提升重识别性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14776 2026-07-15 cs.CV 版本更新 57%

M2I2HA: Multi-modal Object Detection Based on Intra- and Inter-Modal Hypergraph Attention

M2I2HA:基于模态内和模态间超图注意力的多模态目标检测

Xiaofan Yang, Yubin Liu, Wei Pan, Guoqing Chu, Junming Zhang, Jie Zhao, Zhuoqi Man, Xuanming Cao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对多模态目标检测中模态内和模态间信息提取及跨模态对齐的挑战,提出基于超图理论的M2I2HA网络,通过多个模块实现多模态特征的有效处理,在多模态目标检测任务中取得了最优性能。

Comments 43 pages, 13 figures, The theoretical derivation was refined, some data was updated, and experiments were added

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24755 2026-06-25 eess.SY cs.SY 版本更新 50%

Asymmetry-Aware Routing for Industrial Multimodal Monitoring: A Diagnostic Framework

面向工业多模态监测的非对称感知路由:一个诊断框架

Sungwoo Kang

专题命中 红外-可见光融合 :multimodal fusion(abstract)

AI总结 提出非对称感知路由框架,通过三步诊断(单模态性能差距、门权重归因、模态损坏测试)决定多模态融合策略,在三个数据集上验证了其有效性。

Comments A subsequent extension of this analysis to a larger corpus found that the heterogeneity predictor is collinear with the industrial-versus-general domain split, so the corresponding effect is not identifiable on the available data

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多聚焦/多曝光融合 5 篇

2408.06083 2026-07-31 cs.CV 版本更新 57%

Towards Robust Monocular Depth Estimation in Non-Lambertian Surfaces

面向非朗伯表面的鲁棒单目深度估计

Junrui Zhang, Jiaqi Li, Yachuan Huang, Yiran Wang, Jinghong Zheng, Liao Shen, Zhiguo Cao

专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV

AI总结 该研究针对单目深度估计在非朗伯表面预测鲁棒性不足的问题,提出梯度域约束的区域引导方法及可选光照融合模块,在相关数据集和竞赛测试中取得优于Depth Anything V2的性能。

Comments Accepted to ECCV 2024 Workshop TRICKY

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29845 2026-07-10 cs.CV 版本更新 57%

Bricker to BRACE: A Bracket Exposure RAW Dataset and Restoration Model for Flicker-Banding

Bricker到BRACE:用于闪烁条纹的括号曝光RAW数据集和恢复模型

Zihan Zhou, Libo Zhu, Jue Gong, Zhiyi Zhou, Jiezhang Cao, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Consumer Business Group(华为消费者业务集团)

专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV

AI总结 针对屏幕拍摄图像中的闪烁条纹问题,提出基于多帧括号RAW的恢复模型BRACE,利用频率感知条纹先验和多尺度空间交叉注意力调制器,在合成和真实基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16357 2026-07-07 cs.CV 版本更新 57%

GMODiff: One-Step Gain Map Refinement with Diffusion Priors for HDR Reconstruction

GMODiff:基于扩散先验的单步增益图优化用于高动态范围重建

Tao Hu, Weiyu Zhou, Yanjie Tu, Peng Wu, Wei Dong, Qingsen Yan, Yanning Zhang

专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV

AI总结 本文提出GMODiff,通过单步扩散框架优化增益图,提升多曝光HDR重建的动态范围和效率,实验表明其性能优于现有方法且速度提升100倍。

Comments This paper is accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04390 2026-07-01 cs.CV cs.AI 版本更新 57%

FMA-Net++: Motion- and Exposure-Aware Joint Video Super-Resolution and Deblurring

FMA-Net++:运动与曝光感知的联合视频超分辨率与去模糊

Geunhyuk Youk, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) CMLab, Chung-Ang University(中央大学CMLab)

专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV

AI总结 提出非循环序列级框架FMA-Net++,通过层次细化双向聚合块实现并行处理与长时域建模,引入曝光时间感知调制层处理曝光依赖模糊,在合成数据上训练达到SOTA性能。

Comments Accepted to ECCV 2026. Project Page: https://kaist-viclab.github.io/fmanetpp_site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02419 2026-06-11 physics.chem-ph cond-mat.mtrl-sci physics.comp-ph 版本更新 50%

DPA4: Pushing the Accuracy-Cost Frontier of Interatomic Potentials with EMFA SO(2) Convolution

DPA4: 利用EMFA SO(2)卷积推动原子间势的精度-成本前沿

Tiancheng Li, Wentao Li, Anyang Peng, Jianming Xue, Linfeng Zhang, Duo Zhang, Han Wang

专题命中 多聚焦/多曝光融合 :multi-focus(abstract)

AI总结 本文提出DPA4架构,通过EMFA SO(2)等变卷积和编译器友好的训练路径,在降低参数和训练成本的同时,在Matbench Discovery等基准上达到最优精度-成本平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 遥感融合与全色锐化 5 篇

2603.03831 2026-07-29 cs.CV 版本更新 83%

Universal Pansharpening Model

通用全分辨率融合基础模型

Hebaixu Wang, Jing Zhang, Haonan Guo, Di Wang, Jiayi Ma, Bo Du, Liangpei Zhang

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) School of Computer Science, Wuhan University(武汉大学计算机学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Zhongguancun Academy(中关村学院)

专题命中 遥感融合与全色锐化 :pansharpening(title,abstract);information fusion(abstract);分类 cs.CV

AI总结 FoundPS是一种通用全分辨率融合基础模型,通过模态交错Transformer和潜在扩散桥梁模型实现跨传感器和场景的稳健融合,提升全分辨率融合的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14412 2026-07-09 cs.CV 版本更新 79%

G-ZAP: A Generalizable Zero-Shot Framework for Arbitrary-Scale Pansharpening

G-ZAP:一种通用的零样本框架用于任意尺度的全色融合

Zhiqi Yang, Shan Yin, Jingze Liang, Liang-Jian Deng

专题命中 遥感融合与全色锐化 :pansharpening(title,abstract);分类 cs.CV

AI总结 本文提出G-ZAP框架,通过多尺度半监督训练方案实现跨分辨率、跨场景和跨传感器的泛化能力,在多个真实世界数据集上取得SOTA结果,支持权重重用以提高实际部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12268 2026-07-31 eess.IV cs.CV 版本更新 76%

Uncertainty-Aware Multimodal Fusion for Oral Lesion Classification

面向口腔病变分类的患者感知多模态RGB-HSI融合:通过增量启发式元学习

Soujanya Hazra, Rupam Mukherjee, Rajkumar Daniel, Shirin Dasgupta, Subhamoy Mandal

机构 * 1 School of Medical Science \& Technology, IIT Kharagpur, India 2 Department of Electrical Engineering, IIT Kharagpur, India 3 Dr. B.C. Roy Multispeciality Medical Research Centre, IIT Kharagpur, India

专题命中 遥感融合与全色锐化 :multimodal fusion(title);分类 cs.CV、eess.IV

AI总结 本文提出了一种面向口腔病变分类的患者感知多模态RGB-HSI融合方法,结合深度学习、光谱分析和人口统计数据,通过增量启发式元学习提升诊断鲁棒性。

Comments Accepted at MICCAI MultiTab Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09347 2026-06-11 cs.CV 版本更新 57%

IB-HFN: Information Bottleneck-Driven SAR-Optical Fusion Network for High-Fidelity Cloud Removal

IB-HFN: 信息瓶颈驱动的SAR-光学融合网络用于高保真云去除

Haojun Guo, Fan Feng, Ziquan Wang, Yongsheng Zhang, Ying Yu

机构 * Institute of Geospatial Information, Information Engineering University(测绘信息研究院,信息工程大学)

专题命中 遥感融合与全色锐化 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出IB-HFN网络,通过双流骨干、空间信息瓶颈融合模块和联合优化策略,抑制SAR散斑噪声并保留光学细节,实现高保真云去除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08924 2026-06-23 eess.SY cs.SY 版本更新 50%

Automating the Wildfire Detection and Scheduling Pipeline with Maneuverable Earth Observation Satellites

利用可操纵地球观测卫星自动化野火检测与调度流程

Brycen D. Pearl, Joshua G. Warner, Hang Woon Lee

专题命中 遥感融合与全色锐化 :sensor fusion(abstract)

AI总结 提出WildFIRE-DS框架,集成CNN传感器融合检测、贝叶斯统计更新和多星调度优化,实现野火自动检测与卫星调度,仿真实验验证其有效性。

Comments 46 pages, Journal of Aerospace Information Systems (Published)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 医学影像融合 3 篇

2512.10966 2026-06-15 cs.LG cs.AI cs.CV eess.IV 版本更新 76%

Interpretable Alzheimer's Diagnosis via Multimodal Fusion of Regional Brain Experts

可解释的阿尔茨海默病诊断:基于区域脑专家的多模态融合

Farica Zhuang, Shu Yang, Dinara Aliyeva, Zixuan Wen, Duy Duong-Tran, Christos Davatzikos, Tianlong Chen, Song Wang, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 医学影像融合 :multimodal fusion(title);分类 cs.CV、eess.IV

AI总结 提出MREF-AD多模态区域专家融合模型,采用混合专家框架将各模态脑区域视为独立专家,通过门控网络学习个性化融合权重,实现可解释的AD诊断。

Comments Published at IEEE ICHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22874 2026-08-06 cs.CV 版本更新 57%

Deformable Medical Image Registration with KAN-based Implicit Neural Representations

基于KAN的隐式神经表示的可变形医学图像配准

Nikita Drozdov, Marat Zinovev, Dmitry Sorokin

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)

专题命中 医学影像融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 提出基于KAN的INR框架KAN-IDIR与RandKAN-IDIR,用于无需数据集级训练的逐对优化可变形医学图像配准,在多模态医学图像上实现高准确性、低开销与稳定性,适用于临床研究。

Comments Accepted at Machine Learning and Knowledge Extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10702 2026-06-25 cs.CV cs.AI 版本更新 57%

Backbone-Conditional Behavior of Modality Gating in Multi-Modal Prostate MRI Segmentation: A 5-Fold Cross-Validation and Gate Mechanism Analysis

模态隔离门控融合:用于稳健多模态前列腺MRI分割的架构无关方法

Yongbo Shu, Wenzhao Xie, Shanhu Yao, Zirui Xin, Luo Lei, Kewen Chen, Aijing Luo

机构 * The Second Xiangya Hospital of Central South University(中南大学湘雅医学院第二医院) The Third Xiangya Hospital of Central South University(中南大学湘雅医学院第三医院) School of Life Sciences, Central South University(中南大学生命科学学院) Hunan Provincial Key Laboratory of Medical Information Research (Central South University)(湖南省医学信息研究重点实验室(中南大学)) Hunan Provincial Clinical Medical Research Center for Cardiovascular Intelligent Medicine(湖南省心血管智能医学临床医学研究中心)

专题命中 医学影像融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出模态隔离门控融合(MIGF)方法,通过独立编码流和门控阶段提升多模态前列腺MRI分割的鲁棒性,实验表明其在不同模态缺失和伪影情况下均有效。

Comments Major revision. Single-fold analysis replaced by 5-fold cross-validation (180 trained models) plus a direct gate-mechanism analysis; conclusions updated to show that modality gating is backbone-conditional. Supersedes v1

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 自动驾驶多传感器融合 1 篇

2512.21831 2026-07-29 cs.CV 版本更新 79%

End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration

端到端3D时空感知与多模态融合及V2X协作

Zhenwei Yang, Yibo Ai, Weidong Zhang

机构 * National Center for Materials Service Safety(材料服务安全国家中心) University of Science and Technology Beijing(北京科技大学)

专题命中 自动驾驶多传感器融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 XET-V2X通过多模态融合与V2X协作,实现端到端3D时空感知,提升复杂交通场景下的检测与跟踪性能。

Comments 21 pages, 10 figures

Journal ref IEEE Internet of Things Journal, vol. 13, no. 15, pp. 33456-33475, 1 Aug.1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏