arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 70 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 70 篇

2608.02092 2026-08-04 cs.CV cs.MM 新提交 84%

Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion

基于空间掩码与通道融合的深度多模态融合检测

Guandi Wang, Ming Li, Yunsen Xing, Junle Liu

机构 * KTH Royal Institute of Technology(KTH皇家理工学院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);feature-level fusion(abstract);分类 cs.CV、cs.MM

AI总结 本文针对现有多模态融合检测的过拟合问题,提出Attention-Driven Complementarity Resampling框架,通过语义掩码交换与可学习通道竞争实现跨模态目标检测的性能提升,在多数据集上取得了有竞争力的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23243 2026-07-28 cs.AI 新提交 82%

Characterisation of Density-based FM generation methods in the context of Information Fusion

信息融合背景下基于密度的模糊测度生成方法的表征

Yanhao Huang, Christian Wagner

专题命中 融合架构与评测 :information fusion(title,abstract);decision-level fusion(abstract)

AI总结 研究信息融合中基于密度的FM生成方法,指出常用方法不足以唯一确定离散FM,展示如何确定区间值FM及相关置信区间,通过实验表明基于此FM的Choquet FI输出可视为‘理想’融合结果置信区间,为表征FI融合结果提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13092 2026-08-14 cs.CV 新提交 79%

Paths: Prompt-aware Spatio-temporal Transformer with Hierarchical Multi-modal Fusion for RGB-Event Video Person Re-Identification

Paths:面向RGB-Event视频行人重识别的感知提示的时空Transformer与分层多模态融合

Yakun Huo, Yingquan Wang, Yangyang Liu, Tianyu Yan, Yunzhi Zhuge, Pingping Zhang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学)

专题命中 融合架构与评测 :multi-modal fusion(title,abstract);分类 cs.CV

AI总结 针对现有RE-VReID方法时空建模解耦、多模态融合不足的问题,提出含MAB、PST、HMF模块的Paths框架,在三个基准上验证了有效性。

Comments Accepted by ACM MM2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11839 2026-07-14 cs.CV cs.AI 新提交 79%

LoRA-Based Cascaded Multimodal Fusion for Action Recognition in Medical Training Environments

基于LoRA的级联多模态融合在医学训练环境中的动作识别

Divya Mereddy, Jeevan Beedareddy

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 研究面向医疗训练环境的动作识别,提出基于LoRA的级联多模态融合框架,结合特定模态适应与顺序融合,无需重新训练组件,在两个数据集上评估,结果显示该策略优于单模态模型且性能有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05311 2026-07-07 cs.CV 新提交 79%

Deep Learning for Semen Analysis in Male Infertility: Computer Vision, Multimodal Fusion, and Clinical Translation

男性不育症精液分析深度学习技术:计算机视觉、多模态融合与临床转化

Runwei Guan, Shaofeng Liang, Jiacheng Weng, Xiaoyi Gu, Jia Weng, Daizong Liu, Duo Pan, Qingxin Zhang, Xiao Liang, Weiping Ding, Suoyu Zhu, Ming Yuan, Yanhua Fei

机构 * Department of Gynaecology and Obstetrics, The Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院妇产科) Department of Oncology, the Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院肿瘤科) Thrust of AI, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能推力实验室) FertiTech AI(生殖科技人工智能公司) Department of Oncology, Suzhou Xiangcheng People’s Hospital(苏州市相城区人民医院肿瘤科) Department of Biological Sciences and Bioinformatics, School of Science, Xi’an Jiaotong-Liverpool University(西交利物浦大学理学院生物科学与生物信息学系) School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 针对传统精液分析的主观性强等缺陷,综述聚焦计算机视觉与深度学习驱动的精子分析技术,梳理方法、数据集与落地障碍,提出分阶段临床转化路线。

Comments 46 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20742 2026-07-24 cs.LG 新提交 78%

Adaptive Confidence-weighted Expansion for Trustworthy Multi-Omics Multimodal Fusion

用于可信多组学多模态融合的自适应置信加权扩展

Mohammad Raahemi, Ali Sekhavati, Alireza Maleki, Hamid Nasiri

机构 * Faculty of Engineering, University of Ottawa(渥太华大学工程学院) RIV Lab, Department of Computer Engineering, Bu-Ali Sina University(布阿里·西纳大学计算机工程系RIV实验室) School of Computing and Communications, Lancaster University(兰卡斯特大学计算与通信学院)

专题命中 融合架构与评测 :multimodal fusion(title,abstract)

AI总结 针对多模态学习模型在噪声或无信息数据流下性能不佳及缺乏数据质量评估机制的问题,提出自适应置信加权扩展(ACE)框架,通过生成互补模态和双层置信机制提升性能,在多组学数据集评估中显著优于现有算法。

Comments Accepted for publication in the proceedings of the International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26743 2026-07-30 cs.CV cs.AI 新提交 74%

Multimodal fusion of visual and morphometric features for avian bone classification

用于鸟类骨骼分类的视觉与形态计量特征多模态融合

Nevio Dubbini, Lisa Yeomans, Marco Pavia, Ramazan Parmaksiz, Ayse Atas Hooglugt, Gabriele Gattiglia, Beatrice Demarchi

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV

AI总结 本研究提出结合卷积神经网络图像分析与骨计量测量的多模态框架,用于鸟类骨骼分类,在骨骼类型分类准确率达86%,科级分类Top-1准确率51%、Top-3准确率75%,为AI辅助动物考古识别建立了方法学基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25820 2026-07-29 cs.CV 新提交 74%

Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion

基于大语言模型衍生成分标签和多模态融合的食品图像分割

Jui-Feng Chi, Wei-Ta Chu, Sheng-Long Lin

机构 * National Cheng Kung University(国立成功大学)

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV

AI总结 针对现有食品图像分割模型在相似成分和罕见类别上表现不佳的问题,提出两个多模态模块LIM-F和LIM-Q,利用大语言模型衍生标签提升分割性能,在FoodSeg103基准测试中取得领先,且内存消耗增加适度,为细粒度食品理解提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25679 2026-07-29 cs.LG cs.AI cs.MM 新提交 74%

DynaBridge: Dynamic Summary-Guided Cross-Task Multimodal Fusion for DASS-Structured Mental Health Assessment

DynaBridge:用于DASS结构心理健康评估的动态摘要引导跨任务多模态融合

Shiyu Teng, Haichen Yu, Jiaqing Liu, Hao Sun, Yu Song, Shurong Chai, Ruibo Hou, Lanfen Lin, Yen-Wei Chen

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.MM

AI总结 研究针对心理健康评估中通用融合模型忽略问卷标签心理测量结构的问题,提出DynaBridge框架,通过编码多模态线索并结合语义摘要进行评估,在官方验证分割上优于基线和其他方法,展现了多模态融合与心理测量结构结合的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21347 2026-07-24 cs.CV 新提交 74%

Quality-Aware Multimodal Fusion Reveals Implicit Identity in Valence-Arousal Features

质量感知多模态融合揭示效价-唤醒特征中的隐含身份

Jisu Kim, Benjamin S. Riggan

机构 * University of Nebraska-Lincoln(内布拉斯加大学林肯分校)

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV

AI总结 研究针对传统人脸识别在无约束环境中表现不佳的问题,提出质量感知自适应融合方法 QAAF 用于多模态效价-唤醒估计,在 VA 估计任务中取得良好效果,且经 VA 训练的特征在编码身份上表现出色,确立了多模态 VA 估计为传统人脸识别的互补软生物特征模态。

Comments 10 pages, 3 figures, 6 tables. Accepted for publication at IEEE International Joint Conference on Biometrics (IJCB), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17351 2026-07-21 cs.AI cs.RO 新提交 74%

DeeperRadar: End-to-End MIMO Radar Design and Multi-Modal Fusion for Autonomous Vehicle Perception

深度雷达:用于自动驾驶车辆感知的端到端MIMO雷达设计与多模态融合

Eli Goldenshluger, Barak Pinkovich, Chaim Baskin

机构 * Technion–Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 融合架构与评测 :multi-modal fusion(title);分类 cs.RO

AI总结 深度雷达以雷达为中心,通过端到端学习稀疏采集模式,共同设计雷达传感与多模态3D检测。其可学习的MIMO设计模块在融合网络中训练,由其他传感器监督。在RADIal数据集上评估,能发现稀疏配置,降低成本与复杂性,表明最优设计取决于融合堆栈和感知任务。

Comments Accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13573 2026-07-16 cs.RO cs.AI 新提交 74%

IMMNet: Hybrid Fusion of Model-based and Data-driven Approaches for Maneuvering Target Tracking

IMMNet:基于模型与数据驱动方法的混合融合用于机动目标跟踪

Yixuan Zhao, Chaoqun Yang, Lin Gao, Yongxiao Tian, Ting Yuan

机构 * School of Automation, Southeast University(东南大学自动化学院) School of ICE, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Faculty of Artificial Intelligence, Shanghai University of Electric Power(上海电力大学人工智能学院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

专题命中 融合架构与评测 :hybrid fusion(title);分类 cs.RO

AI总结 针对三维空间机动目标跟踪难题,提出IMMNet算法,融合IMM算法可解释结构与神经组件,能保留贝叶斯推理机制并从数据学习,实验证明该算法在多场景下优于现有算法,是机动目标跟踪的有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10700 2026-08-12 cs.IR 新提交 71%

Deciding When to Rely on Visual Information: Gated Multimodal Fusion in Sequential Recommendation

何时依赖视觉信息:序列推荐中的门控多模态融合

Natalija Glisovic, Danica Kragic, Martin Tegner

专题命中 融合架构与评测 :multimodal fusion(title)

AI总结 该研究提出VisGate框架,基于物品和用户上下文自适应融合多模态信号,揭示视觉效用随物品、交互稀疏性变化的规律,实现更精准的序列推荐并可解释视觉信息的作用。

Comments 8 pages, 6 figures, Accepted at CARS @ RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23370 2026-07-28 cs.LG cs.CE econ.EM stat.CO 新提交 71%

Bitcoin Price Direction Prediction via Regime-Aware Multi-Modal Fusion of Social Sentiment and Technical Features

通过社会情绪与技术特征的状态感知多模态融合预测比特币价格走势

Muhammad Abdullah Haroon

机构 * FAST National University of Computer and Emerging Sciences (FAST-NUCES)(快速国立计算机与新兴科学大学)

专题命中 融合架构与评测 :multi-modal fusion(title)

AI总结 研究比特币亚日价格预测难题,提出状态感知多模态学习(RAML)方法,依据市场状态动态融合社会情绪与技术特征,实验表明该方法在预测中表现良好,确立状态条件自适应融合为多模态金融预测的必要原则。

Comments 19 pages, 15 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04786 2026-07-07 cs.SE cs.AI cs.MA 新提交 71%

An Exploration of Agentic Information Fusion for Test Maintenance Prediction

用于测试维护预测的智能信息融合探索

Jingxiong Liu, Nasser Mohammadiha, Gregory Gay

机构 * Chalmers University of Technology and University of Gothenburg(楚德斯技术大学和戈特堡大学) Ericsson AB(爱立信有限公司) University of Gothenburg(戈特堡大学)

专题命中 融合架构与评测 :information fusion(title)

AI总结 研究针对测试维护预测问题,提出多智能体框架MAST,通过智能融合多种分析方法及后检查程序,在实际场景中评估,提升了测试维护预测水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26473 2026-06-26 cs.LG eess.AS 新提交 71%

When Does Quality-Aware Multimodal Fusion Matter? A Leakage-Safe Diagnostic for Decision-Level Dependence

质量感知多模态融合何时重要?一种针对决策级依赖的泄漏安全诊断方法

Jaden Moon, Arvind Pillai, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院)

专题命中 融合架构与评测 :multimodal fusion(title)

AI总结 提出一种诊断方法,通过置换测试检验多模态融合中可靠性分数是否真正影响决策,实验表明仅当可靠性信号能预测单模态正确性时才有效。

Comments Accepted to INTERSPEECH 2026. 5 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16154 2026-07-20 cs.CV cs.SY eess.SY 新提交 70%

CLIFE: Camera-LiDAR Fusion Framework for Edge-Deployable Roadside VRU Perception

CLIFE:用于边缘可部署路边VRU感知的相机-激光雷达融合框架

Tam Bang, Hoang H. Nguyen, Lei Cheng, Lihao Guo, Siyang Cao, Hussam Abubakr, Tianya Zhang, Austin Harris, Mina Sartipi

专题命中 融合架构与评测 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.CV

AI总结 针对路边VRU感知难题,提出CLIFE框架,集成无目标在线校准与轻量级后期融合跟踪于单嵌入式设备,无需云卸载。经实验验证,该框架提升了传感器感知能力与鲁棒性,核心运行高效,为下游安全应用提供基础并减少相关开销。

Comments Accepted for publication at the 2026 IEEE 29th International Conference on Intelligent Transportation Systems (ITSC 2026). 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14821 2026-07-17 cs.CV 新提交 70%

Blurring Modal Boundaries: A Unified Survey from Single- to Multi-Modal Person Re-ldentification

模糊模态边界:从单模态到多模态行人重识别的统一综述

Xiao Wang, Bing Wang, Bin Yang, Cuiqun Chen, Xin Xu, Mang Ye

机构 * Wuhan University of Science and Technology(武汉科技大学) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System(湖北省智能信息处理与实时工业系统重点实验室) Wuhan University(武汉大学) Anhui University(安徽大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);visible-infrared(abstract);分类 cs.CV

AI总结 综述行人重识别领域从单模态向多模态发展的转变,系统回顾关键跨模态任务,研究多模态融合ReID,提出基于Transformer的可见光-红外ReID基线框架,并概述未来研究方向。

Comments 61 pages, 6 figures, journal

Journal ref International Journal of Computer Vision.2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06222 2026-07-08 cs.RO 新提交 70%

APVI-SLAM: Real-Time Acoustic-Pressure-Visual-Inertial Localization and Photorealistic Mapping System in Complex Underwater Environment

APVI-SLAM:复杂水下环境中的实时声压视觉惯性定位与真实感映射系统

Hanwen Zhang, Yipeng Zhu, Xiaopeng Guo, Huajian Huang, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 融合架构与评测 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.RO

AI总结 针对水下视觉惯性SLAM在极端环境中的问题,提出APVI-SLAM系统,通过可靠性感知定位框架和滑动窗口冻结策略增强鲁棒性,用四叉树引导映射模块助力重建,还贡献数据集,实验证明其实现了实时领先的定位与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27886 2026-06-29 cs.LG 新提交 67%

A Comparison of Fusion Techniques for Multi-Modal Human Activity Recognition on the HARMES Dataset

HARMES数据集上多模态人类活动识别融合技术的比较

Ahmed Mohamady, Robin Burchard, Kristof Van Laerhoven

机构 * University of Siegen(锡根大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);sensor fusion(abstract)

AI总结 系统比较七种传感器融合方法在HARMES多模态数据集上的性能,发现门控多模态融合在留一参与者评估中宏F1分数达0.82,优于拼接式后期融合基线(0.76)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07574 2026-08-11 cs.CV cs.RO 新提交 62%

Multimodal Skin Lesion Classification with Swin Transformer and Clinical Metadata Fusion

基于Swin Transformer与临床元数据融合的多模态皮肤病变分类

Nethmi Pathirana, Isuru Munasinghe, Dileeka Alwis

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV、cs.RO

AI总结 该研究针对皮肤病变分类的自动化挑战,提出结合Swin Transformer图像特征与临床元数据的多模态框架,在公开数据集上实现92.55%测试准确率,兼具强少数类性能与预测可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22773 2026-07-28 eess.IV cs.CV physics.med-ph 新提交 62%

Metric Surface Reconstruction of Neurosurgical Scenes from Monocular Operating Microscope Images and Microscope Pose

从单目手术显微镜图像和显微镜位姿重建神经外科场景的度量曲面

Thomas Bucher, Didier Neuenschwander, Thomas Petutschnigg, Michael Murek, David Bervini, Andreas Raabe, Manuela Eugster

专题命中 融合架构与评测 :image fusion(abstract);分类 cs.CV、eess.IV

AI总结 研究能否从单目手术显微镜图像和位姿数据重建神经外科场景的三维几何度量,利用预训练模型估计深度、泊松曲面重建点云成网格,结果显示该方法在模型设置中有技术可行性,支持相关手术技术进一步发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21258 2026-06-23 cs.RO cs.CV 新提交 62%

Spectral GS-SLAM: Observability-Aware, Degeneracy-Robust Tracking for Real-Time 3D Gaussian Splatting SLAM

Spectral GS-SLAM:面向实时3D高斯泼溅SLAM的可观测性感知与退化鲁棒跟踪

Edward Beng Wai Tan, Siew-Kei Lam, Dongshuo Zhang

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV、cs.RO

AI总结 提出Spectral GS-SLAM,通过自适应补偿退化场景中的欠约束方向,结合ICP与特征约束实现鲁棒跟踪,并利用高斯感知平面性加权机制融合几何信息,在无结构/纹理环境中保持实时性能(40.14 FPS)。

Comments This work has been accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12294 2026-06-11 cs.CV eess.IV 新提交 62%

Bridging the Modality Gap in Forensic Image Retrieval

弥合法医图像检索中的模态差距

Ricardo González-Gazapo, Annette Morales-González, Yoanna Martínez-Díaz, Heydi Méndez-Vázquez, Milton García-Borroto

机构 * Advanced Technologies Application Center (CENATAV)(先进技术应用中心(CENATAV)) Centro de Sistemas Complejos, Facultad de Física, Universidad de La Habana(哈瓦那大学物理学院复杂系统中心)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV、eess.IV

AI总结 提出统一检索框架,利用多模态大语言模型生成文本描述并结合视觉与文本特征融合,提升纹身、人脸素描等法医任务的检索精度与鲁棒性。

Comments 23 pages, 5 figures, paper submitted to Elsevier journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13102 2026-08-14 cs.CV 新提交 57%

RbFT-Net: Rectify-Before-Fuse Temporal Radar Anchors for 4D Radar-Camera Depth Completion

RbFT-Net:用于4D雷达-相机深度补全的融合前校正时间雷达锚点

Wentao Zhao, Shouxuan Wu, Yongtao Cen, Tianchen Deng, Yuyang Zhang, Jingchuan Wang

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出RbFT-Net框架,通过图像条件校正模块校正雷达锚点并选择性传播,解决雷达测量的稀疏与干扰问题,在相关数据集上的深度补全性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12570 2026-08-14 cs.CV cs.IR 新提交 57%

Attribute-Conditioned Multimodal Slot Factorization for Controllable Fashion Retrieval

用于可控时尚检索的属性条件多模态槽分解

Najmeh Forouzandehmehr, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本研究提出MM-slotgate多模态槽编码器,将Fashion-CLIP嵌入分解为属性槽,在H&M数据集上实现可控时尚检索,颜色等属性性能提升显著,优于多模态融合与仅文本检索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09550 2026-08-11 cs.CV 新提交 57%

PressureMesh: 3D Human Mesh Estimation from Multi-Device Pressure Images

PressureMesh:基于多设备压力图像的3D人体网格估计

Changhai Ma, Ziyu Wu, Yunkang Zhang, Fangting Xie, Mengting Niu, Heyu Ding, Quan Wan, Jiayue Yuan, Boyan Liu, Yi Ke, Xiaohui Cai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对单设备压力监测范围有限的问题,提出端到端网络MDP-Net,结合MoE框架的多模态融合机制,构建MDP数据集,实现跨设备压力数据的3D人体网格估计,关节位置误差为12.6cm。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08307 2026-08-11 cs.CV cs.AI 新提交 57%

Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering

用于医学视觉问答的频域双分支融合

Yusra Tariq, Rakesh Chandra Joshi

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出频域双分支融合模块,结合BiomedCLIP与BioBART,在PMC-VQA预训练后于VQA-RAD、SLAKE微调,提升医学VQA性能且架构轻量高效。

Comments 7 Pages, 4 figures, under review at AAAI 27

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01807 2026-08-04 cs.CV 新提交 57%

Parameter-Dynamic Adaptive Fusion and Calibration Network for RGBT Tracking

用于RGBT跟踪的参数动态自适应融合与校准网络

Zhaoding Ding, Chenglong Li, Jiandong Jin, Kewei Ying, Wentao Wu

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对现有RGBT跟踪器融合参数无法适配目标状态变化的问题,提出PAFCNet,通过TA-HyperNet生成目标条件参数,实现动态融合与时序校准,在多RGBT跟踪基准上取得竞争力性能。

Comments 9 pages,4 figures; Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24683 2026-07-28 cs.CV cs.AI cs.LG 新提交 57%

Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

多模态分类中用于缺失任意模态的协同学习

Francisco Mena, Dino Ienco, Roberto Interdonato, Cassio F. Dantas, Simon Besnard

机构 * GFZ Helmholtz Center for Geosciences(德国波茨坦地学研究中心亥姆霍兹中心) INRAE, UMR TETIS, University of Montpellier(法国蒙彼利埃大学农业环境与生态研究院、蒙彼利埃大学TETIS联合研究单位) INRIA, EVERGREEN, University of Montpellier(法国蒙彼利埃大学信息与自动化研究所、EVERGREEN实验室) CIRAD, UMR TETIS, University of Montpellier(法国蒙彼利埃大学国际农业研究磋商组织、蒙彼利埃大学TETIS联合研究单位)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对多模态分类中因操作约束导致训练和推理时模态可用性不一致、存在缺失任意模态的问题,提出多模态协同学习框架,引入特征和决策层面利用信息的两种方法,实验证明在不同缺失模态条件下有显著鲁棒性提升。

Comments Accepted at Discovery Science 2026

详情

展开后加载摘要…

URL PDF HTML 收藏