arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 22 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 22 篇

2512.15211 2026-08-13 cs.CV 版本更新 83%

WLC: Weber-Inspired Local Contrast Metric for Low-Altitude Image Fusion

TBC: 低空红外与可见图像融合中的目标-背景对比度度量

Cong Wang, Yufeng Xie

专题命中 融合架构与评测 :image fusion(title,abstract);infrared and visible(abstract);分类 cs.CV

AI总结 本文提出TBC度量,通过关注目标与背景的相对对比度,解决传统度量在低光环境中的失效问题,提升无人机图像融合的鲁棒性和实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00300 2026-07-13 cs.CL 版本更新 78%

Entity Alignment Method of Science and Technology Patent based on Graph Convolution Network and Information Fusion

基于图卷积网络与信息融合的科技专利实体对齐方法

Runze Fang, Yawen Li, Yingxia Shao, Zeli Guan, Zhe Xue

机构 * Beijing Key Laboratory of Intelligent Communication Software and Multimedia(智能通信软件与多媒体北京重点实验室) School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(计算机学院(国家试点软件工程学院),北京邮电大学) School of Economics and Management, Beijing University of Posts and Telecommunications(经济管理学院,北京邮电大学)

专题命中 融合架构与评测 :information fusion(title,abstract)

AI总结 研究科技专利实体对齐问题,提出基于图卷积网络与信息融合的方法,利用专利实体图形结构及辅助信息,通过图卷积网络和BERT模型实现多信息融合,提升实体对齐性能,实验表明该方法优于现有方法。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15265 2026-07-22 cs.CV 版本更新 74%

Trusted Multi-View Deep Learning Classification of Fetal Congenital Heart Disease with Feature-level and Decision-level Fusion

基于特征级与决策级融合的胎儿先天性心脏病可信多视图深度学习分类

Tan Zhou, Shifa Yao, Suncheng Xiang, Dahong Qian, Baoying Ye

机构 * School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) Shanghai Key Laboratory of Embryo Original Diseases(上海胚胎原发疾病重点实验室) Shanghai Municipal Key Clinical Specialty(上海市级重点临床专科)

专题命中 融合架构与评测 :decision-level fusion(title);分类 cs.CV

AI总结 提出一种多视图深度学习框架,通过特征提取、注意力机制和不确定性决策融合超声心动图多视角图像,实现胎儿先天性心脏病高精度二分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02056 2026-06-09 cs.CV 版本更新 74%

COMPASS: Complete Multimodal Fusion via Proxy Tokens and Shared Spaces for Ubiquitous Sensing

COMPASS:通过代理令牌和共享空间实现完整的多模态融合以实现无处不在的感知

Hao Wang, Yanyu Qian, Pengcheng Weng, Zixuan Xia, William Dan, Yangxin Xu, Fei Wang

机构 * Universität Bern(伯恩大学) Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学)

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV

AI总结 COMPASS通过代理令牌和共享空间实现多模态融合,解决缺失模态导致的信息丢失和融合接口不匹配问题,提升多模态感知的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15320 2026-07-07 q-bio.QM cs.CV cs.LG cs.MM q-bio.GN 版本更新 62%

GestaltMML: Enhancing Rare Genetic Disease Diagnosis through Multimodal Machine Learning Combining Facial Images and Clinical Text

GestaltMML:通过结合面部图像和临床文本的多模态机器学习增强罕见遗传病诊断

Da Wu, Zhanliang Wang, Hongzhuo Chen, Jingye Yang, Cong Liu, Tzung-Chien Hsieh, Elaine Marchi, Justin Blair, Peter Krawitz, Chunhua Weng, Wendy Chung, Gholson J. Lyon, Ian D. Krantz, Jennifer M. Kalish, Kai Wang

机构 * Raymond G. Perelman Center for Cellular and Molecular Therapeutics, Children’s Hospital of Philadelphia(雷蒙德·G·佩尔曼细胞与分子治疗中心,费城儿童医院) Department of Mathematics, University of Pennsylvania(数学系,宾夕法尼亚大学) Department of Biomedical Informatics, Columbia University Irving Medical Center(生物医学信息学系,哥伦比亚大学伊万斯医疗中心) Department of Human Genetics, New York State Institute for Basic Research in Developmental Disabilities, Staten Island, NY, USA(人类遗传学系,纽约州发育障碍基础研究机构,纽约州史泰登岛) Division of Human Genetics, Children’s Hospital of Philadelphia(人类遗传学部,费城儿童医院) Department of Pediatrics, Boston Children’s Hospital, Harvard Medical School(儿科系,波士顿儿童医院,哈佛医学院) Biology PhD Program, The Graduate Center, The City University of New York(生物学博士项目,纽约市立大学研究生中心) Department of Genetics, Perelman School of Medicine, University of Pennsylvania(遗传学系,宾夕法尼亚大学佩尔曼医学学院) Department of Pediatrics, Perelman School of Medicine, University of Pennsylvania(儿科系,宾夕法尼亚大学佩尔曼医学学院) Department of Pathology and Laboratory Medicine, Perelman School of Medicine, University of Pennsylvania(病理学与实验室医学系,宾夕法尼亚大学佩尔曼医学学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV、cs.MM

AI总结 研究针对罕见遗传病诊断难题,提出基于Transformer架构的多模态机器学习方法GestaltMML,整合面部图像、人口统计学信息和临床笔记,提升预测准确性,缩小诊断差距。

Comments Preprint updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25699 2026-08-07 cs.RO 版本更新 57%

SA-LIVO: Efficient LiDAR-Inertial-Visual Odometry with Subspace-Aware Degeneracy Handling

SA-LIVO: 基于子空间感知退化处理的轻量级LiDAR-惯性-视觉里程计

Yinong Cao, Xin He, Shouzheng Zhu, Senyuan Wang, Changhui Jiang, Chenyang Zhang, Pingfeng He, Tingwei Wang, Yuwei Chen, Shijie Liu, Chunlai Li, Genghua Huang, Jianyu Wang

机构 * Key Laboratory of Space Active Opto-Electronics Technology, Shanghai Institute of Technical Physics, Chinese Academy of Sciences(中国科学院上海技术物理研究所空间主动光电技术重点实验室) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.RO

AI总结 提出SA-LIVO系统,通过子空间感知信息融合(SAIF)框架对联合信息矩阵进行特征分解,在方向级别选择性融合LiDAR和视觉测量,解决LiDAR退化与视觉失效问题,实现高精度、低内存的实时里程计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新 57%

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14702 2026-07-22 cs.CV cs.AI 版本更新 57%

Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach

第十一届ABAW竞赛中的团队RAS:多模态矛盾情绪识别方法

Elena Ryumina, Maxim Markitantov, Alexandr Axyonov, Fedor Shchetinin, Timur Abdulkadirov, Dmitry Ryumin, Alexey Karpov

机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences (SPC RAS)(俄罗斯科学院圣彼得堡联邦研究中心) HSE University(圣彼得堡高等经济学院) ITMO University(圣彼得堡国立信息技术机械与光学大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对第十一届ABAW竞赛的视频级矛盾情绪和犹豫情绪识别,提出以文本为中心的多模态方法,用文本残差融合模型结合多种特征,实验表明该方法能有效提高识别性能,无需大型模型集成。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24679 2026-07-21 cs.AI eess.SP 版本更新 57%

Multi-modal cross-domain mixed fusion model with dual disentanglement for fault diagnosis under unseen working conditions

用于未知工况下故障诊断的具有双重解缠的多模态跨域混合融合模型

Pengcheng Xia, Yixiang Huang, Chengjin Qin, Chengliang Liu

机构 * State Key Laboratory of Mechanical System and Vibration(机械系统与振动国家重点实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 eess.SP

AI总结 针对未知工况下故障诊断问题,提出具有双重解缠的多模态跨域混合融合模型,通过双重解缠框架、跨域混合融合策略和三模态融合机制,实现多模态表示学习与域泛化,实验验证该方法优于先进方法及各组件有效性。

Comments Accepted for publication in Mechanical Systems and Signal Processing

Journal ref Mechanical Systems and Signal Processing, Volume 258, 2026, 114693

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09118 2026-07-17 cs.CV 版本更新 57%

LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data

LPCAN:用于使用RGB-D数据进行铁路表面缺陷检测的轻量级金字塔交叉注意力网络

Jackie Alex, Guoqiang Huan

机构 * St. Petersburg College(斯波伯学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对铁路表面缺陷检测方法局限,提出LPCANet,利用RGB-D数据,集成MobileNetv2等模块,经多模态融合与结构分析提升性能。在多数据集上评估效果显著,消融研究验证关键模块作用,为工业缺陷检测提供实用框架,未来将聚焦模型压缩。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20101 2026-07-15 cs.SD cs.AI cs.MM 版本更新 57%

RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers

基于整流流的混合扩散变压器用于指令引导音频编辑

Liting Gao, Yonggang Zhu, Yaru Chen, Dongyu Wang, Shubin Zhang, Zhenbo Li, Jean-Yves Guillemaut, Wenwu Wang

机构 * Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(萨里大学视觉、语音与信号处理中心) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Fisheries College, Ocean University of China(中国海洋大学水产学院) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.MM

AI总结 提出混合两阶段扩散变压器架构,通过粗到细策略平衡全局语义对齐与局部细节编辑,在重叠音频事件和复杂指令任务上提升性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11730 2026-07-07 cs.CV cs.HC cs.LG 版本更新 57%

Multimodal Ambivalence/Hesitancy Recognition in Videos for Personalized Digital Health Interventions

视频中矛盾/犹豫识别用于个性化数字健康干预

Manuela González-González, Soufiane Belharbi, Muhammad Osama Zeeshan, Masoumeh Sharafi, Muhammad Haseeb Aslam, Lorenzo Sia, Nicolas Richet, Marco Pedersoli, Alessandro Lameiras Koerich, Simon L Bacon, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(ETS蒙特利尔大学系统工程系LIVIA实验室) LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(ETS蒙特利尔大学软件与信息工程系LIVIA实验室) Dept. of Health, Kinesiology, & Applied Physiology, Concordia University, Montreal, Canada(康科迪亚大学健康、运动科学与应用生理学系) Montreal Behavioural Medicine Centre, CIUSSS Nord-de-l’Ile-de-Montréal, Canada(蒙特利尔行为医学中心,蒙特利尔北岛卫生与社会服务局)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文研究了通过深度学习模型在视频中进行矛盾/犹豫识别,以提升数字健康干预的个性化和成本效益,实验基于新的BAH视频数据集,发现需改进多模态模型以准确识别矛盾/犹豫。

Comments 11 pages, 4 figures, ACII 2026. arXiv admin note: substantial text overlap with arXiv:2505.19328

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04277 2026-07-03 cs.CV 版本更新 57%

Event-based vision sensing and its application to pedestrian detection for intelligent transportation and surveillance

基于事件的视觉感知及其在智能交通与监控中行人检测的应用

Han Wang, Juntao Wu, Jingyuan Bao, Min Liu, Yaoxiong Wang, Saiao Zhou, Yuman Nie, Yun Li

机构 * Han Wang, Juntao Wu, Jingyuan Bao, Min Liu, Yaoxiong Wang, Saiao Zhou, Yuman Nie, Yun Li(未知)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 综述事件视觉感知原理及其在行人检测中的应用,比较事件驱动与传统帧方法的优劣,分析现有方法并讨论开放挑战与未来方向。

Comments Published in Advanced Engineering Informatics, Vol. 76, Part B, 104989 (2026). Received 31 December 2025; Revised 3 June 2026; Accepted 18 June 2026; Available online 23 June 2026. DOI: 10.1016/j.aei.2026.104989

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05888 2026-06-16 cs.CV 版本更新 57%

BioAutoML-NAS: An End-to-End AutoML Framework for Multimodal Insect Classification via Neural Architecture Search on Large-Scale Biodiversity Data

BioAutoML-NAS:基于大规模生物多样性数据通过神经架构搜索进行多模态昆虫分类的端到端AutoML框架

Arefin Ittesafun Abian, Debopom Sutradhar, Md Rafi Ur Rashid, Reem E. Mohamed, Md Rafiqul Islam, Asif Karim, Kheng Cher Yeo, Sami Azam

机构 * Department of Computer Science and Engineering, United International University, Dhaka, Bangladesh(乌姆国际大学计算机科学与工程系,达卡,孟加拉国) Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory, 1217, Dhaka, Bangladesh(应用人工智能与智能系统实验室(AAIINS),1217号,达卡,孟加拉国) Department of Computer Science and Engineering, Penn State University, University Park, PA, USA(宾夕法尼亚州立大学计算机科学与工程系,University Park,PA,美国) Faculty of Science and Information Technology, Charles Darwin University, Sydney, NSW, Australia(查尔斯达尔文大学科学与信息技术学院,悉尼,新南威尔士州,澳大利亚) Faculty of Science and Technology, Charles Darwin University, Casuarina, 0909, NT, Australia(查尔斯达尔文大学科学与技术学院,Casuarina,0909,北领地,澳大利亚)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出首个多模态BioAutoML模型BioAutoML-NAS,利用神经架构搜索自动学习图像操作,结合元数据融合与交替双层优化,在BIOSCAN-5M数据集上以96.81%准确率超越现有方法。

Comments Accepted in IEEE Transactions on Big Data

Journal ref IEEE Transactions on Big Data (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04128 2026-07-31 cs.AI 版本更新 50%

Decision-oriented joint optimization of evidence fusion based on event-conditioned credibility

面向决策的、基于事件条件可信度的证据融合联合优化

Chaoxiong Ma, Yan Liang, Huixia Zhang, Hao Sun

专题命中 融合架构与评测 :decision-level fusion(abstract)

AI总结 针对异构源决策级融合中关键证据易被低估问题,本文提出事件条件可信度,构建联合优化模型,经实验验证其可信度排名更贴合真实值、对正确事件支持度更高且不动点达成率高。

Comments 27 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17330 2026-07-23 cs.LG cs.AI 版本更新 50%

SubQuad: Near-Quadratic-Free Structure Inference with Distribution-Balanced Objectives in Adaptive Receptor framework

SubQuad:在自适应受体框架中利用分布平衡目标的近二次自由结构推断

Rong Fu, Zijian Zhang, Kun Liu, Jiekai Wu, Xianda Li, Simon Fong

机构 * University of Macau(澳门大学) University of Pennsylvania(宾夕法尼亚大学) University of Southampton(南安普顿大学) Juntendo University(顺天堂大学) University of Bologna(博洛尼亚大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 SubQuad通过结合抗原感知的近子二次检索、GPU加速的亲和力核、学习多模态融合和公平性约束聚类,解决大规模群体适应性免疫谱分析中的二次成本和数据不平衡问题,提升效率与公平性。

Comments 27 pages, 9 figures. In the previous version, Juntendo University was erroneously listed as the affiliation; we must clarify that this paper has absolutely no relation to Juntendo University. Therefore, we have replaced this affiliation in the new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16216 2026-07-22 math.OC 版本更新 50%

Conservative fusion of unbiased partial state estimates: CI is optimal

无偏部分状态估计的保守融合:协方差交集是最优的

Jochen Trumpf, Behzad Zamani, Chris Manzie

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 研究两个无偏部分状态估计信息融合时,证明协方差交集(CI)在保守无偏线性融合规则中最优,还表明三个优化问题等价,给出可解性条件及相关成本函数最优解方程。

Comments Provisionally accepted for Automatica

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14954 2026-07-14 cs.LG 版本更新 50%

Multimodal rumor detection enhanced by external evidence and forgery features

通过外部证据和伪造特征增强的多模态谣言检测

Han Li, Hua Sun

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出通过外部证据和伪造特征增强的多模态谣言检测模型,利用ResNet34视觉编码器、BERT文本编码器和伪造特征模块,结合双对比学习模块和门控自适应特征缩放融合机制,提升谣言检测性能。

Comments 20pages,10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.15255 2026-07-07 eess.SY cs.AI cs.SY econ.GN math.OC q-fin.EC 版本更新 50%

Double Fuzzy Probabilistic Interval Linguistic Term Set and a Dynamic Fuzzy Decision Making Model based on Markov Process with tts Application in Multiple Criteria Group Decision Making

双模糊概率区间语言术语集及基于马尔可夫过程的动态模糊决策模型在多准则群体决策中的应用

Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 针对概率语言术语缺陷及动态属性权重确定难问题,提出双模糊概率区间语言术语集概念,定义相关内容,开发模糊语言马尔可夫矩阵等,给出权重确定方法,并用金融风险投资案例说明其在多准则决策中的应用。

Comments submitted to IEEE Transactions on Fuzzy Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04748 2026-06-23 q-bio.GN 版本更新 50%

SeekRBP: Leveraging Sequence-Structure Integration with Reinforcement Learning for Receptor-Binding Protein Identification

SeekRBP: 利用强化学习整合序列-结构信息识别受体结合蛋白

Xiling Luo, Le Ou-Yang, Yang Shen, Jiaojiao Guan, Dehan Cai, Jun Zhang, Guoliang Xing, Yanni Sun, Jiayu Shang

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出SeekRBP框架,通过多臂老虎机策略动态采样难负例,融合蛋白质语言与结构嵌入,有效识别序列差异大的受体结合蛋白,在噬菌体宿主预测中表现优异。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08597 2026-06-16 cs.AI 版本更新 50%

An Attention Mechanism for Robust Multimodal Integration in a Global Workspace Architecture

全局工作空间架构中用于鲁棒多模态集成的注意力机制

Roland Bertin-Johannet, Lara Scipio, Leopold Maytié, Rufin VanRullen

机构 * CerCo, CNRS, Université de Toulouse(CerCo、CNRS、图卢兹大学) ANITI, Artificial and Natural Intelligence Toulouse Institute(ANITI、图卢兹人工智能与自然智能研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出一种轻量级自上而下的模态选择器,在冻结的多模态全局工作空间上运行,通过注意力机制提升系统在模态噪声或缺失下的鲁棒性,并在两个数据集上验证了其高效性和可迁移性。

Comments 21 pages, 6 figures, 2 tables. Accepted at ICANN 2026. Code: https://github.com/RolandBERTINJOHANNET/GW_attention

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10132 2026-06-12 physics.plasm-ph cs.AI 版本更新 50%

TokaMark: A Comprehensive Benchmark for MAST Tokamak Plasma Models

TokaMark:MAST托卡马克等离子体模型的综合基准

Cécile Rousseau, Samuel Jackson, Rodrigo H. Ordonez-Hurtado, Nicola C. Amorisco, Tobia Boschi, George K. Holt, Andrea Loreti, Eszter Székely, Alexander Whittle, Adriano Agnello, Stanislas Pamela, Alessandra Pascale, Robert Akers, Juan Bernabe Moreno, Sue Thorne, Mykhaylo Zayats

机构 * IBM Research Europe(IBM欧洲研究院) UK Atomic Energy Authority(英国原子能局) STFC Hartree Centre(STFC哈特ree中心)

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 为解决聚变数据稀缺、分散且标注不一致的问题,提出TokaMark基准,包含14项任务,统一多模态聚变数据访问和评估协议,并提供基线模型,以加速数据驱动的AI等离子体建模。

详情

展开后加载摘要…

URL PDF HTML 收藏