arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 1409 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 1409 篇

2602.12087 2026-02-13 cs.LG 50%

Geometry of Uncertainty: Learning Metric Spaces for Multimodal State Estimation in RL

不确定性几何:用于强化学习中多模态状态估计的度量空间学习

Alfredo Reichlin, Adriano Pacciarelli, Danica Kragic, Miguel Vasco

机构 * Division of Robotics, Perception, and Learning(机器人、感知与学习系) KTH Royal Institute of Technology(皇家理工学院)

专题命中 融合架构与评测 :sensor fusion(abstract)

AI总结 本文提出了一种学习多模态状态估计的度量空间方法,通过自适应整合多种传感器模态,提升了RL任务中的鲁棒性和状态估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13180 2026-02-12 cs.LG cs.AI cs.DC 50%

GC-Fed: Gradient Centralized Federated Learning with Partial Client Participation

GC-Fed: 带部分客户端参与的梯度集中联邦学习

Jungwon Seo, Ferhat Ozgur Catak, Chunming Rong, Kibeom Hong, Minhoe Kim

机构 * Department of Electrical Engineering and Computer Science, University of Stavanger(电子工程与计算机科学系,斯瓦尔内尔大学) Department of Software, Sookmyung Women's University(软件系,淑明女子大学) Department of Electrical and Information Engineering, Seoul National University of Science and Technology(电子与信息工程系,首尔科学技术大学)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 GC-Fed通过梯度集中技术缓解联邦学习中的客户端漂移问题,提升异构数据下的模型准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10023 2026-02-11 cs.CL 50%

MEVER: Multi-Modal and Explainable Claim Verification with Graph-based Evidence Retrieval

MEVER:基于图的证据检索的多模态和可解释性声明验证

Delvin Ce Zhang, Suhan Cui, Zhelin Chu, Xianren Zhang, Dongwon Lee

机构 * University of Sheffield(谢菲尔德大学) University of Science and Technology Beijing(北京科技大学) University of California San Diego(加州大学圣地亚哥分校) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 MEVER通过多模态图检索和解释生成,实现了准确且可解释的声明验证,同时创建了AI领域的科学数据集AIChartClaim。

Comments Accepted to EACL-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14863 2026-02-04 cs.LG cs.AI 50%

Exploring the Global-to-Local Attention Scheme in Graph Transformers: An Empirical Study

探索图变换器中的全局到局部注意力机制:一项实证研究

Gang Wu, Zhengwei Wang

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 G2LFormer通过全局到局部注意力机制提升图变换器性能,结合注意力与GNN模块,缓解信息丢失并保持线性复杂度。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-51718-4}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00561 2026-02-03 cs.AI 50%

Uncovering Latent Communication Patterns in Brain Networks via Adaptive Flow Routing

通过自适应流路由揭示脑网络中的潜在通信模式

Tianhao Huang, Guanghui Min, Zhenyu Lei, Aiying Zhang, Chen Chen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 本文提出AFR-Net,通过神经通信动态视角融合SC和FC,揭示潜在神经通路,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22610 2026-02-02 cs.LG cs.AI 50%

Local-Global Multimodal Contrastive Learning for Molecular Property Prediction

局部-全局多模态对比学习用于分子性质预测

Xiayu Liu, Zhengyi Lu, Yunhong Liao, Chan Fan, Hou-biao Li

机构 * School of Mathematical Sciences(数学科学学院) University of Electronic Science and Technology of China(电子科技大学) Department of Computer Science and Engineer(计算机科学与工程系) Oakland University(奥克兰大学) Department of Electrical and Computer Engineering(电气与计算机工程系) College of Management Science(管理科学学院) Chengdu University of Technology(成都理工大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 LGM-CL通过局部-全局多模态对比学习框架,整合分子结构和化学语义信息,提升分子性质预测的准确性与性能。

Comments 16 pages, 9 figures. Submitted to Briefings in Bioinformatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18424 2026-01-27 cs.HC cs.LG 50%

Fusion of Spatio-Temporal and Multi-Scale Frequency Features for Dry Electrodes MI-EEG Decoding

时空与多尺度频率特征融合用于干电极MI-EEG解码

Tianyi Gong, Can Han, Junxi Wu, Dahong Qian

专题命中 融合架构与评测 :decision-level fusion(abstract)

AI总结 STGMFM通过融合时空与多尺度频率特征,提升干电极MI-EEG解码的稳定性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11885 2026-01-21 cs.AI 50%

MyGram: Modality-aware Graph Transformer with Global Distribution for Multi-modal Entity Alignment

MyGram: 多模态实体对齐的模态感知图变换器与全局分布

Zhifei Li, Ziyue Qin, Xiangyu Luo, Xiaoju Hou, Yue Zhao, Miao Zhang, Zhifang Huang, Kui Xiao, Bing Yang

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 MyGram通过模态感知图变换器与全局分布机制,提升多模态实体对齐的性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10986 2026-01-19 cs.LG 50%

StellarF: A Physics-Informed LoRA Framework for Stellar Flare Forecasting with Historical & Statistical Data

StellarF:一种结合物理知识的LoRA框架,用于利用历史和统计数据进行恒星耀斑预测

Tianyu Su, Zhiqiang Zou, Qingyu Lu, Feng Zhang, Ali Luo, Xiao Kong, Min Li

机构 * School of Computer Science, Nanjing University of Posts and Telecommunications(南京邮电大学计算机科学学院) Jiangsu Key Laboratory of Big Data Security and Intelligent Processing(江苏大数据安全与智能处理重点实验室) University of Chinese Academy of Sciences(中国科学院大学) CAS Key Laboratory of Optical Astronomy, National Astronomical Observatories(中国科学院国家天文台光学天文重点实验室) School of Astronomy and Space Science, University of Chinese Academy of Sciences(中国科学院大学天文与空间科学学院)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 StellarF通过结合物理知识和LoRA框架,利用历史和统计数据提升恒星耀斑预测的准确性与物理可解释性。

Comments 12 pages, 8 figures (5 main, 3 appendix), 7 tables (2 main, 5 appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08764 2026-01-14 cs.IR cs.SD eess.AS 50%

FusID: Modality-Fused Semantic IDs for Generative Music Recommendation

FusID: 多模态融合的语义ID用于生成音乐推荐

Haven Kim, Yupeng Hou, Julian McAuley

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 FusID通过多模态融合、表示学习和产品量化技术,解决生成音乐推荐中跨模态交互和ID冲突问题,提升推荐准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06848 2026-01-13 cs.CL 50%

Explainable Multimodal Aspect-Based Sentiment Analysis with Dependency-guided Large Language Model

可解释的多模态基于方面的情感分析与依赖引导的大语言模型

Zhongzheng Wang, Yuanhe Tian, Hongzhi Wang, Yan Song

机构 * Harbin Institute of Technology(哈尔滨工程大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出了一种基于依赖引导的大语言模型的多模态情感分析方法,通过生成可解释的自然语言解释来提升情感分类的准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02624 2026-01-07 cs.HC 50%

EgoLog: Ego-Centric Fine-Grained Daily Log with Ubiquitous Wearables

EgoLog:基于普及式可穿戴设备的以自我为中心的细粒度日常日志

Lixing He, Bufang Yang, Di Duan, Zhenyu Yan, Guoliang Xing

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 EgoLog通过融合音频与IMU数据及LLM推理,实现了基于普及式可穿戴设备的细粒度日常日志识别,提升了场景和活动识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20407 2026-01-01 cs.SD cs.AI cs.LG 50%

AUDRON: A Deep Learning Framework with Fused Acoustic Signatures for Drone Type Recognition

AUDRON:一种融合声学特征的深度学习框架用于无人机类型识别

Rajdeep Chatterjee, Sudip Chakrabarty, Trishaani Acharjee, Deepanjali Mishra

机构 * AmygdalaAI-India Lab(AmygdalaAI-India实验室)

专题命中 融合架构与评测 :feature-level fusion(abstract)

AI总结 AUDRON通过融合多种声学特征和深度学习技术,实现高准确率的无人机声学识别,适用于安全监控等场景。

Comments Presented at the 2025 IEEE 22nd India Council International Conference (INDICON). 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23824 2026-01-01 cs.LG 50%

MS-SSM: A Multi-Scale State Space Model for Efficient Sequence Modeling

MS-SSM:一种用于高效序列建模的多尺度状态空间模型

Mahdi Karami, Ali Behrouz, Peilin Zhong, Razvan Pascanu, Vahab Mirrokni

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 MS-SSM通过多尺度状态空间模型提升序列建模效率,尤其在长程和分层任务中表现优异。

Comments In Second Conference on Language Modeling (COLM) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22102 2025-12-29 cs.LG 50%

Explainable Multimodal Regression via Information Decomposition

通过信息分解实现可解释的多模态回归

Zhaozhao Ma, Shujian Yu

机构 * Zhejiang University(浙江大学) Georgia Institute of Technology(佐治亚理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) UiT - The Arctic University of Norway(挪威北极大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出基于部分信息分解的多模态回归框架,通过分解模态特定表示为唯一、冗余和协同组件,提升预测准确性和可解释性,并在多个数据集上验证其有效性。

Comments Project Page: https://github.com/zhaozhaoma/PIDReg

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21543 2025-12-29 cs.IR 50%

CEMG: Collaborative-Enhanced Multimodal Generative Recommendation

CEMG: 基于协作增强的多模态生成推荐

Yuzhen Lin, Hongyi Chen, Xuanjing Chen, Shaowen Wang, Ivonne Xu, Dongming Jiang

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 CEMG通过多模态融合层和残差量化变分自编码器,提升多模态生成推荐的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21215 2025-12-25 eess.AS 50%

USE: A Unified Model for Universal Sound Separation and Extraction

USE: 一种统一的通用声音分离与提取模型

Hongyu Wang, Chenda Li, Xin Zhou, Shuai Wang, Yanmin Qian

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 本文提出USE模型,通过统一框架结合声音分离与目标声音提取,提升两者性能,实验显示在SS和TSE任务中分别取得1.4 dB SDR提升和86%准确率。

Comments Accepted as an oral presentation by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21105 2025-12-25 cs.HC 50%

Volatile Organic Compounds for Stress Detection: A Scoping Review and Exploratory Feasibility Study with Low-Cost Sensors

挥发性有机化合物用于压力检测:一项综述和探索可行性研究,结合低成本传感器

Nicolai Plintz, Marcus Vetter, Dirk Ifenthaler

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文通过综述和探索性研究,证明低成本传感器可捕捉压力相关的VOC模式,揭示了VOC在情绪识别中的应用潜力及实施挑战。

Comments 13 pages, 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20948 2025-12-25 cs.CL cs.SD 50%

Foundation Model-based Evaluation of Neuropsychiatric Disorders: A Lifespan-Inclusive, Multi-Modal, and Multi-Lingual Study

基于基础模型的神经精神障碍评估:一项涵盖全生命周期、多模态和多语言的研究

Zhongren Dong, Haotian Guo, Weixiang Xu, Huan Zhao, Zixing Zhang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Shenzhen Research Institute, Hunan University(湖南大学深圳研究院) Ministry of Education Key Laboratory of Fusion Computing of Supercomputing and Artificial Intelligence, Hunan University(湖南大学教育部长春计算机与人工智能融合计算重点实验室)

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 FEND提出一种多模态框架,利用多语言数据集评估神经精神障碍,揭示多模态融合在不同障碍检测中的性能差异及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18661 2025-12-23 cs.AI 50%

ASTIF: Adaptive Semantic-Temporal Integration for Cryptocurrency Price Forecasting

ASTIF:自适应语义-时间整合用于加密货币价格预测

Hafiz Saif Ur Rehman, Ling Liu, Kaleem Ullah Qasim

机构 * Southwestern University of Finance and Economics(西南财经大学) Southwest Jiaotong University(西南交通大学)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 ASTIF通过自适应元学习整合语义和时间信息,提升加密货币价格预测的准确性和鲁棒性。

Comments 33 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11065 2025-12-17 cs.HC 50%

Immutable Explainability: Fuzzy Logic and Blockchain for Verifiable Affective AI

不可变的可解释性:模糊逻辑与区块链用于可验证的情感人工智能

Marcelo Fransoy, Alejandro Hossian, Hernán Merlino

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出不可变可解释性架构,结合模糊逻辑与区块链,实现情感AI的透明决策和可信审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14078 2025-12-17 cs.LG 50%

FusAD: Time-Frequency Fusion with Adaptive Denoising for General Time Series Analysis

FusAD:基于自适应去噪的时间-频率融合用于通用时间序列分析

Da Zhang, Bingyu Li, Zhiyuan Zhao, Feiping Nie, Junyu Gao, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院,光学电子研究所(iOPEN),西北工业大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Department of Electronic Engineering and Information Science, University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 FusAD通过自适应时间-频率融合和去噪机制,提升多任务时间序列分析的效率与泛化能力。

Comments Paper has been accepted by ICDE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13396 2025-12-16 cs.IR 50%

Automated Information Flow Selection for Multi-scenario Multi-task Recommendation

多场景多任务推荐的自动化信息流选择

Chaohua Yang, Dugang Liu, Shiwei Li, Yuwen Fu, Xing Tang, Weihong Luo, Xiangyu Zhao, Xiuqiang He, Zhong Ming

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 本文提出AutoIFS框架,通过低秩适应和信息流选择网络,解决多场景多任务推荐中信息融合复杂和噪声问题,提升模型性能。

Comments 10 Pages, 6 Figures, WSDM 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07216 2025-12-09 cs.IR cs.LG 50%

MUSE: A Simple Yet Effective Multimodal Search-Based Framework for Lifelong User Interest Modeling

MUSE:一种简单而有效的基于多模态搜索的终身用户兴趣建模框架

Bin Wu, Feifan Yang, Zhangming Chan, Yu-Ran Gu, Jiawei Feng, Chao Yi, Xiang-Rong Sheng, Han Zhu, Jian Xu, Mang Ye, Bo Zheng

机构 * Wuhan University(武汉大学) Alibaba Group(阿里巴巴集团)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 MUSE通过简单有效的多模态搜索框架,实现超长用户行为序列建模,提升推荐系统指标性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06259 2025-12-09 cs.SD cs.AI cs.LG 50%

Who Will Top the Charts? Multimodal Music Popularity Prediction via Adaptive Fusion of Modality Experts and Temporal Engagement Modeling

谁会登顶排行榜?通过适应性融合模态专家和时间参与建模的多模态音乐流行度预测

Yash Choudhary, Preeti Rao, Pushpak Bhattacharyya

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 GAMENet通过融合多模态数据和时间参与建模,提升了音乐流行度预测的准确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18908 2025-12-08 eess.AS 50%

A Survey on Speech Large Language Models for Understanding

语音大语言模型理解综述

Jing Peng, Yucheng Wang, Bohan Li, Yiwei Guo, Hankun Wang, Yangui Fang, Yu Xi, Haoyu Li, Xu Li, Ke Zhang, Shuai Wang, Kai Yu

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 本文综述了语音大语言模型的理解方法,分析其架构并提出解决指令敏感性和语义推理退化问题的方向。

Comments This paper has been ACCEPTED for publication as a SPECIAL ISSUE paper in the IEEE Journal of Selected Topics in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01882 2025-12-02 cs.LG 50%

New Spiking Architecture for Multi-Modal Decision-Making in Autonomous Vehicles

多模态决策中自动驾驶车辆的新脉冲架构

Aref Ghoreishee, Abhishek Mishra, Lifeng Zhou, John Walsh, Nagarajan Kandasamy

机构 * Electrical and Computer Engineering Department(电子与计算机工程系)

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 本文提出了一种基于脉冲神经元的高效多模态决策架构,用于提升自动驾驶车辆的实时决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00563 2025-12-02 cs.SD cs.AI cs.LG 50%

Explainable Multi-Modal Deep Learning for Automatic Detection of Lung Diseases from Respiratory Audio Signals

可解释的多模态深度学习用于从呼吸音频信号自动检测肺部疾病

S M Asiful Islam Saky, Md Rashidul Islam, Md Saiful Arefin, Shahaba Alam

机构 * Albukhary International University(阿尔布胡亚国际大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本研究提出一种可解释的多模态深度学习框架,通过结合频谱-时间编码器和手工制作的声学特征编码器,利用呼吸音频信号自动检测肺部疾病,实现了高准确率和良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14209 2025-11-26 cs.AI 50%

Energy-Aware Pattern Disentanglement: A Generalizable Pattern Assisted Architecture for Multi-task Time Series Analysis

节能模式解耦:一种通用的模式辅助架构用于多任务时间序列分析

Xiangkai Ma, Xiaobin Hong, Wenzhong Li, Sanglu Lu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 Pets提出了一种通用的模式辅助架构,通过局部能量分析和波动模式融合,提升多任务时间序列分析的泛化能力和性能。

Comments We have updated the abstract, citations and related work. At the same time, we have also updated the latest baseline model

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17955 2025-11-25 cs.CL 50%

MTikGuard System: A Transformer-Based Multimodal System for Child-Safe Content Moderation on TikTok

MTikGuard系统:一种基于Transformer的多模态系统,用于TikTok上的儿童安全内容审核

Dat Thanh Nguyen, Nguyen Hung Lam, Anh Hoang-Thi Nguyen, Trong-Hop Do

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息科技大学) Faculty of Software Engineering, University of Information Technology(软件工程学院,信息科技大学) Faculty of Computer Science, University of Information Technology(计算机科学学院,信息科技大学) University of Information Technology, Ho Chi Minh City(信息科技大学,胡志明市) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 MTikGuard系统通过多模态分类框架和扩展数据集,实现TikTok儿童安全内容审核的高准确率和实时部署。

Comments Accepted at PACLIC39

详情

展开后加载摘要…

URL PDF HTML 收藏