arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6856 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6856 篇

2601.14776 2026-07-15 cs.CV 版本更新 83%

M2I2HA: Multi-modal Object Detection Based on Intra- and Inter-Modal Hypergraph Attention

M2I2HA:基于模态内和模态间超图注意力的多模态目标检测

Xiaofan Yang, Yubin Liu, Wei Pan, Guoqing Chu, Junming Zhang, Jie Zhao, Zhuoqi Man, Xuanming Cao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对多模态目标检测中模态内和模态间信息提取及跨模态对齐的挑战,提出基于超图理论的M2I2HA网络,通过多个模块实现多模态特征的有效处理,在多模态目标检测任务中取得了最优性能。

Comments 43 pages, 13 figures, The theoretical derivation was refined, some data was updated, and experiments were added

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18089 2026-07-15 cs.CV 版本更新 83%

Together, Then Apart: Balancing Alignment and Distinctiveness for Multimodal Survival Analysis

在一起,然后分开:平衡多模态生存分析中的对齐与独特性

Wenjing Liu, Qin Ren, Wen Zhang, Yuewei Lin, Chenyu You

机构 * Stony Brook University(石溪大学) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学) Brookhaven National Laboratory(布鲁赫林国家实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对多模态生存分析,提出TTA框架,先基于原型对齐捕获跨模态共享结构,再通过锚定引导对比目标鼓励模态特定独特性,用不平衡最优传输处理模态不平衡和噪声对应,在多个癌症队列上评估,提升了生存预测并揭示可解释模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11170 2026-07-14 cs.CV 新提交 83%

TC-MAF: Train-Calibrated Bounded Multi-Evidence Fusion for Multimodal Industrial Anomaly Detection

TC-MAF:用于多模态工业异常检测的训练校准有界多证据融合

Ming Deng, Sijin Sun, Xiaochuan Hu, Xing Wu

机构 * Shanghai University(上海大学) National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究多模态工业异常检测问题,提出TC-MAF方法,通过固定像素级融合公式结合多模态检测器等,利用轻量级TDC项缩放辅助参与度,在MVTec-3D上取得优异检测和定位结果,消融实验揭示关键因素及校准增益。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23964 2026-07-13 cs.LG cs.CV q-bio.QM 新提交 83%

3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy

3D掩码自编码器是显微镜体积和多模态细胞表示的鲁棒学习器

Amirhossein Kardoost, Lion Gleiter, Tingying Peng, Carsten Marr

机构 * Institute of AI for Health & Helmholtz AI, Computational Health Center, Helmholtz Munich – German Research Center for Environmental Health(亥姆霍兹慕尼黑中心 - 德国环境健康研究中心,计算健康中心,健康人工智能研究所与亥姆霍兹人工智能) Department of Medicine III, Ludwig-Maximilian-University Hospital(路德维希-马克西米利安大学医院第三内科) Department of Physics, Ludwig-Maximilian-University(路德维希-马克西米利安大学物理系) German Cancer Consortium (DKTK), partner site Munich(德国癌症联盟(DKTK)慕尼黑合作站点) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 系统比较2D和3D掩码自编码器在体积显微镜数据上的表现,发现3D模型在下游任务中更优,并通过跨模态对齐和频域正则化进一步提升性能,在蛋白质相互作用和定位任务上达到最先进水平。

Comments Code is available at: https://github.com/marrlab/mae3d-opencell

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08573 2026-07-10 cs.AI 新提交 83%

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

用于情感和情绪识别的SHAP加权跨模态专家融合:证据与局限

Adis Alihodzic, Selma Skopljakovic Hubljar

机构 * Faculty of Science, University of Sarajevo(萨拉热窝大学理学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 研究多模态情感和情绪识别,重新审视XAI引导的自适应融合\xgaf,分析专家特征维度不等时SHAP归因减少的影响,通过实验对比不同融合方法在情感识别任务中的表现,揭示SHAP减少、专家维度和跨模态专家设计对模块化多模态融合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07438 2026-07-09 cs.CV 新提交 83%

Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment

用于动作质量评估的具有自适应对齐的两阶段多模态融合

Kanglei Zhou, Ruizhi Cai, Xinning Wang, Yijian Zheng, Liyuan Wang, Jianguo Li, Xiaohui Liang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Children’s Hospital, Capital Institute of Pediatrics(首都儿科研究所附属儿童医院) Zhongguancun Laboratory(中关村实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究动作质量评估问题,提出两阶段多模态融合框架DualAlign,通过自适应对齐解决跨模态错位等挑战,引入MM-JDM数据集,实验表明该框架在多模态评估中表现出色,相比现有方法有显著提升且在特定条件下稳健。

Comments Accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25542 2026-07-09 cs.CV 新提交 83%

SAC$^2$-Net: Semantic Anchoring and Complementary-Consensus Fusion for Multimodal Micro-Expression Recognition

SAC$^2$-Net:面向多模态微表情识别的语义锚定与互补共识融合

Xuepeng Zheng, Tong Chen, Chaoping Gui, Yingjuan Jia, Hanpu Wang, Yuhao Shan

机构 * College of Electronic and Information Engineering, Southwest University(西南大学电子信息工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对微表情识别中光流与运动放大模态的不对称失效问题,提出SAC$^2$-Net,通过语义锚定软对齐减少跨模态异质性,并设计互补共识融合机制实现可靠性感知融合,在五个基准上取得最优或竞争力强的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05906 2026-07-08 cs.CV 新提交 83%

GaussFusion: Towards Multimodal 3D Gaussian Pretraining

高斯融合:迈向多模态3D高斯预训练

Zhixuan You, Jihua Zhu, Yiding Sun, Zihao Guo, Haozhe Cheng, Dongxu Zhang, Lin Chen, Hainan Luo

机构 * Wuhu HIT Robot Technology Research Institute Co., Ltd.(芜湖哈工大机器人技术研究院有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究提出GaussFusion多模态3D高斯预训练框架,通过跨模态语义对齐集成图像和文本监督,还提出高斯显著性引导的多尺度空洞掩码,实验表明该方法提高了高斯表示可迁移性,在ModelNet40和ScanObjectNN上有性能提升。

Comments 32 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02930 2026-07-07 cs.CV 新提交 83%

CL-Anomaly: Layer-Adaptive Mixture-of-Experts with Multimodal Large Language Model for Continual Learning in Anomaly Detection

CL-Anomaly:用于异常检测中持续学习的具有多模态大语言模型的层自适应专家混合模型

Wen Dong, Zhao Wang, Shuangqing Zhang, Kai Sun, Ben Li, Guo-Sen Xie, Caifeng Shan, Fang Zhao

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对多模态大语言模型持续学习计算昂贵及现有方法语义纠缠问题,提出CL-Anomaly框架,用隔离共享协作实现参数高效微调,介绍任务私有专家PrivLoRA等,实验表明其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02091 2026-07-03 cs.CV 新提交 83%

Multimodal Fusion for Fine-Grained Classification of Breast Fibroadenoma and Phyllodes Tumors

乳腺纤维腺瘤与叶状肿瘤细粒度分类的多模态融合

Chuxi Nan, Di Wu, Hongming Guo, Ning Cao, Xiaohui Zhu, Zhaoting Shi, Jiawei Li

机构 * School of Integrated Circuits, Wuxi Vocational College of Science and Technology(集成电路学院,无锡科学技术职业技术学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(先进科技学院,西安交通大学利物浦大学) Shanghai Gem Science and Technology Co., Ltd.(上海 gems 科技有限公司) Department of Oncology, Shanghai Medical College, Fudan University(肿瘤科,复旦大学上海医学院) Department of Medical Ultrasound, Fudan University Shanghai Cancer Center(医学超声科,复旦大学上海癌症中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对B超下乳腺纤维腺瘤和叶状肿瘤高度重叠导致误诊的问题,构建FAPT-M多模态数据集,提出临床引导的多模态框架,集成视觉、文本和临床特征,通过自适应调制、跨模态Transformer和双路径表示学习,实现细粒度分类,准确率77.64%,AUC 89.74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31135 2026-07-01 cs.CV cs.LG 新提交 83%

MSNN-LINet: Cross-Modal Learning via Continuous Linear Integration

MSNN-LINet:通过连续线性集成进行跨模态学习

Gabriel Clinger

机构 * The George Washington University(乔治华盛顿大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 提出线性集成网络LINet,通过连续线性集成卷积操作实现RGB-D场景分类中的逐层跨模态学习,解决多模态融合的结构性妥协问题,并在SUN RGB-D数据集上取得领先结果。

Comments 14 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30244 2026-06-30 cs.CV 83%

Semantic-Driven Scale and Spatial Selection for Efficient Cross-Modal Alignment in Referring Remote Sensing Image Segmentation

语义驱动的尺度与空间选择实现指代遥感图像分割中的高效跨模态对齐

Kun Li, Shengxi Gui, Francesco Nex, Michael Ying Yang

机构 * University of Liverpool, UK(利物浦大学) University of Michigan, USA(密歇根大学) University of Twente, NL(埃因霍温理工大学) University of Bath, UK(巴斯大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出S4ECA框架,通过参数高效微调的双编码器适配器架构,利用语言引导的尺度与空间选择机制实现跨模态对齐,仅更新2.4%骨干参数即在RRSIS-D和RefSegRS数据集上达到最优性能。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02948 2026-06-30 cs.CV 83%

CrossWeaver: Cross-modal Weaving for Arbitrary-Modality Semantic Segmentation

CrossWeaver:跨模态编织用于任意模态语义分割

Zelin Zhang, Kedi Li, Huiqi Liang, Chuanzhi Xu, Tao Zhang, Weidong Cai

机构 * The University of Sydney(悉尼大学) University of Technology Sydney(悉尼科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出CrossWeaver框架,通过Modality Interaction Block和Seam-Aligned Fusion模块实现高效跨模态融合,在多模态语义分割中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13326 2026-06-30 cs.LG cs.AI 83%

Feature-level Interaction Explanations in Multimodal Transformers

多模态Transformer中的特征级交互解释

Yeji Kim, Housam Khalifa Bashier Babiker, Mi-Young Kim, Randy Goebel

机构 * University of Alberta(阿尔伯塔大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出FL-I2MoE,通过特征级分离独特、协同和冗余证据,提升多模态模型的可解释性,实验表明其在三个基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01588 2026-06-29 cs.LG cs.AI 版本更新 83%

Spectral Text Fusion: A Frequency-Aware Approach to Multimodal Time-Series Forecasting

频谱文本融合:一种频率感知的多模态时间序列预测方法

Huu Hiep Nguyen, Minh Hoang Nguyen, Dung Nguyen, Hung Le

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划) Deakin University(迪金大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 提出SpecTF框架,通过频谱分解将文本信息与时间序列在频域融合,利用轻量级交叉注意力机制自适应重加权频带,显著提升多模态时间序列预测性能。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22077 2026-06-23 cs.CV 新提交 83%

Morphology-Aware Multimodal Representation Learning for Insect Phylogenetic Reconstruction

形态感知的多模态表示学习用于昆虫系统发育重建

Zixuan Liu, Kaijie Yu, Chun He, Xiaoxu Cai, Xinhai Ye, Haishuai Wang, Gongyin Ye, Jiajun Bu

机构 * Rural Development Academy, Zhejiang University(浙江大学农村发展学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出形态感知多模态对齐框架,结合标本图像与形态描述,通过视觉Transformer微调和对比学习对齐图像-文本,学习连续性状用于贝叶斯系统发育重建,在Rove-Tree-11数据集上提升拓扑一致性。

Comments 7 pages, 5 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21446 2026-06-23 cs.CV 新提交 83%

Synergistic Dual-Branch Adaptation for Multi-modal Generalized Category Discovery

协同双分支自适应多模态广义类别发现

Yuxun Qu, Minyu Zhou, Yongqiang Tang, Chenyang Zhang, Wensheng Zhang

机构 * College of Computer Science, Nankai University(南开大学计算机学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出协同双分支自适应框架,通过跨模态协同适配器和邻域互学习模块,增强多模态广义类别发现中的细粒度关系监督,在六个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20044 2026-06-19 cs.CV 新提交 83%

FUSE: Frequency-domain Unification and Spectral Energy Alignment for Multi-modal Object Re-Identification

FUSE:面向多模态目标重识别的频域统一与频谱能量对齐

Xuanhao Qi, Tom H. Luan, Yukang Zhang, Jinkai Zheng, Zhou Su, Shuwei Li, Lei Tan

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学网络空间安全学院) School of Informatics, Xiamen University(厦门大学信息学院) National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出频域框架FUSE,通过频谱解耦和能量对齐两阶段处理,解决多模态重识别中低频偏置问题,在三个数据集上mAP提升9.1%。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16615 2026-06-19 cs.CV 新提交 83%

SUP-MCRL: Subject-aware Unified Pseudo-feature Coded Multimodal Contrastive Representation Learning for EEG Visual Decoding

SUP-MCRL:面向EEG视觉解码的感知主体统一伪特征编码多模态对比表示学习

Shengyu Gong, Weiming Zeng, Yueyang Li, Zijian Kang, Hongjie Yan, Wai Ting Siok, Nizhuan Wang

机构 * Lab of Digital Image and Intelligent Computation, Shanghai Maritime University(上海海事大学数字图像与智能计算实验室) Department of Language Science and Technology, The Hong Kong Polytechnic University(香港理工大学语言科学与技术系) Affiliated Lianyungang Hospital of Xuzhou Medical University(徐州医科大学附属连云港医院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出SUP-MCRL框架,通过语义感知视觉编码器、统一EEG增强器和原型渐进增强器,解决多模态对比学习中语义一致性和主体选择性问题,在THINGS-EEG零样本任务上达到66.0%/91.9%的Top-1/Top-5准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05527 2026-06-18 cs.CV 版本更新 83%

Prior-guided Fusion of Multimodal Features for Change Detection from Optical-SAR Images

先验引导的多模态特征融合用于光学-SAR图像变化检测

Xuanguang Liu, Lei Ding, Yujie Li, Chenguang Dai, Zhenchao Zhang, Mengmeng Li, Ziyi Yang, Yifan Sun, Yongqi Sun, Hanyun Wang, Lorenzo Bruzzone

机构 * Institute of Geospatial Information, Information Engineering University(地理信息研究所,信息工程大学) Academy of Digital China (Fujian), Fuzhou University(数字中国研究院(福建),福州大学) The School of Electronics and Communication Engineering, Sun Yat-sen University(电子与通信工程学院,中山大学) The Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出STSF-Net框架,联合建模模态特定和时空共同特征,并利用视觉基础模型的语义先验自适应融合多模态特征,在三个数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16354 2026-06-16 cs.CV 新提交 83%

GraphBEV++: Multi-Modal Feature Alignment for Autonomous Driving

GraphBEV++: 自动驾驶中的多模态特征对齐

Ziying Song, Caiyan Jia, Lin Liu, Shaoqing Xu, Lei Yang, Yadan Luo

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院,交通数据挖掘与具身智能北京市重点实验室) School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) University of Macau(澳门大学) Nanyang Technological University(南洋理工大学) The University of Queensland(昆士兰大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对自动驾驶中BEV感知的特征未对齐问题,提出GraphBEV++框架,通过局部对齐(LocalAlign-v2)和全局对齐(GlobalAlign-v2)模块,利用图匹配、可变形偏移和扩散去噪方法,在多种基准上实现最优性能。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15038 2026-06-16 cs.AI 新提交 83%

Fusion is not one-size-fits-all: Cross-Modal Representation Alignment for Time-to-Event Modeling

融合并非一刀切:用于时间-事件建模的跨模态表示对齐

Zhemin Zhang, Weijie Chen, David Le, Amara Tariq, Alex Wallace, Matthew Stib, Juan Maria Farina, Chadi Ayoub, Reza Arsanjani, Imon Banerjee

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 针对多模态临床数据中的模态不平衡和分布偏移问题,提出一种基于基础模型的跨模态对齐框架,通过四种融合策略在CT影像和纵向EHR数据间进行表示对齐,在肺栓塞死亡率和心血管疾病结局预测任务上验证了融合的有效性,并首次系统分析了时间-事件预测中的模态不平衡对融合行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15796 2026-06-16 cs.CV 版本更新 83%

Cross-Modal Registration Between 3D and 2D Fingerprints via Pose-Aware Unwrapping and Point-Cloud Fusion

通过姿态感知解缠和点云融合实现3D与2D指纹的跨模态注册

Xiongjun Guan, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出统一框架,实现3D指纹预处理与跨接触式和非接触式2D指纹的注册,结合非参数可视化解缠、点云融合、姿态归一化和姿态感知注册策略,提升3D与2D指纹兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14172 2026-06-15 cs.LG cs.CV 新提交 83%

Context-aware Modality-Topology Co-Alignment for Multimodal Attributed Graphs

上下文感知的模态-拓扑协同对齐用于多模态属性图

Sirui Zhang, Xu Wang, Zhengyu Wu, Xunkai Li, Hongchao Qin

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出CoMAG框架,通过任务自适应可靠上下文学习和模态保持的跳令牌对齐,统一处理图任务和模态任务,在保持稀疏边线性复杂度的同时提升结构预测、跨模态匹配和图条件生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13030 2026-06-12 cs.CV 新提交 83%

A Multi-Modal Framework with Cross-Subject Pseudo-Labeling and Semantic Alignment for Micro-Gesture Recognition

一种结合跨主体伪标签与语义对齐的多模态微手势识别框架

Haoran Zhang, Haokun Zhang, Pengyu Liu, Yujia Zhang, Weibao Xue, Yanbin Hao

机构 * School of Computer Science and Information Engineering, Hefei University of Technology (HFUT)(合肥工业大学计算机科学与信息工程学院) School of Computer Science, University of Auckland (UOA)(奥克兰大学计算机科学学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对微手势识别中低信噪比、长尾分布和跨主体域偏移问题,提出多模态框架,通过显著性引导提取、平方根平滑加权、正交语义嵌入损失和跨模态伪标签策略,实现有效识别,F1分数达68.13%。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11107 2026-06-11 eess.IV cs.CV cs.LG 版本更新 83%

Multimodal Brain Tumour Classification Using Feature Fusion

使用特征融合的多模态脑肿瘤分类

Wajih ul Islam, Muhammad Yaqoob, Javed Ali Khan, Volker Steuber

机构 * School of Physics, Engineering and Computer Science(物理、工程与计算机科学学院) University of Hertfordshire(赫特福德郡大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出双分支多模态网络,融合MRI图像与91个放射组学特征,通过门控融合实现脑肿瘤分类,准确率达96.13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08906 2026-06-09 cs.CV 新提交 83%

DifferSeg: Towards Diverse Multimodal Binary Segmentation via Differential Perception and Frequency Guidance

DifferSeg: 通过差分感知与频率引导实现多样化的多模态二值分割

Qiangqiang Zhou, Jiawei Xu, Yong Chen, Dandan Zhu, Yugen Yi, Xiaoqi Zhao

机构 * School of Artificial Intelligence, Jiangxi Normal University(江西师范大学人工智能学院) Institute of AI Education, East China Normal University(华东师范大学人工智能教育研究所) Yale School of Medicine, Yale University(耶鲁大学医学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出DifferSeg框架,通过差分感知融合模块自适应对齐多模态特征,并设计频率引导解码器平衡高低频表示,在29个公开数据集上超越67种方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08035 2026-06-09 cs.CV 新提交 83%

DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning

DyCo-RL: 用于视觉推理的动态跨模态协调

Hangui Lin, Yan Shu, Zhengyang Liang, Chi Liu, Xiangrui Liu, Minghao Qin, Teng Long, Zheng Liu, Nicu Sebe

机构 * University of Trento(特伦托大学) BAAI(北京智源人工智能研究院) Singapore Management University(新加坡管理大学) IQuest Research

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出DyCo-RL,通过Fisher-Rao测地距离量化模态内注意力转移,实现动态跨模态协调,并利用对齐引导的优势重加权优化策略,提升多模态大模型在视觉推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17446 2026-06-09 cs.LG cs.AI 版本更新 83%

MVCL-DAF++: Enhancing Multimodal Intent Recognition via Prototype-Aware Contrastive Alignment and Coarse-to-Fine Dynamic Attention Fusion

MVCL-DAF++: 通过原型感知对比对齐和由粗到细动态注意力融合增强多模态意图识别

Haofeng Huang, Yifei Han, Long Zhang, Bin Li, Yangfan He, Yaxin Xue

机构 * University of Shanghai for Science and TechnologyChina(上海科学技术大学中国) Shenzhen Institute of Advanced Technology, Chinese Academy of SciencesChina(深圳先进技术研究院,中国科学院中国) University of Minnesota-Twin Cities, USA(明尼苏达大学双城分校,美国) University of LeedsUK(利兹大学,英国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出MVCL-DAF++,通过原型感知对比对齐和由粗到细注意力融合,在MIntRec和MIntRec2.0上提升多模态意图识别,尤其改善稀有类识别。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27343 2026-06-05 cs.CV 83%

JI-ADF: Joint-Individual Learning with Adaptive Decision Fusion for Multimodal Skin Lesion Classification

JI-ADF:联合-个体学习与自适应决策融合用于多模态皮肤病变分类

Phan Nguyen, Dat Cao, Hien Kha, Hien Chu, Minh Le, Trang Pham, Nguyen Quoc Khanh Le

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出JI-ADF框架,通过整合皮肤镜图像、临床照片和结构化患者数据,实现基于临床的皮肤病变分类,采用多模态表示学习和自适应决策融合机制,提升跨模态推理能力,并在MILK10k数据集上验证了其在实际临床场景中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏