arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2982 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 521 篇

2607.29207 2026-08-03 cs.CV 新提交 83%

Multi-Modal Object Re-Identification with Dual Semantic Guidance and Global-Local Mutual Modulation

融合双语义引导与全局-局部互调制的多模态物体重识别

Weixiang Zhou, Xingguo Xu, Yuhao Wang, Cong Wang, Yang Yang, Zhixun Su, Jinshan Pan

机构 * Dalian University of Technology(大连理工大学) University of California, San Francisco(加利福尼亚大学旧金山分校) Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文针对多模态物体重识别的语义先验利用不足与全局-局部协同缺失问题,提出含TSI、MGLM、HMF的双语义引导与全局-局部互调制框架,经多基准实验验证有效。

Comments Accepted by IEEE TCSVT 2026. The version of record may differ slightly

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28341 2026-07-31 cs.CV 新提交 83%

Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models

捕捉令牌趋势以实现多模态大语言模型中无需训练的令牌剪枝

Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) Xiamen Ocean Vocational College(厦门海洋职业技术学院) Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对多模态大语言模型现有无训练剪枝方法忽略令牌重要性动态变化的问题,提出趋势感知剪枝框架,通过捕捉注意力流动量实现动态修正,大幅减少视觉令牌且保持性能,实现高效多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26326 2026-07-30 cs.CV 新提交 83%

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

视觉还是认知?多模态大语言模型的视觉上下文敏感性

Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

机构 * University of Copenhagen(哥本哈根大学) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院) Clemson University(克莱姆森大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26023 2026-07-29 cs.AI 新提交 83%

CHARM: A Multimodal Graph Foundation Model with Hierarchical Context Modeling for Zero-Shot Transfer

CHARM:一种用于零样本迁移的具有分层上下文建模的多模态图基础模型

Ankang Yang, Jitao Zhao, Di Jin, Yuxiao Huang, Dongxiao He

机构 * School of Computer Science and Technology, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部计算机科学与技术学院) Data Science Program, Columbian College of Arts and Sciences, The George Washington University(乔治华盛顿大学文理学院哥伦比亚艺术与科学学院数据科学项目)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究多模态图零样本迁移问题,提出CHARM模型,通过分层上下文建模,用图上下文替换原始节点,减少对目标域监督或适配的依赖,经实验验证该模型在零样本多模态图任务上有改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25818 2026-07-29 cs.CV 新提交 83%

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

SepPrune:一种基于分隔符的高效多模态大语言模型剪枝框架

Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

机构 * University of Science and Technology of China(中国科学技术大学) ChangXin Memory Technologies(长鑫存储技术有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对多模态大语言模型视觉令牌计算成本高的问题,提出SepPrune剪枝方法,以模态分隔符令牌为统一查询来排序和选择视觉令牌,复用内置投影参数,无需架构更改,在Qwen2.5-VL-7B上实验取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23451 2026-07-28 cs.CV 新提交 83%

Multi-Modal Object Re-Identification with Prompt-S6 and Semantic-Aware Knowledge Guidance

基于Prompt-S6和语义感知知识引导的多模态目标重识别

Weixiang Zhou, Jiabei Zuo, Yuhao Wang, Cong Wang, Huchuan Lu, Zhixun Su

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究多模态目标重识别问题,提出基于Prompt-S6和语义感知知识引导的PRISM框架,设计语义驱动令牌剪枝和渐进融合网络两个关键组件,有效抑制背景干扰,实现三模态对齐,提升多模态目标重识别的有效性和效率。

Comments Accepted by IEEE TIP 2026. The version of record may differ slightly

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21600 2026-07-27 cs.AI 新提交 83%

Securing Multimodal AI through Internal Information Decomposition

通过内部信息分解保护多模态人工智能

Jehyeok Yeon, Hyeonjeong Ha, Qiusi Zhan, Heng Ji

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究多模态大语言模型的攻击问题,提出FlowGuard框架,通过监测内部多模态一致性检测有害输入,受部分信息分解启发得出FlowVectors量化相关指标,有效降低攻击成功率且减少效用损失和延迟,为多模态推理提供有效防御。

Comments Accepted as Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21546 2026-07-24 cs.CV 新提交 83%

UnDA: Unpaired Domain Alignment for Cross-Modal Knowledge Transfer in Medical Imaging

UnDA:用于医学成像中跨模态知识转移的无配对域对齐

Rafsan Jany, Shadab Tanjeed Ahmad, Ahsan Bulbul, Tahsinul Islam, Md Azam Hossain, Abu Raihan Mostofa Kamal

机构 * Korea Institute of Oriental Medicine(韩国韩医学研究院) Islamic University of Technology(伊斯兰科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 针对医学成像中跨模态知识转移时获取配对数据难、处理模态差距及噪声传播问题,提出UnDA框架,通过与主干无关的对齐模块、不确定性加权最优传输及每个类别的ProtoNCE目标,实现无配对跨模态蒸馏,提升目标模态分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21384 2026-07-24 cs.AI 新提交 83%

Multimodal Pretraining for Generalizable EEG Representation Learning

用于可泛化脑电信号表征学习的多模态预训练

Targol Bakhtiarvand, Jugal Kalita, Adham Atyabi

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 研究针对癫痫EEG模型应用局限问题,开发多模态EEG基础模型,结合多种编码器,通过创新预训练技术创建癫痫相关表征。在多个数据集和评估设置下实验,该模型实现强大癫痫检测与适应新场景能力,支持可解释癫痫定位,性能达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20357 2026-07-23 cs.CV 新提交 83%

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

少看,快思考:多模态大语言模型的联合令牌-计算适配

Pengcheng Wang, Zhiquan Wang, Jayoung Lee, Zhuoyan Xu, Ran Xu, Saurabh Bagchi, Yin Li, Somali Chaterji

机构 * Purdue University(普渡大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(英伟达)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 针对多模态大语言模型推理成本高的问题,提出SmartVL框架,通过视觉侧令牌控制器和LLM侧计算控制器联合控制视觉令牌数量和模型计算能力,实验证明该框架优于先前方法,实现更好的精度-效率平衡。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19086 2026-07-22 cs.CV 新提交 83%

Advancing Multimodal Fusion on Heterogeneous Medical Data with Hybrid Geometry Attention

利用混合几何注意力推进异构医学数据上的多模态融合

Joy Dhar, Manish Kumar Pandey, Nayyar Zaidi, Chen Chen, Maryam Haghighat, Ferdous Sohel, Puneet Goyal

机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔分校) RoentGen Health(伦琴健康公司) Deakin University(迪肯大学) University of Central Florida(中佛罗里达大学) Queensland University of Technology(昆士兰科技大学) Murdoch University(莫道克大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对异构医学数据多模态融合难题,提出CURE框架,通过HyFuse层及相关模块逐步整合模态,有效捕捉跨模态交互,降低计算成本,在多数据集上评估显示其性能显著提升,优于领先方法。

Comments ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14821 2026-07-17 cs.CV 新提交 83%

Blurring Modal Boundaries: A Unified Survey from Single- to Multi-Modal Person Re-ldentification

模糊模态边界:从单模态到多模态行人重识别的统一综述

Xiao Wang, Bing Wang, Bin Yang, Cuiqun Chen, Xin Xu, Mang Ye

机构 * Wuhan University of Science and Technology(武汉科技大学) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System(湖北省智能信息处理与实时工业系统重点实验室) Wuhan University(武汉大学) Anhui University(安徽大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 综述行人重识别领域从单模态向多模态发展的转变,系统回顾关键跨模态任务,研究多模态融合ReID,提出基于Transformer的可见光-红外ReID基线框架,并概述未来研究方向。

Comments 61 pages, 6 figures, journal

Journal ref International Journal of Computer Vision.2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12686 2026-07-15 cs.CL 新提交 83%

Segregate, Refine, Integrate: Decomposing Multimodal Fusion for Sentiment Analysis

分离、细化、整合:用于情感分析的多模态融合分解

Alexios Filippakopoulos, Elias Kallioras, Nikolaos Xiros, Efthymios Georgiou, Alexandros Potamianos

机构 * National Technical University of Athens(雅典国立技术大学) Athena Research Center(雅典娜研究中心) University of Bern(伯尔尼大学) Archimedes AI(阿基米德人工智能公司) Synaptic Bloom PBC(突触绽放有限责任公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 研究情感分析中的多模态融合问题,提出SeRIn方案,通过分离特定模态与跨模态路径,各自细化演变,将跨模态交互推迟到预测步骤,在CH - SIMS和CMU - MOSEI上取得领先成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12418 2026-07-15 cs.CV 新提交 83%

MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning

MQAdapter:用于从粗到细的视觉语言模型微调的多模态量子适配器

Yumiao Zhao, Bo Jiang, Min Lu, Xiao Wang, Jin Tang

机构 * Anhui University(安徽大学) Origin Quantum Computing Company Limited(本源量子计算有限公司)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对视觉语言模型在少样本学习中细粒度区分不足的问题,提出多模态量子适配器MQAdapter。先检索Top-K候选类别作语义锚点,再用跨模态量子学习机制,利用量子特性建模高阶交互,细化视觉特征,参数高效且能集成现有算法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12293 2026-07-15 cs.CV 新提交 83%

Adaptive Cross-Modal Fusion with Sparse Attention for Pedestrian Crossing Intention Prediction

基于稀疏注意力的自适应跨模态融合用于行人过街意图预测

Md Mahfuzur Rahman, Pengzhan Zhou, A F M Abdun Noor, Md Imam Ahasan, Kah Ong Michael Goh, S. M. Hasan Mahmud, Md Mustafizur Rahman, Kaixin Gao

机构 * Faculty of Information Science & Technology, Multimedia University(信息科学与技术学院,马来西亚多媒体大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 研究针对自动驾驶中行人过街意图预测问题,提出ADAPT多模态框架,通过五个模块联合建模视觉和运动信息,实验证明该方法优于现有技术,在准确率和实时性上取得平衡,为智能交通等应用提供有效方案。

Comments 17 pages, 5 figures, 4 tables. Under review at PeerJ Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11170 2026-07-14 cs.CV 新提交 83%

TC-MAF: Train-Calibrated Bounded Multi-Evidence Fusion for Multimodal Industrial Anomaly Detection

TC-MAF:用于多模态工业异常检测的训练校准有界多证据融合

Ming Deng, Sijin Sun, Xiaochuan Hu, Xing Wu

机构 * Shanghai University(上海大学) National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究多模态工业异常检测问题,提出TC-MAF方法,通过固定像素级融合公式结合多模态检测器等,利用轻量级TDC项缩放辅助参与度,在MVTec-3D上取得优异检测和定位结果,消融实验揭示关键因素及校准增益。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23964 2026-07-13 cs.LG cs.CV q-bio.QM 新提交 83%

3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy

3D掩码自编码器是显微镜体积和多模态细胞表示的鲁棒学习器

Amirhossein Kardoost, Lion Gleiter, Tingying Peng, Carsten Marr

机构 * Institute of AI for Health & Helmholtz AI, Computational Health Center, Helmholtz Munich – German Research Center for Environmental Health(亥姆霍兹慕尼黑中心 - 德国环境健康研究中心,计算健康中心,健康人工智能研究所与亥姆霍兹人工智能) Department of Medicine III, Ludwig-Maximilian-University Hospital(路德维希-马克西米利安大学医院第三内科) Department of Physics, Ludwig-Maximilian-University(路德维希-马克西米利安大学物理系) German Cancer Consortium (DKTK), partner site Munich(德国癌症联盟(DKTK)慕尼黑合作站点) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 系统比较2D和3D掩码自编码器在体积显微镜数据上的表现,发现3D模型在下游任务中更优,并通过跨模态对齐和频域正则化进一步提升性能,在蛋白质相互作用和定位任务上达到最先进水平。

Comments Code is available at: https://github.com/marrlab/mae3d-opencell

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08573 2026-07-10 cs.AI 新提交 83%

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

用于情感和情绪识别的SHAP加权跨模态专家融合:证据与局限

Adis Alihodzic, Selma Skopljakovic Hubljar

机构 * Faculty of Science, University of Sarajevo(萨拉热窝大学理学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 研究多模态情感和情绪识别,重新审视XAI引导的自适应融合\xgaf,分析专家特征维度不等时SHAP归因减少的影响,通过实验对比不同融合方法在情感识别任务中的表现,揭示SHAP减少、专家维度和跨模态专家设计对模块化多模态融合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07438 2026-07-09 cs.CV 新提交 83%

Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment

用于动作质量评估的具有自适应对齐的两阶段多模态融合

Kanglei Zhou, Ruizhi Cai, Xinning Wang, Yijian Zheng, Liyuan Wang, Jianguo Li, Xiaohui Liang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Children’s Hospital, Capital Institute of Pediatrics(首都儿科研究所附属儿童医院) Zhongguancun Laboratory(中关村实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究动作质量评估问题,提出两阶段多模态融合框架DualAlign,通过自适应对齐解决跨模态错位等挑战,引入MM-JDM数据集,实验表明该框架在多模态评估中表现出色,相比现有方法有显著提升且在特定条件下稳健。

Comments Accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25542 2026-07-09 cs.CV 新提交 83%

SAC$^2$-Net: Semantic Anchoring and Complementary-Consensus Fusion for Multimodal Micro-Expression Recognition

SAC$^2$-Net:面向多模态微表情识别的语义锚定与互补共识融合

Xuepeng Zheng, Tong Chen, Chaoping Gui, Yingjuan Jia, Hanpu Wang, Yuhao Shan

机构 * College of Electronic and Information Engineering, Southwest University(西南大学电子信息工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对微表情识别中光流与运动放大模态的不对称失效问题,提出SAC$^2$-Net,通过语义锚定软对齐减少跨模态异质性,并设计互补共识融合机制实现可靠性感知融合,在五个基准上取得最优或竞争力强的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05906 2026-07-08 cs.CV 新提交 83%

GaussFusion: Towards Multimodal 3D Gaussian Pretraining

高斯融合:迈向多模态3D高斯预训练

Zhixuan You, Jihua Zhu, Yiding Sun, Zihao Guo, Haozhe Cheng, Dongxu Zhang, Lin Chen, Hainan Luo

机构 * Wuhu HIT Robot Technology Research Institute Co., Ltd.(芜湖哈工大机器人技术研究院有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究提出GaussFusion多模态3D高斯预训练框架,通过跨模态语义对齐集成图像和文本监督,还提出高斯显著性引导的多尺度空洞掩码,实验表明该方法提高了高斯表示可迁移性,在ModelNet40和ScanObjectNN上有性能提升。

Comments 32 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02930 2026-07-07 cs.CV 新提交 83%

CL-Anomaly: Layer-Adaptive Mixture-of-Experts with Multimodal Large Language Model for Continual Learning in Anomaly Detection

CL-Anomaly:用于异常检测中持续学习的具有多模态大语言模型的层自适应专家混合模型

Wen Dong, Zhao Wang, Shuangqing Zhang, Kai Sun, Ben Li, Guo-Sen Xie, Caifeng Shan, Fang Zhao

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对多模态大语言模型持续学习计算昂贵及现有方法语义纠缠问题,提出CL-Anomaly框架,用隔离共享协作实现参数高效微调,介绍任务私有专家PrivLoRA等,实验表明其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02091 2026-07-03 cs.CV 新提交 83%

Multimodal Fusion for Fine-Grained Classification of Breast Fibroadenoma and Phyllodes Tumors

乳腺纤维腺瘤与叶状肿瘤细粒度分类的多模态融合

Chuxi Nan, Di Wu, Hongming Guo, Ning Cao, Xiaohui Zhu, Zhaoting Shi, Jiawei Li

机构 * School of Integrated Circuits, Wuxi Vocational College of Science and Technology(集成电路学院,无锡科学技术职业技术学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(先进科技学院,西安交通大学利物浦大学) Shanghai Gem Science and Technology Co., Ltd.(上海 gems 科技有限公司) Department of Oncology, Shanghai Medical College, Fudan University(肿瘤科,复旦大学上海医学院) Department of Medical Ultrasound, Fudan University Shanghai Cancer Center(医学超声科,复旦大学上海癌症中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对B超下乳腺纤维腺瘤和叶状肿瘤高度重叠导致误诊的问题,构建FAPT-M多模态数据集,提出临床引导的多模态框架,集成视觉、文本和临床特征,通过自适应调制、跨模态Transformer和双路径表示学习,实现细粒度分类,准确率77.64%,AUC 89.74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31135 2026-07-01 cs.CV cs.LG 新提交 83%

MSNN-LINet: Cross-Modal Learning via Continuous Linear Integration

MSNN-LINet:通过连续线性集成进行跨模态学习

Gabriel Clinger

机构 * The George Washington University(乔治华盛顿大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 提出线性集成网络LINet,通过连续线性集成卷积操作实现RGB-D场景分类中的逐层跨模态学习,解决多模态融合的结构性妥协问题,并在SUN RGB-D数据集上取得领先结果。

Comments 14 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22077 2026-06-23 cs.CV 新提交 83%

Morphology-Aware Multimodal Representation Learning for Insect Phylogenetic Reconstruction

形态感知的多模态表示学习用于昆虫系统发育重建

Zixuan Liu, Kaijie Yu, Chun He, Xiaoxu Cai, Xinhai Ye, Haishuai Wang, Gongyin Ye, Jiajun Bu

机构 * Rural Development Academy, Zhejiang University(浙江大学农村发展学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出形态感知多模态对齐框架,结合标本图像与形态描述,通过视觉Transformer微调和对比学习对齐图像-文本,学习连续性状用于贝叶斯系统发育重建,在Rove-Tree-11数据集上提升拓扑一致性。

Comments 7 pages, 5 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21446 2026-06-23 cs.CV 新提交 83%

Synergistic Dual-Branch Adaptation for Multi-modal Generalized Category Discovery

协同双分支自适应多模态广义类别发现

Yuxun Qu, Minyu Zhou, Yongqiang Tang, Chenyang Zhang, Wensheng Zhang

机构 * College of Computer Science, Nankai University(南开大学计算机学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出协同双分支自适应框架,通过跨模态协同适配器和邻域互学习模块,增强多模态广义类别发现中的细粒度关系监督,在六个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20044 2026-06-19 cs.CV 新提交 83%

FUSE: Frequency-domain Unification and Spectral Energy Alignment for Multi-modal Object Re-Identification

FUSE:面向多模态目标重识别的频域统一与频谱能量对齐

Xuanhao Qi, Tom H. Luan, Yukang Zhang, Jinkai Zheng, Zhou Su, Shuwei Li, Lei Tan

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学网络空间安全学院) School of Informatics, Xiamen University(厦门大学信息学院) National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出频域框架FUSE,通过频谱解耦和能量对齐两阶段处理,解决多模态重识别中低频偏置问题,在三个数据集上mAP提升9.1%。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16615 2026-06-19 cs.CV 新提交 83%

SUP-MCRL: Subject-aware Unified Pseudo-feature Coded Multimodal Contrastive Representation Learning for EEG Visual Decoding

SUP-MCRL:面向EEG视觉解码的感知主体统一伪特征编码多模态对比表示学习

Shengyu Gong, Weiming Zeng, Yueyang Li, Zijian Kang, Hongjie Yan, Wai Ting Siok, Nizhuan Wang

机构 * Lab of Digital Image and Intelligent Computation, Shanghai Maritime University(上海海事大学数字图像与智能计算实验室) Department of Language Science and Technology, The Hong Kong Polytechnic University(香港理工大学语言科学与技术系) Affiliated Lianyungang Hospital of Xuzhou Medical University(徐州医科大学附属连云港医院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出SUP-MCRL框架,通过语义感知视觉编码器、统一EEG增强器和原型渐进增强器,解决多模态对比学习中语义一致性和主体选择性问题,在THINGS-EEG零样本任务上达到66.0%/91.9%的Top-1/Top-5准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16354 2026-06-16 cs.CV 新提交 83%

GraphBEV++: Multi-Modal Feature Alignment for Autonomous Driving

GraphBEV++: 自动驾驶中的多模态特征对齐

Ziying Song, Caiyan Jia, Lin Liu, Shaoqing Xu, Lei Yang, Yadan Luo

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院,交通数据挖掘与具身智能北京市重点实验室) School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) University of Macau(澳门大学) Nanyang Technological University(南洋理工大学) The University of Queensland(昆士兰大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对自动驾驶中BEV感知的特征未对齐问题,提出GraphBEV++框架,通过局部对齐(LocalAlign-v2)和全局对齐(GlobalAlign-v2)模块,利用图匹配、可变形偏移和扩散去噪方法,在多种基准上实现最优性能。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15038 2026-06-16 cs.AI 新提交 83%

Fusion is not one-size-fits-all: Cross-Modal Representation Alignment for Time-to-Event Modeling

融合并非一刀切:用于时间-事件建模的跨模态表示对齐

Zhemin Zhang, Weijie Chen, David Le, Amara Tariq, Alex Wallace, Matthew Stib, Juan Maria Farina, Chadi Ayoub, Reza Arsanjani, Imon Banerjee

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 针对多模态临床数据中的模态不平衡和分布偏移问题,提出一种基于基础模型的跨模态对齐框架,通过四种融合策略在CT影像和纵向EHR数据间进行表示对齐,在肺栓塞死亡率和心血管疾病结局预测任务上验证了融合的有效性,并首次系统分析了时间-事件预测中的模态不平衡对融合行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏