arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2982 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 521 篇

2606.24165 2026-06-24 cs.CV 新提交 85%

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

多模态大语言模型中基于谱演化引导的令牌剪枝

Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) The University of Queensland(昆士兰大学) Singapore Management University(新加坡管理大学) The University of Southern Queensland(南昆士兰大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.CV

AI总结 提出跨层谱演化(CLSE)框架,通过频域分析令牌表示在Transformer层间的演化来评估重要性,实现无训练剪枝,在保持性能的同时减少计算开销。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20641 2026-06-23 cs.RO cs.AI cs.LG 新提交 85%

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning

MAGNIFIED: 多模态大语言模型的强化学习微调用于运动规划

Letian Chen, Yiren Lu, Justin Fu, Yichen Xie, Runsheng Xu, Jyh-Jing Hwang, Ben Sapp, Drago Anguelov

机构 * Waymo LLC(Waymo有限责任公司)

专题命中 多模态训练与对齐 :multimodal(title);MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.AI

AI总结 提出MAGNIFIED方法,通过强化学习微调多模态大语言模型,利用令牌级奖励优化规划目标,在Waymo数据集上显著降低重叠率和偏离道路率。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14700 2026-06-15 cs.CV 新提交 85%

RepFusion: Leveraging Multimodal Priors for Denoising in Representation Space

RepFusion:利用多模态先验在表示空间中进行去噪

Xichen Pan, Aashu Singh, Satya Narayan Shukla, Xiangjun Fan, Shlok Kumar Mishra, Saining Xie

机构 * Meta AI New York University(纽约大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出RepFusion方法,利用多模态大语言模型作为噪声表示编码器,为扩散变压器提供条件信号,在相似推理预算下优于新初始化解码器基线。

Comments Project Page: https://xichenpan.com/repfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10504 2026-06-10 cs.AI 新提交 85%

Cross-Modal Knowledge Distillation without Paired Data: Theoretical Foundation and Algorithm

无配对数据的跨模态知识蒸馏:理论基础与算法

Trong Khiem Tran, Anh Duc Chu, Quang Hung Pham, Phi Le Nguyen, Trong Nghia Hoang

机构 * School of Information and Communications Technology, Hanoi University of Science and Technology, Hanoi, Vietnam(信息与通信技术学院,河内科学技术大学,越南河内) School of Electrical Engineering and Computer Science, Washington State University, Pullman, US(电气工程与计算机科学学院,华盛顿州立大学,华盛顿州普尔曼)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 提出无配对数据下的跨模态知识蒸馏框架,通过特征对齐和标签对齐两种分布对齐机制,实现跨模态知识迁移,理论保证且实验效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01473 2026-08-04 cs.CV cs.CL cs.LG 新提交 85%

Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

Slot2Text:面向高效且空间可追溯的手术多模态大语言模型的以对象为中心的视觉分词

Guiqiu Liao, Matjaz Jogan, Daniel A. Hashimoto

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 Slot2Text将视觉输入转为槽潜变量,推出双模式手术MLLM,在多基准上实现高效推理,Slot2Text-Fast大幅降本,Slot2Text-Reason支持可追溯空间推理。

Comments 17 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09270 2026-08-11 cs.CV cs.AI cs.IR cs.MM 新提交 85%

GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views

GRASP:面向无人机视角细粒度跨模态理解的粒度感知区域对齐与语义原型学习

Jiahui Cui, Yan Zhao, Kan Wei, Enze Zhu, Peirong Zhang, Lei Wang, Yiru Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 针对无人机视角细粒度跨模态理解的背景杂波干扰与视觉同构歧义问题,提出GRASP框架,通过RFA和SPEM策略提升性能,在相关基准数据集上验证了有效性。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM Multimedia 2026, MM '26). 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07279 2026-08-10 eess.SP 新提交 85%

Token Communication for Multimodal Large Language Model

多模态大语言模型的令牌通信

Jingkai Ying, Zhijin Qin, Yuan Shen, Khaled B. Letaief

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本文针对多模态大语言模型(MLLMs)的令牌传输问题,提出适配MLLMs的令牌通信框架,通过集成神经编解码器、两阶段语义对齐训练及自适应适配器,在相同传输数据量下实现更优任务性能。

Comments 13 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04054 2026-08-06 cs.MM cs.AI cs.CL cs.LG 新提交 85%

Modality Agreement- and Conflict-Aware Prototype Hypergraph Learning for Multimodal Intent Understanding

面向多模态意图理解的模态一致与冲突感知原型超图学习

Mohnish Raj, Suraj Kumar, Soumi Chattopadhayay, Chandranath Adak, Ayan Dutta

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 针对多模态意图理解中分歧信息被多数融合方法忽略的问题,提出MACH框架,通过分层一致与冲突原型超图及自适应仲裁机制,在基准数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03475 2026-08-05 cs.MM cs.AI cs.CL 新提交 85%

Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition

用于鲁棒多模态意图识别的自适应模态可靠性诊断与恢复

Suraj Kumar, Mohnish Raj, Soumi Chattopadhayay, Chandranath Adak, Ayan Dutta

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 提出PRIME闭环可靠性引导框架,通过诊断恢复多模态意图识别的不可靠模态,在保持干净数据性能的同时提升了多模态数据各类退化场景下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14309 2026-08-17 cs.CV q-bio.TO 新提交 84%

Spatial Message Passing in Language Space for Pathology Image Interpretation

面向病理图像解读的语言空间空间消息传递

Jing-Cheng Yang, Hao-Jung Wang, Jinhao Du, Yang Hu, Ming-shan Tsai, Jens Rittscher, Bin Li

机构 * National Taiwan University(台湾大学) University of Oxford(牛津大学) ZYTCA Limited(ZYTCA有限公司)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出SLMP框架,在语言空间对病理图像执行空间推理,无需微调MLLM,提升肿瘤描述准确率,缩小通用与病理专用MLLM的性能差距。

Comments Accepted at MICCAI 2026 Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11838 2026-08-13 cs.CV 新提交 84%

GeoBridge: Decoupled Semantic Conditioning for Generative Image Geolocalization

GeoBridge:用于生成式图像地理定位的解耦语义条件机制

Zhiyang Dou, Xumeng Han, Fengde Peng, Zipeng Wang, Moxuan Zhao, Zhipei Huang, Zhenjun Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences(先进交叉科学学院) School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 GeoBridge是一种解耦语义条件机制,通过连接冻结语义MLLM与黎曼流匹配头,在IM2GPS3K数据集上25/200/750公里阈值下准确率达38.67/52.89/70.37,提升了生成式图像地理定位性能,属解码侧算法贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07193 2026-08-10 cs.LG cs.CV 新提交 84%

An AI4AI Framework for Visual Token Pruning

用于视觉令牌剪枝的AI4AI框架

Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24538 2026-06-25 cs.CV 新提交 84%

ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization

ForensicsTok: 面向图像篡改定位的法医引导分词建模

Lei Xu, Haowei Wang, Shen Chen, Taiping Yao, Bin Li, Changsheng Chen

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen MSU-BIT University(深圳北理莫斯科大学)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multi-modal(abstract);分类 cs.CV

AI总结 提出ForensicsTok,将图像篡改定位重构为自回归序列生成任务,通过Token Splatting解码器和分层专家融合模块,直接生成空间定位的令牌序列,避免中间监督,在六个基准上超越现有MLLM方法并略优于强法医基线。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15614 2026-08-18 cs.CV cs.AI 新提交 84%

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

EgoGazeLite:面向 token 高效多模态大语言模型视频输入的设备内自我中心注视预测

Matteo Stoiber, Niels Buus Lassen

机构 * Copenhagen Business School(哥本哈根商学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 EgoGazeLite 是轻量双进程注视预测器,可在消费级硬件上实时运行,无需眼动追踪硬件即可实现 token 高效的自我中心视频理解,性能与真实注视裁剪无显著差异。

Comments 16 pages. Accepted at the WearableAI Workshop, ECCV 2026 (Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07385 2026-08-10 cs.LG cs.AI eess.AS eess.SP stat.ML 新提交 84%

Omni-modal decomposition autoencoders learn full-stack wearable disentangled representations

全模态分解自编码器学习全栈可穿戴解耦表示

Ioannis Ziogas, Ensieh Khazaei, Bilal Taha, Aamna Al Shehhi, Ahsan H. Khandoker, Leontios J. Hadjileontiadis, Dimitrios Hatzinakos

机构 * Khalifa University(哈利法大学) University of Toronto(多伦多大学) MIT Media Lab(麻省理工学院媒体实验室) Aristotle University of Thessaloniki(亚里士多德大学)

专题命中 多模态训练与对齐 :omni-modal(title,abstract);multi-modal(abstract);分类 cs.AI、eess.AS

AI总结 该研究针对现有多模态可穿戴模型的不足,提出OmniDecVAEs框架,在30模态的HAR任务中,提升了识别准确率与数据合成质量,可用于边缘可穿戴与医疗领域。

Comments 15 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04010 2026-08-05 cs.CV cs.CL 新提交 84%

ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

ParVL:面向多模态大语言模型的并行缩放与可扩展计算分配

Yang Yang, Qinyu Zhao, Mouxiang Chen, Xiaohui Li, Lixin Gu, Wenhai Wang, Hongjie Zhang, Wenwei Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL

AI总结 本研究针对多模态大语言模型的计算分配僵化问题,提出ParVL框架,通过复用骨干参数扩展并行计算,在13B token上微调后,其多模态性能优于同配置单分支基线,且最优分配随任务变化。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23493 2026-07-28 cs.CV cs.AI 新提交 84%

Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation

用于多模态情感解释的令牌-区域引导交叉注意力融合

Musa Tur Farazi, Nufayer Jahan Reza

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对孟加拉语模因政治意图检测难题,引入多模态交叉注意力融合框架,利用视觉语言模型提取文本,经跨模态多头注意力机制合成特征,还整合政治词汇表,实验表明该方法显著优于基线,Macro-F1达0.94,有效实现文本语义基于视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22013 2026-07-27 cs.CV cs.AI 新提交 84%

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

用于多模态思维链推理的视觉显著性引导蒸馏

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态思维链推理在小模型中存在的问题,提出视觉显著性引导蒸馏方法,利用多模态大语言模型注意力图生成扰动图像,经奇异值分解提取引导向量指导层间蒸馏,实验证明该方法能改进推理生成和答案推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16260 2026-07-21 cs.LG cs.AI cs.CV 新提交 84%

AdaSurvMamba: Dynamic Fusion and Semantic Scanning for Multimodal Survival Analysis

AdaSurvMamba:用于多模态生存分析的动态融合与语义扫描

Jialong Zhong, Tingwei Liu, Baokun Yue, Jingjing Li, Yongri Piao, Miao Zhang, Leiye Liu, Jiahong Jiang, Wei Ji, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of Alberta(阿尔伯塔大学) Yale University(耶鲁大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态生存分析中传统方法的局限,提出AdaSurvMamba框架,含DSIR模块动态调制跨模态交互强度、SAS模块重组令牌成连续序列,实验证明该框架在五个TCGA队列上比现有方法有优势。

Comments MICCAI 2026 Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12678 2026-07-15 cs.CV cs.AI 新提交 84%

Text-Aided Multi-Modal Panoptic Symbol Spotting for CAD Floor Plan Drawings

用于CAD平面图的文本辅助多模态全景符号识别

Yan Gong, Bohao Li, Bowen Du, Junchen Ye

机构 * CCSE Lab, Beihang University(北京航空航天大学CCSE实验室) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对CAD平面图全景符号识别中现有方法未充分利用文本注释的问题,提出多模态框架TextCAD,设计TACE编码注释语义,引入语义层次对齐框架,实验表明该方法有效提升符号识别性能并达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05978 2026-07-08 cs.CV cs.AI 新提交 84%

Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention

提出并关注:通过多令牌局部注意力实现无训练的多模态大语言模型接地置信度

Daniel Shalam, Emanuel Ben Baruch, Avi Ben Cohen, Tal Remez

机构 * Amazon(亚马逊)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型接地置信度问题,提出无训练的多令牌局部注意力(MTLA)方法,通过在声称区域内求和并跨预测令牌聚合恢复更强接地信号,在多模型家族和模态中提升了幻觉AUROC及零样本检测AP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02593 2026-07-07 cs.CV cs.CL 新提交 84%

Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation

多模态大语言模型知识蒸馏的令牌级响应视觉注意力引导

Jaehyun Jang, Eunseop Yoon, Hee Suk Yoon, SooHwan Eom, Mark A. Hasegawa-Johnson, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL

AI总结 研究多模态大语言模型知识蒸馏,挑战传统依赖,发现下游性能与响应视觉注意力相似度强相关。提出令牌级响应视觉注意力引导方法,通过自适应加权散度,有效引导学生模型,实验证明其性能优于基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11854 2026-06-11 cs.LG cs.AI cs.CL 新提交 84%

Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

使用ART微调多模态大语言模型:基于艺术的强化训练

Michal Chudoba, Sergey Alyaev, Petra Galuscakova, Tomasz Wiktorski

机构 * University of Stavanger(斯塔万格大学) NORCE Research(NORCE研究机构)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 提出ART方法,通过优化原始视觉输入将信息注入冻结的多模态大语言模型,实现软提示微调,无需修改计算图,在数学和工具使用基准上达到与LoRA相当的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17475 2026-08-19 cs.CV 新提交 83%

S$^3$AM: A Single-Stream SAM with Reliability-Calibrated Frequency Adapter for Multi-modal Salient Object Detection

S³AM:一种用于多模态显著目标检测的、具备可靠性校准频率适配器的单流SAM

Ruichao Hou, Boyue Xu, Tongwei Ren, Dongming Zhou, Gangshan Wu, Jinde Cao

机构 * China Pharmaceutical University(中国药科大学) Nanjing University(南京大学) Yunnan University(云南大学) Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 该研究针对多模态显著目标检测的冗余计算问题,提出融合可靠性校准频率适配器的单流SAM框架,仅用12.20M参数即实现竞争力性能,相关代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14152 2026-08-17 cs.AI 新提交 83%

Towards Efficient Multimodal and Multilingual Opinion Extraction for STI: A QLoRA-Based Fine-Tuning Approach

面向科技情报(STI)的高效多模态多语言观点抽取:一种基于QLoRA的微调方法

Sheng Hong, Xuanqi Wang, Jiacheng Wang, Yuwei Wang

机构 * Beihang University(北京航空航天大学) Nanchang University(南昌大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本研究针对科技情报观点抽取的噪声过滤与结构化输出问题,提出基于QLoRA微调的多模态框架,在2194样本数据集上实现多语言观点抽取性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13973 2026-08-17 cs.CV 新提交 83%

Rethinking Auxiliary Modalities in Multimodal Zero-shot Anomaly Detection: From Semantic Fusion to Conditional Modulation

重新思考多模态零样本异常检测中的辅助模态:从语义融合到条件调制

Peng Wu, Xin Ge, Yujia Sun, Guansong Pang

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 本研究针对现有多模态零样本异常检测方法的缺陷,提出即插即用的辅助条件增强框架,通过全局到局部的条件调制实现选择性多模态增强,在MVTec 3D-AD等数据集上提升了现有RGB零样本异常检测器的性能并达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13385 2026-08-14 cs.CV 新提交 83%

When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL

何时仅需任务向量?隐式多模态上下文学习的经验理论

Jiaqian Li

机构 * Brown University(布朗大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出选择-实现假说,通过受控多模态任务和VQA基准研究发现,静态任务向量的成功取决于演示诱导变化的跨查询共享程度,为隐式多模态上下文学习的方法选择提供了统一经验理论。

Comments Accepted by Empirical Theory in Representation Learning @ ECCV 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11685 2026-08-13 cs.CV 新提交 83%

EGM-Det: Entropy-Guided Multimodal Adaptive Fusion for UAV RGB-IR Object Detection

EGM-Det:面向无人机RGB-IR目标检测的熵引导多模态自适应融合

Cunzheng Fan, Dawei Yan, Guanlin Wang, Xingshuo Yang, Yupeng Jia, Jing Yang, Haokui Zhang

机构 * School of Cybersecurity, Northwestern Polytechnical University(西北工业大学网络空间安全学院) School of Automation and Software Engineering, Shanxi University(山西大学自动化与软件学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出EGM-Det框架,通过熵引导多模态自适应融合解决无人机RGB-IR目标检测中模态可靠性被忽略的问题,在三个数据集上实现最优性能,VEDAI上较现有方法提升超10个百分点。

Comments 14 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00043 2026-08-04 eess.SP cs.AI 新提交 83%

Multimodal Wearable-Based Olfactory-Induced Emotion Recognition in Arousal-Valence Dimensions

基于多模态可穿戴设备的嗅觉诱导唤醒-效价维度情感识别

Chen-Yang Xu, Lan Zhang, Fei-Yi Fan, Bin Hu, Qing-Hao Meng

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对现有嗅觉情感研究的维度失衡与多模态数据不足问题,构建多模态嗅觉情感数据集,提出STF-HFNet模型,在两个数据集上取得最优情感识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01437 2026-08-04 cs.AI 新提交 83%

Beyond Routing Saturation: A Long-Horizon Class-Incremental Perspective on Expert Routing in Multimodal Continual Instruction Tuning

超越路由饱和:多模态持续指令调优中专家路由的长程类增量视角

Huiyu Yi, Yongqi Xu, Bogang Zhang, Dunwei Tu, Xu Zhiming, Zhen-Hao Xie, Baile Xu, Furao Shen

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对多模态持续指令调优中专家路由的任务识别问题,构建含34个任务的FLEX基准,提出MCIL框架,适配CIL方法后使LoRA匹配和MacroScore分别提升最高16.3个百分点、4.6个点

详情

展开后加载摘要…

URL PDF HTML 收藏