arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6856 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6856 篇

2603.03710 2026-06-29 cs.CV cs.AI 版本更新 84%

MPFlow: Multi-modal Posterior-Guided Flow Matching for Zero-Shot MRI Reconstruction

MPFlow: 多模态后验引导的流匹配用于零样本MRI重建

Seunghoi Kim, Chen Jin, Henry F. J. Tregidgo, Matteo Figini, Daniel C. Alexander

机构 * 1 Hawkes Institute, UCL \, 2 Dept. of Medical Physics Biomedical Engineering, UCL 3 Dept. of Computer Science, UCL 4 Centre for AI, DS\&AI, AstraZeneca, UK

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出MPFlow框架,利用自监督预训练PAMRI学习跨模态共享表示,在推理时通过数据一致性和特征对齐引导采样,减少幻觉并提升零样本MRI重建效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14001 2026-06-24 cs.CV cs.AI cs.LG 版本更新 84%

MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment

MOCHA: 多模态对象感知的跨架构对齐

Elena Camuffo, Francesco Barbato, Mete Ozay, Simone Milani, Umberto Michieli

机构 * University of Padova(帕多瓦大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出MOCHA蒸馏框架,将冻结VLM教师的多模态区域知识迁移至轻量视觉检测器,通过双重损失实现局部对齐与全局关系一致性,在少样本个性化检测中平均提升10.1%。

Comments 18 pages main paper, 10 pages supplementary material

Journal ref Proceedings of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06652 2026-06-12 cs.CV cs.AI 版本更新 84%

PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment

PaLMR: 通过多模态过程对齐实现忠实视觉推理

Yantao Li, Qiang Hui, Chenyang Yan, Kanzhi Cheng, Fang Zhao, Chao Tan, Huanling Gao, Jianbing Zhang, Kai Wang, Xinyu Dai, Shiguo Lian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Data Science & Artificial Intelligence Research Institute, China Unicom(中国unicom数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国unicom数据智能)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出PaLMR框架,通过感知对齐数据层和过程对齐优化层,减少推理幻觉并提升视觉推理忠实度,在多个基准上取得最优结果。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11854 2026-06-11 cs.LG cs.AI cs.CL 新提交 84%

Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

使用ART微调多模态大语言模型:基于艺术的强化训练

Michal Chudoba, Sergey Alyaev, Petra Galuscakova, Tomasz Wiktorski

机构 * University of Stavanger(斯塔万格大学) NORCE Research(NORCE研究机构)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 提出ART方法,通过优化原始视觉输入将信息注入冻结的多模态大语言模型,实现软提示微调,无需修改计算图,在数学和工具使用基准上达到与LoRA相当的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02679 2026-06-03 cs.LG cs.MM cs.SD eess.AS 84%

Before Fusion, Ask What to Keep: Contextual Calibration of Multimodal Signals

融合之前,先问保留什么:多模态信号的上下文校准

Jiyuan Liu, Liangwei Nathan Zheng, Wei Emma Zhang, Xinpei Wang, Weitong Chen

机构 * Adelaide University(阿德莱德大学) Shandong University(山东大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM、eess.AS

AI总结 提出一种紧凑的校准模块,在融合前对各模态特征进行实例级和维度级调制,抑制不可靠成分并增强上下文支持信号,提升多模态任务性能。

Comments 11 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01282 2026-06-03 cs.CV cs.AI 84%

Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model Enhancement

Align-KD:为移动视觉语言模型增强提取跨模态对齐知识

Qianhan Feng, Wenshuo Li, Tong Lin, Xinghao Chen

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University, China(通用人工智能国家重点实验室,智能科学与技术学院,北京大学,中国) Huawei Noah’s Ark Lab, China(华为诺亚方舟实验室,中国)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出Align-KD方法,通过蒸馏教师模型浅层跨模态对齐知识,指导1.7B学生模型学习视觉-文本匹配,在6个基准上平均提升2.0分。

Comments CVPR 2025 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00170 2026-06-02 cs.HC cs.AI cs.CV 84%

UF-AMA: A unified framework for cross-domain emotion recognition via adaptive multimodal alignment

UF-AMA: 通过自适应多模态对齐的跨域情感识别统一框架

Zheng Wang, Shuo Wang, Junhong Wang

机构 * Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Department of Electronic Engineering and Information Science, University of Science and Technology of China(中国科学技术大学电子工程与信息科学系) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种统一框架UF-AMA,利用自适应多模态对齐和置信度感知筛选机制,解决跨主体和跨会话的生理信号情感识别中的分布偏移问题,在SEED和SEED-IV数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30968 2026-06-01 cs.CV cs.AI 84%

Variational Adapter for Cross-modal Similarity Representation

变分适配器用于跨模态相似性表示

WenZhang Wei, Zhipeng Gui, Dehua Peng, Tiandi Ye, Huayi Wu

机构 * School of Remote Sensing and Information Engineering(遥感与信息工程学院) Wuhan University(武汉大学) School of Data Science and Engineering(数据科学与工程学院) East China Normal University(华东师范大学) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(测绘遥感信息工程国家重点实验室)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 针对跨模态匹配中细粒度标注稀缺导致二元分类边界压缩和假负样本问题,提出变分适配器VACSR,将匹配任务重构为变分推断问题,通过构建潜在相似性空间和正则化缓解过拟合,在图像-文本检索、域泛化和基类到新类泛化任务上验证了有效性。

Comments Accepted by the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16834 2026-05-19 cs.CV cs.AI cs.LG 84%

Learning Relative Representations for Fine-Grained Multimodal Alignment with Limited Data

基于有限数据的细粒度多模态对齐的相对表示学习

Shiwon Kim, Yu Rang Park

机构 * Yonsei University(延世大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于相对表示的学习方法,用于在有限数据条件下实现细粒度多模态对齐,通过学习token级别的跨模态结构来提升零样本分类、跨模态检索和零样本分割任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14710 2026-05-15 cs.CV cs.AI 84%

Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke

基于视觉核心的对比学习用于脑卒中平衡多模态预后预测

Liren Chen, Lidong Sun, Mingyan Huang, Junzhe Tang, Yinghui Zhu, Guanjie Wang, Yiqing Xia, Ting Xiao

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出三模态融合模型,通过大语言模型生成半结构化诊断文本并设计VDAFM模块,提升多模态融合鲁棒性,实现脑卒中预后预测的高精度。

Comments Corresponding author: Ting Xiao

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12034 2026-05-13 cs.CV cs.LG cs.MM 84%

Calibrated Multimodal Representation Learning with Missing Modalities

校准的多模态表示学习与缺失模态

Xiaohao Liu, Xiaobo Xia, Jiaheng Wei, Shuo Yang, Xiu Su, See-Kiong Ng, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Central South University(中南大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CalMRL,通过校准缺失模态导致的不完整对齐问题,从锚点偏移角度提供理论见解,结合先验知识和模态间联系,解决优化难题,验证了方法的有效性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09899 2026-05-12 cs.CV cs.AI 84%

Hyperbolic Distillation: Geometry-Guided Cross-Modal Transfer for Robust 3D Object Detection

双曲蒸馏:几何引导的跨模态迁移用于稳健的3D物体检测

Kanglin Ning, Wenrui Li, Houde Quan, Qifan Li, Xingtao Wang, Xiaopeng Fan

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Suzhou Research Institute of HIT(哈尔滨工业大学苏州研究院) PengChengLab(鹏城实验室)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HGC-Det方法,通过双曲约束跨模态蒸馏提升3D物体检测的鲁棒性,结合图像分支和点云分支,利用双曲几何特性缓解语义损失,实验表明在多个数据集上平衡了检测精度与计算成本。

Comments Current version has been subbmitted to IEEE Transactions on Multimedia. Now, this manuscript's status is Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12890 2026-04-28 cs.CV cs.AI 84%

Towards Long-horizon Agentic Multimodal Search

面向长视界代理多模态搜索

Yifan Du, Zikang Liu, Jinbiao Peng, Jie Wu, Junyi Li, Jinyang Li, Wayne Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 polled 智能学院) City University of Hong Kong(香港城市大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LMM-Searcher框架,通过文件化视觉表示和定制化图像加载工具,解决长视界多模态搜索中的信息管理与成本问题,实验证明其在长视界基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00829 2026-04-28 cs.CV cs.CL 84%

LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation

LinguDistill: 通过选择性跨模态蒸馏恢复视觉语言模型中的语言能力

Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar, Alham Fikri Aji, Yova Kementchedjhieva

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出LinguDistill方法,通过利用冻结的原始语言模型作为教师,选择性蒸馏语言信号以恢复语言能力,同时保持视觉基础,提升了语言和知识基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14218 2026-04-17 cs.CL cs.AI 84%

MEME-Fusion@CHiPSAL 2026: Multimodal Ablation Study of Hate Detection and Sentiment Analysis on Nepali Memes

MEME-Fusion@CHiPSAL 2026: 多模态消融研究:尼泊尔表情包中的仇恨检测与情感分析

Samir Wagle, Reewaj Khanal, Abiral Adhikari

机构 * Department of Computer Science and Engineering, Kathmandu University(加德满都大学计算机科学与工程系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文针对尼泊尔表情包中的仇恨检测与情感分析,提出融合CLIP与BGE-M3的多模态注意力融合架构,通过消融研究发现英文中心视觉模型在尼泊尔语 script 上表现不佳,且数据稀缺时传统集成方法效果下降。

Comments PrePrint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12502 2026-04-15 cs.CV cs.AI 84%

SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker

SEATrack: 简单、高效且自适应的多模态跟踪器

Junbin Su, Ziteng Xue, Shihui Zhang, Kun Chen, Weiming Hu, Zhipeng Zhang

机构 * School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) School of Software, Beihang University(北航软件学院) Hebei Key Laboratory of Computer Virtual Technology and System Integration(河北省计算机虚拟技术与系统集成重点实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), CASIA(多模态人工智能系统国家重点实验室(MAIS),CASIA) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院自动化实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SEATrack通过跨模态对齐和层次混合专家机制,在RGB-T、RGB-D和RGB-E跟踪任务中实现性能与效率的平衡。

Comments Accepted as a CVPR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09585 2026-04-14 cs.HC cs.AI cs.CV 84%

Evaluating Visual Prompts with Eye-Tracking Data for MLLM-Based Human Activity Recognition

基于眼动数据的视觉提示在基于多模态LLM的人类活动识别中的评估

Jae Young Choi, Seon Gyeom Kim, Hyungjun Yoon, Taeckyung Lee, Donggun Lee, Jaeryung Chung, Jihyung Kil, Ryan Rossi, Sung-Ju Lee, Tak Yeon Lee

机构 * KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过眼动数据可视化方法提升多模态LLM处理高频传感器数据的效率,验证了视觉提示在人类活动识别中的有效性与扩展性。

Comments 6 pages. Conditionally accepted to IEEE PacificVis 2026 (VisNotes track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02123 2026-04-14 cs.AI cs.CV 84%

Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy

Nano-EmoX:从感知到共情的多模态情感智能统一框架

Jiahao Huang, Fengyan Lin, Xuechao Yang, Chen Feng, Kexin Zhu, Xu Yang, Zhide Chen

机构 * Fujian Normal University(福建师范大学) RMIT University(皇家墨尔本理工大学) Minjiang University(闽江学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);omni-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Nano-EmoX,通过认知启发的三级架构整合感知、理解与交互层面的情感任务,首次实现六项核心情感任务的统一建模,展现高效且强大的泛化能力。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08333 2026-04-10 cs.CV cs.AI cs.LG 84%

Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification

迷失在喧嚣中:揭示并剖析医学多模态大语言模型在图像分类中的性能退化

Xun Zhu, Fanbin Mo, Xi Chen, Kaili Zheng, Shaoshuai Yang, Yiming Shi, Jian Gao, Miao Li, Ji Wu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了医学多模态大语言模型在图像分类中的性能退化问题,通过实验和特征探查揭示了四个失败模式,并提出了量化评分用于评估特征演变的健康状况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-04-08 cs.CL cs.CV 84%

From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02816 2026-04-06 cs.CV cs.AI 84%

QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models

QAPruner: 量化感知的多模态大语言模型视觉标记剪枝

Xinhao Wang, Zhonyu Xia, Zhiwei Lin, Zhe Li, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出QAPruner框架,通过结合量化误差模拟与异常强度指标,实现多模态大语言模型的视觉标记剪枝与后训练量化联合优化,提升低比特下的推理精度。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21331 2026-04-06 cs.CV cs.AI 84%

The More, the Merrier: Contrastive Fusion for Higher-Order Multimodal Alignment

更多更好:用于高阶多模态对齐的对比融合

Stefanos Koutoupis, Michaela Areti Zervou, Konstantinos Kontras, Maarten De Vos, Panagiotis Tsakalides, Grigorios Tsagkatakis

机构 * Foundation for Research and Technology-Hellas(希腊研究与技术基金会) University of Crete(克里特大学) KU Leuven(鲁汶大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出对比融合框架,通过联合嵌入个体模态及其融合组合,捕捉高阶依赖关系,提升多模态对齐效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00234 2026-04-02 cs.CL cs.AI 84%

OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

OmniFusion: 通过模块融合实现多语言多模态翻译

Sai Koneru, Matthias Huck, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) SAP SE(SAP公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OmniFusion系统,通过融合预训练多模态基础模型与翻译LLM,实现语音、语音加图像及文本加图像的多语言多模态翻译,降低SimulST延迟并提升翻译质量。

Comments Revised submission in review for ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26052 2026-03-30 cs.CV cs.AI 84%

Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification

像素与词语之间的桥梁:面向多模态媒体验证的掩码感知局部语义融合

Zizhao Chen, Ping Wei, Ziyang Ren, Huan Li, Xiangru Yin

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MaLSF框架,通过主动双向验证和层次语义聚合模块,解决多模态虚假信息检测中的局部语义不一致问题,实现像素与词语的语义连接。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24109 2026-03-26 eess.IV cs.AI cs.CV 84%

Comparative analysis of dual-form networks for live land monitoring using multi-modal satellite image time series

多模态卫星图像时间序列用于实时土地监测的双形式网络比较分析

Iris Dumeur, Jérémy Anger, Gabriele Facciolo

机构 * 1 Kayrros SAS 2 Universit\'e Paris-Saclay, ENS Paris-Saclay, CNRS, Centre Borelli, 91190, Gif-sur-Yvette, France 3 Institut Universitaire de France

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了双形式注意力机制以提升多模态SITS分析效率,通过并行训练支持递归推理,针对时间不规则性和不一致性的挑战,提出基于实际获取日期计算token距离的方法,实验表明双形式机制在性能和效率上优于标准Transformer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23272 2026-03-25 cs.CV cs.MM 84%

Multi-Modal Image Fusion via Intervention-Stable Feature Learning

多模态图像融合 via 干预稳定的特征学习

Xue Wang, Zheng Guan, Wenhua Qian, Chengchao Wang, Runzhuo Ma

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Artificial Intelligence, Nanyang Normal University(南阳师范学院人工智能学院) Department of Electrical and Electronic Engineering, Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于因果原则的干预框架,通过三种干预策略探索模态关系,设计因果特征整合器捕捉稳健的模态依赖而非虚假关联。

Comments Accpted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21100 2026-03-24 cs.CV cs.AI 84%

Learning Progressive Adaptation for Multi-Modal Tracking

多模态跟踪的渐进适应学习

He Wang, Tianyang Xu, Zhangyong Tang, Xiao-Jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey大学视觉、语音和信号处理中心)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PATrack方法,通过引入模态依赖、模态交织和任务级适配器,解决多模态跟踪中预训练RGB模型适应问题,提升跨模态交互和预测头的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19807 2026-03-23 cs.CV cs.AI 84%

Enhancing Alignment for Unified Multimodal Models via Semantically-Grounded Supervision

通过语义引导监督增强统一多模态模型的对齐

Jiyeong Kim, Yerim So, Hyesong Choi, Uiwon Hwang, Dongbo Min

机构 * Ewha Womans University(成均馆大学) Soongsil University(顺天大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Semantically-Grounded Supervision方法,通过构建视觉接地图和语义引导的破坏输入,解决统一多模态模型中的粒度不匹配和监督冗余问题,提升生成质量和跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11656 2026-03-17 cs.CV cs.AI cs.RO 84%

SToRM: Supervised Token Reduction for Multi-modal LLMs toward efficient end-to-end autonomous driving

SToRM:面向高效端到端自动驾驶的多模态大语言模型监督令牌缩减

Seo Hyun Kim, Jin Bok Park, Do Yeon Koo, Hogun Park, Il Yong Chun

专题命中 多模态训练与对齐 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SToRM框架,通过监督令牌缩减方法在保持性能的同时降低计算成本,实现实时端到端自动驾驶。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11644 2026-03-13 cs.CV cs.AI 84%

IDRL: An Individual-Aware Multimodal Depression-Related Representation Learning Framework for Depression Diagnosis

IDRL: 一种面向抑郁症诊断的个体感知多模态抑郁症相关表示学习框架

Chongxiao Wang, Junjie Liang, Peng Cao, Jinzhu Yang, Osmar R. Zaiane

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Key Laboratory of Intelligent Computing in Medical Image of Ministry of Education, Northeastern University, Shenyang, China(教育部医学图像智能计算重点实验室) National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Shenyang, China(工业智能与系统优化国家级前沿科学中心) Alberta Machine Intelligence Institute, University of Alberta, Edmonton, Canada(阿尔伯塔机器智能研究所,阿尔伯塔大学,加拿大爱德蒙顿)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 IDRL框架通过分解多模态表示并引入个体感知的模态融合模块,提升抑郁症诊断的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏