arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6856 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6856 篇

2208.07589 2023-05-23 cs.LG cs.CL cs.CV cs.MM 85%

Efficient Multimodal Transformer with Dual-Level Feature Restoration for Robust Multimodal Sentiment Analysis

Licai Sun, Zheng Lian, Bin Liu, Jianhua Tao

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

Comments Accepted by TAC. The code is available at https://github.com/sunlicai/EMT-DLFR

Journal ref IEEE Transactions on Affective Computing, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03344 2023-01-10 cs.CL cs.AI cs.CV 85%

Universal Multimodal Representation for Language Understanding

Zhuosheng Zhang, Kehai Chen, Rui Wang, Masao Utiyama, Eiichiro Sumita, Zuchao Li, Hai Zhao

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06044 2022-10-13 cs.CV cs.AI cs.CL 85%

Multi-Granularity Cross-modal Alignment for Generalized Medical Visual Representation Learning

Fuying Wang, Yuyin Zhou, Shujun Wang, Varut Vardhanabhuti, Lequan Yu

专题命中 多模态训练与对齐 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.02385 2022-03-07 cs.CL cs.AI cs.MM 85%

MM-DFN: Multimodal Dynamic Fusion Network for Emotion Recognition in Conversations

Dou Hu, Xiaolong Hou, Lingwei Wei, Lianxin Jiang, Yang Mo

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

Comments Accepted by ICASSP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.02813 2020-12-08 cs.LG cs.AI cs.CL cs.CV 85%

Cross-Modal Generalization: Learning in Low Resource Modalities via Meta-Alignment

Paul Pu Liang, Peter Wu, Liu Ziyin, Louis-Philippe Morency, Ruslan Salakhutdinov

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.05186 2019-11-14 cs.CV cs.CL cs.LG cs.SD eess.AS stat.ML 85%

TCT: A Cross-supervised Learning Method for Multimodal Sequence Representation

Wubo Li, Wei Zou, Xiangang Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS

Comments submitted to ICASSP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19212 2025-09-24 cs.CL cs.AI 84%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

Comments A lightweight and model-agnostic decoding framework that dynamically adjusts token generation based on multimodal context

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18619 2024-12-31 cs.CL cs.AI cs.CV cs.LG cs.MM eess.AS 84%

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Liang Chen, Zekun Wang, Shuhuai Ren, Lei Li, Haozhe Zhao, Yunshui Li, Zefan Cai, Hongcheng Guo, Lei Zhang, Yizhe Xiong, Yichi Zhang, Ruoyu Wu, Qingxiu Dong, Ge Zhang, Jian Yang, Lingwei Meng, Shujie Hu, Yulong Chen, Junyang Lin, Shuai Bai, Andreas Vlachos, Xu Tan, Minjia Zhang, Wen Xiao, Aaron Yee, Tianyu Liu, Baobao Chang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments 69 papes, 18 figures, repo at https://github.com/LMM101/Awesome-Multimodal-Next-Token-Prediction

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.07848 2020-12-11 cs.CV cs.LG cs.MM 84%

Modality to Modality Translation: An Adversarial Representation Learning and Graph Fusion Network for Multimodal Fusion

Sijie Mai, Haifeng Hu, Songlong Xing

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by AAAI-2020; code is available at: https://github.com/TmacMai/ARGF_multimodal_fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14309 2026-08-17 cs.CV q-bio.TO 新提交 84%

Spatial Message Passing in Language Space for Pathology Image Interpretation

面向病理图像解读的语言空间空间消息传递

Jing-Cheng Yang, Hao-Jung Wang, Jinhao Du, Yang Hu, Ming-shan Tsai, Jens Rittscher, Bin Li

机构 * National Taiwan University(台湾大学) University of Oxford(牛津大学) ZYTCA Limited(ZYTCA有限公司)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出SLMP框架,在语言空间对病理图像执行空间推理,无需微调MLLM,提升肿瘤描述准确率,缩小通用与病理专用MLLM的性能差距。

Comments Accepted at MICCAI 2026 Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11838 2026-08-13 cs.CV 新提交 84%

GeoBridge: Decoupled Semantic Conditioning for Generative Image Geolocalization

GeoBridge:用于生成式图像地理定位的解耦语义条件机制

Zhiyang Dou, Xumeng Han, Fengde Peng, Zipeng Wang, Moxuan Zhao, Zhipei Huang, Zhenjun Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences(先进交叉科学学院) School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 GeoBridge是一种解耦语义条件机制,通过连接冻结语义MLLM与黎曼流匹配头,在IM2GPS3K数据集上25/200/750公里阈值下准确率达38.67/52.89/70.37,提升了生成式图像地理定位性能,属解码侧算法贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07193 2026-08-10 cs.LG cs.CV 新提交 84%

An AI4AI Framework for Visual Token Pruning

用于视觉令牌剪枝的AI4AI框架

Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24538 2026-06-25 cs.CV 新提交 84%

ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization

ForensicsTok: 面向图像篡改定位的法医引导分词建模

Lei Xu, Haowei Wang, Shen Chen, Taiping Yao, Bin Li, Changsheng Chen

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen MSU-BIT University(深圳北理莫斯科大学)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multi-modal(abstract);分类 cs.CV

AI总结 提出ForensicsTok,将图像篡改定位重构为自回归序列生成任务,通过Token Splatting解码器和分层专家融合模块,直接生成空间定位的令牌序列,避免中间监督,在六个基准上超越现有MLLM方法并略优于强法医基线。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09902 2026-05-12 cs.CV 84%

Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment

通过渐进分辨率处理和自适应特征对齐对多模态大语言模型进行对抗攻击

Haobo Wang, Xiaorong Ma, Weiqi Luo, Xiaojun Jia, Jiwu Huang

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出PRAF-Attack框架,通过多尺度语义指导和中间层局部对齐提升多模态大语言模型的对抗攻击转移性,实验表明其在多种黑盒MLLM上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19660 2026-03-30 cs.CV cs.LG 84%

Towards Knowledge Guided Pretraining Approaches for Multimodal Foundation Models: Applications in Remote Sensing

面向多模态基础模型的知识引导预训练方法:遥感应用

Praveen Ravirathinam, Ajitesh Parthasarathy, Ankush Khandelwal, Rahul Ghosh, Vipin Kumar

机构 * University of Minnesota(明尼苏达大学)

专题命中 多模态训练与对齐 :multimodal(title);multimodal foundation model(title);分类 cs.CV

AI总结 本文提出KG-VSF方法,通过条件生成任务建模预测,提升遥感任务中因果关系的建模能力,提升下游任务性能。

Comments 33 pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14799 2025-08-28 cs.HC cs.AI cs.LG 84%

Analyzing Character Representation in Media Content using Multimodal Foundation Model: Effectiveness and Trust

Evdoxia Taka, Debadyuti Bhattacharya, Joanne Garde-Hansen, Sanjay Sharma, Tanaya Guha

机构 * University of Glasgow(格拉斯哥大学) University of Leeds(利兹大学) University of Warwick(沃里克大学)

专题命中 多模态训练与对齐 :multimodal(title);multimodal foundation model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05154 2026-08-14 cs.CL cs.CV 版本更新 84%

RIG-RoPE: Relation-Stratified Multimodal Attention with Instance-Local Rotary Geometry and Representation-Aware Traversal Coordinates

RIG-RoPE:具有时长感知时间坐标的关系与实例门控旋转位置编码

Donggen Li

机构 * Sichuan University(四川大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究针对多模态场景中静态多维位置分配的局限,提出RIG-RoPE机制,通过关系与实例门控及时长感知时间坐标优化位置编码,未增加可学习参数,确立了相关公式与验证路径。

Comments 24 pages, 2 figures. Major theoretical revision: reformulated cross-instance geometry, null-relation analysis, relation-stratified normalization, and representation-aware traversal coordinates; expanded related work and implementation details. Preliminary technical report; empirical validation is left to future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16409 2026-08-13 cs.CV cs.CL cs.LG 版本更新 84%

Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

多语言OCR感知微调和提示引导的链式思维推理用于多模态大语言模型

Qinwu Xu, Yifan Jiang, Haoyu Ren

机构 * Meta AI UT Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 提出一种多语言OCR感知的多模态训练框架,通过合成数据生成、OCR感知微调和结构化视觉链式思维提示,提升多模态大语言模型在复杂视觉条件下的OCR完整性和多语言翻译准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07565 2026-08-11 cs.CL cs.AI 版本更新 84%

Expert-Guided Multimodal Fusion for Unified Emotion and Sentiment Analysis

通过专家引导的多模态融合与大语言模型的统一框架实现情绪识别与情感分析

Jiaqi Qiao, Xinran Li, Yifan Lyu, Xiujuan Xu, Liu Yu

机构 * School of Software, Dalian University of Technology, China(软件学院,大连理工大学,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EGMF框架,通过专家引导的多模态融合与大语言模型结合,实现情绪识别与情感分析的统一处理,提升跨语言鲁棒性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07385 2026-08-10 cs.LG cs.AI eess.AS eess.SP stat.ML 新提交 84%

Omni-modal decomposition autoencoders learn full-stack wearable disentangled representations

全模态分解自编码器学习全栈可穿戴解耦表示

Ioannis Ziogas, Ensieh Khazaei, Bilal Taha, Aamna Al Shehhi, Ahsan H. Khandoker, Leontios J. Hadjileontiadis, Dimitrios Hatzinakos

机构 * Khalifa University(哈利法大学) University of Toronto(多伦多大学) MIT Media Lab(麻省理工学院媒体实验室) Aristotle University of Thessaloniki(亚里士多德大学)

专题命中 多模态训练与对齐 :omni-modal(title,abstract);multi-modal(abstract);分类 cs.AI、eess.AS

AI总结 该研究针对现有多模态可穿戴模型的不足,提出OmniDecVAEs框架,在30模态的HAR任务中,提升了识别准确率与数据合成质量,可用于边缘可穿戴与医疗领域。

Comments 15 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04010 2026-08-05 cs.CV cs.CL 新提交 84%

ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

ParVL:面向多模态大语言模型的并行缩放与可扩展计算分配

Yang Yang, Qinyu Zhao, Mouxiang Chen, Xiaohui Li, Lixin Gu, Wenhai Wang, Hongjie Zhang, Wenwei Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL

AI总结 本研究针对多模态大语言模型的计算分配僵化问题,提出ParVL框架,通过复用骨干参数扩展并行计算,在13B token上微调后,其多模态性能优于同配置单分支基线,且最优分配随任务变化。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23493 2026-07-28 cs.CV cs.AI 新提交 84%

Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation

用于多模态情感解释的令牌-区域引导交叉注意力融合

Musa Tur Farazi, Nufayer Jahan Reza

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对孟加拉语模因政治意图检测难题,引入多模态交叉注意力融合框架,利用视觉语言模型提取文本,经跨模态多头注意力机制合成特征,还整合政治词汇表,实验表明该方法显著优于基线,Macro-F1达0.94,有效实现文本语义基于视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22013 2026-07-27 cs.CV cs.AI 新提交 84%

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

用于多模态思维链推理的视觉显著性引导蒸馏

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态思维链推理在小模型中存在的问题,提出视觉显著性引导蒸馏方法,利用多模态大语言模型注意力图生成扰动图像,经奇异值分解提取引导向量指导层间蒸馏,实验证明该方法能改进推理生成和答案推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16260 2026-07-21 cs.LG cs.AI cs.CV 新提交 84%

AdaSurvMamba: Dynamic Fusion and Semantic Scanning for Multimodal Survival Analysis

AdaSurvMamba:用于多模态生存分析的动态融合与语义扫描

Jialong Zhong, Tingwei Liu, Baokun Yue, Jingjing Li, Yongri Piao, Miao Zhang, Leiye Liu, Jiahong Jiang, Wei Ji, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of Alberta(阿尔伯塔大学) Yale University(耶鲁大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态生存分析中传统方法的局限,提出AdaSurvMamba框架,含DSIR模块动态调制跨模态交互强度、SAS模块重组令牌成连续序列,实验证明该框架在五个TCGA队列上比现有方法有优势。

Comments MICCAI 2026 Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12678 2026-07-15 cs.CV cs.AI 新提交 84%

Text-Aided Multi-Modal Panoptic Symbol Spotting for CAD Floor Plan Drawings

用于CAD平面图的文本辅助多模态全景符号识别

Yan Gong, Bohao Li, Bowen Du, Junchen Ye

机构 * CCSE Lab, Beihang University(北京航空航天大学CCSE实验室) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对CAD平面图全景符号识别中现有方法未充分利用文本注释的问题,提出多模态框架TextCAD,设计TACE编码注释语义,引入语义层次对齐框架,实验表明该方法有效提升符号识别性能并达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05978 2026-07-08 cs.CV cs.AI 新提交 84%

Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention

提出并关注:通过多令牌局部注意力实现无训练的多模态大语言模型接地置信度

Daniel Shalam, Emanuel Ben Baruch, Avi Ben Cohen, Tal Remez

机构 * Amazon(亚马逊)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型接地置信度问题,提出无训练的多令牌局部注意力(MTLA)方法,通过在声称区域内求和并跨预测令牌聚合恢复更强接地信号,在多模型家族和模态中提升了幻觉AUROC及零样本检测AP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02593 2026-07-07 cs.CV cs.CL 新提交 84%

Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation

多模态大语言模型知识蒸馏的令牌级响应视觉注意力引导

Jaehyun Jang, Eunseop Yoon, Hee Suk Yoon, SooHwan Eom, Mark A. Hasegawa-Johnson, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL

AI总结 研究多模态大语言模型知识蒸馏,挑战传统依赖,发现下游性能与响应视觉注意力相似度强相关。提出令牌级响应视觉注意力引导方法,通过自适应加权散度,有效引导学生模型,实验证明其性能优于基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12096 2026-07-07 cs.MM cs.CV cs.IT eess.SP math.IT 版本更新 84%

Token Communications: A Large Model-Driven Framework for Cross-modal Context-aware Semantic Communications

令牌通信:一种用于跨模态上下文感知语义通信的大模型驱动框架

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Rahim Tafazolli, Mehdi Bennis, Dusit Niyato

机构 * School of Information and Electronics, Beijing Institute of Technology, Beijing 100081, China(信息与电子学院,北京理工大学,北京) GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey, Guildford, United Kingdom(5GIC与6GIC,通信系统研究所(ICS), Surrey大学, Guildford,英国) Centre for Wireless Communications, University of Oulu, 90014 Oulu, Finland(无线通信中心,奥卢大学, Oulu,芬兰) School of Computer Science and Engineering, Nanyang Technological University, Singapore 639798(计算机科学与工程学院,南洋理工大学, Singapore)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 介绍令牌通信框架,借助生成基础模型和多模态大语言模型,以令牌为通信单元,在语义通信中利用跨模态上下文信息,提升带宽效率,并给出关键原则与研究方向。

Comments Accepted at IEEE Wireless Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00547 2026-07-01 cs.CV cs.AI cs.HC 84%

Milmer: a Framework for Multiple Instance Learning based Multimodal Emotion Recognition

Milmer: 一种基于多实例学习的多模态情感识别框架

Zaitian Wang, Jian He, Yu Liang, Xiyuan Hu, Tianhao Peng, Kaixin Wang, Jiakai Wang, Chenlong Zhang, Weili Zhang, Shuang Niu, Xiaoyang Xie

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Milmer框架,结合面部表情分析与EEG信号,采用Transformer融合方法提升多模态情感识别性能,通过细调Swin Transformer和交叉注意力机制实现高效特征融合,实验显示在DEAP数据集上达到96.72%的四类情感识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05689 2026-06-30 cs.CV cs.AI 84%

CRFT: Consistent-Recurrent Feature Flow Transformer for Cross-Modal Image Registration

CRFT:用于跨模态图像配准的一致-递归特征流变换器

Xuecong Liu, Mengzhu Ding, Zixuan Sun, Zhang Li, Xichao Teng

机构 * Northeastern University, China(东北大学(中国)) National University of Defense Technology, China(国防科技大学(中国))

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CRFT提出了一种基于特征流学习的统一粗到细框架,通过特征对齐和流估计实现鲁棒的跨模态图像配准,通过多尺度特征相关性和层次特征融合提升精度和鲁棒性。

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 34784-34794

详情

展开后加载摘要…

URL PDF HTML 收藏