arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6878 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6878 篇

2511.20008 2026-03-25 cs.CV cs.AI 81%

Pedestrian Crossing Intention Prediction Using Multimodal Fusion Network

基于多模态融合网络的行人过街意图预测

Yuanzhe Li, Steffen Müller

机构 * Chair of Automotive Engineering, Technische Universität Berlin(柏林技术大学汽车工程系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态融合网络,通过视觉和运动分支提取七种模态特征,有效整合互补信息,提升自动驾驶车辆在城市环境中对行人意图预测的准确性。

Comments 29th IAVSD International Symposium on Dynamics of Vehicles on Roads and Tracks (IAVSD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20729 2026-03-24 cs.CV cs.AI physics.geo-ph 81%

Weakly supervised multimodal segmentation of acoustic borehole images with depth-aware cross-attention

弱监督多模态分割:基于深度感知的跨注意力机制用于声学钻孔图像

Jose Luis Lima de Jesus Silva

机构 * Federal University of Bahia, Institute of Geosciences, Department of Geophysics(巴伊亚联邦大学,地质科学学院,地球物理学系) Grupo de Estudos e Aplicação de Inteligência Artificial em Geofísica (GAIA)(地质物理中人工智能研究与应用小组)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种弱监督多模态分割框架,通过深度感知的跨注意力机制提升钻孔图像分割性能,结合二维图像纹理与一维井下数据,实现无监督的高精度分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00431 2026-03-24 cs.CV cs.AI 81%

Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models

面向层次视觉识别的分类意识表示对齐

Hulingxiao He, Zhi Tan, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机系王轩研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出TARA方法,通过生物基础模型的层次对比学习将分类知识注入大模态模型,提升层次视觉识别中对已知和新类别的识别性能。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17343 2026-03-23 cs.CV cs.LG cs.MM 81%

Principled Multimodal Representation Learning

原理化的多模态表征学习

Xiaohao Liu, Xiaobo Xia, See-Kiong Ng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出PMRL框架,通过优化表示矩阵的主导奇异值实现多模态的同时对齐,采用基于softmax的损失函数和实例对比正则化,提升表征稳定性与分离性,在多种任务中优于基线方法。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16861 2026-03-20 cs.CV cs.AI 81%

Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection

先看再融合:基于2D引导的跨模态对齐用于鲁棒的3D检测

Xiang Li, Zhangchi Hu, Xiao Xu, Bin Kong

机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用2D对象先验进行跨模态特征预对齐,解决LiDAR与相机特征的空间错位问题,提升3D检测鲁棒性。

Comments accepted to cvpr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15168 2026-03-17 cs.CV cs.AI 81%

Multimodal Connectome Fusion via Cross-Attention for Autism Spectrum Disorder Classification Using Graph Learning

通过交叉注意力进行多模态连接组融合用于自闭症谱系障碍分类的图学习

Ansar Rahman, Hassan Shojaee-Mend, Sepideh Hatamikia

机构 * Department of Medicine, Danube Private University (DPU)(丹ube私人大学医学系) Department of Medical Physics and Biomedical Engineering, Medical University of Vienna(维也纳医学大学医学物理与生物医学工程系) Department of Medical Informatics, Faculty of Medicine, Gonabad University of Medical Sciences(戈纳巴德医学院医学信息学系) Austrian Center for Medical Innovation and Technology (ACMIT)(奥地利医学创新与技术中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态图学习框架,通过交叉注意力机制融合功能和结构影像数据,提升自闭症谱系障碍分类的准确率。

Comments 29 Pages; 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14976 2026-03-17 cs.MM cs.CV 81%

Anchoring Emotions in Text: Robust Multimodal Fusion for Mimicry Intensity Estimation

在文本中锚定情绪:用于模仿强度估计的鲁棒多模态融合

Lingsi Zhu, Yuefeng Zou, Yunxiang Zhang, Naixiang Zheng, Guoyuan Wang, Jun Yu, Jiaen Liang, Wei Huang, Shengping Liu, Ximin Zheng

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co., Ltd.(Unisound人工智能科技有限公司) Pingan Technology Co., Ltd.(平安科技有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出TAEMI框架,通过文本锚定机制融合多模态数据,提升在噪声和缺失数据下的情绪模仿强度估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14891 2026-03-17 cs.CL cs.AI 81%

Decision-Level Ordinal Modeling for Multimodal Essay Scoring with Large Language Models

基于大语言模型的多模态作文评分的决策级序数建模

Han Zhang, Jiamin Su, Li liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DLOM方法,通过显式序数决策提升多模态作文评分的准确性,DLOM-GF和DLOM-DA分别引入门控融合模块和距离感知正则化项,实验表明在多模态和纯文本评分任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14189 2026-03-17 cs.CV cs.AI 81%

Walking Further: Semantic-aware Multimodal Gait Recognition Under Long-Range Conditions

行走更远:基于语义的多模态步态识别在远距离条件下的应用

Zhiyang Lu, Wen Jiang, Tianren Wu, Zhichao Wang, Changwang Zhang, Siqi Shen, Ming Cheng

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LRGait基准和EMGaitNet框架,通过语义引导融合和跨模态对齐提升远距离步态识别性能,验证了方法的有效性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12722 2026-03-16 cs.CV cs.AI 81%

CognitionCapturerPro: Towards High-Fidelity Visual Decoding from EEG/MEG via Multi-modal Information and Asymmetric Alignment

CognitionCapturerPro:通过多模态信息和非对称对齐实现从EEG/MEG的高保真视觉解码

Kaifan Zhang, Lihuo He, Junjie Ke, Yuqi Ji, Lukun Wu, Lizi Wang, Xinbo Gao

机构 * Visual Information Processing Laboratory, School of Electronic Engineering, Xidian University(电子科技大学信息处理实验室,电子工程学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CognitionCapturerPro框架,通过整合EEG与多模态先验信息,提升EEG视觉重建的保真度与检索准确率,改进Top-1和Top-5准确率达25.9%和10.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12721 2026-03-16 cs.CV cs.AI 81%

CMHANet: A Cross-Modal Hybrid Attention Network for Point Cloud Registration

CMHANet:一种用于点云配准的跨模态混合注意力网络

Dongxu Zhang, Yingsen Wang, Yiding Sun, Haoran Xu, Peilin Fan, Jihua Zhu

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CMHANet,通过融合2D图像与3D点云信息,提升配准鲁棒性,并引入对比学习优化函数,实验表明在3DMatch和3DLoMatch数据集上效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12625 2026-03-16 cs.IR cs.AI cs.CV 81%

VLM4Rec: Multimodal Semantic Representation for Recommendation with Large Vision-Language Models

VLM4Rec:基于大视觉-语言模型的多模态语义表示推荐系统

Ty Valencia, Burak Barlas, Varun Singhal, Ruchir Bhatia, Wei Yang

机构 * University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 VLM4Rec通过语义对齐而非直接特征融合,提升多模态推荐性能,实验显示其优于原始视觉特征和融合方法。

Comments 13 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11220 2026-03-13 cs.CV cs.CL 81%

Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models

频率调制的视觉修复用于Matryoshka大多模态模型

Qingtao Pan, Zhihao Dou, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出FMVR策略,通过频率调制修复视觉语义,提升LMMs在减少视觉token时的推理能力,并在多个基准测试中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08208 2026-03-10 cs.CV cs.AI 81%

Alignment-Aware and Reliability-Gated Multimodal Fusion for Unmanned Aerial Vehicle Detection Across Heterogeneous Thermal-Visual Sensors

具有对齐意识和可靠性门控的多模态融合用于跨异质热视觉传感器的无人机检测

Ishrat Jahan, Molla E Majid, M Murugappan, Muhammad E. H. Chowdhury, N. B. Prakash, Saad Bin Abul Kashem, Balamurugan Balusamy, Amith Khandakar

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出RGIF和RGMAF两种融合策略,通过注册意识和可靠性门控提升跨异质热视觉传感器的无人机检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06986 2026-03-09 cs.CV cs.CL 81%

Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs

重新思考多模态大语言模型中视觉编码器混合范式以提升视觉理解

Mozhgan Nasr Azadani, James Riddell, Sean Sedwards, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 LEO通过轻量级融合设计提升多模态大语言模型的视觉理解能力,并在自动驾驶领域展现良好泛化性能。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01592 2026-03-04 cs.CV cs.AI 81%

DMTrack: Spatio-Temporal Multimodal Tracking via Dual-Adapter

DMTrack: 基于双适配器的时空多模态跟踪

Weihong Li, Shaohua Dong, Haonan Lu, Yanhao Zhang, Heng Fan, Libo Zhang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Department of Computer Science and Engineering, University of North Texas(北卡罗来纳州立大学计算机科学与工程系) OPPO AI Center(OPPO人工智能中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 DMTrack通过双适配器架构实现时空多模态跟踪,利用STMA和PMCA模块提升跨模态融合效果,达到先进性能。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24027 2026-03-02 cs.CV cs.MM 81%

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

GuardAlign: 多模态大语言模型中的测试时安全性对齐

Xingyu Zhu, Beier Zhu, Junfeng Fang, Shuo Wang, Yin Zhang, Xiang Wang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Tianjin University(天津大学)

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 GuardAlign通过OT增强的安全检测和跨模态注意力校准,有效提升多模态大语言模型在测试时的安全性,减少不安全响应率并提升任务表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03830 2026-02-24 cs.AI cs.CV cs.CY 81%

Decoding Tourist Perception in Historic Urban Quarters with Multimodal Social Media Data: An AI-Based Framework and Evidence from Shanghai

通过多模态社交媒体数据解码历史城市街区的游客感知:一种基于人工智能的框架及上海的实证

Kaizhen Tan, Yufan Wu, Yuxuan Liu, Haoran Zeng

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出基于人工智能的多模态框架,通过分析社交媒体数据解码游客对历史城市街区的感知,揭示感知与现实之间的差距,并为遗产管理和城市设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18745 2026-02-24 cs.CV cs.AI 81%

Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code

从零开始合成多模态几何数据集并借助绘图代码实现视觉对齐

Haobo Lin, Tianyi Bai, Chen Chen, Jiajun Zhang, Bohan Zeng, Wentao Zhang, Binhang Yuan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GeoCode数据集,通过代码预测实现视觉对齐,提升多模态几何推理性能。

Comments 58 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01696 2026-02-24 cs.CV cs.AI 81%

Cross-Modal Purification and Fusion for Small-Object RGB-D Transmission-Line Defect Detection

跨模态净化与融合用于小物体RGB-D传输线缺陷检测

Jiaming Cui, Wenqiang Li, Shuai Zhou, Ruifeng Qin, Feng Shen

机构 * School of Mechatronics Engineering, Harbin Institute of Technology(机械电子工程学院,哈尔滨工业大学) School of Instrument Science and Engineering, Harbin Institute of Technology(仪器科学与工程学院,哈尔滨工业大学) Electric Power Research Institute, Yunnan Power Grid Co., Ltd.(电力研究院,云南电网公司)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 CMAFNet通过跨模态净化与融合技术,提升小物体RGB-D传输线缺陷检测的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09201 2026-02-20 cs.LG cs.AI cs.CL 81%

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

多模态提示优化:为何不利用多种模态为大语言模型服务

Yumin Choi, Dongki Kim, Jinheon Baek, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出多模态提示优化问题,提出MPO框架,通过联合优化和贝叶斯策略提升多模态提示效果,验证其在图像、视频等多模态任务中的优越性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03262 2026-02-16 cs.CV cs.AI 81%

Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders

探究多模态大语言模型中多个视觉编码器的冗余性

Yizhou Wang, Song Mao, Yang Chen, Yufan Shen, Yinqiao Yan, Pinlong Cai, Ding Wang, Guohang Yan, Zhi Yu, Xuming Hu, Botian Shi

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型中多个视觉编码器的冗余性,通过分析发现编码器的专业化、冗余性和有害性,并提出了量化冗余的指标,为更高效的多模态架构设计提供依据。

Comments accepted by ICLR2026, project website: https://github.com/MaoSong2022/Encoder-Redundancy

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02467 2026-02-16 cs.CV cs.AI 81%

Timing Is Everything: Finding the Optimal Fusion Points in Multimodal Medical Imaging

时机至关重要:在多模态医学影像中寻找最佳融合点

Valerio Guarrasi, Klara Mogensen, Sara Tassinari, Sara Qvarlander, Paolo Soda

机构 * Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入系,生物医学工程与放射物理,乌梅大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种顺序前进搜索算法,用于高效确定多模态医学影像中最佳融合时机,提升诊断准确性并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08567 2026-02-16 cs.CL cs.AI 81%

CATP: Cross-Attention Token Pruning for Accuracy Preserved Multimodal Model Inference

CATP:用于保持准确性的多模态模型推理中的交叉注意力标记修剪

Ruqi Liao, Chuqing Zhao, Jin Li, Weiqi Feng, Yi Lyu, Bingxian Chen, Haochen Yang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 CATP通过交叉注意力层优化标记修剪,显著提升多模态模型推理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08282 2026-02-10 cs.CV cs.AI 81%

Tighnari v2: Mitigating Label Noise and Distribution Shift in Multimodal Plant Distribution Prediction via Mixture of Experts and Weakly Supervised Learning

Tighnari v2: 通过专家混合和弱监督学习缓解多模态植物分布预测中的标签噪声和分布偏移

Haixu Liu, Yufei Wang, Tianxiang Xu, Chuancheng Shi, Hongsheng Xing

机构 * The University of Sydney, Sydney, New South Wales, Australia(悉尼大学) The University of New South Wales, Sydney, New South Wales, Australia(新南威尔士大学) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院) Shandong University of Technology, Zibo, Shandong, China(山东科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Tighnari v2通过专家混合和弱监督学习缓解多模态植物分布预测中的标签噪声和分布偏移,提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04937 2026-02-06 cs.LG cs.AI cs.CL 81%

Linear Model Merging Unlocks Simple and Scalable Multimodal Data Mixture Optimization

线性模型合并解锁了简单且可扩展的多模态数据混合优化

Davide Berasi, Matteo Farina, Massimiliano Mancini, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过模型合并高效估算多模态数据混合效果,结合领域专家训练与参数空间组合,实现可扩展的混合优化方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04405 2026-02-05 cs.CV cs.MM 81%

Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion

交互式空间-频率融合Mamba用于多模态图像融合

Yixin Zhu, Long Lv, Pingping Zhang, Xuehu Liu, Tongdan Tang, Feng Tian, Weibing Sun, Huchuan Lu

机构 * School of Future Technology, Dalian University of Technology and the Key Laboratory of Data Science and Smart Education (Hainan Normal University), Ministry of Education(未来技术学院,大连理工大学和数据科学与智能教育关键实验室(海南师范大学),教育部) Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(计算机科学与人工智能学院,武汉理工大学) Central Hospital of Dalian University of Technology(大连理工大学中心医院) School of Information and Communication Engineering, Dalian University of Technology(信息与通信工程学院,大连理工大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出交互式空间-频率融合Mamba框架,通过多尺度频率融合和交互式融合提升多模态图像融合性能。

Comments This work is accepted by IEEE Transactions on Image Processing. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16419 2026-02-05 cs.CL cs.CV 81%

Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning

通过强化微调学习多模态大语言模型中的领域知识

Qinglong Cao, Yuntian Chen, Chao Ma, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University, Shanghai, China(人工智能大规模并行计算实验室,人工智能研究院,上海交通大学,上海)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出通过强化微调框架在优化层面整合领域知识,提升多模态大语言模型在专门领域任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04356 2026-02-03 cs.RO cs.AI cs.CV 81%

UNIC: Learning Unified Multimodal Extrinsic Contact Estimation

UNIC: 学习统一的多模态外在接触估计

Zhengtong Xu, Yuki Shirai

机构 * Edwardson School of Industrial Engineering, Purdue University(帕克大学工业工程学院) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 UNIC通过统一多模态框架实现无需先验知识的外在接触估计,提升手部操作的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00347 2026-02-03 cs.CV cs.AI 81%

AdaFuse: Adaptive Multimodal Fusion for Lung Cancer Risk Prediction via Reinforcement Learning

AdaFuse:基于强化学习的自适应多模态融合用于肺癌风险预测

Chongyu Qu, Zhengyi Lu, Yuxiang Lai, Thomas Z. Li, Junchao Zhu, Junlin Guo, Juming Xiong, Yanfan Zhu, Yuechen Yang, Allen J. Luna, Kim L. Sandler, Bennett A. Landman, Yuankai Huo

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) Emory University(埃默里大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 AdaFuse利用强化学习实现自适应多模态融合,通过动态选择和融合模态提升肺癌风险预测的AUC性能。

详情

展开后加载摘要…

URL PDF HTML 收藏