arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 31 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 31 篇

2602.11656 2026-03-17 cs.CV cs.AI cs.RO 84%

SToRM: Supervised Token Reduction for Multi-modal LLMs toward efficient end-to-end autonomous driving

SToRM:面向高效端到端自动驾驶的多模态大语言模型监督令牌缩减

Seo Hyun Kim, Jin Bok Park, Do Yeon Koo, Hogun Park, Il Yong Chun

专题命中 多模态训练与对齐 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SToRM框架,通过监督令牌缩减方法在保持性能的同时降低计算成本,实现实时端到端自动驾驶。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14132 2026-03-17 cs.CV cs.LG 83%

DualSwinFusionSeg: Multimodal Martian Landslide Segmentation via Dual Swin Transformer with Multi-Scale Fusion and UNet++

DualSwinFusionSeg: 多模态火星滑坡分割 via 双Swin Transformer 与多尺度融合及UNet++

Shahriar Kabir, Abdullah Muhammed Amimul Ehsan, Istiak Ahmmed Rifti, Md Kaykobad Reza

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出DualSwinFusionSeg,通过双Swin Transformer与多尺度融合及UNet++实现多模态火星滑坡分割,验证了在有限标注数据下提升分割精度的效果。

Comments 10 pages, 2 Figures, 12 Tables. Code is available at: https://github.com/amimulamim/Mars-LS-Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13719 2026-03-17 cs.CV 83%

Sparse-Dense Mixture of Experts Adapter for Multi-Modal Tracking

稀疏-密集专家混合适配器用于多模态跟踪

Yabin Zhu, Jianqi Li, Chenglong Li, Jiaxiang Wang, Chengjie Gu, Jin Tang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出稀疏-密集专家混合适配器框架,通过稀疏MoE和密集共享MoE有效建模多模态特征,结合Gram基于语义对齐超图融合模块,提升多模态跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13272 2026-03-17 cs.LG cs.AI 83%

CAMEL-CLIP: Channel-aware Multimodal Electroencephalography-text Alignment for Generalizable Brain Foundation Models

CAMEL-CLIP:面向通用脑基础模型的通道感知多模态EEG-文本对齐

Hanseul Choi, Jinyeong Park, Seongwon Jin, Sungho Park, Jibum Kim

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Incheon National University(庆尚国立大学) Department of Artificial Intelligence(人工智能系) Inha University(Inha大学) Center for Brain-Machine Interface(脑机接口中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 CAMEL-CLIP通过通道属性位置编码、动态通道投影和双级对比学习,提升EEG-文本多模态基础模型在通道异质性下的鲁棒性,实验表明其在线性探测中表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15168 2026-03-17 cs.CV cs.AI 81%

Multimodal Connectome Fusion via Cross-Attention for Autism Spectrum Disorder Classification Using Graph Learning

通过交叉注意力进行多模态连接组融合用于自闭症谱系障碍分类的图学习

Ansar Rahman, Hassan Shojaee-Mend, Sepideh Hatamikia

机构 * Department of Medicine, Danube Private University (DPU)(丹ube私人大学医学系) Department of Medical Physics and Biomedical Engineering, Medical University of Vienna(维也纳医学大学医学物理与生物医学工程系) Department of Medical Informatics, Faculty of Medicine, Gonabad University of Medical Sciences(戈纳巴德医学院医学信息学系) Austrian Center for Medical Innovation and Technology (ACMIT)(奥地利医学创新与技术中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态图学习框架,通过交叉注意力机制融合功能和结构影像数据,提升自闭症谱系障碍分类的准确率。

Comments 29 Pages; 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14976 2026-03-17 cs.MM cs.CV 81%

Anchoring Emotions in Text: Robust Multimodal Fusion for Mimicry Intensity Estimation

在文本中锚定情绪:用于模仿强度估计的鲁棒多模态融合

Lingsi Zhu, Yuefeng Zou, Yunxiang Zhang, Naixiang Zheng, Guoyuan Wang, Jun Yu, Jiaen Liang, Wei Huang, Shengping Liu, Ximin Zheng

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co., Ltd.(Unisound人工智能科技有限公司) Pingan Technology Co., Ltd.(平安科技有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出TAEMI框架,通过文本锚定机制融合多模态数据,提升在噪声和缺失数据下的情绪模仿强度估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14891 2026-03-17 cs.CL cs.AI 81%

Decision-Level Ordinal Modeling for Multimodal Essay Scoring with Large Language Models

基于大语言模型的多模态作文评分的决策级序数建模

Han Zhang, Jiamin Su, Li liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DLOM方法,通过显式序数决策提升多模态作文评分的准确性,DLOM-GF和DLOM-DA分别引入门控融合模块和距离感知正则化项,实验表明在多模态和纯文本评分任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14189 2026-03-17 cs.CV cs.AI 81%

Walking Further: Semantic-aware Multimodal Gait Recognition Under Long-Range Conditions

行走更远:基于语义的多模态步态识别在远距离条件下的应用

Zhiyang Lu, Wen Jiang, Tianren Wu, Zhichao Wang, Changwang Zhang, Siqi Shen, Ming Cheng

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LRGait基准和EMGaitNet框架,通过语义引导融合和跨模态对齐提升远距离步态识别性能,验证了方法的有效性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18652 2026-03-17 cs.CL 80%

PolyFrame at MWE-2026 AdMIRe 2: When Words Are Not Enough: Multimodal Idiom Disambiguation

PolyFrame在MWE-2026 AdMIRe 2:当词语不够时:多模态成语消歧

Nina Hosseini-Kivanani

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出PolyFrame系统,通过统一管道处理图像+文本排名和纯文本描述排名任务,利用轻量模块提升多语言成语消歧性能,无需微调大模型。

Comments Accepted at AdMIRe 2 shared task (Advancing Multimodal Idiomaticity Representation) colocated with 22nd Workshop on Multiword Expressions (MWE 2026) @EACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15100 2026-03-17 cs.CV 79%

Learning from Limited and Incomplete Data: A Multimodal Framework for Predicting Pathological Response in NSCLC

从有限和不完整数据中学习:一种多模态框架用于预测非小细胞肺癌的病理反应

Alice Natalina Caragliano, Giulia Farina, Fatih Aksu, Camillo Maria Caruso, Claudia Tacconi, Carlo Greco, Lorenzo Nibid, Edy Ippolito, Michele Fiore, Giuseppe Perrone, Sara Ramella, Paolo Soda, Valerio Guarrasi

机构 * Department of Medicine and Surgery(医学与外科系) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入系,放射物理,生物医学工程) Umeå University, Umeå, Sweden(乌梅大学,瑞典)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态深度学习框架,整合基础模型的CT特征提取与缺失感知架构,以在有限数据和不完整临床资料下准确预测NSCLC的病理反应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13298 2026-03-17 cs.LG cs.AI 79%

FusionCast: Enhancing Precipitation Nowcasting with Asymmetric Cross-Modal Fusion and Future Radar Priors

FusionCast: 通过不对称跨模态融合和未来雷达先验增强降水现在预报

Henan Wang, Shengwu Xiong, Yifang Zhang, Wenjie Yin, Chen Zhou, Yuqiang Zhang, Pengfei Duan

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Earth and Space Science and Technology, Wuhan University(武汉大学地球和空间科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出FusionCast框架,结合历史雷达QPE、PWV数据和预测雷达QPE,通过不对称融合和未来先验提升降水现在预报精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13291 2026-03-17 cs.LG cs.AI 79%

FedUAF: Uncertainty-Aware Fusion with Reliability-Guided Aggregation for Multimodal Federated Sentiment Analysis

FedUAF: 基于不确定性融合与可靠性引导聚合的多模态联邦情感分析

Xianxun Zhu, Zezhong Sun, Imad Rida, Erik Cambria, Junqi Su, Rui Wang, Hui Chen

机构 * Shanghai University(上海大学) North China Electric Power University(华北电力大学) Université de Technologie de Compiègne(法国图卢兹国立理工学院) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Macquarie University(麦考瑞大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出FedUAF框架,通过不确定性融合和可靠性引导聚合解决联邦学习中多模态数据缺失、分布异质和客户端更新不可靠的问题,实验证明其在CMU-MOSI和CMU-MOSEI数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15004 2026-03-17 cs.SE 78%

TriFusion-LLM: Prior-Guided Multimodal Fusion with LLM Arbitration for Fine-grained Code Clone Detection

TriFusion-LLM:基于LLM仲裁的先验引导多模态融合用于细粒度代码克隆检测

Mengdi Li, Yuming Liu, He Wang, Zifeng Xu, Yuqing Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出TriFusion-LLM框架,结合传统机器学习的启发式相似性先验、AST结构信号和CodeBERT语义嵌入,提升细粒度代码克隆检测的分类性能,实验表明其在BigCloneBench上将Macro-F1提升至0.875。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12192 2026-03-17 physics.optics 78%

Multimodal Fusion Network for Micro-displacement Measurement via Michelson Interferometer

用于迈克尔逊干涉仪的多模融合网络微位移测量

Zixing Jia, Jiawei Li, Ziping Chen, Xin Li

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种多模融合网络用于高精度微位移测量,通过引入双头学习机制解决半波位移模糊问题,实现高精度位移和整数干涉阶分类,具备实时性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14493 2026-03-17 cs.CV cs.CL cs.LG 73%

Fine-tuning MLLMs Without Forgetting Is Easier Than You Think

对多模态大语言模型进行微调而不遗忘比你想象的更容易

He Li, Yuhui Zhang, Xiaohan Wang, Kaifeng Lyu, Serena Yeung-Levy

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文通过实验框架展示,简单调整微调方法可缓解灾难性遗忘,提出数据混合训练策略解决特定任务过拟合问题,并证明该方法可扩展至持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17741 2026-03-17 cs.CV 70%

Reasoning to Attend: Try to Understand How <SEG> Token Works

推理以关注:尝试理解<SEG>标记的作用

Rui Qian, Xin Yin, Dejing Dou

专题命中 多模态训练与对齐 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文研究了<SEG>标记在多模态模型中的作用,通过可视化相似性图揭示其在图像-文本对中的语义相似性贡献,并提出READ方法提升模型的推理能力。

Comments This work has been accepted to CVPR 2025, please refer to https://github.com/rui-qian/READ

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13292 2026-03-17 cs.LG cs.AI 70%

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁

Ming Wen, Kun Yang, Xin Chen, Jingyu Zhang, Dingding Han, Shiwen Cui, Yuedong Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) UCLA(加州大学洛杉矶分校) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。

Comments 31 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14214 2026-03-17 cs.CV cs.AI 62%

UniFusion: A Unified Image Fusion Framework with Robust Representation and Source-Aware Preservation

UniFusion:一种具有鲁棒表示和源感知保留的统一图像融合框架

Xingyuan Li, Songcheng Du, Yang Zou, HaoYuan Xu, Zhiying Jiang, Jinyuan Liu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 UniFusion通过统一框架实现跨任务泛化,利用DINOv3提取模态一致特征,引入重建对齐损失保持源信息一致性,并采用双层优化策略平衡重建与融合目标,提升融合质量与泛化能力。

Comments 11 pages, 8 figures, published to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13366 2026-03-17 cs.CV cs.AI 62%

Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding

在不确定性中思考:通过潜在熵感知解码减轻MLRMs中的幻觉

Zhongxing Xu, Zhonghua Wang, Zhe Qian, Dachuan Shi, Feilong Tang, Ming Hu, Shiyan Su, Xiaocheng Zou, Wei Feng, Dwarikanath Mahapatra, Yifan Peng, Mingquan Lin, Zongyuan Ge

机构 * Monash University(墨尔本大学) Georgia Tech(佐治亚理工学院) Cornell University(康奈尔大学) Northeastern University(东北大学) Khalifa University(卡利法大学) University of Minnesota(明尼苏达大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过潜在熵感知解码策略减轻多模态大推理模型中的幻觉问题,利用语义上下文增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13335 2026-03-17 cs.CV cs.AI 62%

Information-Theoretic Constraints for Continual Vision-Language-Action Alignment

信息论视角下的持续视觉-语言-动作对齐约束

Libang Zhao, Qixin Zeng, Hongyin Zhang, Donglin Wang

机构 * Westlake University, China(西湖大学) University of Southampton, UK(南安普顿大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Info-VLA框架,通过两个互补约束保持跨模态信息结构,解决持续学习中视觉语言动作对齐退化问题,实验表明其在任务保持与适应性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15452 2026-03-17 cs.AI 57%

Unlocking the Value of Text: Event-Driven Reasoning and Multi-Level Alignment for Time Series Forecasting

释放文本价值:基于事件驱动推理和多级对齐的时间序列预测

Siyuan Wang, Peng Chen, Yihang Wang, Wanghui Qiu, Chenjuan Guo, Bin Yang, Yang Shu

机构 * East China Normal University(华东师范大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出VoT方法,结合事件驱动推理和多级对齐,利用文本信息提升时间序列预测性能,通过历史上下文学习和自适应频率融合实现文本与数值预测的互补。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14892 2026-03-17 cs.CV 57%

Balancing Saliency and Coverage: Semantic Prominence-Aware Budgeting for Visual Token Compression in VLMs

平衡显著性与覆盖:面向视觉令牌压缩的语义显著性感知预算分配

Jaehoon Lee, Mingi Jung, Soohyuk Jang, Seungryong Yoo, Dahuin Jung, Sungroh Yoon

机构 * Interdisciplinary Program in AI, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Department of Artificial Intelligence, Chung-Ang University(成均馆大学人工智能系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PromPrune框架,通过语义显著性感知预算分配和两阶段选择流程,在视觉令牌压缩中平衡局部显著性保留与全局覆盖,提升性能并减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14822 2026-03-17 cs.CV 57%

RadarXFormer: Robust Object Detection via Cross-Dimension Fusion of 4D Radar Spectra and Images for Autonomous Driving

RadarXFormer: 通过4D雷达光谱与图像的跨维度融合实现稳健的目标检测用于自动驾驶

Yue Sun, Yeqiang Qian, Zhe Wang, Tianhui Li, Chunxiang Wang, Ming Yang

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学未来技术全球研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(中国教育部系统控制与信息处理重点实验室) SAIC GM Wuling Automobile Company Co., Ltd.(上汽通用五菱汽车有限公司) Guangxi Laboratory of New Energy Automobile(广西新能源汽车实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出RadarXFormer框架,通过融合4D雷达光谱与RGB图像的跨维度信息,提升自动驾驶中的目标检测鲁棒性和准确性,同时保持实时推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14086 2026-03-17 cs.CV 57%

Effective Feature Learning for 3D Medical Registration via Domain-Specialized DINO Pretraining

通过领域专用DINO预训练实现有效的3D医学图像特征学习

Eytan Kats, Mattias P. Heinrich

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文通过领域专用DINO预训练学习3D医学图像密集体积分量特征,提升变形匹配性能,在跨患者腹部注册任务中优于自然图像预训练模型。

Comments Accepted for International Symposium on Biomedical Imaging 2026 (ISBI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14039 2026-03-17 cs.CV 57%

EyeWorld: A Generative World Model of Ocular State and Dynamics

EyeWorld: 一种眼态与动态的生成世界模型

Ziyu Gao, Xinyuan Wu, Xiaolan Chen, Zhuoran Liu, Ruoyu Chen, Bowen Liu, Bingjie Yan, Zhenhan Wang, Kai Jin, Jiancheng Yang, Yih Chung Tham, Mingguang He, Danli Shi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 EyeWorld通过统一多模态解析与时间条件状态转移,实现对眼态的鲁棒多模态解释与临床预测模拟。

Comments 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16931 2026-03-17 cs.AI 57%

Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents

细粒度微调会削弱视觉语言代理的安全对齐

Idhant Gulati, Shivam Raval

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 研究发现细粒度微调在有害数据集上会导致广泛的任务和模态对齐偏差,且单模态安全基准可能低估视觉语言模型的对齐退化。

Comments 25 pages, 14 figures, Published at the Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17343 2026-03-17 cs.CV cs.HC 57%

Ocular Authentication: Fusion of Gaze and Periocular Modalities

眼认证:融合眼动与周睑模态

Dillon Lohr, Michael J. Proulx, Mehedi Hasan Raju, Oleg V. Komogortsev

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种多模态认证系统,通过融合眼动和周睑图像,在无校准认证系统中提升性能,优于单一模态系统,超越FIDO基准。

Comments Supplementary material is available

Journal ref 2025 IEEE International Joint Conference on Biometrics (IJCB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03565 2026-03-17 cs.CV 57%

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

INST-IT:通过显式视觉提示指令微调提升实例理解

Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出INST-IT方法,通过显式视觉提示指令微调提升大模型的实例理解能力,构建了评估基准和数据集,并在多个基准上验证了方法的有效性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13787 2026-03-17 cs.CV 57%

Advancing Cancer Prognosis with Hierarchical Fusion of Genomic, Proteomic and Pathology Imaging Data from a Systems Biology Perspective

从系统生物学视角出发,通过多层次融合基因组、蛋白质组和病理影像数据以推进癌症预后

Junjie Zhou, Bao Xue, Meiling Wang, Wei Shao, Daoqiang Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HFGPI框架,通过分子编码策略和蛋白质引导超图学习,多层次融合基因组、蛋白质组和病理影像数据,提升癌症预后预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13768 2026-03-17 cs.SD cs.CL 57%

Causal Tracing of Audio-Text Fusion in Large Audio Language Models

大型音频语言模型中音频-文本融合的因果追溯

Wei-Chih Chen, Chien-yu Huang, Hung-yi Lee

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 研究通过因果追溯分析大型音频语言模型在音频理解过程中音频特征与文本上下文的融合机制,揭示不同模型在层间和token级的融合策略及信息瓶颈。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏