arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-25 至 2026-06-25 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 10 篇

2606.24963 2026-06-25 cs.CV cs.LG 新提交 87%

Curvature-Guided Mixing for MLLM Adaptation

曲率引导混合用于MLLM适配

Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang

机构 * Research Institute of Trustworthy Autonomous Systems and Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学可信自主系统研究院与计算机科学与工程系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 提出曲率引导混合(CGM)框架,通过二阶Hessian近似推导最优软混合比,以及硬混合变体CGM†,在LLaVA-1.5和Qwen2.5VL上改善任务专化与通用知识保持的权衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24538 2026-06-25 cs.CV 新提交 84%

ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization

ForensicsTok: 面向图像篡改定位的法医引导分词建模

Lei Xu, Haowei Wang, Shen Chen, Taiping Yao, Bin Li, Changsheng Chen

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen MSU-BIT University(深圳北理莫斯科大学)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multi-modal(abstract);分类 cs.CV

AI总结 提出ForensicsTok,将图像篡改定位重构为自回归序列生成任务,通过Token Splatting解码器和分层专家融合模块,直接生成空间定位的令牌序列,避免中间监督,在六个基准上超越现有MLLM方法并略优于强法医基线。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10386 2026-06-25 cs.CV cs.AI cs.MM 82%

Handling Missing Modalities in Multimodal Survival Prediction for Non-Small Cell Lung Cancer

多模态生存预测中缺失模态的处理:非小细胞肺癌的应用

Filippo Ruffini, Camillo Maria Caruso, Claudia Tacconi, Lorenzo Nibid, Francesca Miccolis, Marta Lovino, Carlo Greco, Edy Ippolito, Michele Fiore, Alessio Cortellini, Bruno Beomonte Zobel, Giuseppe Perrone, Bruno Vincenzi, Claudio Marrocco, Alessandro Bria, Elisa Ficarra, Sara Ramella, Valerio Guarrasi, Paolo Soda

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering(人工智能与计算机系统单位,工程系) Università Campus Bio-Medico di Roma(罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入部门,辐射物理,生物医学工程) Umeå University(乌梅学院) Research Unit of Radiation Oncology, Department of Medicine and Surgery(放射肿瘤研究单位,医学与外科部门) Fondazione Policlinico Universitario Campus Bio-Medico(生物医学大学附属医院基金会) Anatomical Pathology Operative Research Unit(解剖病理学操作研究单位) Research Unit of Anatomical Pathology, Department of Medicine and Surgery(解剖病理学研究单位,医学与外科部门) Department of Medicine and Surgery(医学与外科部门)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出一种缺失感知的多模态生存框架,结合CT、WSI和临床数据,通过基础模型提取特征并融合,提升NSCLC生存预测的准确性与临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25579 2026-06-25 eess.IV cs.CV 交叉投稿 79%

Cross-Attention Multimodal Learning for Predicting Response to Neoadjuvant Imatinib in Gastrointestinal Stromal Tumors: A Multicenter Retrospective Study

跨注意力多模态学习预测胃肠道间质瘤新辅助伊马替尼治疗反应:一项多中心回顾性研究

Fariba Tohidinezhad, Douwe J. Spaanderman, Natalia Oviedo Acosta, Kaouther Mouheb, Karthik Prathaban, David F. Hanff, Dirk J. Grünhagen, Cornelis Verhoef, Joris M. van Sabben, Evelyne Roets, Jette J. Slettenhaar, Hans Gelderblom, Ingrid M. E. Desar, Anna K. L. Reyners, Neeltje Steeghs, Stefan Klein, Martijn P. A. Starmans

机构 * Department of Radiology and Nuclear Medicine, Erasmus MC Cancer Institute, University Medical Center Rotterdam(埃拉斯姆斯MC癌症研究所放射学与核医学部,埃因霍温医学院鲁特沃特分校) Department of Surgical Oncology, Erasmus MC Cancer Institute, University Medical Center Rotterdam(埃拉斯姆斯MC癌症研究所外科肿瘤部,埃因霍温医学院鲁特沃特分校) Department of Pathology, Erasmus MC Cancer Institute, University Medical Center Rotterdam(埃拉斯姆斯MC癌症研究所病理学部,埃因霍温医学院鲁特沃特分校) Department of Medical Oncology, The Netherlands Cancer Institute, Amsterdam(荷兰癌症研究所医学肿瘤部,阿姆斯特丹) Department of Medical Oncology, Leiden University Medical Center, Leiden(莱顿大学医学中心医学肿瘤部,莱顿) Department of Medical Oncology, Radboud University Medical Centre, Nijmegen(拉德堡德大学医学中心医学肿瘤部,尼日梅根) Department of Medical Oncology, University Medical Center Groningen, University of Groningen(格罗宁根大学医学中心医学肿瘤部,格罗宁根) Department of Medical Oncology, Netherlands Cancer Institute, Antoni Van Leeuwenhoek(荷兰癌症研究所医学肿瘤部,安托万·弗莱明)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究开发了一种可解释的跨注意力多模态深度学习框架,整合CT影像和临床变量,用于预测胃肠道间质瘤对新辅助伊马替尼的治疗反应,在内部验证中达到高AUC但外部泛化性有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25865 2026-06-25 q-bio.BM 新提交 78%

Molexar: A Unified Multimodal Molecular Foundation Model for Drug Design

Molexar:用于药物设计的统一多模态分子基础模型

Haoyu Lin, Yiyan Liao, Jinmei Pan, Xinliao Ling, Luhua Lai, Jianfeng Pei

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出Molexar,一种基于Fragment-SELFIES的统一多模态分子基础模型,通过自回归解码和条件注入实现高效分子生成,在多个任务上达到或超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25796 2026-06-25 cs.RO 新提交 78%

MIL-LC: A Robust Magnetometer-Inertial-LiDAR Fusion Multimodal Localization Framework

MIL-LC:一种鲁棒的磁力计-惯性-LiDAR融合多模态定位框架

Qiyang Lyu, Zhenyu Wu, Wei Wang, Hongming Shen, Danwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Centre for Advanced Robotics Technology Innovation (CARTIN)(先进机器人技术创新中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出MIL-LC框架,融合磁力计、惯性和LiDAR,解决GNSS缺失、几何重复或无纹理环境下的定位问题,通过磁地图与LiDAR退化检测实现鲁棒定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25278 2026-06-25 cs.CV cs.AI 新提交 62%

Heterogeneous and Adept Snapshot Distillation for 3D Semantic Segmentation

异构与专长快照蒸馏用于3D语义分割

Xiaopei Wu, Yuenan Hou, Junkai Xu, Wenxiao Wang, Binbin Lin, Yu Li, Ping Li, Haifeng Liu, Deng Cai, Wanli Ouyang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出异构和专长快照知识蒸馏(HAS-KD),通过信息导向异构蒸馏(IHD)和专长快照蒸馏(ASD)将多模态模型和多个模型专家的知识高效迁移到点云网络,在ScanNetV2和S3DIS上取得最先进结果。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25319 2026-06-25 cs.CV 新提交 57%

V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning

V-Zero: 无答案标签的在线策略蒸馏与对比证据门控用于细粒度视觉推理

Haoxiang Sun, Zhihang Yi, Langxuan Deng, Yuhao Zhou, Peiqi Jia, Jian Zhao, Li Yuan, Jiancheng Lv, Tao Wang

机构 * SCU(四川大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出V-Zero框架,通过对比证据门控评估学生采样轨迹,无需答案标签即可实现细粒度视觉推理的在线策略蒸馏,训练速度比监督微调快5倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24960 2026-06-25 cs.LG cs.AI 新提交 57%

Enhancing Clinician Decision-Making via Uncertainty-Aware Multi-Expert Fusion for Stroke Rehabilitation

通过不确定性感知的多专家融合增强中风康复中的临床决策

Tamim Ahmed, Thanassis Rikakis

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出xAARA引擎,利用动态贝叶斯网络和熵门控融合多模态模型,为中风康复提供带校准不确定性和解释的ARAT评估,实现高准确率并减少不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00989 2026-06-25 cs.CV 57%

Towards Integrating Multi-Spectral Imaging with Gaussian Splatting

迈向多光谱成像与高斯点扩散的整合

Josef Grün, Lukas Meyer, Maximilian Weiherer, Bernhard Egger, Marc Stamminger, Linus Franke

机构 * Visual Computing Erlangen, Friedrich-Alexander-Universität Erlangen-Nürnberg, Germany(埃朗根视觉计算,埃朗根-纽伦堡弗里德里希-亚历山大大学,德国)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文研究如何将颜色(RGB)和多光谱成像(红、绿、红边和近红外)整合到3D高斯点扩散框架中,通过三种策略验证了联合优化的有效性,提升了多光谱重建质量。

Comments for project page, see https://meyerls.github.io/towards_multi_spec_splat/

详情

展开后加载摘要…

URL PDF HTML 收藏