arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-29 至 2026-07-29 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 14 篇

2602.00214 2026-07-29 cs.CV cs.AI 88%

A Geometric Multimodal Foundation Model Integrating Bp-MRI and Clinical Reports in Prostate Cancer Classification

一种整合Bp-MRI和临床报告的几何多模态基础模型用于前列腺癌分类

Juan A. Olmos, Antoine Manzanera, Fabio Martínez

机构 * Biomedical Imaging, Vision and Learning Laboratory (BIVL$^2$ab), UIS, Colombia(生物医学成像、视觉与学习实验室(BIVL²ab), UIS,哥伦比亚) U2IS, ENSTA, Institut Polytechnique de Paris, France(U2IS, ENSTA,巴黎理工学院,法国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MFM-Geom模型,通过整合Bp-MRI和临床报告,利用几何方法提升前列腺癌分类的准确性和鲁棒性。

Comments Accepted at IEEE International Symposium on Biomedical Imaging (ISBI) 2026

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25422 2026-07-29 cs.AI 新提交 88%

Salient Knowledge Pathways: Sparse Cross-Modal Routing for Efficient Knowledge-Intensive Multimodal Question Answering

显著知识路径:用于高效知识密集型多模态问答的稀疏跨模态路由

Noor Islam S. Mohammad, Uluğ Bayazıt

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI

AI总结 研究知识密集型多模态问答,提出SKIP架构,通过问题引导视觉令牌修剪等方法,沿稀疏路径计算路由,结合自适应预算控制器,在五个基准测试中,以更少计算量和更低延迟达到或超越密集基线准确性。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026) Workshop on Efficient Multimodal Question Answering (EMM-QA), Seoul, South Korea. Copyright 2026 by the author(s). (Archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26023 2026-07-29 cs.AI 新提交 83%

CHARM: A Multimodal Graph Foundation Model with Hierarchical Context Modeling for Zero-Shot Transfer

CHARM:一种用于零样本迁移的具有分层上下文建模的多模态图基础模型

Ankang Yang, Jitao Zhao, Di Jin, Yuxiao Huang, Dongxiao He

机构 * School of Computer Science and Technology, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部计算机科学与技术学院) Data Science Program, Columbian College of Arts and Sciences, The George Washington University(乔治华盛顿大学文理学院哥伦比亚艺术与科学学院数据科学项目)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究多模态图零样本迁移问题,提出CHARM模型,通过分层上下文建模,用图上下文替换原始节点,减少对目标域监督或适配的依赖,经实验验证该模型在零样本多模态图任务上有改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25818 2026-07-29 cs.CV 新提交 83%

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

SepPrune:一种基于分隔符的高效多模态大语言模型剪枝框架

Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

机构 * University of Science and Technology of China(中国科学技术大学) ChangXin Memory Technologies(长鑫存储技术有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对多模态大语言模型视觉令牌计算成本高的问题,提出SepPrune剪枝方法,以模态分隔符令牌为统一查询来排序和选择视觉令牌,复用内置投影参数,无需架构更改,在Qwen2.5-VL-7B上实验取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21831 2026-07-29 cs.CV 版本更新 83%

End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration

端到端3D时空感知与多模态融合及V2X协作

Zhenwei Yang, Yibo Ai, Weidong Zhang

机构 * National Center for Materials Service Safety(材料服务安全国家中心) University of Science and Technology Beijing(北京科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 XET-V2X通过多模态融合与V2X协作,实现端到端3D时空感知,提升复杂交通场景下的检测与跟踪性能。

Comments 21 pages, 10 figures

Journal ref IEEE Internet of Things Journal, vol. 13, no. 15, pp. 33456-33475, 1 Aug.1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25820 2026-07-29 cs.CV 新提交 79%

Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion

基于大语言模型衍生成分标签和多模态融合的食品图像分割

Jui-Feng Chi, Wei-Ta Chu, Sheng-Long Lin

机构 * National Cheng Kung University(国立成功大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有食品图像分割模型在相似成分和罕见类别上表现不佳的问题,提出两个多模态模块LIM-F和LIM-Q,利用大语言模型衍生标签提升分割性能,在FoodSeg103基准测试中取得领先,且内存消耗增加适度,为细粒度食品理解提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25322 2026-07-29 cs.AI 新提交 79%

From Cellular Responses to Pharmacological Domains: Multimodal Zero-Shot Drug Representation Learning

从细胞反应到药理学领域:多模态零样本药物表示学习

Jintao Huang, Lu Leng, Ziyuan Yang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态药物发现中存在的问题,提出PMRD框架,通过分离机制因素、构建共识反应域、增强机制候选、动态加权及结合互补表示等方法,实现多模态零样本药物性质预测,提升预测效果并减少化合物间冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20993 2026-07-29 cs.LG cs.AI stat.ML 版本更新 79%

Annotation-Assisted Learning of Treatment Policies From Multimodal Electronic Health Records

借助注释的学习:从多模态电子健康记录中学习治疗策略

Henri Arno, Thomas Demeester

机构 * Department of Information Technology Ghent University - imec(信息科技系根特大学 - imec)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出AACE方法,通过专家注释辅助学习多模态EHR中的因果策略,提升治疗决策效果。

Comments Accepted at Machine Learning for Healthcare (MLHC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24747 2026-07-29 cs.CR cs.HC 新提交 78%

Multimodal User Authentication Method via Fusion of Keystroke Dynamics and Glove-Based Hand Kinematics

通过击键动力学和基于手套的手部运动学融合的多模态用户认证方法

Issei Hyakuda, Lei Jing

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对击键动力学受环境影响问题,提出融合击键动力学与手部运动学的多模态认证框架,用定制手套捕获特征,经混合架构融合,通过“未见”评估协议验证,该方法能有效提升认证准确率,融合模态增强了生物识别辨别力。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22712 2026-07-29 cs.CV cs.AI physics.optics 版本更新 73%

scMIR: a vision-language foundation model for single-cell light microscopy image representation

scMIR:用于单细胞光学显微镜图像表示的视觉语言基础模型

Yifan Shang, Jiahui Tan, Xiangxiang Zeng, Renjie Zhou

专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究针对单细胞光学显微镜图像分析难题,提出scMIR模型,通过自监督图像重建与文本引导跨模态对齐,在多图像文本对上预训练,在多种复杂任务中表现出色,优于现有方法,具备强泛化能力,能推动高通量表型分析工作流程标准化和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25669 2026-07-29 cs.AI 新提交 57%

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

OmniDelta:用于OmniLLMs中令牌压缩的技能驱动预算分配

Haoyang Huang, Wenjie Huang, Tianqi Xu, Hongyaoxing Gu, Kang Tan, Yikai Fu, Yuhao Shen, Tianyu Liu, Baolin Zhang, Jun Zhang, Xinyi Hu, Jun Dai, Shuang Ge, Lei Chen, Yue Li, Mingchen Wang, Meng Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Alibaba(阿里巴巴)

专题命中 多模态训练与对齐 :omni-modal(abstract);分类 cs.AI

AI总结 研究针对OmniLLMs长音频-视频令牌序列成本高的问题,提出技能驱动的OmniDelta框架,通过构建技能池、结合意图与内容感知分配预算,能与现有策略结合,实验证明其在多个基准上建立新的准确性-效率前沿,减少内存并加速推理。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25377 2026-07-29 cs.CV cs.GR 新提交 57%

Gaussian Volumetric Representation for Efficient Shear-Warp Visualization

用于高效剪切变形可视化的高斯体表示

Mayuri Mathur, Ojaswa Sharma

机构 * Indraprastha Institute of Information Technology Delhi(德里英迪拉甘地信息技术学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究针对医学图像可视化计算成本高的问题,提出基于高斯的体表示,用蒙特卡罗体估计和课程学习策略优化,能从稀疏监督中学习解剖细节与纹理,降低计算成本,支持高效渲染多模态医学数据集,实现高帧率和高压缩比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23297 2026-07-29 cs.CV 版本更新 57%

PRIMA: Pre-Training with Risk-Integrated Image--Metadata Alignment for Medical Diagnosis with LLM-Based Feature Aggregation

PRIMA:通过大语言模型进行风险集成图像-元数据对齐的医学诊断预训练

Yiqing Wang, Chunming He, Ziyun Yang, Maria Woodward, Ming-Chen Lu, Mercy Pawar, Leslie Niziol, Sina Farsiu

机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学眼科与视觉科学系)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出PRIMA框架,通过检索增强生成策展风险-疾病关联专家语料库优化文本编码器,用双编码器预训练策略及四个互补损失函数弥合模态差距,融合特征用于疾病分类,性能优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25339 2026-07-29 cs.IR 新提交 50%

SPARC: Sequence-aware Progressive Attribute Routing and Compression Framework for Generative Recommendation

SPARC:用于生成式推荐的序列感知渐进式属性路由与压缩框架

Chang Liu, Changfa Wu, Hui Qian, Binbin Cao, Jian Wu, Yuliang Yan, Han Zhu, Bo Zheng

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究针对生成式推荐中现有离散语义ID问题,提出SPARC框架,通过建模序列依赖、路由多表示到插槽及轻量级交互,在不增输入长度下丰富用户历史表示,实验证明其性能优于基线,改进源于上下文条件信息保留。

详情

展开后加载摘要…

URL PDF HTML 收藏