arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-25 至 2026-06-25 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2507.16518 2026-06-25 cs.CV cs.CL cs.LG 版本更新 84%

SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning

SyncLoop: 一种用于自我改进数学推理的多模态双循环框架

Xiuwei Chen, Wentao Hu, Hanhui Li, Yongxin Wang Jun Zhou, Zisheng Chen, Meng Cao, Yihan Zeng, Kui Zhang, Yu-Jie Yuan, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) MBZUAI Huawei Noah’s Ark Lab(华为诺亚实验室) Yinwang Intelligent Technology Co. Ltd(依文智科有限公司)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出SyncLoop多模态双循环框架,通过跨模态数据演化循环和数据-模型演化循环联合进化训练数据和模型能力,解决数据复杂度不匹配和演化分离问题,在数学推理基准上持续提升性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25657 2026-06-25 cs.CV cs.AI 新提交 73%

Steering Vision-Language Models with Joint Sparse Autoencoders

用联合稀疏自编码器引导视觉-语言模型

Huizhen Shu, Xuying Li, Hongxu Lin, Wenjie Sun, Hui Li

机构 * yunshanai(云山AI) HKUST(Guangzhou)(香港科技大学(广州)) Zidongtaichu(紫东太初) University of British Columbia(不列颠哥伦比亚大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出联合稀疏自编码器(JSAE),通过显式对齐约束联合分解视觉和语言激活,得到可解释的跨模态特征,并在LLaVA等模型上验证了层依赖的干预效果。

Comments 19pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11421 2026-06-25 cs.CV cs.LG 版本更新 70%

BOFA: Bridge-Layer Orthogonal Low-Rank Fusion for CLIP-Based Class-Incremental Learning

BOFA: 基于CLIP的类增量学习中的桥接层正交低秩融合

Lan Li, Tao Hu, Da-Wei Zhou, Jia-Qi Yang, Han-Jia Ye, De-Chuan Zhan

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出BOFA框架,通过将适应限制在CLIP的跨模态桥接层并使用正交低秩融合防止遗忘,无需额外参数或数据回放,实现高效类增量学习。

Comments Accepted by AAAI 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(27): 22967-22975, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25546 2026-06-25 cs.CV 新提交 57%

Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography

面向3D计算机断层扫描的疾病中心视觉语言预训练与混合视觉编码

Bowen Shi, Weiwei Cao, Ruifeng Yuan, Wanxing Chang, Wenrui Dai, Hongkai Xiong, Ling Zhang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab, 310023, Hangzhou, China(虎扑实验室,杭州,中国) Shanghai Jiao Tong University, China(上海交通大学,中国) Zhejiang University, China(浙江大学,中国) Fudan University, China(复旦大学,中国)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出一种结合CNN-ViT混合编码器、疾病级对比学习和诊断感知提示的视觉语言预训练框架,在CT-RATE和Rad-ChestCT上取得最优性能,并提升零样本诊断可靠性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25084 2026-06-25 cs.CV 新提交 57%

Are We There Yet? Exploring the Capabilities of MLLMs in Assistive AI Applications

我们到了吗?探索多模态大语言模型在辅助人工智能应用中的能力

Shayon Dasgupta, Avijit Dasgupta, C. V. Jawahar

机构 * IIT BHU India(印度理工学院瓦拉纳西校区) CVIT, IIIT Hyderabad India(印度海得拉巴国际信息技术学院计算机视觉与信息技术中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文通过真实世界任务评估多模态大语言模型在辅助AI中的表现,开发NetraLink系统收集基准数据,揭示其优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24570 2026-06-25 cs.CV 新提交 57%

Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning

Jolia: 用于3D CT对比学习的概念级视觉-语言对齐

Julien Khlaut, Charles Corbière, Baptiste Callard, Amaury Prat, Leo Butsanets, Antoine Saporta, Théo Danielou, Leo Machado, Korentin Le Floch, Tom Boeken, Pierre Manceron, Corentin Dancette

机构 * Raidium Department of Vascular and Oncological Interventional Radiology, Hôpital Européen Georges Pompidou, AP-HP(欧洲乔治·蓬皮杜医院血管与肿瘤介入放射科,AP-HP) Faculté de Santé, Université Paris-Cité(巴黎西岱大学健康学院) HEKA, INRIA(HEKA,法国国家信息与自动化研究所) Imaging Department, Fondation Ophtalmologique Adolphe de Rothschild(阿道夫·罗斯柴尔德眼科基金会影像科)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 提出ConQuer方法,通过概念查询将报告拆分为特定概念部分,学习交叉注意力查询以匹配图像特征,实现概念级对齐,在胸部与腹部CT上训练的Jolia模型在多项任务中超越CLIP基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25591 2026-06-25 cs.RO 新提交 50%

WOLF-VLA: Whole-Body Humanoid Optimal Locomotion Framework for Vision-Language-Action Learning

WOLF-VLA:面向视觉-语言-动作学习的全身人形最优运动框架

Melya Boukheddimi, Omar Adjali, Daniel Sontag, Frank Kirchner

机构 * Robotics Innovation Center, DFKI GmbH(德国人工智能研究中心机器人创新中心) University of Oldenburg(奥尔登堡大学) AG Robotik University of Bremen(不来梅大学机器人工作组)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 提出WOLF-VLA框架,结合全身最优控制运动合成与大规模多模态数据集,训练VLA模型从自然语言指令生成人形运动策略,在多种任务中展现强鲁棒性和竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏