arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-10 至 2026-04-10 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 6 篇

2510.12184 2026-04-10 cs.CV cs.AI 84%

CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs

CompoDistill:多模态大语言模型中基于注意力的知识蒸馏用于组合推理

Jiwan Kim, Kibum Kim, Sangwoo Seo, Chanyoung Park

机构 * KAIST(韩国科学技术院)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CompoDistill,通过显式对齐学生与教师模型的视觉注意力,提升多模态大语言模型的组合推理能力,同时保持视觉问答任务的性能。

Comments ICLR'26, Project Page : https://ptkjw1997.github.io/CompoDistill-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20223 2026-04-10 cs.LG cs.AI 83%

MultiModalPFN: Extending Prior-Data Fitted Networks for Multimodal Tabular Learning

多模态PFN:扩展先验数据拟合网络以进行多模态表格学习

Wall Kim, Chaeyoung Song, Hanul Kim

机构 * Samsung Electronics(三星电子) Seoul National University of Science and Technology(首尔科学技术大学)

专题命中 其他多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出MMPFN,通过引入多头门控MLP和跨注意力池化器,扩展TabPFN以处理表格和非表格模态,实验证明其在医疗和通用多模态数据集上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08476 2026-04-10 cs.CV cs.AI 81%

Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization

可信的GRPO:通过约束策略优化提升多模态语言模型的视觉空间推理

Sai Srinivas Kancheti, Aditya Kanade, Rohit Sinha, Vineeth N Balasubramanian, Tanuja Ganu

机构 * IIT Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Faithful GRPO,通过约束策略优化提升多模态模型的空间推理质量,减少推理不一致率并提升视觉 grounding 评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28618 2026-04-10 cs.AI 79%

Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning

与你共见:多模态推理中的感知-推理共进化

Ziqi Miao, Haonan Jia, Lijun Li, Chen Qian, Yuan Xiong, Wenting Yan, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Zhejiang University(浙江大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出PRCO框架,通过分离的奖励信号提升多模态推理的感知与推理能力,在八个基准测试中平均提升7个百分点。

Comments 21 pages, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01881 2026-04-10 cs.LG cs.AI 57%

Tractable Uncertainty-Aware Meta-Learning

可 tractable 的不确定性意识元学习

Young-Jin Park, Cesar Almecija, Apoorva Sharma, Navid Azizan

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出 LUMA,一种用于回归的元学习方法,能够高效地进行分布内任务的概率预测,检测分布外上下文数据,并有效处理异质多模态任务分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14611 2026-04-10 cs.HC 50%

Exploring MLLMs Perception of Network Visualization Principles

探索 MLLMs 对网络可视化原则的感知

Jacob Miller, Markus Wallinger, Ludwig Felder, Timo Brand, Henry Förster, Johannes Zink, Chunyang Chen, Stephen Kobourov

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究测试多模态大语言模型是否能在网络布局属性感知任务中匹配人类表现,发现MLLMs在同等条件下表现优于非专家,且提示工程可提升性能,表明其可能依赖视觉代理而非计算实际值。

详情

展开后加载摘要…

URL PDF HTML 收藏