arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-13 至 2026-03-13 共收录 68 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2603.11924 2026-03-13 cs.LG cs.CL 79%

Chem4DLLM: 4D Multimodal LLMs for Chemical Dynamics Understanding

Chem4DLLM: 4D 多模态大语言模型用于化学动态理解

Xinyu Li, Zhen Zhang, Qi Chen, Anton van den Hengel, Lina Yao, Javen Qinfeng Shi

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 Chem4DLLM通过整合等变图编码器和预训练大语言模型,旨在提升对4D分子动态轨迹的解释能力,推动化学动态理解和多模态科学推理的研究。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11414 2026-03-13 cs.CL cond-mat.mtrl-sci 79%

MaterialFigBENCH: benchmark dataset with figures for evaluating college-level materials science problem-solving abilities of multimodal large language models

MaterialFigBENCH:用于评估多模态大语言模型在大学级材料科学问题解决能力的基准数据集

Michiko Yoshitake, Yuta Suzuki, Ryo Igarashi, Yoshitaka Ushiku, Keisuke Nagato

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 MaterialFigBench是一个评估多模态大语言模型在材料科学问题中图表解读能力的基准数据集,通过137个问题测试模型在视觉理解和数值精度上的表现,揭示了当前模型在图表处理方面的不足。

Comments 27 pages, 4 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14810 2026-03-13 cs.LG cs.AI 79%

MARIA: a Multimodal Transformer Model for Incomplete Healthcare Data

MARIA:一种用于不完整医疗数据的多模态Transformer模型

Camillo Maria Caruso, Paolo Soda, Valerio Guarrasi

机构 * UniCampus

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 MARIA是一种基于Transformer的多模态模型,通过掩码自注意力机制有效处理不完整医疗数据,优于现有方法在性能和鲁棒性方面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.14084 2026-03-13 cs.AI cs.LG 79%

Multimodal Explainability via Latent Shift applied to COVID-19 stratification

多模态可解释性通过潜在位移应用于COVID-19分层

Valerio Guarrasi, Lorenzo Tronchin, Domenico Albano, Eliodoro Faiella, Deborah Fazzini, Domiziana Santucci, Paolo Soda

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态可解释方法,通过潜在位移技术在COVID-19分层中实现决策解释,提升模型可解释性与分类性能。

Journal ref Pattern Recognition 156 (2024) 110825

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09175 2026-03-13 cs.RO 78%

STONE Dataset: A Scalable Multi-Modal Surround-View 3D Traversability Dataset for Off-Road Robot Navigation

STONE数据集:一个可扩展的多模态周围视图3D可通行性数据集用于越野机器人导航

Konyul Park, Daehun Kim, Jiyong Oh, Seunghoon Yu, Junseo Park, Jaehyun Park, Hongjae Shin, Hyungchan Cho, Jungho Kim, Jun Won Choi

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 STONE数据集通过大规模多模态数据和自动标注流程,为越野机器人导航中的3D可通行性预测提供了可扩展的地面真实值和基准测试平台。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12172 2026-03-13 eess.SP 71%

Simultaneous Multi-Modal Covert Communications: Analysis and Optimization

同时多模隐蔽通信:分析与优化

Justin H. Kong, Terrence J. Moore, Fikadu T. Dagefu

专题命中 多模态评测 :multi-modal(title)

AI总结 本文提出了一种低复杂度的多模隐蔽通信模式选择技术,旨在在满足速率约束的前提下最大化隐蔽性,通过分析不同对手知识状态下的检测错误概率,验证了其性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02626 2026-03-13 q-bio.QM 71%

A Wrist-Worn Multimodal Reaction Time Monitoring Device for Ecologically-Valid Cognitive Assessment

一种用于生态化认知评估的腕戴式多模态反应时间监测设备

Abhigyan Sarkar, Boris Rubinsky

专题命中 多模态评测 :multimodal(title)

AI总结 本文提出了一种低成本腕戴式设备,用于在现实环境中实现多模态反应时间的高精度监测,支持非侵入式认知评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12266 2026-03-13 cs.CV 70%

MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning

MM-CondChain: 一种可编程验证的视觉基础深度组合推理基准

Haozhan Shen, Shilin Yan, Hongwei Xue, Shuaiqi Lu, Xiaojun Tang, Guannan Zhang, Tiancheng Zhao, Jianwei Yin

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 MM-CondChain提出了一种可编程验证的视觉基础深度组合推理基准,通过多层推理链评估多模态大语言模型在复杂视觉任务中的表现,实验表明深度组合推理仍是重大挑战。

Comments Project Page: https://accio-lab.github.io/MM-CondChain

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18675 2026-03-13 cs.CV cs.AI cs.CL 67%

ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps

ReasonMap:迈向基于交通地图的细粒度视觉推理

Sicheng Feng, Song Wang, Shuyi Ouyang, Lingdong Kong, Zikai Song, Jianke Zhu, Huan Wang, Xinchao Wang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 ReasonMap是一个针对交通地图的细粒度视觉推理基准,通过评估16种MLLMs揭示开源与闭源模型在推理性能上的差异,并强调视觉支撑对高性能的重要性。

Comments CVPR 2026, website: https://fscdc.github.io/ReasonMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03772 2026-03-13 eess.IV cs.AI cs.CV 62%

Multi-objective optimization determines when, which and how to fuse deep networks: an application to predict COVID-19 outcomes

多目标优化确定何时、何种及如何融合深度网络:应用于预测新冠结局的应用

Valerio Guarrasi, Paolo Soda

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多目标优化方法,用于确定何时、何种及如何融合深度网络,以提升新冠预测的准确性和鲁棒性。

Journal ref Computers in Biology and Medicine 154 (2023) 106625

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11915 2026-03-13 cs.CL 57%

CoMMET: To What Extent Can LLMs Perform Theory of Mind Tasks?

CoMMET:大型语言模型在理论思维任务中能发挥多大作用?

Ruirui Chen, Weifeng Jiang, Chengwei Qin, Cheston Tan

机构 * Agency for Science, Technology and Research (A*STAR)(科技研究局) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州),中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出CoMMET多模态基准数据集,用于评估大型语言模型在多轮对话中的理论思维能力,通过扩展心理状态评估和引入多轮测试,分析模型优劣势并指明未来改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11846 2026-03-13 cs.CV 57%

ZeroSense:How Vision matters in Long Context Compression

ZeroSense:视觉在长上下文压缩中的作用

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ZeroSense框架,通过解耦多模态大语言模型能力,评估视觉-文本压缩质量,并通过低语义相关性基准测试验证长上下文压缩效果与下游任务准确性之间的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11093 2026-03-13 cs.AI cs.RO 57%

A Survey of Reasoning in Autonomous Driving Systems: Open Challenges and Emerging Paradigms

自动驾驶系统推理的综述:开放挑战与新兴范式

Kejin Yu, Yuhan Sun, Taiqiang Wu, Ruixu Zhang, Zhiqiang Lin, Yuxin Meng, Junjie Wang, Yujiu Yang

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了自动驾驶系统推理的挑战与新兴范式,提出认知层次分解驾驶任务,并系统化七个核心推理挑战,强调发展可验证的神经符号架构以解决高延迟推理与安全需求的矛盾。

Comments Published in TMLR (March 2026) | OpenReview: https://openreview.net/forum?id=XwQ7dc4bqn

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21066 2026-03-13 cs.AI cs.HC 57%

Agentic Explainable Artificial Intelligence (Agentic XAI) Approach To Explore Better Explanation

代理可解释人工智能(代理XAI)方法探索更好的解释

Tomoaki Yamaguchi, Yutong Zhou, Masahiro Ryo, Keisuke Katsura

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种结合SHAP解释性和多模态LLM迭代细化的代理XAI框架,通过农业推荐系统验证,发现早期停止可提升推荐质量,但过度细化导致性能下降,揭示了偏差-方差权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11324 2026-03-13 cs.CR 50%

LROO Rug Pull Detector: A Leakage-Resistant Framework Based on On-Chain and OSINT Signals

LROO Rug Pull Detector:一种基于链上和开源情报信号的抗泄漏框架

Fatemeh Shoaei, Mohammad Pishdar, Mozafar Bag-Mohammadi, Mojtaba Karami

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出了一种基于链上和开源情报信号的抗泄漏框架,用于早期识别 rug pull 攻击,通过整合多模式数据提升检测性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 4 篇

2509.22961 2026-03-13 stat.ME 78%

Measuring capacities in multimodal maritime port systems with anchorage queues

多模式港口系统中锚泊队列容量的测量

Debojjal Bagchi, Kyle Bathgate, Kenneth N. Mitchell, Magdalena I. Asborno, Marin M. Kress, Stephen D. Boyles

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出了一种方法,用于估算多模式港口系统的运营和终极容量,通过队列模型和微分方程模型分析休斯顿港的吞吐量及瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11392 2026-03-13 cs.NI cs.AI 57%

Agentic AI for Embodied-enhanced Beam Prediction in Low-Altitude Economy Networks

面向低空经济网络的具身增强型波束预测的代理AI

Min Hao, Zhizhuo Li, Zirui Zhang, Maoqiang Wu, Han Zhang, Rong Yu

机构 * School of Electronic Science and Engineering, South China Normal University(南方科技大学电子科学与工程学院) School of Intelligent Engineering, Shaoguan university(韶关大学智能工程学院) School of Automation, Guangdong University of Technology(广东工业大学自动化学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于多代理协作推理的混合波束预测模型,通过整合时序建模、视觉编码和多模态融合,提升低空经济网络中UAV通信的波束预测精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11569 2026-03-13 cs.HC 50%

Modeling Sequential Design Actions as Designer Externalization on an Infinite Canvas

将顺序设计动作建模为设计师在无限画布上的外部化

Yejin Yun, Seung Won Lee, Jiin Choi, Kyung Hoon Hyun

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究探讨了AI在无限画布设计中的作用,发现AI通过改变认知分配和工作流程,促进了设计师与AI的协同进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11476 2026-03-13 cs.LG q-bio.QM 50%

Leveraging Phytolith Research using Artificial Intelligence

利用人工智能进行phytolith研究

Andrés G. Mejía Ramón, Kate Dudgeon, Nina Witteveen, Dolores Piperno, Michael Kloster, Luigi Palopoli, Mónica Moraes R., José M. Capriles, Umberto Lombardo

专题命中 多模态Agent :multimodal(abstract)

AI总结 Sorometry通过人工智能整合2D和3D数据,实现phytolith的高效分析与预测,提升考古和古生态研究的精度与标准化。

Comments 45 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 9 篇

2602.06965 2026-03-13 cs.CV 87%

MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images

MedMO:为医学图像构建和理解多模态大语言模型

Ankan Deria, Komal Kumar, Adinath Madhavrao Dukre, Eran Segal, Salman Khan, Imran Razzak

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);multimodal foundation model(abstract)

AI总结 MedMO是一种基于通用MLLM架构构建的医学多模态基础模型,通过多阶段训练提升跨模态和任务的性能,超越现有开源基线,在医学图像识别和报告生成中取得显著提升。

Comments 21 pages, 6 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11644 2026-03-13 cs.CV cs.AI 84%

IDRL: An Individual-Aware Multimodal Depression-Related Representation Learning Framework for Depression Diagnosis

IDRL: 一种面向抑郁症诊断的个体感知多模态抑郁症相关表示学习框架

Chongxiao Wang, Junjie Liang, Peng Cao, Jinzhu Yang, Osmar R. Zaiane

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Key Laboratory of Intelligent Computing in Medical Image of Ministry of Education, Northeastern University, Shenyang, China(教育部医学图像智能计算重点实验室) National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Shenyang, China(工业智能与系统优化国家级前沿科学中心) Alberta Machine Intelligence Institute, University of Alberta, Edmonton, Canada(阿尔伯塔机器智能研究所,阿尔伯塔大学,加拿大爱德蒙顿)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 IDRL框架通过分解多模态表示并引入个体感知的模态融合模块,提升抑郁症诊断的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05391 2026-03-13 cs.CV 83%

LoC-Path: Learning to Compress for Pathology Multimodal Large Language Models

LoC-Path:学习压缩用于病理多模态大语言模型

Qingqiao Hu, Weimin Lyu, Meilong Xu, Kehan Qi, Xiaoling Hu, Saumya Gupta, Jiawei Zhou, Chao Chen

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 LoC-Path通过压缩滑片图像特征,降低多模态模型的训练和推理成本,使在有限资源下实现高效病理大语言模型成为可能。

Comments Code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11306 2026-03-13 cs.CV 83%

Hierarchical Granularity Alignment and State Space Modeling for Robust Multimodal AU Detection in the Wild

层次粒度对齐与状态空间建模用于野外多模态面部动作单元检测

Jun Yu, Yunxiang Zhang, Naixiang Zheng, Lingsi Zhu, Guoyuan Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出了一种基于层次粒度对齐和状态空间模型的多模态框架,通过强大的基础模型提取高保真视觉和音频表示,并引入视觉-马尔可夫模型和不对称交叉注意机制,实现对野外环境中面部动作单元的高效检测。

Comments 8 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11220 2026-03-13 cs.CV cs.CL 81%

Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models

频率调制的视觉修复用于Matryoshka大多模态模型

Qingtao Pan, Zhihao Dou, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出FMVR策略,通过频率调制修复视觉语义,提升LMMs在减少视觉token时的推理能力,并在多个基准测试中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12166 2026-03-13 cs.CV 79%

LatentGeo: Learnable Auxiliary Constructions in Latent Space for Multimodal Geometric Reasoning

LatentGeo: 在潜在空间中学习可学习的辅助构造以进行多模态几何推理

Haiying Xu, Zihan Wang, Song Dai, Zhengxuan Zhang, Kairan Dou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nankai University(南开大学) Communication University of China(中国传媒大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 LatentGeo通过学习潜在空间中的连续视觉表示,解决多模态几何推理中辅助构造的表示问题,采用三阶段课程和强化学习方法提升几何推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02686 2026-03-13 cs.LG cs.AI 79%

A Systematic Review of Intermediate Fusion in Multimodal Deep Learning for Biomedical Applications

多模态深度学习在生物医学应用中的中间融合系统综述

Valerio Guarrasi, Fatih Aksu, Camillo Maria Caruso, Francesco Di Feola, Aurora Rofena, Filippo Ruffini, Paolo Soda

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文系统综述了多模态深度学习在生物医学应用中的中间融合方法,分析了现有技术、挑战及未来方向,并提出结构化符号以促进方法的广泛应用。

Journal ref Image and Vision Computing 158 (2025) 105509

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11617 2026-03-13 cs.CV 57%

Noise-aware few-shot learning through bi-directional multi-view prompt alignment

通过双向多视图提示对齐实现噪声感知的少样本学习

Lu Niu, Cheng Xue

机构 * Southeast University(东南大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 NA-MVP通过双向多视图提示对齐实现噪声感知少样本学习,有效区分干净与噪声线索,提升模型在噪声环境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11117 2026-03-13 cs.LG 50%

Learning Tree-Based Models with Gradient Descent

通过梯度下降学习基于树的模型

Sascha Marton

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出通过梯度下降学习硬轴对齐决策树的方法,解决传统方法的局限性,提升树模型在多个领域的性能和适用性。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 10 篇

2602.20197 2026-03-13 cs.LG cs.AI 83%

Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning

混合策略强化学习可调节探索用于多模态推理

Zhuoxu Huang, Mengxi Jia, Hao Sun, Xuelong Li, Jungong Han

机构 * Aberystwyth University(阿伯里斯特维斯大学) Institute of Artificial Intelligence (TeleAl)(人工智能研究所) China Telecom(中国电信) Tsinghua University(清华大学)

专题命中 其他多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出CalibRL框架,通过分布感知优势加权和非对称激活函数实现可控探索,提升多模态推理模型的探索与利用平衡。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23830 2026-03-13 cs.DC cs.AI 83%

OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training

OrchMLLM: 通过批量后平衡 orchestrate 多模态数据以加速多模态大语言模型训练

Yijie Zheng, Bangjun Xiao, Lei Shi, Xiaoyang Li, Faming Wu, Tianyu Li, Xuefeng Xiao, Yang Zhang, Yuxuan Wang, Shouda Liu

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 OrchMLLM通过批量后平衡调度器和全局协调器解决多模态数据训练中的模态不一致问题,提升训练效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏