arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-13 至 2026-03-13 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2603.11987 2026-03-13 cs.AI 83%

LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories

LABSHIELD:一种多模态基准,用于科学实验室中的安全关键推理和规划

Qianpu Sun, Xiaowei Chi, Yuhan Rui, Ying Li, Kuangzhi Ge, Jiajun Li, Sirui Han, Shanghang Zhang

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 LABSHIELD是一个多模态基准,用于评估MLLM在科学实验室中的安全关键推理和规划能力,揭示了现有模型在专业实验室场景中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11924 2026-03-13 cs.LG cs.CL 79%

Chem4DLLM: 4D Multimodal LLMs for Chemical Dynamics Understanding

Chem4DLLM: 4D 多模态大语言模型用于化学动态理解

Xinyu Li, Zhen Zhang, Qi Chen, Anton van den Hengel, Lina Yao, Javen Qinfeng Shi

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 Chem4DLLM通过整合等变图编码器和预训练大语言模型,旨在提升对4D分子动态轨迹的解释能力,推动化学动态理解和多模态科学推理的研究。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11414 2026-03-13 cs.CL cond-mat.mtrl-sci 79%

MaterialFigBENCH: benchmark dataset with figures for evaluating college-level materials science problem-solving abilities of multimodal large language models

MaterialFigBENCH:用于评估多模态大语言模型在大学级材料科学问题解决能力的基准数据集

Michiko Yoshitake, Yuta Suzuki, Ryo Igarashi, Yoshitaka Ushiku, Keisuke Nagato

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 MaterialFigBench是一个评估多模态大语言模型在材料科学问题中图表解读能力的基准数据集,通过137个问题测试模型在视觉理解和数值精度上的表现,揭示了当前模型在图表处理方面的不足。

Comments 27 pages, 4 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14810 2026-03-13 cs.LG cs.AI 79%

MARIA: a Multimodal Transformer Model for Incomplete Healthcare Data

MARIA:一种用于不完整医疗数据的多模态Transformer模型

Camillo Maria Caruso, Paolo Soda, Valerio Guarrasi

机构 * UniCampus

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 MARIA是一种基于Transformer的多模态模型,通过掩码自注意力机制有效处理不完整医疗数据,优于现有方法在性能和鲁棒性方面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.14084 2026-03-13 cs.AI cs.LG 79%

Multimodal Explainability via Latent Shift applied to COVID-19 stratification

多模态可解释性通过潜在位移应用于COVID-19分层

Valerio Guarrasi, Lorenzo Tronchin, Domenico Albano, Eliodoro Faiella, Deborah Fazzini, Domiziana Santucci, Paolo Soda

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态可解释方法,通过潜在位移技术在COVID-19分层中实现决策解释,提升模型可解释性与分类性能。

Journal ref Pattern Recognition 156 (2024) 110825

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09175 2026-03-13 cs.RO 78%

STONE Dataset: A Scalable Multi-Modal Surround-View 3D Traversability Dataset for Off-Road Robot Navigation

STONE数据集:一个可扩展的多模态周围视图3D可通行性数据集用于越野机器人导航

Konyul Park, Daehun Kim, Jiyong Oh, Seunghoon Yu, Junseo Park, Jaehyun Park, Hongjae Shin, Hyungchan Cho, Jungho Kim, Jun Won Choi

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 STONE数据集通过大规模多模态数据和自动标注流程,为越野机器人导航中的3D可通行性预测提供了可扩展的地面真实值和基准测试平台。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12172 2026-03-13 eess.SP 71%

Simultaneous Multi-Modal Covert Communications: Analysis and Optimization

同时多模隐蔽通信:分析与优化

Justin H. Kong, Terrence J. Moore, Fikadu T. Dagefu

专题命中 多模态评测 :multi-modal(title)

AI总结 本文提出了一种低复杂度的多模隐蔽通信模式选择技术,旨在在满足速率约束的前提下最大化隐蔽性,通过分析不同对手知识状态下的检测错误概率,验证了其性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02626 2026-03-13 q-bio.QM 71%

A Wrist-Worn Multimodal Reaction Time Monitoring Device for Ecologically-Valid Cognitive Assessment

一种用于生态化认知评估的腕戴式多模态反应时间监测设备

Abhigyan Sarkar, Boris Rubinsky

专题命中 多模态评测 :multimodal(title)

AI总结 本文提出了一种低成本腕戴式设备,用于在现实环境中实现多模态反应时间的高精度监测,支持非侵入式认知评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12266 2026-03-13 cs.CV 70%

MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning

MM-CondChain: 一种可编程验证的视觉基础深度组合推理基准

Haozhan Shen, Shilin Yan, Hongwei Xue, Shuaiqi Lu, Xiaojun Tang, Guannan Zhang, Tiancheng Zhao, Jianwei Yin

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 MM-CondChain提出了一种可编程验证的视觉基础深度组合推理基准,通过多层推理链评估多模态大语言模型在复杂视觉任务中的表现,实验表明深度组合推理仍是重大挑战。

Comments Project Page: https://accio-lab.github.io/MM-CondChain

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18675 2026-03-13 cs.CV cs.AI cs.CL 67%

ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps

ReasonMap:迈向基于交通地图的细粒度视觉推理

Sicheng Feng, Song Wang, Shuyi Ouyang, Lingdong Kong, Zikai Song, Jianke Zhu, Huan Wang, Xinchao Wang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 ReasonMap是一个针对交通地图的细粒度视觉推理基准,通过评估16种MLLMs揭示开源与闭源模型在推理性能上的差异,并强调视觉支撑对高性能的重要性。

Comments CVPR 2026, website: https://fscdc.github.io/ReasonMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03772 2026-03-13 eess.IV cs.AI cs.CV 62%

Multi-objective optimization determines when, which and how to fuse deep networks: an application to predict COVID-19 outcomes

多目标优化确定何时、何种及如何融合深度网络:应用于预测新冠结局的应用

Valerio Guarrasi, Paolo Soda

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多目标优化方法,用于确定何时、何种及如何融合深度网络,以提升新冠预测的准确性和鲁棒性。

Journal ref Computers in Biology and Medicine 154 (2023) 106625

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11915 2026-03-13 cs.CL 57%

CoMMET: To What Extent Can LLMs Perform Theory of Mind Tasks?

CoMMET:大型语言模型在理论思维任务中能发挥多大作用?

Ruirui Chen, Weifeng Jiang, Chengwei Qin, Cheston Tan

机构 * Agency for Science, Technology and Research (A*STAR)(科技研究局) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州),中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出CoMMET多模态基准数据集,用于评估大型语言模型在多轮对话中的理论思维能力,通过扩展心理状态评估和引入多轮测试,分析模型优劣势并指明未来改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11846 2026-03-13 cs.CV 57%

ZeroSense:How Vision matters in Long Context Compression

ZeroSense:视觉在长上下文压缩中的作用

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ZeroSense框架,通过解耦多模态大语言模型能力,评估视觉-文本压缩质量,并通过低语义相关性基准测试验证长上下文压缩效果与下游任务准确性之间的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11093 2026-03-13 cs.AI cs.RO 57%

A Survey of Reasoning in Autonomous Driving Systems: Open Challenges and Emerging Paradigms

自动驾驶系统推理的综述:开放挑战与新兴范式

Kejin Yu, Yuhan Sun, Taiqiang Wu, Ruixu Zhang, Zhiqiang Lin, Yuxin Meng, Junjie Wang, Yujiu Yang

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了自动驾驶系统推理的挑战与新兴范式,提出认知层次分解驾驶任务,并系统化七个核心推理挑战,强调发展可验证的神经符号架构以解决高延迟推理与安全需求的矛盾。

Comments Published in TMLR (March 2026) | OpenReview: https://openreview.net/forum?id=XwQ7dc4bqn

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21066 2026-03-13 cs.AI cs.HC 57%

Agentic Explainable Artificial Intelligence (Agentic XAI) Approach To Explore Better Explanation

代理可解释人工智能(代理XAI)方法探索更好的解释

Tomoaki Yamaguchi, Yutong Zhou, Masahiro Ryo, Keisuke Katsura

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种结合SHAP解释性和多模态LLM迭代细化的代理XAI框架,通过农业推荐系统验证,发现早期停止可提升推荐质量,但过度细化导致性能下降,揭示了偏差-方差权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11324 2026-03-13 cs.CR 50%

LROO Rug Pull Detector: A Leakage-Resistant Framework Based on On-Chain and OSINT Signals

LROO Rug Pull Detector:一种基于链上和开源情报信号的抗泄漏框架

Fatemeh Shoaei, Mohammad Pishdar, Mozafar Bag-Mohammadi, Mojtaba Karami

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出了一种基于链上和开源情报信号的抗泄漏框架,用于早期识别 rug pull 攻击,通过整合多模式数据提升检测性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏