arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-01 至 2026-05-01 共收录 21 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 21 篇

2602.00095 2026-05-01 cs.CV cs.AI cs.CY 84%

EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten Solutions

EDU-CIRCUIT-HW:评估多模态大语言模型在真实世界大学级STEM学生手写解答中的表现

Weiyu Sun, Liangliang Chen, Yongnuo Cai, Huiru Xie, Yi Zeng, Ying Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) Virginia Tech(弗吉尼亚理工学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EDU-CIRCUIT-HW数据集,用于评估多模态大语言模型在处理包含数学公式、图表和文本推理的大学STEM学生手写解答中的性能,揭示模型在自动评分中的可靠性问题,并提出通过纠正识别错误提升AI评分系统鲁棒性的方法。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Project Website: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL GitHub and Dataset: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24564 2026-05-01 cs.CL cs.IR cs.IT math.IT 83%

MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG

MEG-RAG: 多模态证据 grounding 的量化研究以提升 RAG 中的证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Quan Z. Sheng, Lina Yao

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Zhejiang University(浙江大学) Peking University(北京大学) University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(CSIRO 数据61)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出 MEG-RAG 框架,通过语义感知的多模态证据 grounding 方法提升 RAG 中的证据选择准确性与多模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12844 2026-05-01 cs.CV 83%

GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance

GuideDog: 一种用于视障和低视力者无障碍引导的现实世界单人视角多模态数据集

Junhyeok Kim, Jaewoo Park, Junhee Park, Sangeyl Lee, Jiwan Chung, Jisung Kim, Ji Hoon Joung, Youngjae Yu

机构 * Yonsei University(延世大学) LG AI Research(LG AI研究所) Euler Robotics(Euler机器人) Seoul National University(首尔国立大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 本文提出GuideDog数据集,包含22K图像描述对,用于提升视障者导航能力,通过人机协同标注提升数据质量,并展示深度感知评估基准,揭示当前多模态大语言模型在深度感知方面的挑战。

Comments ACL 2026 Main. Project page: https://jun297.github.io/GuideDog/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08611 2026-05-01 cs.IR cs.AI cs.CV cs.MM 82%

VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking

VeriTaS:首个动态多模态自动事实核查基准

Mark Rothermel, Marcus Kornmann, Marcus Rohrbach, Anna Rohrbach

机构 * Multimodal AI Lab(多模态AI实验室) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 为应对在线虚假信息的扩大规模,本文提出VeriTaS动态基准,通过自动化流程持续更新,涵盖104个专业机构的25000个真实声明,支持多模态事实核查评估。

Comments ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26288 2026-05-01 cs.CV cs.AI 81%

CheXthought: A global multimodal dataset of clinical chain-of-thought reasoning and visual attention for chest X-ray interpretation

CheXthought:一个包含临床推理链和视觉注意力的全球多模态数据集,用于胸部X光解读

Sonali Sharma, Jin Long, George Shih, Sarah Eid, Christian Bluethgen, Francine L. Jacobson, Emily B. Tsai, Global Radiology Consortium, Ahmed M. Alaa, Curtis P. Langlotz

机构 * Center for Artificial Intelligence in Medicine and Imaging(医学与影像人工智能中心) Department of Radiology(放射科) Department of Pediatrics(儿科) Department of Radiology, Weill Cornell Medicine(韦氏 Cornell 医学院放射科) Department of Radiology, Brigham and Women’s Hospital(布里奇妇产科医院放射科) University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Department of Biomedical Data Science(生物医学数据科学部)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 CheXthought数据集通过501名放射科医生的50312例多读X光片,提供了103592条推理链和6609082条同步视觉注意力标注,展示了临床推理模式,并在事实准确性、空间定位、病理分类、视觉忠实度、时间推理和不确定性沟通等方面提升了视觉语言模型性能。

Comments 51 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28011 2026-05-01 cs.CV 79%

Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation

Echo-α:用于超声解读的大型代理多模态推理模型

Jing Zhang, Wentao Jiang, Tao Huang, Zhiwei Wang, Jianxin Liu, Jian Chen, Ping Ye, Gang Wang, Zengmao Wang, Bo Du, Dacheng Tao

机构 * MiliLab(Mili实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 Echo-α结合了精确的病变定位和整体临床推理,通过九任务监督课程和强化学习提升超声解读的准确性和可解释性。

Comments 12 pages, 4 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14602 2026-05-01 cs.RO cs.AI cs.HC 79%

K2MUSE: A human lower-limb multimodal walking dataset spanning task and acquisition variability for rehabilitation robotics

K2MUSE:一种涵盖任务和采集变异性的下肢多模态行走数据集,用于康复机器人

Jiwei Li, Bi Zhang, Xiaowei Tan, Wanxin Chen, Zhaoyuan Liu, Juanjuan Zhang, Weiguang Huo, Jian Huang, Lianqing Liu, Xingang Zhao

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) College of Artificial Intelligence, Tianjin Key Laboratory of Intelligent Robotics, Nankai University(人工智能学院,天津智能机器人重点实验室,南开大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 K2MUSE数据集通过多模态数据揭示下肢康复机器人与生物力学信息的关系,为康复机器人开发提供大规模步态样本和数据驱动方法支持。

Comments 34 pages, 30 figures,7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27259 2026-05-01 cs.CV cs.LG 79%

VTBench: A Multimodal Framework for Time-Series Classification with Chart-Based Representations

VTBench: 一种基于图表表示的多模态时间序列分类框架

Madhumitha Venkatesan, Xuyang Chen, Dongyu Liu

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出VTBench,通过融合原始序列和图表可视化,系统评估了时间序列分类中图表类型、视觉编码和数据集的影响,展示了图表模型在特定领域的竞争力及多模态融合的优势。

Comments 8 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27217 2026-05-01 cs.AI 79%

Toward Personalized Digital Twins for Cognitive Decline Assessment: A Multimodal, Uncertainty-Aware Framework

迈向认知下降评估的个性化数字孪生:一种多模态、不确定性感知的框架

Bulent Soykan, Gulsah Hancerliogullari Koksalmis, Hsin-Hsiung Huang, Laura J. Brattain

机构 * Department of Mechanical, Industrial \& Manufac. Eng. The University of Toledo Toledo, OH, USA Department of Industrial Eng. Mngt. Systems University of Central Florida Orlando, FL, USA Department of Statistics Data Science University of Central Florida Orlando, FL, USA Department of Internal Medicine University of Central Florida Orlando, FL, USA

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种多模态、不确定性感知的框架,用于从稀疏、噪声和不规则的纵向数据中建模患者特定的疾病轨迹,通过结合潜在状态空间模型、多模态融合和不确定性感知验证,实现对认知下降的个性化评估。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27017 2026-05-01 eess.IV cs.LG stat.ML 78%

Validating the Clinical Utility of CineECG 3D Reconstructions through Cross-Modal Feature Attribution

通过跨模态特征归因验证CineECG 3D重建的临床价值

Karol Dobiczek, Maciej Mozolewski, Szymon Bobek, Michał Szafarczyk, Peter van Dam, Grzegorz J. Nalepa

机构 * Department of Human-Centered Artificial Intelligence, Institute of Applied Computer Science, Jagiellonian University(人类中心人工智能系,应用计算机科学研究所,雅盖隆大学) Faculty of Medicine, Jagiellonian University Medical College(医学系,雅盖隆大学医学院)

专题命中 多模态评测 :cross-modal(title,abstract)

AI总结 本文提出跨模态方法,将高性能12导联ECG模型的特征归因投影到CineECG 3D解剖空间,验证了其在临床整合中的有效性。

Comments Accepted to the CompHealth workshop at the 26th International Conference on Computational Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12652 2026-05-01 cs.CV 74%

CBEN -- A Multimodal Machine Learning Dataset for Cloud Robust Remote Sensing Image Understanding

CBEN -- 一种用于云鲁棒遥感图像理解的多模态机器学习数据集

Marco Stricker, Masakazu Iwamura, Koichi Kise

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出CBEN数据集,用于研究云干扰对遥感图像理解的影响,通过结合光学与雷达数据,验证云鲁棒方法在云覆盖场景下的有效性。

Comments We are currently in the process of selecting an appropriate journal for submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17056 2026-05-01 cs.CL cs.AI 62%

From Test-taking to Cognitive Scaffolding: A Pedagogical Diagnostic Benchmark for LLMs on English Standardized Tests

从应试到认知支架:一种面向LLM的教育诊断基准测试标准测试

Luoxi Tang, Tharunya Sundar, Yuqiao Meng, Shuai Yang, Ankita Patra, Lakshmi Manohar Chippada, Jiqian Zhao, Yi Li, Weicheng Ma, Zhaohan Xi

机构 * Binghamton University(宾夕法尼亚州立大学比灵顿分校) BlossomsAI(BlossomsAI公司) Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种教育诊断基准,通过认知框架模拟英语标准化测试问题解决过程,展示ESTBook基准测试在识别认知轨迹和改进教学推理中的实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28039 2026-05-01 cs.AI 57%

SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images

SpecVQA:一种用于科学图像光谱理解和视觉问答的基准测试

Jialu Shen, Han Lyu, Suyang Zhong, Hanzheng Li, Haoyi Tao, Nan Wang, Changhong Chen, Xi Fang

机构 * DP Technology(DP技术)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 SpecVQA通过7种典型光谱类型和专家标注的问答对,评估多模态模型在科学光谱理解中的能力,提出光谱数据采样与插值重建方法,提升模型在科学光谱理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00607 2026-05-01 cs.MM cs.SD 57%

MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation

MTAVG-Bench: 多说话人对话中心音频视频生成的诊断基准

Yang-Hao Zhou, Haitian Li, Rexar Lin, Heyan Huang, Jinxing Zhou, Changsen Yuan, Tian Lan, Ziqin Zhou, Yudong Li, Jiajun Xu, Jingyun Liao, Yi-Ming Cheng, Xuefeng Chen, Xian-Ling Mao, Yousheng Feng

机构 * Beijing Institute of Technology(北京理工大学) Shanghai University(上海大学) OpenNLP Lab(OpenNLP实验室) Beijing University of Technology(北京工业大学) The University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) Inkeverse Group Limited(Inkeverse集团)

专题命中 多模态评测 :audio-visual(abstract);分类 cs.MM

AI总结 本文提出MTAVG-Bench,用于评估多说话人对话中心音频视频生成的失败模式诊断,通过半自动化流程生成1.8k视频并标注2.4k问答对,评估音频视频信号保真度、时间属性一致性、社交互动和电影表现四个层面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14988 2026-05-01 cs.CV 57%

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

在细粒度图像任务上评估大型视觉-语言模型:全面评估

Hong-Tao Yu, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16942 2026-05-01 cs.CL 57%

NUTSHELL: A Dataset for Abstract Generation from Scientific Talks

NUTSHELL:用于从科学演讲中生成摘要的数据集

Maike Züfle, Sara Papi, Beatrice Savoldi, Marco Gaido, Luisa Bentivogli, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出NUTSHELL数据集,用于科学演讲摘要生成,通过建立基线模型和评估生成摘要质量,揭示SAG的挑战并促进改进模型和评估方法的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27654 2026-05-01 cs.CV 57%

MSR:Hybrid Field Modeling for CT-MRI Rigid-Deformable Registration of the Cervical Spine with an Annotated Dataset

MSR:用于带有标注数据集的颈椎脊柱CT-MRI刚-变形配准的混合场建模

Bohai Zhang, Wenjie Chen, Mu Li, Kaixing Long, Xing Shen, Xinqiang Yao, Jincheng Yang, Jianting Chen, Wei Yang, Qianjin Feng, Lei Cao

机构 * School of Biomedical Engineering, Southern Medical University, Guangzhou, 510515, China.(南方医科大学生物医学工程学院) Guangdong Provincial Key Laboratory of Medical Image Processing, Guangzhou, 510515, China.(广东省医学图像处理重点实验室) Guangdong Province Engineering Laboratory for Medical Imaging(广东省医学影像与诊断技术工程实验室) Information Center, Nanfang Hospital, Southern Medical University, Guangzhou, 510515, China.(南方医科大学南华医院信息中心) Division of Spine Surgery, Department of Orthopaedics, Nanfang hospital, Southern Medical University, Guangzhou, Guangdong, 510515, China.(南方医科大学南华医院骨科脊柱外科)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MSR框架,通过混合刚-变形配准方法提升颈椎脊柱CT-MRI配准精度,解决复杂结构配准难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27366 2026-05-01 cs.CV 57%

Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving

评判,然后驾驶:一种以评判为中心的视觉语言动作框架用于自动驾驶

Lijin Yang, Jianing Huang, Zhongzhan Huang, Shu Liu, Hao Yang

机构 * Bosch Research(博世研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CriticVLA框架,通过多模态评估和单步优化提升自动驾驶决策质量,实验显示其在复杂场景中性能显著优于现有方法。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12022 2026-05-01 cs.AI 57%

AI Models for Depressive Disorder Detection and Diagnosis: A Review

用于抑郁症检测和诊断的AI模型:综述

Dorsa Macky Aleagha, Payam Zohari, Mostafa Haghir Chehreghani

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了55项研究中的最新AI方法,提出层次分类体系,揭示图神经网络、大语言模型和多模态融合三大趋势,提供数据集和评估指标,为计算精神病学未来创新提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24848 2026-05-01 cs.CV cs.LG 57%

Reading Recognition in the Wild

野外阅读识别

Charig Yang, Samiul Alam, Shakhrul Iman Siam, Michael J. Proulx, Lambert Mathias, Kiran Somasundaram, Luis Pesqueira, James Fort, Sheroze Sheriffdeen, Omkar Parkhi, Carl Ren, Mi Zhang, Yuning Chai, Richard Newcombe, Hyo Jin Kim

机构 * Meta Reality Labs Research(Meta现实实验室) VGG, University of Oxford(VGG,牛津大学) The Ohio State University(俄亥俄州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出阅读识别任务,通过多模态数据和Transformer模型实现对阅读行为的识别,扩展了阅读研究的规模和现实场景。

Comments NeurIPS 2025. Project Page: https://www.projectaria.com/datasets/reading-in-the-wild/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22018 2026-05-01 cs.LG cs.SE 50%

Do Papers Tell the Whole Story? A Benchmark and Framework for Uncovering Hidden Implementation Gaps in Bioinformatics

论文是否讲完了全部故事?一个用于揭示生物信息学中隐藏实现差距的基准和框架

Tianxiang Xu, Xiaoyan Zhu, Xin Lai, Sizhe Dang, Xin Lian, Hangyu Cheng, Jiayin Wang

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 多模态评测 :cross-modal(abstract)

AI总结 本文提出论文-代码一致性检测任务,构建首个生物信息学基准数据集BioCon,通过统一框架提升代码与论文的一致性与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏