arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-01 至 2026-04-01 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 15 篇

2603.29901 2026-04-01 cs.CV cs.CL 81%

Less Is More? Selective Visual Attention to High-Importance Regions for Multimodal Radiology Summarization

少即是多?选择性关注高重要性区域用于多模态放射学摘要

Mst. Fahmida Sultana Naznin, Adnan Ibney Faruq, Mushfiqur Rahman, Niloy Kumar Mondal, Md. Mehedi Hasan Shawon, Md Rakibul Hasan

机构 * Bangladesh University of Engineering and Technology(孟加拉国工程技术大学) BRAC University(布拉克大学) Curtin University(科廷大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文通过MIMIC-CXR基准测试表明,选择性关注病理相关视觉区域比全图更有效,提出ViTAS模型在多模态放射学摘要中取得SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00818 2026-04-01 cs.AI cs.CV 81%

Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning

Med-CMR:一个整合视觉证据和临床逻辑的细粒度基准,用于医疗复杂多模态推理

Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jiangning Zhang, Xiaobin Hu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Tongji University(同济大学) Ruijin Hospital(瑞金医院) Technical University of Munich(慕尼黑工业大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Med-CMR通过细粒度分解医疗多模态推理能力,设计挑战性任务并覆盖广泛高质量数据,评估18种先进大语言模型,发现GPT-5在多项选择题和开放性评分中表现最佳,但专业医疗大语言模型并不总能超越强通用模型,长尾泛化成为主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29677 2026-04-01 cs.LG cs.AI 79%

Mind the Gap: A Framework for Assessing Pitfalls in Multimodal Active Learning

注意差距:一个多模态主动学习中陷阱评估的框架

Dustin Eisenhardt, Yunhee Jeong, Florian Buettner

机构 * German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) German Cancer Consortium (DKTK)(德国癌症联盟(DKTK)) UCT Frankfurt-Marburg(法兰克福-马尔堡大学癌症中心) Institute of Informatics, Goethe University Frankfurt(法兰克福歌德大学信息学研究所) Department of Medicine, Goethe University Frankfurt(法兰克福歌德大学医学系) Frankfurt Cancer Institute (FCI)(法兰克福癌症研究所(FCI)) Crop Science Division, Bayer AG(拜耳股份公司作物科学部)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一个多模态主动学习评估框架,通过合成数据集系统评估主动学习策略,发现模型易产生不平衡表示,现有方法无法缓解此问题,需设计模态感知的查询策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29199 2026-04-01 cs.AI 79%

AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction

AEC-Bench:一种用于建筑、工程和施工领域代理系统的多模态基准

Harsh Mankodiya, Chase Gallik, Theodoros Galanos, Andriy Mulyar

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 AEC-Bench旨在评估建筑、工程和施工领域代理系统在真实任务中的表现,涵盖图纸理解、跨表单推理和项目级协调任务,通过多模型基准测试提升基础模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28784 2026-04-01 eess.SP cs.AI 79%

A Multi-Modal Dataset for Ground Reaction Force Estimation Using Consumer Wearable Sensors

一种用于使用消费级可穿戴传感器估计地面反作用力的多模态数据集

Parvin Ghaffarzadeh, Debarati Chakraborty, Koorosh Aslansefat, Ali Dostan, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学) Nottingham Trent University(诺丁汉特伦特大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出一个多模态数据集,用于通过苹果手表传感器估计垂直地面反作用力,包含惯性测量单元和力板数据,支持可穿戴生物力学研究和机器学习模型评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06874 2026-04-01 cs.CV 79%

MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

MVGGT:多模态视觉几何 grounded 变换器用于多视角3D指称表达分割

Changli Wu, Haodong Wang, Jiayi Ji, Yutian Yao, Chunsai Du, Jihua Kang, Yanwei Fu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ByteDance(字节跳动) Tianjin University of Science and Technology(天津科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MVGGT,一种高效的端到端框架,通过双分支设计将语言信息整合到稀疏视角的几何推理中,解决稀疏视角下的优化障碍,建立首个强基线,实现高精度和快速推理。

Comments Accepted to CVPR 2026; Project Website: https://mvggt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02536 2026-04-01 cs.CV 79%

MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark

MovieRecapsQA: 一种多模态开放式视频问答基准

Shaden Shaar, Bradon Thymes, Sirawut Chaixanien, Claire Cardie, Bharath Hariharan

机构 * Cornell University(康奈尔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MovieRecapsQA基准,通过电影回顾视频生成8200个开放式问题及事实,构建无参考评估指标,评估多模态能力,发现视觉感知是主要瓶颈。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29793 2026-04-01 cs.LG q-bio.QM 78%

Multimodal Machine Learning for Early Prediction of Metastasis in a Swedish Multi-Cancer Cohort

多模态机器学习在瑞典多癌队列中早期预测转移的应用

Franco Rugolon, Korbinian Randl, Braslav Jovanovic, Ioanna Miliou, Panagiotis Papapetrou

机构 * Karolinska University Hospital(卡罗林斯卡大学医院) Department of Computer and Systems Sciences, Stockholm University(斯德哥尔摩大学计算机与系统科学系)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出利用多模态机器学习在诊断前一个月预测转移风险,通过整合电子健康记录数据,比较单模态与多模态模型的性能,展示中间融合策略在多种癌症中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02350 2026-04-01 cs.HC 78%

FIRMED: A Peak-Centered Multimodal Dataset with Fine-Grained Annotation for Emotion Recognition

FIRMED:一种以峰值为中心的多模态数据集,用于情感识别的细粒度标注

Hao Tang, Songyun Xie, Xinzhou Xie, Can Liao, Bohan Li, Zhongyu Tian, Dalu Zheng

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 FIRMED通过即时回忆标注方法,提供同步的EEG、ECG、GSR、PPG和面部记录,以峰值为中心的标注减少了动态情感识别中的时间标签噪声,实验表明其在八种EEG分类器上平均提升3.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29967 2026-04-01 cs.CV 70%

Learning Structural-Functional Brain Representations through Multi-Scale Adaptive Graph Attention for Cognitive Insight

通过多尺度自适应图注意力学习结构-功能脑表示以获得认知洞察

Badhan Mazumder, Sir-Lord Wiafe, Aline Kotoski, Vince D. Calhoun, Dong Hye Ye

机构 * Georgia State University(佐治亚州立大学) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) Tri-Institutional Center for Translational Research in Neuroimaging and Data Science (TReNDS)(三机构神经影像与数据科学转化研究中心 (TReNDS))

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MAGNet框架,通过多尺度自适应图注意力机制融合结构和功能脑网络,提升认知功能理解。

Comments Preprint version of the paper accepted to the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026). This is the author's accepted manuscript. The final published version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29791 2026-04-01 cs.AI cs.CL cs.LG 62%

Reasoning-Driven Synthetic Data Generation and Evaluation

基于推理的合成数据生成与评估

Tim R. Davidson, Benoit Seguin, Enrico Bacis, Cesar Ilharco, Hamza Harkous

机构 * EPFL(瑞士联邦理工学院洛桑) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Simula框架,通过无种子、代理化方法生成大规模合成数据,提供可解释且可控的生成流程,验证了其在多种数据集上的有效性,为合成数据机制设计和大规模生成评估提供指导。

Comments Accepted to TMLR 2026, J2C Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29592 2026-04-01 cs.GR cs.CV 57%

Bioinspired123D: Generative 3D Modeling System for Bioinspired Structures

生物启发123D:用于生物启发结构的生成3D建模系统

Rachel K. Luu, Markus J. Buehler

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Bioinspired123D,一种轻量级模块化代码-几何管道,通过参数化程序直接生成可制造的3D结构,而非密集视觉表示。系统基于生物启发3D模型,结合多模态检索增强生成和视觉-语言模型批评者,实现了高效的文本到3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02413 2026-04-01 cs.CV 57%

TruckDrive: Long-Range Autonomous Highway Driving Dataset

TruckDrive:长距离自动驾驶高速公路数据集

Filippo Ghilotti, Edoardo Palladin, Samuel Brucker, Adam Sigal, Mario Bijelic, Felix Heide

机构 * Torc Robotics Princeton University(普林斯顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TruckDrive数据集,用于解决重卡车高速公路自动驾驶中长距离感知的挑战,通过多模态传感器采集47.5万样本,支持20秒序列中2D检测1000米和3D检测400米的感知基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18804 2026-04-01 cs.RO cs.HC 50%

"You've got a friend in me": Co-Designing a Peer Social Robot for Young Newcomers' Language and Cultural Learning

你在我身边:为新移民儿童语言和文化学习设计同伴社交机器人

Neil Fernandes, Cheng Tang, Tehniyat Shahbaz, Alex Hauschildt, Emily Davies-Robinson, Yue Hu, Kerstin Dautenhahn

机构 * University of Waterloo(滑铁卢大学) United for Literacy(联合扫盲组织)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文报告了一项与加拿大United for Literacy导师合作的共设计研究,开发了Maple社交助教机器人,通过短故事活动、多模态支架和嵌入式测验支持新移民儿童的语言和社会化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29141 2026-04-01 cs.CY 50%

Modernizing Ground Truth: Four Shifts Toward Improving Reliability and Validity in AI in Education

现代化真实数据:四种转变以提升教育中人工智能可靠性和有效性

Danielle R. Thomas, Conrad Borchers, Kirk P. Vanacore, Kenneth R. Koedinger, René F. Kizilcec

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文探讨了教育AI中真实数据质量的挑战,提出通过诊断信号、透明报告、偏见审计和有效性证据四种转变提升可靠性和有效性。

Comments Accepted as full paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏