arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-20 至 2026-04-20 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2602.21950 2026-04-20 cs.CL 83%

MEDSYN: Benchmarking Multi-EviDence SYNthesis in Complex Clinical Cases for Multimodal Large Language Models

MEDSYN:多证据合成在复杂临床病例中的基准测试用于多模态大语言模型

Boqi Chen, Xudong Liu, Jiachuan Peng, Marianne Frey-Marti, Bang Zheng, Kyle Lam, Lin Li, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) Amazon(亚马逊) University of Oxford(牛津大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) Peking University(北京大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 MEDSYN是一个多语言、多模态的复杂临床病例基准测试,用于评估多模态大语言模型在差分诊断和最终诊断中的表现,揭示模型在异质临床证据合成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16060 2026-04-20 cs.CV cs.AI 81%

Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs

基于链式思维的多模态大语言模型视觉空间推理能力退化

Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian, Tanuja Ganu

机构 * Microsoft Research India(微软印度研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究发现链式思维范式在视觉空间推理任务中导致性能下降,通过实验揭示多模态模型在空间基准测试中的关键缺陷,并指出需转向以视觉为中心的推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16054 2026-04-20 cs.CV cs.AI 81%

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

Mind's Eye:多模态大语言模型的视觉抽象、转换与组合基准

Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N Balasubramanian, Tanuja Ganu

机构 * CSE Dept., IIT Hyderabad(IIT海得拉巴计算机科学与工程系) Microsoft Research(微软研究院) IIT Hyderabad(IIT海得拉巴)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Mind's Eye基准,通过A-R-T分类评估多模态大语言模型的视觉认知能力,发现人类准确率达80%,而顶级模型低于50%,揭示模型在视觉空间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13058 2026-04-20 cs.CL cs.LG cs.MM 81%

KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context

KMMMU:评估韩语多学科多模态理解

Nahyun Lee, Guijin Son, Hyunwoo Ko, Chanyoung Kim, JunYoung An, Kyubeen Han, Il-Youp Kwak

机构 * Chung-Ang University(Chung-Ang 大学) Seoul National University(首尔国立大学) SK A.X OnelineAI HAE-RAE

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM

AI总结 KMMMU是首个针对韩语文化机构场景的多模态理解评估基准,包含3466道韩语原生考试题,涵盖九大学科和九种视觉模态,验证了多模态模型在韩语环境下的性能差异与挑战。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13131 2026-04-20 cs.AI cs.CV cs.ET cs.NI 81%

MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications

MM-Telco: 电信应用的多模态大语言模型基准与工具

Anshul Kumar, Gagan Raj Gupta, Manish Rai, Apu Chakraborty, Ashutosh Modi, Abdelaali Chaoub, Soumajit Pramanik, Moyank Giri, Yashwanth Holla, Sunny Kumar, M. V. Kiran Sooraj

机构 * IIT Bhilai(比哈尔理工学院) IIT Kanpur(坎pur理工学院) INPT(伊斯兰北方技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MM-Telco,为电信领域设计的多模态基准和模型,旨在解决领域特定挑战,通过基准任务和实验验证提升大语言模型在电信中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16214 2026-04-20 cs.CV 79%

GAViD: A Large-Scale Multimodal Dataset for Context-Aware Group Affect Recognition from Videos

GAViD:一个大规模多模态数据集,用于视频中基于情境的群体情感识别

Deepak Kumar, Abhishek Pratap Singh, Puneet Kumar, Xiaobai Li, Balasubramanian Raman

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Roorkee(计算机科学与工程系,印度理工学院Roorkee分校) Indian Institute of Technology Ropar(印度理工学院Ropar分校) Zhejiang University(浙江大学) University of Oulu(奥卢大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GAViD数据集和CAGNet网络,用于视频中基于情境的群体情感识别,通过多模态数据和上下文信息提升识别性能,测试准确率达63.20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15871 2026-04-20 cs.CV cs.AI 79%

UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs

UniEditBench: 一种统一且成本效益高的图像和视频编辑基准,通过压缩的多模态大语言模型

Lifan Jiang, Tianrun Wu, Yuhang Pei, Chenyang Wang, Boxi Wu, Deng Cai

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 UniEditBench提出统一的图像和视频编辑基准,支持基于重建和指令驱动的方法,通过压缩的多模态大语言模型提供多维评分,减少部署成本并提高评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16298 2026-04-20 cs.CV cs.RO 74%

FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation

FineCog-Nav:整合细粒度认知模块以实现零样本多模态无人机导航

Dian Shao, Zhengzheng Xu, Peiyang Wang, Like Liu, Yule Wang, Jieqi Shi, Jing Huo

机构 * Northwestern Polytechnical University(西北工业大学) Nanjing University(南京大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出FineCog-Nav框架,通过细粒度认知模块提升无人机零样本多模态导航性能,构建了AerialVLN-Fine基准测试集,实验表明其在指令遵循、长视距规划和环境泛化方面优于基线方法。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16104 2026-04-20 eess.IV cs.AI cs.CV 62%

Dual-Modal Lung Cancer AI: Interpretable Radiology and Microscopy with Clinical Risk Integration

双模肺癌AI:结合可解释放射学与显微镜的临床风险整合

Baramee Sukumal, Aueaphum Aueawatthanaphisut

机构 * Hatyaiwittayalai School(哈雅维泰莱学校) School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology(Sirindhorn国际技术学院) Thammasat University(泰国朱拉大学) Pathum Thani, Thailand(帕亨他尼,泰国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出整合CT放射学与H&E病理学的双模AI框架,利用卷积神经网络提取特征并融合临床数据,通过可解释AI技术提升诊断性能,实现肺癌亚型分类。

Comments 16 pages, 6 figures, 3 tables, 8 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09836 2026-04-20 cs.AI cs.CL cs.LG 62%

COMPOSITE-Stem

COMPOSITE-STEM基准:通过70个专家编写的任务评估AI代理的科学推理能力

Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wolff, Jiaqi Cai, Lianghui Li, Marc Roth, Mohinder Naiya, Naixu Guo, Qicheng Tang, Richard Wheeler, Samuele Sala, Serguei Popov, Steven Dillmann, Yuqi Li

机构 * PortexAI University of Milano-Bicocca(米兰-比科卡大学) University of Calgary(卡尔加里大学) University of Chicago(芝加哥大学) Inria(法国国家信息与自动化技术研究院) Fraunhofer Institute for Individualized Medical Technology IMTE(弗劳恩霍夫个性化医疗技术研究所) University of Cambridge(剑桥大学) Independent(独立) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Queen Mary University of London(伦敦大学玛丽女王学院) Dot Ingredients National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院) University of Edinburgh(爱丁堡大学) Murdoch University(墨尔本大学) University of Porto(波尔图大学) Stanford University(斯坦福大学) Stony Brook University(史泰津布鲁克大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出COMPOSITE-STEM基准,通过70个专家编写任务评估AI代理的科学推理能力,结合精确匹配评分和LLM作为评委的协议,展示AI在科学领域的能力突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21675 2026-04-20 cs.CL cs.CV cs.GR 62%

Is this chart lying to me? Automating the detection of misleading visualizations

这张图表在欺骗我吗?自动化检测误导性可视化

Jonathan Tonglet, Jan Zimny, Tinne Tuytelaars, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系、图腾斯大学(TU Darmstadt)及应用网络安全国家研究中心ATHENE) Department of Electrical Engineering, KU Leuven(电子工程系、鲁文大学) Department of Computer Science, KU Leuven(计算机科学系、鲁文大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究提出Misviz基准测试集和合成数据集,用于自动化检测误导性可视化,发现该任务仍极具挑战性。

Comments Camera-ready version accepted at ACL 2026 Main conference. Code and data available at: https://github.com/UKPLab/acl2026-misviz

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-04-20 cs.AI 57%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15837 2026-04-20 cs.AI 57%

Stein Variational Black-Box Combinatorial Optimization

Stein 变分黑盒组合优化

Thomas Landais, Olivier Goudet, Adrien Goëffon, Frédéric Saubion, Sylvain Lamprier

机构 * LERIA, Université d’Angers(安格里大学LERIA研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于Stein算子的变分黑盒组合优化方法,通过引入粒子间排斥机制促进群体分散探索多模态适应度景观,实验证明其在大规模问题上性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14388 2026-04-20 cs.CV 57%

FoodSense: A Multisensory Food Dataset and Benchmark for Predicting Taste, Smell, Texture, and Sound from Images

FoodSense:一个多感官食物数据集和基准,用于从图像预测味觉、嗅觉、触觉和声音

Sabab Ishraq, Aarushi Aarushi, Juncai Jiang, Chen Chen

机构 * College of Engineering and Computer Science, University of Central Florida(中央佛罗里达大学工程与计算机科学学院) College of Business Administration, University of Central Florida(中央佛罗里达大学商学院) Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FoodSense数据集,包含66,842个参与者的图像对,用于预测多感官体验,通过图像接地推理轨迹训练模型,展示传统评估指标在视觉感官推断中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22278 2026-04-20 cs.CV 57%

FETAL-GAUGE: A Benchmark for Assessing Vision-Language Models in Fetal Ultrasound

FETAL-GAUGE:用于评估胎儿超声检查中视觉-语言模型的基准

Hussain Alasmawi, Numan Saeed, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Fetal-Gauge基准,用于评估视觉-语言模型在胎儿超声检查中的性能,包含42000张图像和93000个问题-答案对,揭示当前模型在临床任务中的性能差距,强调需领域适应的架构和训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15761 2026-04-20 cs.NE math.OC 50%

Frenetic Cat-inspired Particle Optimization: a Markov state-switching hybrid swarm optimizer with application to cardiac digital twinning

受 frenzy 猫启发的粒子优化:一种马尔可夫状态切换混合种群优化器及其在心脏数字孪生中的应用

Jorge Sánchez, Guadalupe García-Isla, Sandra Perez-Herrero, Beatriz Trenor, Javier Saiz

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种结合粒子群优化动态和显式状态马尔可夫切换控制器的混合种群优化器,用于解决昂贵黑箱问题中的优化问题,并在心脏数字孪生中应用。

详情

展开后加载摘要…

URL PDF HTML 收藏