arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-20 至 2026-07-20 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 14 篇

2607.15517 2026-07-20 cs.CV cs.AI 新提交 89%

SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

SLAPBench:用于四指SLAP指纹验证的多模态大语言模型基准测试

Bibesh Pyakurel, M. G. Sarwar Murshed

机构 * University of Wisconsin–Green Bay(威斯康星大学格林湾分校)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究四指SLAP指纹验证,介绍SLAPBench基准,评估多个MLLM在不同提示下的表现,发现提示控制崩溃,模型能力控制歧视,建立了特定于SLAP的MLLM基线,揭示了模型在指纹验证中的能力差距和公平性问题。

Comments 19 pages, 6 figures, 2 tables. Includes appendix with supporting figures and per-subgroup fairness detail. Code and data: https://github.com/bibeshpyakurel/SLAPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23786 2026-07-20 cs.AI cs.LG 版本更新 86%

FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

FAIR_XAI: 通过可解释性提升多模态基础模型公平性以用于幸福感评估

Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes

机构 * Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Harvard University(哈佛大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.AI

AI总结 本文研究了多模态基础模型在幸福感评估中的公平性问题,通过可解释性干预框架改善诊断可靠性与公平性,发现不同模型在不同数据集上表现差异显著,且存在性别和种族偏见。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16056 2026-07-20 cs.CV 新提交 79%

Multi-Modal Semantic Segmentation of Electrolyzer Components for Sustainable Hydrogen Technologies: A Dual-Branch Deep Learning Approach

用于可持续氢能技术的电解槽组件多模态语义分割:一种双分支深度学习方法

Wasimul Karim, Nur Mohammad Fahad, Abdul Hasib Siddique, Md Rafiqul Islam, Hooman Mehdizadeh-Rad, Asif Karim, Sami Azam

机构 * Applied Artificial Intelligence and INtelligent Systems (AAIINS) Laboratory(应用人工智能与智能系统(AAIINS)实验室) University of Scholars(学者大学) Murdoch University(莫道克大学) Charles Darwin University(查尔斯达尔文大学)

专题命中 多模态评测 :multi-modal(title);cross-modal(abstract);分类 cs.CV

AI总结 针对电解槽材料分割难题,提出双分支深度学习框架HREM-Net,结合高光谱和RGB图像,通过创新模块、融合模块及损失函数,在相关数据集上取得良好效果,有望用于工业提升电解槽效率和制氢预测性维护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10310 2026-07-20 cs.CL 版本更新 79%

PolyInterview: An LLM-based Platform for Immersive Mock Interview Practice with Comprehensive Multimodal Assessment

PolyInterview:一个基于大语言模型的沉浸式模拟面试平台,具备全面的多模态评估

Zhiyuan Wen, Jiannong Cao, Kelly Chan, Zijian Wang, Chen Chen, Xiaoyun Liu, Jianing Yin, Zhuo Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 PolyInterview平台利用大语言模型,基于职位描述和简历为求职者生成定制面试问题,通过数字人类面试官进行多轮口语面试,全面评估回答内容、语音表达和非语言行为,提供结构化反馈,助力求职者更好地准备面试。

Comments 10 pages, 7 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04020 2026-07-20 cs.CV 版本更新 79%

Paired Uterine Whole-Slide Images and Pathology Reports for Multimodal Computational Pathology

用于多模态计算病理学的配对子宫全切片图像和病理报告

Han Li, Jingsong Liu, Ayako Ura, Junlin Hou, Zhengyang Xu, Azar Kazemi, Oskar Thaeter, Christian Grashei, Fabian Gülhan, Reza Nasirigerdeh, Xun Ma, Rui Yan, Hao Chen, S. Kevin Zhou, Nassir Navab, Carolin Mogler, Peter Schüffler

机构 * Institute of Pathology, Technical University of Munich(慕尼黑工业大学病理研究所) Computer Aided Medical Procedures (CAMP), Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序(CAMP)) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Human Pathology, Juntendo University Graduate School of Medicine(顺天堂大学医学研究生院人体病理学部) The Hong Kong University of Science and Technology(香港科技大学) Munich Data Science Institute (MDSI)(慕尼黑数据科学研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究子宫疾病病理诊断,针对全切片图像与病理报告配对数据集稀缺问题,引入TUM-Uteria数据集,含多对病例及切片级配对,经验证,为计算病理学研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15436 2026-07-20 cs.CY 新提交 78%

Complete Trip: A Linked Multimodal Human Mobility Dataset

完整行程:一个链接的多模式人类移动数据集

Ruohan Li, Weiyu Luo, Xin Wu, Chenfeng Xiong

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究提出完整行程数据集,通过四阶段工作流程从LBS数据重建多模式旅行行为,涵盖犹他州六个县。能保留行程关系、提供路线表示并支持人口级分析,推动交通、公共卫生等多领域可重复研究。

Comments 16 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15752 2026-07-20 cs.CV 新提交 77%

Personalized Image Aesthetic Assessment via Preference-rich Sample Mining and Cohort Merging

通过偏好丰富样本挖掘和群组合并进行个性化图像美学评估

Zhichao Yang, Tianjiao Gu, Zhixianhe Zhang, Xiangfei Sheng, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 研究个性化图像美学评估问题,提出基于多模态大语言模型的PRAC方法,通过偏好丰富样本挖掘和美学共鸣群组合并建模个体美学偏好,经实验验证该方法优于现有技术。

Comments The paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15418 2026-07-20 cs.AI cs.CV 新提交 73%

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

DrawingVQA:建筑图纸上多深度视觉文本推理的真实世界基准测试

Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard

机构 * Louisiana State University(路易斯安那州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 DrawingVQA针对建筑图纸多深度视觉文本推理设计基准测试,利用图纸与问答对,提出双分类框架评估模型,揭示模型与专家表现差距,为领域特定多模态推理及AI与工程工作流程整合奠定基础。

Comments CVPR 2026 Findings accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16146 2026-07-20 cs.RO cs.CV 新提交 57%

VTLoc: Learning-based Tactile Contact Localization in Visual Point Clouds

VTLoc:基于学习的视觉点云中触觉接触定位

Zhiyuan Wu, Zhuo Chen, Shan Luo

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 研究视觉与触觉融合的接触定位问题,提出VTLoc框架,通过几何多模态对齐模块和迭代定位更新器,利用视觉点云从触觉读数定位接触点,在新基准上减少对应模糊性,改善单触接触定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15605 2026-07-20 cs.CV 新提交 57%

Benchmarking MRI Representations for Deep Learning-Based Focal Cortical Dysplasia Segmentation

基于深度学习的局灶性皮质发育异常分割的MRI表征基准测试

Soumen Ghosh, John Phamnguyen, Amit Soni Arya, Subhojit Mandal, Tilottama Goswami, Rajat Vashistha

机构 * The University of Queensland(昆士兰大学) I-MED Radiology(I-MED放射学) Bennett University(贝内特大学) Indian Institute of Technology Madras(印度马德拉斯理工学院) University College of Engineering, Osmania University(奥斯曼尼亚大学工程学院) Mater Hospital(玛特医院) Royal Brisbane and Women’s Hospital(皇家布里斯班和妇女医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究针对局灶性皮质发育异常分割,利用nnU-Net框架对MRI表征进行基准测试,评估多种输入配置,发现FLAIR单模态性能最强,比率衍生表征单独不足,多模态配置可提高病变描绘,强调MRI表征设计在深度学习分割中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15190 2026-07-20 cs.AI 版本更新 57%

Can We Trust Item Response Theory for AI Evaluation?

我们能信任项目反应理论进行人工智能评估吗?

Han Jiang, Sunbeom Kwon, Jinwen Luo, Ziang Xiao, Susu Zhang

机构 * Johns Hopkins University(约翰·霍普金斯大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究探讨项目反应理论(IRT)用于人工智能评估的可靠性,利用六个大语言模型基准模拟响应矩阵,比较四种估计工具,评估IRT在多方面的表现,发现经典估计器在大型基准中可能不可行,可扩展估计器在特定模型集下可能产生不可靠推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18929 2026-07-20 cs.CV 版本更新 57%

On the Role of Depth in Surgical Vision Foundation Models: An Empirical Study of RGB-D Pre-training

在手术视觉基础模型中深度的作用:一项关于RGB-D预训练的实证研究

John J. Han, Adam Schmidt, Muhammad Abdullah Jamal, Chinedu Nwoye, Anita Rau, Jie Ying Wu, Omid Mohareri

机构 * Vanderbilt University(范德比尔大学) Intuitive Surgical Inc.(Intuitive Surgical公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究通过比较不同预训练方法,发现几何感知的多模态预训练能显著提升手术视觉模型的性能,且无需改变推理架构。

Comments Inaccurate findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13020 2026-07-20 cs.LG cs.AI 版本更新 57%

PASs-MoE: Mitigating Misaligned Co-drift among Router and Experts via Pathway Activation Subspaces for Continual Learning

PASs-MoE:通过路径激活子空间减轻路由器与专家之间的错位协同漂移以进行持续学习

Zhiyan Hou, Haiyun Guo, Haokai Ma, Yandu Sun, Yonghui Yang, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Southeast University, Nanjing, China(南京东南大学) Wuhan AI Research, Wuhan, China(武汉人工智能研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究持续指令调整中多模态大语言模型的问题,提出基于路径激活子空间的固定容量PASs - MoE - LoRA方法,含PAS引导的重新加权和PAS感知的秩稳定,实验表明该方法在准确性和抗遗忘性上优于基线和变体且不增参数。

Comments Published in the Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Volume 1: Long Papers. 14 pages. Code is available at https://github.com/yueluoshuangtian/PASs-MoE

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 31959--31972, San Diego, California, United States, July 2026. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.04599 2026-07-20 cs.LG cs.AI 版本更新 57%

Perception-Aligned AI Outputs: End-to-End Visual Prediction for Uncertainty Communication in Clinical Decision-Making

感知对齐的人工智能输出:临床决策中用于不确定性通信的端到端视觉预测

Mohammad Eslami, Solale Tabarestani, Saber Kazeminasab, Ehsan Adeli, Glyn Elwyn, Tobias Elze, Mengyu Wang, Nazlee Zebardast, Lucia Sobrin, Nassir Navab, Daniel Shu Wei Ting, Malek Adjouadi

机构 * Harvard Ophthalmology AI Lab(哈佛眼科人工智能实验室) Schepens Eye Research Institute of Massachusetts Eye and Ear(马萨诸塞眼耳医院施佩恩眼科研究所) Harvard Medical School(哈佛医学院) Center for Advanced Technology and Education(先进教育技术中心) Florida International University(佛罗里达国际大学) Dartmouth Institute for Health Policy and Clinical Practice(达特茅斯健康政策与临床实践研究所) Dartmouth College(达特茅斯学院) Computer Aided Medical Procedures(医学辅助程序) Technical University of Munich(慕尼黑技术大学) Singapore Eye Research Institute(新加坡眼科研究所) Singapore National Eye Centre(新加坡国家眼科中心) Department of Ophthalmology, Byers Eye Institute, Stanford University(眼科部门,比尔斯眼科研究所,斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究针对医疗保健中可解释人工智能的问题,提出以人为本的机器学习可视化学习框架VL4ML,通过直观视觉表示传达模型预测与不确定性,经多临床任务验证及评估,结果显示其能有效支持临床决策,具有广泛可及性。

详情

展开后加载摘要…

URL PDF HTML 收藏