Peng Jiang, Kasi Viswanath, Akhil Nagariya, George Chustz, Maggie Wigness, Philip Osteen, Timothy Overbye, Christian Ellis, Long Quang, Jia Huang, Srikanth Saripalli
机构
*
Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX, USA(迈克·沃克66机械工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国)
;
DEVCOM Army Research Laboratory, Adelphi, MD, USA(陆军研究实验室,阿德菲,马里兰州,美国)
;
University of Texas at Austin Center for Autonomy, Austin, TX, USA(德克萨斯大学奥斯汀分校自主性中心,奥斯汀,德克萨斯州,美国)
机构
*
Department of Computer Science and Engineering, IIT Bombay(印度理工学院班加罗尔分校计算机科学与工程系)
;
Center for Educational Technology, IIT Bombay(印度理工学院班加罗尔分校教育技术中心)
;
School of Management, Mahindra University(马恒达大学管理学院)
机构
*
School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)
;
Department of Computer Science and Software Engineering, The University of Western Australia(西澳大学计算机科学与软件工程系)
机构
*
Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息技术研究所)
;
GastroIntestinal Department, Dhulikhel Hospital(杜尔基hel医院消化内科)
;
Univesity of Lausanne(洛桑大学)
;
University of West Virginia(西弗吉尼亚大学)
;
University of Utah(犹他大学)
;
University of Aberdeen(阿伯丁大学)
Leveraging ChatGPT's Multimodal Vision Capabilities to Rank Satellite Images by Poverty Level: Advancing Tools for Social Science Research
利用ChatGPT的多模态视觉能力按贫困水平对卫星图像进行排名:推进社会科学研究工具
Hamid Sarmadi, Ola Hall, Thorsteinn Rögnvaldsson, Mattias Ohlsson
机构
*
Center for Applied Intelligent Systems Research (CAISR), Halmstad University, Sweden(应用智能系统研究中心(CAISR),哈马斯特德大学,瑞典)
;
Department of Human Geography, Lund University, Sweden(人类地理系,吕勒奥大学,瑞典)
;
Department of Earth and Environmental Sciences, Lund University, Sweden(地球与环境科学系,吕勒奥大学,瑞典)
机构
*
Southwestern University of Finance and Economics(西南财经大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Central South University(中南大学)
;
Hithink Research(Hithink研究)
;
Westlake University(西湖大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
University of Manchester(曼彻斯特大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
University of Adelaide(阿德莱德大学)
;
Fudan University(复旦大学)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
;
Chengdu Everimaging Science and Technology Co., Ltd(成都亿联科技有限公司)
GestaltMML: Enhancing Rare Genetic Disease Diagnosis through Multimodal Machine Learning Combining Facial Images and Clinical Text
GestaltMML:通过结合面部图像和临床文本的多模态机器学习增强罕见遗传病诊断
Da Wu, Zhanliang Wang, Hongzhuo Chen, Jingye Yang, Cong Liu, Tzung-Chien Hsieh, Elaine Marchi, Justin Blair, Peter Krawitz, Chunhua Weng, Wendy Chung, Gholson J. Lyon, Ian D. Krantz, Jennifer M. Kalish, Kai Wang
机构
*
Raymond G. Perelman Center for Cellular and Molecular Therapeutics, Children’s Hospital of Philadelphia(雷蒙德·G·佩尔曼细胞与分子治疗中心,费城儿童医院)
;
Department of Mathematics, University of Pennsylvania(数学系,宾夕法尼亚大学)
;
Department of Biomedical Informatics, Columbia University Irving Medical Center(生物医学信息学系,哥伦比亚大学伊万斯医疗中心)
;
Department of Human Genetics, New York State Institute for Basic Research in Developmental Disabilities, Staten Island, NY, USA(人类遗传学系,纽约州发育障碍基础研究机构,纽约州史泰登岛)
;
Division of Human Genetics, Children’s Hospital of Philadelphia(人类遗传学部,费城儿童医院)
;
Department of Pediatrics, Boston Children’s Hospital, Harvard Medical School(儿科系,波士顿儿童医院,哈佛医学院)
;
Biology PhD Program, The Graduate Center, The City University of New York(生物学博士项目,纽约市立大学研究生中心)
;
Department of Genetics, Perelman School of Medicine, University of Pennsylvania(遗传学系,宾夕法尼亚大学佩尔曼医学学院)
;
Department of Pediatrics, Perelman School of Medicine, University of Pennsylvania(儿科系,宾夕法尼亚大学佩尔曼医学学院)
;
Department of Pathology and Laboratory Medicine, Perelman School of Medicine, University of Pennsylvania(病理学与实验室医学系,宾夕法尼亚大学佩尔曼医学学院)
AgroOmni: A Large-Scale Multi-view Agricultural Dataset for Cross-Scale Multimodal Reasoning
AgroOmni:一个大规模多视角农业数据集用于跨尺度多模态推理
Jiarui Zhang, Junqi Hu, Zurong Mai, Yang Liu, Yuhang Chen, Shuohong Lou, Henglian Huang, Hong Cheng, Lingyuan Zhao, Jianxi Huang, Yutong Lu, Haohuan Fu, Juepeng Zheng
机构
*
Sun Yat-sen University(中山大学)
;
Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
;
HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司)
;
China Agricultural University(中国农业大学)
;
Southwest Jiaotong University(西南交通大学)
;
National Supercomputing Center in Shenzhen(深圳国家超算中心)
;
The Chinese University of Hong Kong(香港中文大学)
MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval
MCERF:通过增强检索推进工程文档的多模态大语言模型评估
Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu
机构
*
School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269)
;
Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)
Comments9 pages. v2: results updated to July 2026 leaderboard (17 models). Accepted at the 2nd Workshop on Knowledge-Intensive Multimodal Reasoning (KnowledgeMR) at CVPR 2026 (non-archival), under the former title "PDFParse: A Benchmark for Grounded Multimodal Reasoning over Professional PDF Documents". Dataset: https://huggingface.co/datasets/surgeai/GDP.pdf ; Code: https://github.com/surge-ai/gdp-pdf
MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs
MELLA:弥合低资源语言多模态大语言模型的语言能力与文化根基
Yufei Gao, Jiaying Fei, Nuo Chen, Ruirui Chen, Guohang Yan, Yunshi Lan, Botian Shi
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
East China Normal University(东华大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Institute of High Performance Computing, A*STAR(高性能计算研究所,A*STAR)
RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care
RESPClinBench:呼吸专科医疗中的多模态临床决策与纵向疾病管理基准测试
Mouxiao Bian, Zhi Chen, Ruiyao Chen, Lu Lu, Hengrui Liang, Chaoyi Huang, Yiluo Lin, Jingru Ding, Yun Zhong, Yueming Su, Jie Xu
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Macau University of Science and Technology(澳门科技大学)
;
First Affiliated Hospital of Guangzhou Medical University(广州医科大学附属第一医院)
;
Guangzhou Institute of Respiratory Health(广州呼吸健康研究院)
LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content
LiveXiv —— 基于 arXiv 论文内容的多模态实时基准测试集
Nimrod Shabtay, Felipe Maia Polo, Sivan Doveh, Wei Lin, M. Jehanzeb Mirza, Leshem Choshen, Mikhail Yurochkin, Yuekai Sun, Assaf Arbelle, Leonid Karlinsky, Raja Giryes
机构
*
Faculty of Engineering Tel-Aviv University(特拉维夫大学工程学院)
;
IBM Research(IBM研究院)
;
Department of Statistics, University of Michigan(密歇根大学统计学系)
;
JKU Linz, Austria(林茨大学,奥地利)
;
MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
;
MIT-IBM(麻省理工学院-IBM)