SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding
SurgMLLMBench: 一个用于手术场景理解的多模态大语言模型基准数据集
Tae-Min Choi, Tae Kyeong Jeong, Garam Kim, Jaemin Lee, Yeongyoon Koh, In Cheul Choi, Jae-Ho Chung, Jong Woong Park, Juyoun Park
机构
*
Samsung Research(三星研究所)
;
Center for Humanoid Research, Korea Institute of Science and Technology(人类研究学院,韩国科学技术院)
;
Department of plastic surgery, College of medicine, Korea University(医学院整形外科部,韩国大学)
;
Department of orthopedic surgery, College of medicine, Korea University(医学院骨科部,韩国大学)
专题命中
视觉问答
:multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
机构
*
College of Computer, National University of Defense Technology(国防科技大学计算机学院)
;
School of Computer and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)
;
CCNU(中国地质大学)
专题命中
视觉问答
:multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding
Hongyong Han, Wei Wang, Gaowei Zhang, Mingjie Li, Yi Wang
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Technology Innovation Center for South China Sea Remote Sensing, Surveying and Mapping Collaborative Application, Ministry of Natural Resources(自然资源部南海遥感测绘协同应用技术创新中心)
;
South China Sea Development Research Institute, Ministry of Natural Resources(自然资源部南海发展研究 institute)
;
Inspur Computer Technology Co., Ltd(Inspur 计算机技术有限公司)
;
Shandong Key Laboratory of Advanced Computing(山东先进计算重点实验室)
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
Yan Zhang, Jiaqing Lin, Miao Zhang, Kui Xiao, Xiaoju Hou, Yue Zhao, Zhifei Li
机构
*
School of Computer Science, Hubei University, Wuhan, China(湖北大学计算机学院)
;
Hubei Key Laboratory of Big Data Intelligent Analysis and Application (Hubei University)(湖北大数据智能分析与应用重点实验室)
;
Key Laboratory of Intelligent Sensing System and Security (Hubei University)(智能传感系统与安全重点实验室)
;
Institute of Vocational Education, Guangdong Industry Polytechnic University(广东行业职业大学职业教育学院)
;
Shandong Police College(山东警察学院)
专题命中
视觉问答
:visual question answering(title,abstract);visual language model(abstract);分类 cs.CV、cs.AI
CommentsACCEPTED as a FULL PAPER for the Research Track at International Conference on Database Systems for Advanced Applications 2025
机构
*
AI VIETNAM Lab(AI越南实验室)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of Wisconsin - Madison(威斯康星大学麦迪逊分校)
;
University of Pittsburgh(匹兹堡大学)
;
University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
;
Northwestern University(西北大学)
机构
*
Massachusetts Institute of Technology(麻省理工学院)
;
Amazon Web Services(亚马逊网络服务)
专题命中
视觉问答
:VLM(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI
Comments8 pages, 5 figures, accepted to the 11th IEEE International Workshop on Computer Vision in Sports (CVSports) at CVPR 2025; supplementary appendix included
Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models
Qingni Wang, Tiantian Geng, Zhiyuan Wang, Teng Wang, Bo Fu, Feng Zheng
机构
*
University of Electronic Science and Technology of China(电子科技大学)
;
Southern University of Science and Technology(南方科技大学)
;
University of Birmingham(伯明翰大学)
;
The University of Hong Kong(香港大学)
专题命中
视觉问答
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG
Beyond the Hype: A dispassionate look at vision-language models in medical scenario
Yang Nan, Huichi Zhou, Xiaodan Xing, Guang Yang
机构
*
Bioengineering Department and Imperial-X, Imperial College London(生物工程部门和Imperial-X,帝国理工学院伦敦分校)
;
GSK, Artificial Intelligence and Machine Learning(GSK,人工智能与机器学习)
;
Cardiovascular Research Centre, Royal Brompton Hospital(心血管研究中心,皇家布里托尼医院)
;
School of Biomedical Engineering and Imaging Sciences, King’s College London(生物医学工程与成像科学学院,国王学院伦敦分校)
MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports
Sunggu Kyung, Hyungbin Park, Jinyoung Seo, Jimin Sung, Jihyun Kim, Dongyeong Kim, Wooyoung Jo, Yoojin Nam, Sangah Park, Taehee Kwon, Sang Min Lee, Namkug Kim
机构
*
Department of Biomedical Engineering, University of Ulsan College of Medicine(生物医学工程系,釜山大学医学院)
专题命中
视觉问答
:visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments14 pages, 5 figures, submitted to CVPR 2025
Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models
Safaa Abdullahi Moallim Mohamud, Minjin Baek, Dong Seog Han
机构
*
Center for ICT and Automotive Convergence, Kyungpook National University(信息与汽车融合研究中心,庆北国立大学)
;
School of Electronic and Electrical Engineering, Kyungpook National University(电子电气工程学院,庆北国立大学)
机构
*
Dept. of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong, China(计算机科学与工程系,香港中文大学,香港,中国)
;
Institute of Medical Intelligence and XR, The Chinese University of Hong Kong, Hong Kong, China(医学智能与XR研究所,香港中文大学,香港,中国)
专题命中
视觉问答
:vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
Wenhui Zhu, Xuanzhao Dong, Xin Li, Peijie Qiu, Xiwen Chen, Abolfazl Razi, Aris Sotiras, Yi Su, Yalin Wang
机构
*
Arizona State University(亚利桑那州立大学)
;
Clemson University(克莱姆森大学)
;
Washington University in St.Louis(华盛顿大学圣路易斯分校)
;
Banner Alzheimer’s Institute(Banner阿尔茨海默病研究所)
专题命中
视觉问答
:vision-language model(title);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
WorldCuisines: A Massive-Scale Benchmark for Multilingual and Multicultural Visual Question Answering on Global Cuisines
Genta Indra Winata, Frederikus Hudi, Patrick Amadeus Irawan, David Anugraha, Rifki Afina Putri, Yutong Wang, Adam Nohejl, Ubaidillah Ariq Prathama, Nedjma Ousidhoum, Afifa Amriani, Anar Rzayev, Anirban Das, Ashmari Pramodya, Aulia Adila, Bryan Wilie, Candy Olivia Mawalim, Ching Lam Cheng, Daud Abolade, Emmanuele Chersoni, Enrico Santus, Fariz Ikhwantri, Garry Kuwanto, Hanyang Zhao, Haryo Akbarianto Wibowo, Holy Lovenia, Jan Christian Blaise Cruz, Jan Wira Gotama Putra, Junho Myung, Lucky Susanto, Maria Angelica Riera Machin, Marina Zhukova, Michael Anugraha, Muhammad Farid Adilazuarda, Natasha Santosa, Peerat Limkonchotiwat, Raj Dabre, Rio Alexander Audino, Samuel Cahyawijaya, Shi-Xiong Zhang, Stephanie Yulia Salim, Yi Zhou, Yinxuan Gui, David Ifeoluwa Adelani, En-Shiun Annie Lee, Shogo Okada, Ayu Purwarianti, Alham Fikri Aji, Taro Watanabe, Derry Tanti Wijaya, Alice Oh, Chong-Wah Ngo
机构
*
Capital One
;
SEACrowd
;
NAIST
;
ITB
;
UofT
;
KAIST
;
JAIST
;
Cardiff University
;
Independent
;
HKUST
;
SMU
;
Masakhane
;
University of Lagos
;
HK PolyU
;
Boston University
;
Columbia University
;
MBZUAI
;
Monash University
;
UCSB
;
Tokyo Tech
;
AI Singapore
;
NICT
;
Cohere
;
McGill
;
MILA
;
Canada CIFAR AI Chair
;
Ontario Tech
专题命中
视觉问答
:visual question answering(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI