Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA
多模态大语言模型的置信度校准:基于医学视觉问答的实证研究
Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu
机构
*
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)
;
Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)
机构
*
Built Environment Department, College of Science and Technology, North Carolina A&T State University(北卡罗来纳农工州立大学科技学院建筑环境系)
;
United Nations University Institute for Water, Environment and Health(联合国大学水、环境与健康研究所)
机构
*
Tsinghua University(清华大学)
;
Chongqing University(重庆大学)
;
Peking University(北京大学)
;
ZenoMind AI
;
Xi’an Jiaotong University(西安交通大学)
;
Beijing Institute of Technology(北京理工大学)
;
Southeast University(东南大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Joy Future Academy(京东探索研究院)
;
The University of Hong Kong(香港大学)
Frozen Multimodal Embeddings for AI-Assisted Interview Assessment of Personality and Cognitive Ability
冻结多模态嵌入用于异步视频面试中的个性与认知能力评估
Kuo-En Hung, Hung-Yue Suen, Shih-Ching Yeh, Hsiang-Wen Wang
机构
*
Technology Application and Human Resource Development, National Taiwan Normal University(台湾国立台中教育大学技术应用与人力资源发展系)
;
Computer Science and Information Engineering, National Central University(台湾国立中央大学计算机科学与资讯工程系)
;
Institute of Photonic System, National Yang Ming Chiao Tung University(台湾阳明交通大学光电系统研究所)
AgroOmni: A Large-Scale Multi-view Agricultural Dataset for Cross-Scale Multimodal Reasoning
AgroOmni:一个大规模多视角农业数据集用于跨尺度多模态推理
Jiarui Zhang, Junqi Hu, Zurong Mai, Yang Liu, Yuhang Chen, Shuohong Lou, Henglian Huang, Hong Cheng, Lingyuan Zhao, Jianxi Huang, Yutong Lu, Haohuan Fu, Juepeng Zheng
机构
*
Sun Yat-sen University(中山大学)
;
Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
;
HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司)
;
China Agricultural University(中国农业大学)
;
Southwest Jiaotong University(西南交通大学)
;
National Supercomputing Center in Shenzhen(深圳国家超算中心)
;
The Chinese University of Hong Kong(香港中文大学)
MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models
MMBU: 大规模多模态生物医学理解基准,用于探测视觉语言模型的感知能力
Ryan D'Cunha, Alejandro Lozano, Xiaoxiao Sun, Daniel Vela Jarquin, Min Woo Sun, Josiah Aklilu, James Burgess, Yuhui Zhang, Ryan Nayebi, Paola Avila, Robayo, Jin Ye, Ming Hu, Zhongying Deng, Junjun He, Xin Chen, Yue Yao, Robert Tibshirani, Jeffrey J. Nirschl, Serena Yeung-Levy
机构
*
Stanford University(斯坦福大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Instituto Tecnológico de Monterrey(蒙特雷技术学院)
;
Monash University(墨尔本大学)
;
University of Cambridge(剑桥大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Shandong University(山东大学)
MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval
MCERF:通过增强检索推进工程文档的多模态大语言模型评估
Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu
机构
*
School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269)
;
Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)
FRED: A Multi-Modal Autonomous Driving Dataset for Flooded Road Environments
FRED:面向洪水道路环境的多模态自动驾驶数据集
Connor Malone, Sebastien Demmel, Sebastien Glaser
机构
*
Queensland University of Technology(昆士兰理工大学)
;
ARC Training Centre for Automated Vehicles in Rural and Remote Regions (AVR3)(农村和偏远地区自动化车辆培训中心(AVR3))
Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale
回到柏拉图的洞穴:大规模检验跨模态表示收敛性
A. Sophia Koepke, Daniil Zverev, Shiry Ginosar, Alexei A. Efros
机构
*
UC Berkeley(伯克利大学)
;
Technical University Munich, MCML(慕尼黑技术大学)
;
University of Tübingen, Tübingen AI Center(图宾根大学)
;
Toyota Technical Institute at Chicago(芝加哥丰田技术研究所)
机构
*
Kyoto University(京都大学)
;
NII LLMC(日本国立信息与通信技术研究所语言模型中心)
;
RIKEN AIP(日本理化学研究所先进理工研究所)
;
Case Western Reserve University(凯斯西储大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
The University of Osaka(大阪大学)
;
University of Tokyo(东京大学)
Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation
多模态3D智能的最新进展:综合调查与评估
Yinjie Lei, Zixuan Wang, Feng Chen, Guoqing Wang, Peng Wang, Yang Yang
机构
*
College of Electronics and Information Engineering, Sichuan University(四川大学电子信息工程学院)
;
School of Computer Science, University of Adelaide(阿德莱德大学计算机科学学院)
;
School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
ERGeoBench:多模态大语言模型中具身推理与地理定位的综合基准
Kaiwen Xue, Tao Wei, Guoxin Zhang, Zhonghong Ou, Kaoyan Lu, Yu Feng, Yifan Zhu, Haoran Luo
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)
;
School of Materials Science and Engineering(材料科学与工程学院)
;
China Mobile Research Institute(中国移动研究院)
;
College of Computing and Data Science(计算与数据科学学院)