Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA
多模态大语言模型的置信度校准:基于医学视觉问答的实证研究
Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu
机构
*
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)
;
Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
;
Key Laboratory of Computer Network and Information Integration, Southeast University, Ministry of Education(东南大学计算机网络和信息集成教育部重点实验室)
;
Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models
TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法
Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang
机构
*
Peking University(北京大学)
;
Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
;
University of Science and Technology of China(中国科学技术大学)
;
Southeast University(东南大学)
;
Southern University of Science and Technology(南方科技大学)
;
Beijing University of Aeronautics and Astronautics(北京航空航天大学)
;
Beijing Language and Culture University(北京语言大学)
;
Sichuan University(四川大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval
EvoGraph-R1:用于智能检索的自进化多模态知识超图
Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He
机构
*
Northwestern Polytechnical University(西北工业大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The University of Hong Kong(香港大学)
;
Monash University(莫纳什大学)
;
The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))
专题命中
视觉问答
:grounding(abstract);multimodal large language model(abstract);分类 cs.CV
ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures
ReScene: 基于多视角图像的结构化室内场景重建
Haoran Xu, Lechao Zhang, Daoguo Dong, Yan Gao, Xin Tan
机构
*
School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
;
Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究院)
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
QiYuanLab(启元实验室)
;
Tsinghua University(清华大学)
;
University of Electronic Science and Technology of China(电子科技大学)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models
在自进化大型多模态模型中更加关注视觉标记
Shravan Venkatraman, Ritesh Thawkar, Omkar Thawakar, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan
机构
*
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Aalto University(阿尔托大学)
;
Australian National University(澳大利亚国立大学)
;
Linköping University(林雪平大学)