Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning
基于排名的校准:可靠多模态强化学习
Peng Cui, Boyao Yang, Jun Zhu
机构
*
Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学-博世联合机器学习中心,THBI实验室,清华大学,北京)
;
Dept. of Automation, Tsinghua University, Beijing(自动化系,清华大学,北京)
Zhi Li, Songkun Yan, Jie Cao, Mofan Zhang, Anjiang Wei, Jinwoong Yoo, Yang Hong
机构
*
Civil, Environmental, and Architectural Engineering, University of Colorado Boulder(科罗拉多大学波尔德分校土木、环境与建筑工程系)
;
Civil Engineering and Environmental Sciences, University of Oklahoma(俄克拉荷马大学土木工程与环境科学系)
;
Department of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学系)
;
Civil and Environmental Engineering, Stanford University(斯坦福大学土木与环境工程系)
;
Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
;
NASA Goddard Space Flight Center(美国国家航空航天局戈达德空间飞行中心)
QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
QQJ: 量化定性判断以实现可扩展且与人类对齐的生成AI评估
Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri
机构
*
AI Lab, Arioobarzan Engineering Team(艾伊罗巴赞工程团队人工智能实验室)
;
Department of Computer Engineering and Information Technology(计算机工程与信息科技系)
;
Department of Informatics, Bioengineering, Robotics and Systems Engineering(信息学、生物工程、机器人与系统工程系)
;
University of Genoa(热那亚大学)
Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring
对多模态大语言模型评分者的审计:临床顺序评分中的中间倾向偏差
Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada, Yonah Joffe, Jessica Sena, Miguel Contreras, Scott Siegel, Subhash Nerella, Catherine Price, Parisa Rashidi
机构
*
Department of Electrical & Computer Engineering(电气与计算机工程系)
;
Department of Computer and Information Science and Engineering(计算机与信息科学与工程系)
;
Department of Clinical and Health Psychology(临床与健康心理学系)
;
Department of Biomedical Engineering(生物医学工程系)
专题命中
幻觉与鲁棒性
:multimodal large language model(abstract);分类 cs.CV
Generating Realistic Safety-Critical Scenarios for Vehicle-Pedestrian Interactions
生成车辆-行人交互的安全关键场景
Qingwen Pu, Kun Xie, Yuan Zhu, Guocong Zhai
机构
*
Transportation Informatics Lab, Department of Civil and Environmental Engineering, Old Dominion University(交通信息实验室,土木与环境工程系,旧 Dominion 大学)
;
Inner Mongolia Center for Transportation Research, Inner Mongolia University(内蒙古交通研究所,内蒙古大学)
;
School of Transportation and Logistics, National Engineering Laboratory of Integrated Transportation Big Data Application Technology, National and Local Joint Engineering Research Center of Integrated Transportation Intelligence, Southwest Jiaotong University(交通运输学院,国家集成交通大数据应用技术工程实验室,国家与地方联合集成交通智能工程研究中心,西南交通大学)
Employing Vision-Language Models for Face Image Quality Assessment
利用视觉-语言模型进行人脸图像质量评估
Erdi Sarıtaş, Eren Onaran, Vitomir Štruc, Hazım Kemal Ekenel
机构
*
Department of Computer Engineering, Istanbul Technical University(伊斯坦布尔技术大学计算机工程系)
;
Faculty of Electrical Engineering, University of Ljubljana(卢布尔雅那大学电气工程系)
;
Division of Engineering, NYU Abu Dhabi(纽约大学阿布扎克分校工程系)
Medical Context Distorts Decisions in Clinical Vision Language Models
医学语境扭曲了临床视觉语言模型的决策
David Restrepo, Ira Ktena, Maria Vakalopoulou, Stergios Christodoulidis, Enzo Ferrante
机构
*
MICS(医学信息学中心)
;
CentraleSupélec - Université Paris-Saclay(中央超导学院 - 巴黎萨克雷大学)
;
Cancer Data Science Unit(癌症数据科学单元)
;
IHU PRISM
;
National Institute in Precision Oncology(精准肿瘤学国家研究所)
;
University Paris-Saclay(巴黎萨克雷大学)
;
CentraleSupelec(中央超导学院)
;
Gustave Roussy(儒勒-维维安-圣拉扎尔医院)
;
INSERM(国家医学研究院)
;
CONICET(阿根廷国家科研与技术创新委员会)
;
Universidad de Buenos Aires(布宜诺斯艾利斯大学)
专题命中
VLM训练与架构
:vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
Evaluating Cognitive Age Alignment in Interactive AI Agents
评估交互式AI代理的认知年龄对齐
Yifan Shen, Jiawen Zhang, Jian Xu, Junho Kim, Ismini Lourentzou, Xu Cao, Meihuan Huang
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Shenzhen Children's Hospital(深圳儿童医院)
;
Peking University(北京大学)
;
Hong Kong Polytechnic University(香港理工大学)
专题命中
VLM训练与架构
:visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation
Hi-GaTA:用于外科视频报告生成的分层门控时间聚合适配器
Kedi Sun, Chaohui Dang, Yue Feng, James Glasbey, Theodoros N. Arvanitis, Le Zhang
机构
*
School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学工程学院)
;
School of Computer Science, University of Birmingham, Birmingham, UK(英国伯明翰大学计算机科学学院)
;
Department of Applied Health Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学应用健康科学系)
专题命中
VLM训练与架构
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV