VISOR: A Vision-Language Model-based Test Oracle for Testing Robots
VISOR:基于视觉-语言模型的机器人测试 oracle
Prasun Saurabh, Pablo Valle, Aitor Arrieta, Shaukat Ali, Paolo Arcaini
机构
*
Simula Research Laboratory(Simula研究实验室)
;
Oslo Metropolitan University(奥斯陆理工大学)
;
Mondragon University(蒙dragon大学)
;
National Institute of Informatics(国立信息研究所)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
大型视觉-语言模型在视觉标记压缩下的对抗鲁棒性研究
Xinwei Zhang, Hangcheng Liu, Li Bai, Hao Wang, Qingqing Ye, Tianwei Zhang, Haibo Hu
机构
*
The Hong Kong Polytechnic University, Hong Kong(香港理工大学)
;
Nanyang Technological University, Singapore(南洋理工大学)
;
Chongqing University, Chongqing, China(重庆大学)
;
Research Centre for Privacy and Security Technologies in Future Smart Systems, PolyU(未来智能系统中的隐私与安全技术研究中心)
Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning
基于排名的校准:可靠多模态强化学习
Peng Cui, Boyao Yang, Jun Zhu
机构
*
Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学-博世联合机器学习中心,THBI实验室,清华大学,北京)
;
Dept. of Automation, Tsinghua University, Beijing(自动化系,清华大学,北京)
Zhi Li, Songkun Yan, Jie Cao, Mofan Zhang, Anjiang Wei, Jinwoong Yoo, Yang Hong
机构
*
Civil, Environmental, and Architectural Engineering, University of Colorado Boulder(科罗拉多大学波尔德分校土木、环境与建筑工程系)
;
Civil Engineering and Environmental Sciences, University of Oklahoma(俄克拉荷马大学土木工程与环境科学系)
;
Department of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学系)
;
Civil and Environmental Engineering, Stanford University(斯坦福大学土木与环境工程系)
;
Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
;
NASA Goddard Space Flight Center(美国国家航空航天局戈达德空间飞行中心)
QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
QQJ: 量化定性判断以实现可扩展且与人类对齐的生成AI评估
Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri
机构
*
AI Lab, Arioobarzan Engineering Team(艾伊罗巴赞工程团队人工智能实验室)
;
Department of Computer Engineering and Information Technology(计算机工程与信息科技系)
;
Department of Informatics, Bioengineering, Robotics and Systems Engineering(信息学、生物工程、机器人与系统工程系)
;
University of Genoa(热那亚大学)
Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring
对多模态大语言模型评分者的审计:临床顺序评分中的中间倾向偏差
Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada, Yonah Joffe, Jessica Sena, Miguel Contreras, Scott Siegel, Subhash Nerella, Catherine Price, Parisa Rashidi
机构
*
Department of Electrical & Computer Engineering(电气与计算机工程系)
;
Department of Computer and Information Science and Engineering(计算机与信息科学与工程系)
;
Department of Clinical and Health Psychology(临床与健康心理学系)
;
Department of Biomedical Engineering(生物医学工程系)
专题命中
幻觉与鲁棒性
:multimodal large language model(abstract);分类 cs.CV
Generating Realistic Safety-Critical Scenarios for Vehicle-Pedestrian Interactions
生成车辆-行人交互的安全关键场景
Qingwen Pu, Kun Xie, Yuan Zhu, Guocong Zhai
机构
*
Transportation Informatics Lab, Department of Civil and Environmental Engineering, Old Dominion University(交通信息实验室,土木与环境工程系,旧 Dominion 大学)
;
Inner Mongolia Center for Transportation Research, Inner Mongolia University(内蒙古交通研究所,内蒙古大学)
;
School of Transportation and Logistics, National Engineering Laboratory of Integrated Transportation Big Data Application Technology, National and Local Joint Engineering Research Center of Integrated Transportation Intelligence, Southwest Jiaotong University(交通运输学院,国家集成交通大数据应用技术工程实验室,国家与地方联合集成交通智能工程研究中心,西南交通大学)