MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage
MedObvious:通过临床分诊暴露视觉语言模型中的医学莫拉维奇悖论
Ufaq Khan, Umair Nawaz, L D M S S Teja, Numaan Saeed, Muhammad Bilal, Yutong Xie, Mohammad Yaqub, Muhammad Haris Khan
机构
*
Mohamed bin Zayed University of Artificial Intelligence, UAE(马尔代夫布扎伊德人工智能大学,阿联酋)
;
National Institute of Technology, Silchar(西尔CHAR国家理工学院)
;
Birmingham City University, UK(伯明翰城市大学,英国)
专题命中
视觉问答
:vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
机构
*
Tsinghua University(清华大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Tianjin University(天津大学)
;
Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)
;
HKUST (Guangzhou)(香港科技大学(广州))
;
National University of Defense Technology(国防科技大学)
;
Beihang University(北航)
;
Beijing Information Science and Technology University(北京信息科技大学)
;
Artificial Intelligence Institute of China Electronics Technology Group Corporation(中国电子科技集团人工智能研究院)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Traffic Sign Recognition in Autonomous Driving: Dataset, Benchmark, and Field Experiment
自动驾驶中的交通标志识别:数据集、基准测试与实地实验
Guoyang Zhao, Weiqing Qi, Kai Zhang, Chenguang Zhang, Zeying Gong, Zhihai Bi, Kai Chen, Benshan Ma, Ming Liu, Jun Ma
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Lingnan University(岭大)
;
Shenzhen Unity Drive Innovation Technology Co., Ltd.(深圳Unity Drive创新技术有限公司)
;
The Hong Kong University of Science and Technology(香港科技大学)
I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes
我来了,我看到了,我解释了:在表情包中评估多模态大语言模型的隐喻意义
Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli
机构
*
MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
National Research Council Canada(加拿大国家研究委员会)
专题命中
视觉推理
:multimodal large language model(abstract)
ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding
ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准
Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu
机构
*
National University of Defense Technology(国防科技大学)
;
Intelligent Game and Decision Lab(智能游戏与决策实验室)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中
视觉定位与Grounding
:multimodal large language model(title,abstract);InternVL(abstract);grounding(abstract);分类 cs.CV
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
GeoDiT:一种基于扩散的视觉-语言模型,用于地理空间理解
Jiaqi Liu, Ronghao Fu, Haoran Liu, Lang Sun, Bo Yang
机构
*
College of Computer Science and Technology, Jilin University, Changchun 130012, China(吉林大学计算机科学与技术学院,长春 130012,中国)
;
Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)
VLGOR: Visual-Language Knowledge Guided Offline Reinforcement Learning for Generalizable Agents
VLGOR:基于视觉-语言知识的离线强化学习用于通用智能体
Pengsen Liu, Maosen Zeng, Nan Tang, Kaiyuan Li, Jing-Cheng Pang, Yunan Liu, Yang Yu
机构
*
National Key Laboratory for Novel Software Technology, Nanjing University, China \& School of Artificial Intelligence, Nanjing University, China
;
Computational Intelligence Center (CIC), School of Computer
;
Artificial Intelligence, Shandong Jianzhu University, Jinan, 250101, China