JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
JigShape:通过拼图任务评估视觉语言模型的视觉几何推理能力
Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi, Franck Dernoncourt, Roger Zimmermann, Yue Wang, Zhengzhong Tu, Vicente Ordonez, Mohit Bansal, Yue Zhao
机构
*
University of Southern California(南加州大学)
;
National University of Singapore(新加坡国立大学)
;
Adobe Research(奥多比研究院)
;
Texas A&M University(德克萨斯农工大学)
;
Rice University(莱斯大学)
;
The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?
我们真的需要参数超过10亿的多模态情感语言模型吗?
Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge
机构
*
University of Glasgow(格拉斯哥大学)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
School of Artificial Intelligence, Shandong University(山东大学人工智能学院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)
;
Tough Cyberphysical AI Research Center, Tohoku University(东北大学 Tough 跨物理AI研究中心)
;
RWTH Aachen University(亚琛工业大学)