Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA
空间推理并非免费午餐:对LLaVA的受控研究
Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A., Kranthi Kiran, Wesley Tam, Bala Krishna S Vegesna
机构
*
Cohere Labs Community(Cohere Labs社区)
;
Indian Institute of Science, Bangalore(印度科学研究所班加罗尔分校)
;
UIUC(伊利诺伊大学厄巴纳-香槟分校)
;
Imperial College London(伦敦帝国学院)
;
Eisai Inc.(卫材公司)
;
EleutherAI
;
Georgia Institute of Technology(佐治亚理工学院)
Evaluating Vision-Language and Large Language Models for Automated Student Assessment in Indonesian Classrooms
评估视觉语言和大语言模型用于印度尼西亚课堂自动学生评估
Nurul Aisyah, Muhammad Dehan Al Kautsar, Arif Hidayat, Raqib Chowdhury, Fajri Koto
机构
*
Quantic School of Business and Technology(Quantic商业与技术学院)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Indonesia University of Education(印度尼西亚教育大学)
;
Monash University(莫纳什大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
机构
*
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
FKLPRIU, School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院福建省模式识别与图像理解重点实验室)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);foundation model(abstract)
VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection
VMAD:视觉增强的多模态大语言模型用于零样本异常检测
Huilin Deng, Hongchen Luo, Wei Zhai, Yang Cao, Yu Kang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Northeastern University(东北大学)
;
Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract)
机构
*
Tsinghua University(清华大学)
;
National University of Defense Technology(国防科技大学)
;
Beihang University(北京航空航天大学)
;
Tianjin University(天津大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Peking University(北京大学)
;
Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所)
;
Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Civil Aviation University of China(中国民航大学)
;
Beijing Institute of Technology(北京理工大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
专题命中
评测与基准
:LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)
Structured Prompts Improve Evaluation of Language Models
结构化提示提升语言模型评估
Asad Aali, Muhammad Ahmed Mohsin, Vasiliki Bikia, Arnav Singhvi, Richard Gaus, Suhana Bedi, Hejie Cui, Miguel Fuentes, Alyssa Unell, Yifan Mai, Jordan Cahoon, Michael Pfeffer, Roxana Daneshjou, Sanmi Koyejo, Emily Alsentzer, Christopher Potts, Nigam H. Shah, Akshay S. Chaudhari
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
CDH-Bench:一种基于常识的幻觉基准,用于评估视觉语言模型中的视觉保真度
Kesheng Chen, Yamin Hu, Qi Zhou, Zhenqian Zhu, Wenjian Luo
机构
*
Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies, Institute of Cyberspace Security, School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(广东省新型安全智能技术重点实验室,网络空间安全研究院,计算机科学与技术学院,哈尔滨工业大学(深圳))