HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models
HSSBench: 多模态大语言模型在人文学与社会科学能力评估中的基准测试
机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) ; Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) ; Tsinghua University(清华大学) ; Chinese Academy of Sciences(中国科学院) ; University of British Columbia(不列颠哥伦比亚大学) ; Renmin University of China(中国人民大学)
AI总结 HSSBench是一个专门评估多模态大语言模型在人文学与社会科学任务能力的基准测试,包含多语言样本,通过协作生成数据提升跨学科推理能力。
Comments ICLR 2026 (OpenReview: https://openreview.net/forum?id=iQsKotob31)