Humans Are More Diverse: Frontier LLMs Show Extreme Policies in Idealised AI Development Races
人类更多样化:前沿大语言模型(LLM)在理想化AI开发竞赛中表现出极端策略
Phu Hoa Pham, Duy Minh Dao Sy, Trung Kiet Huynh, Phu Quy Nguyen Lam, Chi Nguyen Tran, Minh Trung Le, Phong Hao Le, Dinh Nam Nguyen, Thien Ky Nguyen Dong, Elias Fernandez Domingos, Le Hong Trang, The Anh Han
机构
*
Ho Chi Minh City University of Science(胡志明市科学大学)
;
Vietnam National University Ho Chi Minh City (VNU-HCM)(越南国家大学胡志明市分校)
;
Ho Chi Minh City University of Technology (HCMUT)(胡志明市技术大学(HCMUT))
专题命中
评测与基准
:LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification
基础模型能否识别声音的来源?针对闭集声源识别的音频-语言模型与传统分类器的分层基准测试
Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmad ElShiekh, Ahmed Rashad
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
突破探索瓶颈:面向通用大语言模型推理的Rubric引导强化学习
Yang Zhou, Sunzhu Li, Shunyu Liu, Wenkai Fang, Kongcheng Zhang, Jiale Zhao, Jingwen Yang, Yihe Zhou, Jianwei Lv, Tongya Zheng, Hengtong Lu, Wei Chen, Yan Xie, Mingli Song
机构
*
Zhejiang University(浙江大学)
;
Li Auto Inc.(力汽车公司)
;
Nanyang Technological University(南洋理工大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Hangzhou City University(杭州市大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
A systematic comparison of Large Language Models for automated assignment assessment in programming education: Exploring the importance of architecture and vendor
Marcin Jukiewicz
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract)
SPARC-Rad: A Multimodal Benchmark Dataset and Evaluation Pipeline for Spatial and Anatomical Reasoning in Radiology Vision-Language Models
SPARC-Rad:面向放射学视觉语言模型的空间与解剖推理多模态基准数据集及评估流程
Satvik Tripathi, Mustafa Ege Seker, Kristian Quevada, Ebubechukwu D Enwerem, Pratham Khandelwal, Emine Meltem, Bera Koca, Shahriar Faghani, Jacinta Arnold, Dania Daye, Tessa S. Cook
SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials
SoM-1K:用于材料力学能力的千题基准数据集
Qixin Wan, Zilong Wang, Jingwen Zhou, Wanting Wang, Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng
机构
*
College of Civil Engineering, Hunan University(湖南大学土木工程学院)
;
Department of Civil & Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系)
;
Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系)
;
School of Architecture, University of Miami(迈阿密大学建筑学院)
;
Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)
专题命中
评测与基准
:large language model(abstract,abstract_cn);language model(abstract,abstract_cn);foundation model(abstract);prompting(abstract)