SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models
SciCustom: 一个用于大型语言模型科学能力定制评估的框架
Yiyang Gu, Junwei Yang, Junyu Luo, Ye Yuan, Bin Feng, Yingce Xia, Shufang Xie, Kaili Liu, Bohan Wu, Qi Shi, Haoran Li, Beier Xiao, Zhiping Xiao, Xiao Luo, Weizhi Zhang, Philip S. Yu, Zequn Liu, Ming Zhang
机构
*
State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(多媒体信息处理国家重点实验室,计算机学院,PKU-Anker LLM实验室,北京大学)
;
Zhongguancun Academy(中关村学院)
;
IDEA
;
Xidian University(西安电子科技大学)
;
Peking University(北京大学)
;
University of Washington(华盛顿大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL
Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses
大型语言模型能否革新调查研究?与灾害准备响应的实验
Yan Wang, Ziyi Guo, Christopher McCarty
机构
*
Dept. of Urban and Regional Planning & Florida Institute for Built Environment Resilience, University of Florida(城市与区域规划系及佛罗里达环境韧性研究所,佛罗里达大学)
;
College of Liberal Arts and Sciences, Bureau of Economic and Business Research, University of Florida(文理学院及经济与商业研究局,佛罗里达大学)
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection
DetectRL-X: 向可靠多语言和真实世界LLM生成文本检测迈进
Junchao Wu, Yefeng Liu, Chenyu Zhu, Hao Zhang, Zeyu Wu, Tianqi Shi, Yichao Du, Longyue Wang, Weihua Luo, Jinsong Su, Derek F. Wong
机构
*
NLP2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学学院NLP2 CT实验室)
;
Alibaba Group(阿里巴巴集团)
;
Xiamen University(厦门大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
A novel YOLO26-MoE optimized by an LLM agent for insulator fault detection considering UAV images
一种由LLM代理优化的YOLO26-MoE新型模型用于考虑无人机图像的绝缘子故障检测
João Pedro Matos-Carvalho, Laio Oriel Seman, Stefano Frizzo Stefenon, Mohammad Khalaf Mohammad Khreasat, Gabriel Villarrubia González
机构
*
Department of Automation and Systems Engineering, Federal University of Santa Catarina, Florianópolis, Brazil(自动化与系统工程系,圣卡塔琳娜联邦大学,巴西弗洛里安波利斯)
;
Applications Lab, Faculty of Science, University of Salamanca, Plaza de los Caídos s/n, 37008 Salamanca, Spain(应用实验室,科学学院,萨拉曼卡大学,西班牙萨拉曼卡)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents
叫还是不叫:诊断LLM代理中的内在过度调用偏差
Wei Shi, Ziheng Peng, Sihang Li, Xiting Wang, Xiang Wang, Mengnan Du, Na Zou
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Renmin University of China(中国人民大学)
;
The Chinese University of Hong Kong Shenzhen(香港中文大学(深圳))
;
University of Science and Technology of China(中国科学技术大学)
Paulo Pirozelli, Victor Hugo Nascimento Rocha, Fabio G. Cozman, Douglas Aldred
机构
*
Universidade de São Paulo Center for Artificial Intelligence (C4AI)(圣保罗大学人工智能中心(C4AI))
;
Instituto Mauá de Tecnologia Núcleo de Sistemas Eletrônicos Embarcados (NSEE)(马乌阿技术研究所电子系统嵌入核(NSEE))
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
BLINKG: A Benchmark for LLM-Integrated Knowledge Graph Generation
BLINKG:一个用于集成大语言模型的知识图谱生成基准
Carla Castedo, Enrique Iglesias, Manuel Lama, Alberto Bugarin-Diz, Maria-Esther Vidal, David Chaves-Fraga
机构
*
Centro Singular de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela, Spain(圣地亚哥-德孔波斯特拉大学智能技术研究中心(CiTIUS))
;
L3S Research Center Germany, Hannover, Germany(德国汉诺威L3S研究中心)
;
TIB Leibniz Information Centre for Science and Technology, Hannover, Germany(德国汉诺威TIB莱比锡信息科学与技术研究中心)
;
Leibniz University, Hannover, Germany(德国汉诺威莱比锡大学)
;
Departamento de Electrónica e Computación, Universidade de Santiago de Compostela, Spain(圣地亚哥-德孔波斯特拉大学电子与计算系)
专题命中
评测与基准
:LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
College of Electronic and Information Engineering, Shenzhen University, Shenzhen, China(深圳大学电子与信息工程学院)
;
Shenzhen Audencia Financial Technology Institute, Shenzhen University, Guangdong, People's Republic of China(深圳大学审计金融科技研究所)
专题命中
评测与基准
:LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
Position: Let's Develop Data Probes to Fundamentally Understand How Data Affects LLM Performance
位置:让我们开发数据探针,以根本理解数据如何影响大语言模型性能
Shiqiang Wang, Herbert Woisetschläger, Hans Arno Jacobsen, Mingyue Ji
机构
*
Department of Computer Science, University of Exeter, UK(埃克塞特大学计算机科学系)
;
Technical University of Munich, Germany(慕尼黑技术大学)
;
Department of Electrical and Computer Engineering, University of Toronto, Canada(多伦多大学电气与计算机工程系)
;
Department of Electrical and Computer Engineering, University of Florida, FL, USA(佛罗里达大学电气与计算机工程系)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
机构
*
School of Computer Science and Engineering, Macau University of Science and Technology, Macao SAR(澳门科学技术大学计算机科学与工程学院)
;
Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology(湖北省交通物联网重点实验室,武汉理工大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract)
A Geometric Analysis of Small-sized Language Model Hallucinations
小尺寸语言模型幻觉的几何分析
Emanuele Ricco, Elia Onofri, Lorenzo Cima, Stefano Cresci, Roberto Di Pietro
机构
*
Engineering (CEMSE) division, King Abdullah University of Science and Technology (KAUST)(卡塔尔科技大学工程学院(CEMSE))
;
Istituto di Informatica e Telematica (IIT), National Research Council of Italy (CNR)(意大利国家研究理事会信息与电信研究所(IIT))
;
Department of Information Engineering, University of Pisa(比萨大学信息工程系)
专题命中
评测与基准
:language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI
GRASP: Deterministic argument ranking in interaction graphs
GRASP:交互图中的确定性论证排名
Diganta Misra, Antonio Orvieto, Rediet Abebe, Volkan Cevher
机构
*
MPI-IS Tübingen(图宾根MPI研究所)
;
Tübingen AI Center(图宾根人工智能中心)
;
ELLIS Institute Tübingen(图宾根ELLIS研究所)
;
Eberhard Karls Universität Tübingen(图宾根埃伯哈德·卡尔斯大学)
;
LIONS, EPFL(EPFL的LIONS实验室)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG