Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach
使用大语言模型对Linux/bash考试进行自动评分:一种四层认知分类方法
Manuel Alonso-Carracedo, Ruben Fernandez-Boullon, Pedro Celard, Francisco J. Rodriguez-Martinez, Lorena Otero-Cerdeira
机构
*
Universidade de Vigo, Department of Computer Science, ESEI-Higher School of Computer Engineering(维戈大学计算机科学系ESEI高等计算机工程学院)
;
IFCAE-Institute for Research in Physics, Computing and Aerospace Science(IFCAE物理、计算与航空航天科学研究所)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
Towards Automated Kernel Generation in the Era of LLMs
面向LLM时代的自动化内核生成
Yang Yu, Peiyu Zang, Chi Hsu Tsai, Haiming Wu, Yixin Shen, Jialing Zhang, Haoyu Wang, Zhiyou Xiao, Jingze Shi, Yuyu Luo, Wentao Zhang, Chunlei Men, Guang Liu, Yonghua Lin
机构
*
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Beijing Normal University(北京师范大学)
;
Peking University(北京大学)
;
Beijing Institute of Technology(北京理工大学)
;
Cornell University(康奈尔大学)
;
Beijing Jiaotong University(北京交通大学)
;
Renmin University of China(中国人民大学)
;
Hong Kong University of Science and Technology (Guangzhou)(广州科技大学)
专题命中
评测与基准
:LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation
Agent工具编排泄露更多:数据集、基准测试与缓解措施
Yuxuan Qiao, Dongqin Liu, Hongchang Yang, Wei Zhou, Songlin Hu
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models
EconCausal: 面向大语言模型的上下文感知经济推理基准
Donggyu Lee, Hyeok Yun, Meeyoung Cha, Sungwon Park, Sangyoon Park, Jihee Kim
机构
*
Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院)
;
College of Business, KAIST(韩国科学技术院商学院)
;
Data Science for Humanity Group, MPI-SP(马克斯·普朗克所际数据科学为人类集团)
;
School of Computing, KAIST(韩国科学技术院计算学院)
;
Division of Social Science, HKUST(香港科技大学社会科学系)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI
Systematic Evaluation of the Quality of Synthetic Clinical Notes Rephrased by LLMs at Million-Note Scale
在百万笔记规模上系统评估LLM重新表述的合成临床笔记质量
Jinghui Liu, Sarvesh Soni, Anthony Nguyen
机构
*
Australian e-Health Research Centre, CSIRO, Australia(澳大利亚电子健康研究中心,CSIRO,澳大利亚)
;
National Library of Medicine, National Institutes of Health, USA(国家医学图书馆,国立卫生研究院,美国)
专题命中
评测与基准
:LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Can Language Models Analyze Data? Evaluating Large Language Models for Question Answering over Datasets
语言模型能分析数据吗?评估大型语言模型在数据集上的问答性能
Andreas Xenofontos, Pavlos Fafalios
机构
*
School of Production Engineering and Management, Technical University of Crete(生产工程与管理学院,希腊克里特技术大学)
;
Institute of Computer Science, Foundation for Research and Technology - Hellas(计算机科学研究所,希腊基础研究与技术研究院)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks
CulturALL:基于 grounded 任务的 LLM 多语言和多文化能力基准测试
Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova, Liubou Misevich, Nevena Marinković, Ngoc Gia Linh Nguyen, Thi Khanh Linh Do, Sarakmatak Sophy, Baotian Hu, Guanhua Chen, Gongbo Tang, Alham Fikri Aji, Longyue Wang, Weihua Luo
机构
*
Alibaba Group(阿里巴巴集团)
;
Beijing Language and Culture University(北京语言大学)
;
LMU Munich(慕尼黑大学)
;
ELLIS Institute Finland(芬兰ELLIS研究所)
;
University of Turku(图尔库大学)
;
IBM Research AI, UAE(阿联酋IBM人工智能研究)
;
MBZUAI
;
Harbin Institute of Technology, Shenzhen(深圳哈尔滨工业大学)
;
Southern University of Science and Technology(南方科技大学)
专题命中
评测与基准
:LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI