RPA-Check: A Multi-Stage Automated Framework for Evaluating Dynamic LLM-based Role-Playing Agents
RPA-Check:一种多阶段自动框架,用于评估基于大语言模型的角色扮演代理
Riccardo Rosati, Edoardo Colucci, Massimiliano Bolognini, Adriano Mancini, Paolo Sernani
机构
*
Department of Political Sciences, Communication and International Relations, University of Macerata(马切拉塔大学政治学、传播与国际关系系)
;
Department of Law, University of Macerata(马切拉塔大学法律系)
EVGeoQA: Benchmarking LLMs on Dynamic, Multi-Objective Geo-Spatial Exploration
EVGeoQA:基于动态多目标地理空间探索的LLM基准测试
Jianfei Wu, Zhichun Wang, Zhensheng Wang, Zhiyu He
机构
*
School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
;
Beijing Key Laboratory of Artificial Intelligence for Education(北京市教育人工智能重点实验室)
;
Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(教育部智能技术与教育应用工程研究中心)
;
College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)
机构
*
School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院)
;
MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室)
LABBench2: An Improved Benchmark for AI Systems Performing Biology Research
LABBench2:一种改进的AI系统进行生物研究的基准测试
Jon M Laurent, Albert Bou, Michael Pieler, Conor Igoe, Alex Andonian, Siddharth Narayanan, James Braza, Alexandros Sanchez Vassopoulos, Jacob L Steenwyk, Blake Lash, Andrew D White, Samuel G Rodriques
机构
*
Broad Institute, Cambridge, MA, USA(博德研究所,美国马萨诸塞州剑桥市)
Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning
通过字形驱动微调增强多模态大语言模型用于古汉字演变分析
Rui Song, Lida Shi, Ruihua Qi, Yingji Li, Hao Xu
机构
*
College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院)
;
Key Laboratory of Ancient Chinese Script, Culture Relics and Artificial Intelligence, Jilin University, China(吉林大学古文字、文物与人工智能重点实验室)
;
School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院)
;
School of Archaeology, Jilin University, China(吉林大学考古学院)
SciPredict: Can LLMs Predict the Outcomes of Scientific Experiments in Natural Sciences?
SciPredict: LLMs能否预测自然科学中的实验结果?
Udari Madhushani Sehwag, Elaine Lau, Haniyeh Ehsani Oskouie, Shayan Shabihi, Erich Liang, Andrea Toledo, Guillermo Mangialardi, Sergio Fonrouge, Ed-Yeremai Hernandez Cardona, Paula Vergara, Utkarsh Tyagi, Chen Bo Calvin Zhang, Pavi Bhatter, Nicholas Johnson, Furong Huang, Ernesto Gabriel Hernandez Montoya, Bing Liu
机构
*
Scale AI
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
University of Maryland(马里兰大学)
;
Princeton University(普林斯顿大学)
;
Human Frontier Collective(人类前沿集体)