机构
*
China-ASEAN Information Harbor Co., Ltd.(中国-东盟信息港有限公司)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
School of Software & Microelectronics, Peking University(北京大学软件与微电子学院)
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games
Orak:面向多样化视频游戏的LLM代理训练与评估基础基准
Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, Jaewoong Cho
机构
*
KRAFTON
;
Seoul National University(首尔国立大学)
;
NVIDIA
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
Ludo Robotics
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
RAG or Learning? Understanding the Limits of LLM Adaptation under Continuous Knowledge Drift in the Real World
RAG还是学习?在现实世界中连续知识漂移下理解LLM适应的极限
Hanbing Liu, Lang Cao, Yang Li
机构
*
Tsinghua University(清华大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
School of Artificial Intelligence, Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)人工智能学院)
;
Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(深圳 ubiquitous 数据赋能重点实验室,清华大学深圳国际研究生院,清华大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)
FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks
FDM-Bench:用于评估大型语言模型在增材制造任务中的综合基准
Ahmadreza Eslaminia, Adrian Jackson, Beitong Tian, Avi Stern, Hallie Gordon, Rajiv Malhotra, Klara Nahrstedt, Chenhui Shao
机构
*
Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系)
;
Coordinated Science Laboratory, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校协调科学实验室)
;
Department of Mechanical and Aerospace Engineering, Rutgers University(罗格斯大学机械与航空航天工程系)
;
Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
机构
*
Department of Computer
;
Data Sciences, Case Western Reserve University, Cleveland, USA
;
Department of Computer Science \& Engineering, Texas A\&M University, College Station, USA
;
Department of Biochemistry, Case Western Reserve University, Cleveland, USA
;
Center for RNA Science
;
Therapeutics, Case Western Reserve University, Cleveland, USA
;
Department of Biomedical Engineering, Case Western Reserve University, Cleveland, USA
专题命中
评测与基准
:language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.LG
Comments11 pages, 5 figures, 9 tables. Published in FSE Companion 2026
Journal refIn Proceedings of the 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering Companion (FSE Companion '26), Montreal, QC, Canada, 2026
GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis
GeoAgentBench: 一种面向空间分析工具增强代理的动态执行基准
Bo Yu, Cheng Yang, Dongyang Hou, Chengfu Liu, Jiayao Liu, Chi Wang, Zhiming Zhang, Haifeng Li, Wentao Yang
机构
*
School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)
;
School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(湖南科技大学地球科学与空间信息工程学院)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
RPS: Information Elicitation with Reinforcement Prompt Selection
RPS: 通过强化提示选择进行信息获取
Tao Wang, Jingyao Lu, Xibo Wang, Haonan Huang, Su Yao, Zhiqiang Hu, Xingyan Chen, Enmao Diao
机构
*
Department of Computer Science, Southwestern University of Finance and Economics(西南财经大学计算机科学学院)
;
China Telecom Corporation Limited(中国电信有限公司)
;
Tsinghua University(清华大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Eindhoven University of Technology(埃因霍温理工大学)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG