机构
*
Baidu Inc.(百度公司)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
University of Science and Technology of China(中国科学技术大学)
;
Zhejiang University(浙江大学)
;
University of Technology Sydney(悉尼科技大学)
Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents
Agent规划基准:LLM Agent规划能力的诊断框架
Haoyu Sun, Wenxuan Wang, Mingyang Song, Jujie He, Weinan Zhang, Yang Liu, Yang Yang, Yu Cheng
机构
*
Tongji University(同济大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Fudan University(复旦大学)
;
Skywork AI
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Shanghai Jiao Tong University(上海交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
The Saturation Trap and the Subjectivity of Intervention Timing: Why Affect-Based Triggers and LLM Judges Fail to Time Interventions on Autonomous Agents
机构
*
University of Electronic Science and Technology of China(电子科技大学)
;
National University of Singapore(新加坡国立大学)
;
De Artificial Intelligence Lab(德人工智能实验室)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
University of Science and Technology of China(中国科学技术大学)
机构
*
State Key Laboratory of AI Safety(人工智能安全国家重点实验室)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
Renmin University of China(中国人民大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
Journal refProceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pp. 4797-4818, European Language Resources Association (ELRA), Palma, Mallorca, Spain, May 2026