机构
*
School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)
;
Key Laboratory of Machine Intelligence and System Control, Shandong University(机器智能与系统控制重点实验室,山东大学)
;
Department of Medicine and Therapeutics, The Chinese University of Hong Kong(医学与治疗学系,香港中文大学)
;
Department of Geriatric Medicine, Qilu Hospital of Shandong University(老年医学科,山东大学齐鲁医院)
;
Department of Psychiatry, The Chinese University of Hong Kong(精神病学系,香港中文大学)
;
Li Chiu Kong Family Sleep Assessment Unit, Department of Psychiatry, Faculty of Medicine, The Chinese University of Hong Kong(李秋虹家庭睡眠评估单元,精神病学系,医学院,香港中文大学)
;
Li Ka Shing Institute of Health Sciences, Faculty of Medicine, The Chinese University of Hong Kong(李嘉诚健康科学研究院,医学院,香港中文大学)
;
Gerald Choa Neuroscience Institute, Department of Medicine and Therapeutics, The Chinese University of Hong Kong(Gerald Choa 神经科学研究所,医学与治疗学系,香港中文大学)
SorryDB: Can AI Provers Complete Real-World Lean Theorems?
SorryDB: AI证明者能完成现实世界的Lean定理吗?
Austin Letson, Leopoldo Sarra, Auguste Poiroux, Oliver Dressler, Paul Lezeau, Dhyan Aranha, Frederick Pu, Aaron Hill, Miguel Corredera Hidalgo, Julian Berman, George Tsoukalas, Lenny Taelman
机构
*
University of California, Berkeley(加州大学伯克利分校)
Automated Creativity Evaluation of Language Models Across Open-Ended Tasks
语言模型在开放式任务中的自动化创造力评估
Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan
机构
*
Raffles Institution(莱佛士书院)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
;
Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院)
;
Centre of AI in Medicine (C-AIM), Nanyang Technological University(南洋理工大学人工智能医学中心)
机构
*
The University of Hong Kong(香港大学)
;
Qwen Team, Alibaba Inc.(阿里巴巴集团Qwen团队)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
Tsinghua University(清华大学)
MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval
MCERF:通过增强检索推进工程文档的多模态大语言模型评估
Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu
机构
*
School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269)
;
Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)
Comments18 pages, 2 figures, 9 tables. Technical report. First place in both Open and Efficient tracks of MindGames Arena Generalization Track at NeurIPS 2025
机构
*
SIAT, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Alibaba Group(阿里巴巴集团)
;
University of New South Wales(新南威尔士大学)
TS-Skill: A Benchmark for Evaluating Analytical Skills in Time-Series Question Answering
TS-Skill: 用于评估时间序列问答中分析技能的基准
Liying Han, Kang Yang, Oliver Wang, Jason Wu, Pengrui Quan, Gaofeng Dong, Ozan Baris Mulayim, Sizhe Ma, Yuyang Yuan, Dezhi Hong, Mario Berges, Mani Srivastava
机构
*
University of California, Los Angeles(加州大学洛杉矶分校)
;
Samsung Research America(三星美国研究院)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Microsoft(微软)
;
Amazon(亚马逊)
To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents
叫还是不叫:诊断LLM代理中的内在过度调用偏差
Wei Shi, Ziheng Peng, Sihang Li, Xiting Wang, Xiang Wang, Mengnan Du, Na Zou
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Renmin University of China(中国人民大学)
;
The Chinese University of Hong Kong Shenzhen(香港中文大学(深圳))
;
University of Science and Technology of China(中国科学技术大学)