机构
*
Peking University(北京大学)
;
MIT(麻省理工学院)
;
TUM(技术大学(TUM))
;
Meituan(美团)
;
Peking University School of CIT, MCML, MDSIEECS and CSAIL(北京大学计算机学院、MCML、MDSIEECS以及CSAIL)
机构
*
School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院)
;
School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)
;
CSIRO(澳大利亚联邦科学与工业研究组织)
;
Northwestern Polytechnical University(西北工业大学)
;
University of Macau(澳门大学)
EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning
EgoIntrospect: 一个用于用户中心内部状态推理的注视数据集和基准
Zeyu Wang, Chang Liu, Eduardus Tjitrahardja, Yuntao Wang, Borislav Pavlov, Fangfei Gou, Jose Manuel Davila, Dai Shi, Ran Xu, Yue Pan, Jiayi Tan, Shuting Chang, Qi Wang, Jinzhao Li, Jiacheng Hua, Yifei Huang, Jingwei Sun, Yu Zhang, Liuxin Zhang, Guocai Yao, Jia Jia, Yin Li, Qianying Wang, Yuanchun Shi, Miao Liu
机构
*
Tsinghua University(清华大学)
;
Tongji University(同济大学)
;
Renmin University of China(中国人民大学)
;
The University of Tokyo(东京大学)
;
Lenovo Group(联想集团)
;
Peking University(北京大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Shanghai Qi Zhi Institute(上海启智研究院)
When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution
当机器人做家务:一个基准和代理用于长期家庭任务执行
Zilin Zhu, Longteng Guo, Yanghong Mei, Bowen Pang, Zongxun Zhang, Xingjian He, Ruyi Ji, Jing Liu
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Zhongguancun Academy(中关村学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform
WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试
Yu Shang, Yinzhou Tang, Yiding Ma, Zhuohang Li, Lei Jin, Weikang Su, Xin Jin, Zhaolu Wang, Ziyou Wang, Xin Zhang, Haisheng Su, Weizhen He, Wei Wu, Haoyi Duan, Gordon Wetzstein, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Chen Gao, Yong Li
机构
*
Tsinghua University(清华大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Zhejiang University(浙江大学)
;
Stanford University(斯坦福大学)
;
The University of Hong Kong(香港大学)
;
Princeton University(普林斯顿大学)
;
Chinese Academy of Sciences(中国科学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Peking University(北京大学)
;
National University of Singapore(新加坡国立大学)
Forecasting Downstream Performance of LLMs With Proxy Metrics
通过代理指标预测大语言模型的下游性能
Arkil Patel, Siva Reddy, Marius Mosbach, Dzmitry Bahdanau
机构
*
Mila – Quebec AI Institute & McGill University(魁北克AI研究院与麦吉尔大学)
;
CIFAR AI Chair(CIFAR人工智能主席)
;
ServiceNow Research Periodic Labs(ServiceNow研究周期实验室)
STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics
STT-Arena:一种更现实的工具使用环境,包含时空动态
Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan, Sen Su, Chunxiao Liu, Ning Miao
机构
*
Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学)
;
Department of Data Science, City University of Hong Kong(数据科学系,香港城市大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Li Auto Inc.(李汽有限公司)
;
Independent Researcher(独立研究者)
Validate Your Authority: Benchmarking LLMs on Multi-Label Precedent Treatment Classification
验证你的权威:在多标签先例处理分类上对LLM进行基准测试
M. Mikail Demir, M. Abdullah Canbaz
机构
*
Department of Information Science and Technology(信息科学与技术系)
;
College of Emergency Preparedness, Homeland Security, and Cybersecurity(应急准备、国土安全与网络安全学院)
;
University at Albany, SUNY(萨利纳大学)
QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
QQJ: 量化定性判断以实现可扩展且与人类对齐的生成AI评估
Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri
机构
*
AI Lab, Arioobarzan Engineering Team(艾伊罗巴赞工程团队人工智能实验室)
;
Department of Computer Engineering and Information Technology(计算机工程与信息科技系)
;
Department of Informatics, Bioengineering, Robotics and Systems Engineering(信息学、生物工程、机器人与系统工程系)
;
University of Genoa(热那亚大学)
ADR: An Agentic Detection System for Enterprise Agentic AI Security
ADR:一种用于企业代理AI安全的代理检测系统
Chenning Li, Pan Hu, Justin Xu, Baris Ozbas, Olivia Liu, Caroline Van, Manxue Li, Wei Zhou, Mohammad Alizadeh, Pengyu Zhang, KK Sriramadhesikan, Ming Zhang
机构
*
Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系)
;
Alibaba International Digital Commerce Group, Beijing, China(阿里巴巴国际数字 commerce 集团)
;
School of Software, Tsinghua University, Beijing, China(清华大学软件学院)
PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media
PluRule:一种用于社交媒体上多元社区调节的基准测试
Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer
机构
*
Observatory on Social Media, Indiana University, USA(社交媒体观察站,印第安纳大学,美国)
;
Center Synergy of Systems, TUD Dresden University of Technology, Germany(系统协同中心,德累斯顿技术大学,德国)
CoCoReviewBench: A Completeness- and Correctness-Oriented Benchmark for AI Reviewers
CoCoReviewBench:面向AI审稿人完整性和正确性的基准测试
Hexuan Deng, Xiaopeng Ke, Yichen Li, Ruina Hu, Dehao Huang, Derek F. Wong, Yue Wang, Xuebo Liu, Min Zhang
机构
*
Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)
;
Zhongguancun Academy, Beijing, China(中关村学院)
;
Faculty of Computing, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机学院)
;
Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学计算机科学与工程系)
;
NLP²CT Lab, Department of Computer and Information Science, University of Macau, China(澳门大学自然语言处理实验室)
Helping Customers in Distress: An LLM-powered Agent that Converses, Probes, and Routes
帮助陷入困境的客户:一个基于LLM的代理,能够对话、探测和分流
Alankar Atreya, Stefan Sylvius Wanger, Devesh Batra, Robert Hankache, Cristovao Iglesias, Patrick Sinclair, Giulio Pelosio, Michael McMillan, Greig A. Cowan, Raad Khraishi
SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science
SCICONVBENCH: 评估LLM在计算科学任务公式化中的多轮澄清能力
Nithin Somasekharan, Youssef Hassan, Shiyao Lin, Gihan Panapitiya, Patrick Emami, Anurag Acharya, Sameera Horawalavithana, Shaowu Pan
机构
*
Rensselaer Polytechnic Institute(拉特格斯理工学院)
;
University of Texas at Arlington(德克萨斯大学阿灵顿分校)
;
Pacific Northwest National Laboratory(太平洋西北国家实验室)
;
National Renewable Energy Laboratory(国家可再生能源实验室)
A Scoping Review of Large Language Model-Based Pedagogical Agents
基于大语言模型的教育代理的综述
Shan Li, Juan Zheng
机构
*
Department of Education and Human Services, College of Education, Lehigh University(教育与人类服务学院,教育学院,莱维大学)
;
Department of Community and Global Health, College of Health, Lehigh University(社区与全球健康学院,健康学院,莱维大学)