TS-Skill: A Benchmark for Evaluating Analytical Skills in Time-Series Question Answering
TS-Skill: 用于评估时间序列问答中分析技能的基准
Liying Han, Kang Yang, Oliver Wang, Jason Wu, Pengrui Quan, Gaofeng Dong, Ozan Baris Mulayim, Sizhe Ma, Yuyang Yuan, Dezhi Hong, Mario Berges, Mani Srivastava
机构
*
University of California, Los Angeles(加州大学洛杉矶分校)
;
Samsung Research America(三星美国研究院)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Microsoft(微软)
;
Amazon(亚马逊)
A Proactive Multi-Agent Dialogue Framework for Assessing Social Language Disorder Traits in Autism
一种主动式多智能体对话框架用于评估自闭症中的社交语言障碍特征
Chuanbo Hu, Minglei Yin, Bin Liu, Wenqi Li, Lynn K. Paul, Shuo Wang, Xin Li
机构
*
Department of Computer Science(计算机科学系)
;
University at Albany(阿尔巴尼大学)
;
Department of Management Information System(管理信息系统系)
;
West Virginia University(西弗吉尼亚大学)
;
Department of Radiology(放射学系)
;
Washington University in St. Louis(圣路易斯华盛顿大学)
;
Humanities and Social Sciences(人文学与社会科学)
GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory
GT-HarmBench:通过博弈论视角评估AI安全风险
Pepijn Cobben, Xuanqiang Angelo Huang, Thao Amelia Pham, Isabel Dahlgren, Terry Jingchen Zhang, Zhijing Jin
机构
*
ETH Zürich(苏黎世联邦理工学院)
;
Berea College(贝雷学院)
;
University of Toronto(多伦多大学)
;
Vector Institute(向量研究所)
;
Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统马克斯·普朗克研究所)
Learnability-Informed Fine-Tuning of Diffusion Language Models
扩散语言模型的可学习性感知微调
Shubham Parashar, Atharv Chagi, Jacob Helwig, Lakshmi Jotsna, Sushil Vemuri, James Caverlee, Dileep Kalathil, Shuiwang Ji
机构
*
Department of Computer Science and Engineering, Texas A\&M University, College Station, TX, USA(计算机科学与工程系,德克萨斯A&M大学,College Station, TX, USA)
;
Department of Electrical and Computer Engineering, Texas A\&M University, College Station, TX, USA(电气与计算机工程系,德克萨斯A&M大学,College Station, TX, USA)
MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents
MoralityGym:用于评估序列决策代理中分层道德对齐的基准
Simon Rosen, Siddarth Singh, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Victoria Williams, Benjamin Rosman, Geraud Nangue Tasse, Steven James
Journal refProc of the 25th International Conference on Autonomous Agents and Multiagent Systems AAMAS 2026, Paphos, Cyprus, May 25 to 29, 2026, IFAAMAS
Fengfei Yu, Ruijia Niu, Dongxia Wu, Yian Ma, Rose Yu
机构
*
Department of Computer Science and Engineering, University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校计算机科学与工程系,拉贾尔,加利福尼亚州,美国)
;
Halıcıoğlu Data Science Institute, University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校Halıcıoğlu数据科学研究所,拉贾尔,加利福尼亚州,美国)
;
Department of Statistics, Stanford University, Stanford, California, USA(斯坦福大学统计学系,斯坦福,加利福尼亚州,美国)
Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta
机构
*
Zuse Institute Berlin(柏林Zuse研究所)
;
Technical University of Berlin(柏林技术大学)
;
Hong Kong Baptist University(香港 Baptist大学)
;
RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心)
Forecasting Downstream Performance of LLMs With Proxy Metrics
通过代理指标预测大语言模型的下游性能
Arkil Patel, Siva Reddy, Marius Mosbach, Dzmitry Bahdanau
机构
*
Mila – Quebec AI Institute & McGill University(魁北克AI研究院与麦吉尔大学)
;
CIFAR AI Chair(CIFAR人工智能主席)
;
ServiceNow Research Periodic Labs(ServiceNow研究周期实验室)
STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics
STT-Arena:一种更现实的工具使用环境,包含时空动态
Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan, Sen Su, Chunxiao Liu, Ning Miao
机构
*
Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学)
;
Department of Data Science, City University of Hong Kong(数据科学系,香港城市大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Li Auto Inc.(李汽有限公司)
;
Independent Researcher(独立研究者)