ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences
ReplicatorBench:用于社会科学和行为科学中可复制性评估的LLM代理基准测试
Bang Nguyen, Dominik Soós, Qian Ma, Rochana R. Obadage, Zack Ranjan, Sai Koneru, Timothy M. Errington, Shakhlo Nematova, Sarah Rajtmajer, Jian Wu, Meng Jiang
机构
*
University of Notre Dame(圣母大学)
;
Old Dominion University(老道明大学)
;
Pennsylvania State University(宾夕法尼亚州立大学)
;
Independent Researcher(独立研究员)
;
Uppsala University(乌普萨拉大学)
;
Center for Open Science(开放科学中心)
From Assistance to Agency: Rethinking Autonomy and Control in CI/CD Pipelines
从协助到自主:重新思考CI/CD流水线中的自主性与控制
Marcus Emmanuel Barnes, Taher A. Ghaleb, Safwat Hassan
机构
*
Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大)
;
Department of Computer Science Trent University Peterborough Ontario Canada(计算机科学系特伦特大学彼得伯格安大略加拿大)
;
University of Toronto(多伦多大学)
;
Trent University(特伦特大学)
Can Multimodal LLMs Perform Time Series Anomaly Detection?
多模态大语言模型能否进行时间序列异常检测?
Xiongxiao Xu, Haoran Wang, Yueqing Liang, Philip S. Yu, Yue Zhao, Kai Shu
机构
*
Illinois Institute of Technology(伊利诺伊理工学院)
;
Emory University(埃默里大学)
;
University of Illinois Chicago(伊利诺伊大学香槟分校)
;
University of Southern California(南加州大学)
Evolving Excellence: Automated Optimization of LLM-based Agents
精益求精:基于大语言模型的代理的自动化优化
Paul Brookes, Vardan Voskanyan, Rafail Giavrimis, Matthew Truscott, Mina Ilieva, Chrystalla Pavlou, Alexandru Staicu, Manal Adham, Will Evers- Hood, Jingzhi Gong, Kejia Zhang, Matvey Fedoseev, Vishal Sharma, Roman Bauer, Zheng Wang, Hema Nair, Wei Jie, Tianhua Xu, Aurora Constantin, Leslie Kanthan, Michail Basios
机构
*
University of Leeds(利兹大学)
;
City, University of London(伦敦城市大学)
;
University of West London(西伦敦大学)
;
University of Edinburgh(爱丁堡大学)
;
University of Surrey(萨里大学)
;
University of Warwick(沃里克大学)
;
King's College London(伦敦国王学院)