LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers: Benchmarking Simulation Accuracy Using 120K+ Personas of 1511 Humans
LLM代理预测社交媒体反应但不优于文本分类器:使用120,000多个1511人的人设进行基准测试
Ljubisa Bojic, Alexander Felfernig, Bojana Dinic, Velibor Ilic, Achim Rettinger, Vera Mevorah, Damian Trilling
机构
*
Institute for Artificial Intelligence Research and Development of Serbia(塞尔维亚人工智能研究与开发研究所)
;
University of Belgrade, Institute for Philosophy and Social Theory, Digital Society Lab(贝尔格莱德大学,哲学与社会理论研究所,数字社会实验室)
;
Complexity Science Hub, Vienna, Austria(维也纳复杂科学中心)
;
Graz University of Technology, Graz, Austria(技术大学格拉茨,格拉茨,奥地利)
;
University of Novi Sad, Faculty of Philosophy, Novi Sad, Serbia(诺维萨德大学,哲学学院,诺维萨德,塞尔维亚)
;
University of Trier, Trier, Germany(特里尔大学,特里尔,德国)
;
Vrije University Amsterdam, Amsterdam, Netherlands(阿姆斯特丹自由大学,阿姆斯特丹,荷兰)
Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning
超越多数投票:面向细粒度和更可靠的测试时间强化学习奖励信号
Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang
机构
*
College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
;
College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)