Wisdom of the AI Crowd (AI-CROWD) for Ground Truth Approximation in Content Analysis: A Research Protocol & Validation Using Eleven Large Language Models
Transforming Science with Large Language Models: A Survey on AI-assisted Scientific Discovery, Experimentation, Content Generation, and Evaluation
用大语言模型变革科学:一项关于人工智能辅助科学发现、实验、内容生成和评估的综述
Steffen Eger, Yong Cao, Jennifer D'Souza, Andreas Geiger, Christian Greisinger, Stephanie Gross, Yufang Hou, Brigitte Krenn, Anne Lauscher, Yizhi Li, Chenghua Lin, Nafise Sadat Moosavi, Wei Zhao, Tristan Miller
机构
*
University of Technology Nuremberg (UTN)(图恩大学(UTN))
;
University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心)
;
TIB Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心)
;
Austrian Research Institute for Artificial Intelligence(奥地利人工智能研究所)
;
IT:U Interdisciplinary Transformation University Austria(奥地利 interdisciplinary transformation 大学)
;
University of Hamburg(汉堡大学)
;
University of Manchester(曼彻斯特大学)
;
University of Sheffield(谢菲尔德大学)
;
University of Aberdeen(阿伯丁大学)
;
University of Manitoba(曼尼托巴大学)
专题命中
评测与基准
:language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG
机构
*
School of Computing, Wichita State University(计算机科学学院,威斯康星州立大学)
;
Department of Electrical and Computer Engineering, Auburn University(电气与计算机工程系,阿伯茨兰大学)
;
IBM
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
From Raw Corpora to Domain Benchmarks: Automated Evaluation of LLM Domain Expertise
从原始语料到领域基准:对LLM领域专业知识的自动化评估
Nitin Sharma, Thomas Wolfers, Çağatay Yıldız
机构
*
Department of Psychiatry and Psychotherapy(精神病学与心理学系)
;
University Hospital Tübingen(图宾根大学医院)
;
Laboratory for Mental Health Mapping(心理健康图谱实验室)
;
Carl Zeiss Professor for AI in Neural Systems Imaging(神经系统成像人工智能教授职位)
;
Friedrich Schiller University Jena(耶拿弗里德里克·施勒格尔大学)
;
Cluster of Excellence Machine Learning for Science(卓越中心:科学机器学习)
;
University of Tübingen(图宾根大学)
Comments46 pages, 3 figures + This paper proposes an LLM-based multi-agent system (MAS) for automated evaluation of new product concepts, incorporating retrieval-augmented generation (RAG) and cross-functional virtual agents to assess technical and market feasibility
Spatial Colour Mixing Illusions as a Perception Stress Test for Vision-Language Models
空间色彩混合错觉作为视觉-语言模型的感知压力测试
Nicoleta-Nina Basoc, Adrian Cosma, Emilian Radoi
机构
*
National University of Science and Technology POLITEHNICA Bucharest(波兰布加勒斯特技术大学)
;
IDSIA, The Dalle Molle Institute for Artificial Intelligence(达摩信息技术研究所)
Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots
迈向运动图灵测试:评估人形机器人的人性化
Mingzhe Li, Mengyin Liu, Zekai Wu, Xincheng Lin, Junsheng Zhang, Ming Yan, Zengye Xie, Changwang Zhang, Chenglu Wen, Lan Xu, Siqi Shen, Cheng Wang
机构
*
Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(福建城市智能感知与计算重点实验室,厦门大学)
;
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Xiamen University(多媒体可信感知与高效计算重点实验室,中华人民共和国教育部,信息学院,厦门大学)
;
National Institute for Data Science in Health and Medicine, Xiamen University(医学数据科学国家研究院,厦门大学)
;
OPPO Research Institute(OPPO研究院)
;
ShanghaiTech University(上海科技大学)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract)