How Many Human Survey Respondents is a Large Language Model Worth? An Uncertainty Quantification Perspective
大型语言模型值得模拟多少人意见?从不确定性量化角度出发
Chengpiao Huang, Yuhang Wu, Kaizheng Wang
机构
*
Department of IEOR, Columbia University(哥伦比亚大学工业工程与运筹学系)
;
Decision, Risk, and Operations Division, Columbia Business School(哥伦比亚商学院决策、风险与运营分校)
;
Department of IEOR and Data Science Institute, Columbia University(哥伦比亚大学工业工程与运筹学系及数据科学研究所)
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
机构
*
NSW Department of Education(新南威尔士州教育部)
;
South Australian Department for Education(南澳大利亚州教育部)
;
OC Selective exam preparation platform(OC精英考试备考平台)
;
Studitory: HSC preparation platform(Studitory: HSC备考平台)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Griffith University(格里菲斯大学)
;
Jiangsu University(江苏大学)
;
University of Southern Queensland(南方昆士兰大学)
;
Peking University(北京大学)
;
Great Bay University(大湾大学)
;
Nanjing University(南京大学)
;
Macquarie University(麦觉瑞大学)
;
Southern University of Science and Technology(南方科学与技术大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
CommentsAccepted for publication in Text, Speech and Dialogue (TSD 2026). The final authenticated publication will be available online via Springer LNCS/LNAI
Towards Understanding and Measuring COGNITIVE ATROPHY in LLM Behaviour
理解和测量LLM行为中的认知萎缩
Abeer Badawi, Moyosoreoluwa Olatosi, Negin Baghbanzadeh, Laleh Seyyed-Kalantari, Frank Rudzicz, R. Shayna Rosenbaum, Sara Pishdadian, Elham Dolatabadi
机构
*
York University(约克大学)
;
Vector Institute(向量研究所)
;
Rotman Research Institute(罗特曼研究学院)
;
Dalhousie University(达尔豪斯大学)
;
Centre for Addiction & Mental Health(成瘾与心理健康中心)
;
KITE Research Institute(KITE研究机构)
Querying an astronomical database using large language models: the ALeRCE text-to-SQL system
使用大语言模型查询天文数据库:ALeRCE文本到SQL系统
P. A. Estevez, J. Espejo-Moreira, S. Sanfeliu-Alvarez, F. Forster, A. M. Munoz Arancibia, G. Cabrera-Vives, F. E. Bauer, A. Bayo, M. Catelan, R. Dastidar, L. Hernandez-Garcia, J. A. Intriago, G. Pignata
机构
*
Department of Electrical Engineering, University of Chile, Av. Tupper 2007, Santiago, Chile Millennium Institute of Astrophysics (MAS), Nuncio Monseñor Sótero Sanz 100, Providencia, Santiago, Chile Data
;
Artificial Intelligence Initiative (ID\&IA), Universidad de Chile Center for Mathematical Modeling, Universidad de Chile, Beauchef 851, North building, 7th floor, Santiago 8320000, Chile Departamento de Astronom\'ia, Universidad de Chile, Casilla 36D, Santiago, Chile Department of Computer Science, Universidad de Concepción, Edmundo Larenas 219, Concepción, Chile Center for Data
;
Artificial Intelligence, Universidad de Concepción, Edmundo Larenas 310, Concepción, Chile Heidelberg Institute for Theoretical Studies, Heidelberg, Baden-Württemberg, Germany Instituto de Alta Investigación, Universidad de Tarapacá, Casilla 7D, Arica, 1010000, Chile European Southern Observatory, Karl-Schwarzschild-Strasse 2, 85748 Garching bei München, Germany Instituto de Astrofísica, Facultad de Física, Pontificia Universidad Católica de Chile, Casilla 306, Santiago 22, Chile Centro de Astroingeniería, Pontificia Universidad Católica de Chile, Av. Vicuña Mackenna 4860, 7820436 Macul, Santiago, Chile Instituto de Estudios Astrof\'isicos, Facultad de Ingenier\'ia y Ciencias, Universidad Diego Portales, Av. Ej\'ercito Libertador 441, Santiago, Chile Centro Interdisciplinario de Data Science, Facultad de Ingenier\'ia y Ciencias, Universidad Diego Portales, Av. Ej\'ercito Libertador 441, Santiago, Chile
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI
AI总结
提出基于大语言模型的文本到SQL系统,通过上下文学习和逐步生成框架(模式链接、查询分类、提示分解、自纠正)实现自然语言查询天文数据库,在ALeRCE数据集上评估13个模型,Claude Opus 4.6等表现最佳。
机构
*
School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)
;
Key Laboratory of Machine Intelligence and System Control, Shandong University(机器智能与系统控制重点实验室,山东大学)
;
Department of Medicine and Therapeutics, The Chinese University of Hong Kong(医学与治疗学系,香港中文大学)
;
Department of Geriatric Medicine, Qilu Hospital of Shandong University(老年医学科,山东大学齐鲁医院)
;
Department of Psychiatry, The Chinese University of Hong Kong(精神病学系,香港中文大学)
;
Li Chiu Kong Family Sleep Assessment Unit, Department of Psychiatry, Faculty of Medicine, The Chinese University of Hong Kong(李秋虹家庭睡眠评估单元,精神病学系,医学院,香港中文大学)
;
Li Ka Shing Institute of Health Sciences, Faculty of Medicine, The Chinese University of Hong Kong(李嘉诚健康科学研究院,医学院,香港中文大学)
;
Gerald Choa Neuroscience Institute, Department of Medicine and Therapeutics, The Chinese University of Hong Kong(Gerald Choa 神经科学研究所,医学与治疗学系,香港中文大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety
用于代理网络运维和AI运维的大型语言模型:架构、评估与安全
Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar
机构
*
School of Computing and Communications(计算与通信学院)
;
University of Cambridge(剑桥大学)
;
School of Software(软件学院)
;
Nanjing University of Information Science and Technology(南京信息科技大學)
;
TU Wien(维也纳技术大学)
;
ICREA
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.AI
Ido Aharon, Emanuele La Malfa, Michael Wooldridge, Sarit Kraus
机构
*
Department of Computer Science, Bar-Ilan University(巴伊兰大学计算机科学系)
;
Department of Computer Science, University of Oxford(牛津大学计算机科学系)
;
Institute for Decentralized AI (IDAI)(去中心化人工智能研究所)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.LG
SEAGym: An Evaluation Environment for Self-Evolving LLM Agents
SEAGym: 自我进化LLM智能体的评估环境
Congjie Zheng, Chuanyi Xue, Bin Liang, Jun Yang, Changshui Zhang
机构
*
Department of Automation, Tsinghua University(清华大学自动化系)
;
Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(北京信息科学与技术国家研究中心(BNRist),清华大学)
EHRNote-ChatQA: A Benchmark for Evidence-Grounded Multi-Turn Clinical Question Answering over Longitudinal Discharge Summaries
EHRNote-ChatQA:一个面向纵向出院总结的基于证据的多轮临床问答基准
Jiyoun Kim, Muhan Yeo, Eunhye Jang, Jeewon Yang, Hangyul Yoon, Su Ji Lee, Hee Jo Han, Hee-Jae Jung, Doyun Kwon, Jun young Lee, Jaehun Lee, Jung-Oh Lee, Sunjun Kweon, Jong Hak Moon, Daseul Kim, Minjae Cho, Edward Choi
机构
*
KAIST(韩国科学技术院)
;
Seoul National University(首尔大学)
;
Seoul National University Bundang Hospital(首尔大学盆唐医院)
;
SAIHST, Sungkyunkwan University(成均馆大学)
;
Yonsei University College of Medicine(延世大学医学院)
;
Gangnam Severance Hospital(江南塞弗伦斯医院)
;
Severance Hospital(塞弗伦斯医院)
;
Seoul Medical Center(首尔医疗中心)
;
Seoul National University Hospital(首尔大学医院)
;
National Cancer Center(国立癌症中心)
;
Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院)
;
Samsung Medical Center(三星医疗中心)
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI