arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2602.10799 2026-02-12 cs.CV cs.AI 89%

RSHallu: Dual-Mode Hallucination Evaluation for Remote-Sensing Multimodal Large Language Models with Domain-Tailored Mitigation

RSHallu: 远程传感多模态大语言模型的双模式幻觉评估与领域定制缓解

Zihui Zhou, Yong Feng, Yanying Chen, Guofan Duan, Zhenxi Song, Mingliang Zhou, Weijia Jia

机构 * College of Computer Science, Chongqing University(重庆大学计算机科学学院) Heavy Rainfall Research Center of China(中国强降水研究中心) CMA Key Open Laboratory of Transforming Climate Resources to Economy, Chongqing Institute of Meteorological Sciences(中国气象局气候资源转化经济重点开放实验室、重庆气象科学研究院) Chongqing Metropolitan College of Science(重庆科学理工学院) School of Intelligence Science(智能科学学院) College of Artificial Intelligence, Harbin Institute of Technology(人工智能学院、哈尔滨工业大学) BNU-UIC Institute of Artificial Intelligence(北京师范大学-国际学院人工智能与未来网络研究院) Future Networks, Beijing Normal University at Zhuhai(未来网络、北京师范大学珠海分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 RSHallu通过双模式检查和领域定制数据集,提升遥感多模态大语言模型的幻觉缓解效果,提高无幻觉率21.63个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09210 2026-02-12 cs.CV cs.AI 89%

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

MME-Emotion:多模态大语言模型情感智能的综合评估基准

Fan Zhang, Zebang Cheng, Chong Deng, Haoxuan Li, Zheng Lian, Qian Chen, Huadai Liu, Wen Wang, Yi-Fan Zhang, Renrui Zhang, Ziyu Guo, Zhihong Zhu, Hao Wu, Haixin Wang, Yefeng Zheng, Xiaojiang Peng, Xian Wu, Kun Wang, Xiangang Li, Jieping Ye, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室) SZTU(深圳技术大学) Peking University(北京大学) Tongji University(同济大学) CASIA(中国科学院自动化所) Tencent(腾讯) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08889 2026-02-10 cs.AI 89%

Scalable Delphi: Large Language Models for Structured Risk Estimation

可扩展的德尔菲:用于结构化风险估计的大型语言模型

Tobias Lorenz, Mario Fritz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出可扩展的德尔菲方法,利用大型语言模型进行结构化风险评估,通过多样化的专家人设和迭代优化,实现了高效且准确的风险估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08887 2026-02-10 cs.SE cs.AI 89%

DeepQuali: Initial results of a study on the use of large language models for assessing the quality of user stories

DeepQuali: 大型语言模型在评估用户故事质量研究中的初步结果

Adam Trendowicz, Daniel Seifert, Andreas Jedlitschka, Marcus Ciolkowski, Anton Strahilov

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 DeepQuali利用大型语言模型评估用户故事质量,通过对比专家判断发现其在整体评估上有效,但细节评分存在分歧,且需进一步融入工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08872 2026-02-10 cs.CL cs.IR 89%

Large Language Models for Geolocation Extraction in Humanitarian Crisis Response

大型语言模型在人道主义危机响应中的地理信息提取

G. Cafferata, T. Demarco, K. Kalimeri, Y. Mejova, M. G. Beiró

机构 * Universidad de San Andrés Victoria(圣安德烈斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出基于LLM的两步框架,通过结合命名实体识别和上下文地理编码模块,提升人道主义文档中地理信息提取的精度与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19647 2026-02-09 cs.CV cs.AI 89%

Show or Tell? Effectively prompting Vision-Language Models for semantic segmentation

展示还是讲述?有效提示视觉-语言模型进行语义分割

Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Filip Janicki, Cristiano Malossi, Konrad Schindler, Roy Assaf

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :language model(title,abstract);prompting(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出PromptMatcher,通过结合文本和视觉提示提升VLMs在语义分割中的性能,实现优于现有方法的改进。

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05883 2026-02-06 cs.AI 89%

A Guide to Large Language Models in Modeling and Simulation: From Core Techniques to Critical Challenges

大语言模型在建模与仿真中的应用指南:从核心技术到关键挑战

Philippe J. Giabbanelli

机构 * Old Dominion University(旧 Dominion 大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在建模与仿真中的应用,分析了核心技术和关键挑战,提供了全面的使用指南和实践建议。

Comments Book chapter. Accepted in Artificial Intelligence in Modeling and Simulation, Philippe J. Giabbanelli and Istvan David (eds). Series on Simulation Foundations, Methods and Applications. Springer, Cham. Series ISSN: 2195-2817

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03198 2026-02-05 cs.CL 89%

PersoBench: Benchmarking Personalized Response Generation in Large Language Models

PersoBench:大型语言模型中个性化响应生成的基准测试

Saleh Afzoon, Zahra Jamali, Usman Naseem, Amin Beheshti

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学) School of Electrical and Computer Engineering, Shiraz University(电气与计算机工程学院,谢里兹大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 PersoBench通过结构化流程评估LLMs在零样本设置中生成个性化响应的能力,揭示其在流畅性、个性化和连贯性方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02641 2026-02-04 cs.CR cs.AI 89%

Benchmarking Large Language Models for Zero-shot and Few-shot Phishing URL Detection

对零样本和少样本钓鱼网址检测的大型语言模型进行基准测试

Najmul Hasan, Prashanth BusiReddyGari

机构 * University of North Carolina at Pembroke(北卡罗来纳大学帕克分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文通过统一的零样本和少样本提示框架,评估了大型语言模型在钓鱼网址检测中的性能,揭示了不同模型在泛化能力和实用性上的差异。

Comments 9 pages, accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025 LAW Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07077 2026-02-04 cs.CL cs.CY cs.HC 89%

Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models

多轮评估大型语言模型中的人格化行为

Lujain Ibrahim, Canfer Akbulut, Rasmi Elasmar, Charvi Rastogi, Minsuk Kahng, Meredith Ringel Morris, Kevin R. McKee, Verena Rieser, Murray Shanahan, Laura Weidinger

机构 * University of Oxford(牛津大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出多轮评估方法,评估大型语言模型的人格化行为,发现SOTA模型表现出关系建立和第一人称代词使用等行为,并强调多轮评估对复杂社会现象的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02440 2026-02-03 cs.CL 89%

Large Language Models for Mental Health: A Multilingual Evaluation

大语言模型在心理健康领域的应用:多语言评估

Nishat Raihan, Sadiya Sayara Chowdhury Puspo, Ana-Maria Bucur, Stevie Chancellor, Marcos Zampieri

机构 * George Mason University(乔治·马歇尔大学) Interdisciplinary School of Doctoral Studies, University of Bucharest(布加勒斯特大学跨学科博士研究学院) PRHLT Research Center, Universitat Politècnica de València(瓦伦西亚理工大学PRHLT研究中心) University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文评估了多语言环境下大语言模型在心理健康任务中的表现,发现其在部分数据集上表现优异,但翻译质量对性能有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07448 2026-02-03 cs.CL 89%

Large Language Models for Scientific Idea Generation: A Creativity-Centered Survey

用于科学思想生成的大型语言模型:以创造力为中心的综述

Fatemeh Shahhosseini, Arash Marioriyad, Ali Momen, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban, Shaghayegh Haghjooy Javanmard

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型在科学思想生成中的应用,分析了不同方法在创新性与科学合理性之间的权衡,并提出了评估框架以指导未来研究方向。

Comments 75 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01161 2026-02-03 cs.CL 89%

Beyond Training for Cultural Awareness: The Role of Dataset Linguistic Structure in Large Language Models

超越文化意识的训练:大型语言模型中数据集语言结构的作用

Reem I. Masoud, Chen Feng, Shunta Asano, Saied Alshahrani, Philip Colin Treleaven, Miguel R. D. Rodrigues

机构 * University College London(伦敦大学学院) Queen’s University Belfast(贝尔法斯特女王大学) The University of Tokyo(东京大学) University of Bisha(比沙大学) King Abdulaziz University(阿卜杜勒阿齐兹国王大学) AI Centre, University College London(伦敦大学学院人工智能中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文研究了数据集语言结构对大型语言模型文化表现的影响,发现词汇导向的成分在不同模型中表现更稳定,而语义或多样性极端成分可能产生中性或有害效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21375 2026-01-30 cs.AI 89%

TeachBench: A Syllabus-Grounded Framework for Evaluating Teaching Ability in Large Language Models

TeachBench: 一种基于课程的评估大语言模型教学能力的框架

Zheng Li, Siyao Song, Jingyuan Ma, Rui Li, Ying Zeng, Minghao Li, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) ByteDance BandAI(字节跳动BandAI) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 TeachBench通过多轮指导后学生表现提升评估大语言模型的教学能力,揭示不同模型和领域间教学效果的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00527 2026-01-30 cs.SE cs.AI 89%

A Hierarchical Imprecise Probability Approach to Reliability Assessment of Large Language Models

一种分层不精确概率方法用于大型语言模型的可靠性评估

Robab Aghazadeh-Chakherlou, Qing Guo, Siddartha Khastgir, Peter Popov, Xiaoge Zhang, Xingyu Zhao

机构 * WMG, University of Warwick(沃里克大学工业与制造业学院) Center for Frontier AI Research, A*STAR(前沿人工智能研究中心) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Center for Software Reliability, City St George's, University of London(伦敦大学圣乔治学院软件可靠性中心) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业与系统工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出HIP-LLM,一种分层不精确概率框架,用于更准确地评估大型语言模型的可靠性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18271 2026-01-27 cs.DL cs.CL 89%

Designing large language model prompts to extract scores from messy text: A shared dataset and challenge

设计大型语言模型提示以从杂乱文本中提取分数:一个共享数据集和挑战

Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出一个共享数据集和挑战,旨在通过设计提示提升大型语言模型从杂乱文本中提取分数的准确性。

Journal ref Trends in Information Management, 13(2), paper 1 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16516 2026-01-27 cs.LG 89%

Rethinking Large Language Models For Irregular Time Series Classification In Critical Care

重新思考用于危重监护中不规则时间序列分类的大型语言模型

Feixiang Zheng, Yu Wu, Cecilia Mascolo, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) University of Cambridge, UK(剑桥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文研究了LLMs在不规则ICU时间序列分类中的有效性,发现编码器设计比对齐策略更重要,但LLMs在训练时间和少样本学习中表现欠佳。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01993 2026-01-27 cs.AI 89%

Towards Privacy-Preserving Mental Health Support with Large Language Models

面向隐私保护的大型语言模型在心理健康支持中的应用

Dong Xue, Jicheng Tu, Ming Wang, Xin Yan, Fangzhou Liu, Jie Hu

机构 * IEEE

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出MindChat和MindCorpus,通过多智能体角色扮演框架生成高质量咨询数据,结合联邦学习和差分隐私优化,实现隐私保护的高效心理健康支持系统。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16466 2026-01-26 cs.CL 89%

Persona Jailbreaking in Large Language Models

大型语言模型中的身份劫持

Jivnesh Sandhan, Fei Cheng, Tushar Sandhan, Yugo Murawaki

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 PHISH通过隐含引导历史的身份劫持框架,揭示LLM身份操控的新漏洞,实现对身份的可控操控。

Comments Accepted at EACL26 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12723 2026-01-26 cs.NE cs.AI 89%

An Evolutionary Framework for Automatic Optimization Benchmark Generation via Large Language Models

基于大语言模型的进化自动优化基准生成框架

Yuhiro Ono, Tomohiro Harada, Yukiya Miura

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的进化自动优化基准生成框架,通过生成数学表达式问题诱导不同算法性能差异,实验表明该框架能高效生成具有显著区分性的优化基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15628 2026-01-23 cs.AI 89%

CogToM: A Comprehensive Theory of Mind Benchmark inspired by Human Cognition for Large Language Models

CogToM:一种受人类认知启发的大型语言模型全面理论思维基准

Haibo Tong, Zeyang Yue, Feifei Zhao, Erliang Lin, Lu Jia, Ruolin Chen, Yinqian Sun, Qian Zhang, Yi Zeng

机构 * BrainCog Lab, Institute of Automation, Chinese Academy of Sciences(脑认知实验室,自动化研究所,中国科学院) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究所) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学) Long-term AI(长期人工智能)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 CogToM通过8000个双语实例评估LLM的理论思维能力,揭示性能异质性和认知瓶颈,为研究LLM认知边界提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13137 2026-01-23 cs.CL 89%

Adversarial Alignment: Ensuring Value Consistency in Large Language Models for Sensitive Domains

对抗对齐:确保大型语言模型在敏感领域中的价值一致性

Yuan Gao, Zhigang Liu, Xinyu Yao, Bo Chen, Xiaobing Zhao

机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) National Language Resource Monitoring and Research Center of Minority Languages(少数民族语言资源监测与研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出对抗对齐框架,通过持续预训练、指令微调和对抗训练提升大型语言模型在敏感领域中的价值一致性,实验表明其优于现有主流模型。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15129 2026-01-22 cs.CL 89%

RSNA Large Language Model Benchmark Dataset for Chest Radiographs of Cardiothoracic Disease: Radiologist Evaluation and Validation Enhanced by AI Labels (REVEAL-CXR)

用于心胸疾病胸部X光影像的RSNA大语言模型基准数据集:通过AI标签增强的放射科评估和验证(REVEAL-CXR)

Yishu Wei, Adam E. Flanders, Errol Colak, John Mongan, Luciano M Prevedello, Po-Hao Chen, Henrique Min Ho Lee, Gilberto Szarf, Hamilton Shoji, Jason Sho, Katherine Andriole, Tessa Cook, Lisa C. Adams, Linda C. Chu, Maggie Chung, Geraldine Brusca-Augello, Djeven P. Deva, Navneet Singh, Felipe Sanchez Tijmes, Jeffrey B. Alpert, Elsie T. Nguyen, Drew A. Torigian, Kate Hanneman, Lauren K Groner, Alexander Phan, Ali Islam, Matias F. Callejas, Gustavo Borges da Silva Teles, Faisal Jamal, Maryam Vazirabad, Ali Tejani, Hari Trivedi, Paulo Kuriki, Rajesh Bhayana, Elana T. Benishay, Yi Lin, Yifan Peng, George Shih

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究通过AI辅助标注流程,创建了包含200张胸部影像的基准数据集,用于评估不同模型,同时帮助放射科医生更高效地标注影像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15034 2026-01-22 cs.HC cs.AI 89%

Visual and Cognitive Demands of a Large Language Model-Powered In-vehicle Conversational Agent

基于大型语言模型的车载对话代理的视觉与认知需求

Chris Monk, Allegra Ayala, Christine S. P. Yu, Gregory M. Fitch, Dara Gruber

机构 * Exponent, Inc.(Exponent公司) Google, Inc.(Google公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究评估了基于大型语言模型的车载对话代理在驾驶中的视觉与认知需求,发现其与免提通话在认知负荷上相当,且视觉需求较低,支持其在驾驶环境中的安全应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14826 2026-01-22 cs.CL 89%

Comparative Study of Large Language Models on Chinese Film Script Continuation: An Empirical Analysis Based on GPT-5.2 and Qwen-Max

大型语言模型在中文电影剧本延续中的比较研究:基于GPT-5.2和Qwen-Max的实证分析

Yuxuan Cao, Zida Yang, Ye Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究比较GPT-5.2和Qwen-Max在中文电影剧本延续任务中的表现,发现GPT-5.2在结构保持和整体质量上显著优于Qwen-Max,为LLM在中文创意写作中的评估提供了实证框架。

Comments 18 pages, 6 figures, 6 tables, 20 references. First two authors contributed equally. Corresponding author: Ye Wang (wangye@whu.edu.cn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14446 2026-01-22 cs.CE cs.AI 89%

Diffusion Large Language Models for Black-Box Optimization

扩散大语言模型用于黑盒优化

Ye Yuan, Can, Chen, Zipeng Sun, Dinghuai Zhang, Christopher Pal, Xue Liu

机构 * McGill(麦吉尔大学) MILA - Quebec AI Institute(魁北克人工智能研究所) Microsoft Research(微软研究院) Polytechnique Montreal(蒙特利尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出dLLM,利用扩散LLMs的双向建模能力,结合遮蔽扩散树搜索,实现高效离线黑盒优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13882 2026-01-21 cs.CL 89%

OpenLearnLM Benchmark: A Unified Framework for Evaluating Knowledge, Skill, and Attitude in Educational Large Language Models

OpenLearnLM基准:一个评估教育大型语言模型知识、技能和态度的统一框架

Unggi Lee, Sookbun Lee, Heungsoo Choi, Jinseo Lee, Haeun Park, Younghoon Jeon, Sungmin Cho, Minju Kang, Junbo Koh, Jiyeong Bae, Minwoo Nam, Juyeon Eun, Yeonji Jung, Yeil Jeong

机构 * Chosun University(chosun大学) Korea University(韩国大学) Ewha Womans University(成均馆大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Seoul National University(首尔国立大学) Texas A&M University(德克萨斯农工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 OpenLearnLM基准通过统一框架评估教育大型语言模型的知识、技能和态度,揭示不同模型在多维度上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07238 2026-01-21 cs.CL 89%

When Benchmarks Age: Temporal Misalignment through Large Language Model Factuality Evaluation

当基准老化时:通过大型语言模型事实性评估进行时间错位

Xunyi Jiang, Dingyi Chang, Julian McAuley, Xin Xu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文研究了评估基准随时间老化对LLM事实性评估的影响,通过分析五个基准和八种LLM,提出了一套新的指标和方法以量化基准老化问题。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12632 2026-01-21 cs.CL cs.IR 89%

BioPulse-QA: A Dynamic Biomedical Question-Answering Benchmark for Evaluating Factuality, Robustness, and Bias in Large Language Models

BioPulse-QA: 一个动态生物医学问答基准,用于评估大型语言模型的事实性、鲁棒性和偏见

Kriti Bhattarai, Vipina K. Keloth, Donald Wright, Andrew Loza, Yang Ren, Hua Xu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 BioPulse-QA是一个动态生物医学问答基准,用于评估大型语言模型在事实性、鲁棒性和偏见方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15055 2026-01-19 cs.CL 89%

Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory

陷入基准?基于项目反应理论重新思考大语言模型基准测试

Hongli Zhou, Hui Huang, Ziqing Zhao, Lvyuan Han, Huicheng Wang, Kehai Chen, Muyun Yang, Wei Bao, Jian Dong, Bing Xu, Conghui Zhu, Hailong Cao, Tiejun Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出PSN-IRT框架,用于评估大语言模型基准的有效性,揭示现有基准的测量缺陷,并展示如何构建更符合人类偏好的小型基准。

Comments Accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏