Evaluating Large Language Models with Grid-Based Game Competitions: An Extensible LLM Benchmark and Leaderboard
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);prompting(abstract)
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments In Progress
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 8 pages, 8 figures, 12 tables
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 9 pages, Eval4NLP 2023
Journal ref Proceedings of the 4th Workshop on Evaluation and Comparison for NLP systems (2023)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)
SPLIT:英语和乌克兰语LLM回应中的跨语言共情与文化根基
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出SPLIT基准测试,评估LLM在英语和乌克兰语危机情境下的共情准确性、语言自然性和文化根基,发现模型在乌克兰语中表现下降,且人类与AI评估者一致性弱。
Comments 19 pages, 5 figures, 3 tables. Benchmark paper introducing SPLIT for evaluating empathy, linguistic naturalness, and cultural grounding in English and Ukrainian LLM responses
Spark-LLM-Eval: 一个用于统计严谨大语言模型评估的分布式框架
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出Spark-LLM-Eval,一个基于Apache Spark的分布式评估框架,通过数据并行处理实现大规模LLM评估,强调统计严谨性,提供置信区间和显著性检验,并利用Delta Lake实现响应缓存以降低评估成本。
Comments 16 pages, 2 figures, 6 tables. Open source: https://github.com/bassrehab/spark-llm-eval. Cross-list requested: cs.CL, cs.LG
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
Comments 34 pages, 8 figures, code available at https://github.com/AI4HealthUOL/ecg-llm
CORDA:面向大语言模型的以伤害为核心的分层道德推理基准
机构 * University of the Witwatersrand(威特沃特斯兰德大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 研究提出CORDA基准,评估大语言模型的以伤害为核心的分层道德推理,发现多数模型优先避免直接个人伤害,部分模型无法遵循指定优先级,该基准填补了LLM道德评估的核心空白。
Comments 8 pages, 6 figures. Accepted at the Fourth International Workshop on Value Engineering in AI (VALE 2026), affiliated with IJCAI-ECAI 2026
验证驱动的闭环多智能体大语言模型框架:面向符合代码规范的结构设计
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本研究提出验证驱动的闭环多智能体LLM框架,通过耦合有限元验证系统与双节点结构提升结构设计的代码合规性,开源基准与脚本,性能提升显著且具可复现性。
Comments 20 pages, 21 figures
一种智能体AI框架克服了大型语言模型在眼底照相青光眼检测中的基本局限
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 该研究开发的智能体AI框架整合LLM与专用深度学习工具,提升了眼底照相青光眼检测的准确率、一致性,纠正了仅用LLM的缺陷,具有通用性,或推动医学AI向多智能体系统转变。
AI 玩商业游戏:在动态模拟中对大型语言模型的管理决策能力进行基准测试
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本研究提出一种用于LLM基准测试的可复现开放获取管理模拟器,评估Gemini等五个LLMs在动态商业模拟中的多步骤战略决策能力,为长期决策评估提供新途径。
Comments 34 pages, 7 figures, 3 tables
大型语言模型可提高医师准确率,但会导致错误依赖
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。
关于聊天机器人在问题解决驱动对话中如何工作的一些假设:大型语言模型作为创新幻觉的确认
机构 * S.F.M. van Vlijmen and H.D. Lethe jr(S.F.M. van Vlijmen 和 H.D. Lethe jr)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文提出聊天机器人作为对话伙伴的本质,基于聚合动力学、认知语言学等理论,假设LLM训练数据仅部分模仿人类思维,并得出结论:基础聊天机器人无法成为与人类匹敌的思考伙伴。
Comments Changes made over the versions do NOT concern the argument or conclusion. The changes do concern: typo's, better phrasing, extra references, making the abstract fit the length demands without losing the main points to be made. 42 pages, 3 figures, submitted to Transmathematica
用于光网络自动化的大语言模型的人工基础评估
机构 * University of Applied Sciences and Arts of Southern Switzerland(瑞士南瑞士应用科学与艺术大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 研究针对光网络自动化中LLMs输出质量和成本差异大的问题,提出HuGLEN评估管道,结合LLM评判器和专家评级,用QES排名,用于转换XAI模型输出,结果显示中等规模LLM的QES最高,减轻人工标注负担,助力模型选择。
SycoEval-EM:急诊护理模拟临床场景中大语言模型的谄媚评估
机构 * UNC Chapel Hill(UNC夏洛特山分校) ; University of Waterloo(滑铁卢大学) ; Stanford University(斯坦福大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 提出SycoEval-EM多智能体模拟框架,评估19个LLM在急诊医学中对患者说服的鲁棒性,发现谄媚率呈双峰分布,静态医学基准无法预测安全表现。
Comments 19 pages, 10 figures
OntoLearner: 一个用于大语言模型本体学习的模块化Python库
机构 * TIB – Leibniz Information Centre for Science and Technology(TIB – 莱布尼茨科学与技术信息中心) ; L3S Research Center, Leibniz University of Hannover(L3S研究中心,莱布尼茨汉诺威大学) ; IBM Research(IBM研究院)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 提出OntoLearner框架,统一本体访问、LLM驱动学习管道和标准化基准,通过跨领域大规模实验揭示本体学习的主要瓶颈是模型知识编码与本体组织的结构性不匹配。
Comments 30 pages. Under review at Nature Communications. This version is reformatted with a different section structure; content is unchanged
StatEval:大型语言模型在统计学中的综合基准
机构 * Shanghai University of Finance and Economics(上海财经大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。
BrainAgent:一种大语言模型驱动的多智能体框架,用于自主脑信号理解
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 提出LLM驱动的多智能体框架BrainAgent,通过分层架构将自然语言意图转化为可执行的处理流水线,实现脑信号分析的自动化与民主化。
Comments 22 pages, 11 figures
同一教训,不同故事:大型语言模型中文化叙事的跨语言重构
机构 * College of Computer and Information Sciences(计算机与信息科学学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)
AI总结 本研究通过跨语言谚语集和四种LLM生成叙事,评估模型在跨语言条件下是否保留文化意义,发现跨语言提示基本保留语义但改变叙事结构,且模型间存在强收敛。
Comments This paper is under review
大型语言模型中用于隐私和数据审计的自然标识符
机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI总结 提出自然标识符(NIDs)解决LLM隐私审计难题,无需重训练即可进行事后差分隐私审计和数据集推断。
Comments Accepted at ICLR 2026
大型胸部CT数据集中基于大语言模型的报告衍生标签清洗
机构 * Division of Radiology and Biomedical Engineering, Graduate School of Medicine, The University of Tokyo(放射医学与生物医学工程系,东京大学医学研究生院) ; Department of Computational Diagnostic Radiology and Preventive Medicine, The University of Tokyo Hospital(计算诊断放射学与预防医学系,东京大学医院) ; Department of Radiology, Kanazawa University Hospital(金泽大学医院放射科) ; Faculty of Medicine, The University of Tokyo(东京大学医学系) ; Department of Radiology, School of Medicine, Jichi Medical University(立命馆大学医学系放射科) ; Department of Radiology, The University of Tokyo Hospital(东京大学医院放射科)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本研究利用大语言模型(GPT-5.4)清洗CT-RATE数据集中的标签-报告不一致性,通过放射科医生裁决验证,发现LLM辅助清洗能有效识别临床相关错误,并提升数据集质量。
Comments 17 pages
基于共识的智能体大语言模型框架用于协调制度海关编码分类
机构 * Analytics Everywhere Lab, University of New Brunswick(新不伦瑞克大学无处不在分析实验室) ; University of Economics Ho Chi Minh City(胡志明市经济大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 提出一种多智能体LLM框架,通过信息检索、语义检索、证据推理、共识验证和分层投票等方法,解决加拿大10位HTS编码分类难题,在3300条数据上验证了证据驱动和人工参与的必要性。
Comments Accepted at the 3rd International Conference of Resilience by Technology and Design (RTD 2026)
开源LLM代理能否取代静态应用安全测试工具?一项实证评估
机构 * College of Engineering and Science, Florida Institute of Technology(工程学院与科学学院,佛罗里达理工学院)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI
AI总结 评估基于开源LLM的代理在静态应用安全测试中的性能,与SAST工具Bandit对比,发现当前不适合实际应用。
Comments Keywords: Agentic AI, Cybersecurity, Large Language Models, Static Application Security Testing, Model performance evaluation
语言塑造大型语言模型中的心理健康评估
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Arizona State University(亚利桑那州立大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 研究多语言LLM在心理健康评估中是否因语言不同而产生系统性偏差,发现中文提示比英文提示导致更高的污名相关评分和更保守的抑郁严重度判断。
SurgiQ: 用于评估大语言模型手术理解的大规模多领域基准
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 提出SurgiQ基准,包含13,055道多选题,覆盖六个外科领域和四种题型,用于评估LLM的手术推理能力。实验显示最佳模型准确率仅68.1%,通用模型优于多数生物医学模型,表明当前医学专业化未能充分覆盖手术知识。