arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2407.07796 2024-07-12 cs.AI cs.CL cs.LG cs.NE 92%

Evaluating Large Language Models with Grid-Based Game Competitions: An Extensible LLM Benchmark and Leaderboard

Oguzhan Topsakal, Colby Jacob Edell, Jackson Bailey Harper

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06866 2024-04-30 cs.CL cs.AI cs.LG 92%

Health-LLM: Large Language Models for Health Prediction via Wearable Sensor Data

Yubin Kim, Xuhai Xu, Daniel McDuff, Cynthia Breazeal, Hae Won Park

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12273 2024-04-19 cs.AI cs.CL cs.LG 92%

FedEval-LLM: Federated Evaluation of Large Language Models on Downstream Tasks with Collective Wisdom

Yuanqin He, Yan Kang, Lixin Fan, Qiang Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09729 2024-03-05 cs.AI cs.CL cs.LG 92%

MindMap: Knowledge Graph Prompting Sparks Graph of Thoughts in Large Language Models

Yilin Wen, Zifeng Wang, Jimeng Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14837 2024-02-26 cs.CL cs.AI cs.HC cs.LG 92%

An Empirical Categorization of Prompting Techniques for Large Language Models: A Practitioner's Guide

Oluwole Fagbohun, Rachel M. Harrison, Anton Dereventsov

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10524 2024-02-19 cs.HC cs.AI cs.CL cs.LG 92%

LLM Comparator: Visual Analytics for Side-by-Side Evaluation of Large Language Models

Minsuk Kahng, Ian Tenney, Mahima Pushkarna, Michael Xieyang Liu, James Wexler, Emily Reif, Krystal Kallarackal, Minsuk Chang, Michael Terry, Lucas Dixon

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14769 2024-01-01 cs.CL cs.AI cs.CY cs.LG 92%

Large Language Model (LLM) Bias Index -- LLMBI

Abiodun Finbarrs Oketunji, Muhammad Anas, Deepthi Saina

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情
URL PDF HTML 收藏
2311.11552 2023-11-21 cs.CL cs.AI cs.LG 92%

Exploring Prompting Large Language Models as Explainable Metrics

Ghazaleh Mahmoudi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages, Eval4NLP 2023

Journal ref Proceedings of the 4th Workshop on Evaluation and Comparison for NLP systems (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15851 2023-08-31 cs.MM 92%

Prompting Vision Language Model with Knowledge from Large Language Model for Knowledge-Based VQA

Yang Zhou, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02049 2026-07-03 cs.CL cs.AI cs.CY 新提交 92%

SPLIT: Cross-Lingual Empathy and Cultural Grounding in English and Ukrainian LLM Responses

SPLIT:英语和乌克兰语LLM回应中的跨语言共情与文化根基

Anna Chorna

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SPLIT基准测试,评估LLM在英语和乌克兰语危机情境下的共情准确性、语言自然性和文化根基,发现模型在乌克兰语中表现下降,且人类与AI评估者一致性弱。

Comments 19 pages, 5 figures, 3 tables. Benchmark paper introducing SPLIT for evaluating empathy, linguistic naturalness, and cultural grounding in English and Ukrainian LLM responses

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28769 2026-04-01 cs.DC cs.CL cs.LG 92%

Spark-LLM-Eval: A Distributed Framework for Statistically Rigorous Large Language Model Evaluation

Spark-LLM-Eval: 一个用于统计严谨大语言模型评估的分布式框架

Subhadip Mitra

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Spark-LLM-Eval,一个基于Apache Spark的分布式评估框架,通过数据并行处理实现大规模LLM评估,强调统计严谨性,提供置信区间和显著性检验,并利用Delta Lake实现响应缓存以降低评估成本。

Comments 16 pages, 2 figures, 6 tables. Open source: https://github.com/bassrehab/spark-llm-eval. Cross-list requested: cs.CL, cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18339 2025-10-22 cs.CL cs.LG 92%

ECG-LLM -- training and evaluation of domain-specific large language models for electrocardiography

Lara Ahrens, Wilhelm Haverkamp, Nils Strodthoff

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments 34 pages, 8 figures, code available at https://github.com/AI4HealthUOL/ecg-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08061 2026-08-11 cs.AI 新提交 92%

CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models

CORDA:面向大语言模型的以伤害为核心的分层道德推理基准

Siddarth Singh, Victoria Williams, Simon Rosen, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Benjamin Rosman, Geraud Nangue Tasse, Steven James

机构 * University of the Witwatersrand(威特沃特斯兰德大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究提出CORDA基准,评估大语言模型的以伤害为核心的分层道德推理,发现多数模型优先避免直接个人伤害,部分模型无法遵循指定优先级,该基准填补了LLM道德评估的核心空白。

Comments 8 pages, 6 figures. Accepted at the Fourth International Workshop on Value Engineering in AI (VALE 2026), affiliated with IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07978 2026-08-11 cs.SE cs.AI 新提交 92%

Verication-driven closed-loop multi-agent large language modelframework for code-compliant structural design

验证驱动的闭环多智能体大语言模型框架:面向符合代码规范的结构设计

Jianbin Luo, Weibin Lin, Yiran Lin, Qing Wei, Wei Guo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出验证驱动的闭环多智能体LLM框架,通过耦合有限元验证系统与双节点结构提升结构设计的代码合规性,开源基准与脚本,性能提升显著且具可复现性。

Comments 20 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07651 2026-08-11 cs.AI cs.CV 新提交 92%

An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography

一种智能体AI框架克服了大型语言模型在眼底照相青光眼检测中的基本局限

Jalil Jalili, Hossein Taghizad, Anuwat Jiravarnsirikul, Christopher Bowd, Akram Belghith, Raheleh Kafieh, Christopher A. Girkin, Sally L. Baxter, Robert N. Weinreb, Linda M. Zangwill, Mark Christopher

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究开发的智能体AI框架整合LLM与专用深度学习工具,提升了眼底照相青光眼检测的准确率、一致性,纠正了仅用LLM的缺陷,具有通用性,或推动医学AI向多智能体系统转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26331 2026-08-07 cs.AI 版本更新 92%

AI Playing Business Games: Benchmarking Large Language Models on Managerial Decision-Making in Dynamic Simulations

AI 玩商业游戏:在动态模拟中对大型语言模型的管理决策能力进行基准测试

Berdymyrat Ovezmyradov

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出一种用于LLM基准测试的可复现开放获取管理模拟器,评估Gemini等五个LLMs在动态商业模拟中的多步骤战略决策能力,为长期决策评估提供新途径。

Comments 34 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00817 2026-08-04 cs.AI cs.HC stat.AP 新提交 92%

Large language models improve physician accuracy but lead to false reliance

大型语言模型可提高医师准确率,但会导致错误依赖

Tirtha Chanda, Christoph Wies, Franziska Schramm, Carina Nogueira Garcia, Nicolas B. Merl, Martin J. Hetz, Jochen S. Utikal, Phillip Tschandl, Cristian Navarrete-Dechent, Alexander Thiem, Jakob N. Kather, Consortium, Titus J. Brinker

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07722 2026-08-04 cs.AI 版本更新 92%

Some hypotheses on how chatbots work in problem-solving-driven conversations. Large Language Models as confirmation of the Innovation Illusion

关于聊天机器人在问题解决驱动对话中如何工作的一些假设:大型语言模型作为创新幻觉的确认

S. F. M. van Vlijmen, H. D. Lethe

机构 * S.F.M. van Vlijmen and H.D. Lethe jr(S.F.M. van Vlijmen 和 H.D. Lethe jr)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出聊天机器人作为对话伙伴的本质,基于聚合动力学、认知语言学等理论,假设LLM训练数据仅部分模仿人类思维,并得出结论:基础聊天机器人无法成为与人类匹敌的思考伙伴。

Comments Changes made over the versions do NOT concern the argument or conclusion. The changes do concern: typo's, better phrasing, extra references, making the abstract fit the length demands without losing the main points to be made. 42 pages, 3 figures, submitted to Transmathematica

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18068 2026-07-22 cs.NI cs.AI 版本更新 92%

Human Grounded Evaluation of Large Language Models for Optical Network Automation

用于光网络自动化的大语言模型的人工基础评估

Kiarash Rezaei, Omran Ayoub, Paolo Monti, Carlos Natalino

机构 * University of Applied Sciences and Arts of Southern Switzerland(瑞士南瑞士应用科学与艺术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对光网络自动化中LLMs输出质量和成本差异大的问题,提出HuGLEN评估管道,结合LLM评判器和专家评级,用QES排名,用于转换XAI模型输出,结果显示中等规模LLM的QES最高,减轻人工标注负担,助力模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16529 2026-07-09 cs.AI cs.HC 版本更新 92%

SycoEval-EM: Sycophancy Evaluation of Large Language Models in Simulated Clinical Encounters for Emergency Care

SycoEval-EM:急诊护理模拟临床场景中大语言模型的谄媚评估

Dongshen Peng, Yi Wang, Austin Schoeffler, Sun-ha Hong, Brian Suffoletto, David Kim, Carl Preiksaitis, Christian Rose

机构 * UNC Chapel Hill(UNC夏洛特山分校) University of Waterloo(滑铁卢大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出SycoEval-EM多智能体模拟框架,评估19个LLM在急诊医学中对患者说服的鲁棒性,发现谄媚率呈双峰分布,静态医学基准无法预测安全表现。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01977 2026-07-03 cs.AI 新提交 92%

OntoLearner: A Modular Python Library for Ontology Learning with Large Language Models

OntoLearner: 一个用于大语言模型本体学习的模块化Python库

Hamed Babaei Giglou, Jennifer D'Souza, Andrei Aioanei, Nandana Mihindukulasooriya, Sören Auer

机构 * TIB – Leibniz Information Centre for Science and Technology(TIB – 莱布尼茨科学与技术信息中心) L3S Research Center, Leibniz University of Hannover(L3S研究中心,莱布尼茨汉诺威大学) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出OntoLearner框架,统一本体访问、LLM驱动学习管道和标准化基准,通过跨领域大规模实验揭示本体学习的主要瓶颈是模型知识编码与本体组织的结构性不匹配。

Comments 30 pages. Under review at Nature Communications. This version is reformatted with a different section structure; content is unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09517 2026-07-03 cs.CL 版本更新 92%

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics

StatEval:大型语言模型在统计学中的综合基准

Yuchen Lu, Run Yang, Yichen Zhang, Shuguang Yu, Ziwei Wang, Jiayi Xiang, Wenxin E, Changyu Zhu, Fan Zhou

机构 * Shanghai University of Finance and Economics(上海财经大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25400 2026-06-25 cs.AI 新提交 92%

BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding

BrainAgent:一种大语言模型驱动的多智能体框架,用于自主脑信号理解

Yangxuan Zhou, Sha Zhao, Jiquan Wang, Shijian Li, Gang Pan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出LLM驱动的多智能体框架BrainAgent,通过分层架构将自然语言意图转化为可执行的处理流水线,实现脑信号分析的自动化与民主化。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24610 2026-06-24 cs.CL 新提交 92%

Same Lesson, Different Story: Cross-Lingual Reconstruction of Cultural Narratives in Large Language Models

同一教训,不同故事:大型语言模型中文化叙事的跨语言重构

Jory Alshaalan, Haya Albaker, Abeer Aldayel, Aljawharah Alabdullatif, Rehab Alahmadi

机构 * College of Computer and Information Sciences(计算机与信息科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 本研究通过跨语言谚语集和四种LLM生成叙事,评估模型在跨语言条件下是否保留文化意义,发现跨语言提示基本保留语义但改变叙事结构,且模型间存在强收敛。

Comments This paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24408 2026-06-24 cs.LG 新提交 92%

Natural Identifiers for Privacy and Data Audits in Large Language Models

大型语言模型中用于隐私和数据审计的自然标识符

Lorenzo Rossi, Bartłomiej Marek, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 提出自然标识符(NIDs)解决LLM隐私审计难题,无需重训练即可进行事后差分隐私审计和数据集推断。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22382 2026-06-23 eess.IV cs.AI cs.CV 新提交 92%

Large Language Model-Assisted Cleaning of Report-Derived Labels in a Large-Scale Chest CT Dataset

大型胸部CT数据集中基于大语言模型的报告衍生标签清洗

Yosuke Yamagishi, Atsushi Takamatsu, Mototsugu Sato, Tomohiro Kikuchi, Shouhei Hanaoka, Takeharu Yoshikawa, Osamu Abe

机构 * Division of Radiology and Biomedical Engineering, Graduate School of Medicine, The University of Tokyo(放射医学与生物医学工程系,东京大学医学研究生院) Department of Computational Diagnostic Radiology and Preventive Medicine, The University of Tokyo Hospital(计算诊断放射学与预防医学系,东京大学医院) Department of Radiology, Kanazawa University Hospital(金泽大学医院放射科) Faculty of Medicine, The University of Tokyo(东京大学医学系) Department of Radiology, School of Medicine, Jichi Medical University(立命馆大学医学系放射科) Department of Radiology, The University of Tokyo Hospital(东京大学医院放射科)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究利用大语言模型(GPT-5.4)清洗CT-RATE数据集中的标签-报告不一致性,通过放射科医生裁决验证,发现LLM辅助清洗能有效识别临床相关错误,并提升数据集质量。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16987 2026-06-16 cs.AI 新提交 92%

Consensus-based Agentic Large Language Model Framework for Harmonized Tariff Schedule Code Classification

基于共识的智能体大语言模型框架用于协调制度海关编码分类

Truong Thanh Hung Nguyen, Khanh Van Quynh Nguyen, Hoang-Loc Cao, Tri Duong, Phuc Ho, Van Pham, Loc Nguyen, Hung Cao

机构 * Analytics Everywhere Lab, University of New Brunswick(新不伦瑞克大学无处不在分析实验室) University of Economics Ho Chi Minh City(胡志明市经济大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出一种多智能体LLM框架,通过信息检索、语义检索、证据推理、共识验证和分层投票等方法,解决加拿大10位HTS编码分类难题,在3300条数据上验证了证据驱动和人工参与的必要性。

Comments Accepted at the 3rd International Conference of Resilience by Technology and Design (RTD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11672 2026-06-11 cs.CR cs.AI 新提交 92%

Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment

开源LLM代理能否取代静态应用安全测试工具?一项实证评估

Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

机构 * College of Engineering and Science, Florida Institute of Technology(工程学院与科学学院,佛罗里达理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 评估基于开源LLM的代理在静态应用安全测试中的性能,与SAST工具Bandit对比,发现当前不适合实际应用。

Comments Keywords: Agentic AI, Cybersecurity, Large Language Models, Static Application Security Testing, Model performance evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06910 2026-06-11 cs.CL 版本更新 92%

Language Shapes Mental Health Evaluations in Large Language Models

语言塑造大型语言模型中的心理健康评估

Jiayi Xu, Xiyang Hu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究多语言LLM在心理健康评估中是否因语言不同而产生系统性偏差,发现中文提示比英文提示导致更高的污名相关评分和更保守的抑郁严重度判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08071 2026-06-09 cs.CL 新提交 92%

SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

SurgiQ: 用于评估大语言模型手术理解的大规模多领域基准

Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi, Hamdan Alhadhrami, Preslav Nakov, Cesare Stefanini

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出SurgiQ基准,包含13,055道多选题,覆盖六个外科领域和四种题型,用于评估LLM的手术推理能力。实验显示最佳模型准确率仅68.1%,通用模型优于多数生物医学模型,表明当前医学专业化未能充分覆盖手术知识。

详情

展开后加载摘要…

URL PDF HTML 收藏