arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31907 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31907 篇

2607.10490 2026-07-14 cs.CR cs.LG 新提交 90%

NetInjectBench: Benchmarking Indirect Prompt Injection in Tool-Using Large Language Model Agents for Network Operations

NetInjectBench:用于网络操作的工具使用大型语言模型代理中间接提示注入的基准测试

Ruksat Khan Shayoni, Muhammad Faraz Shoaib, S M Asif Hossain, M. F. Mridha

机构 * School of Computing, Wichita State University(威斯康星州立大学计算机学院) Department of Computer Science, American International University-Bangladesh(孟加拉国国际大学计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究网络操作中工具使用大型语言模型代理的间接提示注入问题,提出NetInjectBench基准测试。通过多种方法评估,发现单纯执行不安全率高,不同方法可降低该率,元数据感知策略门效果好,表明网络操作代理需执行时授权边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10402 2026-07-14 cs.CR cs.AI cs.SI 新提交 90%

Large Language Models in Misinformation Ecosystems: Misuse, Defense, and Vulnerability

错误信息生态系统中的大语言模型:滥用、防御与脆弱性

Lingwei Wei, Dou Hu, Wei Zhou, Songlin Hu, Philip S. Yu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Illinois Chicago(伊利诺伊大学香槟分校) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究大语言模型在错误信息生态系统中的问题,引入角色层框架统一风险与防御,组织相关攻击、研究检测与验证方法、分析漏洞及讨论对策,指出从静态检测到风险评估、强化验证管道、部署可审计人工参与验证系统这三个关键挑战。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11847 2026-07-10 stat.ML cs.LG 版本更新 90%

Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings

丢弃少量偏好可以改变大型语言模型的排名

Jenny Y. Huang, Yunyi Shen, Dennis Wei, Tamara Broderick

机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.LG

AI总结 研究通过评估LLM排名系统的鲁棒性,发现丢弃少量偏好数据可显著影响模型排名,揭示MT-bench偏好更稳定的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05408 2026-07-08 cs.CY cs.LG 新提交 90%

Life Cycle Assessment of Pre-training the Lucie 7B Open-Source Large Language Model on the Jean Zay Supercomputer

在让·扎伊超级计算机上对露西7B开源大语言模型进行预训练的生命周期评估

Marc Léobet, Pierre-François Lavallée, Jean-Pierre Lorré

机构 * Mens Data CNRS / IDRIS(法国国家科学研究中心/IDRIS) LINAGORA

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 研究对开源多语言基础模型露西7B在让·扎伊超级计算机上预训练进行生命周期评估,以AFNOR SPEC 2314为框架,应用Labos 1point5方法,整合硬件全生命周期,给出多方面数据,为节俭人工智能系统设计提供参考。

Comments 12 pages, 2 tables, 1 figure. OpenLLM-France Environmental Report v1, January 2026. CC BY-SA 4.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03704 2026-07-07 cs.CL 新提交 90%

Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization

优化用于药物警戒中因果关系评估的大语言模型:开发一种性能指标作为贝叶斯超参数优化的目标

Nicole Sonne Heckmann, Arnault-Quentin Vermillet, Søren Norlin Mølgaard, Manuela Del Castillo Suero, Lars Melskens, Gerard Ompad, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) Safety Operations, Novo Nordisk(诺和制药安全运营部) Clinical Development Centre Denmark, Novo Nordisk(丹麦临床开发中心,诺和制药) Statistical Data Science Lead, Pfizer(辉瑞统计数据科学负责人)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究针对药物警戒中因果关系评估优化大语言模型,开发高斯过程兼容的优化目标,用链思维提示评估GPT-5.2,通过贝叶斯优化研究温度优化效果,EWACS指标优化提升了因果关系分类一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20677 2026-07-07 cs.CR cs.CL 版本更新 90%

Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

基于学习的自动化对抗红队测试用于大型语言模型的鲁棒性评估

Zhang Wei, Hanxuan Chen, Peilu Hu, Zhenyuan Wei, Chenwei Liang, Jiayi Gu, Wenqian Weng, Jacqueline Pang, Hao Yan, Li Mei, Shengning Lang, Kuan Lu, Xi Xiao, Zhimo Han, Yijin Wang, Yichao Zhang, Chen Yang, Zhenyu Yu, Riyang Bao, Xinyuan Song, Junfeng Hao, Mu-Jiang-Shan Wang

机构 * Independent Researcher(独立研究者) Hunan University(湖南大学) Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司) Central University of Finance and Economics(中央财经大学) Chongqing University(重庆大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Stevens Institute of Technology(斯蒂文斯理工学院) Cornell University(康奈尔大学) Oak Ridge National Laboratory(橡树岭国家实验室) Zhengzhou University of Light Industry(郑州轻工业大学) Xidian University(西安电子科技大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室) University of Malaya(马来亚大学) Emory University(埃默里大学) Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出一种学习驱动的自动化红队测试框架,用于高效发现大型语言模型的漏洞,通过元提示引导的对抗性提示生成和分层执行检测流程,在六个威胁类别中实现标准化评估,实验发现47个漏洞,包括21个高严重性失败和12种新攻击模式。

Comments ACL ARR minor revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19698 2026-07-07 cs.AI 版本更新 90%

RLIE: Rule Generation with Logistic Regression, Iterative Refinement, and Evaluation for Large Language Models

RLIE:用于大语言模型的基于逻辑回归、迭代细化和评估的规则生成

Yang Yang, Hua XU, Zhangyi Hu, Yutao Yue

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究提出RLIE框架,将大语言模型与概率建模结合学习加权规则集,经规则生成、逻辑回归、迭代细化和评估四阶段,评估多种推理策略,明确大语言模型在归纳推理中的潜力与局限,实现更可靠的神经符号推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08269 2026-07-07 cs.NE cs.AI 版本更新 90%

A Systematic Survey on Large Language Models for Evolutionary Optimization: From Modeling to Solving

关于用于进化优化的大语言模型的系统综述:从建模到求解

Yisong Zhang, Ran Cheng, Guoxing Yi, Kay Chen Tan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该综述聚焦进化优化,通过工作流框架系统回顾相关进展,将文献分为优化建模与求解两阶段,求解阶段再分三类范式,分析方法、局限性及与传统方法关系,还给出基准、比较及应用,并指出研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00700 2026-07-02 cs.SE cs.AI cs.PL 新提交 90%

LLVM-Bench: Benchmarking and Advancing Large Language Models for LLVM Compiler Issue Resolution

LLVM-Bench:面向LLVM编译器问题解决的大语言模型基准测试与推进

Zhao Tian, Yingquan Zhao, Chenyao Suo, Meng Wang, Junjie Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出LLVM-Bench基准和LLVM-Gym平台,评估大语言模型在LLVM编译器问题解决上的表现,并设计集成方法LLVM-Ens提升解决率至21.99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31308 2026-07-01 cs.AI 新提交 90%

Benchmarking Large Language Models on Floating-Point Error Classification

大型语言模型在浮点错误分类上的基准测试

Lisa Taldir, Muhammad Ahmad Saeed, David Defour, Pablo de Oliveira Castro, Eric Petit

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI

AI总结 本文提出InterFLOPBench基准,评估14个LLM在六类浮点错误上的静态检测性能,最新模型整体F1超过0.88。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19633 2026-06-30 cs.AI 90%

OptiMUS-0.3: Using Large Language Models to Model and Solve Optimization Problems at Scale

OptiMUS-0.3:利用大语言模型在大规模范围内建模和解决优化问题

Ali AhmadiTeshnizi, Wenzhi Gao, Herman Brunborg, Shayan Talaei, Connor Lawless, Madeleine Udell

机构 * School of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程学院) Institute for Computational and Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出OptiMUS-0.3系统,通过大语言模型自动建模和解决线性规划问题,提升优化工具的实用性与效率,实验证明其在易实例和实际案例中表现优异。

Comments This paper documents OptiMUS-0.3, improving on OptiMUS-0.1 (arXiv:2310.06116) and OptiMUS-0.2 (arXiv:2402.10172). arXiv admin note: text overlap with arXiv:2402.10172

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18430 2026-06-26 cs.LG cs.CR 新提交 90%

Signature filtering: a lightweight enhancement for statistical watermark detection in large language models

签名过滤:大型语言模型中统计水印检测的轻量级增强方法

Chih-Duo Hong, Yen-Pang Chen, Fang Yu

机构 * National Chengchi University(国立政治大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出签名过滤模块,通过移除干扰水印检测的签名令牌,在弱信号和低熵设置下将检测率从8-31%提升至78-99%,同时保持可控的假阳性率。

Comments update grant numbers

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22974 2026-06-24 cs.AI 新提交 90%

When Preferences Fail to Become Incentives: A Utility-Behavior Gap in Large Language Models

当偏好未能成为激励:大语言模型中的效用-行为差距

Yujun Zhou, Christopher M. Ackerman

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文发现大语言模型在偏好选择中表现出的效用结构,在真实写作任务中无法激励其输出质量提升,揭示了偏好与行为之间的差距。

Comments 23 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20146 2026-06-24 cs.AI 新提交 90%

BIM-Edit: Benchmarking Large Language Models for IFC-Based Building Information Modeling

BIM-Edit:基于IFC的建筑信息模型的大语言模型基准测试

Bharathi Kannan Nithyanantham, Clemens Kujat, Tobias Sesterhenn, Stefan Telgmann, Ashwin Nedungadi, Jörn Plönnigs, Christian Bartelt, Stefan Lüdtke

机构 * University of Rostock(罗斯托克大学) Clausthal University of Technology(克劳斯塔尔工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出BIM-Edit基准,评估大语言模型在IFC格式建筑信息模型上的自然语言编辑能力,涵盖324个任务,最佳模型平均得分仅49.5%,揭示当前能力与工程需求间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18473 2026-06-18 cs.CL 新提交 90%

PreUnlearn: Auditing Collateral Knowledge Damage Before Large Language Model Unlearning

PreUnlearn: 在大语言模型遗忘之前审计附带知识损害

Bo Su, Ankit Shah, Thai Le

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出PreUnlearn方法,通过数据特征预测遗忘操作对同领域和远距离知识的附带损害,实现遗忘前的风险审计。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18258 2026-06-18 cs.HC cs.AI 新提交 90%

Examining Human-Like Behaviors in LLMs: A Multi-Dimensional Analysis of Model Behaviors, User Factors, and System Prompts

审视LLM中的人类行为:模型行为、用户因素和系统提示的多维分析

Sunnie S. Y. Kim, Margit Bowler, Leon A Gatys

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过21,000次对话的多维分析,发现LLM普遍表现出人类行为,但不同模型和用户因素下差异显著;人类评估者认为LLM的自我参照和关系建立行为不如人类适当,但边界维护行为更适当;系统提示可控制这些行为但需谨慎评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18019 2026-06-17 eess.AS cs.CL cs.SD 新提交 90%

Reading between the Lines: Leveraging Large Language Models for Global Dementia and Depression Assessment from Clinical Interviews

字里行间:利用大型语言模型从临床访谈中进行全球痴呆和抑郁评估

Franziska Braun, Alea Rüggeberg, Thomas Ranzenberger, Hartmut Lehfeld, Thomas Hillemacher, Tobias Bocklet, Korbinian Riedhammer

机构 * TH Nürnberg(Nürnberg大学) FAU Erlangen(埃朗根大学) PMU Klinikum Nürnberg(纽伦堡大学医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究利用开放权重大型语言模型,从154名德语受试者的临床访谈录音中预测痴呆和抑郁严重程度,引入与全球恶化量表对齐的全球抑郁量表,发现零样本预测对抑郁有效,而结构化特征提取显著提升痴呆评估性能,误差降低达35%,且暂停增强转录本表现与人工转录相当。

Comments Accepted for publication in Text, Speech and Dialogue (TSD 2026). The final authenticated publication will be available online via Springer LNCS/LNAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18021 2026-06-15 quant-ph cs.ET cs.LG 版本更新 90%

Shuttling Compiler for Trapped-Ion Quantum Computers Based on Large Language Models

基于大型语言模型的离子阱量子计算机穿梭编译器

Fabian Kreppel, Reza Salkhordeh, Ferdinand Schmidt-Kaler, André Brinkmann

机构 * Institute of Computer Science, Johannes Gutenberg University(计算机科学研究所,约翰内斯·古特堡大学) Institute of Physics, Johannes Gutenberg University(物理研究所,约翰内斯·古特堡大学) Department of Computer Science, Saarland University(计算机科学系,萨尔兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出首个基于大语言模型的离子阱量子计算机穿梭编译器,通过微调预训练模型生成有效调度,减少穿梭开销达15%。

Comments 18 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13079 2026-06-12 cs.CR cs.AI 新提交 90%

The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems

大型语言模型驱动的AI系统中自主渗透能力的涌现

Jiaqi Luo, Jiarun Dai, Zhile Chen, Jia Xu, Weibing Wang, Yawen Duan, Brian Tse, Geng Hong, Xudong Pan, Yuan Zhang, Min Yang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Concordia AI Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 针对现有评估方法不透明、场景简化等问题,构建包含两级目标服务器和通用代理框架的自主渗透评估体系,测试19个LLM发现成功率10.7%-69.3%,且能力随模型整体能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12114 2026-06-11 cs.CL 新提交 90%

Detecting Sensitive Personal Information in Japanese Pre-Training Corpora for Large Language Models

检测日语大语言模型预训练语料库中的敏感个人信息

Rei Minamoto, Yusuke Oda, Daisuke Kawahara

机构 * Waseda University(早稻田大学) Research and Development Center for LLMs, National Institute of Informatics(国立信息学研究所大语言模型研发中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对日语大语言模型预训练语料中的敏感个人信息,基于日本《个人信息保护法》定义的特殊要保护个人信息,构建数据集并训练机器学习模型进行快速检测,首次探索日语文本中的SCPI检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21817 2026-06-11 stat.ML cs.LG 版本更新 90%

A Judge-Aware Ranking Framework for Evaluating Large Language Models without Ground Truth

一种面向评委的排名框架:无需真实标签评估大语言模型

Mingyuan Xu, Xinzi Tan, Jiawei Wu, Doudou Zhou

机构 * University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种面向评委的排名框架,通过引入评委特定的辨别参数扩展Bradley-Terry-Luce模型,在不参考标签的情况下联合估计潜在模型质量和评委可靠性,从而提高人类偏好的一致性,提高数据效率,并产生校准的不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13406 2026-06-10 cs.HC cs.AI 90%

Integrating Virtual Reality and Large Language Models for Team-Based Non-Technical Skills Training and Evaluation in the Operating Room

将虚拟现实与大型语言模型结合用于手术室基于团队的非技术技能训练与评估

Jacob Barker, Doga Demirel, Cullen Jackson, Anna Johansson, Robbin Miraglia, Darian Hoagland, Stephanie B. Jones, John Mitchell, Daniel B. Jones, Suvranu De

机构 * Beth Israel Deaconess Medical Center Center(贝希斯尔德医疗中心中心) Department of Surgery, Northwell Health(外科,北well健康) College of Engineering, Florida Agricultural and Mechanical University and Florida State University(工程学院,佛罗里达农业与机械大学和佛罗里达州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出VORTeX平台,结合虚拟现实与大型语言模型,用于手术室团队非技术技能的训练与评估,通过分析团队对话生成交互图谱,提升沟通与协作能力。

Comments 23 pages, 7 figures, 1 table, 2 Appendices

Journal ref npj Digit. Surg. 1, 10 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02039 2026-06-09 cs.AI 版本更新 90%

A Survey on Large Language Model-Based Game Agents

基于大语言模型的游戏智能体综述

Sihao Hu, Tiansheng Huang, Gaowen Liu, Ramana Rao Kompella, Fatih Ilhan, Selim Furkan Tekin, Yichang Xu, Zachary Yahn, Ling Liu

机构 * Georgia Institute of Technology USA(佐治亚理工学院美国分校) Cisco Research USA(思科研究美国分公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 综述基于大语言模型的游戏智能体,提出统一参考架构,从单智能体(记忆、推理、感知-行动接口)和多智能体(通信协议、组织模型)层面总结研究,并建立挑战导向的分类法连接六种游戏类型与智能体需求。

Comments ACM Computing Surveys, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06546 2026-06-08 cs.LG 新提交 90%

Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

Elmes*:面向长尾教育场景的大语言模型细粒度评估量规自动构建

Tao Liu, Ye Lu, Ruohua Zhang, Siyu Song, Wentao Liu, Aimin Zhou, Hao Hao

机构 * Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华师范大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出Elmes*框架,自动构建细粒度场景特定量规,用于评估大语言模型在教育场景中的多维教学能力,构建Edu-330基准并揭示模型差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05564 2026-06-05 cs.CL 90%

Using Large Language Models to Support High Volume Application Review for an Undergraduate Research Program

使用大型语言模型支持本科研究项目的高容量申请评审

Varun Aggarwal, Kay Kobak, John Howarter

机构 * Engineering Undergraduate Research Office, Purdue University(普渡大学本科生研究办公室) Elmore School of Electrical and Computer Engineering, Purdue University(普渡大学电子与计算机工程学院) School of Materials Engineering, Purdue University(材料工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究开发并部署基于GPT模型(GPT-4o、GPT-5-mini、GPT-5.2)的工具,对普渡大学SURF项目约1200份目的陈述进行自动化评分与理由注释,将评审时间从数周缩短至约4小时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05170 2026-06-05 cs.LG 90%

ERRORQUAKE: Heavy-Tailed Error Severity Distributions in Open-Weight Large Language Models

ERRORQUAKE: 开放权重大语言模型中重尾错误严重性分布

Jason Z Wang

机构 * Independent(独立)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.LG

AI总结 提出Errorquake-10k基准测试,通过连续严重性评分和古登堡-里希特指数b揭示开放权重LLM在相同准确率下错误严重性分布存在显著差异,证明严重性分布与错误率信息非冗余。

Comments 28 pages, 12 figures, appendix and checklist

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05169 2026-06-05 cs.LG 90%

The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models

评估盲点:大型语言模型基准覆盖的体视学理论

Jason Z Wang

机构 * Independent(独立)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.LG

AI总结 本文提出一种体视学理论,通过有效维度和可见豪斯多夫距离量化LLM基准覆盖的盲点,发现结构盲点远超统计噪声,并基于子模贪心算法和特征值分析提出稳定核心基准集。

Comments 55 pages, 3 figures, 3 tables, extensive appendix with proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04202 2026-06-04 cs.AI 90%

SMAC-Talk: A Natural Language Extension of the StarCraft Multi-Agent Challenge for Large Language Models

SMAC-Talk: 面向大型语言模型的星际争霸多智能体挑战的自然语言扩展

Joel Sol, Homayoun Najjaran

机构 * Faculty of Engineering and Computer Science(工程与计算机科学学院) University of Victoria(维多利亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 提出SMAC-Talk环境,通过自然语言通信通道评估LLM智能体在合作多智能体场景中的协调与信任,并构建含欺骗性通信者的评估场景。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03660 2026-06-04 cs.AI 90%

From Answers to States: Verifiable Process-Level Evaluation of Chemical Reasoning in Large Language Models

从答案到状态:大语言模型中化学推理的可验证过程级评估

Hongyu Guo, Hao Li, He Cao, Gongbo Zhang, Li Yuan

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ChemCoTBench-V2基准,通过确定性规则和参考轨迹验证结构化化学推理步骤,揭示模型在最终答案正确性与推理状态一致性之间的差距。

Comments 23 pages, 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03157 2026-06-03 cs.AI 90%

ClinicalMC: A Benchmark for Multi-Course Clinical Decision-Making with Large Language Models

ClinicalMC:面向大语言模型的多疗程临床决策基准

Ruihui Hou, Siyi Zhu, Ziyue Huai, Guangya Yu, Yongqi Fan, Chunming Wang, Tong Ruan

机构 * East China University of Science and Technology, Shanghai, China(东华大学) Renji Hospital Affiliated to Shanghai Jiaotong University School of Medicine, Shanghai, China(复旦大学附属中山医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ClinicalMC基准,包含多阶段样本,通过多智能体评估框架在单轮静态和多轮动态设置下测试大语言模型的临床决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏