arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-03 至 2026-08-03 共收录 65 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 65 篇

2607.29389 2026-08-03 cs.LG cs.SE 新提交 93%

Simulation Code Generation for Fluid Systems using Large Language Models: Benchmarking Models and Prompting Strategies

基于大语言模型的流体系统仿真代码生成:模型与提示策略的基准测试

Jan Marius Stürmer, Jascha Knack, Tobias Koch, Andreas Weinmann

机构 * German Aerospace Centre (DLR)(德国航空航天中心) Technische Hochschule Würzburg-Schweinfurt(维尔茨堡-施韦因富特应用技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract,abstract_cn)

AI总结 本研究通过系统比较10种大语言模型与6种提示策略,评估其将流体系统模型图表示转换为WNTR、Modelica代码的能力,为相关设计流程提供指导,同时指出仿真保真度仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30219 2026-08-03 cs.AI cs.CL cs.LG cs.SE 版本更新 92%

EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures

EvalSafetyGap:LLM评估-安全失败的混合调查与概念框架

Buğra Alperen Uluırmak, Rifat Kurban

机构 * Erciyes University(埃里切耶大学) Abdullah Gül University(阿卜杜勒拉赫曼·古尔大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM评估与AI安全中基准分数与潜在属性不一致的测量问题,提出混合调查与概念框架,并通过十模型审计揭示能力与鲁棒性关联不显著、安全差距主要由治理因素驱动。

Comments 74 pages, 2 figures, 4 tables. Hybrid systematic survey and conceptual framework on LLM evaluation and AI-safety failures, synthesizing 373 primary studies (2018-2026). Introduces the EvalSafetyGap framework (Instability Decomposition, Alignment Trilemma) and reports an exploratory ten-model audit. Submitted as a review/survey article; not currently under consideration elsewhere

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29064 2026-08-03 cs.LG cs.AI 新提交 92%

Benchmarking Frontier Large Language Models Against Official Crash Database Coding Using Police Crash Narratives

基于警方事故叙述文本,对比前沿大语言模型与官方事故数据库编码的基准测试

Sudhir Bharati, Rajendra K C Khatri, Sudip Bharati

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究以阿肯色州2015-2025年的致命事故数据为对象,对比6种前沿大语言模型与官方事故数据库的编码效果,为事故编码领域的LLM应用提供了基准评估依据。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28710 2026-08-03 cs.CY 新提交 91%

Structured AI Demonstrations and Student LLM Use in Engineering Mechanics: Study Design and Preliminary Results

工程力学中的结构化AI演示与学生大语言模型(LLM)使用:研究设计与初步结果

Shuang Geng, Helen Lallos-Harrell, Jiya Ashar, Thomas J. McKenna, Annwesa Dasgupta, Caleb Farny, Emma Lejeune

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对工程力学课程设计了含九次结构化AI演示的方法论框架,结合调查工具分析学生LLM使用情况,为工程教育应对LLM融入提供实证研究基础。

Comments 47 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29431 2026-08-03 cs.AI 新提交 91%

ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models

ModelEquivBench:LLM生成优化模型的多关系验证评估系统

Penglin Zhu, Jungang Xu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出多关系评估系统ModelEquivBench,将其用于评估GPT-5.4等三个LLM生成的优化模型,发现不同模型在特征不同阶段失败,无法简化为单一准确率分数。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08804 2026-08-03 cs.CY cs.CL cs.LG 91%

Estimating Item Difficulty Using Large Language Models and Tree-Based Machine Learning Algorithms

利用大语言模型和基于树的方法进行项目难度估计

Pooya Razavi, Sonya Powers

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究利用大语言模型和基于树的方法预测K-5数学和阅读评估项目的难度,发现基于特征的方法在预测准确性上优于直接估计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03322 2026-08-03 cs.CL cs.AI 版本更新 91%

Can Large Language Models Derive New Knowledge? A Dynamic Benchmark for Biological Knowledge Discovery

大语言模型能否推导新知识?一种动态生物知识发现基准

Chaoqun Yang, Xinyu Lin, Shulin Li, Wenjie Wang, Ruihan Guo, Fuli Feng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出DBench-Bio,一种动态生物知识发现基准,通过三阶段流程评估AI的新知识发现能力,揭示当前模型在知识发现上的局限性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28934 2026-08-03 cs.CL cs.AI cs.CY 新提交 90%

FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation

FairFund-Bench:评估大语言模型资源分配中的分配偏差

Martin Lukk

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FairFund-Bench基准通过调整审计格式等特征,发现LLM资源分配的偏差受审计类型影响,且因果框架效应强于人口统计效应,可用于评估LLM的分配偏差。

Comments 19 pages, 7 figures. Code and data: https://github.com/martinlukk/fairfund-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28840 2026-08-03 cs.CL cs.SE 新提交 90%

Benchmarks Are Not Validation: A System-Level View of Financial LLM Applications

基准测试并非验证:金融大语言模型应用的系统级视角

Burak Payzun, İrem Demirtaş, Simona Scala, Elena Ferretti, Seçil Arslan

机构 * Prometeia S.p.A.(普罗米特亚公司)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究指出金融大语言模型不能仅靠基准测试验证,提出需从系统全栈进行多层验证,还讨论了LLM-as-a-judge的应用与控制措施,强调要研究系统感知基准等相关方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28643 2026-08-03 cs.HC cs.CL 新提交 90%

To Facilitate or not to Facilitate: Human and LLM Facilitator Tendencies in Online Discussions

是否促进:在线讨论中的人类与大语言模型(LLM)促进者倾向

Dimitris Tsirmpas, Katerina Korre, John Pavlopoulos

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本研究创建PEFK语料库,对比人类与LLM的在线讨论促进倾向,发现LLM过度急于促进,训练ModernBert分类器修正效果优于LLM替代设置。

Comments For the moderators: The acronym package may complain that some "acro" references are undefined. These references are, in fact, defined and the readability of the article remains the same

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28814 2026-08-03 cs.CL cs.AI cs.LG 新提交 89%

Rolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational Interviewing

顺应阻力:偏好优化的大型语言模型(LLM)咨询师可在动机访谈中权衡目标坚持性与关系调谐

Weiying Chen, Junlong Shen, Zhexuan Tang

专题命中 评测与基准 :LLM(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究基于动机访谈准则构建双轴评估框架,通过偏好优化训练LLM咨询师,发现惩罚对抗会降低目标坚持性,惩罚妥协无显著效果,仅提示控制可提升关系调谐且无目标坚持性代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28165 2026-08-03 cs.CR 版本更新 89%

Piggybacking on Perception: Stealthy Concurrent Audio Prompt Injections against Multimodal LLM Agents

利用感知能力:针对多模态大语言模型智能体的隐蔽并发音频提示注入攻击

Mingxiao Liu, Yitong Li, Haoren Zhao, Yaoxiang Bian, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对多模态LLM智能体提出隐蔽并发音频提示注入攻击,构建首个相关基准并评估多款智能体,还提出CADV防御机制,经实验验证攻击有效且防御可靠。

Comments 19 pages, 8 figures, The code is publicly available at https://github.com/Limax666/AudioAgentSecurity

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21008 2026-08-03 cs.CL cs.AI cs.LG 版本更新 89%

The Metanym Game: A Self-Contained, Self-Consistent LLM Peer-Community Benchmark for Structural Intelligence

Metanym游戏:一种自包含、自洽的LLM同行社区结构智能基准

David Nordfors

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Metanym游戏作为LLM结构智能基准,通过同行互评和奇异值分解实现无黄金标准的客观评估,事实评分与GPQA Diamond相关性达0.92,发现评判能力比生成能力更稀缺。

Comments 71 pages (main text + four appendices: full generation/evaluation prompts, the anchor submission excerpt, and a council-evaluation excerpt), 1 figure, 17 tables. Github repo with pages/figures/tables/code and data for reproducing results: https://github.com/dnordfors/metanym-game-paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28991 2026-08-03 cs.CV 新提交 89%

CAER: Conflict-Aware Evidence Routing with Dual Prefix Experts for Multimodal Large Language Models

CAER:面向多模态大语言模型的冲突感知证据路由,采用双前缀专家机制

Zixuan Liu, Juntao Cai, Xiaoxu Cai, Haishuai Wang, Jiajun Bu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本研究提出与主干无关的CAER框架,通过双前缀专家路由机制实现视觉-语言冲突检测与冲突感知生成,在MMMC及AgriConflict数据集上验证可提升开源多模态大语言模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18816 2026-08-03 cs.CR cs.SE 89%

AppPoet: Large Language Model based Android malware detection via multi-view prompt engineering

Wenxiang Zhao, Juntao Wu, Zhaoyi Meng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted by Expert Systems With Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29252 2026-08-03 cs.CL cs.AI cs.LG 新提交 88%

CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation

CalibratedRubric:面向开放式大语言模型评估的任务自适应评分规则库

Mengting Chen, Yanshu Sun, Wanting Liang, Beidi Luan, Rui Sun, Dezhi Chen, Jing Li, Zuo Bai

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 CalibratedRubric是结合特定类型评分、贝叶斯过滤与IRT的任务自适应框架,可提升开放式LLM评估的人工-黄金标准一致性与排序保真度,减少所需评分规则数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29085 2026-08-03 cs.CY 新提交 88%

IyawoBench v2.0: Extended Diagnostic Evaluation of Large Language Model Clinical Triage in Nigerian Primary Care

IyawoBench v2.0:尼日利亚基层医疗中大型语言模型临床分诊的扩展诊断评估

Anthonio Oladimeji Gabriel, Dimeji Olawuyi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 IyawoBench v2.0评估尼日利亚基层医疗的大型语言模型临床分诊,提出含三类失效模式的框架及新指标,发现前沿模型存缺陷,最优模型随部署场景变化,为中低收入国家临床AI选择提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29626 2026-08-03 cs.AI 新提交 87%

AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准

Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing Huang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00093 2026-08-03 cs.CL cs.HC physics.data-an 版本更新 87%

Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why

LLM作为评判者的评估一致性指标:报告什么及为什么

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过调查24篇近期论文,指出在二元评判标准下多数一致性指标冗余,强调Cohen's κ提供额外信息,并给出报告清单。

Comments 17 pages, 4 figures; arxiv ancillary files included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29539 2026-08-03 cs.CL cs.AI 新提交 87%

ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation

ARB:用于AI文本检测器评估的匹配作者改写基准数据集

Gaetano Perrone, Simon Pietro Romano

机构 * University of Napoli Federico II(那不勒斯费德里科二世大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出用于AI文本检测器评估的ARB基准数据集,对比五种检测器在传统基准与人类被LLM改写场景下的性能,发现传统基准测得的性能无法迁移至改写人类文本场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28631 2026-08-03 cs.AI cs.CL 新提交 87%

Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems Using Automated Multi-Model Review

AI能否评估AI科学家?基于自动化多模型评审的自主研究生成系统基准研究

Vaibhava Lakshmi Ravideshik, Mayank Kejriwal

机构 * Technion(以色列理工学院) Sakana AI FARS

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对AI科学家系统的评估难题,提出基于多模型LLM的自动化评审基准,发现FARS基准论文表现最优,Gemini与Claude评估一致性强,GPT-5.4标准不同,建立了首个定量基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02430 2026-08-03 cs.SE cs.AI 版本更新 86%

WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics

WebCoderBench: 用全面且可解释的评估指标对Web应用生成进行基准测试

Chenxu Liu, Yingjie Fu, Wei Yang, Ying Zhang, Tao Xie

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出WebCoderBench,首个基于真实用户需求的Web应用生成基准,包含1572个真实用户需求及24个细粒度评估指标,结合规则和LLM评估方法,提供可解释的评估结果,实验显示无单一最优模型,为模型优化提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28887 2026-08-03 cs.SE cs.AI cs.LG 新提交 86%

To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing

添加是机器,删除是人类:测量和缓解大语言模型代码编辑中的删除回避问题

Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia, Gopi Krishnan Rajbahadur, Ahmed E. Hassan

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究针对大语言模型代码编辑中的删除回避问题,通过SWE-bench Verified等基准测量其表现,发现后期训练中加入删除相关训练可缓解该问题并提升代码编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24649 2026-08-03 cs.AI 版本更新 85%

Reason-Mediated Behavioral Models for Auditing LLM Social Simulators

用于审计大语言模型社会模拟器的基于推理的行为模型

Atharva Pandey, Gautam Jajoo

机构 * Kairosity

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型作为社会模拟器的评估问题,通过防晒霜概念测试将人类理由映射到推理状态Z,发现人类理由能提升购买意图预测,大语言模型模拟理由较脆弱,贡献了社会模拟器评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28801 2026-08-03 cs.CL cs.AI cs.LG 新提交 85%

Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation

基准并非单一整体:面向大语言模型评估的样本级审计与编排

Philipp D. Siedler, Jordan Sassoon

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出样本级审计的元评估框架,标注五大基准的内部异质性,可编排复合基准子集实现模型能力针对性评估,为基准重组提供原则性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28788 2026-08-03 cs.AI 新提交 84%

EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses

EarlyDx:一个锚定入院时间的开放生成式循证急诊科就诊诊断基准

Jiahui Li, Ruili Fang, Zishuai Liu, Yutong Guo, Nan Yang, Wenzhan Song, Jin Lu, Fei Dou

机构 * University of Georgia(佐治亚大学) Beijing Luhe Hospital(北京潞河医院)

专题命中 评测与基准 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出EarlyDx基准,针对现有诊断基准不适用入院诊断场景的问题,基于MIMIC-IV数据构建,发现各类LLM均无法可靠综合入院证据,仅能提取部分诊断,微调后仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28645 2026-08-03 cs.HC cs.AI 新提交 84%

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试

Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17262 2026-08-03 cs.CL stat.ME 84%

Quantifying and Mitigating Socially Desirable Responding in LLMs: A Desirability-Matched Graded Forced-Choice Psychometric Study

对大型语言模型中社会期望反应进行量化与缓解:一种匹配可欲性的等级强制选择心理测量研究

Kensuke Okada, Yui Furukawa, Kyosuke Bunji

机构 * The University of Tokyo(东京大学) Kobe University(Kobe大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种心理测量框架,用于量化和缓解LLM问卷评估中的社会期望反应偏差,通过匹配可欲性来减少偏差并保持目标特征的恢复。

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Volume 1: Long Papers, pp. 40148-40166

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29079 2026-08-03 cs.CL 新提交 83%

Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models

更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制

Yaoxuan Dou, Yang Shu

机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) Zhejiang University(浙江大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。

Comments 9 pages, 4 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28634 2026-08-03 cs.CL cs.LG 新提交 82%

Can LLMs Really Understand Item Difficulty Levels? Implications for Automated Item Generation Using LLMs

大语言模型真的能理解题目难度等级吗?对使用大语言模型进行自动题目生成的启示

Xinyi Wang, Hong Jiao, Ming Li, Sydney Peters, Hanna Choi, Tianyi Zhou, Qingshu Xu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探究LLMs预测题目难度等级的表现,发现GPT-4.1准确率最高但仍低于ConvBERT,LLMs难标注难题,生成特定难度题目需谨慎。

Comments 43 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏