arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-03 至 2026-08-03 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 65 篇

2607.28165 2026-08-03 cs.CR 版本更新 89%

Piggybacking on Perception: Stealthy Concurrent Audio Prompt Injections against Multimodal LLM Agents

利用感知能力:针对多模态大语言模型智能体的隐蔽并发音频提示注入攻击

Mingxiao Liu, Yitong Li, Haoren Zhao, Yaoxiang Bian, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对多模态LLM智能体提出隐蔽并发音频提示注入攻击,构建首个相关基准并评估多款智能体,还提出CADV防御机制,经实验验证攻击有效且防御可靠。

Comments 19 pages, 8 figures, The code is publicly available at https://github.com/Limax666/AudioAgentSecurity

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21008 2026-08-03 cs.CL cs.AI cs.LG 版本更新 89%

The Metanym Game: A Self-Contained, Self-Consistent LLM Peer-Community Benchmark for Structural Intelligence

Metanym游戏:一种自包含、自洽的LLM同行社区结构智能基准

David Nordfors

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Metanym游戏作为LLM结构智能基准,通过同行互评和奇异值分解实现无黄金标准的客观评估,事实评分与GPQA Diamond相关性达0.92,发现评判能力比生成能力更稀缺。

Comments 71 pages (main text + four appendices: full generation/evaluation prompts, the anchor submission excerpt, and a council-evaluation excerpt), 1 figure, 17 tables. Github repo with pages/figures/tables/code and data for reproducing results: https://github.com/dnordfors/metanym-game-paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28991 2026-08-03 cs.CV 新提交 89%

CAER: Conflict-Aware Evidence Routing with Dual Prefix Experts for Multimodal Large Language Models

CAER:面向多模态大语言模型的冲突感知证据路由,采用双前缀专家机制

Zixuan Liu, Juntao Cai, Xiaoxu Cai, Haishuai Wang, Jiajun Bu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本研究提出与主干无关的CAER框架,通过双前缀专家路由机制实现视觉-语言冲突检测与冲突感知生成,在MMMC及AgriConflict数据集上验证可提升开源多模态大语言模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18816 2026-08-03 cs.CR cs.SE 89%

AppPoet: Large Language Model based Android malware detection via multi-view prompt engineering

Wenxiang Zhao, Juntao Wu, Zhaoyi Meng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted by Expert Systems With Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29252 2026-08-03 cs.CL cs.AI cs.LG 新提交 88%

CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation

CalibratedRubric:面向开放式大语言模型评估的任务自适应评分规则库

Mengting Chen, Yanshu Sun, Wanting Liang, Beidi Luan, Rui Sun, Dezhi Chen, Jing Li, Zuo Bai

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 CalibratedRubric是结合特定类型评分、贝叶斯过滤与IRT的任务自适应框架,可提升开放式LLM评估的人工-黄金标准一致性与排序保真度,减少所需评分规则数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29085 2026-08-03 cs.CY 新提交 88%

IyawoBench v2.0: Extended Diagnostic Evaluation of Large Language Model Clinical Triage in Nigerian Primary Care

IyawoBench v2.0:尼日利亚基层医疗中大型语言模型临床分诊的扩展诊断评估

Anthonio Oladimeji Gabriel, Dimeji Olawuyi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 IyawoBench v2.0评估尼日利亚基层医疗的大型语言模型临床分诊,提出含三类失效模式的框架及新指标,发现前沿模型存缺陷,最优模型随部署场景变化,为中低收入国家临床AI选择提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29626 2026-08-03 cs.AI 新提交 87%

AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准

Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing Huang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00093 2026-08-03 cs.CL cs.HC physics.data-an 版本更新 87%

Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why

LLM作为评判者的评估一致性指标:报告什么及为什么

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过调查24篇近期论文,指出在二元评判标准下多数一致性指标冗余,强调Cohen's κ提供额外信息,并给出报告清单。

Comments 17 pages, 4 figures; arxiv ancillary files included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29539 2026-08-03 cs.CL cs.AI 新提交 87%

ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation

ARB:用于AI文本检测器评估的匹配作者改写基准数据集

Gaetano Perrone, Simon Pietro Romano

机构 * University of Napoli Federico II(那不勒斯费德里科二世大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出用于AI文本检测器评估的ARB基准数据集,对比五种检测器在传统基准与人类被LLM改写场景下的性能,发现传统基准测得的性能无法迁移至改写人类文本场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28631 2026-08-03 cs.AI cs.CL 新提交 87%

Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems Using Automated Multi-Model Review

AI能否评估AI科学家?基于自动化多模型评审的自主研究生成系统基准研究

Vaibhava Lakshmi Ravideshik, Mayank Kejriwal

机构 * Technion(以色列理工学院) Sakana AI FARS

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对AI科学家系统的评估难题,提出基于多模型LLM的自动化评审基准,发现FARS基准论文表现最优,Gemini与Claude评估一致性强,GPT-5.4标准不同,建立了首个定量基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02430 2026-08-03 cs.SE cs.AI 版本更新 86%

WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics

WebCoderBench: 用全面且可解释的评估指标对Web应用生成进行基准测试

Chenxu Liu, Yingjie Fu, Wei Yang, Ying Zhang, Tao Xie

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出WebCoderBench,首个基于真实用户需求的Web应用生成基准,包含1572个真实用户需求及24个细粒度评估指标,结合规则和LLM评估方法,提供可解释的评估结果,实验显示无单一最优模型,为模型优化提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28887 2026-08-03 cs.SE cs.AI cs.LG 新提交 86%

To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing

添加是机器,删除是人类:测量和缓解大语言模型代码编辑中的删除回避问题

Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia, Gopi Krishnan Rajbahadur, Ahmed E. Hassan

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究针对大语言模型代码编辑中的删除回避问题,通过SWE-bench Verified等基准测量其表现,发现后期训练中加入删除相关训练可缓解该问题并提升代码编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24649 2026-08-03 cs.AI 版本更新 85%

Reason-Mediated Behavioral Models for Auditing LLM Social Simulators

用于审计大语言模型社会模拟器的基于推理的行为模型

Atharva Pandey, Gautam Jajoo

机构 * Kairosity

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型作为社会模拟器的评估问题,通过防晒霜概念测试将人类理由映射到推理状态Z,发现人类理由能提升购买意图预测,大语言模型模拟理由较脆弱,贡献了社会模拟器评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28801 2026-08-03 cs.CL cs.AI cs.LG 新提交 85%

Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation

基准并非单一整体:面向大语言模型评估的样本级审计与编排

Philipp D. Siedler, Jordan Sassoon

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出样本级审计的元评估框架,标注五大基准的内部异质性,可编排复合基准子集实现模型能力针对性评估,为基准重组提供原则性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28788 2026-08-03 cs.AI 新提交 84%

EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses

EarlyDx:一个锚定入院时间的开放生成式循证急诊科就诊诊断基准

Jiahui Li, Ruili Fang, Zishuai Liu, Yutong Guo, Nan Yang, Wenzhan Song, Jin Lu, Fei Dou

机构 * University of Georgia(佐治亚大学) Beijing Luhe Hospital(北京潞河医院)

专题命中 评测与基准 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出EarlyDx基准,针对现有诊断基准不适用入院诊断场景的问题,基于MIMIC-IV数据构建,发现各类LLM均无法可靠综合入院证据,仅能提取部分诊断,微调后仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28645 2026-08-03 cs.HC cs.AI 新提交 84%

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试

Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17262 2026-08-03 cs.CL stat.ME 84%

Quantifying and Mitigating Socially Desirable Responding in LLMs: A Desirability-Matched Graded Forced-Choice Psychometric Study

对大型语言模型中社会期望反应进行量化与缓解:一种匹配可欲性的等级强制选择心理测量研究

Kensuke Okada, Yui Furukawa, Kyosuke Bunji

机构 * The University of Tokyo(东京大学) Kobe University(Kobe大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种心理测量框架,用于量化和缓解LLM问卷评估中的社会期望反应偏差,通过匹配可欲性来减少偏差并保持目标特征的恢复。

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Volume 1: Long Papers, pp. 40148-40166

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29079 2026-08-03 cs.CL 新提交 83%

Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models

更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制

Yaoxuan Dou, Yang Shu

机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) Zhejiang University(浙江大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。

Comments 9 pages, 4 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28634 2026-08-03 cs.CL cs.LG 新提交 82%

Can LLMs Really Understand Item Difficulty Levels? Implications for Automated Item Generation Using LLMs

大语言模型真的能理解题目难度等级吗?对使用大语言模型进行自动题目生成的启示

Xinyi Wang, Hong Jiao, Ming Li, Sydney Peters, Hanna Choi, Tianyi Zhou, Qingshu Xu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探究LLMs预测题目难度等级的表现,发现GPT-4.1准确率最高但仍低于ConvBERT,LLMs难标注难题,生成特定难度题目需谨慎。

Comments 43 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27816 2026-08-03 cs.CL cs.AI 版本更新 82%

Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation

超越借用的历史:用于交互式角色扮演评估的人物对齐用户模拟

Yuhang Zhu, Mingxuan Du, Benfeng Xu, Jie Gao, Lingyun Yu, Hongtao Xie

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对现有RPA评估基准的局限,提出基于用户模拟器的PALATE基准,通过个性化评分标准和多轮自由对话评估,生成针对特定用户-RPA对的可解释评估。

Comments 29 pages, 3 figures, including supplementary material. Resources: https://github.com/Zhuyh1139/PALATE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22657 2026-08-03 cs.CL cs.AI 版本更新 82%

Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS

在抑制与崩溃之间:用LENS评估叙事去学习

Viktoriia Makovska, George Fletcher

机构 * Ukrainian Catholic University(乌克兰天主教大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型再现虚假叙事问题,引入LENS评估协议,通过实验评估两个叙事,涵盖四个模型,用SCE分数评估,发现选定检查点可减少叙事再现,有实体恢复副作用,证明LENS是成功的诊断协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-08-03 cs.CL cs.AI 版本更新 82%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29218 2026-08-03 cs.AI 新提交 81%

MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft

MirrorCraft:Minecraft中隐藏规则变化下的配对评估

Jianxin Gao, Beini Hu, Runze Li, Wanli Peng, Ruohan Lei, Jinyuan Zhang, Linna Deng, Tianyi Yu, Zining Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MirrorCraft是用于Minecraft隐藏规则变化下评估智能体的配对基准,实验发现规则集对隐藏规则变化的影响差异显著,未提供规则描述时ReAct表现最优,提供规则可适度提升任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28777 2026-08-03 cs.CL 新提交 81%

Self-Supervised Skill Optimization

自监督技能优化

Siran Peng, Cuiyu Yang, Tianyu Fu, Tianshuo Zhang, Haoyuan Zhang, Weisong Zhao, Anyang Su, Minghui Wu, Huiying Li, Xiangyu Zhu, Chenxu Zhao, Zhen Lei

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出自监督技能优化(SSO)框架,仅用未标注任务实例学习可复用技能,在封闭、开放任务上优于无真实标注的提示优化器,部分场景表现接近最强的基于真实标注的技能优化器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28439 2026-08-03 cs.CL 版本更新 81%

Beyond a Single Judge: The Evidence-Grounded, Social-Weighted Persona Panel for Generative UI Evaluation

超越单一评判者:用于生成式UI评估的社会角色面板模拟

Zheng Wu, Yibo Luo, Pu Zhang, Cheng Yang, Zhuosheng Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对GenUI评估问题,提出三阶段ESPP方法,通过多样化角色面板提升评估保真度,揭示用户子群体的结构性分歧,代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20075 2026-08-03 cs.SE cs.AI 版本更新 81%

Agentic Harness for Real-World Compilers

面向现实世界的编译器助手

Yingwei Zheng, Cong Li, Shaohua Li, Yuqun Zhang, Zhendong Su

机构 * Southern University of Science and Technology(南方科技大学) ETH Zurich(苏黎世联邦理工学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出llvm-autofix,首个专为修复编译器bug设计的代理工具,通过专用工具和基准测试展示其在处理复杂编译器bug时的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28641 2026-08-03 cs.CL cs.AI 新提交 81%

The Formalism Trap: Are LLM-as-a-Judge Evaluators Blinded by Consensus Mimicry under Social Load?

形式主义陷阱:社会负荷下作为评判者的大语言模型是否会被共识模仿蒙蔽?

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Agentic形式主义陷阱与评估失调指数,通过多领域轨迹分析揭示作为评判者的大语言模型易受句法触发影响,且该漏洞与领域无关,需架构特定的警戒过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10046 2026-08-03 cs.SE 版本更新 80%

Automated Table Reproduction via Code Generation

Artisan: 自动化代理评估

Doehyun Baek, Michael Pradel

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 Artisan通过自动化LLM代理生成重现脚本,提升软件工程研究结果的可重复性,生成44/60个有效脚本并发现20个新错误。

Comments Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29445 2026-08-03 cs.CV cs.AI 新提交 79%

QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models

用于红外视觉语言模型定向语义攻击的QR结构化热触发装置

Xiang Chen, Yingying Zhao, Chao Li, Jiaju Han, Ben Zhang, Ang Li, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出QR-STT框架,作为隐蔽黑盒攻击手段,可定向操控IR-VLMs的语义对齐,其扰动还能跨任务迁移,凸显了对该类攻击进行鲁棒性评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23332 2026-08-03 cs.LG 版本更新 79%

AllocBench: Measuring Online Tool Allocation Capability in LLM Agents

AlloBench:测量大语言模型智能体中的在线工具分配能力

Daniel Wang, Andrew Xu

机构 * Sea12 Technologies(Sea12科技公司) Yale University(耶鲁大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 研究测试大语言模型智能体在固定预算下的在线工具分配能力,通过配对基准测试发现前沿模型在抽象框架中表现近乎最优,但在脚本编写中失败,确定了各模型失败模式,还表明开源Qwen模型在抽象分配上有推广,在线工具分配是重要能力边界。

Comments 24 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏