arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2509.01494 2026-06-08 cs.SE 版本更新 89%

SWR-Bench: Assessing LLM Performance in Real-World Code Review Comment Generation

SWR-Bench:评估大语言模型在真实世界代码审查评论生成中的性能

Zhengran Zeng, Ruikai Shi, Keke Han, Yixin Li, Kaicheng Sun, Yidong Wang, Zhuohao Yu, Rui Xie, Wei Ye, Shikun Zhang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 SWR-Bench通过1000个手动验证的GitHubPull Requests,评估LLM在真实世界代码审查中的性能,提出客观评估方法并验证了多评论聚合策略,显著提升ACR性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05567 2026-06-05 cs.CR cs.MA 89%

ZERO-APT: A Closed-Loop Adversarial Framework for LLM-Driven Automated Penetration Testing under Intelligent Defense

ZERO-APT: 智能防御下LLM驱动的自动化渗透测试的闭环对抗框架

Anlan Zheng, Tiantian Zhu

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出ZERO-APT框架,通过集成可配置的LLM防御者、架构级因果一致性机制和专用裁判智能体,解决了LLM驱动渗透测试在真实性、一致性和可审计性方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05489 2026-06-05 cs.CV cs.DB 89%

LLM-Guided ANN Index Optimization for Human-Object Interaction Retrieval

LLM引导的ANN索引优化用于人-物交互检索

Shahrzad Esmat, Chaunte W. Lacewell, Sameh Gobriel, Nilesh Jain, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Intel Corporation(英特尔公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种基于大语言模型的阶段感知智能体,通过耦合参数空间的分阶段优化,在HICO-DET等基准上显著提升向量检索吞吐量。

Comments 13 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05001 2026-06-04 cs.SE 89%

TeleSWEBench: A Commit-Driven Benchmark for Evaluating LLM-Powered Software Engineering in Telecommunications

TeleSWEBench:一个面向电信领域评估基于LLM的软件工程的提交驱动基准

Pranshav Gajjar, Ali Mamaghani, Dinesh Bharadia, Vijay K Shah

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出TeleSWEBench,首个面向电信领域的提交驱动基准,通过从srsRAN 5G仓库挖掘真实提交并构建734个可执行测试用例,结合分层LLM评判框架TeleJudge,评估ASE工具在电信软件工程中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01969 2026-06-02 cs.SE cs.HC 89%

Trust-Calibrated Code Review: A Participatory Design Study of Review Workflows for LLM-Generated Multi-File Changes

信任校准的代码审查:针对LLM生成的多文件变更的审查工作流程的参与式设计研究

Lo Gullstrand Heander, Agnia Sergeyuk, Ilya Zakharov, Emma Söderberg, Nikita Mukhortov

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本研究通过参与式设计,发现审查LLM生成的多文件变更的核心挑战是信任校准,提出了三级审查工作流程和七项设计构造,并通过验证调查表明其能降低审查工作量。

Comments Submitted to ESEM SEIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01859 2026-06-02 cs.SE 89%

Improving LLM-Based Go Code Review through Issue-List Generation and Context Augmentation

通过问题列表生成和上下文增强改进基于LLM的Go代码审查

Kexin Sun, Yucong Guan, Jiaqi Sun, Hongyu Kuang, Guoping Rong, Dong Shao, He Zhang, Xiaoxing Ma, Christoph Treude

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出问题列表审查范式,结合三种上下文增强方法,并通过候选集成和精炼引导剪枝提升LLM代码审查效果,在Go代码审查中显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01317 2026-06-02 cs.SE cs.CR 89%

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00467 2026-06-02 cs.CL cs.AI cs.LG stat.ML 89%

On the Limits of LLM Adaptability: Impact of Model-Internalized Priors on Annotation Task Performance

论大语言模型适应性的局限:模型内化先验对标注任务性能的影响

Etienne Casanova, Rafal Kocielnik, R. Michael Alvarez

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过毒性检测实验,研究大语言模型内化先验与指令交互的三个维度,发现近三分之二的零样本错误难以通过提示纠正,并引入定义特定熟悉度(DSF)指标,证明其与性能正相关,而文本记忆指标则无此关联。

Comments Accepted at ICML 2026 (Oral & Spotlight); PMLR vol. 306. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00003 2026-06-02 cs.CY cs.CR cs.HC 89%

Learning from Mistakes: Can LLM Self-Recover after Misalignment?

从错误中学习:LLM 在错位后能否自我恢复?

Olga E. Sorokoletova, Francesco Giarrusso, Vincenzo Suriani, Daniele Nardi

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究大语言模型在遭受恶意攻击后,是否具有内在的自我对齐恢复能力,并提出一种建模用户-助手交互安全轨迹并检测恢复趋势的方法。

Comments AAAI'26 Workshop (WS37), Machine Ethics: from formal methods to emergent machine ethics, January 20--27, 2026, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13557 2026-06-02 cs.AR 89%

MACO: A Multi-Agent LLM Framework for Automated CGRA Hardware/Software Co-Design

MACO: 一种用于自动化CGRA硬件/软件协同设计的基于多智能体LLM的框架

Zesong Jiang, Yuqi Sun, Qing Zhong, Mahathi Krishna, Deepak Patil, Cheng Tan, Jeff Zhang

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出MACO框架,通过多智能体LLM协作和指数衰减探索策略,自动化CGRA硬件/软件协同设计,在功耗、性能和搜索效率上分别提升25.9%、20.0%和5倍。

Comments new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26269 2026-05-27 cs.CR 89%

AgentSecBench: Measuring Prompt Injection, Privacy Leakage, and Tool-Use Integrity in LLM Agents

AgentSecBench:测量LLM智能体中的提示注入、隐私泄露和工具使用完整性

Faruk Alpay, Taylan Alpay

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出AgentSecBench框架,通过定义意图到执行的无干扰游戏,系统评估LLM智能体在指令完整性、检索机密性和能力完整性方面的安全风险,并实验验证防御措施的有效性。

Comments 24 pages, 3 figures. Ancillary files provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24309 2026-05-26 cs.CR 89%

Reframing LLM Agent Security as an Agent-Human Interaction Problem

将LLM智能体安全重新定义为智能体-人类交互问题

Peiran Wang, Ying Li, Yuan Tian

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过系统分析59篇学术论文、21个生产智能体系统和26个安全插件,论证LLM智能体安全本质上是智能体-人类交互问题,而非纯算法问题,并提出了三方向研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22812 2026-05-21 cs.HC 89%

Stable Personas: Dual-Assessment of Temporal Stability in LLM-Based Human Simulation

稳定的人设:基于LLM的人类模拟中的双评估时间稳定性

Jana Gonnermann-Müller, Jennifer Haase, Nicolas Leins, Thomas Kosch, Sebastian Pokutta

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过双评估框架研究LLM在长时间对话中保持稳定人设的能力,发现自述信息稳定但观察者评分显示人设表达随时间下降,为多智能体社交模拟提供了边界条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11401 2026-05-21 cs.HC cs.MA 89%

FACET: Teacher-Centred LLM-Based Multi-Agent Systems-Towards Personalized Educational Worksheets

FACET:以教师为中心的基于大语言模型的多智能体系统——向个性化教育工作表迈进

Jana Gonnermann-Müller, Jennifer Haase, Konstantin Fackeldey, Sebastian Pokutta

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出FACET框架,一种面向教师的基于大语言模型的多智能体系统,旨在生成整合学习者认知和动机维度的个性化课堂材料,通过三个专门智能体实现,展示了多智能体LLM架构在异质课堂环境中的规模化、情境感知个性化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07777 2026-05-20 cs.MA cs.GT 89%

Talk, Judge, Cooperate: Gossip-Driven Indirect Reciprocity in Self-Interested LLM Agents

谈话、评判、合作:在自利LLM代理中基于 gossip 的间接互惠

Shuhui Zhu, Yue Lin, Shriya Kaistha, Wenhao Li, Baoxiang Wang, Hongyuan Zha, Gillian K. Hadfield, Pascal Poupart

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出ALIGN框架,通过策略性分享开放式 gossip 实现去中心化代理的声誉形成、信任评估和社会规范协调,从而提升间接互惠并抵御恶意入侵,发现LLM的更强推理能力促进更激励对齐的合作,而聊天模型容易过度合作。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16386 2026-05-19 cs.CV 89%

Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

对多模态大语言模型评分者的审计:临床顺序评分中的中间倾向偏差

Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada, Yonah Joffe, Jessica Sena, Miguel Contreras, Scott Siegel, Subhash Nerella, Catherine Price, Parisa Rashidi

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Department of Computer and Information Science and Engineering(计算机与信息科学与工程系) Department of Clinical and Health Psychology(临床与健康心理学系) Department of Biomedical Engineering(生物医学工程系)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文研究多模态大语言模型在临床顺序评分中的中间倾向偏差,通过基准测试发现三种前沿LLM在Clock Drawing Test评分中存在系统性压缩倾向,影响临床决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10930 2026-05-19 cs.HC 89%

Evaluating the False Trust Engendered by LLM Explanations

评估由LLM解释所引发的虚假信任

Vardhan Palod, Upasana Biswas, Subbarao Kambhampati

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过用户研究评估不同解释类型对用户判断AI答案正确性及产生虚假信任的影响,发现推理轨迹和事后解释具有说服力但不具信息性,而对比双解释能提升用户区分正确与错误输出的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14312 2026-05-15 cs.SE 89%

Making OpenAPI Documentation Agent-Ready: Detecting Documentation and REST Smells with a Multi-Agent LLM System

使OpenAPI文档具备代理准备性:利用多代理LLM系统检测文档和REST气味

Rayfran Rocha Lima, Davi G. Assunção Pinheiro, Thiago Medeiros de Menezes

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 研究通过多代理LLM系统检测OpenAPI文档和REST相关问题,发现2450个气味,揭示微服务环境中结构有效性不保证语义准备性,推动API治理流程改进。

Comments 10 pages. Accepted in EASE 2026, 9-12 June 2026, Glasgow, Scotland, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11482 2026-05-13 cs.SE 89%

NeuroFlake: A Neuro-Symbolic LLM Framework for Flaky Test Classification

NeuroFlake:一种用于故障测试分类的神经符号LLM框架

Khondaker Tasnia Hoque, Toukir Ahammed

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出NeuroFlake框架,通过结合神经网络与符号方法,提升故障测试分类的鲁棒性与泛化能力,实验表明其在F1-score上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10036 2026-05-13 cs.CL cs.AI cs.IR cs.LG 89%

Reflect then Learn: Active Prompting for Information Extraction Guided by Introspective Confusion

先反思再学习:基于反思困惑的主动提示信息提取

Dong Zhao, Yadong Wang, Xiang Chen, Chenxi Wang, Hongliang Dai, Chuanxing Geng, Shengzhong Zhang, Shaoyuan Li, Sheng-Jun Huang

机构 * NUAA-MMMI(南京航空航天大学- MMMI)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出APIE框架,通过反思困惑度评估,主动选择具有挑战性和信息量的样本,提升信息提取的准确性和鲁棒性。

Comments Published at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09961 2026-05-12 cs.CR 89%

Towards LLM-Based Analysis of Virtualization-Obfuscated Code through Automated Data Generation

基于LLM的虚拟化混淆代码分析方法通过自动化数据生成

Sangjun An, Hyeyeon Park, Yejin Son, Seoksu Lee, Eun-Sun Cho

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过自动化数据生成方法,针对虚拟化混淆代码的结构分析,提出了一种基于LLM的分析方法,解决了输入规模限制和大规模标注数据需求的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07293 2026-05-11 cs.CR 89%

When the Ruler is Broken: Parsing-Induced Suppression in LLM-Based Security Log Evaluation

当尺子破损时:基于LLM的安全日志评估中的解析诱导抑制

Chaitanya Vilas Garware, Sharif Noor Zisad

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文揭示了基于LLM的安全日志分类器评估中因严格正则表达式解析导致的系统性误差,通过OpenSOC-AI案例显示,修正后的模糊解析可将威胁准确性从0%提升至76%,并提出SOC-Bench v0基准框架以避免解析偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06652 2026-05-08 cs.LG cs.AI cs.CL 89%

When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels

在没有基准的情况下:在无标签的情况下验证比较LLM安全性评分

Sushant Gautam, Finn Schwall, Annika Willoch Olstad, Fernando Vallecillos Ruiz, Birk Torpmann-Hagen, Sunniva Maria Stordal Bjørklund, Leon Moonen, Klas Pettersen, Michael A. Riegler

机构 * Simula Metropolitan Center for Digital Engineering(Simula 数字工程中心) Oslo Metropolitan University(奥斯陆 Metropolitan 大学) University of Oslo(奥斯陆大学) Simula Research Laboratory(Simula 研究实验室) Norwegian Directorate of Health(挪威健康 Directorate)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出在无标签情况下验证LLM安全性的方法,通过构建仪器有效性链来替代真实标签,通过实验验证其有效性,并展示了在不同场景下的应用和结果。

Comments SimpleAudit Repository: https://github.com/kelkalot/simpleaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05790 2026-05-08 cs.HC 89%

GazeMind: A Gaze-Guided LLM Agent for Personalized Cognitive Load Assessment

GazeMind:一种基于注视的LLM代理用于个性化认知负荷评估

Bin Wang, Yue Liu, Benjamin Newman, Ajoy S. Fernandes, Zhiyuan Wang, Robert Cavin, Michele A. Cox, Vijay Rajanna, Takumi Bolte, Melissa Hunfalvay, Ulas Bagci, Michael J. Proulx

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出GazeMind,一种基于注视的LLM代理框架,用于智能眼镜上的认知负荷评估。该框架通过编码注视数据为结构化表示,提供可解释的认知负荷预测,并通过新颖的任务引导推理方法实现跨场景泛化,同时利用用户特定特征和历史参考实现个性化适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05391 2026-05-08 cs.HC 89%

Every(bot) Makes Mistakes: Coding Big Five Personalities, Context, and Tone into an LLM Chatbot Recovery Code Framework

每个( bot )都会犯错:将大五人格、情境和语气编码到LLM聊天机器人恢复代码框架中

Rachel Hill, Tom Owen, Julian Hough

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出一个结合大五人格、情境和语气的LLM聊天机器人恢复代码框架,通过实验验证其在提升错误恢复质量方面的有效性。

Comments 14 pages of main content, 3 figures, 4 tables, 9 appendices. This paper has been submitted to the Becker Friedman Institute 2026 AI in Social Sciences conference for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01209 2026-05-05 cs.SE cs.FL 89%

ClarifySTL: An Interactive LLM Agent Framework for STL Transformation through Requirements Clarification

ClarifySTL: 一种通过需求澄清的交互式LLM代理框架用于STL转换

Yue Fang, Zhi Jin, Jie An, Hongshen Chen, Xiaohong Chen, Naijun Zhan

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ClarifySTL框架,通过交互式澄清需求中的模糊和歧义信息,提升STL转换的准确性与效率,实验表明其在多个基准测试中表现优异。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23455 2026-05-04 cs.SE 89%

CUJBench: Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend

CUJBench:跨模态故障诊断的LLM-代理基准测试

Haoming Meng

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 CUJBench是首个结合浏览器可见故障证据与后端可观测性的跨模态故障诊断基准测试,通过LLM辅助生成管道降低标注成本,评估六种前沿模型发现跨模态综合是主要瓶颈。

Comments 10 pages, 1 figure; updated source code url

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01026 2026-05-04 cs.SE cs.HC 89%

Understanding the Human-LLM Dynamic: A Literature Survey of LLM Use in Programming Tasks

理解人与大语言模型的动态:关于大语言模型在编程任务中应用的文献综述

Deborah Etsenake, Meiyappan Nagappan

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文综述了大语言模型在编程任务中的应用,分析了用户与LLM的交互行为、LLM的优缺点以及影响人类和任务表现的因素,揭示了人与LLM交互的非确定性特性。

Comments Revised version: Corrected citation errors in the Learning Check subsection (Section RQ2), updated the RQ2 summary to more accurately reflect the mixed results in the data, and added clarifying notes on implementation structure as a moderating variable for learning outcomes. 16 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27727 2026-05-01 cs.SE 89%

LLM-as-a-Judge for Human-AI Co-Creation: A Reliability-Aware Evaluation Framework for Coding

LLM作为裁判促进人机协同创造:一种可靠性感知的编码评估框架

Md Faizul Ibne Amin, Yutaka Watanobe, Daniel M. Muepu, Haruto Suzuki, Kenta Nanaumi, Md Mostafizer Rahman

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出一种基于评分标准的LLM作为裁判框架,用于编程和软件工程的人机协同创造评估,通过多指标协议评估多个LLM裁判,并分析协同创造轨迹信号,揭示协同创造成功早期集中和修订行为异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26679 2026-04-30 cs.HC 89%

MultEval: Supporting Collaborative Alignment for LLM-as-a-Judge Evaluation Criteria

MultEval: 支持LLM-as-a-Judge评估标准的协作对齐

Charles Chiang, Simret Gebreegziabher, Annalisa Szymanski, Yukun Yang, Hyo Jin Do, Zahra Ashktorab, Werner Geyer, Toby Li, Diego Gomez-Zara

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 研究探讨了LLM-as-a-Judge评估标准的协作制定过程,提出MultEval系统支持多方协商和迭代修订标准,提升评估透明度与一致性。

Comments 17 pages, 5 figures

Journal ref Proceedings of the 5th Annual Symposium on Human-Computer Interaction for Work (CHIWORK '26), June 22--25, 2026, Linz, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏