arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2606.31187 2026-07-01 cs.CV 新提交 88%

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25747 2026-07-01 cs.SE 新提交 88%

CodeChat-Eval: Evaluating Large Language Models in Multi-Turn Code Refinement Dialogues

CodeChat-Eval:在多轮代码优化对话中评估大型语言模型

Guoxiang Guo, Kla Tantithamthavorn, Neelofar Neelofar, Yuanyuan Qi, Aldeida Aleti

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出CodeChat-Eval框架,通过动态指令选择算法构建多轮代码优化对话评估会话,发现LLMs在多轮优化中功能正确性显著下降(19.2%-69.2%),逻辑级优化和新增请求导致最大下降。

Comments Accepted by ICSME26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26927 2026-06-26 cs.SE 新提交 88%

Are LLMs Ready for Anti-Pattern Detection in Microservice Architectures?

LLM 是否准备好检测微服务架构中的反模式?

Marco De Luca, Domenico Amalfitano, Porfirio Tramontana, Anna Rita Fasolino

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文研究大型语言模型(LLM)通过提示分析微服务仓库静态制品来检测16种架构反模式的能力,与静态分析工具MARS对比,发现LLM在局部、异构或语义丰富的反模式上表现有竞争力,但在需要结构或跨服务依赖证据时受限,可作为补充工具。

Comments accepted at ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25193 2026-06-25 cs.SE 新提交 88%

LLM4MTLs: Automated Generation and Empirical Evaluation of Model Transformation Languages

LLM4MTLs:模型转换语言的自动生成与实证评估

Bowen Jiang, Nathan Hagel, Haowei Cheng, Benedikt Jutz, Arne Lange, Weixing Zhang, Rahul Sharma, Ralf Reussner, Anne Koziolek

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出LLM4MTLs工作流,通过少样本提示、语法提示和辅助方法组合,自动生成并评估LLM编写的模型转换代码,发现少样本提示能提升语法质量但语义改进有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24166 2026-06-24 cs.NE 新提交 88%

Distributed Quality-Diversity Search for Toxicity in Large Language Models

大型语言模型中毒性检测的分布式质量-多样性搜索

Onkar Shelar, Travis Desell

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出ToxSearch-S方法,通过增量式物种形成和MPI并行化,在有限预算下实现与基线相当的峰值毒性,同时降低累积搜索压力,并利用分布式计算显著加速搜索。

Comments 40 pages, 10 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23704 2026-06-24 cs.AR 新提交 88%

PCB-QA: Evaluating LLMs over the First Printed Circuit Board Design Question-Answer Dataset

PCB-QA:首个印刷电路板设计问答数据集评估大语言模型

Sahana Srinivasan, Benjamin Tan, Benjamin Turnbull, Hammond Pearce

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对大语言模型在PCB设计应用中缺乏文本数据集和评估方法的问题,提出PCB-QA数据集(480个问答对),通过不同文件格式提示LLM,发现基于JSON的文本格式使Gemini 3 Flash Preview达到93%准确率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17094 2026-06-17 cs.SE 新提交 88%

LogCopilot: Automating Log Aggregation Analysis through Large Language Models

LogCopilot: 通过大型语言模型自动化日志聚合分析

Senyu Xie, Chenxi Zhang, Tong Zhou, Jiacheng Liu, Xiaoyu Hong, Qingshan Li, Xin Peng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出LogCopilot框架,利用大型语言模型,通过自然语言指令、知识检索和工具调用自动生成LogQL查询,实现日志聚合分析,平均准确率76.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14607 2026-06-15 cs.SE cs.DC 新提交 88%

Empowering Student Debugging in Parallel Programming with Execution Traces and Large Language Models

利用执行轨迹和大语言模型增强学生在并行编程中的调试能力

God'salvation F. Oguibe, Vinodh Kumaran Jayakumar, Tongping Liu, Andrew Lan, Wei Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出ParaView工具,通过执行记录与可视化帮助学生调试并发程序,结合大语言模型分析错误,实验表明调试成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19974 2026-08-21 cs.AI 新提交 87%

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance

ReguSim:评估大语言模型智能体在金融合规中的规则落地

Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song

机构 * HKUST(香港科技大学) HKBU(香港浸会大学) NTU(新加坡南洋理工大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19746 2026-08-21 cs.CL 新提交 87%

PersonalBench: Measuring the Authorship Gap in LLM Personalization

PersonalBench:测量大语言模型个性化中的作者差距

Yash Ganpat Sawant

机构 * Independent AI Researcher(独立人工智能研究员)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究推出PersonalBench基准,通过LUAR、LLM评判者、自动风格计量学评估LLM个性化方法,发现其可区分作者但未达人类水平,发布该基准为LLM个性化提供校准工具。

Comments 17 pages. Extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18554 2026-08-20 cs.CY cs.AI cs.MA econ.GN q-fin.EC 新提交 87%

CentaurBench: Benchmarking LLM Capabilities on Augmenting vs. Automating Real-World Work Tasks

CentaurBench:评估大型语言模型在增强与自动化现实工作任务方面的能力

Pattaraphon Kenny Wongchamcharoen, Kris Gulati, Min Min Fong, Abhishek Nagaraj

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 CentaurBench基准测试显示LLM的自动化能力与辅助能力仅适度相关,多数自动化优胜者在增强任务中表现不佳,辅助效果并非始终为正,表明需按模型在多智能体系统中的角色评估模型。

Comments 46 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17933 2026-08-19 cs.AI cs.CE 新提交 87%

EvoTS-Agent: A Self-Evolving LLM Agent for Financial Time Series Change Point Detection

EvoTS-Agent:一种用于金融时间序列变点检测的自进化大语言模型智能体

Lei Jiang, Ye Wei, Xinyu Xi, Jordan Langham-Lopez, Yifan Bao, Raad Khraishi, Yihao Ang, Anthony K. H. Tung, Lukasz Szpruch, Hao Ni

机构 * Alan Turing Institute(阿兰·图灵研究所) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) NatWest AI Research(国民西敏寺银行人工智能研究部) University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对金融时间序列变点检测难题,提出自进化 LLM 智能体 EvoTS-Agent,经验证引导进化检测流程,在四个基准数据集上表现优于现有同类智能体且执行成功率达100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16349 2026-08-18 cs.AI 新提交 87%

AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment

AeroCopilotBench:用于在交互式虚拟驾驶舱环境中评估作为航空副驾驶的大语言模型智能体的双层基准

Yuchen Yuan, Zhenghuang Wu, Yuangan Li, Liang Ma, Ke Li

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出AeroCopilot操作环境与双层航空智能体评估基准,通过12个模型测试发现静态知识表现难转化为流程执行能力,为航空智能体评估提供可复现基础。

Comments 38 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15931 2026-08-18 cs.CL 新提交 87%

PLSQLBench: Benchmarking LLM Systems for Executable Procedural Database Programming

PLSQLBench:面向可执行过程式数据库编程的大语言模型系统基准测试

Marianne Menglin Liu, Leonid Boytsov, Daniel W. Peterson, Pramuditha Perera, Rongguang Wang, Sai Ashish Somayajula, Syed Hamza Rafique, Rohit Saini, Shubham Pathak, Sujeeth Bharadwaj, Tao Sheng, Graham Horwood, Fahad Shah, Ankan Bansal, Sujith Ravi, Dan Roth

机构 * Oracle AI, Turing Enterprise Inc(Oracle AI 图灵企业公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究提出首个过程式数据库编程基准PLSQLBench,含2865个任务实例,经8个LLM实验发现其在多方面存在困难,工具增强智能体性能有提升但仍有差距,凸显了传统基准未覆盖的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14956 2026-08-18 cs.LG cs.LO 新提交 87%

LLM-based Framework for Generating and Verifying Parallel DEVS Statecharts

基于大语言模型的并行DEVS状态图生成与验证框架

Vamsi Krishna Vasa, Hessam S. Sarjoughian, Edward J. Yellig

机构 * Arizona State University(亚利桑那州立大学) Intel Corporation(英特尔公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.LG

AI总结 本研究提出智能体式PDEVS-LLM框架,辅助建模人员生成验证PDEVS状态图,经评估该框架可显著提升生成状态图的逻辑一致性。

Comments 22 pages, 5 figures, 9 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14950 2026-08-18 cs.CL 新提交 87%

DA-RAC: Distance-Aware Calibration of LLM Judges for Trustworthy AI Auditing

DA-RAC:面向可信AI审计的大语言模型评判器的距离感知校准

Cheng Wu, Vishal Anand, Jaya Krishna Mandivarapu, Xiya Liu, Rui Zhuang

机构 * Microsoft(微软公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 针对LLM评判器因无关参考示例导致的校准偏差问题,提出DA-RAC距离感知参考锚定校准方法,在多轮评估基准上提升了校准效果并降低了误通过风险,为可信AI审计提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14590 2026-08-18 cs.AI 新提交 87%

Toward Safe LLM Agents: A Survey of Specification, Verification, and Enforcement

面向安全的大语言模型智能体:规范、验证与执行的综述

Pierre Dantas, Lucas Cordeiro, Ehsan Nowroozi, Tihanyi Norbert

机构 * The University of Manchester(曼彻斯特大学) The University of Greenwich(格林威治大学) Technology Innovation Institute(技术创新研究院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该综述针对LLM智能体缺乏形式化任务级安全保障的问题,通过系统分析38项研究,揭示规范瓶颈等四项关键发现,提出三级分类体系与十大问题研究议程,为可信智能体AI研究提供方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13835 2026-08-17 cs.CL 新提交 87%

When Lexical Change Misleads: Rethinking Dynamic Topic Model Evaluation with Traditional and LLM-Based Metrics

当词汇变化产生误导时:结合传统指标与基于大语言模型的指标重新思考动态主题模型评估

Charu Karakkaparambil James

机构 * RPTU University Kaiserslautern-Landau(莱茵兰-普法尔茨州立大学凯撒斯劳滕-兰道分校)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对动态主题模型评估中词汇变化误导的问题,对比传统指标与基于LLM的语义相似性指标,发现后者在CoNTM上与人工判断一致性更高,提出应结合两类指标开展感知词汇变化的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13563 2026-08-17 cs.HC cs.AI cs.SE 新提交 87%

Proxy-Validated LLM UX Micro-Simulations: An Artifact-First Protocol for Early-Stage Decision Support

代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议

Alexandre Cristovão Maiorano

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。

Comments 27 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10503 2026-08-12 cs.CL 新提交 87%

Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases

每个词元都重要:用于测量大语言模型态度与偏差的精确李克特量表分布

Davood Wadi, Mohsen Ghodrat, Matthew Philp

机构 * McGill University(麦吉尔大学) University Canada West(加拿大西部大学) Toronto Metropolitan University(多伦多都会大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究提出结合人类心理测量学与LLMs机制的精确框架,通过因子实验、词元级PMFs及对应分析方法,分离LLMs的系统性原产国偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10385 2026-08-12 cs.IR cs.AI 新提交 87%

Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

角色设定作为基于大语言模型的信息检索评估的评估者敏感性探测工具

Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie, Gianluca Demartini

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究以角色设定为探测工具,分析基于大语言模型的IR评估中评估者敏感性,发现高容量模型能保持系统排序一致性,角色来源影响小于评估者角色和模型容量。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09946 2026-08-12 cs.HC cs.AI 新提交 87%

HoosierHelp: Benchmarking LLM Agents for Social Service Navigation

HoosierHelp:面向社会服务导航的大语言模型智能体基准测试

Yiyang Li, Weixiang Sun, Tianyi Ma, Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究推出基于印第安纳州3971项公共社会服务资源的交互式基准HoosierHelp,测试发现现有LLM智能体在社会服务导航中对复杂非理想用户交互鲁棒性不足,需更可靠的智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09343 2026-08-11 cs.AI 新提交 87%

LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling

基于模拟轨迹的大语言模型引导式启发式设计:动态生产与自动导引车调度的案例研究

Jinbo Li, Chuanhao Li

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出LLM引导的启发式设计框架,通过模拟轨迹诊断优化AGV与生产调度策略,在多组实验中优于多种基线方法,证实模拟轨迹可指导代码层面的策略改进。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09140 2026-08-11 cs.CR cs.CL 新提交 87%

Beyond Direct Identifiers: Probabilistic Privacy Risk Estimation for Privacy-Conscious LLM Query Delegation

超越直接标识符:面向注重隐私的大语言模型查询委托的概率隐私风险估计

Li Siyan, Zhou Yu, Julia Hirschberg

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对注重隐私的LLM查询委托问题,提出概率变体PCD,结合LLM驱动的k-匿名性估计,创建PUPA-SD数据集,发现PAPILLON在Llama-3.2-3B上实现最佳隐私-效用平衡,k-匿名性是有用辅助指标。

Comments Accepted into HAIPS workshop at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08968 2026-08-11 cs.SE cs.AI 新提交 87%

GALA: Graph-Augmented LLM Agents for Root Cause Analysis and Incident Response in Microservices

GALA:用于微服务根本原因分析和事件响应的图增强大语言模型智能体

Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Yiran Li, Hans-Arno Jacobsen

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对微服务RCA的现有方法存在局限,提出图增强LLM智能体框架GALA+,结合STRIX与SURE-Score,在基准测试中性能优于最佳LLM基线,获SRE专家认可。

Comments Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08621 2026-08-11 cs.AI 新提交 87%

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

商业竞技场:在现实市场中对大语言模型智能体进行基准测试

Yijun Pan, Yukun Lian, Kunyu Shi, Junbo Li, Hongwei Xue, Sicong Xie, Guannan Zhang, Xiaoying Xing

机构 * Alibaba Group(阿里巴巴集团) Yale University(耶鲁大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 研究人员推出Business Arena测试平台,评估15个前沿LLM智能体在跨境商店运营中的表现,发现其平均最终净资产差9倍,最优模型仍逊于人类策略,为商业智能体评估提供了现实测试基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08245 2026-08-11 cs.CR cs.AI cs.HC 新提交 87%

Privacy-Preserving Data Drift Detection and Recovery for Large-Scale LLM Applications via Proxy Representations

基于代理表示的大规模大语言模型应用的隐私保护数据漂移检测与恢复

Michael Levit, Josh Ledgard, Haoyu Dong, Vishwas Suryanarayanan, Eyal Kolman, Sharon Tan, Qiang Gan, Vishal Chowdhary

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对大规模LLM应用的隐私约束导致的评估与漂移追踪难题,提出ProxyDrift框架,基于非PII代理表示实现无敏感数据暴露的漂移监测与合成数据生成,实验验证其对齐度达RA~0.9。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08189 2026-08-11 cs.AI 新提交 87%

Janus: An Algorithm-Evaluator Co-Evolution Framework for LLM-Driven Discovery under Expensive Evaluation Budgets

Janus:面向评估预算昂贵的大语言模型驱动发现的算法-评估器协同进化框架

Ximeng Liu, Qianlong Wang, Yingming Mao, Annan Li, Yatao Li, Shizhen Zhao, Jianmin Wu, Dawei Yin, Dou Shen

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 Janus是一个算法-评估器协同进化框架,它用LLM协同进化目标程序与代理评估器,通过真实结果校准、在线信用更新等策略缓解分布偏移,在五项任务中用更少真实评估实现更优性能,将评估器引导的LLM发现扩展到评估昂贵的科学领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07925 2026-08-11 cs.AI 新提交 87%

ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration

ZhuLong:基于执行的大语言模型智能体,用于结合离线API自探索的EDA脚本编写

Yang Liu, Shiwei Hou, Xiyuan Chen, Yu Wang, Sen Yuan, Qirui Gan, Shao You, Feifan Chen, Wencheng Li, Shuyang Hu, Yongzhou Liu, Emma Xia, Xiaojing Lu, Hao Wang, Fan Xu, Yanfeng Li

机构 * Changxin Memory Technologies, Inc.(长鑫存储技术有限公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 本文提出基于执行的LLM智能体ZhuLong,结合API检索、沙箱执行与离线API自探索机制,在EDA脚本任务基准测试中性能远超纯LLM基线,为EDA脚本编写提供了有效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07614 2026-08-11 cs.SE cs.CL 新提交 87%

DevIntent: How Much Does LLM-Generated Code Violate Developer Intent?

DevIntent:大语言模型生成的代码在多大程度上违反开发者意图?

Susana Haing, Natan Vidra, Spurthi Setty

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对LLM生成代码违反开发者隐式意图的问题,构建含49个问题的基准并提出IVR指标,发现两款主流LLM生成代码虽通过率高但超半数违反意图,揭示现有基准局限性。

Comments 8 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏