arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2606.12764 2026-06-12 cs.LG cs.CL cs.CR 新提交 88%

Detecting Functional Memorization in Code Language Models

检测代码语言模型中的功能记忆

Matthieu Meeus, Anil Ramakrishna, Matthew Grange, Zheng Xu, Luca Melis

机构 * Meta Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究代码语言模型的功能记忆现象,通过反事实设置对比暴露目标代码的模型与未暴露的参考模型,使用文本和功能相似性度量,发现功能记忆超出文本重叠的检测范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08036 2026-06-09 cs.IR cs.AI cs.CL 新提交 88%

GIScholarBench: Benchmarking LLM Overconfidence in GIS Research

GIScholarBench: 在GIS研究中评估大语言模型的过度自信

Zongrng Li, Mingzheng Yang, Lei Zou, Hongxu Ma, Hao Tian, Siqi Zhou, Wenjing Gong, Kaili Zhang, Bingqian Chen, Mitch Zhang, Yifan Yang

机构 * Texas A&M University(德克萨斯理工大学) Google(谷歌) Department of Geography(地理系) Department of Landscape Architecture and Urban Planning(景观建筑与城市规划系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在学术研究中的过度自信问题,构建了包含10865篇论文的GIScholarBench基准,通过元数据检索、文献链接和研究方向生成三项任务评估模型表现,发现所有模型均存在任务不变的过度自信现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17577 2026-06-17 cs.AI 新提交 88%

Surrogate Assisted Pedestrian Protection Design via a Foundation Model Orchestrated Workflow

基于基础模型编排工作流的代理辅助行人保护设计

Osamu Ito, Akihiko Katagiri, Yoshikazu Nakagawa, Shin Saeki, Jun Shiraishi, Masato Sasaki

机构 * Honda Motor Co., Ltd.(本田汽车有限公司)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出首个基础模型编排的碰撞安全设计工作流,集成代理模型、多目标进化搜索、几何生成器和自然语言接口,将行人保护评估时间从数小时降至秒级。

Journal ref ICLR 2026 Workshop The 2nd Workshop on Foundation Models for Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11149 2026-08-12 cs.CV 新提交 88%

PRMU: A Corpus-Free Benchmark for Person-Centric Knowledge Unlearning in Multimodal Large Language Models

PRMU:面向多模态大语言模型中以人为中心的知识遗忘的无语料基准

Huafeng Chen, Yueming Lyu, Ziyuan Chen, Wenda Tan, Chenyang Si, Liucheng Guo, Caifeng Shan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对现有多模态大语言模型(MLLMs)遗忘方法依赖语料的局限,提出无语料基准PRMU及基线SGPE,实验显示SGPE在目标遗忘、局部性保留等方面权衡更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06769 2026-08-10 cs.CV 新提交 88%

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

GraphVerse:面向多模态大语言模型的综合性视觉图推理基准

Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

机构 * New York University(纽约大学) Sensetime Research(商汤科技研究院) Tsinghua University(清华大学) New York University Shanghai(上海纽约大学) University of Georgia(佐治亚大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05561 2026-08-07 cs.SE 新提交 88%

Exploring Dependence, Overreliance, and Addiction Related Behaviors Associated with Large Language Model Use Among Software Engineers

探索软件工程师使用大语言模型(LLMs)相关的依赖、过度依赖及成瘾相关行为

Ronnie de Souza Santos, Italo Santos, Matheus de Moraes Leça, Cleyton Magalhaes, Mairieli Wessel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究通过对119名软件从业者的调查,分析了工程师使用LLMs时的依赖、过度依赖及成瘾相关行为,发现LLMs已成为软件工程的习惯性工具,多数使用具功能性,需促进适当依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00357 2026-08-04 cs.HC 新提交 88%

Dynamic Surveys: Using LLMs to Blend Qualitative Depth,Quantitative Structure, and Collaborative Interaction

动态调查:利用大语言模型(LLM)融合质性深度、定量结构与协作互动

Kehua Lei, Aidan Ladenburg, Zahra Petiwala, Zili Wang, Dishita Jhawar, Ipsita Bisht, Ansh Kumar, David T. Lee

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出动态调查平台,利用LLM实时聚类质性回答并引出定量内容,经93名参与者的两项实地研究验证,其能提供更丰富见解并提升参与度。

Comments 27 pages, 6 figures

Journal ref Proc. ACM Hum.-Comput. Interact., Vol. 9, No. CSCW, Article 405 (November 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29085 2026-08-03 cs.CY 新提交 88%

IyawoBench v2.0: Extended Diagnostic Evaluation of Large Language Model Clinical Triage in Nigerian Primary Care

IyawoBench v2.0:尼日利亚基层医疗中大型语言模型临床分诊的扩展诊断评估

Anthonio Oladimeji Gabriel, Dimeji Olawuyi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 IyawoBench v2.0评估尼日利亚基层医疗的大型语言模型临床分诊,提出含三类失效模式的框架及新指标,发现前沿模型存缺陷,最优模型随部署场景变化,为中低收入国家临床AI选择提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19910 2026-07-23 cs.CV cs.HC 新提交 88%

MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

MV-Bench:用于协同多视图界面构建的多模态大语言模型基准测试

Yue Zhao, Hongxu Liu, Feiyu Wang, Xiaoyu Yang, Tong Ge, Zhen Yang, Chao Wang, Qiong Zeng

机构 * Shandong Second Medical University(山东第二医科大学) Shandong University(山东大学) Bairong Inc.(百融云创科技股份有限公司) Ke Holdings Inc.(贝壳控股有限公司) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Shandong Provincial Key Laboratory of Computing-Network Integration, Shandong University(山东大学计算网络融合技术山东省重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究针对多模态大语言模型在协同多视图界面构建评估不足的问题,引入MV-Bench基准,通过多阶段管道转换规范为界面,评估五个模型,发现当前MLLMs虽能再现视觉外观,但在数据语义和交互逻辑生成上有限,迭代改进效果不佳。

Comments Submitted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16648 2026-07-21 cs.CR cs.IT math.IT 新提交 88%

Synchronization-Free Algebraic Fingerprints for Large Language Models: From Autoregressive to Diffusion Models

大语言模型的无同步代数指纹:从自回归模型到扩散模型

Jaroslaw Janas, Josef Pieprzyk, Pawel Morawiecki

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对大语言模型水印需求,提出无同步水印方案,由相邻令牌生成二元同余作水印,从代数角度分析恢复问题,讨论解码算法,该方法能抗多种操作,避免同步问题,为嵌入不同长度秘密身份提供灵活框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13934 2026-07-16 cs.MA 新提交 88%

Pezego-HITL: A policy-grounded large language model architecture for agricultural extension in Ghana

Pezego-HITL:一种用于加纳农业推广的基于政策的大语言模型架构

Shunbao Li, Zhipeng Yuan, Amoako Ofori, Benedicta Y. Fosu-Mensah, Yang Li, Manu Kenchappa Junjanna, Qing Xue, Po Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究针对加纳农业推广中大语言模型应用问题,提出基于政策的结构化检索增强生成与验证内存路由方法,通过P-EVAL框架评估,提升了模型政策对齐率、农艺利用率,降低延迟,还验证了通用性,为小农户农业提供可扩展模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06012 2026-07-08 cs.CV 新提交 88%

Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models

使用聚类、分类和大语言模型从房地产文档中提取结构化数据

Muhammad Assad Shehbaz, Carlos Francisco Moreno-García

机构 * Robert Gordon University(罗伯特·戈登大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究如何从房地产问卷文档中提取结构化数据,提出端到端管道,先分类文档,再用大语言模型提取属性,应用于3965份文档,成功处理2781份,得到2766条记录,验证了数据质量,证明该提取方法可行可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02325 2026-07-03 cs.HC 新提交 88%

Personality Without Persons? A Psychometric Critique of Big Five Testing in Large Language Models

无人格的人格?大语言模型中大五人格测试的心理测量学批判

Kim Zierahn, Cristina Cachero, Anna Korhonen, Nuria Oliver

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 通过心理测量学评估大语言模型的大五人格测试,发现其不适用于LLMs,无法捕捉模型间差异且因子结构失效,建议开发针对LLMs的评估框架。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31187 2026-07-01 cs.CV 新提交 88%

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25747 2026-07-01 cs.SE 新提交 88%

CodeChat-Eval: Evaluating Large Language Models in Multi-Turn Code Refinement Dialogues

CodeChat-Eval:在多轮代码优化对话中评估大型语言模型

Guoxiang Guo, Kla Tantithamthavorn, Neelofar Neelofar, Yuanyuan Qi, Aldeida Aleti

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出CodeChat-Eval框架,通过动态指令选择算法构建多轮代码优化对话评估会话,发现LLMs在多轮优化中功能正确性显著下降(19.2%-69.2%),逻辑级优化和新增请求导致最大下降。

Comments Accepted by ICSME26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26927 2026-06-26 cs.SE 新提交 88%

Are LLMs Ready for Anti-Pattern Detection in Microservice Architectures?

LLM 是否准备好检测微服务架构中的反模式?

Marco De Luca, Domenico Amalfitano, Porfirio Tramontana, Anna Rita Fasolino

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文研究大型语言模型(LLM)通过提示分析微服务仓库静态制品来检测16种架构反模式的能力,与静态分析工具MARS对比,发现LLM在局部、异构或语义丰富的反模式上表现有竞争力,但在需要结构或跨服务依赖证据时受限,可作为补充工具。

Comments accepted at ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25193 2026-06-25 cs.SE 新提交 88%

LLM4MTLs: Automated Generation and Empirical Evaluation of Model Transformation Languages

LLM4MTLs:模型转换语言的自动生成与实证评估

Bowen Jiang, Nathan Hagel, Haowei Cheng, Benedikt Jutz, Arne Lange, Weixing Zhang, Rahul Sharma, Ralf Reussner, Anne Koziolek

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出LLM4MTLs工作流,通过少样本提示、语法提示和辅助方法组合,自动生成并评估LLM编写的模型转换代码,发现少样本提示能提升语法质量但语义改进有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24166 2026-06-24 cs.NE 新提交 88%

Distributed Quality-Diversity Search for Toxicity in Large Language Models

大型语言模型中毒性检测的分布式质量-多样性搜索

Onkar Shelar, Travis Desell

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出ToxSearch-S方法,通过增量式物种形成和MPI并行化,在有限预算下实现与基线相当的峰值毒性,同时降低累积搜索压力,并利用分布式计算显著加速搜索。

Comments 40 pages, 10 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23704 2026-06-24 cs.AR 新提交 88%

PCB-QA: Evaluating LLMs over the First Printed Circuit Board Design Question-Answer Dataset

PCB-QA:首个印刷电路板设计问答数据集评估大语言模型

Sahana Srinivasan, Benjamin Tan, Benjamin Turnbull, Hammond Pearce

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对大语言模型在PCB设计应用中缺乏文本数据集和评估方法的问题,提出PCB-QA数据集(480个问答对),通过不同文件格式提示LLM,发现基于JSON的文本格式使Gemini 3 Flash Preview达到93%准确率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17094 2026-06-17 cs.SE 新提交 88%

LogCopilot: Automating Log Aggregation Analysis through Large Language Models

LogCopilot: 通过大型语言模型自动化日志聚合分析

Senyu Xie, Chenxi Zhang, Tong Zhou, Jiacheng Liu, Xiaoyu Hong, Qingshan Li, Xin Peng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出LogCopilot框架,利用大型语言模型,通过自然语言指令、知识检索和工具调用自动生成LogQL查询,实现日志聚合分析,平均准确率76.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14607 2026-06-15 cs.SE cs.DC 新提交 88%

Empowering Student Debugging in Parallel Programming with Execution Traces and Large Language Models

利用执行轨迹和大语言模型增强学生在并行编程中的调试能力

God'salvation F. Oguibe, Vinodh Kumaran Jayakumar, Tongping Liu, Andrew Lan, Wei Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出ParaView工具,通过执行记录与可视化帮助学生调试并发程序,结合大语言模型分析错误,实验表明调试成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13835 2026-08-17 cs.CL 新提交 87%

When Lexical Change Misleads: Rethinking Dynamic Topic Model Evaluation with Traditional and LLM-Based Metrics

当词汇变化产生误导时:结合传统指标与基于大语言模型的指标重新思考动态主题模型评估

Charu Karakkaparambil James

机构 * RPTU University Kaiserslautern-Landau(莱茵兰-普法尔茨州立大学凯撒斯劳滕-兰道分校)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对动态主题模型评估中词汇变化误导的问题,对比传统指标与基于LLM的语义相似性指标,发现后者在CoNTM上与人工判断一致性更高,提出应结合两类指标开展感知词汇变化的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13563 2026-08-17 cs.HC cs.AI cs.SE 新提交 87%

Proxy-Validated LLM UX Micro-Simulations: An Artifact-First Protocol for Early-Stage Decision Support

代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议

Alexandre Cristovão Maiorano

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。

Comments 27 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10503 2026-08-12 cs.CL 新提交 87%

Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases

每个词元都重要:用于测量大语言模型态度与偏差的精确李克特量表分布

Davood Wadi, Mohsen Ghodrat, Matthew Philp

机构 * McGill University(麦吉尔大学) University Canada West(加拿大西部大学) Toronto Metropolitan University(多伦多都会大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究提出结合人类心理测量学与LLMs机制的精确框架,通过因子实验、词元级PMFs及对应分析方法,分离LLMs的系统性原产国偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10385 2026-08-12 cs.IR cs.AI 新提交 87%

Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

角色设定作为基于大语言模型的信息检索评估的评估者敏感性探测工具

Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie, Gianluca Demartini

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究以角色设定为探测工具,分析基于大语言模型的IR评估中评估者敏感性,发现高容量模型能保持系统排序一致性,角色来源影响小于评估者角色和模型容量。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09946 2026-08-12 cs.HC cs.AI 新提交 87%

HoosierHelp: Benchmarking LLM Agents for Social Service Navigation

HoosierHelp:面向社会服务导航的大语言模型智能体基准测试

Yiyang Li, Weixiang Sun, Tianyi Ma, Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究推出基于印第安纳州3971项公共社会服务资源的交互式基准HoosierHelp,测试发现现有LLM智能体在社会服务导航中对复杂非理想用户交互鲁棒性不足,需更可靠的智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09343 2026-08-11 cs.AI 新提交 87%

LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling

基于模拟轨迹的大语言模型引导式启发式设计:动态生产与自动导引车调度的案例研究

Jinbo Li, Chuanhao Li

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出LLM引导的启发式设计框架,通过模拟轨迹诊断优化AGV与生产调度策略,在多组实验中优于多种基线方法,证实模拟轨迹可指导代码层面的策略改进。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09140 2026-08-11 cs.CR cs.CL 新提交 87%

Beyond Direct Identifiers: Probabilistic Privacy Risk Estimation for Privacy-Conscious LLM Query Delegation

超越直接标识符:面向注重隐私的大语言模型查询委托的概率隐私风险估计

Li Siyan, Zhou Yu, Julia Hirschberg

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对注重隐私的LLM查询委托问题,提出概率变体PCD,结合LLM驱动的k-匿名性估计,创建PUPA-SD数据集,发现PAPILLON在Llama-3.2-3B上实现最佳隐私-效用平衡,k-匿名性是有用辅助指标。

Comments Accepted into HAIPS workshop at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08968 2026-08-11 cs.SE cs.AI 新提交 87%

GALA: Graph-Augmented LLM Agents for Root Cause Analysis and Incident Response in Microservices

GALA:用于微服务根本原因分析和事件响应的图增强大语言模型智能体

Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Yiran Li, Hans-Arno Jacobsen

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对微服务RCA的现有方法存在局限,提出图增强LLM智能体框架GALA+,结合STRIX与SURE-Score,在基准测试中性能优于最佳LLM基线,获SRE专家认可。

Comments Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08621 2026-08-11 cs.AI 新提交 87%

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

商业竞技场:在现实市场中对大语言模型智能体进行基准测试

Yijun Pan, Yukun Lian, Kunyu Shi, Junbo Li, Hongwei Xue, Sicong Xie, Guannan Zhang, Xiaoying Xing

机构 * Alibaba Group(阿里巴巴集团) Yale University(耶鲁大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 研究人员推出Business Arena测试平台,评估15个前沿LLM智能体在跨境商店运营中的表现,发现其平均最终净资产差9倍,最优模型仍逊于人类策略,为商业智能体评估提供了现实测试基准。

详情

展开后加载摘要…

URL PDF HTML 收藏