If LLM Is the Wizard, Then Code Is the Wand: A Survey on How Code Empowers Large Language Models to Serve as Intelligent Agents
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.AI
Comments 6 pages, 3 figures, IEEE International Conference on Big Data
TraceSafe: 对LLM在多步骤工具调用轨迹上的安全护栏的系统评估
机构 * CyCraft AI Lab, Taiwan(CyCraft AI实验室(台湾)) ; National Taiwan University(国立台湾大学)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract,comments);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出TraceSafe-Bench,首个评估中间轨迹安全的综合基准,发现安全护栏效果更依赖结构数据能力而非语义安全对齐,通用模型在轨迹分析中表现更优,且准确性随执行步骤增加而提升。
Comments Accepted to Conference on Language Modeling (COLM) 2026
少样本提示何时起作用?跨模型规模、架构和输出解析鲁棒性的样本数量效应的系统实证研究
专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究少样本提示中样本数量与模型规模、架构及输出格式合规性对分类性能的影响。通过对五个LLM在六种样本数量配置下研究,发现样本数量与分类性能关系非单调、非普遍且不能仅由模型规模预测,还纠正了影响Llama 3.3 70B性能的解析工件。
Comments 12 pages, 4 figures, 8 tables. Code available at https://github.com/a-dwivedi/few-shot-prompting-study
面向多模态大语言模型的统一幻觉模糊测试
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。
Comments 47 pages, 17 figures
创造力的秘诀:大语言模型中的迭代生成与评估
机构 * Leiden University(莱顿大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 本研究以2024年Pillsbury烘焙大赛食谱生成为任务,探究迭代生成对LLM创造力的影响,发现迭代生成-选择可产出与人类基准相当的食谱,且评估器设计是主观创造性搜索的关键变量。
Comments 7 pages, 3 figures, 1 table. Short paper accepted at ICCC'26
Journal ref Proceedings of the 17th International Conference on Computational Creativity (ICCC'26), Coimbra, Portugal, June 29-July 3, 2026
BenHalluEval:孟加拉语大语言模型的多任务幻觉评估框架
机构 * Department of Computer Science and Engineering, Islamic University of Technology(伊斯兰科技大学计算机科学与工程系) ; Department of Computer Science and Engineering, University of California(加州大学计算机科学与工程系)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)
AI总结 针对孟加拉语大语言模型幻觉评估的空白,提出BenHalluEval框架,涵盖四项任务,构建12000个幻觉候选,并提出双轨校准指标BenHalluScore,揭示模型间幻觉校准的显著差异。
Comments Preprint. Under review
BrainBench:面向全面脑电理解的大语言模型基准测试
机构 * Zhejiang University(浙江大学) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究推出BrainBench基准测试,涵盖4个子集共17个数据集等,评估大语言模型在两种范式下的脑电理解能力,为相关研究提供可复现测试平台。
Comments 42pages,22pages
M-GATE:面向大语言模型的多语言语法、翻译准确性与效率基准
专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);pretraining(abstract)
AI总结 本研究推出多语言基准M-GATE,评估50余种模型的80余种配置,发现翻译与语法能力分离,低资源语言惩罚随模型迭代缩小,推理对翻译提升显著。
Comments 45 pages (97 incl. appendices), 6 figures
2026 AI世界杯:用于端到端足球锦标赛预测的大语言模型基准测试
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文通过AI世界杯基准测试,对10款大语言模型进行2026年FIFA世界杯端到端预测,发现淘汰赛表现决定排名,GPT-5.5 Thinking夺冠,相关成果已公开以支持后续研究。
Comments 18 pages, 8 figures, 7 tables. Project repository available in the paper
ARCHead:大语言模型输出头的激活度量残差修正
机构 * aiXplain, Inc.(aiXplain公司)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 ARCHead是一种LM-head压缩器,通过量化低秩核心、分组INT4残差及激活衍生低秩修正,将LM-head存储降3.7-3.9倍,在Qwen3-8B-Base上性能优于朴素INT4,可补充块量化器。
Comments 13 pages, 4 figures. Submitted to ACL Rolling Review (ARR). Code: https://github.com/suayptalha/archead
大型语言模型综述
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文综述了大型语言模型的发展,探讨了预训练、微调、应用及能力评估等核心方法,并总结了现有资源与未来研究方向。
Comments ongoing work; 144 pages, 1081 citations
Journal ref Frontiers of Computer Science, Volume 20, Issue 12, Article 2012627 (2026)
利用大语言模型和基于树的方法进行项目难度估计
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本研究利用大语言模型和基于树的方法预测K-5数学和阅读评估项目的难度,发现基于特征的方法在预测准确性上优于直接估计方法。
大语言模型能否推导新知识?一种动态生物知识发现基准
机构 * National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出DBench-Bio,一种动态生物知识发现基准,通过三阶段流程评估AI的新知识发现能力,揭示当前模型在知识发现上的局限性。
Comments Accepted by KDD 2026
从单文档到跨文档:大语言模型多粒度事件分析的基准测试
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Tsinghua University(清华大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文推出MiGUE-Bench基准及MiGUE-Pipeline框架,通过四项核心任务评估LLMs多粒度事件分析能力,明确其能力边界与缺陷,为该领域改进提供方向。
Comments 9 pages. Published in the Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)
Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), pp. 3464-3472, 2026
基于BERT的模型与大语言模型在低资源命名实体识别中的比较研究:以马拉地语为例
机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) ; L3Cube Labs(L3Cube实验室)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 研究比较基于BERT的模型与大语言模型在马拉地语低资源命名实体识别中的表现,通过在MahaNER数据集上微调MahaBERT-v2并与基线及通用模型对比,发现特定任务模型效果更佳,凸显专用架构对低资源语言处理的重要性。
为什么大语言模型与人类在评估创造力时会趋同和背离
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究探讨大语言模型与人类评估创造力时趋同和背离的原因,通过三项研究和六个模型,识别其评估标准及影响,发现一致性取决于判断证据和模型标准,强调内在品质时趋同,需上下文信息时背离,选评估模型很关键。
无需云端的智能编码:在纵向数据准备任务中评估开放权重的大语言模型
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究在纵向数据准备任务中评估开放权重的大语言模型,介绍开源框架,含真实数据集、任务定义和评估程序,通过基准测试发现当前先进模型表现良好,为治理受限研究中的AI辅助数据准备提供可行路径。
Comments Presented at SLLS 2026; accepted at CLS 2026 and RSS 2026
大语言模型的可靠概率安全边界
机构 * University of Oxford(牛津大学) ; Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) ; University of Birmingham(伯明翰大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究提出框架计算大语言模型生成有害输出概率的严格边界,利用克洛普 - 皮尔逊置信区间,通过潜在空间特征优先探索有害分支,能高效计算可靠下界,实验验证方法有效性,为模型评估和认证提供新途径。
Comments The Initial version of this manuscript has been available on OpenReview, see https://openreview.net/forum?id=papImkPLf5
语言模型偏见缓解中的“无免费午餐”现象?针对性偏见减少可能加剧未缓解的LLM偏见
机构 * University of Southern California(南加州大学)
专题命中 评测与基准 :LLM(title,title_cn);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了语言模型偏见缓解的跨类别影响,发现针对性缓解可能加剧其他方面的偏见,强调了多维评估的重要性。
Journal ref AI, 7(1), 24, 2026
定义和评估大语言模型的物理安全性
机构 * The Chinese University of Hong Kong(香港中文大学) ; IBM Research(IBM研究院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出了一种无人机控制的全面基准,评估大语言模型在物理安全方面的风险与权衡,揭示了模型在安全性和实用性之间的不理想平衡。
Journal ref Communications of the ACM, 2026
InvestPhilBench: 评估大型语言模型在专家投资哲学中程序性推理的多层动态基准
机构 * University of California, Riverside (UCR)(加州大学河滨分校) ; Illinois Institute of Technology (IIT)(伊利诺伊理工学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI、cs.LG
AI总结 提出InvestPhilBench基准,通过八层认知层级和自动化评分管道,揭示前沿LLM在投资决策程序推理中的复合评分饱和但程序性缺陷隐藏的问题。
Comments 65 pages, 6 figures, 26 tables. Benchmark, data, and code released. v0.6 release; preliminary empirical study (de-confounded multi-model leaderboard forthcoming)
大型语言模型(LLMs)和生成式人工智能在网络安全与隐私中的应用:两用风险、人工智能生成的恶意软件、可解释性及防御策略综述
机构 * Virelya Intelligence Research Labs(Virelya智能研究实验室) ; Google(谷歌)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 综述大型语言模型和生成式人工智能在网络安全中的应用,涵盖两用风险等多方面。通过回顾众多资料及实际案例研究,给出负责任部署建议与安全路线图,为应对人工智能驱动的网络安全挑战提供关键参考。
Comments Invited survey paper. 10 pages, 5 figures, 2 tables
Journal ref IEEE 6th Silicon Valley Cybersecurity Conference (SVCC), San Francisco, CA, USA, 2025, pp. 1-10
野外数据分析:针对现实世界数据复杂性对大语言模型进行基准测试
机构 * Fujitsu Research of America(富士通美国研究院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 针对大语言模型在数据分析基准测试无法反映现实情况的问题,引入DataGovBench基准测试,含表格问答和表格洞察两个任务,通过实验发现现有模型有性能差距,为推进相关研究提供挑战基准。
Comments 29 pages, 9 figures
大语言模型的频谱特征
机构 * Rice University(莱斯大学) ; Dartmouth College(达特茅斯学院) ; Georgia Institute of Technology(佐治亚理工学院) ; University of California, Berkeley(加州大学伯克利分校) ; Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
AI总结 针对大规模管理和量化大语言模型的挑战,采用基于重尾自正则化理论的频谱形状指标,以权重经验谱密度形状信息为模型频谱特征,可用于模型谱系追踪等,还构建语料库进行基准测试。
SHIELD: 一个多样化的临床笔记数据集和蒸馏小语言模型,用于企业级去标识化
机构 * Stanford Medicine(斯坦福医学院)
专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract_cn);large language model(abstract)
AI总结 针对现有临床去标识化基准数据集的不足,构建了包含1381份笔记、10229个PHI标注的多样化数据集SHIELD,并通过教师-学生蒸馏框架将大语言模型能力迁移至可本地部署的小模型,在标准工作站上达到0.89精确率和0.88召回率。
使用大语言模型探测风格挪用:欧盟法律下版权侵权的评估框架
机构 * Maastricht University(马斯特里赫特大学) ; Contractuo
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出PSALM框架,通过十个评估器将欧盟版权法标准操作化,发现指令调优模型在接触语料前已有非平凡风格相似性,微调导致系统性风格挪用,负偏好优化可降低但残留可检测风格模式。
Know2Guess: 一种面向大型语言模型知识边界评估的污染感知多区域基准
机构 * Anhui University(安徽大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出一种污染感知多区域基准,通过冻结构建时标签测量从可回答知识到应弃权未知的转变,评估模型在回答与弃权间的可靠性。
Comments 16 pages, 3 figures
论大语言模型评估中提示排序的稳定性
机构 * University of Amsterdam(阿姆斯特丹大学) ; Northeastern University(东北大学) ; University of California San Diego(加州大学圣迭戈分校) ; Duke University(杜克大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究提示排序在常见评估变化下的稳定性,发现顶级提示常变导致选择不可靠,提出基于置信下限的稳定性感知选择策略以提高鲁棒性。
探究语言引导:跨大语言模型架构的形容词效应分析
机构 * Research and Implementation(研究与实现)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)
AI总结 本研究利用Shapley值量化形容词对模型性能的引导效应,发现少量形容词具有不成比例的强大影响,但效果非普适;跨模型分析揭示“家族效应”,且形容词的引导方向高度依赖于句法角色和位置。
Comments Accepted for TMLR, https://openreview.net/forum?id=xN7NYpQeBm