arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2307.13204 2023-09-21 cs.RO 89%

GraspGPT: Leveraging Semantic Knowledge from a Large Language Model for Task-Oriented Grasping

Chao Tang, Dehao Huang, Wenqi Ge, Weiyu Liu, Hong Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01191 2023-08-08 cs.SE 89%

Towards Understanding the Capability of Large Language Models on Code Clone Detection: A Survey

Shihan Dou, Junjie Shan, Haoxiang Jia, Wenhao Deng, Zhiheng Xi, Wei He, Yueming Wu, Tao Gui, Yang Liu, Xuanjing Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00675 2023-08-02 cs.CL cs.AI cs.CV cs.LG 89%

Tool Documentation Enables Zero-Shot Tool-Usage with Large Language Models

Cheng-Yu Hsieh, Si-An Chen, Chun-Liang Li, Yasuhisa Fujii, Alexander Ratner, Chen-Yu Lee, Ranjay Krishna, Tomas Pfister

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12701 2023-07-25 cs.DB 89%

Leveraging Large Language Models (LLMs) for Process Mining (Technical Report)

Alessandro Berti, Mahnaz Sadat Qafari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12907 2023-05-23 cs.CL cs.AI cs.LG 89%

Meta-in-context learning in large language models

Julian Coda-Forno, Marcel Binz, Zeynep Akata, Matthew Botvinick, Jane X. Wang, Eric Schulz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10846 2023-05-09 cs.CV cs.MM 89%

From Images to Textual Prompts: Zero-shot VQA with Frozen Large Language Models

Jiaxian Guo, Junnan Li, Dongxu Li, Anthony Meng Huat Tiong, Boyang Li, Dacheng Tao, Steven C. H. Hoi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments CVPR 2023 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06638 2023-04-14 cs.CL cs.AI cs.CY cs.LG 89%

How Useful are Educational Questions Generated by Large Language Models?

Sabina Elkins, Ekaterina Kochmar, Jackie C. K. Cheung, Iulian Serban

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to AIED Late Breaking Results 2023 - to be published in their proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17071 2023-03-31 cs.CL cs.AI cs.LG 89%

DERA: Enhancing Large Language Model Completions with Dialog-Enabled Resolving Agents

Varun Nair, Elliot Schumacher, Geoffrey Tso, Anitha Kannan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07080 2023-02-15 cs.HC 89%

The Programmer's Assistant: Conversational Interaction with a Large Language Model for Software Development

Steven I. Ross, Fernando Martinez, Stephanie Houde, Michael Muller, Justin D. Weisz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 43 pages, 3 figures. To be published in IUI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02291 2022-12-06 cs.CV 89%

I2MVFormer: Large Language Model Generated Multi-View Document Supervision for Zero-Shot Image Classification

Muhammad Ferjad Naeem, Muhammad Gul Zain Ali Khan, Yongqin Xian, Muhammad Zeshan Afzal, Didier Stricker, Luc Van Gool, Federico Tombari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01195 2024-11-05 cs.CL cs.LG 89%

Transfer Learning for Finetuning Large Language Models

Tobias Strangmann, Lennart Purucker, Jörg K. H. Franke, Ivo Rapant, Fabio Ferreira, Frank Hutter

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG;foundation model(comments)

Comments Accepted at NeurIPS 2024 Workshop on Adaptive Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19951 2024-10-04 cs.AI cs.CL cs.CV 89%

Law of the Weakest Link: Cross Capabilities of Large Language Models

Ming Zhong, Aston Zhang, Xuewei Wang, Rui Hou, Wenhan Xiong, Chenguang Zhu, Zhengxing Chen, Liang Tan, Chloe Bi, Mike Lewis, Sravya Popuri, Sharan Narang, Melanie Kambadur, Dhruv Mahajan, Sergey Edunov, Jiawei Han, Laurens van der Maaten

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)

Comments Data, Code, & Benchmark: www.llm-cross-capabilities.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18786 2024-09-30 cs.CL cs.AI 89%

A Survey on the Honesty of Large Language Models

Siheng Li, Cheng Yang, Taiqiang Wu, Chufan Shi, Yuji Zhang, Xinyu Zhu, Zesen Cheng, Deng Cai, Mo Yu, Lemao Liu, Jie Zhou, Yujiu Yang, Ngai Wong, Xixin Wu, Wai Lam

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)

Comments Project Page: https://github.com/SihengLi99/LLM-Honesty-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11760 2023-11-14 cs.CL cs.AI cs.HC 89%

Large Language Models Understand and Can be Enhanced by Emotional Stimuli

Cheng Li, Jindong Wang, Yixuan Zhang, Kaijie Zhu, Wenxin Hou, Jianxun Lian, Fang Luo, Qiang Yang, Xing Xie

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)

Comments Technical report; updated the std error for human study; short version (v1) was accepted by LLM@IJCAI'23; 32 pages; more work: https://llm-enhance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01448 2023-10-20 cs.CL cs.AI 89%

Meta Semantic Template for Evaluation of Large Language Models

Yachuan Liu, Liang Chen, Jindong Wang, Qiaozhu Mei, Xing Xie

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)

Comments Work in progress; 7 pages; more work at: https://llm-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01793 2026-08-17 cs.CL 版本更新 89%

Research-Oriented Human-Centric Evaluation for Foundation Models

面向研究的基础模型以人为中心的评估

Yijin Guo, Kaiyuan Ji, Xiaorong Zhu, Junying Wang, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(title,abstract);分类 cs.CL

AI总结 针对现有基础模型评估忽视用户主观体验的问题,提出Human-Centric Evaluation框架,通过604次人类评估会话及LLM-as-a-judge实验,证实人类主观评估不可替代,为基础模型研究提供新评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11584 2026-08-13 cs.AI 新提交 89%

EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval

EnterpriseRAG:非理想企业检索场景下LLM指令遵循与鲁棒性的基准测试

Huiqi Miao, Xinbao Sun, Bo Wang, Fanyu Meng, Lijun Mei, Na Wu, Di Jin, Chao Deng, Junlan Feng

机构 * Jiutian Research, China Mobile(中国移动九天研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究针对企业RAG部署的可靠性问题,推出含983个样本的EnterpriseRAG基准,评估13个LLM发现其指令遵循崩溃,为生产级RAG提供可复现的评估基础

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08801 2026-08-11 cs.CL cs.AR cs.ET 新提交 89%

IDRAAK: From Multi-Agent NLP to Few-Shot Prompting for Semantic Drift Detection in Technical Requirements

IDRAAK:从多智能体自然语言处理到用于技术需求语义漂移检测的少样本提示

Shiva Ahir

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);分类 cs.CL

AI总结 IDRAAK是基于语义需求表示的可解释框架,通过含6个少样本示例的LLM单次调用检测技术需求语义漂移,性能优于多种替代方案,证明少样本提示是高效替代方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05199 2026-08-07 cs.CR cs.AI 新提交 89%

Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents

基于模块化大语言模型(LLM)的安全智能体的事后轨迹风险验证

Zhenpeng Li

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文针对模块化LLM安全智能体的轨迹风险验证问题,提出生成树替代方案,在两阶段入侵检测实验中实现92.7%±2.4%的平均轨迹覆盖率,量化了联合访问缺失的成本。

Comments 18 pages, 11 tables; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00718 2026-08-04 cs.CR cs.AI cs.MA 新提交 89%

Adversarial Attacks in Multi-Agent LLM Pipelines: Unveiling Structural Vulnerabilities in Agentic AI Architectures

多智能体大语言模型流水线中的对抗攻击:揭示智能体AI架构的结构性漏洞

Faisal Haque Bappy, Tahrim Hossain, Tarannum Shaila Zaman, Raiful Hasan, Kamrul Hasan, Tariqul Islam

专题命中 评测与基准 :LLM(title,summary_cn);language model(abstract);分类 cs.AI

AI总结 该研究针对多智能体LLM流水线的结构性漏洞,通过在GPT-5-mini等模型上的实验,发现对抗性漏洞源于架构而非模型能力,推动流水线级防御的发展。

Comments This paper has been accepted at the 2026 IEEE Global Communications Conference (GLOBECOM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00817 2026-08-04 cs.CL 版本更新 89%

When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models

当LLM停止遵循步骤:语言模型中程序执行的诊断研究

Sailesh Panda, Pritam Kadasi, Abhishek Upperwal, Mayank Singh

机构 * Indian Institute of Technology Gandhinagar(印度理工学院冈丁加尔)

专题命中 评测与基准 :language model(title,abstract);LLM(title_cn,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本研究通过构建受控诊断基准,评估大型语言模型在程序执行任务中的忠实性,发现随着步骤增加准确率从63%降至20%,并揭示了缺失答案、过早答案、自我修正和执行不完整等失败模式。

Comments 24 pages, 19 figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28307 2026-07-31 cs.SE cs.AI 新提交 89%

From Textual Requirements to Microservice Architectures - A Comprehensive Evaluation of LLM-Based Design Synthesis

从文本需求到微服务架构 —— 基于大语言模型的设计合成综合评估

Danyllo Albuquerque, José Renan, Guillermo Rodríguez, Guillermo Rodríguez, Emanuel Dantas, Ademar França, Mirko Perkusich, Kyller Gorgônio, Angelo Perkusich

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨OpenAI o3能否仅从文本需求生成微服务架构,经实验发现少样本提示下其服务识别与通信恢复的一致性优于零样本,为需求驱动的架构合成提供了潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05775 2026-07-29 cs.CL cs.CY 版本更新 89%

Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM

守护者与违规者:大语言模型有害内容生成与安全缓解研究综述

Chi Zhang, Changjia Zhu, Junjie Xiong, Xiaoran Xu, Lingyao Li, Yao Liu, Zhuo Lu

机构 * University of South Florida(佛罗里达州立大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 评测与基准 :LLM(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 综述大语言模型在内容创作中带来的风险与挑战,系统回顾相关研究,提出危害与防御统一分类法,分析越狱策略,评估缓解措施,指出评估局限,明确未来研究方向以推动语言技术稳健且符合伦理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06742 2026-07-20 cs.SE cs.AI 版本更新 89%

Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios

评估基于LLM的从零开始软件生成在端到端CLI工具场景中的表现

Ruida Hu, Xinchen Wang, Chao Peng, Cuiyun Gao, David Lo

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Independent Researcher, China(独立研究者,中国) Singapore Management University, Singapore(新加坡管理大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CLI-Tool-Bench基准,用于评估从零生成CLI工具的能力,发现顶级模型成功率低于43%,指出生成代码倾向单体化。

Comments Data link: https://github.com/kinesiatricssxilm14/CLI-Tool-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08877 2026-07-17 cs.AI 89%

Quantifying the Accuracy and Cost Impact of Design Decisions in Budget-Constrained Agentic LLM Search

量化预算约束下代理LLM搜索中的准确性与成本影响

Kyle McCleary, James Ghawaly

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究探讨了预算约束下代理LLM搜索中搜索深度、检索策略和完成预算对准确性和成本的影响,并提供了可重复的评估方法和实验结果。

Comments Accepted in 2026 Language Resources and Evaluation Conference (LREC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08878 2026-07-14 cs.CL cs.MA 版本更新 89%

PerspectiveGap: A Benchmark for Multi-Agent Orchestration Prompting

PerspectiveGap: 多智能体编排提示的基准测试

Youran Sun, Xingyu Ren, Kejia Zhang, Xinpeng Liu, Jiaxuan Guo

机构 * University of Maryland(马里兰大学) The Chinese University of Hong Kong(香港中文大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);分类 cs.CL

AI总结 提出PerspectiveGap基准,评估LLM为多智能体系统编写编排提示的能力,实验显示模型平均通过率仅14.9%,表明该能力独特且未被充分评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03595 2026-07-13 cs.CL 版本更新 89%

Decoupling Task-Solving and Output Formatting in LLM Generation

在大语言模型生成中解耦任务解决与输出格式

Haikang Deng, Po-Nien Kung, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型任务指令与格式要求交织致性能下降的问题,提出解耦框架Deco-G,将格式遵循委托给单独模块,引入指令感知蒸馏等三项创新,实验证明其优于基线方法,能保证格式符合。

Comments Update to the latest ACL published version and add a link to the released code

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, 2026, pp. 16764-16781

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08117 2026-07-10 cs.CL 新提交 89%

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

COALA:通过对比正则化器和偏差分数估计实现用于ASR的鲁棒上下文语音增强语言建模

Jhih-Rong Guo, Bi-Cheng Yan, Tien-Hong Lo, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究旨在增强复杂多实体场景中的语音增强语言模型,提出COALA框架,通过将SLM潜在表示映射到判别空间量化匹配强度,并解决训练崩溃问题,在LibriSpeech基准上实现了卓越的上下文偏差性能。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01293 2026-07-03 cs.CL 新提交 89%

RuleChef: Grounding LLM Task Knowledge in Human-Editable Rules

RuleChef:将LLM任务知识扎根于可人工编辑的规则

Ádám Kovács, Nadia Verdha, Gábor Recski

机构 * KR Labs(KR实验室) TU Wien(维也纳工业大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出RuleChef框架,利用大语言模型为NLP任务生成可执行规则,并通过示例和人工反馈迭代优化,最终得到快速、确定且可检查的规则系统。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31630 2026-07-01 cs.LG 新提交 89%

Calibration, Not Compilation: Detecting and Repairing Misspecified Probabilistic Programs Written by Language Models

校准,而非编译:检测和修复语言模型编写的错误指定概率程序

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS RIKEN AIP South China University of Technology(南方科技大学) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出用贝叶斯工作流(后验预测检查、模拟校准等)作为验证器,检测和修复LLM编写的概率程序中的统计错误,在检测(AUC 0.97)和修复(显著优于单元测试反馈)上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏