arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31748 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31748 篇

2606.26130 2026-06-26 cs.CL cs.AI cs.DL 新提交 92%

Thinking Like a Scientist? A Structural Study of LLM-Generated Research Methods

像科学家一样思考?LLM生成研究方法的结构性研究

Francesca Carlon, Brecht Verbeken, Vincent Ginis, Andres Algaba

机构 * Data Analytics Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学数据分析实验室) imec-SMIT, Vrije Universiteit Brussel(布鲁塞尔自由大学imec-SMIT) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过对比LLM在最小提示下生成的方法建议与论文实际方法,发现LLM在模型选择上存在显著偏差,且方法多样性大幅缩减。

Comments 46 pages, 13 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25782 2026-06-25 cs.CL cs.AI 新提交 92%

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation

编码器足够吗?用于LLM对抗性评估的编码器与解码器安全评判器的系统比较

Han Jeon, Shiv Medler, Joseph Voyles, Matt Wood

机构 * PricewaterhouseCoopers(普华永道)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 系统比较ModernBERT系列编码器分类器与基于LLM的解码器评判器在识别有害LLM输出上的性能,发现编码器可在保持低延迟和低成本的同时接近LLM评判器的效果。

Comments 13 pages, 5 figures, Accepted into ICANN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08247 2026-06-09 eess.AS cs.AI cs.LG eess.SP 新提交 92%

AeroSpectra Sentinel: An Auditable LLM Prompt-Chaining Decision-Support Workflow for Acute Asthma Risk Assessment from Respiratory Sounds and Clinical Signals

AeroSpectra Sentinel:一种用于从呼吸音和临床信号进行急性哮喘风险评估的可审计LLM提示链决策支持工作流

Aueaphum Aueawatthanaphisut

机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology, Thammasat University(泰国朱拉隆梭国际技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出AeroSpectra Sentinel,结合STFT呼吸音分析、轻量ML筛查、临床特征融合和五阶段LLM提示链,实现可审计的急性哮喘风险评估,在公开数据集上验证了音频筛查和LLM工作流的有效性。

Comments 10 pages, 8 figures, 5 tables, 14 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05942 2026-05-21 cs.CL cs.AI 92%

EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models

EvalMORAAL: 可解释的链式推理与大语言模型道德对齐的LLM-as-Judge评估

Hadi Mohammadi, Anastasia Giachanou, Robert A. Bagheri

机构 * Department of Methodology and Statistics, Utrecht University(方法论与统计学系,乌得勒支大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出EvalMORAAL框架,通过两种评分方法和模型作为裁判的同行评审,评估20个大语言模型的道德对齐情况,发现西方与非西方地区存在显著的道德对齐差距。

Comments Accepted as a poster at *SEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12644 2025-07-22 cs.CL cs.AI 92%

Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles

Devichand Budagam, Ashutosh Kumar, Mahsa Khoshnoodi, Sankalp KJ, Vinija Jain, Aman Chadha

机构 * Indian Institute of Technology Kharagpur(印度理工学院Khargapur分校) Rochester Institute of Technology(罗切斯特理工学院) Researcher, Fatima Fellowship(研究员,Fatima fellowship) AI Institute, University of South Carolina(人工智能研究所,南卡罗来纳大学) Amazon GenAI(亚马逊生成人工智能) Stanford University(斯坦福大学) James Silberrad Brown Center for AI, San Diego State University(詹姆斯·西伯拉德·布朗人工智能中心,圣地亚哥州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments 18 pages, 9 figures, KDD workshop on Prompt Optimization 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11221 2025-06-16 cs.AI cs.CL cs.LO 92%

LLM-as-a-Fuzzy-Judge: Fine-Tuning Large Language Models as a Clinical Evaluation Judge with Fuzzy Logic

Weibing Zheng, Laurah Turner, Jess Kropczynski, Murat Ozer, Tri Nguyen, Shane Halse

机构 * University of Cincinnati(辛辛那提大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);SFT(abstract)

Comments 12 pages, 1 figure, 2025 IFSA World Congress NAFIPS Annual Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16703 2024-10-23 cs.CL cs.AI 92%

PLDR-LLM: Large Language Model from Power Law Decoder Representations

Burc Gokden

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

Comments 22 pages, 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06185 2024-06-05 cs.CL cs.AI 92%

KnowGPT: Knowledge Graph based Prompting for Large Language Models

Qinggang Zhang, Junnan Dong, Hao Chen, Daochen Zha, Zailiang Yu, Xiao Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17563 2024-03-29 cs.IR cs.CL cs.LG 92%

Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting

Zhen Qin, Rolf Jagerman, Kai Hui, Honglei Zhuang, Junru Wu, Le Yan, Jiaming Shen, Tianqi Liu, Jialu Liu, Donald Metzler, Xuanhui Wang, Michael Bendersky

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments Accepted to NAACL 2024. Corrected results of RankT5 on TREC-DL19

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12890 2024-01-24 cs.CL cs.AI 92%

Large Language Models Vote: Prompting for Rare Disease Identification

David Oniani, Jordan Hilsman, Hang Dong, Fengyi Gao, Shiven Verma, Yanshan Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12391 2026-08-14 cs.CL cs.AI cs.LG 新提交 92%

Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models

面向大语言模型复杂图推理的统一多维度基准

Fali Wang, Ali Al-Lawati, Iliyas Bektas, Jinxuan Fang, Alek Melenski, Tianxiang Zhao, Yao Ma, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有图推理基准的局限,提出半自动框架构建含202个任务的统一多维度基准,评估LLM在不同推理模式下的表现,揭示模型局限并提供实证指导。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27637 2026-08-04 cs.CV 版本更新 92%

MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models

MMOOC:多模态大语言模型的上下文外评估综合基准

Wenjie Zhu, Yabin Zhang, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东方理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出MMOOC基准,评估多模态大语言模型在上下文偏移场景下的拒绝与作答能力,实验发现当前模型难以平衡可答性与拒绝性,后训练可提升稳健性,该基准将公开。

Comments project page:https://zhuwenjie98.github.io/MMOOC-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16127 2026-07-20 cs.CL cs.AI cs.LG 版本更新 92%

AuAu: A Benchmark for Auditing Authoritarian Alignment in Large Language Models

AuAu: 大型语言模型中威权对齐审计基准

Andreas Einwiller, Max Klabunde, Florian Lemmerich

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AuAu基准,结合心理测量、情境行为测试和用户提示评估LLM的威权倾向,发现17个模型均存在显著威权响应,且系统提示可操纵多数模型。

Comments v2, 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25561 2026-06-25 cs.CR 新提交 92%

CrypFormBench: Benchmarking Formal Analysis Capability of Large Language Models for Cryptographic Schemes

CrypFormBench:评估大型语言模型在密码方案形式化分析中的能力基准

Zhaoxuan Li, Qionglu Zhang, Hengyuan Liu, Xiaoyan Gu, Xianhui Lu, Hongbo Liu, Bingzheng Wang, Haihui Fan, Ziming Zhao, Rui Zhang, Li Zhou

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出CrypFormBench基准,涵盖符号与计算安全,评估LLM在密码方案形式化分析中的五项核心能力,发现模型在生成、转换和修正方面表现有限。

Comments 23 pages, 17 figures, FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17582 2026-06-17 cs.DB 新提交 92%

Collaborative Large and Small Language Models for Accurate and Scalable Data Repair

协作式大小语言模型实现准确且可扩展的数据修复

Qian Chen, Jianwei Wang, Wenjie Zhang

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 提出LasRepair框架,利用大语言模型作为指导者选择全局修复上下文,小语言模型作为校正者高效修复错误数据,并通过EM过程和置信度加权进一步提升修复质量。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07887 2025-10-17 cs.CL cs.AI 92%

Benchmarking Adversarial Robustness to Bias Elicitation in Large Language Models: Scalable Automated Assessment with LLM-as-a-Judge

Riccardo Cantini, Alessio Orsino, Massimo Ruggiero, Domenico Talia

机构 * University of Calabria(卡利博利亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Journal ref Cantini, R., Orsino, A., Ruggiero, M., Talia, D. Benchmarking adversarial robustness to bias elicitation in large language models: scalable automated assessment with LLM-as-a-judge. Mach Learn 114, 249 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24573 2026-07-28 cs.AI 新提交 92%

LLM-SoccerArena: Benchmarking LLMs on Real-World Predictions in Sports

LLM - 足球竞技场:在体育领域的现实世界预测中对大语言模型进行基准测试

Jonas Schröder, Jonas Schweisthal, Oliver Müller, Markus Weinmann, Stefan Feuerriegel

机构 * MCML & LMU Munich(慕尼黑机器学习中心及慕尼黑大学) Paderborn University(帕德博恩大学) University of Cologne(科隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究旨在评估大语言模型预测现实世界体育赛事的能力,核心方法是引入LLM - 足球竞技场这一前瞻性实时基准,通过对2026年世界杯的评估,详细分析模型性能各维度表现,为LLMs预测性能提供新证据及开源平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20436 2026-06-19 cs.CR cs.AI 新提交 92%

Multi-View Decompilation for LLM-Based Malware Classification

基于LLM的恶意软件分类的多视角反编译

Bercan Turkmen, Vyas Raina

机构 * Independent Researcher(独立研究员) SPARK

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出多反编译器视角提升LLM恶意软件分类性能,通过Ghidra和RetDec的互补伪C代码提高召回率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28304 2026-06-08 cs.CL 版本更新 92%

The Necessity of Setting Temperature in LLM-as-a-Judge

LLM作为评判者中设置温度的必要性

Lujun Li, Lama Sleem, Yangjie Xu, Yewei Song, Aolin Jia, Jerome Francois, Radu State

机构 * University of Luxembourg(卢森堡大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 系统研究温度对LLM评判行为的影响,发现高温降低一致性但暴露不确定性,低温适合稳定任务,高温适合复杂场景,建议温度作为任务相关的设计选择。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25998 2026-05-26 cs.LG 92%

Causal methods for LLM development and evaluation

因果方法在LLM开发与评估中的应用

Dennis Frauen, Marie Brockschmidt, Konstantin Hess, Haorui Ma, Yuchen Ma, Abdurahman Maarouf, Maresa Schröder, Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Sonali Parbhoo, Rahul G. Krishnan, Stefan Feuerriegel

机构 * Imperial College London(帝国理工学院伦敦分校) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出因果方法可解决LLM开发与评估中的关键因果问题,并系统梳理其在预训练、对齐、路由等环节的应用机会。

Comments Published in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23970 2026-05-26 cs.CL 92%

Faithful or Fabricated? A Causal Framework for Rationalization Bias in LLM Judges

忠实还是捏造?LLM 评判中合理化偏差的因果框架

Riya Tapwal, Abhishek Kumar, Carsten Maple

机构 * School of Computing and Electrical Engineering(计算与电子工程学院) Indian Institute of Technology (IIT) Mandi(印度理工学院(IIT)曼迪) London U.K.(伦敦英国) Warwick Manufacturing Group U.K.(沃里克制造集团英国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出因果框架研究 LLM 评判者对非证据线索的依赖,通过线索干预和锚定度量揭示其合理化偏差,并验证证据锁定策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07422 2026-05-11 cs.SE cs.AI 92%

Prompt Engineering Strategies for LLM-based Qualitative Coding of Psychological Safety in Software Engineering Communities: A Controlled Empirical Study

基于LLM的软件工程社区心理安全定性编码的提示工程策略:一项受控实证研究

Moaath Alshaikh, Tasneem Alshaher, Ricardo Vieira, Beatriz Santana, Clelio Xavier, Jose Amancio, Glauco Carneiro, Julio Leite, Savio Freire, Manoel Mendonca

机构 * Federal University of Bahia(巴伊亚联邦大学) State University of Feira de Santana(费拉德桑塔纳州立大学) Federal University of Sergipe(塞格皮联邦大学) Federal Institute of Ceara(塞阿拉联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过对比三种LLM在零样本和多样本提示策略下的表现,验证了多样本提示能提升编码一致性,但对部分模型效果有限,同时发现模型在某些类别上存在系统性偏差。

Comments 9 pages, 5 figures. Accepted at the 1st International Workshop on Prompt Engineering for Software Engineering (PROMPT-SE 2026), co-located with the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026), Glasgow, Scotland, United Kingdom, June 9--12, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01014 2026-04-17 cs.CL 92%

IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation

IF-CRITIC:面向指令遵循评估的细粒度LLM批评者

Bosi Wen, Yilin Niu, Cunxiang Wang, Pei Ke, Xiaoying Ling, Ying Zhang, Aohan Zeng, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) Zhipu AI(智谱AI) University of Electronic Science and Technology of China(电子科技大学) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组(KEG))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出IF-CRITIC,通过细粒度、高效且可靠的评估方法提升LLM指令遵循能力,采用检查清单生成器和约束级偏好优化训练模型,实验表明其优于现有基线模型。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19735 2026-03-24 cs.LG 92%

Improving Fairness of Large Language Model-Based ICU Mortality Prediction via Case-Based Prompting

通过基于案例的提示提升基于大语言模型的ICU死亡预测公平性

Gangxiong Zhang, Yongchao Long, Yuxi Zhou, Yong Zhang, Shenda Hong

机构 * School of Computer Science and Engineering, Tianjin University of Technology, Tianjin, China(天津理工大学计算机科学与工程学院) Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院) DCST, BNRist, RIIT, Institute of Internet Industry, Tsinghua University, Beijing, China(清华大学信息产业研究院) National Institute of Health Data Science, Peking University, Beijing, China(北京大学健康数据科学国家研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

AI总结 本文提出一种临床适应性提示框架,通过整合去偏策略和历史误判案例,提升ICU死亡预测的公平性和性能,实验显示AUROC和AUPRC显著提升,预测差异大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16453 2026-01-30 cs.AI 92%

TimeSeries2Report prompting enables adaptive large language model management of lithium-ion batteries

TimeSeries2Report提示使大语言模型适应性管理锂离子电池

Jiayang Yang, Martin Guay, Zhixing Cao, Chunhui Zhao

机构 * State Key Laboratory of Industrial Control Technology, College of Control Science and Engineering, Zhejiang University, Hangzhou, 310027, China(工业控制技术国家重点实验室,控制科学与工程学院,浙江大学,杭州,310027,中国) Department of Chemical Engineering, Queen’s University, Kingston, Ontario K7L 3N6, Canada(化学工程系,皇后大学,金斯顿,安大略省K7L 3N6,加拿大)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

AI总结 TimeSeries2Report通过将时间序列数据转化为结构化报告,提升大语言模型在锂离子电池管理中的适应性和决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25014 2025-10-30 cs.AI 92%

Aligning Large Language Models with Procedural Rules: An Autoregressive State-Tracking Prompting for In-Game Trading

Minkyung Kim, Junsik Kim, Woongcheol Yang, Sangdon Park, Sohee Bae

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments 8 pages main content, 18 pages supplementary material, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16076 2025-10-06 cs.CL 92%

The Prompt Makes the Person(a): A Systematic Evaluation of Sociodemographic Persona Prompting for Large Language Models

Marlene Lutz, Indira Sen, Georg Ahnert, Elisa Rogers, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) Complexity Science Hub Vienna(维也纳复杂科学中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments Accepted to EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11779 2025-04-02 cs.LG 92%

LLM-IE: A Python Package for Generative Information Extraction with Large Language Models

Enshuo Hsu, Kirk Roberts

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14373 2024-12-23 cs.CL 92%

Small Language Models as Effective Guides for Large Language Models in Chinese Relation Extraction

Xuemei Tang, Jun Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);small language model(title);LLM(abstract)

Comments 13 pages, 9 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12025 2024-12-02 cs.CL 92%

Speech Translation with Speech Foundation Models and Large Language Models: What is There and What is Missing?

Marco Gaido, Sara Papi, Matteo Negri, Luisa Bentivogli

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(title,abstract);LLM(abstract)

Comments Outstanding paper at the ACL 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏