arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2309.17012 2024-09-26 cs.CL cs.AI cs.LG 91%

Benchmarking Cognitive Biases in Large Language Models as Evaluators

Ryan Koo, Minhwa Lee, Vipul Raheja, Jong Inn Park, Zae Myung Kim, Dongyeop Kang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Publishsed at ACL 2024. 29 pages, 9 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16282 2024-06-18 cs.CL cs.AI cs.LG 91%

Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language Models

Abhishek Kumar, Robert Morabito, Sanzhar Umbet, Jad Kabbara, Ali Emami

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 9 pages (excluding references), accepted to ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12516 2024-06-04 cs.CL cs.AI cs.LG 91%

ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks

Xiaodong Yu, Hao Cheng, Xiaodong Liu, Dan Roth, Jianfeng Gao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments NAACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04685 2024-05-09 cs.CL cs.AI cs.LG 91%

Bridging the Bosphorus: Advancing Turkish Large Language Models through Strategies for Low-Resource Language Adaptation and Benchmarking

Emre Can Acikgoz, Mete Erdogan, Deniz Yuret

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00566 2024-02-20 cs.LG cs.AI cs.CL cs.CY 91%

Empowering Many, Biasing a Few: Generalist Credit Scoring through Large Language Models

Duanyu Feng, Yongfu Dai, Jimin Huang, Yifang Zhang, Qianqian Xie, Weiguang Han, Zhengyu Chen, Alejandro Lopez-Lira, Hao Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16789 2023-10-04 cs.AI cs.CL cs.LG 91%

ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs

Yujia Qin, Shihao Liang, Yining Ye, Kunlun Zhu, Lan Yan, Yaxi Lu, Yankai Lin, Xin Cong, Xiangru Tang, Bill Qian, Sihan Zhao, Lauren Hong, Runchu Tian, Ruobing Xie, Jie Zhou, Mark Gerstein, Dahai Li, Zhiyuan Liu, Maosong Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00723 2023-09-25 cs.CL cs.AI cs.LG cs.SD eess.AS 91%

Contextual Biasing of Named-Entities with Large Language Models

Chuanneng Sun, Zeeshan Ahmed, Yingyi Ma, Zhe Liu, Lucas Kabela, Yutong Pang, Ozlem Kalinli

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 5 pages, 4 figures. Conference: ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16648 2023-08-03 cs.AI cs.CL cs.IT cs.LG math.IT 91%

LLMs4OL: Large Language Models for Ontology Learning

Hamed Babaei Giglou, Jennifer D'Souza, Sören Auer

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 15 pages main content, 27 pages overall, 2 Figures, accepted for publication at ISWC 2023 research track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01456 2026-06-02 cs.LG cs.CL cs.GT 91%

Truthful AI Advisors: A Pre-Specified Benchmark for Large Language Model Honesty Under Preference Misalignment

诚实的人工智能顾问:偏好错位下大语言模型诚实性的预设基准

Hamidreza Hasani Balyani, Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Arshia Gharagozlou

机构 * Amazon Lab126, HW Tech Org.(亚马逊实验室126,硬件技术组织) Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡分校) Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth 分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 通过Crawford-Sobel廉价谈话模型构建基准,评估大语言模型在偏好冲突时是否诚实,发现模型过度揭示信息,偏离策略最优。

Comments 19 pages. Code and data: https://github.com/iHamidHasani/cheap-talk-llm-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13168 2026-08-14 cs.CL 新提交 91%

Which LLM Is Your Ideal Companion? Evaluating Emotional Companion Capabilities of LLMs Based on Adult Attachment Theory

哪种大语言模型是你理想的陪伴者?基于成人依恋理论评估大语言模型的情感陪伴能力

Junkai Zhou, Shiting Guan, Zhaoyi Zhang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究基于成人依恋理论构建情感陪伴基准ECBench,评估32个LLM的依恋倾向,探究其在多轮交互中的表现及可调整性,为情感陪伴类LLM的选择提供理论与工具支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10621 2026-08-12 cs.LG 新提交 91%

ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

ProbGuard:基于大语言模型输出分布的校准安全风险估计

Xinzhe Huang, Biwu Yao, Kedong Xiu, Mengnan Zhao, Di Wang, Puning Zhao, Tianhang Zheng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究针对现有LLM安全防护的确定性范式局限,提出概率架构无关防护框架ProbGuard,利用早期输出分布信号校准安全风险,实现提前终止不安全输出,在9种组合设置及6种越狱攻击中均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07367 2026-08-10 cs.AI 新提交 91%

People Are Not Just Their Countries. Disentangling Social Determinants of LLM Value Alignment Across Europe

人不只是其所属国家:在欧洲范围内解耦大型语言模型(LLM)价值对齐的社会决定因素

Maria-Louisa Wightman, Guillaume Bied, Tijl De Bie

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 本研究依托欧洲社会调查,发现LLMs与不同社会人口学群体的价值观对齐存在差异,国籍作为单独变量的解释力与全部社会人口学变量相当,国家与社会人口学因素在解释对齐模式上互补。

Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06781 2026-08-06 cs.CL 版本更新 91%

When Better Codebooks Are Not Enough: Predictive Performance and Behavioral Reliability in LLM Political Event Coding

当更好的代码手册还不够:LLM政治事件编码中的预测性能与行为可靠性

Zixian He, Bharath Raahul Murugesan, Patrick Brandt, Yibo Hu

机构 * Independent Researcher(独立研究者) Illinois Institute of Technology(伊利诺伊理工学院) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 本研究探讨在政治事件编码任务中,将专家代码手册优化为LLM友好形式能显著提升分类性能,但预测增益并未完全转化为行为可靠性,模型在代码手册变化下仍可能失效。

Comments 13 pages, 3 figures, 13 tables. Revised version with updated experiments, behavioral reliability analyses, and additional API-model results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02620 2026-08-05 cs.CL 新提交 91%

JudgeArena: A Unified Framework for Reproducible LLM-Judge Evaluation

JudgeArena:用于可复现LLM-评判者评估的统一框架

Erlis Lushtaku, Bora Kargi, Ali Elganzory, Fabio Ferreira, Alejandro R. Salamanca, Julia Kreutzer, David Salinas

机构 * University of Freiburg(弗莱堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Microsoft AI(微软人工智能部门) Cohere Labs(Cohere实验室) Prior Labs(Prior实验室)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 JudgeArena是统一主流LLM评判者基准的开源框架,支持可替换评判者,配备调优开源评判者配置,可高精度模拟LMArena Elo分数,减少对闭源模型的依赖,提升评估的透明度与可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29431 2026-08-03 cs.AI 新提交 91%

ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models

ModelEquivBench:LLM生成优化模型的多关系验证评估系统

Penglin Zhu, Jungang Xu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出多关系评估系统ModelEquivBench,将其用于评估GPT-5.4等三个LLM生成的优化模型,发现不同模型在特征不同阶段失败,无法简化为单一准确率分数。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23088 2026-07-28 cs.CR cs.AI 新提交 91%

Poster: Rethinking Security in LLM Code Generation through Real-World Risk Scenarios

海报:通过现实世界风险场景重新思考大语言模型代码生成中的安全性

Lixun Ma, Ruolong Ma, Bei Wang, Feng Wei, Zhenguang Liu, Lorenzo Cavallaro, Wentao Chen

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究LLM代码生成的安全行为,识别出三种风险场景,构建含2700个测试用例的基准评估安全性,发现先进LLMs平均漏洞率超56%,证明安全感知提示可大幅降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25332 2026-06-25 cs.CR cs.AI 新提交 91%

Decoupling Reconnaissance and Exploitation: Measuring the Capability Boundaries of LLM-Based Web Penetration Testing

解耦侦察与利用:测量基于LLM的Web渗透测试的能力边界

Liwei Yu, Shuo Li, Ming Zhou, Ge Chu, Yan Guo

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州先进研究院) Nanjing University of Science and Technology(南京理工大学) Research Institute, Runjian Co., Ltd(润杰有限公司研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出解耦评估框架分离侦察与利用阶段,发现LLM代理在准确漏洞上下文下功能成功率可达90.0%,但自主侦察召回率仅约50.0%,揭示了能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23178 2026-06-25 cs.AI 版本更新 91%

Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines

评判评判者:LLM-as-a-Judge pipelines中偏见缓解策略的系统评估

Sadman Kabir Soumik

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文系统评估了LLM-as-a-Judge pipelines中九种偏见缓解策略,发现风格偏见是最主要的偏见类型,且所有模型在扩展对上偏好简洁性,但截断控制能区分质量和长度,表明质量敏感的评估而非单纯长度偏见。

Comments 22 pages, 4 figures. Published in Transactions on Machine Learning Research (2026)

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19544 2026-06-19 cs.CL 新提交 91%

Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias

无效度的可靠性:LLM-as-a-Judge 模型在一致性、稳定性和偏差上的系统性大规模评估

Justin D. Norman, Michael U. Rivera, D. Alex Hughes

机构 * UC Berkeley School of Information(加州大学伯克利分校信息学院)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 本研究通过大规模系统性评估(21个裁判模型、118次运行、约54.1万次判断),发现LLM-as-a-Judge在一致性、稳定性和偏差方面存在普遍问题,包括kappa通缩、排名偏移、高重测信度与严重位置偏差并存,并提出了最小可行验证协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29874 2026-06-16 cs.MA cs.AI cs.GT 版本更新 91%

Evolutionary Dynamics of Cooperation in Next-Generation LLM Agent Systems: A Cross-Provider Empirical Extension

下一代LLM智能体系统中合作的演化动力学:跨提供商的实证扩展

Francisco León Zúñiga Bolívar

机构 * Institución Universitaria Colegio Mayor del Cauca(大学机构科尔多瓦大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本研究通过扩展Willis等人的基准,测试2025-2026年四个前沿LLM模型在迭代囚徒困境中的合作偏差,发现合作偏差普遍存在但提供商间差异显著,且噪声仍是普遍挑战。

Comments v2 (erratum): two truncated Gemini 3.1 Pro libraries regenerated; cooperative-plurality 9/12->10/12, conclusions unchanged. 11 pages, 3 figures, 8 tables. Extends arXiv:2501.16173. Code and n=500 replication: https://github.com/arqFranciscoLeon/evollm (archived: https://doi.org/10.5281/zenodo.20248615)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14278 2026-06-15 cs.CL 新提交 91%

Does the Judge Prefer English? Evaluating Language-Switching Invariance in LLM-as-a-Judge

法官偏爱英语吗?评估LLM作为法官时的语言切换不变性

Shaojie Yin

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Judge-LS协议,通过语言切换变体评估LLM作为自动法官的可靠性,发现语言切换导致10.7-14.4%偏好翻转,但翻译等价测试未显示系统英语偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06420 2026-06-05 cs.CL 91%

A Komi-Yazva--Russian Parallel Corpus and Evaluation Protocol for Zero- and Few-Shot LLM Translation

科米-亚兹瓦语-俄语平行语料库及零样本和少样本LLM翻译评估协议

Petr Parshakov

机构 * HSE University, Perm, Russia(俄罗斯彼尔姆国立经济大学) School of Management SKOLKOVO, Moscow, Russia(莫斯科SKOLKOVO管理学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 构建首个科米-亚兹瓦语-俄语平行语料库,并提出显式评估协议,研究大语言模型在极度低资源濒危语言翻译中的零样本和检索增强少样本性能。

Comments 18 pages, 6 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06022 2026-06-05 cs.CL 91%

Contextualized Prompting For Stance Detection On Social Media

社交媒体立场检测的上下文化提示

Tilman Beck, Shakib Yazdani, Simon Kruschinski, Marcus Maurer, Iryna Gurevych

机构 * Institute of Intensive Care, University Hospital of Zurich and University of Zurich(重症医学研究所,苏黎世大学医院和苏黎世大学) Institute of Computer Science, University of Goettingen(计算机科学研究所,哥廷根大学) GESIS Leibniz Institute for the Social Sciences(社会科学研究莱比锡研究所) Institut für Publizistik, Johannes Gutenberg-University Mainz(主笔研究所,美因茨约翰· Gutenberg 大学) Ubiquitous Knowledge Processing Lab, Technical University of Darmstadt(无处不在知识处理实验室,达姆施塔特技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 通过系统实验,研究在零样本提示中融入真实世界、推导和LLM生成的上下文特征对Twitter立场检测的影响,发现LLM生成的目标描述能持续提升准确率,而其他用户元数据效果不一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05206 2026-06-05 q-bio.NC cs.AI stat.AP 91%

Ontology-constrained multi-LLM scoring of hypothesis support in the predictive processing literature

本体约束的多LLM评分在预测处理文献中假设支持度的应用

Hamed Nejat, Alexander Maier, Jesse Spencer-Smith, André M. Bastos

机构 * University of Edinburgh(爱丁堡大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文提出一个本地多LLM流水线,通过本体约束对预测编码文献中的研究进行评分,将异构文献映射到定量证据空间,并揭示假设间的结构化分歧。

Comments 33 pages, 5 tables and 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03876 2026-06-03 cs.HC cs.AI cs.MA 91%

From 'What' to 'How' and 'Why': Sharing LLM-Generated Retrospective Summaries of Older Adults' Passive Tracking Data with Remote Family Members

从“是什么”到“怎么样”和“为什么”:与远程家庭成员共享老年人被动追踪数据的LLM生成回顾性摘要

Jiachen Li, Reina Szeyi Chan, Akshat Choube, Xiang Zhi Tan, Elizabeth Mynatt, Varun Mishra

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究利用大型语言模型(LLM)从多模态追踪数据生成回顾性摘要,通过技术探针和访谈重新设计系统,显著提升了远程家庭成员对摘要的满意度、帮助性、信任和接收意愿,并提出了支持其从“是什么”到“怎么样”和“为什么”的认知转变的设计启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03043 2026-06-03 cs.CL 91%

The Geometry of LLM-as-Judge: Why Inter-LLM Consensus Is Not Human Alignment

LLM作为评判者的几何学:为什么LLM间共识不等于人类对齐

Sourabrata Mukherjee, Hamna Hamna, Kalika Bali, Sunayana Sitaram

专题命中 评测与基准 :LLM(title,title_cn);preference optimization(abstract);分类 cs.CL

AI总结 通过几何量测量,发现LLM评判者之间高度一致但与人类对齐差,其评分子空间与人类子空间几乎正交,共识源于子空间坍缩而非人类对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02470 2026-06-02 cs.AI 91%

MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation

MCP-Persona:通过环境模拟在真实个人应用上基准测试LLM智能体

Wenhao Wang, Peizhi Niu, Gongyi Zou, Xiyuan Yang, Jingxing Wang, Haoting Shi, Yaxin Du, Jingyi Chai, Xianghe Pang, Shuo Tang, Yanfeng Wang, Siheng Chen

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有基准忽略个人社交应用中工具与个人账户或本地数据库交互的挑战,提出MCP-Persona基准,通过模拟真实个性化MCP工具评估LLM智能体性能,实验表明现有智能体在个性化工具使用上存在显著困难。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02418 2026-06-02 quant-ph cs.AI 91%

Evolutionary Discovery of Bivariate Bicycle Codes with LLM-Guided Search

基于LLM引导搜索的双变量自行车码的进化发现

Juan Cruz-Benito, Andrew W. Cross, David Kremer, Ismael Faro

机构 * IBM Research(IBM研究院) IBM T. J. Watson Research Center(IBM T.J. 巴特勒研究中心)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出一种LLM引导的进化工作流,通过变异生成双变量自行车码和扰动变体的Python程序,在约1650次迭代中筛选约2×10^5个候选码,发现了465个不同候选码,包括非CSS扰动码和CSS码,展示了LLM引导的程序进化在结构化量子码发现中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02289 2026-06-02 cs.CL 91%

DECK: A Consistency x Confidence Taxonomy of LLM Hallucinations

DECK: LLM幻觉的一致性×置信度分类法

Mohit Singh Chauhan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL

AI总结 提出一种基于样本间一致性和词级置信度的2×2分类法(DECK),将LLM幻觉分为四个行为区域,每个区域对应可检测的评分器家族,并通过实验验证其有效性及识别出输出级不确定性评估的普遍盲点。

Comments 18 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00765 2026-06-02 cs.AI 91%

FALAT: Tracing Failures in LLM Agent Trajectories via Dependency-Guided Search

FALAT: 通过依赖引导搜索追踪LLM智能体轨迹中的失败

Md Nakhla Rafi, Md Ahasanuzzaman, Dong Jae Kim, Zhijie Wang, Tse-Hsun Chen

机构 * SPEAR Lab(SPEAR实验室) Concordia University(康科德大学) DePaul University(德保罗大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 提出FALAT框架,通过依赖引导搜索方法,在LLM智能体轨迹中识别导致失败的关键步骤和责任智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏