arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-12 至 2026-03-12 共收录 230 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 55 篇

2603.00359 2026-03-12 cs.CL cs.LG 90%

How Large Language Models Get Stuck: Early structure with persistent errors

大语言模型为何陷入停滞:早期结构与持续性错误

Alokesh Manna, William Snyder, Whitney Tabor

机构 * Department of Statistics(统计学系) University of Connecticut, Storrs(康涅狄格大学斯托尔分校) Department of Linguistics(语言学系) Department of Psychological Sciences(心理学科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究发现大语言模型在训练早期可能因大写统计偏差而陷入错误固化,提出双元组假设以解释这一现象并提出测试方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08245 2026-03-12 cs.CL cs.AI cs.HC 90%

Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement

大语言模型心理测量学:评估、验证与增强的系统综述

Haoran Ye, Jing Jin, Yuhang Xie, Xin Zhang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(一般人工智能国家重点实验室,智能科学与技术学院,北京大学) School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) Key Laboratory of Machine Perception (Ministry of Education), Peking University(机器感知重点实验室(教育部),北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文系统综述了大语言模型的心理测量学,通过整合心理测量工具和理论,提升LLM的评估、理解和增强能力,推动以人类为中心的AI发展。

Comments 400+ references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10018 2026-03-12 cs.CY cs.AI 89%

DeliberationBench: A Normative Benchmark for the Influence of Large Language Models on Users' Views

DeliberationBench: 一个用于评估大语言模型对用户观点影响的规范性基准

Luke Hewitt, Maximilian Kroner Dale, Paul de Font-Reaulx

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 DeliberationBench通过评估大语言模型对用户观点影响的规范性基准,揭示了其在政策讨论中的显著影响及对民主标准的贡献。

Comments 20 pages, 6 figures, IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09638 2026-03-12 cs.CL 89%

Tracking Cancer Through Text: Longitudinal Extraction From Radiology Reports Using Open-Source Large Language Models

通过文本追踪癌症:使用开源大语言模型进行放射学报告的纵向提取

Luc Builtjes, Alessa Hering

机构 * Department of Medical Imaging, Radboudumc(放射医学部,拉德堡德大学医学中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出基于开源大语言模型的放射学报告纵向信息提取方法,实现高准确率的肿瘤病变数据提取,适用于隐私敏感的医疗环境。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00307 2026-03-12 cs.AI 89%

BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models

BiasBusters: 检测和缓解大语言模型中的工具选择偏差

Thierry Blankenstein, Jialin Yu, Zixuan Li, Vassilis Plachouras, Sunando Sengupta, Philip Torr, Yarin Gal, Alasdair Paren, Adel Bibi

机构 * University of Oxford(牛津大学) Microsoft(微软)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究通过基准测试揭示LLM工具选择中的系统性偏差,并提出轻量级缓解策略以减少选择偏差。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05406 2026-03-12 cs.AI cs.SY eess.SY 89%

Synthesizing Interpretable Control Policies through Large Language Model Guided Search

通过大语言模型引导搜索合成可解释的控制策略

Carlo Bosio, Mark W. Mueller

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出通过大语言模型引导搜索生成可解释的动态系统控制策略,利用标准编程语言提高透明性和可解释性,并展示在摆动单摆和杯中球任务中的应用。

Comments 8 pages, 7 figures, conference paper

Journal ref Published at ACC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03114 2026-03-12 cs.SE 89%

PromCopilot: Simplifying Prometheus Metric Querying in Cloud Native Online Service Systems via Large Language Models

PromCopilot: 通过大型语言模型简化云原生在线服务系统的Prometheus指标查询

Chenxi Zhang, Bicheng Zhang, Dingyu Yang, Xin Peng, Miao Chen, Senyu Xie, Gang Chen, Wei Bi, Wei Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 PromCopilot通过大型语言模型简化云原生在线服务系统的Prometheus指标查询,首次提出文本到PromQL框架,准确率达69.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07602 2026-03-12 cs.SE 89%

OODEval: Evaluating Large Language Models on Object-Oriented Design

OODEval: 对象导向设计上评估大型语言模型

Bingxu Xiao, Yunwei Dong, Yiqi Tang, Manqing Zhang, Yifan Zhou, Chunyan Ma, Yepang Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract)

AI总结 OODEval评估了29个大型语言模型在面向对象设计任务上的表现,揭示了LLMs在语义上的不足,并提出了CLUE度量集以评估类图生成质量。

Comments 32 pages,8 figures,10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09985 2026-03-12 cs.CL cs.AI 88%

The Dunning-Kruger Effect in Large Language Models: An Empirical Study of Confidence Calibration

大型语言模型中的邓宁-克鲁格效应:对置信度校准的实证研究

Sudipta Ghosh, Mrityunjoy Panday

机构 * Cognizant Technology Solutions(Cognizant技术解决方案)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大型语言模型在置信度校准上存在类似邓宁-克鲁格效应的过度自信现象,通过实验证明低性能模型更易高估自身能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05503 2026-03-12 cs.LG cs.AI 88%

Over-Searching in Search-Augmented Large Language Models

搜索增强型大语言模型中的过度搜索

Roy Xie, Deepak Gopinath, David Qiu, Dong Lin, Haitian Sun, Saloni Potdar, Bhuwan Dhingra

机构 * Apple(苹果公司) Duke University(杜克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了搜索增强型大语言模型中的过度搜索问题,提出TPC指标量化其性能与成本的权衡,并探讨了缓解方法。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10541 2026-03-12 cs.CV cs.AI 88%

Prompting with the human-touch: evaluating model-sensitivity of foundation models for musculoskeletal CT segmentation

带有人情味的提示:评估基础模型对肌肉骨骼CT分割的敏感性

Caroline Magg, Maaike A. ter Wee, Johannes G. G. Dobbe, Geert J. Streekstra, Leendert Blankevoort, Clara I. Sánchez, Hoel Kervadec

专题命中 评测与基准 :foundation model(title,abstract);prompting(title,abstract);分类 cs.AI

AI总结 本研究评估了基础模型在肌肉骨骼CT分割中的敏感性,发现不同模型和提示策略性能差异大,且人类提示影响分割结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03782 2026-03-12 cond-mat.supr-con cond-mat.str-el cs.AI 85%

Expert Evaluation of LLM World Models: A High-$T_c$ Superconductivity Case Study

专家评估LLM世界模型:一个高温超导体案例研究

Haoyu Guo, Maria Tikhanovskaya, Paul Raccuglia, Alexey Vlaskin, Chris Co, Daniel J. Liebling, Scott Ellsworth, Matthew Abraham, Elizabeth Dorfman, N. P. Armitage, Chunhan Feng, Antoine Georges, Olivier Gingras, Dominik Kiese, Steven A. Kivelson, Vadim Oganesyan, B. J. Ramshaw, Subir Sachdev, T. Senthil, J. M. Tranquada, Michael P. Brenner, Subhashini Venugopalan, Eun-Ah Kim

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过专家评估LLM在高温超导领域的问题回答能力,发现基于RAG的系统在全面性和证据支持方面优于封闭模型。

Comments (v1) 9 pages, 4 figures, with 7-page supporting information. Accepted at the ICML 2025 workshop on Assessing World Models and the Explorations in AI Today workshop at ICML'25

Journal ref Proceedings of the National Academy of Sciences 123, e2533676123 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09996 2026-03-12 cs.CL cs.AI cs.CR cs.LG 85%

There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective

没有愚蠢的问题:从土耳其视角评估离线LLM能力

Edibe Yilmaz, Kahraman Kostas

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究从土耳其视角评估了离线LLM在遗产语言教育中的鲁棒性和教学安全性,发现参数范围在8B-14B的模型在成本与安全性之间达到最佳平衡。

Comments 5 pages, 6 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10351 2026-03-12 cs.CL cs.AI 84%

Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneck

通过解耦信息瓶颈缓解多语言大语言模型作为评判者的翻译偏差

Hongbin Zhang, Kehai Chen, Xuefen Bai, Youcheng Pan, Yang Xiang, Jinpeng Wang, Min Zhang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DIBJudge框架,通过解耦信息瓶颈缓解多语言LLM的翻译偏差问题,有效提升多语言评估的公平性和准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09993 2026-03-12 cs.CL cs.AI 84%

CEI: A Benchmark for Evaluating Pragmatic Reasoning in Language Models

CEI:一种评估语言模型隐含推理能力的基准

Jon Chun, Hannah Sussman, Adrian Mangine, Murathan Kocaman, Kirill Sidorko, Abhigya Koirala, Andre McCloud, Gwen Eisenbeis, Wisdom Akanwe, Moustapha Gassama, Eliezer Gonzalez Chirinos, Anne-Duncan Enright, Peter Dunson, Tiffanie Ng, Anna von Rosenstiel, Godwin Idowu

机构 * Kenyon College(肯尼恩学院) US NIST AI Consortium(美国NIST人工智能联合体) Schmidt Science HAVI(施密特科学HAVI)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 CEI基准通过300个经人类验证的场景评估语言模型在处理隐含意义复杂语句时的歧义消除能力,涵盖讽刺、混合信号等五种隐含子类型,采用三种权力配置进行测试。

Comments 38 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11025 2026-03-12 cs.MA cs.IR 82%

LLMGreenRec: LLM-Based Multi-Agent Recommender System for Sustainable E-Commerce

LLMGreenRec: 基于大语言模型的多智能体推荐系统用于可持续电子商务

Hao N. Nguyen, Hieu M. Nguyen, Son Van Nguyen, Nguyen Thi Hanh

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 LLMGreenRec通过大语言模型和多智能体框架,提升电子商务中可持续产品推荐的准确性和环保性。

Comments Accepted to the Proceedings of the Conference on Digital Economy and Fintech Innovation (DEFI 2025). To appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10029 2026-03-12 cs.GT 82%

Quantal Response Equilibrium as a Measure of Strategic Sophistication: Theory and Validation for LLM Evaluation

量子反应均衡作为战略成熟度的度量:理论与LLM评估中的验证

Mateo Pechon-Elkins, Jon Chun

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出基于量子反应均衡的理论框架,用于评估大型语言模型的战略成熟度,通过实验验证了模型在不同认知能力上的表现及参数估计的稳健性。

Comments 25 pages, 8 figures, submitted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10033 2026-03-12 cs.CL cs.AI 81%

Evaluating Progress in Graph Foundation Models: A Comprehensive Benchmark and New Insights

评估图基础模型的进展:一个全面的基准和新见解

Xingtong Yu, Shenghua Ye, Ruijuan Liang, Chang Zhou, Hong Cheng, Xinming Zhang, Yuan Fang

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个全面的图基础模型基准,评估主题和格式双维度的转移能力,揭示了GFM在多领域适应中的新发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11027 2026-03-12 cs.CL 79%

Beyond the Illusion of Consensus: From Surface Heuristics to Knowledge-Grounded Evaluation in LLM-as-a-Judge

超越共识的幻觉:从表面启发式到基于知识的评估

Mingyang Song, Mao Zheng, Chenning Xu

机构 * Tencent, China(腾讯,中国)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 LLM-as-a-judge范式中,高一致性可能源于表面启发式而非实质质量,动态生成基于领域知识的评分标准能提升评估一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10784 2026-03-12 cs.CL cs.IR 79%

Interpretable Chinese Metaphor Identification via LLM-Assisted MIPVU Rule Script Generation: A Comparative Protocol Study

通过LLM辅助MIPVU规则脚本生成实现可解释的中文隐喻识别:一种比较性协议研究

Weihang Huang, Mengna Liu

机构 * University of Birmingham(伯明翰大学) Guangdong University of Foreign Studies(广东外语外贸大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文通过LLM辅助生成可解释的规则脚本,对中文隐喻识别进行跨协议比较,发现协议选择是影响识别结果的主要因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10287 2026-03-12 stat.ML cs.LG 79%

MultiwayPAM: Multiway Partitioning Around Medoids for LLM-as-a-Judge Score Analysis

多方式PAM:用于LLM-as-a-Judge评分分析的多方式分区围绕质心

Chihiro Watanabe, Jingyu Sun

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 本文提出MultiwayPAM方法,用于分析LLM-as-a-Judge评分中的偏见结构,通过张量聚类技术揭示评分偏见的来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06627 2026-03-12 cs.CR cs.AI 79%

Burn-After-Use for Preventing Data Leakage through a Secure Multi-Tenant Architecture in Enterprise LLM

使用后销毁以通过安全多租户架构防止数据泄露

Qiang Zhang, Elena Emma Wang, Jiaming Li, Xichun Wang

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本研究提出一种结合'使用后销毁'机制的Secure Multi-Tenant Architecture,用于防止企业LLM的数据泄露,通过严格隔离和会话短暂性确保数据安全。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11011 2026-03-12 cs.HC 79%

Task-Aware Delegation Cues for LLM Agents

面向任务的代理委派提示

Xingrui Gu

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出面向任务的代理委派提示框架,通过任务分类学和协调风险提示提升人机协作的透明度和可协商性。

Comments Accepeted by CHI'26 Workshop on Developing Standards and Documentation For LLM Use as Simulated Research Participants

Journal ref CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10303 2026-03-12 cs.CL cs.AI 79%

Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas

这个想法是否新颖?一种自动化的判断研究想法新颖性的基准

Tim Schopf, Michael Färber

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RINoBench基准,用于评估研究想法新颖性判断,发现LLM生成的推理与人类相似但判断不准确。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18710 2026-03-12 cs.AI cs.LG 79%

Many AI Analysts, One Dataset: Navigating the Agentic Data Science Multiverse

众多AI分析师,一个数据集:导航代理数据科学多宇宙

Martin Bertran, Riccardo Fogliato, Zhiwei Steven Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究展示基于LLM的AI分析师能生成多样化的分析结果,揭示了自动化经验科学中的透明性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10814 2026-03-12 cs.CV 78%

HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation

HanMoVLM:用于专业艺术绘画评估的大型视觉-语言模型

Hongji Yang, Yucheng Zhou, Wencheng Han, Songlian Li, Xiaotong Zhao, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(SKL-IOTSC、CIS、澳门大学) CSE, Shandong University(山东大学计算机科学与工程学院) Online-Video BU, Tencent(腾讯在线视频事业部)

专题命中 评测与基准 :language model(title,abstract)

AI总结 HanMoVLM通过引入HanMo-Bench数据集和链式推理机制,实现专业艺术绘画评估,提升中国绘画生成质量。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10578 2026-03-12 cs.CV cs.DB 78%

R4-CGQA: Retrieval-based Vision Language Models for Computer Graphics Image Quality Assessment

R4-CGQA: 基于检索的视觉语言模型用于计算机图形图像质量评估

Zhuangzi Li, Jian Jin, Shilv Cai, Weisi Lin

专题命中 评测与基准 :language model(title,abstract)

AI总结 R4-CGQA通过构建包含3500张CG图像及其质量描述的数据集,提出双流检索框架提升视觉语言模型对计算机图形图像质量的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10807 2026-03-12 q-fin.CP cs.AI cs.CY 77%

Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services

针对金融服务业LLM自动红队测试的风险调整危害评分

Fabrizio Dimino, Bhaskarjit Sarmah, Stefano Pasquali

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种针对金融服务业LLM安全风险的评估框架,通过风险敏感的RAHS度量标准,评估LLM在长期对抗压力下的安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10233 2026-03-12 cs.CL 77%

S-GRADES -- Studying Generalization of Student Response Assessments in Diverse Evaluative Settings

S-GRADES -- 研究学生响应评估在多样化评估环境中的泛化能力

Tasfia Seuti, Sagnik Ray Choudhury

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 S-GRADES通过统一的基准测试平台整合多种学生响应评分数据集,评估大语言模型在不同评分任务中的泛化能力,揭示评分任务中的可靠性与泛化差距。

Comments LREC 2026 Accepted, https://sgrades.eng.unt.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10194 2026-03-12 cs.CR cs.AI 77%

MCP-in-SoS: Risk assessment framework for open-source MCP servers

MCP-in-SoS:开源MCP服务器的风险评估框架

Pratyay Kumar, Miguel Antonio Guirao Aguilera, Srikathyayani Srikanteswara, Satyajayant Misra, Abu Saleh Md Tayeen

机构 * New Mexico State University(新墨西哥州立大学) University of Hartford(哈特福德大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种针对开源MCP服务器的风险评估框架,通过静态代码分析识别弱点并评估其安全风险,揭示了现有系统存在的安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏