arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31906 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31906 篇

2604.19984 2026-04-23 cs.CY cs.AI cs.CL 90%

Bias in the Tails: How Name-conditioned Evaluative Framing in Resume Summaries Destabilizes LLM-based Hiring

尾部偏差:姓名条件下的评价框架在简历摘要中如何使基于LLM的招聘不稳定

Huy Nghiem, Phuong-Anh Nguyen-Le, Sy-Tuyen Ho, Hal Daume

机构 * University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了LLM生成的简历摘要中姓名条件下的评价框架如何导致招聘决策的不稳定性,通过大规模实验发现,评价语言在分布极值处存在细微差异,尤其在开源模型中更为明显。

Comments First version, 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08570 2026-04-23 cs.LG cs.AI cs.PL cs.SE quant-ph 90%

QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation

QuanBench+: 一种统一的多框架基准用于基于LLM的量子代码生成

Ali Slim, Haydar Hamieh, Jawad Kotaich, Yehya Ghosn, Mahdi Chehimi, Ammar Mohanna, Hasan Abed Al Kader Hammoud, Bernard Ghanem

机构 * American University of Beirut(贝鲁特美国大学) King Abdullah University of Science and Technology(卡迪夫国王大学科学与技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuanBench+基准,用于评估LLM在量子代码生成中的多框架性能,通过执行测试和反馈修复机制,展示了不同框架下的代码生成效果及改进。

Comments 24 pages total, 25 figures, 5 tables, including supplementary material. Accepted to the ICLR 2026 Workshop on I Can't Believe It's Not Better

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15702 2026-04-22 cs.CL cs.LG 90%

The Metacognitive Monitoring Battery: A Cross-Domain Benchmark for LLM Self-Monitoring

元认知监控电池:一个跨领域用于LLM自我监控的基准测试

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出一个跨领域评估LLM元认知监控的基准测试,结合人类心理测量方法,通过524项任务测试学习、元认知校准等六个认知领域,揭示LLM在自信度和自我监控上的差异。

Comments 11 pages, 6 figures, 3 tables. Submitted to NeurIPS 2026 Evaluations and Datasets Track. Code, data, and Croissant metadata: https://github.com/synthiumjp/metacognitive-monitoring-battery

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18169 2026-04-21 cs.CL cs.AI 90%

Beyond Reproduction: A Paired-Task Framework for Assessing LLM Comprehension and Creativity in Literary Translation

超越复制:一种配对任务框架用于评估LLM在文学翻译中的理解与创造力

Ran Zhang, Steffen Eger, Arda Tezcan, Wei Zhao, Simone Paolo Ponzetto, Lieve Macken

机构 * Natural Language Learning Group (NLLG) School of Business Informatics and Mathematics University of Mannheim(曼海姆大学自然语言学习组(NLLG)商学院信息与数学学院) University of Technology Nuremberg (UTN), Department Engineering(纽伦堡技术大学(UTN)工程系) University of Gent, Department of Translation, Interpreting and Communication(根特大学翻译、口译与传播系) University of Aberdeen, Department of Computing Science(阿伯丁大学计算科学系) Natural Language Learning and Generation (NLLG) Lab(自然语言学习与生成(NLLG)实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种配对任务框架,评估LLM在文学翻译中的理解与创造力。通过11本书的文学片段,评估模型的文本理解与翻译创造力,发现强理解不等于人类水平的创造力,仅Mistral-Large接近人类水平。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17714 2026-04-21 cs.CL cs.AI 90%

Screen Before You Interpret: A Portable Validity Protocol for Benchmark-Based LLM Confidence Signals

在解释前筛查:一种便携式有效性协议用于基于基准的LLM置信信号

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出一种便携式有效性协议,用于评估基于基准的LLM置信信号,通过临床人格评估中的有效性筛查原则,定义了三个核心指标和结构指标,验证了20个前沿LLM在524个项目上的有效性。

Comments 25 pages, 6 figures, 8 tables, 2 appendices. Companion to arXiv:2604.15702

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13061 2026-04-20 cs.CL cs.AI 90%

Token Statistics Reveal Conversational Drift in Multi-turn LLM Interaction

令牌统计揭示多轮LLM交互中的对话漂移

Wael Hafez, Amir Nazeri

机构 * Semarx Research LLC(Semarx研究公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过令牌频率统计监测对话一致性,提出Bipredictability指标,验证其在多轮交互中的有效性,显示结构监控可补充语义评估。

Comments 13 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15859 2026-04-20 cs.LG cs.AI 90%

QuantSightBench: Evaluating LLM Quantitative Forecasting with Prediction Intervals

QuantSightBench:评估LLM定量预测的预测区间

Jeremy Qin, Maksym Andriushchenko

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuantSightBench基准,评估LLM在连续量数值预测中的表现,发现现有模型在90%覆盖率目标上普遍不足,且置信度校准随极端值恶化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15915 2026-04-17 cs.LG cs.CL 90%

AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization

AccelOpt:一种自我改进的LLM代理系统,用于AI加速器内核优化

Genghan Zhang, Shaowei Zhu, Anjiang Wei, Zhenyu Song, Allen Nie, Zhen Jia, Nandita Vijaykumar, Yida Wang, Kunle Olukotun

机构 * Anonymous Authors(匿名作者)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 AccelOpt通过迭代生成探索内核优化空间,利用优化记忆库提升AI加速器内核性能,实验证明其能力随时间提升,且成本效益高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23636 2026-04-16 cs.LG cs.AI 90%

FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation

FlexGuard: 严格度自适应的连续风险评分用于LLM内容审核

Zhihao Ding, Jinming Li, Ze Lu, Jieming Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出FlexGuard,一种基于LLM的连续风险评分系统,通过风险对齐优化提升审核准确性和在不同严格度下的鲁棒性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00954 2025-10-24 cs.CL cs.AI 90%

Annotation Guidelines-Based Knowledge Augmentation: Towards Enhancing Large Language Models for Educational Text Classification

Shiqi Liu, Sannyuya Liu, Lele Sha, Zijie Zeng, Dragan Gasevic, Zhi Liu

机构 * National Engineering Research Center of Educational Big Data, Faculty of Artificial Intelligence in Education, Central China Normal University(国家教育大数据工程研究中心,教育人工智能学院,中央财经大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments The manuscript has been accepted for publication in IEEE Transactions on Learning Technologies. https://doi.org/10.1109/TLT.2025.3570775

Journal ref Liu, S., Liu, S., Sha, L., Zeng, Z., Gasevic, D., & Liu, Z. (2025). Annotation Guideline-Based Knowledge Augmentation: Towards Enhancing Large Language Models for Educational Text Classification. IEEE Transactions on Learning Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19475 2025-09-30 cs.CL cs.AI 90%

Automatic Question & Answer Generation Using Generative Large Language Model (LLM)

Md. Alvee Ehsan, A. S. M Mehedi Hasan, Kefaya Benta Shahnoor, Syeda Sumaiya Tasneem

专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09053 2025-08-06 cs.AI cs.GT cs.LG 90%

Game Theory Meets Large Language Models: A Systematic Survey with Taxonomy and New Frontiers

Haoran Sun, Yusen Wu, Peng Wang, Wei Chen, Yukun Cheng, Xiaotie Deng, Xu Chu

机构 * CFCS, School of Computer Science, Peking University(计算机科学系,北京大学) School of Business, Jiangnan University(商学院,江南大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments A shorter conference version is published in IJCAI 2025, titled 'Game Theory Meets Large Language Models: A Systematic Survey'

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20921 2025-05-30 cs.CL cs.AI 90%

Automatic Transmission for LLM Tiers: Optimizing Cost and Accuracy in Large Language Models

Injae Na, Keonwoong Noh, Woohwan Jung

机构 * Department of Applied Artificial Intelligence, Hanyang University(应用人工智能系,翰阳大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

Comments ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01330 2024-12-03 cs.CL cs.AI 90%

The "LLM World of Words" English free association norms generated by large language models

Katherine Abramski, Riccardo Improta, Giulio Rossetti, Massimo Stella

专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

Comments 16 pages, 11 figures, associated Github page with dataset available at: https://github.com/LLMWorldOfWords/LWOW

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07635 2023-08-16 cs.CL cs.AI 90%

LLM-Mini-CEX: Automatic Evaluation of Large Language Model for Diagnostic Conversation

Xiaoming Shi, Jie Xu, Jinru Ding, Jiali Pang, Sichen Liu, Shuqing Luo, Xingwei Peng, Lu Lu, Haihong Yang, Mingtao Hu, Tong Ruan, Shaoting Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03156 2026-08-04 cs.SE cs.AI cs.HC 版本更新 90%

The Impact of LLM-Assistants on Software Developer Productivity: A Systematic Review and Mapping Study

大型语言模型助手对软件开发者生产力的影响:一项系统综述和映射研究

Amr Mohamed, Maram Assi, Mariam Guizani

机构 * Queen's University(女王大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过综述39项研究,探讨LLM助手对软件开发者生产力的影响,发现多数研究显示积极效益,但存在认知卸载和团队协作风险,研究指出需更全面的评估方法。

Comments 42 pages

Journal ref Mohamed, Amr, Maram Assi, and Mariam Guizani. "The impact of llm-assistants on software developer productivity: A systematic review and mapping study." ACM Transactions on Software Engineering and Methodology (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00476 2026-07-08 cs.AI 版本更新 90%

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

做他们所说的,而不是他们所推理的:定位LLM智能体中的忠实性差距

Yufeng Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 通过将忠实性差距分解为推理-结论和结论-行动两个步骤,在可控的德克萨斯扑克模拟器中研究LLM智能体是否按照其陈述的推理行动。

Comments submitted to COLM social simulation with LLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31281 2026-06-01 cs.CL 90%

Wind Turbine Maintenance Log Labelling Framework: LLM-Driven Data Correction and Enrichment via Semantic Extraction of Reliability Intelligence

风力涡轮机维护日志标注框架:基于LLM驱动的数据校正与语义提取的可靠性智能增强

Max Malyi, Jonathan Shek, Alasdair McDonald, Andre Biscaya

机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(能源系统研究所,工程学院,爱丁堡大学) Nadara, Lisbon, Portugal(纳达拉,里斯本,葡萄牙)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种利用大语言模型自动标准化和结构化风力涡轮机维护日志的方法,通过纠正系统代码、提取故障模式与维护动作分类,将非结构化文本转化为定量可靠性指标。

Comments An adjustable template containing the Python script architecture, applied dynamic prompts, and data schemas is hosted in an open-source GitHub repository: https://github.com/mvmalyi/llm-driven-wind-turbine-maintenance-log-labelling

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21404 2026-05-21 cs.LG 90%

What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema

十二篇LLM代理基准测试论文披露了什么:一项初步审计和开放评分方案

Mahdi Naser Moghadasi, Faezeh Ghaderi

机构 * Research Division, BrightMind AI(BrightMind AI研究部) Texas Tech University(德克萨斯理工大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文通过分析十二篇知名LLM代理基准测试论文,揭示了这些论文在评估方法披露方面的不足,设计了一种开放评分方案以提高透明度和可重复性。

Comments Pilot audit of 12 LLM agent benchmark papers; schema, codebook, and per-paper scoring sheet released. Submission to IEEE Big Data 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01446 2024-08-06 cs.CL cs.CV cs.NE 90%

Open Sesame! Universal Black Box Jailbreaking of Large Language Models

Raz Lapid, Ron Langberg, Moshe Sipper

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments Accepted at SeT-LLM @ ICLR 2024

Journal ref ICLR 2024 Workshop on Secure and Trustworthy Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09832 2024-03-18 cs.CL 90%

Scaling Behavior of Machine Translation with Large Language Models under Prompt Injection Attacks

Zhifan Sun, Antonio Valerio Miceli-Barone

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments 15 pages, 18 figures, First Workshop on the Scaling Behavior of Large Language Models (SCALE-LLM 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13928 2026-08-17 cs.CR cs.SE 新提交 90%

CoSA: Context-Aware Severity Assessment via Context Analysis with Large Language Models

CoSA:基于大语言模型的上下文分析实现上下文感知的漏洞严重程度评估

Jinfeng Jiang, Yikun Li, Chengran Yang, Ting Zhang, Wen Bin Leow, Yide Yin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 CoSA是一种基于大语言模型的上下文感知漏洞严重程度评估方法,通过两阶段仓库剪枝策略与Transformer预测器,在6816个CVSS标注实例上较最优基线提升了14.4%准确率与15.3% Macro-F1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11735 2026-08-13 cs.CL cs.AI cs.LG 新提交 90%

Locating and Controlling Implicit Personalization in Large Language Models

定位并控制大语言模型中的隐式个性化

Yueru Yan, Siqi Wu, Thai Le

机构 * Indiana University(印第安纳大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对5种大语言模型,发现追踪推荐变化的局部内部激活信号与隐式个性化行为相关,移除对应信号可抑制线索影响且保留基准性能,为控制大语言模型隐式个性化提供了因果控制思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10904 2026-08-11 cs.CR 版本更新 90%

When the Defense Writes the Refusal: Auditing Keyword-Scored Evaluation of Inference-Time Defenses for Multimodal Large Language Models

多模态大语言模型推理时防御方法的比较分析

Bulat Nutfullin, Vladimir Evgrafov, Dmitry Namiot

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文比较评估了三种推理时防御方法及其组合在InternVL和Qwen-VL系列共8个模型上的效果,发现无单一防御在所有设置中占优,组合防御导致良性查询过度拒绝率达97-100%,而简单安全提示在保持实用性的同时带来适度安全提升。

Comments 15 pages, 3 figures. Conditionally accepted at DAMDID/RCDL 2026; revised after peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27100 2026-07-30 cs.CY 新提交 90%

Can Large Language Models Represent Urban Publics? Behavioral Replication and Population Mismatch in an Affordable-Housing Experiment

大语言模型能否代表城市公众?经济适用房实验中的行为复制与人口匹配问题

Yuxuan Cai, Yequan Hu, Hongqian Li, Zhanghong Ju, Shuying Guo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 该研究以美国经济适用房调查实验对比8款开放权重LLMs与843名受访者,发现LLMs虽能近似部分总体对比,却无法保留人口结构、组内异质性等关键特征,城市规划的模型评估需测试空间与社会结构的模拟保留情况。

Comments Yuxuan Cai and Yequan Hu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00918 2026-07-28 cs.CL cs.AI cs.LG 版本更新 90%

LIBMoE: A Library for comprehensive benchmarking Mixture of Experts in Large Language Models

LIBMoE:一种用于大规模语言模型混合专家全面基准测试的库

Nam V. Nguyen, Thong T. Doan, Luong Tran, Van Nguyen, Quang Pham

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LibMoE为大规模语言模型混合专家提供统一框架,通过全面分析路由动态、初始化影响及训练模式差异,推动MoE研究标准化与创新。

Comments 40 pages

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15936 2026-07-21 cs.CY cs.HC 版本更新 90%

Large Language Models in Architecture Studio: A Framework for Learning Outcomes

大型语言模型在建筑工作室中的应用:一种学习成果的学习框架

Juan David Salazar Rodriguez, Sam Conrad Joyce, Nachamma Sockalingam, Khoo Eng Tat, Julfendi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本研究探讨了大型语言模型在建筑工作室中的应用,旨在通过AI干预解决教学挑战并提升学习成果。

Comments This work has been accepted for publication in International Conference on Human-Computer Interaction HCII 2026 (pp. 93-110)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21001 2026-07-14 cs.GT 版本更新 90%

Do Large Language Model Voters Strategize? An Oracle-Based Benchmark for Manipulation under Voting Rules

大语言模型选民会策略投票吗?一个基于预言机的投票规则操纵基准测试

Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Hamidreza Hasani Balyani, Arshia Gharagozlou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出一个基于预言机的基准测试,通过枚举所有可行报告并计算真实结果,评估大语言模型选民能否发现并执行策略投票,覆盖多种投票规则和提示条件。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00604 2026-07-02 math.OC 新提交 90%

Vehicle Routing Problem Meets Large Language Models: An Overview and Perspectives

车辆路径问题遇上大语言模型:综述与展望

Xianchao Xiu, Chong Shen, Yanjiao Zhu, Wanquan Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 综述大语言模型在车辆路径问题中的应用,涵盖模型构建、算法设计、协调工具等角色,并讨论基准测试与实验。

Comments working in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29602 2026-06-30 cs.CR 90%

An Empirical Evaluation of Prompt Injection Vulnerabilities in Large Language Models Across Multilingual and Obfuscated Attack Scenarios

多语言与混淆攻击场景下大语言模型提示注入漏洞的实证评估

Caglar Uysal, Baturay Birinci, Süha Orhun Mutluergil, Orçun Çetin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文实证评估六种大语言模型在多语言和混淆攻击下的提示注入漏洞,发现所有模型均易受攻击,非英语语言恶意合规率更高,需加强安全防御。

Comments Accepted to the AI-SS 2026 Workshop at the 21st European Dependable Computing Conference (EDCC 2026). To be published in the EDCC Companion Proceedings (EDCC-C)

详情

展开后加载摘要…

URL PDF HTML 收藏