arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2510.16928 2026-06-12 cs.CL 版本更新 91%

ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models

ChiKhaPo: 一个用于评估大型语言模型词汇理解与生成能力的大规模多语言基准

Emily Chang, Niyati Bafna

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Johns Hopkins University, Center for Language and Speech Processing(约翰霍普金斯大学语言与语音处理中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 针对现有基准语言覆盖不足且侧重高阶任务的问题,提出ChiKhaPo基准,包含8个子任务,覆盖2700+种语言,评估LLM的词汇理解与生成能力,发现6个SOTA模型表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00051 2026-06-02 cs.CY cs.AI 91%

Business Utility of Large Language Models as Exploratory Data Analysis Agents

大型语言模型作为探索性数据分析代理的商业实用性

Rafał Łabędzki, Patryk Miziuła, Hubert Rutkowski, Szymon Betlewski, Cezary Depta, Szymon Janowski, Jarosław Kochanowicz, Jan Kanty Milczek

机构 * deepsense.ai SGH Warsaw School of Economics(SGH沃兹尼亚克经济学院) Bydgoszcz University of Science and Technology(比得戈茨茨理工大学) Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 通过基于代理的供应链模拟基准,评估LLM作为EDA代理在商业环境中的平均性能与可重复性,提出风险调整指标Business utility,发现多数配置不可靠,GPT-5.4表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05427 2026-06-02 cs.AI 91%

The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models

拒绝-顺从权衡:大型语言模型的大规模安全行为审计

Alif Al Hasan, Sumon Biswas

机构 * Department of Computer and Data Sciences(计算机与数据科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);post-training(abstract)

AI总结 本研究通过调整组合方法隔离模型敏感性与数据集毒性混淆,审计了21个开源权重LLM在四个安全基准上的拒绝与顺从失败模式,发现模型采用不同校准策略、人口保护不平等以及拒绝与顺从倾向在模型家族内稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24621 2026-06-02 cs.CL 91%

Benchmarking Large Language Models for Cryptanalysis and Side-Channel Vulnerabilities

大型语言模型在密码分析和侧信道漏洞方面的基准测试

Utsav Maskey, Chencheng Zhu, Usman Naseem

机构 * Macquarie University(麦考瑞大学) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究通过零样本和少样本设置及思维链提示,评估大型语言模型在多种加密算法生成的密文上的解密成功率,揭示其在侧信道场景中的能力与局限,并讨论欠泛化相关攻击的风险。

Comments EMNLP'25 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30481 2026-06-01 cs.CL 91%

When English Rewrites Local Knowledge: Global Narrative Dominance in Large Language Models

当英语重写地方知识:大语言模型中的全球叙事主导

Md Arid Hasan, Ruwad Naswan, Farhan Samir, Sharifa Sultana, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) BUET(巴特利特大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究通过构建孟加拉语文化数据集CulturalNB,评估大语言模型在低资源文化背景下的跨语言知识一致性,发现英语提问会系统性地增加全球替代和制度框架,减少地方视角覆盖,表明文化失败不仅是知识缺失,更是根基和叙事优先级问题。

Comments Submitted to ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28313 2026-05-28 cs.CL 91%

Argument Quality Assessment with Large Language Models: A Pairwise Bradley-Terry Approach

基于大语言模型的论证质量评估:一种成对Bradley-Terry方法

Nicolás Benjamín Ocampo, Agnes Paullate Nyiranziza, Davide Ceolin

机构 * Centrum Wiskunde & Informatica, The Netherlands(荷兰代尔夫特理工大学) Vrije Universiteit Amsterdam, The Netherlands(荷兰阿姆斯特丹自由大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究利用12种开源大语言模型,通过成对比较和Bradley-Terry模型评估论证质量,发现Llama-70B与人类专家判断具有中等一致性(Cohen's κ=0.493),其他模型表现各异但互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28037 2026-05-28 cs.CL 91%

Personality, Role, and Expressive Style in Large Language Models: An Interactionist Analysis

大型语言模型中的个性、角色与表达风格:一种互动主义分析

Moe Nagao, Koichiro Terao, Mikio Nakano, Naoto Iwahashi

机构 * Okayama Prefectural University(冈山县立大学) AI & Humans Lab(人工智能与人类实验室) C4A Research Institute(C4A研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究从互动主义视角,通过因子设计实验分析个性特质、对话角色和表达风格如何共同影响大型语言模型生成对话中感知的大五人格特质表达。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18481 2026-05-28 q-fin.TR cs.AI 91%

AlphaForgeBench: Benchmarking End-to-End Trading Strategy Design with Large Language Models

AlphaForgeBench:用大型语言模型对端到端交易策略设计进行基准测试

Wentao Zhang, Mingxuan Zhao, Jincheng Gao, Jieshun You, Huaiyu Jia, Yilei Zhao, Bo An, Shuo Sun

机构 * Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出AlphaForgeBench框架,将LLM从随机交易代理重新定义为量化研究员,通过生成可执行alpha因子和基于因子的交易策略,消除执行不稳定,实现可复现的金融推理评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26100 2026-05-26 cs.SE cs.AI 91%

Beyond Summaries: Structure-Aware Labeling of Code Changes with Large Language Models

超越摘要:基于结构感知的代码变更标注与大型语言模型

Bar Weiss, Antonio Abu-Nassar, Adi Sosnovich, Karen Yorav

机构 * Viterbi Faculty of Electrical and Computer Engineering(电气与计算机工程学院) IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 提出两阶段流水线,利用大型语言模型对代码补丁中的变更进行基于分类的标注,捕获结构关系和语义属性,以提升代码审查效率。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18788 2026-05-25 cs.CL 91%

BURMESE-SAN: Burmese NLP Benchmark for Evaluating Large Language Models

BURMESE-SAN: 评估大语言模型的缅甸语NLP基准

Thura Aung, Jann Railey Montalan, Jian Gang Ngui, Peerat Limkonchotiwat

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);instruction tuning(abstract)

AI总结 提出首个全面评估大语言模型在缅甸语上理解、推理和生成能力的基准BURMESE-SAN,包含七个子任务,并通过母语者驱动构建确保语言自然性和文化真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21362 2026-05-21 cs.CL 91%

LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models

LASH:适应性语义混合用于大语言模型的黑盒劫持

Abdullah Al Nomaan Nafi, Fnu Suya, Swarup Bhunia, Prabuddha Chakraborty

机构 * University of Maine(缅因大学) University of Tennessee, Knoxville(田纳西大学, 基纳顿分校) University of Florida(佛罗里达大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出LASH框架,通过适应性语义混合方法,利用多个基础攻击的输出作为可重用的种子提示,针对不同目标模型和有害类别进行自适应组合,从而在黑盒红队测试中取得更高的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12871 2026-05-19 cs.CL 91%

MentalBench: A DSM-Grounded Benchmark for Evaluating Psychiatric Diagnostic Capability of Large Language Models

MentalBench: 一个用于评估大语言模型 psychiatric 诊断能力的 DSM 基础基准

Hoyun Song, Migyeong Kang, Jisu Shin, Jihyun Kim, Chanbi Park, Hangyeol Yoo, Jihyun An, Alice Oh, Jinyoung Han, KyungTae Lim

机构 * KAIST(韩国科学技术院) Sungkyunkwan University(成均馆大学) Dongguk University Medical Center(东国大学医学院) Seoultech(首尔技术大学) Samsung Medical Center(三星医疗中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文提出 MentalBench,一个用于评估大语言模型在不同临床模糊程度下能否做出 DSM 基础的 psychiatric 诊断决策的基准。该基准基于 psychiatrist 构建并验证的知识图谱,生成了 24,750 个合成临床案例,以系统地变化信息完整性和诊断复杂性,从而实现 DSM 基础的评估。实验表明,尽管最先进的 LLM 在噪声自由查询上表现良好,但它们在区分具有重叠症状的诊断时难以校准其信心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13873 2026-05-15 cs.DL cs.AI cs.HC 91%

Large Language Models for Web Accessibility: A Systematic Literature Review

用于网络可访问性的大型语言模型:系统文献综述

Wajdi Aljedaani, Rubel Hassan Mollik

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文综述了38篇研究,探讨了大型语言模型在网页可访问性中的应用,发现大多数研究集中在文本导向和结构明确的任务,主要参考WCAG标准,但对认知可访问性指南考虑有限,评估方法多样且缺乏残障用户直接参与。

Comments Accepted at the 23rd International Web for All Conference (W4A 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00245 2026-05-04 cs.AI 91%

ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts

ARMOR 2025:一种评估大语言模型安全性的军事对齐基准,超越民用情境

Sydney Johns, Heng Jin, Chaoyu Zhang, Y. Thomas Hou, Wenjing Lou

机构 * Virginia Polytechnic Institute and State University(弗吉尼亚理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文提出ARMOR 2025基准,基于军事 doctrine 提出安全评估方法,通过12类分类和519个军事相关提示,评估21种商业LLM在军事应用中的安全对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27454 2026-05-04 cs.CL 91%

Exploring Applications of Transfer-State Large Language Models: Cognitive Profiling and Socratic AI Tutoring

探索迁移态大型语言模型的应用:认知画像与苏格拉底式AI辅导

Minori Noguchi

机构 * Hitachi High-Tech Corporation(日立高新技术公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文探讨迁移态LLM在认知画像和苏格拉底式AI辅导中的应用,通过初步调查和实验发现迁移态在辅导表现指标上显著优于非迁移态,提出迁移态作为操作性状态的实用价值。

Comments 29 pages, 5 figures, 7 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25927 2026-04-30 cs.CL 91%

Information Extraction from Electricity Invoices with General-Purpose Large Language Models

从电力账单中提取信息:通用大型语言模型

Javier Gómez, Javier Sánchez

机构 * Centro de Tecnologías de la Imagen (CTIM)(图像技术中心) Instituto Universitario de Cibernética, Empresas y Sociedad (IUCES)(大学网络研究所、企业与社会) University of Las Palmas de Gran Canaria(大加那利岛大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 研究评估通用大型语言模型在无需特定任务微调的情况下从西班牙电力账单中提取结构化信息的能力,发现提示质量对提取精度影响显著。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05432 2026-04-29 cs.AI 91%

AInstein: Can LLMs Solve Research Problems From Parametric Memory Alone?

AInstein:LLM能否仅凭参数记忆解决研究问题?

Shambhavi Mishra, Gaurav Sahu, Marco Pedersoli, Laurent Charlin, Jose Dolz, Christopher Pal

机构 * LIVIA, ÉTS Montréal(LIVIA,蒙特利尔工程学院) Mila – Quebec AI Institute(魁北克人工智能研究所) HEC Montréal(蒙特利尔HEC学院) ServiceNow Research(ServiceNow研究) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) International Laboratory on Learning Systems (ILLS)(学习系统国际实验室)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出AInstein框架,测试LLM能否通过迭代批评循环生成和改进解决方案。研究发现LLM在70%的问题上成功,但重新发现已发表方案的比例低于19%,表明真正的解决问题能力。但LLM在跨领域类比迁移时存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03108 2026-04-22 cs.CL 91%

ChemPro: A Progressive Chemistry Benchmark for Large Language Models

ChemPro:一种渐进式的化学基准测试用于大语言模型

Aaditya Baranwal, Shruti Vyas

机构 * Aaditya Baranwal Shruti Vyas

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 ChemPro通过4100个化学问题-答案对评估大语言模型在化学领域的表现,涵盖多个难度层级,揭示了LLM在科学推理中的局限性。

Comments Accepted at Artificial Intelligence Chemistry Journal

Journal ref Artif. Intell. Chem. 4(1), 100118 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17053 2026-04-21 cs.CL 91%

Jailbreaking Large Language Models with Morality Attacks

通过道德攻击 jailbreak 大型语言模型

Ying Su, Mingen Zheng, Weili Diao, Haoran Li

机构 * South China University of Technology(南方科技大学) HKUST(香港科技大学) Beihang University(北航大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文通过道德攻击研究大型语言模型的内部道德价值观,构建了包含10300个实例的道德数据集,提出了四种对抗攻击方法,揭示了LLM和防护模型在道德感知攻击中的关键漏洞。

Comments 27 pages, 6 figures, 18 tables. Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06660 2026-02-27 cs.CR cs.AI 91%

Towards Small Language Models for Security Query Generation in SOC Workflows

面向SOC工作流中安全查询生成的小语言模型

Saleha Muzammil, Rahul Reddy, Vishal Kamalakrishnan, Hadi Ahmadi, Wajih Ul Hassan

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);SLM(abstract)

AI总结 本文提出一个三调节框架,利用小型语言模型实现高效、低成本的安全查询生成,实验表明其在语法和语义准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17652 2026-01-09 cs.CL 91%

Qomhra: A Bilingual Irish and English Large Language Model

Qomhra: 一种双语爱尔兰语和英语大语言模型

Joseph McInerney, Khanh-Tung Tran, Liam Lonergan, Ailbhe Ní Chasaide, Neasa Ní Chiaráin, Barry Devereux

机构 * Trinity College Dublin(三一学院) University College Cork(科克大学) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 Qomhra是一种双语爱尔兰语和英语大语言模型,通过低资源约束下的方法生成人类偏好数据,显著提升了爱尔兰语和英语的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07666 2025-12-09 cs.CL cs.SE 91%

Bridging Code Graphs and Large Language Models for Better Code Understanding

连接代码图与大型语言模型以实现更好的代码理解

Zeqi Chen, Zhaoyang Chu, Yi Gui, Feng Guo, Yao Wan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 CGBridge通过引入外部Bridge模块,提升LLMs对代码结构语义的理解,显著提高代码生成和翻译任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19422 2025-11-25 cs.SE cs.AI cs.PL 91%

SLMFix: Leveraging Small Language Models for Error Fixing with Reinforcement Learning

SLMFix:利用小型语言模型通过强化学习进行错误修复

David Jiahao Fu, Aryan Gupta, Aaron Councilman, David Grove, Yu-Xiong Wang, Vikram Adve

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 SLMFix通过强化学习微调小型语言模型,有效修复LLMs生成代码的语法错误,提升领域特定语言代码质量,优于传统微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08878 2025-07-15 cs.CR cs.AI 91%

Towards Privacy-Preserving and Personalized Smart Homes via Tailored Small Language Models

Xinyu Huang, Leming Shen, Zijing Ma, Yuanqing Zheng

机构 * Department of Computing, The Hong Kong Polytechnic University(计算机系,香港理工大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08031 2025-07-15 cs.CL 91%

Beyond Scale: Small Language Models are Comparable to GPT-4 in Mental Health Understanding

Hong Jia, Shiya Fu, Feng Xia, Vassilis Kostakos, Ting Dang

机构 * University of Melbourne(墨尔本大学) University of Auckland(奥克兰大学) RMIT University(皇家墨尔本理工学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08194 2025-06-18 cs.DB cs.LG 91%

Magneto: Combining Small and Large Language Models for Schema Matching

Yurong Liu, Eduardo Pena, Aecio Santos, Eden Wu, Juliana Freire

机构 * New York University Federal University of Technology Paran\' a

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);small language model(abstract);SLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04516 2025-06-06 cs.CL 91%

DRE: An Effective Dual-Refined Method for Integrating Small and Large Language Models in Open-Domain Dialogue Evaluation

Kun Zhao, Bohao Yang, Chen Tang, Siyuan Dai, Haoteng Tang, Chenghua Lin, Liang Zhan

机构 * Department of Electrical and Computer Engineering, University of Pittsburgh(匹兹堡大学电气与计算机工程系) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Department of Computer Science, University of Texas Rio Grande Valley(德克萨斯理工大学里奥格兰德谷分校计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

Comments arXiv admin note: text overlap with arXiv:2405.15924

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17876 2024-08-09 cs.CL 91%

TarGEN: Targeted Data Generation with Large Language Models

Himanshu Gupta, Kevin Scaria, Ujjwala Anantheswaran, Shreyas Verma, Mihir Parmar, Saurabh Arjun Sawant, Chitta Baral, Swaroop Mishra

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments COLM 2024, 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16801 2024-06-27 cs.CL 91%

RES-Q: Evaluating Code-Editing Large Language Model Systems at the Repository Scale

Beck LaBash, August Rosedale, Alex Reents, Lucas Negritto, Colin Wiel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00858 2024-02-02 cs.CL 91%

Can Large Language Models Understand Context?

Yilun Zhu, Joel Ruben Antony Moniz, Shruti Bhargava, Jiarui Lu, Dhivya Piraviperumal, Site Li, Yuan Zhang, Hong Yu, Bo-Hsiang Tseng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Findings of EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏