arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2512.21347 2025-12-29 cs.SE 89%

Understanding the Role of Large Language Models in Software Engineering: Evidence from an Industry Survey

理解大型语言模型在软件工程中的作用:来自行业调查的证据

Vítor Mateus de Brito, Kleinner Farias

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文通过行业调查揭示大型语言模型在软件工程中的应用现状与影响,探讨其积极效果与潜在风险,提出需批判性使用LLM工具以提升开发效率与安全性。

Comments 4 Figures, 8 Tables, Text in Portuguese

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17164 2025-12-22 cs.IR 89%

TCDE: Topic-Centric Dual Expansion of Queries and Documents with Large Language Models for Information Retrieval

基于大语言模型的查询与文档主题聚焦双扩展方法用于信息检索

Yu Yang, Feng Tian, Ping Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 TCDE通过大语言模型实现查询与文档的主题聚焦双扩展,提升信息检索的语义对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16816 2025-12-19 cs.SE 89%

Toward Systematic Counterfactual Fairness Evaluation of Large Language Models: The CAFFE Framework

迈向大型语言模型系统性反事实公平性评估:CAFFE框架

Alessandra Parziale, Gianmario Voria, Valeria Pontillo, Gemma Catolino, Andrea De Lucia, Fabio Palomba

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 CAFFE框架通过结构化和意图感知的方法系统评估大型语言模型的反事实公平性,提升了公平性检测的广度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13004 2025-12-16 eess.SY cs.SY 89%

Large Language Models for Power System Applications: A Comprehensive Literature Survey

大语言模型在电力系统应用中的综述:全面的文献调查

Muhammad Sarwar, Muhammad Rizwan, Mubushra Aziz, Abdul Rehman Sudais

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了大语言模型在电力系统中的应用,探讨了其在故障诊断、负荷预测等领域的潜力及面临的挑战,提出未来研究方向。

Comments 17 pages, 1 table, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14295 2025-12-10 cs.CL cs.AI cs.LG 89%

AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models

AraLingBench:一个用于评估大型语言模型阿拉伯语语言能力的人工标注基准

Mohammad Zbeeb, Hasan Abed Al Kader Hammoud, Sina Mukalled, Nadine Rizk, Fatima Karnib, Issam Lakkis, Ammar Mohanna, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(卡斯泰克大学) American University of Beirut (AUB)(贝鲁特美国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AraLingBench通过150道人工标注的多项选择题评估阿拉伯语LLM的语言能力,揭示模型在语法和句法推理上的不足,强调了记忆与模式识别对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07007 2025-12-10 cs.CV 89%

MELLM: A Flow-Guided Large Language Model for Micro-Expression Understanding

MELLM:一种面向微表情理解的流引导大型语言模型

Sirui Zhao, Zhengye Zhang, Shifeng Liu, Xinglong Mao, Shukang Yin, Chaoyou Fu, Tong Xu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Nanjing University(南京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 MELLM通过结合光学流敏感性与LLM推理能力,首次实现对微表情的全面理解,显著提升微表情识别的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06248 2025-12-09 cs.SE 89%

CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models

CFCEval: 评估大型语言模型生成代码的安全性方面

Cheng Cheng, Jinqiu Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 CFCEval通过引入MLVBench和ELRM指标,有效评估大型语言模型生成代码的质量与安全性,提升代码评估的准确性和全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21371 2025-12-09 eess.SY cs.SY 89%

Evaluation of Large Language Models for Numeric Anomaly Detection in Power Systems

大型语言模型在电力系统中数值异常检测中的评估

Yichen Liu, Hongyu Wu, Bo Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了GPT-OSS-20B在电力系统中用于数值异常检测的性能,采用多种方法并结合三西格玛准则,探讨LLM在电网应用中的潜力与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18908 2025-12-08 eess.AS 89%

A Survey on Speech Large Language Models for Understanding

语音大语言模型理解综述

Jing Peng, Yucheng Wang, Bohan Li, Yiwei Guo, Hankun Wang, Yangui Fang, Yu Xi, Haoyu Li, Xu Li, Ke Zhang, Shuai Wang, Kai Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了语音大语言模型的理解方法,分析其架构并提出解决指令敏感性和语义推理退化问题的方向。

Comments This paper has been ACCEPTED for publication as a SPECIAL ISSUE paper in the IEEE Journal of Selected Topics in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04643 2025-12-05 cs.CV cs.AI cs.CL cs.LG 89%

SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding

SEASON: 通过自诊断对比解码缓解视频大语言模型中的时间幻觉

Chang-Hsun Wu, Kai-Po Chang, Yu-Yang Sheng, Hung-Kai Chung, Kuei-Chun Wang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SEASON通过自诊断对比解码方法,无需训练即可提升视频大语言模型在时间信息处理上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11059 2025-12-03 cs.SE 89%

Defects4C: Benchmarking Large Language Model Repair Capability with C/C++ Bugs

Defects4C:利用C/C++漏洞基准测试大语言模型的修复能力

Jian Wang, Xiaofei Xie, Qiang Hu, Shangqing Liu, Jiongchi Yu, Jiaolong Kong, Yi Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 Defects4C通过提供高质量C/C++漏洞基准测试,评估大语言模型在修复C/C++程序中的有效性,揭示当前技术的局限性并推动未来研究。

Comments ASE-2025 main research paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01568 2025-12-03 cs.LG cs.AI cs.CL cs.CY 89%

Do Large Language Models Walk Their Talk? Measuring the Gap Between Implicit Associations, Self-Report, and Behavioral Altruism

大型语言模型是否言出必行?隐含关联、自我报告与行为利他主义之间的差距测量

Sandro Andric

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现大型语言模型在隐含利他主义偏见和自我报告与实际行为之间存在显著差距,建议将校准差距作为衡量标准。

Comments 14 pages, 7 figures, 7 tables. Code and data available at https://github.com/sandroandric/LLMs_Altruism_Study_Code

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11452 2025-12-03 cs.IR 89%

Leveraging Reference Documents for Zero-Shot Ranking via Large Language Models

通过大型语言模型利用参考文档实现零样本排序

Jieran Li, Xiuyuan Hu, Yang Zhao, Shengyao Zhuang, Hao Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 RefRank 通过利用固定参考文档实现零样本排序,以线性时间复杂度提升排序准确性并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22047 2025-12-01 cs.CR 89%

Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks

评估大型语言模型安全防护措施对对抗攻击的鲁棒性

Richard J. Young

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究评估了大型语言模型安全防护措施对对抗攻击的鲁棒性,发现模型在未见过的提示上表现显著下降,且存在新的失败模式,强调泛化能力的重要性。

Comments 21 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22016 2025-12-01 cs.CL cs.AI cs.LG 89%

AfriStereo: A Culturally Grounded Dataset for Evaluating Stereotypical Bias in Large Language Models

AfriStereo:一种基于文化背景的数据集,用于评估大型语言模型中的刻板印象偏见

Yann Le Beux, Oluchi Audu, Oche D. Ankeli, Dhananjay Balakrishnan, Melissah Weya, Marie D. Ralaiarinosy, Ignatius Ezeani

专题命中 评测与基准 :language model(title,abstract);large language model(title);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AfriStereo通过构建基于非洲文化的数据集,评估大型语言模型中的刻板印象偏见,揭示了模型在性别、年龄、职业等维度上的系统性偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09606 2025-11-27 cs.CR 89%

How Can We Effectively Use LLMs for Phishing Detection?: Evaluating the Effectiveness of Large Language Model-based Phishing Detection Models

如何有效利用大语言模型进行钓鱼检测?:评估基于大语言模型的钓鱼检测模型的有效性

Fujiao Ji, Doowon Kim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了基于大语言模型的钓鱼检测有效性,发现商业模型在检测中表现更优,截图输入在品牌识别中效果最佳,但需注意温度设置和多模态输入的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08087 2025-11-26 cs.CR 89%

Securing Large Language Models: Addressing Bias, Misinformation, and Prompt Attacks

保障大语言模型:应对偏见、虚假信息和提示攻击

Benji Peng, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Junyu Liu, Xinyuan Song, Qian Niu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文探讨了大语言模型在偏见、虚假信息和提示攻击方面的安全问题,分析了偏见缓解策略、内容检测机制及防御措施,强调了对LLM安全领域进一步研究的重要性。

Comments 17 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11410 2025-11-17 cs.CV 89%

Q-Doc: Benchmarking Document Image Quality Assessment Capabilities in Multi-modal Large Language Models

Jiaxi Huang, Dongxu Wu, Hanwei Zhu, Lingyu Zhu, Jun Xing, Xu Wang, Baoliang Chen

机构 * South China Normal University(华南师范大学) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Shenzhen Academy of Inspection and Quarantine(深圳检验检疫局) Shenzhen University(深圳大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10418 2025-11-14 cs.DB 89%

CityVerse: A Unified Data Platform for Multi-Task Urban Computing with Large Language Models

Yaqiao Zhu, Hongkai Wen, Mark Birkin, Man Luo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11034 2025-11-14 cs.SE 89%

The Impact of Large Language Models (LLMs) on Code Review Process

Antonio Collante, Samuel Abedu, SayedHassan Khatoonabadi, Ahmad Abdellatif, Ebube Alor, Emad Shihab

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03739 2025-11-11 cs.CV 89%

ChestGPT: Integrating Large Language Models and Vision Transformers for Disease Detection and Localization in Chest X-Rays

Shehroz S. Khan, Petar Przulj, Ahmed Ashraf, Ali Abedi

机构 * College of Engineering and Technology, American University of the Middle East(工程与技术学院,中东大学) Faculty of Applied Science and Engineering, University of Toronto(应用科学与工程学院,多伦多大学) Department of Electrical and Computer Engineering, University of Manitoba(电气与计算机工程系,曼尼托巴大学) KITE Research Institute, Toronto Rehabilitation Institute, University Health Network(KITE研究机构,多伦多康复研究所,大学健康网络)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 8 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23262 2025-11-10 cs.CY 89%

Applying Large Language Models to Travel Satisfaction Analysis

Pengfei Xu, Donggen Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04267 2025-11-07 cs.SE 89%

A Tool for Benchmarking Large Language Models' Robustness in Assessing the Realism of Driving Scenarios

Jiahui Wu, Chengjie Lu, Aitor Arrieta, Shaukat Ali

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18658 2025-11-07 cs.CL cs.AI cs.LG 89%

Robustness in Large Language Models: A Survey of Mitigation Strategies and Evaluation Metrics

Pankaj Kumar, Subhankar Mishra

机构 * School of Computer Sciences(计算机科学学院) National Institute of Science Education and Research(国家科学教育与研究 institute) An OCC of Homi Bhabha National Institute, India(霍米·巴布国家研究所办公室,印度)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12593 2025-11-06 cs.PL 89%

Converting IEC 61131-3 LD into SFC Using Large Language Model: Dataset and Testing

Yimin Zhang, Mario de Sousa

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08903 2025-11-05 cs.SE 89%

Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks

Xing Hu, Feifei Niu, Junkai Chen, Xin Zhou, Junwei Zhang, Junda He, Xin Xia, David Lo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00624 2025-11-04 cs.SE 89%

Can Large Language Models Detect Real-World Android Software Compliance Violations?

Haoyi Zhang, Huaijin Ran, Xunzhu Tang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08604 2025-10-31 cs.CL cs.AI cs.LG 89%

LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback

Raffaele Mura, Giorgio Piras, Kamilė Lukošiūtė, Maura Pintor, Amin Karbasi, Battista Biggio

机构 * University of Cagliari(卡利亚里大学) Centre for AI Governance(人工智能治理中心) Foundation AI – Cisco Systems Inc.(AI基金会——思科系统公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20945 2025-10-31 cs.CR 89%

IRCopilot: Automated Incident Response with Large Language Models

Xihuan Lin, Jie Zhang, Gelei Deng, Tianzhe Liu, Tianwei Zhang, Qing Guo, Riqing Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15066 2025-10-31 cs.HC cs.CY 89%

Constraining Participation: Affordances of Feedback Features in Interfaces to Large Language Models

Ned Cooper, Alexandra Zafiroglu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Version accepted for publication

Journal ref ACM Journal on Responsible Computing, Volume 2, Issue 4, Article 16 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏