arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31906 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31906 篇

2511.19872 2025-11-27 cs.AI 90%

Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy

大语言模型的模拟自我评估:一种心理测量方法用于AI自我效能

Daniel I Jackson, Emma L Jensen, Syed-Amad Hussain, Emre Sezgin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过心理测量方法评估大语言模型的自我效能,发现模型自我评估与实际表现不一致,且不同任务表现差异显著。

Comments 25 pages,5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15585 2025-11-27 cs.SE cs.CL cs.PL 90%

Leveraging Test Driven Development with Large Language Models for Reliable and Verifiable Spreadsheet Code Generation: A Research Framework

利用大型语言模型进行测试驱动开发以实现可靠且可验证的电子表格代码生成:一种研究框架

Simon Thorne, Advait Sarkar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出一种结合测试驱动开发与大型语言模型的框架,以提高电子表格代码生成的可靠性与准确性。

Comments 16 pages

Journal ref Proceedings of the EuSpRIG 2025 Conference "Spreadsheet Productivity & Risks" ISBN : 978-1-905404-60-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16383 2025-11-26 cs.CL 90%

Large Language Models in Argument Mining: A Survey

大型语言模型在论证挖掘中的应用:综述

Hao Li, Viktor Schlegel, Yizheng Sun, Riza Batista-Navarro, Goran Nenadic

机构 * University of Manchester(曼彻斯特大学) Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文综述了大型语言模型对论证挖掘领域的影响,分析了LLM如何改变任务设计、数据集构建和评估方法,并提出了未来研究方向。

Comments Work draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06227 2025-11-11 cs.SE cs.AI cs.CE 90%

Assertion-Aware Test Code Summarization with Large Language Models

Anamul Haque Mollah, Ahmed Aljohani, Hyunsook Do

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted for publication at 2nd ACM International Conference on AI-powered Software (AIware 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20916 2025-11-11 cs.CL 90%

SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement

Yuan Ge, Junxiang Zhang, Xiaoqian Liu, Bei Li, Xiangnan Ma, Chenglong Wang, Kaiyang Ye, Yangfan Du, Linfeng Zhang, Yuxin Huang, Tong Xiao, Zhengtao Yu, JingBo Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04989 2025-11-10 cs.CL 90%

Acquiring Common Chinese Emotional Events Using Large Language Model

Ya Wang, Guangzheng Zhu, Cungen Cao, Jingjing Li, He Li, Xin Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments I am the second author (Guangzheng Zhu) and I am submitting this paper on behalf of all co-authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11137 2025-11-10 cs.CL 90%

Scalable Medication Extraction and Discontinuation Identification from Electronic Health Records Using Large Language Models

Chong Shao, Douglas Snyder, Chiran Li, Bowen Gu, Kerry Ngan, Chun-Ting Yang, Jiageng Wu, Richard Wyss, Kueiyu Joshua Lin, Jie Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04328 2025-11-07 cs.AI 90%

RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation

Jiahao Zhao, Luxin Xu, Minghuan Tan, Lichao Zhang, Ahmadreza Argha, Hamid Alinejad-Rokny, Min Yang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Electronic Science and Technology of China(电子科技大学) Shenzhen University of Advanced Technology(深圳大学) School of Biomedical Engineering, UNSW Sydney(生物医学工程学院,UNSW悉尼)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments To appear in BIBM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02458 2025-11-05 cs.CL cs.CE econ.GN q-fin.EC 90%

Prompting for Policy: Forecasting Macroeconomic Scenarios with Synthetic LLM Personas

Giulia Iadisernia, Carolina Camassa

机构 * Banca d’Italia(意大利银行)

专题命中 评测与基准 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

Comments 9 pages, 8-pages appendix, accepted at ICAIF 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11373 2025-11-03 cs.CL cs.CY 90%

Cancer-Myth: Evaluating Large Language Models on Patient Questions with False Presuppositions

Wang Bill Zhu, Tianqi Chen, Xinyan Velocity Yu, Ching Ying Lin, Jade Law, Mazen Jizzini, Jorge J. Nieva, Ruishan Liu, Robin Jia

机构 * Department of Computer Science, USC(美国斯克里普斯大学计算机科学系) Keck School of Medicine, USC(美国斯克里普斯大学凯克医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03913 2025-10-07 cs.CL 90%

PsycholexTherapy: Simulating Reasoning in Psychotherapy with Small Language Models in Persian

Mohammad Amin Abbasi, Hassan Naderi

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02962 2025-10-06 cs.CL 90%

Leave No TRACE: Black-box Detection of Copyrighted Dataset Usage in Large Language Models via Watermarking

Jingqi Zhang, Ruibo Chen, Yingqing Yang, Peihua Mai, Heng Huang, Yan Pang

机构 * Antiquus S. Hippocampus, Natalia Cerebro & Amelie P. Amygdale Department of Computer Science Cranberry-Lemon University Pittsburgh, PA 15213, USA(计算机科学系,Cranberry-Lemon大学) Ji Q. Ren & Yevgeny LeNet Department of Computational Neuroscience University of the Witwatersrand Joburg, South Africa(计算神经科学系,沃特瓦特斯兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01761 2025-10-06 cs.CL 90%

Same evaluation, more tokens: On the effect of input length for machine translation evaluation using Large Language Models

Tobias Domhan, Dawei Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted at EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25197 2025-10-01 cs.SE cs.AI cs.PL 90%

Towards Repository-Level Program Verification with Large Language Models

Si Cheng Zhong, Xujie Si

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted to LMPL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21192 2025-09-29 cs.CL 90%

GEP: A GCG-Based method for extracting personally identifiable information from chatbots built on small language models

Jieli Zhu, Vi Ngoc-Nha Tran

机构 * Department of Computer Science(计算机科学系) The Arctic University of Norway(挪威北极大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

Comments 16 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05262 2025-09-18 cs.CL 90%

Do Large Language Models Truly Grasp Addition? A Rule-Focused Diagnostic Using Two-Integer Arithmetic

Yang Yan, Yu Lu, Renjun Xu, Zhenzhong Lan

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted by EMNLP'25 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18337 2025-09-16 cs.CL 90%

Can LLMs assist with Ambiguity? A Quantitative Evaluation of various Large Language Models on Word Sense Disambiguation

T. G. D. K. Sumanathilaka, Nicholas Micallef, Julian Hough

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 12 pages,6 tables, 1 figure, Proceedings of the 1st International Conference on NLP & AI for Cyber Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08829 2025-09-12 cs.CY cs.AI cs.IR 90%

PerFairX: Is There a Balance Between Fairness and Personality in Large Language Model Recommendations?

Chandan Kumar Sah

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 10 pages, 5 figures. Accepted to the Workshop on Multimodal Continual Learning (MCL) at ICCV 2025. @2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), ICCV's 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05471 2025-09-09 cs.CR cs.AI 90%

Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models

Youjia Zheng, Mohammad Zandsalimy, Shanu Sushmita

机构 * Northeastern University(东北大学) Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17675 2025-09-09 cs.LG 90%

Towards Synthesizing Normative Data for Cognitive Assessments Using Generative Multimodal Large Language Models

Victoria Yan, Honor Chotkowski, Fengran Wang, Xinhui Li, Carl Yang, Jiaying Lu, Runze Yan, Xiao Hu, Alex Fedorov

机构 * The Westminster Schools(韦斯敏斯特学校) Center for Data Science, Nell Hodgson Woodruff School of Nursing, Emory University(数据科学中心、恩莫森护理学院、埃默里大学) Department of Computer Science, Emory University(计算机科学系、埃默里大学) School of Electrical and Computer Engineering, Georgia Institute of Technology(电气与计算机工程学院、佐治亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14096 2025-09-09 cs.CV cs.AI 90%

Image Segmentation with Large Language Models: A Survey with Perspectives for Intelligent Transportation Systems

Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(Iowa State University) Department of Civil, Construction and Environmental Engineering, Iowa State University, Ames, IA, USA(Iowa State University)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02855 2025-09-04 cs.CL cs.CY 90%

IDEAlign: Comparing Large Language Models to Human Experts in Open-ended Interpretive Annotations

Hyunji Nam, Lucia Langlois, James Malamut, Mei Tan, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 10 pages, 9 pages for appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00963 2025-09-03 cs.CY cs.AI 90%

Who Gets Left Behind? Auditing Disability Inclusivity in Large Language Models

Deepika Dash, Yeshil Bangera, Mithil Bangera, Gouthami Vadithya, Srikant Panda

机构 * IBM India(IBM印度分公司) University of New Haven(新罕布什尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18638 2025-08-29 cs.HC cs.AI 90%

Prompt Engineering and the Effectiveness of Large Language Models in Enhancing Human Productivity

Rizal Khoirul Anam

机构 * Department of Computer Science(计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 38 pages, 15 tables, 5 figures. Submitted as a research paper draft for arXiv. Based on survey data collected in 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05123 2025-08-27 cs.CL 90%

A Survey on Data Selection for LLM Instruction Tuning

Bolin Zhang, Jiahao Wang, Qianlong Du, Jiajun Zhang, Zhiying Tu, Dianhui Chu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))

专题命中 评测与基准 :LLM(title,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)

Comments Published in JAIR (Vol. 83, Article 32, 2025)

Journal ref Journal of Artificial Intelligence Research, 83:32, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24102 2025-08-25 cs.CL 90%

Is Small Language Model the Silver Bullet to Low-Resource Languages Machine Translation?

Yewei Song, Lujun Li, Cedric Lothritz, Saad Ezzini, Lama Sleem, Niccolo Gentile, Radu State, Tegawendé F. Bissyandé, Jacques Klein

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02312 2025-08-05 cs.CR cs.AI 90%

A Survey on Data Security in Large Language Models

Kang Chen, Xiuze Zhou, Yuanguo Lin, Jinhe Su, Yuanhui Yu, Li Shen, Fan Lin

机构 * School of Computer Engineering, Jimei University, Xiamen, 361021, China(厦门大学计算机工程学院) College of Science, Mathematics and Technology, Wenzhou-Kean University, Wenzhou, 325060, China(温州-凯恩大学科学、数学与技术学院) The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, 511453, China(香港科学与技术大学(广州)) School of Professional Studies, New York University, New York, 10003, United States(纽约大学专业研究学院) School of Informatics, Xiamen University, Xiamen, 361102, China(厦门大学信息学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01708 2025-08-05 cs.CL 90%

Am I Blue or Is My Hobby Counting Teardrops? Expression Leakage in Large Language Models as a Symptom of Irrelevancy Disruption

Berkay Köprü, Mehrzad Mashal, Yigit Gurses, Akos Kadar, Maximilian Schmitt, Ditty Mathew, Felix Burkhardt, Florian Eyben, Björn W. Schuller

机构 * audEERING GmbH(audEERING公司) Agile Robots SE(Agile Robots公司) Chair of Health Informatics, Technical University of Munich(技术大学慕尼黑健康信息学系) Group on Language, Audio & Music, Imperial College London(伦敦帝国学院语言、音频与音乐组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03108 2025-07-23 cs.CR cs.AI 90%

OMNISEC: LLM-Driven Provenance-based Intrusion Detection via Retrieval-Augmented Behavior Prompting

Wenrui Cheng, Tiantian Zhu, Shunan Jing, Jian-Ping Mei, Mingjun Ma, Jiaobo Jin, Zhengqiu Weng

机构 * Zhejiang University of Technology(浙江工业大学) Wenzhou University of Technology(温州大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16899 2025-07-15 cs.CR cs.AI 90%

Towards Effective Complementary Security Analysis using Large Language Models

Jonas Wagner, Simon Müller, Christian Näther, Jan-Philipp Steghöfer, Andreas Both

机构 * Data Science Group \ Web \& Software Engineering Research Group Paderborn University Leipzig University of Applied Sciences Paderborn, Germany \ Leipzig, Germany \ Web \& Software Engineering Research Group Leipzig University of Applied Sciences Leipzig, Germany

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏