arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31957 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31957 篇

2509.19314 2025-09-25 cs.CL cs.AI cs.CY 90%

Automated Item Neutralization for Non-Cognitive Scales: A Large Language Model Approach to Reducing Social-Desirability Bias

Sirui Wu, Daijin Yang

机构 * University of British Columbia(不列颠哥伦比亚大学) Northeastern University(东北大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in NCME-AIME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20099 2025-09-23 cs.CL cs.AI cs.IR 90%

Large Language Models Meet Knowledge Graphs for Question Answering: Synthesis and Opportunities

Chuangtao Ma, Yongrui Chen, Tianxing Wu, Arijit Khan, Haofen Wang

机构 * Aalborg University(奥尔堡大学) Southeast University(东南大学) Bowling Green State University(布雷恩特绿色州立大学) Tongji University(同济大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08498 2025-09-23 cs.CL cs.AI 90%

LCES: Zero-shot Automated Essay Scoring via Pairwise Comparisons Using Large Language Models

Takumi Shibata, Yuichi Miyamura

机构 * Deloitte Analytics R&D(德勤分析研究与开发)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15957 2025-09-22 cs.AI cs.CL cs.HC cs.IR 90%

EHR-MCP: Real-world Evaluation of Clinical Information Retrieval by Large Language Models via Model Context Protocol

Kanato Masayoshi, Masahiro Hashimoto, Ryoichi Yokoyama, Naoki Toda, Yoshifumi Uwamino, Shogo Fukuda, Ho Namkoong, Masahiro Jinzaki

机构 * Department of Radiology, Keio University Hospital, Tokyo, Japan(Keio大学医院放射科) Division of Infectious Diseases and Infection Control, Keio University Hospital, Tokyo, Japan(Keio大学医院感染病学与感染控制科)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18475 2025-09-22 cs.LG cs.AI 90%

A Survey of Large Language Models for Data Challenges in Graphs

Mengran Li, Pengyu Zhang, Wenbin Xing, Yijia Zheng, Klim Zaporojets, Junzhou Chen, Ronghui Zhang, Yong Zhang, Siyuan Gong, Jia Hu, Xiaolei Ma, Zhiyuan Liu, Paul Groth, Marcel Worring

机构 * Guangdong Key Laboratory of Intelligent Transportation System, School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(广东智能交通系统重点实验室,智能系统工程学院,中山大学深圳校区) University of Amsterdam(阿姆斯特丹大学) Aarhus University(阿arhus大学) Beijing Institute of Artificial Intelligence, Beijing University of Technology(北京人工智能研究院,北京工业大学) School of Information and Engineering, Chang’an University(信息工程学院,长安大学) Key Laboratory of Road and Traffic Engineering of the Ministry of Education, Tongji University(交通工程教育部长实验室,同济大学) Key Laboratory of Intelligent Transportation Technology and System, School of Transportation Science and Engineering, Beihang University(智能交通技术与系统重点实验室,交通运输科学与工程学院,北航) Jiangsu Key Laboratory of Urban ITS, Jiangsu Province Collaborative Innovation Center of Modern Urban Traffic Technologies, School of Transportation, Southeast University(江苏城市ITS重点实验室,江苏省现代城市交通技术协同创新中心,交通学院,东南大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments Accepted by Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14519 2025-09-19 cs.LG cs.AI cs.CR 90%

BEACON: Behavioral Malware Classification with Large Language Model Embeddings and Deep Learning

Wadduwage Shanika Perera, Haodi Jiang

机构 * Department of Computer Science(计算机科学系) Sam Houston State University(萨姆霍茨州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15871 2025-09-18 cs.CY cs.AI cs.CL 90%

A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare

Manar Aljohani, Jun Hou, Sindhura Kommu, Xuan Wang

机构 * Virginia Tech(维吉尼亚理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12098 2025-09-16 cs.CL cs.AI 90%

Is 'Hope' a person or an idea? A pilot benchmark for NER: comparing traditional NLP tools and large language models on ambiguous entities

Payam Latifi

机构 * Department of Humanities University of Turin(人文学院 特林姆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 9 figures, 2 tables. This is a pilot study evaluating six NER systems -- three traditional tools (NLTK, spaCy, Stanza) and three LLMs (Gemini-1.5-flash, DeepSeek-V3, Qwen-3-4B) -- on a small, ambiguity-rich dataset of 119 tokens. The annotated dataset, prompts are provided in appendices for full reproducibility. All experiments were conducted on 14 May 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09709 2025-09-15 cs.CL cs.AI 90%

Assisting Research Proposal Writing with Large Language Models: Evaluation and Refinement

Jing Ren, Weiqi Wang

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02787 2025-09-12 cs.CL cs.CR cs.CY cs.LG 90%

SimMark: A Robust Sentence-Level Similarity-Based Watermarking Algorithm for Large Language Models

Amirhossein Dabiriaghdam, Lele Wang

机构 * Department of ECE, University of British Columbia(电子工程系,不列颠哥伦比亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments Accepted to EMNLP 25 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18183 2025-09-09 cs.CL cs.AI cs.CY 90%

Leveraging Large Language Models for Accurate Sign Language Translation in Low-Resource Scenarios

Luana Bulla, Gabriele Tuccio, Misael Mongiovì, Aldo Gangemi

机构 * University of Catania, Italy(意大利卡塔尼亚大学) National Research Council - ISTC, Italy(意大利国家研究理事会-ISTC) University of Bologna, Italy(意大利博洛尼亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10291 2025-09-09 cs.AI cs.CL cs.IR 90%

ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents

Hao Kang, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06464 2025-09-09 cs.AI cs.CL 90%

Transforming Wearable Data into Personal Health Insights using Large Language Model Agents

Mike A. Merrill, Akshay Paruchuri, Naghmeh Rezaei, Geza Kovacs, Javier Perez, Yun Liu, Erik Schenck, Nova Hammerquist, Jake Sunshine, Shyam Tailor, Kumar Ayush, Hao-Wei Su, Qian He, Cory Y. McLean, Mark Malhotra, Shwetak Patel, Jiening Zhan, Tim Althoff, Daniel McDuff, Xin Liu

机构 * Google Research(谷歌研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 53 pages, 7 main figures, 2 main tables, accepted to Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04504 2025-09-08 cs.CL cs.AI 90%

Behavioral Fingerprinting of Large Language Models

Zehua Pei, Hui-Ling Zhen, Ying Zhang, Zhiyuan Yang, Xing Li, Xianzhi Yu, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei(华为诺亚实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Submitted to 1st Open Conference on AI Agents for Science (agents4science 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02514 2025-09-03 cs.CL cs.LG 90%

Comparative Study of Pre-Trained BERT and Large Language Models for Code-Mixed Named Entity Recognition

Mayur Shirke, Amey Shembade, Pavan Thorat, Madhushri Wagh, Raviraj Joshi

机构 * Dept. of Computer Engineering, Pune Institute of Computer Technology, Pune, India(计算机工程系,普那计算机技术研究所,普那,印度) Indian Institute of Technology Madras, Chennai, India(印度理工学院马德拉斯学院,钦奈,印度) L3Cube Labs, Pune, Maharashtra, India(L3Cube实验室,普那,马哈拉施特拉邦,印度)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00182 2025-08-29 cs.CL cs.AI 90%

Zero-Shot Classification of Crisis Tweets Using Instruction-Finetuned Large Language Models

Emma McDaniel, Samuel Scheele, Jeff Liu

机构 * Computer Science Department Georgia State University(计算机科学系乔治亚州立大学) Disaster Relief Systems MIT Lincoln Laboratory(灾难救援系统麻省理工学院林肯实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19667 2025-08-28 cs.CL cs.AI 90%

Survey of Specialized Large Language Model

Chenghan Yang, Ruiyu Zhao, Yang Liu, Ling Jiang

机构 * Xiaoduo AI(小多AI) Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12733 2025-08-28 cs.CL cs.AI 90%

LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models

Zhiyuan Ning, Tianle Gu, Jiaxin Song, Shixin Hong, Lingyu Li, Huacan Liu, Jie Li, Yixu Wang, Meng Lingyu, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 7pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11280 2025-08-26 cs.CL cs.AI 90%

LETToT: Label-Free Evaluation of Large Language Models On Tourism Using Expert Tree-of-Thought

Ruiyan Qi, Congding Wen, Weibo Zhou, Jiwei Li, Shangsong Liang, Lingbo Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16673 2025-08-26 cs.CY cs.AI cs.CL 90%

Invisible Filters: Cultural Bias in Hiring Evaluations Using Large Language Models

Pooja S. B. Rao, Laxminarayen Nagarajan Venkatesan, Mauro Cherubini, Dinesh Babu Jayagopi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to AIES 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14704 2025-08-21 cs.AI cs.CL 90%

MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers

Ziyang Luo, Zhiqi Shen, Wenzhuo Yang, Zirui Zhao, Prathyusha Jwalapuram, Amrita Saha, Doyen Sahoo, Silvio Savarese, Caiming Xiong, Junnan Li

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Website: https://mcp-universe.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10226 2025-08-15 cs.CL cs.AI 90%

Using Large Language Models to Measure Symptom Severity in Patients At Risk for Schizophrenia

Andrew X. Chen, Guillermo Horga, Sean Escola

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10003 2025-08-15 cs.CL cs.AI 90%

Semantic Structure in Large Language Model Embeddings

Austin C. Kozlowski, Callin Dai, Andrei Boutyline

机构 * University of Chicago(芝加哥大学) University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08277 2025-08-13 cs.CL cs.LG 90%

Objective Metrics for Evaluating Large Language Models Using External Data Sources

Haoze Du, Richard Li, Edward Gehringer

机构 * Department of Computer Science(计算机科学系) North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments This version of the paper is lightly revised from the EDM 2025 proceedings for the sake of clarity

Journal ref EDM 2025 Palermo, Italy, July, 2025, pp. 489-495. International Educational Data Mining Society (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06277 2025-08-11 cs.CL cs.LG cs.SD 90%

Large Language Model Data Generation for Enhanced Intent Recognition in German Speech

Theresa Pekarek Rosin, Burak Can Kaplan, Stefan Wermter

机构 * University of Hamburg - Knowledge Technology(汉堡大学-知识技术)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 11 pages, 3 figures, accepted at KONVENS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05474 2025-08-08 cs.AI cs.CL 90%

Can Large Language Models Generate Effective Datasets for Emotion Recognition in Conversations?

Burak Can Kaplan, Hugo Cesar De Castro Carneiro, Stefan Wermter

机构 * Department of Informatics, University of Hamburg(信息学院,汉堡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12106 2025-08-08 cs.CL cs.AI 90%

Can open source large language models be used for tumor documentation in Germany? -- An evaluation on urological doctors' notes

Stefan Lenz, Arsenij Ustjanzew, Marco Jeray, Meike Ressing, Torsten Panholzer

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments 53 pages, 5 figures

Journal ref BioData Mining volume 18, Article number 48 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04219 2025-08-07 cs.CL cs.LG 90%

Hierarchical Text Classification Using Black Box Large Language Models

Kosuke Yoshimura, Hisashi Kashima

机构 * Kyoto University, Kyoto, Japan(京都大学) Anonymous Institute(匿名机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03970 2025-08-07 cs.CL cs.AI 90%

Data and AI governance: Promoting equity, ethics, and fairness in large language models

Alok Abhishek, Lisa Erickson, Tushar Bandopadhyay

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Published in MIT Science Policy Review 6, 139-146 (2025)

Journal ref MIT Science Policy Review, 6. (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18182 2025-08-05 cs.CL cs.AI 90%

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models

Wonjun Jeong, Dongseok Kim, Taegkeun Whangbo

机构 * Department of Computer Engineering(计算机工程系) Gachon University(高城大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Comments: 34 pages, 1 figure. v2: All "Consequence." statements in the Theoretical Analysis section relabeled as "Corollary."; duplicated values in Table 20 (previously identical to Table 15) corrected

详情

展开后加载摘要…

URL PDF HTML 收藏