arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2505.23053 2025-05-30 cs.IR cs.AI 89%

Augment or Not? A Comparative Study of Pure and Augmented Large Language Model Recommenders

Wei-Hsiang Huang, Chen-Wei Ke, Wei-Ning Chiu, Yu-Xuan Su, Chun-Chun Yang, Chieh-Yuan Cheng, Yun-Nung Chen, Pu-Jen Cheng

机构 * National Taiwan University(台湾大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00172 2025-05-30 cs.CL 89%

A Survey of Uncertainty Estimation Methods on Large Language Models

Zhiqiu Xia, Jinxuan Xu, Yuqian Zhang, Hang Liu

机构 * Rutgers, The State University of New Jersey(新泽西州立大学拉特格斯分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21148 2025-05-28 cs.CL cs.SD eess.AS 89%

Assessment of L2 Oral Proficiency using Speech Large Language Models

Rao Ma, Mengjie Qian, Siyuan Tang, Stefano Bannò, Kate M. Knill, Mark J. F. Gales

机构 * University of Cambridge(剑桥大学) ALTA Institute(ALTA研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments submitted to Interspeech

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05111 2025-05-28 cs.CL 89%

Unveiling Language-Specific Features in Large Language Models via Sparse Autoencoders

Boyi Deng, Yu Wan, Yidan Zhang, Baosong Yang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Sichuan University(四川大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12472 2025-05-28 cs.CL 89%

Knowledge Boundary of Large Language Models: A Survey

Moxin Li, Yong Zhao, Wenxuan Zhang, Shuaiyi Li, Wenya Xie, See-Kiong Ng, Tat-Seng Chua, Yang Deng

机构 * National University of Singapore(国立新加坡大学) Singapore Management University(新加坡管理大学) Singapore University of Technology and Design(新加坡科技设计大学) The Chinese University of Hong Kong(香港中文大学) University of Minnesota - Twin Cities(明尼苏达大学双城分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted to ACL 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20206 2025-05-27 cs.SE cs.AI 89%

Evaluating Large Language Models for Code Review

Umut Cihan, Arda İçöz, Vahid Haratian, Eray Tüzün

机构 * Bilkent University(比尔肯特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10497 2025-05-27 cs.CL 89%

MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation

Weihao Xuan, Rui Yang, Heli Qi, Qingcheng Zeng, Yunze Xiao, Aosong Feng, Dairui Liu, Yun Xing, Junjue Wang, Fan Gao, Jinghui Lu, Yuang Jiang, Huitao Li, Xin Li, Kunyu Yu, Ruihai Dong, Shangding Gu, Yuekang Li, Xiaofei Xie, Felix Juefei-Xu, Foutse Khomh, Osamu Yoshie, Qingyu Chen, Douglas Teodoro, Nan Liu, Randy Goebel, Lei Ma, Edison Marrese-Taylor, Shijian Lu, Yusuke Iwasawa, Yutaka Matsuo, Irene Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19658 2025-05-27 cs.SE cs.AI 89%

Large Language Models in Code Co-generation for Safe Autonomous Vehicles

Ali Nouri, Beatriz Cabrero-Daniel, Zhennan Fei, Krishna Ronanki, Håkan Sivencrona, Christian Berger

机构 * Volvo Cars(沃尔沃汽车公司) University of Gothenburg(哥德堡大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted in the 44th International Conference on Computer Safety, Reliability and Security (SafeComp 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19533 2025-05-27 cs.LG 89%

ExAnte: A Benchmark for Ex-Ante Inference in Large Language Models

Yachuan Liu, Xiaochun Wei, Lin Shi, Xinnuo Li, Bohan Zhang, Paramveer Dhillon, Qiaozhu Mei

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18466 2025-05-27 cs.CL 89%

Measuring South Asian Biases in Large Language Models

Mamnuya Rinki, Chahat Raj, Anjishnu Mukherjee, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15094 2025-05-27 cs.CL stat.AP 89%

Judging It, Washing It: Scoring and Greenwashing Corporate Climate Disclosures using Large Language Models

Marianne Chuang, Gabriel Chuang, Cheryl Chuang, John Chuang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 17 pages, 12 figures. To appear, ClimateNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16591 2025-05-23 cs.CL 89%

Evaluating Large Language Model with Knowledge Oriented Language Specific Simple Question Answering

Bowen Jiang, Runchuan Zhu, Jiang Wu, Zinco Jiang, Yifan He, Junyuan Gao, Jia Yu, Rui Min, Yinfan Wang, Haote Yang, Songyang Zhang, Dahua Lin, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai University(上海大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Equal contribution: Bowen Jiang, Runchuan Zhu, Jiang Wu; Corresponding author: Conghui He

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15741 2025-05-22 cs.NE cs.CL cs.MA 89%

Evolutionary Computation and Large Language Models: A Survey of Methods, Synergies, and Applications

Dikshit Chauhan, Bapi Dutta, Indu Bala, Niki van Stein, Thomas Bäck, Anupam Yadav

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) Department of Computer Science, Universidad de Jaén(西班牙Jaén大学计算机科学系) School of Computer and Mathematical Sciences, University of Adelaide(阿德莱德大学计算机与数学科学学院) Leiden Institute of Advanced Computer Science, University Leiden(莱顿大学先进计算机科学研究所) Department of Mathematics and Computing, Dr. B. R. Ambedkar National Institute of Technology(德拉·B·R·阿姆贝卡尔国立理工学院数学与计算系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24245 2025-05-22 cs.CL 89%

Enhancing Large Language Models (LLMs) for Telecommunications using Knowledge Graphs and Retrieval-Augmented Generation

Dun Yuan, Hao Zhou, Di Wu, Xue Liu, Hao Chen, Yan Xin, Jianzhong, Zhang

机构 * School of Computer Science(计算机科学学院) Department of Electrical and Computer Engineering(电气与计算机工程系) Standards and Mobility Innovation Lab(标准与移动创新实验室) Samsung Research America(三星美国研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments This work has been accepted to ICC 2025 IEEE International Conference on Communications. copyright 2025 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15071 2025-05-22 cs.CL 89%

Can Large Language Models Understand Internet Buzzwords Through User-Generated Content

Chen Huang, Junkai Luo, Xinzuo Wang, Wenqiang Lei, Jiancheng Lv

机构 * College of Computer Science, Sichuan University, China(四川大学计算机学院) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, China(教育部机器学习与工业智能工程研究中心) JD.com, China(京东公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments ACL 2025 Main Paper. Our dataset and code are available at https://github.com/SCUNLP/Buzzword

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00342 2025-05-22 cs.AI 89%

Empowering the Deaf and Hard of Hearing Community: Enhancing Video Captions Using Large Language Models

Nadeen Fathallah, Monika Bhole, Steffen Staab

机构 * Analytic Computing, Institute for Artificial Intelligence, University of Stuttgart(分析计算中心、人工智能研究所、斯图加特大学) University of Stuttgart(斯图加特大学) University of Southampton(南安普顿大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11638 2025-05-22 cs.CL cs.IR 89%

A Comprehensive Evaluation of Large Language Models on Temporal Event Forecasting

He Chang, Chenchen Ye, Zhulin Tao, Jie Wu, Zhengmao Yang, Yunshan Ma, Xianglin Huang, Tat-Seng Chua

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13488 2025-05-21 cs.CL cs.CY 89%

Source framing triggers systematic evaluation bias in Large Language Models

Federico Germani, Giovanni Spitale

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12567 2025-05-20 cs.CR cs.AI 89%

A Survey of Attacks on Large Language Models

Wenrui Xu, Keshab K. Parhi

机构 * Department of Electrical and Computer Engineering, University of Minnesota(电气与计算机工程系,明尼苏达大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15037 2025-05-19 cs.CL 89%

mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation

Nishat Raihan, Antonios Anastasopoulos, Marcos Zampieri

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 30 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10494 2025-05-16 cs.CL 89%

Can You Really Trust Code Copilots? Evaluating Large Language Models from a Code Security Perspective

Yutao Mou, Xiao Deng, Yuxiao Luo, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University, China(软件工程国家工程研究中心,北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by ACL2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10010 2025-05-16 cs.LG 89%

ImagineBench: Evaluating Reinforcement Learning with Large Language Model Rollouts

Jing-Cheng Pang, Kaiyuan Li, Yidi Wang, Si-Hang Yang, Shengyi Jiang, Yang Yu

机构 * National Key Laboratory for Novel Software Technology Nanjing University China(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence Nanjing University China(南京大学人工智能学院) The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04877 2025-05-16 cs.LG 89%

System Log Parsing with Large Language Models: A Review

Viktor Beck, Max Landauer, Markus Wurzenberger, Florian Skopik, Andreas Rauber

机构 * AIT Austrian Institute of Technology(奥地利技术研究院) TU Wien(维也纳技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments 36 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09777 2025-05-16 cs.IR cs.CL 89%

A Survey on Large Language Models in Multimodal Recommender Systems

Alejo Lopez-Avila, Jinhua Du

机构 * Huawei London Research Centre(华为伦敦研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09056 2025-05-15 cs.CL 89%

A Comprehensive Analysis of Large Language Model Outputs: Similarity, Diversity, and Bias

Brandon Smith, Mohamed Reda Bouadjenek, Tahsin Alamgir Kheya, Phillip Dawson, Sunil Aryal

机构 * Deakin University(德克萨斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08830 2025-05-15 cs.CR cs.AI 89%

Federated Large Language Models: Feasibility, Robustness, Security and Future Directions

Wenhao Jiang, Yuchuan Luo, Guilin Deng, Silong Chen, Xu Yang, Shihong Wu, Xinwen Gao, Lin Liu, Shaojing Fu

机构 * National University of Defense Technology(国防科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08744 2025-05-14 cs.AI 89%

DeepMath-Creative: A Benchmark for Evaluating Mathematical Creativity of Large Language Models

Xiaoyang Chen, Xinan Dai, Yu Du, Qian Feng, Naixu Guo, Tingshuo Gu, Yuting Gao, Yingyi Gao, Xudong Han, Xiang Jiang, Yilin Jin, Hongyi Lin, Shisheng Lin, Xiangnan Li, Yuante Li, Yixing Li, Zhentao Lai, Zilu Ma, Yingrong Peng, Jiacheng Qian, Hao-Yu Sun, Jianbo Sun, Zirui Wang, Siwei Wu, Zian Wang, Bin Xu, Jianghao Xu, Yiyang Yu, Zichuan Yang, Hongji Zha, Ruichong Zhang

机构 * School of Mathematical Sciences, Tongji University(同济大学数学科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06305 2025-05-13 cs.CR cs.AI 89%

User Behavior Analysis in Privacy Protection with Large Language Models: A Study on Privacy Preferences with Limited Data

Haowei Yang, Qingyi Lu, Yang Wang, Sibei Liu, Jiayun Zheng, Ao Xiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04784 2025-05-09 cs.CR cs.AI cs.CY 89%

A Proposal for Evaluating the Operational Risk for ChatBots based on Large Language Models

Pedro Pinacho-Davidson, Fernando Gutierrez, Pablo Zapata, Rodolfo Vergara, Pablo Aqueveque

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03985 2025-05-09 cs.AI cs.SE 89%

LogiDebrief: A Signal-Temporal Logic based Automated Debriefing Approach with Large Language Models Integration

Zirong Chen, Ziyan An, Jennifer Reynolds, Kristin Mullen, Stephen Martini, Meiyi Ma

机构 * Department of Computer Science, Vanderbilt University(维斯尼尔大学计算机科学系) Metro Nashville Department of Emergency Communications(孟菲斯市紧急通讯部门)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted at IJCAI-2025

详情

展开后加载摘要…

URL PDF HTML 收藏