arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2505.03988 2025-05-08 cs.DC cs.AI cs.PF 89%

Can Large Language Models Predict Parallel Code Performance?

Gregory Bolet, Giorgis Georgakoudis, Harshitha Menon, Konstantinos Parasyris, Niranjan Hasabnis, Hayden Estes, Kirk W. Cameron, Gal Oren

机构 * Virginia Tech, USA(弗吉尼亚理工大学) LLNL, USA(劳伦斯利弗莫尔国家实验室) Code Metal, USA(Code Metal公司) Stanford University, Technion, USA(斯坦福大学、技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 5 pages, 4 figures, accepted to AI4Sys Workshop at HPDC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03369 2025-05-07 cs.AI cs.CY 89%

Validating the Effectiveness of a Large Language Model-based Approach for Identifying Children's Development across Various Free Play Settings in Kindergarten

Yuanyuan Yang, Yuan Shen, Tianchen Sun, Yangbin Xie

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15539 2025-05-06 cs.CV cs.AI 89%

Large Language Model with Region-guided Referring and Grounding for CT Report Generation

Zhixuan Chen, Yequan Bie, Haibo Jin, Hao Chen

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00001 2025-05-06 cs.CL 89%

Rosetta-PL: Propositional Logic as a Benchmark for Large Language Model Reasoning

Shaun Baek, Shaun Esua-Mensah, Cyrus Tsui, Sejan Vigneswaralingam, Abdullah Alali, Michael Lu, Vasu Sharma, Sean O'Brien, Kevin Zhu

机构 * Emory University(埃默里大学) Algoverse AI Research(Algoverse AI研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01065 2025-05-05 cs.CR cs.AI 89%

Good News for Script Kiddies? Evaluating Large Language Models for Automated Exploit Generation

David Jin, Qian Fu, Yuekang Li

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Commonwealth Scientific and Industrial Research Organisation (CSIRO) Data61(澳大利亚联邦科学与工业研究组织(CSIRO)Data61)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01035 2025-05-05 cs.CL 89%

Do We Need a Detailed Rubric for Automated Essay Scoring using Large Language Models?

Lui Yoshida

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted in AIED 2025. This preprint has not undergone any post-submission improvements or corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00036 2025-05-02 cs.CL cs.CY 89%

A Framework to Assess the Persuasion Risks Large Language Model Chatbots Pose to Democratic Societies

Zhongren Chen, Joshua Kalla, Quan Le, Shinpei Nakamura-Sakai, Jasjeet Sekhon, Ruixiao Wang

机构 * Yale University(耶鲁大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19314 2025-05-02 cs.CL 89%

BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese

Peilin Zhou, Bruce Leon, Xiang Ying, Can Zhang, Yifan Shao, Qichen Ye, Dading Chong, Zhiling Jin, Chenxuan Xie, Meng Cao, Yuxin Gu, Sixin Hong, Jing Ren, Jian Chen, Chao Liu, Yining Hua

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Peking University(北京大学) Mindverse AI Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学) MBZUAI NIO(蔚来汽车) HSBC(汇丰银行) Harvard T.H. Chan School of Public Health(哈佛大学T.H. Chan公共卫生学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21303 2025-05-01 cs.CL 89%

Confidence in Large Language Model Evaluation: A Bayesian Approach to Limited-Sample Challenges

Xiao Xiao, Yu Su, Sijing Zhang, Zhang Chen, Yadong Chen, Tian Liu

机构 * Tencent Hunyuan(腾讯文言)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20276 2025-04-30 cs.CL stat.AP 89%

Enhancing Systematic Reviews with Large Language Models: Using GPT-4 and Kimi

Dandan Chen Kaptur, Yue Huang, Xuejun Ryan Ji, Yanhui Guo, Bradley Kaptur

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 13 pages, Paper presented at the National Council on Measurement in Education (NCME) Conference, Denver, Colorado, in April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17360 2025-04-25 cs.CL 89%

PatientDx: Merging Large Language Models for Protecting Data-Privacy in Healthcare

Jose G. Moreno, Jesus Lovon, M'Rick Robin-Charlet, Christine Damase-Michel, Lynda Tamine

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Journal ref Workshop CL4Health @ NAACL 2025, May 2025, Albuquerque, New Mexico, United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00530 2025-04-24 cs.AI 89%

Advances in Embodied Navigation Using Large Language Models: A Survey

Jinzhou Lin, Han Gao, Xuxiang Feng, Rongtao Xu, Changwei Wang, Man Zhang, Li Guo, Shibiao Xu

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Aerospace Information Research Institute, Chinese Academy of Science(中国科学院航空航天信息研究所) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China(中国科学院自动化研究所多模态人工智能系统国家重点实验室) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(山东省教育厅计算能力网络与信息安全重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Submited to IEEE TRANSACTIONS ON SYSTEMS, MAN, AND CYBERNETICS: SYSTEMS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14706 2025-04-23 cs.AI 89%

AI with Emotions: Exploring Emotional Expressions in Large Language Models

Shin-nosuke Ishikawa, Atsushi Yoshino

机构 * Graduate School of Artificial Intelligence and Science, Rikkyo University(人工智能与科学研究生院,立命馆大学) Strategic Digital Business Unit, Mamezou Co., Ltd.(战略数字商务部,麦默株式会社)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 14 pages, 8 figures, accepted to the Natural Language Processing for Digital Humanities (NLP4DH) workshop at NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14891 2025-04-22 cs.CL 89%

Retrieval Augmented Generation Evaluation in the Era of Large Language Models: A Comprehensive Survey

Aoran Gan, Hao Yu, Kai Zhang, Qi Liu, Wenyu Yan, Zhenya Huang, Shiwei Tong, Guoping Hu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) McGill University(麦吉尔大学) Tencent Company(腾讯公司) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14738 2025-04-22 cs.CL 89%

PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines

Reya Vir, Shreya Shankar, Harrison Chase, Will Fu-Hinthorn, Aditya Parameswaran

机构 * UC Berkeley(伯克利大学) LangChain

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted to NAACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13775 2025-04-22 cs.CL cs.CR 89%

BadApex: Backdoor Attack Based on Adaptive Optimization Mechanism of Black-box Large Language Models

Zhengxian Wu, Juan Wen, Wanli Peng, Ziwei Zhang, Yinghan Zhou, Yiming Xue

机构 * College of information electrical and engineering(信息电气工程学院) China Agricultural University(中国农业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10258 2025-04-22 cs.CL 89%

Is Translation All You Need? A Study on Solving Multilingual Tasks with Large Language Models

Chaoqun Liu, Wenxuan Zhang, Yiran Zhao, Anh Tuan Luu, Lidong Bing

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里达摩院) Hupan Lab(虎斑实验室) National University of Singapore(新加坡国立大学) Shanda AI Research Institute(沙达AI研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13882 2025-04-22 cs.HC cs.CL 89%

Toward Automated Qualitative Analysis: Leveraging Large Language Models for Tutoring Dialogue Evaluation

Megan Gu, Chloe Qianhui Zhao, Claire Liu, Nikhil Patel, Jahnvi Shah, Jionghao Lin, Kenneth R. Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学) Monash University(墨尔本大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Manuscript accepted to the Workshop on "From Data to Discovery: LLMs for Qualitative Analysis in Education" at LAK25

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09841 2025-04-15 cs.CR cs.AI 89%

StruPhantom: Evolutionary Injection Attacks on Black-Box Tabular Agents Powered by Large Language Models

Yang Feng, Xudong Pan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09754 2025-04-15 cs.SE cs.LG 89%

Integrating Large Language Models for Automated Structural Analysis

Haoran Liang, Mohammad Talebi Kalaleh, Qipei Mei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07100 2025-04-11 cs.CL 89%

EnDive: A Cross-Dialect Benchmark for Fairness and Performance in Large Language Models

Abhay Gupta, Jacob Cheung, Philip Meng, Shayan Sayyed, Austen Liao, Kevin Zhu, Sean O'Brien

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06785 2025-04-10 cs.CV cs.AI 89%

Zero-Shot Image-Based Large Language Model Approach to Road Pavement Monitoring

Shuoshuo Xu, Kai Zhao, James Loney, Zili Li, Andrea Visentin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05642 2025-04-09 cs.CL 89%

Leveraging Prompt-Tuning for Bengali Grammatical Error Explanation Using Large Language Models

Subhankar Maity, Aniket Deroy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05496 2025-04-09 cs.CL 89%

A Survey on Hypothesis Generation for Scientific Discovery in the Era of Large Language Models

Atilla Kaan Alkan, Shashwat Sourav, Maja Jablonska, Simone Astarita, Rishabh Chakrabarty, Nikhil Garuda, Pranav Khetarpal, Maciej Pióro, Dimitrios Tanoglidis, Kartheik G. Iyer, Mugdha S. Polimera, Michael J. Smith, Tirthankar Ghosal, Marc Huertas-Company, Sandor Kruk, Kevin Schawinski, Ioana Ciucă

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments 9 pages (+2 pages of references), 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04216 2025-04-09 cs.CL 89%

A Perplexity and Menger Curvature-Based Approach for Similarity Evaluation of Large Language Models

Yuantao Zhang, Zhankui Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07702 2025-04-08 cs.CL 89%

Prompting open-source and commercial language models for grammatical error correction of English learner text

Christopher Davis, Andrew Caines, Øistein Andersen, Shiva Taslimipoor, Helen Yannakoudakis, Zheng Yuan, Christopher Bryant, Marek Rei, Paula Buttery

专题命中 评测与基准 :language model(title,abstract);prompting(title,abstract);large language model(abstract);分类 cs.CL

Comments 8 pages with appendices; accepted to ACL Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00164 2025-04-04 cs.CL cs.CY 89%

Measuring Large Language Models Capacity to Annotate Journalistic Sourcing

Subramaniam Vincent, Phoebe Wang, Zhan Shi, Sahas Koka, Yi Fang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01850 2025-04-03 cs.SE cs.AI 89%

Code Red! On the Harmfulness of Applying Off-the-shelf Large Language Models to Programming Tasks

Ali Al-Kaswan, Sebastian Deatc, Begüm Koç, Arie van Deursen, Maliheh Izadi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments FSE'25 Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00343 2025-04-02 cs.CL 89%

Leveraging Large Language Models for Automated Definition Extraction with TaxoMatic A Case Study on Media Bias

Timo Spinde, Luyang Lin, Smi Hinterreiter, Isao Echizen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Journal ref Proceedings of the International AAAI Conference on Web and Social Media (ICWSM'25) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16644 2025-04-02 eess.AS cs.CL cs.SD 89%

Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation

Siyin Wang, Wenyi Yu, Yudong Yang, Changli Tang, Yixuan Li, Jimin Zhuang, Xianzhao Chen, Xiaohai Tian, Jun Zhang, Guangzhi Sun, Lu Lu, Yuxuan Wang, Chao Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏