arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2507.14107 2025-07-21 cs.AI cs.IR 89%

Automated Interpretation of Non-Destructive Evaluation Contour Maps Using Large Language Models for Bridge Condition Assessment

Viraj Nishesh Darji, Callie C. Liao, Duoduo Liao

机构 * School of Computing(计算学院) George Mason University(乔治·玛莎大学) College of Science(科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Journal ref IEEE BigData, Year: 2024; Page: 3258-3263

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04631 2025-07-18 cs.CL 89%

On the Limitations of Large Language Models (LLMs): False Attribution

Tosin Adewumi, Nudrat Habib, Lama Alkhaled, Elisa Barney

机构 * Machine Learning Group, EISLAB, Luleå University of Technology(机器学习组、EISLAB、卢勒奥技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments This paper was accepted for presentation by Recent Advances in NLP (RANLP) 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11527 2025-07-16 cs.AI cs.CE 89%

DrafterBench: Benchmarking Large Language Models for Tasks Automation in Civil Engineering

Yinsheng Li, Zhen Dong, Yi Shao

机构 * McGill University(麦吉尔大学) UC Santa Barbara(圣巴巴拉大学) NVIDIA(英伟达)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Project page: https://github.com/Eason-Li-AIS/DrafterBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00972 2025-07-16 cs.AI cs.RO 89%

Seeking to Collide: Online Safety-Critical Scenario Generation for Autonomous Driving with Retrieval Augmented Large Language Models

Yuewen Mei, Tong Nie, Jian Sun, Ye Tian

机构 * Dept. of Traf. Eng. Tongji University Shanghai, China Dept. of Civ. \& Envir. Eng. The Hong Kong Polytechnic University Hong Kong SAR, China

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted at IEEE ITSC 2025

Journal ref IEEE International Conference on Intelligent Transportation Systems, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00027 2025-07-15 cs.CL 89%

Personalization of Large Language Models: A Survey

Zhehao Zhang, Ryan A. Rossi, Branislav Kveton, Yijia Shao, Diyi Yang, Hamed Zamani, Franck Dernoncourt, Joe Barrow, Tong Yu, Sungchul Kim, Ruiyi Zhang, Jiuxiang Gu, Tyler Derr, Hongjie Chen, Junda Wu, Xiang Chen, Zichao Wang, Subrata Mitra, Nedim Lipka, Nesreen Ahmed, Yu Wang

机构 * Dartmouth College(达特茅斯学院) Adobe Research(Adobe研究) Stanford University(斯坦福大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Pattern Data Vanderbilt University(范德比尔特大学) Dolby Research(Dolby研究) University of California San Diego(加州大学圣地亚哥分校) Cisco Research(思科研究) University of Oregon(俄勒冈大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at the Transactions on Machine Learning Research (TMLR) journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12380 2025-07-15 cs.CL 89%

Evaluation of Attribution Bias in Generator-Aware Retrieval-Augmented Large Language Models

Amin Abolghasemi, Leif Azzopardi, Seyyed Hadi Hashemi, Maarten de Rijke, Suzan Verberne

机构 * Leiden University(莱顿大学) University of Strathclyde(斯特拉思克莱德大学) eBay Inc.(eBay公司) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08459 2025-07-14 cs.CL 89%

Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework

Zishan Xu, Shuyi Xie, Qingsong Lv, Shupei Xiao, Linlin Song, Sui Wenjuan, Fan Lin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08019 2025-07-14 cs.CL econ.GN q-fin.EC 89%

Signal or Noise? Evaluating Large Language Models in Resume Screening Across Contextual Variations and Human Expert Benchmarks

Aryan Varshney, Venkat Ram Reddy Ganuthula

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13857 2025-07-14 cs.CL 89%

Enabling Inclusive Systematic Reviews: Incorporating Preprint Articles with Large Language Model-Driven Evaluations

Rui Yang, Jiayi Tong, Haoyuan Wang, Hui Huang, Ziyang Hu, Peiyu Li, Nan Liu, Christopher J. Lindsell, Michael J. Pencina, Yong Chen, Chuan Hong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07988 2025-07-11 cs.CL 89%

Automating Expert-Level Medical Reasoning Evaluation of Large Language Models

Shuang Zhou, Wenya Xie, Jiaxi Li, Zaifu Zhan, Meijia Song, Han Yang, Cheyenna Espinoza, Lindsay Welton, Xinnie Mai, Yanwei Jin, Zidu Xu, Yuen-Hei Chung, Yiyun Xing, Meng-Han Tsai, Emma Schaffer, Yucheng Shi, Ninghao Liu, Zirui Liu, Rui Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 22 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00699 2025-07-11 cs.CL 89%

A Comprehensive Survey of Contamination Detection Methods in Large Language Models

Mathieu Ravaut, Bosheng Ding, Fangkai Jiao, Hailin Chen, Xingxuan Li, Ruochen Zhao, Chengwei Qin, Caiming Xiong, Shafiq Joty

机构 * Nanyang Technological University(南洋理工大学) Institute of Infocomm Research (I2R), A*STAR(信息通信研究所(I2R),A*STAR) Salesforce Research(Salesforce研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by TMLR in July 2025. 18 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05565 2025-07-09 cs.SE cs.AI cs.NE 89%

Search-based Selection of Metamorphic Relations for Optimized Robustness Testing of Large Language Models

Sangwon Hyun, Shaukat Ali, M. Ali Babar

机构 * The University of Adelaide(阿德莱德大学) Simula Research Laboratory(Simula研究实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04803 2025-07-08 cs.AI 89%

Application and Evaluation of Large Language Models for Forecasting the Impact of Traffic Incidents

George Jagadeesh, Srikrishna Iyer, Michal Polanowski, Kai Xin Thia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments This paper has been accepted for publication at the 2025 IEEE 28th International Conference on Intelligent Transportation Systems (ITSC), Gold Coast, Australia, 2025. Copyright IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04697 2025-07-08 cs.LG cs.DC cs.MS 89%

Performance Evaluation of General Purpose Large Language Models for Basic Linear Algebra Subprograms Code Generation

Daichi Mukunoki, Shun-ichiro Hayashi, Tetsuya Hoshino, Takahiro Katagiri

机构 * Information Technology Center\ University Nagoya, Aichi 466-8601 Email Graduate School of Informatics\ University Nagoya, Aichi 466-8601 Email

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments 8 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19265 2025-07-08 cs.CL 89%

PHEONA: An Evaluation Framework for Large Language Model-based Approaches to Computational Phenotyping

Sarah Pungitore, Shashank Yadav, Vignesh Subbian

机构 * Program in Applied Mathematics, The University of Arizona(应用数学项目,亚利桑那大学) College of Engineering, The University of Arizona(工程学院,亚利桑那大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 2 figures, 5 tables, accepted at 2025 AMIA Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02919 2025-07-08 cs.CL cs.CY cs.ET 89%

ChatGPT is not A Man but Das Man: Representativeness and Structural Consistency of Silicon Samples Generated by Large Language Models

Dai Li, Linzhuo Li, Huilian Sophie Qiu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23486 2025-07-04 cs.AI 89%

Autoformalization in the Era of Large Language Models: A Survey

Ke Weng, Lun Du, Sirui Li, Wangyue Lu, Haozhe Sun, Hengyu Liu, Tiancheng Zhang

机构 * Northeastern University(东北大学) Ant Research Institute, Ant Group(蚂蚁集团研究院) Department of Computer Science, Aalborg University(奥尔堡大学计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02241 2025-07-04 cs.LG 89%

VERBA: Verbalizing Model Differences Using Large Language Models

Shravan Doda, Shashidhar Reddy Javaji, Zining Zhu

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00693 2025-07-02 cs.SD cs.CL eess.AS 89%

Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection

Yifan Gao, Jiao Fu, Long Guo, Hong Liu

机构 * College of Computer Science(计算机科学学院) National Key Laboratory of Fundamental Science on Synthetic Vision(合成视觉基础科学国家重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted to Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00088 2025-07-02 physics.soc-ph cs.AI cs.SI 89%

How large language models judge and influence human cooperation

Alexandre S. Pires, Laurens Samson, Sennay Ghebreab, Fernando P. Santos

机构 * Institute of Informatics(信息学院) University of Amsterdam(阿姆斯特丹大学) City of Amsterdam(阿姆斯特丹市)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23762 2025-07-01 cs.SE cs.AI 89%

Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead

Hongzhou Rao, Yanjie Zhao, Xinyi Hou, Shenao Wang, Haoyu Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23527 2025-07-01 cs.CL 89%

On Recipe Memorization and Creativity in Large Language Models: Is Your Model a Creative Cook, a Bad Cook, or Merely a Plagiator?

Jan Kvapil, Martin Fajcik

机构 * Brno University of Technology(布拉格技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11095 2025-06-30 cs.CL 89%

A Survey of Large Language Models in Psychotherapy: Current Landscape and Future Directions

Hongbin Na, Yining Hua, Zimu Wang, Tao Shen, Beibei Yu, Lilin Wang, Wei Wang, John Torous, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) University of Technology Sydney(悉尼科技大学) Harvard University(哈佛大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21360 2025-06-27 cs.CL 89%

Structuralist Approach to AI Literary Criticism: Leveraging Greimas Semiotic Square for Large Language Models

Fangzhou Dong, Yifan Zeng, Yingpeng Sang, Hong Shen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Engineering and Technology, Central Queensland University(中央昆士兰大学工程与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted in CogSci 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20274 2025-06-26 cs.AI 89%

Enterprise Large Language Model Evaluation Benchmark

Liya Wang, David Yi, Damien Jose, John Passarelli, James Gao, Jordan Leventis, Kang Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Submitted to MLNLP 2025 at https://csity2025.org/mlnlp/index

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07919 2025-06-23 cs.AI 89%

Large Language Model Interface for Home Energy Management Systems

François Michelon, Yihong Zhou, Thomas Morstyn

机构 * University of Edinburgh(爱丁堡大学) Oxford University(牛津大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);prompting(abstract)

Comments 13 pages conference paper

Journal ref Proc. 16th ACM Int. Conf. on Future and Sustainable Energy Systems, e-Energy 2025, pages 590-602, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16064 2025-06-23 cs.CL 89%

Self-Critique-Guided Curiosity Refinement: Enhancing Honesty and Helpfulness in Large Language Models via In-Context Learning

Duc Hieu Ho, Chenglin Fan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04804 2025-06-18 cs.CY cs.CL 89%

What do Large Language Models Say About Animals? Investigating Risks of Animal Harm in Generated Text

Arturs Kanepajs, Aditi Basu, Sankalpa Ghose, Constance Li, Akshat Mehta, Ronak Mehta, Samuel David Tucker-Davis, Eric Zhou, Bob Fischer, Jacy Reese Anthis

机构 * Alethic Research Texas State University(德克萨斯州立大学) Sentience Institute(意识研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07313 2025-06-18 cs.CL 89%

ETM: Modern Insights into Perspective on Text-to-SQL Evaluation in the Age of Large Language Models

Benjamin G. Ascoli, Yasoda Sai Ram Kandikonda, Jinho D. Choi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07637 2025-06-18 cs.AI cs.NI 89%

OpsEval: A Comprehensive IT Operations Benchmark Suite for Large Language Models

Yuhe Liu, Changhua Pei, Longlong Xu, Bohan Chen, Mingze Sun, Zhirui Zhang, Yongqian Sun, Shenglin Zhang, Kun Wang, Haiming Zhang, Jianhui Li, Gaogang Xie, Xidao Wen, Xiaohui Nie, Minghua Ma, Dan Pei

机构 * Tsinghua University \& BNRist Beijing China Beijing University of Posts Nankai University \& TKL-SEHCI Tianjin China Nankai University \& HL-IT Tianjin China Microsoft Redmond USA Tsinghua University \& BNRist Nankai University \& TKL-SEHCI Nankai University \& HL-IT Microsoft

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏