arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2508.03360 2025-10-20 cs.AI 89%

CogBench: A Large Language Model Benchmark for Multilingual Speech-Based Cognitive Impairment Assessment

Rui Feng, Zhiyao Luo, Wei Wang, Yuting Song, Yong Liu, Tingting Zhu, Jianqing Li, Xingyao Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

Comments 19 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12045 2025-10-17 cs.CY cs.AI 89%

Large Language Models Enable Design of Personalized Nudges across Cultures

Vladimir Maksimenko, Qingyao Xin, Prateek Gupta, Bin Zhang, Prateek Bansal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14471 2025-10-17 cs.CL 89%

Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs

Koshiro Saito, Sakae Mizuki, Masanari Ohi, Taishi Nakamura, Taihei Shiotani, Koki Maeda, Youmi Ma, Kakeru Hattori, Kazuki Fujii, Takumi Okamoto, Shigeki Ishida, Hiroya Takamura, Rio Yokota, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) NII LLMC(日本信息基础设施中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted as a spotlight at the 1st workshop on Multilingual and Equitable Language Technologies (MELT), COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12702 2025-10-15 cs.SE cs.AI cs.PL 89%

Beyond Postconditions: Can Large Language Models infer Formal Contracts for Automatic Software Verification?

Cedric Richter, Heike Wehrheim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16804 2025-10-15 cs.MA cs.AI 89%

Multi-Agent Autonomous Driving Systems with Large Language Models: A Survey of Recent Advances

Yaozu Wu, Dongyuan Li, Yankai Chen, Renhe Jiang, Henry Peng Zou, Wei-Chieh Huang, Yangning Li, Liancheng Fang, Zhen Wang, Philip S. Yu

机构 * The University of Tokyo(东京大学) Cornell University(康奈尔大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11297 2025-10-14 cs.CL 89%

Are Large Language Models Effective Knowledge Graph Constructors?

Ruirui Chen, Weifeng Jiang, Chengwei Qin, Bo Xiong, Fiona Liausvia, Dongkyu Choi, Boon Kiat Quek

机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科技研究局(A*STAR),新加坡) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州),中国) Stanford University, United States(斯坦福大学,美国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11645 2025-10-14 cs.AI 89%

Adapting and Evaluating Multimodal Large Language Models for Adolescent Idiopathic Scoliosis Self-Management: A Divide and Conquer Framework

Zhaolong Wu, Pu Luo, Nan Meng, Jason Pui Yin Cheung, Teng Zhang

机构 * Department of Orthopaedics and Traumatology, The University of Hong Kong(骨科与创伤外科部,香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

Comments Accepted by MICCAI 2025 MLLMCP Workshop

Journal ref Lecture Notes in Computer Science 16147 (2026) 280-289

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16700 2025-10-14 cs.AI 89%

MCP-RADAR: A Multi-Dimensional Benchmark for Evaluating Tool Use Capabilities in Large Language Models

Xuanqi Gao, Siyi Xie, Juan Zhai, Shiqing Ma, Chao Shen

机构 * Xi’an Jiaotong University(西安交通大学) University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06343 2025-10-14 cs.SE cs.AI cs.CR 89%

Leveraging Large Language Models for Cybersecurity Risk Assessment -- A Case from Forestry Cyber-Physical Systems

Fikret Mert Gultekin, Oscar Lilja, Ranim Khojah, Rebekka Wohlrab, Marvin Damschen, Mazen Mohamad

机构 * Chalmers University of Technology(楚德斯技术大学) University of Gothenburg(哥德堡大学) Carnegie Mellon University(卡内基梅隆大学) RISE Research Institutes of Sweden(瑞典RISE研究机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted at Autonomous Agents in Software Engineering (AgenticSE) Workshop, co-located with ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09355 2025-10-13 cs.CL 89%

NL2GenSym: Natural Language to Generative Symbolic Rules for SOAR Cognitive Architecture via Large Language Models

Fang Yuan, Junjie Zeng, Yue Hu, Zhengqiu Zhu, Quanjun Yin, Yuxiang Xie

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) Test Center, National University of Defense Technology(测试中心,国防科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14218 2025-10-13 cs.CL 89%

Understanding the Repeat Curse in Large Language Models from a Feature Perspective

Junchi Yao, Shu Yang, Jianhua Xu, Lijie Hu, Mengdi Li, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明责任AI与数据 analytics 实验室) King Abdullah University of Science and Technology(卡瓦尔阿卜杜勒拉大学科学与技术学院) University of Electronic Science and Technology of China(中国电子科学与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by ACL 2025, Findings, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00847 2025-10-10 cs.CL 89%

Argument Summarization and its Evaluation in the Era of Large Language Models

Moritz Altemeyer, Steffen Eger, Johannes Daxenberger, Yanran Chen, Tim Altendorf, Philipp Cimiano, Benjamin Schiller

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments EMNLP 2025 Main Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06931 2025-10-09 astro-ph.IM cs.LG 89%

Textual interpretation of transient image classifications from large language models

Fiorenzo Stoppa, Turan Bulmus, Steven Bloemen, Stephen J. Smartt, Paul J. Groot, Paul Vreeswijk, Ken W. Smith

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments Published in Nature Astronomy (2025). Publisher's Version of Record (CC BY 4.0). DOI: 10.1038/s41550-025-02670-z

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05468 2025-10-09 cs.CL 89%

LatteReview: A Multi-Agent Framework for Systematic Review Automation Using Large Language Models

Pouria Rouzrokh, Bardia Khosravi, Parsa Rouzrokh, Moein Shariatnia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 31 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06826 2025-10-09 cs.CL 89%

Mid-Training of Large Language Models: A Survey

Kaixiang Mo, Yuxin Shi, Weiwei Weng, Zhiqiang Zhou, Shuman Liu, Haibo Zhang, Anxiang Zeng

机构 * Shopee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21840 2025-10-08 cs.LO cs.AI 89%

Can Large Language Models Autoformalize Kinematics?

Aditi Kabra, Jonathan Laurent, Sagar Bharadwaj, Ruben Martins, Stefan Mitsch, André Platzer

机构 * Carnegie Mellon University(卡内基梅隆大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) DePaul University(德保罗大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Journal ref Proc. 25th International Conference on Formal Methods in Computer-Aided Design (FMCAD), pp. 78-83, TU Wien Academic Press, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20115 2025-10-07 cs.DL cs.AI cs.DB 89%

Flexible metadata harvesting for ecology using large language models

Zehao Lu, Thijs L van der Plas, Parinaz Rashidi, W Daniel Kissling, Ioannis N Athanasiadis

机构 * Wageningen University & Research(瓦赫宁根大学与研究学院) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04293 2025-10-07 cs.CL 89%

Equipping Retrieval-Augmented Large Language Models with Document Structure Awareness

Lingnan Xu, Chong Feng, Kaiyuan Zhang, Liu Zhengyong, Wenqiang Xu, Fanqing Meng

机构 * School of Computer Science, Beijing Institute of Technology(计算机学院,北京理工大学) Ant Group(蚂蚁集团) Southeast Academy of Information Technology, Beijing Institute of Technology(信息科技东南学院,北京理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04051 2025-10-07 cs.AI 89%

Toward a unified framework for data-efficient evaluation of large language models

Lele Liao, Qile Zhang, Ruofan Wu, Guanhua Fang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments codes available at https://github.com/Rorschach1989/efficient-lm-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19064 2025-10-07 cs.CL 89%

Can Large Language Models Outperform Non-Experts in Poetry Evaluation? A Comparative Study Using the Consensual Assessment Technique

Piotr Sawicki, Marek Grześ, Dan Brown, Fabrício Góes

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 18 pages, 3 figures. Accepted for publication at the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02403 2025-10-06 q-bio.QM cs.AI cs.CV 89%

Glaucoma Detection and Structured OCT Report Generation via a Fine-tuned Multimodal Large Language Model

Jalil Jalili, Yashraj Gavhane, Evan Walker, Anna Heinke, Christopher Bowd, Akram Belghith, Massimo A. Fazio, Christopher A. Girkin, C. Gustavo De Moraes, Jeffrey M. Liebmann, Sally L. Baxter, Robert N. Weinreb, Linda M. Zangwill, Mark Christopher

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10150 2025-10-06 cs.CL cs.HC 89%

When Large Language Models are Reliable for Judging Empathic Communication

Aakriti Kumar, Nalin Poungpeth, Diyi Yang, Erina Farrell, Bruce Lambert, Matthew Groh

机构 * Kellogg School of Management(凯洛格管理学院) Northwestern University(西北大学) Northwestern Institute for Complex Systems(西北复杂系统研究所) Stanford University(斯坦福大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01398 2025-10-03 cs.AI 89%

Automating Data-Driven Modeling and Analysis for Engineering Applications using Large Language Model Agents

Yang Liu, Zaid Abulawi, Abhiram Garimidi, Doyeong Lim

机构 * Department of Nuclear Engineering, Texas A\&M University(核工程系,德克萨斯A&M大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01244 2025-10-03 cs.CL 89%

Feasibility of Structuring Stress Documentation Using an Ontology-Guided Large Language Model

Hyeoneui Kim, Jeongha Kim, Huijing Xu, Jinsun Jung, Sunghoon Kang, Sun Joo Jang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04512 2025-10-03 cs.AI 89%

Schema Generation for Large Knowledge Graphs Using Large Language Models

Bohui Zhang, Yuan He, Lydia Pintscher, Albert Meroño Peñuela, Elena Simperl

机构 * King’s College London(伦敦国王学院) University of Oxford(牛津大学) Wikimedia Deutschland(维基媒体德国) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00015 2025-10-03 cs.CL 89%

Design and Application of Multimodal Large Language Model Based System for End to End Automation of Accident Dataset Generation

MD Thamed Bin Zaman Chowdhury, Moazzem Hossain

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments This paper is accepted for presentation in TRB annual meeting 2026. The version presented here is the preprint version before peer review process

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10582 2025-10-03 cs.CL cs.HC 89%

Adapting Large Language Models for Character-based Augmentative and Alternative Communication

Dylan Gaines, Keith Vertanen

机构 * Dylan Gaines Department of Computer Science, Michigan Technological University, Houghton, MI, USA(达西·甘斯 计算机科学系,密歇根技术大学,霍顿,MI,美国) Keith Vertanen(凯斯·维塔内)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments To appear in Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13355 2025-10-01 cs.AI 89%

Survey: Multi-Armed Bandits Meet Large Language Models

Djallel Bouneffouf, Raphael Feraud

机构 * IBM Research(IBM研究院) Orange Lab(Orange实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23350 2025-09-30 cs.SD cs.AI 89%

ABC-Eval: Benchmarking Large Language Models on Symbolic Music Understanding and Instruction Following

Jiahao Zhao, Yunjia Li, Wei Li, Kazuyoshi Yoshii

机构 * Graduate School of Informatics, Kyoto University, Japan(京都大学信息科学研究生院) College of Computer Science and Artificial Intelligence, Fudan University, China(复旦大学计算机科学与人工智能学院) Graduate School of Engineering, Kyoto University, Japan(京都大学工学研究科)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23061 2025-09-30 cs.PL cs.AI 89%

Local Success Does Not Compose: Benchmarking Large Language Models for Compositional Formal Verification

Xu Xu, Xin Li, Xingwei Qu, Jie Fu, Binhang Yuan

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏