arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137794 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12318 篇

2512.10932 2026-03-31 cs.CV cs.AI 89%

BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models

BabyVLM-V2:迈向基于发展基础的视觉基础模型预训练与基准测试

Shengao Wang, Wenqi Wang, Zecheng Wang, Max Whitton, Michael Wakeham, Arjun Chandra, Joey Huang, Pengyue Zhu, Helen Chen, David Li, Jeffrey Li, Shawn Li, Andrew Zagula, Amy Zhao, Andrew Zhu, Sayaka Nakamura, Yuki Yamamoto, Jerry Jun Yokono, Aaron Mueller, Bryan A. Plummer, Kate Saenko, Venkatesh Saligrama, Boqing Gong

机构 * Boston University(波士顿大学) Sony Group Corporation(索尼集团公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 BabyVLM-V2通过纵向多维预训练集、灵活模型和DevCV工具箱,提升婴儿启发式视觉语言模型性能,实验证明其在基准测试中表现优异。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19269 2026-03-23 cs.CL 89%

From Tokens To Agents: A Researcher's Guide To Understanding Large Language Models

从标记到代理:研究者理解大型语言模型的指南

Daniele Barolo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文探讨了如何有效使用大型语言模型,分析了预训练数据、标记化、Transformer架构等六个关键组成部分,通过案例研究展示如何评估LLM在特定研究中的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07632 2026-03-20 cs.CV cs.AI 89%

GeoMotionGPT: Geometry-Aligned Motion Understanding with Large Language Models

GeoMotionGPT:基于大语言模型的几何对齐运动理解

Zhankai Ye, Bofan Li, Yukai Jin, Shuoqiu Li, Wei Wang, Yanfu Zhang, Shangqian Gao, Xin Liu

机构 * Florida State University(佛罗里达州立大学) Texas Tech University(德克萨斯技术大学) William & Mary University(威廉与玛丽大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出GeoMotionGPT框架,通过几何对齐提升运动理解与运动-语言推理能力,实验表明在HumanML3D和KIT-ML上性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20623 2026-03-20 cs.AI 89%

Copyright Detection in Large Language Models: An Ethical Approach to Generative AI Development

在大型语言模型中的版权检测:生成式AI发展的伦理方法

David Szczecina, Senan Gaffori, Edmond Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一个开源平台,帮助内容创作者验证其作品是否被用于LLM训练数据集,通过提升易用性、改进相似性检测和优化数据集验证,减少计算开销,促进AI开发的透明度和伦理合规。

Comments 4 pages, 3 figures

Journal ref Canadian Undergraduate Conference on Artificial Intelligence, 4 (2025) 75-78

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05369 2026-03-06 cs.CL 89%

Progressive Residual Warmup for Language Model Pretraining

逐步残差预热用于语言模型预训练

Tianhao Chen, Xin Xu, Lu Yin, Hao Chen, Yang Wang, Shizhe Diao, Can Yang

机构 * The Hong Kong University of Science(香港科学与技术大学) NVIDIA, Santa Clara, US(NVIDIA公司) The University of Hong Kong, Hong Kong, China(香港大学) University of Surrey, Guildford, UK(萨里大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL

AI总结 ProRes通过逐步残差预热方法提升语言模型预训练的稳定性与收敛速度,实现更快的收敛和更好的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22760 2026-02-27 cs.DC cs.AI 89%

Distributed LLM Pretraining During Renewable Curtailment Windows: A Feasibility Study

分布式LLM预训练期间可再生能源削减窗口:可行性研究

Philipp Wiesner, Soeren Becker, Brett Cornick, Dominik Scheinert, Alexander Acker, Odej Kao

机构 * TU Berlin(柏林技术大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title);large language model(abstract);language model(abstract)

AI总结 本研究探讨在可再生能源削减窗口期间利用清洁廉价电力进行分布式LLM预训练的可行性,通过联邦学习框架实现跨地理分布集群的弹性训练,降低碳排放。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20052 2026-02-24 cs.CL 89%

Entropy in Large Language Models

大语言模型中的熵

Marco Scharringhausen

机构 * Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究比较了大语言模型与自然语言的词熵,发现LLM的词熵低于自然口语,旨在评估LLM训练数据对信息和不确定性的影响。

Comments 7 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09392 2026-02-17 cs.CR cs.AI 89%

LLMAC: A Global and Explainable Access Control Framework with Large Language Model

LLMAC: 一种全局且可解释的访问控制框架基于大语言模型

Sharif Noor Zisad, Ragib Hasan

机构 * Department of Computer Science(计算机科学系) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 LLMAC利用大语言模型整合多种访问控制方法,实现高准确率和可解释性,显著优于传统方法。

Comments This paper is accepted and presented in IEEE Consumer Communications & Networking Conference (CCNC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21551 2026-02-04 cs.LG 89%

Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test

在LLM预训练中“Grokking”?无需测试即可监控记忆到泛化的过程

Ziyue Li, Chenrui Fan, Tianyi Zhou

机构 * Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学,学院公园)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);instruction tuning(abstract);分类 cs.LG

AI总结 本文研究了LLM预训练中“Grokking”现象,通过分析训练数据路径的动态变化,提出两种新度量标准以监控模型泛化能力,无需额外成本。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03034 2026-01-09 cs.CL 89%

NorwAI's Large Language Models: Technical Report

NorwAI的大型语言模型:技术报告

Jon Atle Gulla, Peng Liu, Lemei Zhang

机构 * Norwegian Research Center for AI Innovation (NorwAI)(挪威人工智能创新研究中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 NorwAI开发了针对挪威语和其他斯堪的纳维亚语言的大型语言模型,通过预训练和微调策略提升性能与适应性,适用于交互和领域特定应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03570 2026-01-08 cs.CL 89%

How Do Large Language Models Learn Concepts During Continual Pre-Training?

大型语言模型在持续预训练中如何学习概念?

Barry Menglong Yao, Sha Li, Yunzhi Yao, Minqian Liu, Zaishuo Xia, Qifan Wang, Lifu Huang

机构 * UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) UCLA(加州大学洛杉矶分校) Meta AI

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究揭示了大型语言模型在持续预训练中概念学习的动态机制,通过分析概念电路揭示了概念获取、遗忘及相互作用的规律,为设计更可解释的训练策略提供依据。

Comments 12 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02830 2026-01-08 cs.CL 89%

The performances of the Chinese and U.S. Large Language Models on the Topic of Chinese Culture

中中美大语言模型在中华文化传播主题上的表现

Feiyan Liu, Siyan Zhao, Chenxun Zhuo, Tianming Liu, Bao Ge

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究评估了中美开发的大语言模型在中华文化传播问题上的表现,发现中国模型在相关任务上普遍优于美国模型,且Gemini 2.5Pro和GPT-5.1表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14757 2025-12-23 cs.SE cs.AI 89%

SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs

SWE-Synth:合成可验证的bug修复数据以使大语言模型能够解决现实中的bug

Minh V. T. Pham, Huy N. Phan, Hoang N. Phan, Cuong Le Chi, Tien N. Nguyen, Nghi D. Q. Bui

机构 * FPT Software AI Center, Viet Nam(越南FPT软件AI中心) Nanyang Technological University, Singapore(新加坡南洋理工大学) University of Texas at Dallas, US(美国德克萨斯大学达拉斯分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 SWE-Synth通过合成可验证的bug修复数据集,提升大语言模型在解决现实bug中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22818 2025-12-22 cs.AI cs.CY 89%

Can Large Language Models Develop Gambling Addiction?

大语言模型能否产生赌博成瘾?

Seungpil Lee, Donghyeon Shin, Yunjeong Lee, Sundong Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology(人工智能融合系,全州科学技术院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究探讨大语言模型在老虎机实验中表现出赌博成瘾行为,揭示其决策机制与风险认知特征,指出模型行为受抽象决策特征控制而非单纯依赖训练数据。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07031 2025-12-08 econ.EM cs.AI 89%

Large Language Models: An Applied Econometric Framework

大语言模型:一个应用计量经济学框架

Jens Ludwig, Sendhil Mullainathan, Ashesh Rambachan

机构 * Center for Applied Artificial Intelligence at the University of Chicago(芝加哥大学应用人工智能中心) Altman Family Fund at MIT(麻省理工学院阿尔特曼家族基金) University of Chicago(芝加哥大学) Massachusetts Institute of Technology(麻省理工学院) NBER(美国国家经济研究局)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一个应用计量经济学框架,利用大语言模型进行文本预测和经济概念测量,强调无训练泄漏和验证样本的重要性,以提高实证分析的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21006 2025-12-01 cs.CL 89%

TrackList: Tracing Back Query Linguistic Diversity for Head and Tail Knowledge in Open Large Language Models

TrackList: 回溯查询语言多样性以探究开放式大语言模型中的头部与尾部知识

Ioana Buhnila, Aman Sinha, Mathieu Constant

机构 * ATILF, University of Lorraine - CNRS, France(ATILF,洛林大学 - CNRS,法国) Center for Data Science in Humanities, Chosun University, South Korea(人文数据科学中心,全州大学,韩国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 TrackList研究了预训练数据对LLMs回答多样化语言查询的影响,发现LLMs在定义型问题表现最佳,但在例子型问题表现最差,且更倾向于改写流行知识而非尾部和技术知识。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15503 2025-11-25 cs.CL 89%

Llama2Vec: Unsupervised Adaptation of Large Language Models for Dense Retrieval

Llama2Vec: 无监督适应大型语言模型用于密集检索

Zheng Liu, Chaofan Li, Shitao Xiao, Yingxia Shao, Defu Lian

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 Llama2Vec通过无监督适应LLM提升密集检索性能,实现新的最先进结果。

Comments ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14831 2025-11-19 eess.SP cs.LG 89%

Robust Transmission of Punctured Text with Large Language Model-based Recovery

Sojeong Park, Hyeonho Noh, Hyun Jong Yang

机构 * Department of Electrical Engineering, Pohang University of Science and Technology, Korea(首尔国立大学) Department of Electrical and Computer Engineering, Seoul National University, Korea(首尔国立大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments This work has been submitted to the IEEE for possible publication

Journal ref IEEE Transactions on Vehicular Technology, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14245 2025-11-19 cs.CL 89%

MuCPT: Music-related Natural Language Model Continued Pretraining

Kai Tian, Yirong Mao, Wendong Bi, Hanjie Wang, Que Wenhui

机构 * Tsinghua University(清华大学) Tencent Inc(腾讯公司)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14153 2025-11-19 cs.LG cs.CY 89%

A Comprehensive Study of Implicit and Explicit Biases in Large Language Models

Fatima Kazi, Alex Young, Yash Inani, Setareh Rafatirad

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18966 2025-11-18 cs.CL 89%

DataGen: Unified Synthetic Dataset Generation via Large Language Models

Yue Huang, Siyuan Wu, Chujie Gao, Dongping Chen, Qihui Zhang, Yao Wan, Tianyi Zhou, Jianfeng Gao, Chaowei Xiao, Lichao Sun, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) Huazhong University of Science and Technology(华中科技大学) MBZUAI University of Washington(华盛顿大学) Peking University(北京大学) University of Maryland, College Park(马里兰大学学院市分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) Lehigh University(莱斯大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12131 2025-11-18 cs.CV cs.AI 89%

OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description

Quanxing Xu, Ling Zhou, Feifei Zhang, Jinyu Tian, Rubing Huang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09115 2025-11-11 cs.CL 89%

SinLlama -- A Large Language Model for Sinhala

H. W. K. Aravinda, Rashad Sirajudeen, Samith Karunathilake, Nisansa de Silva, Surangika Ranathunga, Rishemjit Kaur

机构 * Central Scientific Instruments Organisation, Academy of Scientific and Innovative Research(中央科学仪器组织,科学与创新研究院) School of Mathematical and Computational Sciences, Massey University(数学与计算科学学院,梅西大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03106 2025-11-06 cs.AI 89%

Large language models require a new form of oversight: capability-based monitoring

Katherine C. Kellogg, Bingyang Ye, Yifan Hu, Guergana K. Savova, Byron Wallace, Danielle S. Bitterman

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00691 2025-10-28 cs.CL 89%

Leveraging Large Language Models for Code-Mixed Data Augmentation in Sentiment Analysis

Linda Zeng

机构 * The Harker School(哈克尔学校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments 17 pages, 4 figures, 11 tables, To be published in the Proceedings of the Second Workshop on Social Influence in Conversations (SICon 2024), co-located with EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10603 2025-10-24 cs.AI 89%

EA4LLM: A Gradient-Free Approach to Large Language Model Optimization via Evolutionary Algorithms

WenTao Liu, Siyu Song, Hao Hao, Aimin Zhou

机构 * Shanghai Institute of Artifical Intelligence Education, East China Normal University, Shanghai, China(上海人工智能教育研究院,东华大学,上海,中国) School of Computer Science and Technology, East China Normal University, Shanghai, China(计算机科学与技术学院,东华大学,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15480 2025-10-20 cs.SE cs.AI 89%

Selecting and Combining Large Language Models for Scalable Code Clone Detection

Muslim Chochlov, Gul Aftab Ahmed, James Vincent Patten, Yuanhua Han, Guoxian Lu, David Gregg, Jim Buckley

机构 * University of Limerick(利默里克大学) Trinity College Dublin(都柏林三一学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20639 2025-10-20 cs.CR cs.AI 89%

A Framework for Rapidly Developing and Deploying Protection Against Large Language Model Attacks

Adam Swanda, Amy Chang, Alexander Chen, Fraser Burch, Paul Kassianik, Konstantin Berlin

机构 * Cisco Systems(思科系统)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10179 2025-10-14 cs.SE cs.AI 89%

LLMs are All You Need? Improving Fuzz Testing for MOJO with Large Language Models

Linghan Huang, Peizhou Zhao, Huaming Chen

机构 * School of Electrical and Computer Engineering, University of Sydney(悉尼大学电气与计算机工程学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04848 2025-10-07 cs.CL 89%

Instability in Downstream Task Performance During LLM Pretraining

Yuto Nishida, Masaru Isonuma, Yusuke Oda

机构 * Nara Institute of Science and Technology(那拉科学与技术研究所) Tohoku University(东北大学) Research and Development Center for Large Language Models, National Institute of Informatics(大型语言模型研究与开发中心,信息学国家研究所)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title);large language model(abstract);language model(abstract)

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏