arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12365 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2605.23901 2026-05-25 cs.LG cs.AI cs.IT math.IT 87%

LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws

LLMs 作为噪声信道:香农视角下的模型容量与缩放定律

Xu Ouyang, Deyi Liu, Yuhang Cai, Jing Liu, Yuan Yang, Chen Zheng, Thomas Hartvigsen, Yiyuan Ma

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有缩放定律无法解释非单调性能退化的问题,提出基于香农-哈特利定理的香农缩放定律,将LLM训练建模为噪声信道上的信息传输,通过信号噪声比解释模型规模与数据量对性能的影响。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19285 2026-05-20 cs.CL cs.AI cs.CY 87%

Are Rationales Necessary and Sufficient? Tuning LLMs for Explainable Misinformation Detection

理性是否必要且充分?为可解释的虚假信息检测调优大语言模型

Bing Wang, Rui Miao, Ximing Li, Chen Shen, Shaotian Yan, Changchun Li, Kaiyuan Liu, Xiaosong Yuan, Jieping Ye

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Tongyi Lab, Alibaba Group(阿里云实验室) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了如何通过调优大语言模型(LLM)来提升可解释性虚假信息检测的性能,提出了一种新的数据合成管道LONSREX,用于定位必要且充分的理性,以解决现有方法中因粗粒度标签和过度验证行为导致的理性不足和冗余问题。

Comments Accepted by KDD 2026. 12 pages, 8 figures. Code: https://github.com/wangbing1416/LONSREX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13436 2026-05-14 cs.CL cs.LG 87%

Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP

通过子词正则化预训练语言模型:BPE Dropout在低资源NLP中的实证研究

Ruan Visser, Trienko Grobler, Marcel Dunaiski

机构 * Department of Computer Science, Stellenbosch University(斯瓦茨堡大学计算机科学系)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG

AI总结 本文研究了在低资源NLP中预训练时应用BPE Dropout对下游性能的影响,发现随机分词在预训练和微调时均优于仅在微调时应用,尤其在数据较少时表现更佳。

Comments Comments: 12 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12438 2026-05-13 cs.CL cs.AI 87%

A Causal Language Modeling Detour Improves Encoder Continued Pretraining

通过因果语言模型的绕行提升编码器持续预训练

Rian Touchent, Eric de la Clergerie

机构 * Sorbonne Université / INRIA Paris ALMAnaCH Team(索邦大学 / 巴黎INRIA ALMAnaCH团队) INRIA Paris ALMAnaCH Team(巴黎INRIA ALMAnaCH团队)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

AI总结 本文通过在持续预训练中临时切换到因果语言模型并随后进行短时掩码语言模型衰减,提升了下游任务性能,特别是在生物医学文本上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17408 2026-04-21 cs.AI cs.LG 87%

The Impact of Off-Policy Training Data on Probe Generalisation

偏离策略训练数据对探测泛化的影响

Nathalie Kirch, Samuel Dower, Adrians Skapars, Helen Yannakoudakis, Ekdeep Singh Lubana, Dmitrii Krasheninnikov

机构 * King’s College London(伦敦国王学院) Imperial College London(伦敦帝国学院) LASR Labs(LASR实验室) University of Manchester(曼彻斯特大学) Goodfire AI University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了偏离策略训练数据对八个不同LLM行为探测泛化的影响,发现训练策略显著影响探测性能,尤其在涉及响应意图的行为上表现更差,并提出预测泛化失败的测试方法。

Comments 10 pages, ACL 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12407 2026-04-17 cs.CR cs.CL cs.LG 87%

De-Anonymization at Scale via Tournament-Style Attribution

通过竞赛式归因实现大规模去匿名化

Lirui Zhang, Huishuai Zhang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究利用LLM链接匿名文档与其作者,提出大规模去匿名化方法DAS,通过分组筛选和多数投票提升鲁棒性和精度,实验显示在匿名平台存在现实隐私风险。

Comments 14 pages, ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06767 2026-04-09 cs.LG cs.CL 87%

Geometric Properties of the Voronoi Tessellation in Latent Semantic Manifolds of Large Language Models

大型语言模型潜在语义流形中Voronoi分割的几何特性

Marshall Brett

机构 * MARS Labs(MARS实验室)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

AI总结 研究大型语言模型在潜在语义流形中的Voronoi分割,通过浮点32精度重新计算消除bfloat16量化伪影,验证表达性差距的线性缩放定律,并展示通过边距优化程序重塑Voronoi分割的可行性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06197 2026-04-09 cs.CL cs.AI 87%

Temporally Phenotyping GLP-1RA Case Reports with Large Language Models: A Textual Time Series Corpus and Risk Modeling

利用大语言模型进行GLP-1RA病例报告的时间表表征:一个文本时间序列语料库和风险建模

Sayantan Kumar, Jeremy C. Weiss

机构 * National Library of Medicine(美国国家医学图书馆)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文利用大语言模型处理GLP-1RA病例报告的时间线,构建了包含136个病例的文本时间序列语料库,并通过时间序列分析评估了模型在提取临床事件及其时间点上的性能,发现GPT5在事件覆盖和时间顺序上表现优异,并展示了糖尿病患者使用GLP-1RA降低呼吸并发症风险的证据。

Comments AMIA Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23251 2026-03-25 cs.CL cs.LG 87%

Is AI Catching Up to Human Expression? Exploring Emotion, Personality, Authorship, and Linguistic Style in English and Arabic with Six Large Language Models

人工智能是否正在赶上人类表达?探索英语和阿拉伯语中情感、个性、作者身份和语言风格的模仿

Nasser A Alsadhan

机构 * College of Computer and Information Sciences, King Saud University(计算机与信息科学学院,沙特阿拉伯国王沙德大学)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文研究六种大语言模型在英语和阿拉伯语中模仿情感和个性的能力,发现AI生成文本可被识别,但分类性能下降,揭示了LLM在情感信号编码上的差异。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20674 2026-02-23 cs.CL cs.AI 87%

PonderLM: Pretraining Language Models to Ponder in Continuous Space

PonderLM:在连续空间中预训练语言模型以进行思考

Boyi Zeng, Shixiang Song, Siyuan Huang, Yixuan Wang, He Li, Ziwei He, Xinbing Wang, Zhiyu Li, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) Shanghai Jiao Tong University(上海交通大学) Institute for Advanced Algorithms Research Shanghai(上海高级算法研究所) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

AI总结 PonderLM通过在连续空间中引入思考过程,提升语言模型的认知处理能力,实验表明其在多个基准测试中优于现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17869 2026-01-27 cs.CL cs.LG 87%

On the Emergence and Test-Time Use of Structural Information in Large Language Models

关于大型语言模型中结构信息的出现及其测试时使用

Michelle Chao Chen, Moritz Miller, Bernhard Schölkopf, Siyuan Guo

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) University of Cambridge(剑桥大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

AI总结 本研究探讨了大型语言模型如何学习和利用结构信息,发现其在复杂推理任务中表现突出,但测试时组合生成能力仍受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14780 2026-01-22 cs.CL cs.AI 87%

RECAP: Resistance Capture in Text-based Mental Health Counseling with Large Language Models

RECAP: 在基于文本的心理健康咨询中利用大语言模型进行抗阻捕捉

Anqi Li, Yuqian Chen, Yu Lu, Zhaoming Chen, Yuan Xie, Zhenzhong Lan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 RECAP通过捕捉13种细粒度抗阻行为,提高了基于文本的心理健康咨询中抗阻检测的准确性和解释性,优于现有方法。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17103 2026-01-07 cs.CL cs.AI 87%

Forging Time Series with Language: A Large Language Model Approach to Synthetic Data Generation

用语言锻造时间序列:一种基于大语言模型的合成数据生成方法

Cécile Rousseau, Tobia Boschi, Giandomenico Cornacchia, Dhaval Salwala, Alessandra Pascale, Juan Bernabe Moreno

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SDForger通过大语言模型生成高质量多变量时间序列,利用文本条件化实现高效合成数据生成及多模态建模。

Journal ref NeurIPS 2025, https://openreview.net/forum?id=A2pmvkqOgp

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09323 2025-12-30 cs.CL cs.AI 87%

Leveraging Large Language Models for Rare Disease Named Entity Recognition

利用大语言模型进行罕见疾病命名实体识别

Nan Miles Xi, Yu Deng, Lin Wang

专题命中 预训练与数据 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用大语言模型在低资源环境下提升罕见疾病命名实体识别性能,通过结构化提示框架和语义引导方法,实现优于传统模型的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14469 2025-12-02 cs.CL cs.AI 87%

Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations

大语言模型在混合语言扰动下的归因安全故障

Somnath Banerjee, Pratyush Chatterjee, Shanu Kumar, Sayan Layek, Parag Agrawal, Rima Hazra, Animesh Mukherjee

机构 * Microsoft Corporation(微软公司)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在混合语言扰动下存在归因安全故障,提出显著性漂移归因框架并提出翻译基恢复策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16096 2025-10-21 cs.CL cs.LG 87%

Facts in Stats: Impacts of Pretraining Diversity on Language Model Generalization

Tina Behnia, Puneesh Deora, Christos Thrampoulidis

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.LG

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01892 2025-08-05 cs.LG cs.AI 87%

How Does Controllability Emerge In Language Models During Pretraining?

Jianshu She, Xinyue Li, Eric Xing, Zhengzhong Liu, Qirong Ho

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00619 2025-08-04 cs.CL cs.LG 87%

DACTYL: Diverse Adversarial Corpus of Texts Yielded from Large Language Models

Shantanu Thorat, Andrew Caines

机构 * Department of Computer Science & Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

Comments MPhil in Advanced Computer Science thesis for University of Cambridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12466 2025-07-17 cs.CL cs.LG 87%

Language Models Improve When Pretraining Data Matches Target Tasks

David Mizrahi, Anders Boesen Lindbo Larsen, Jesse Allardice, Suzie Petryk, Yuri Gorokhov, Jeffrey Li, Alex Fang, Josh Gardner, Tom Gunter, Afshin Dehghan

机构 * Apple(苹果公司) University of Washington(华盛顿大学) Stanford(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG

Comments 44 pages, 25 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00548 2025-06-03 cs.CR cs.CL cs.LG 87%

Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities

Jiahui Geng, Thy Thy Tran, Preslav Nakov, Iryna Gurevych

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01380 2025-03-13 cs.CL cs.AI 87%

Knowledge Entropy Decay during Language Model Pretraining Hinders New Knowledge Acquisition

Jiyeon Kim, Hyunji Lee, Hyowon Cho, Joel Jang, Hyeonbin Hwang, Seungpil Won, Youbin Ahn, Dohaeng Lee, Minjoon Seo

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.AI

Comments ICLR 2025, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06054 2025-03-11 cs.CL cs.AI 87%

Fine-Grained Bias Detection in LLM: Enhancing detection mechanisms for nuanced biases

Suvendu Mohanty

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

Comments Bias detection, Large Language Models, nuanced biases, fine-grained mechanisms, model transparency, ethical AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13198 2024-09-23 cs.CL cs.LG stat.ML 87%

Exploring Scaling Laws for Local SGD in Large Language Model Training

Qiaozhi He, Xiaomin Zhuang, Zhihua Wu

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09455 2024-06-17 cs.CV cs.AI cs.CL 87%

Pandora: Towards General World Model with Natural Language Actions and Video States

Jiannan Xiang, Guangyi Liu, Yi Gu, Qiyue Gao, Yuting Ning, Yuheng Zha, Zeyu Feng, Tianhua Tao, Shibo Hao, Yemin Shi, Zhengzhong Liu, Eric P. Xing, Zhiting Hu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Website: https://world-model.maitrix.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03304 2024-06-14 cs.CL cs.LG 87%

Large Language Models for Document-Level Event-Argument Data Augmentation for Challenging Role Types

Joseph Gatto, Parker Seegmiller, Omar Sharif, Sarah M. Preum

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

Comments Paper in submission (8 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02385 2024-06-05 cs.CL cs.AI 87%

TinyLlama: An Open-Source Small Language Model

Peiyuan Zhang, Guangtao Zeng, Tianduo Wang, Wei Lu

专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17076 2024-05-28 cs.AI cs.CL cs.IR 87%

Leveraging small language models for Text2SPARQL tasks to improve the resilience of AI assistance

Felix Brei, Johannes Frey, Lars-Peter Meyer

专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI

Comments To appear in Proceedings of the Workshop on Linked Data-driven Resilience Research 2024 (D2R2) co-located with Extended Semantic Web Conference 2024 (ESWC 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02255 2024-02-06 cs.CL cs.LG 87%

Frequency Explains the Inverse Correlation of Large Language Models' Size, Training Data Amount, and Surprisal's Fit to Reading Times

Byung-Doh Oh, Shisen Yue, William Schuler

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

Comments EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01115 2023-04-04 cs.CV cs.AI cs.LG 87%

LASP: Text-to-Text Optimization for Language-Aware Soft Prompting of Vision & Language Models

Adrian Bulat, Georgios Tzimiropoulos

专题命中 预训练与数据 :prompting(title,abstract);language model(title);分类 cs.AI、cs.LG

Comments Accepted at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.01806 2023-02-06 cs.CL cs.AI 87%

Mitigating Data Scarcity for Large Language Models

Hoang Van

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments 155 pages, 26 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏