arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138237 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12353 篇

2511.17408 2026-04-21 cs.AI cs.LG 87%

The Impact of Off-Policy Training Data on Probe Generalisation

偏离策略训练数据对探测泛化的影响

Nathalie Kirch, Samuel Dower, Adrians Skapars, Helen Yannakoudakis, Ekdeep Singh Lubana, Dmitrii Krasheninnikov

机构 * King’s College London(伦敦国王学院) Imperial College London(伦敦帝国学院) LASR Labs(LASR实验室) University of Manchester(曼彻斯特大学) Goodfire AI University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了偏离策略训练数据对八个不同LLM行为探测泛化的影响,发现训练策略显著影响探测性能,尤其在涉及响应意图的行为上表现更差,并提出预测泛化失败的测试方法。

Comments 10 pages, ACL 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12407 2026-04-17 cs.CR cs.CL cs.LG 87%

De-Anonymization at Scale via Tournament-Style Attribution

通过竞赛式归因实现大规模去匿名化

Lirui Zhang, Huishuai Zhang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究利用LLM链接匿名文档与其作者,提出大规模去匿名化方法DAS,通过分组筛选和多数投票提升鲁棒性和精度,实验显示在匿名平台存在现实隐私风险。

Comments 14 pages, ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06767 2026-04-09 cs.LG cs.CL 87%

Geometric Properties of the Voronoi Tessellation in Latent Semantic Manifolds of Large Language Models

大型语言模型潜在语义流形中Voronoi分割的几何特性

Marshall Brett

机构 * MARS Labs(MARS实验室)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

AI总结 研究大型语言模型在潜在语义流形中的Voronoi分割,通过浮点32精度重新计算消除bfloat16量化伪影,验证表达性差距的线性缩放定律,并展示通过边距优化程序重塑Voronoi分割的可行性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06197 2026-04-09 cs.CL cs.AI 87%

Temporally Phenotyping GLP-1RA Case Reports with Large Language Models: A Textual Time Series Corpus and Risk Modeling

利用大语言模型进行GLP-1RA病例报告的时间表表征:一个文本时间序列语料库和风险建模

Sayantan Kumar, Jeremy C. Weiss

机构 * National Library of Medicine(美国国家医学图书馆)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文利用大语言模型处理GLP-1RA病例报告的时间线,构建了包含136个病例的文本时间序列语料库,并通过时间序列分析评估了模型在提取临床事件及其时间点上的性能,发现GPT5在事件覆盖和时间顺序上表现优异,并展示了糖尿病患者使用GLP-1RA降低呼吸并发症风险的证据。

Comments AMIA Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23251 2026-03-25 cs.CL cs.LG 87%

Is AI Catching Up to Human Expression? Exploring Emotion, Personality, Authorship, and Linguistic Style in English and Arabic with Six Large Language Models

人工智能是否正在赶上人类表达?探索英语和阿拉伯语中情感、个性、作者身份和语言风格的模仿

Nasser A Alsadhan

机构 * College of Computer and Information Sciences, King Saud University(计算机与信息科学学院,沙特阿拉伯国王沙德大学)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文研究六种大语言模型在英语和阿拉伯语中模仿情感和个性的能力,发现AI生成文本可被识别,但分类性能下降,揭示了LLM在情感信号编码上的差异。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20674 2026-02-23 cs.CL cs.AI 87%

PonderLM: Pretraining Language Models to Ponder in Continuous Space

PonderLM:在连续空间中预训练语言模型以进行思考

Boyi Zeng, Shixiang Song, Siyuan Huang, Yixuan Wang, He Li, Ziwei He, Xinbing Wang, Zhiyu Li, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) Shanghai Jiao Tong University(上海交通大学) Institute for Advanced Algorithms Research Shanghai(上海高级算法研究所) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

AI总结 PonderLM通过在连续空间中引入思考过程,提升语言模型的认知处理能力,实验表明其在多个基准测试中优于现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17869 2026-01-27 cs.CL cs.LG 87%

On the Emergence and Test-Time Use of Structural Information in Large Language Models

关于大型语言模型中结构信息的出现及其测试时使用

Michelle Chao Chen, Moritz Miller, Bernhard Schölkopf, Siyuan Guo

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) University of Cambridge(剑桥大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

AI总结 本研究探讨了大型语言模型如何学习和利用结构信息,发现其在复杂推理任务中表现突出,但测试时组合生成能力仍受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14780 2026-01-22 cs.CL cs.AI 87%

RECAP: Resistance Capture in Text-based Mental Health Counseling with Large Language Models

RECAP: 在基于文本的心理健康咨询中利用大语言模型进行抗阻捕捉

Anqi Li, Yuqian Chen, Yu Lu, Zhaoming Chen, Yuan Xie, Zhenzhong Lan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 RECAP通过捕捉13种细粒度抗阻行为,提高了基于文本的心理健康咨询中抗阻检测的准确性和解释性,优于现有方法。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17103 2026-01-07 cs.CL cs.AI 87%

Forging Time Series with Language: A Large Language Model Approach to Synthetic Data Generation

用语言锻造时间序列:一种基于大语言模型的合成数据生成方法

Cécile Rousseau, Tobia Boschi, Giandomenico Cornacchia, Dhaval Salwala, Alessandra Pascale, Juan Bernabe Moreno

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SDForger通过大语言模型生成高质量多变量时间序列,利用文本条件化实现高效合成数据生成及多模态建模。

Journal ref NeurIPS 2025, https://openreview.net/forum?id=A2pmvkqOgp

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09323 2025-12-30 cs.CL cs.AI 87%

Leveraging Large Language Models for Rare Disease Named Entity Recognition

利用大语言模型进行罕见疾病命名实体识别

Nan Miles Xi, Yu Deng, Lin Wang

专题命中 预训练与数据 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用大语言模型在低资源环境下提升罕见疾病命名实体识别性能,通过结构化提示框架和语义引导方法,实现优于传统模型的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14469 2025-12-02 cs.CL cs.AI 87%

Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations

大语言模型在混合语言扰动下的归因安全故障

Somnath Banerjee, Pratyush Chatterjee, Shanu Kumar, Sayan Layek, Parag Agrawal, Rima Hazra, Animesh Mukherjee

机构 * Microsoft Corporation(微软公司)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在混合语言扰动下存在归因安全故障,提出显著性漂移归因框架并提出翻译基恢复策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16096 2025-10-21 cs.CL cs.LG 87%

Facts in Stats: Impacts of Pretraining Diversity on Language Model Generalization

Tina Behnia, Puneesh Deora, Christos Thrampoulidis

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.LG

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01892 2025-08-05 cs.LG cs.AI 87%

How Does Controllability Emerge In Language Models During Pretraining?

Jianshu She, Xinyue Li, Eric Xing, Zhengzhong Liu, Qirong Ho

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00619 2025-08-04 cs.CL cs.LG 87%

DACTYL: Diverse Adversarial Corpus of Texts Yielded from Large Language Models

Shantanu Thorat, Andrew Caines

机构 * Department of Computer Science & Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

Comments MPhil in Advanced Computer Science thesis for University of Cambridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12466 2025-07-17 cs.CL cs.LG 87%

Language Models Improve When Pretraining Data Matches Target Tasks

David Mizrahi, Anders Boesen Lindbo Larsen, Jesse Allardice, Suzie Petryk, Yuri Gorokhov, Jeffrey Li, Alex Fang, Josh Gardner, Tom Gunter, Afshin Dehghan

机构 * Apple(苹果公司) University of Washington(华盛顿大学) Stanford(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG

Comments 44 pages, 25 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00548 2025-06-03 cs.CR cs.CL cs.LG 87%

Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities

Jiahui Geng, Thy Thy Tran, Preslav Nakov, Iryna Gurevych

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01380 2025-03-13 cs.CL cs.AI 87%

Knowledge Entropy Decay during Language Model Pretraining Hinders New Knowledge Acquisition

Jiyeon Kim, Hyunji Lee, Hyowon Cho, Joel Jang, Hyeonbin Hwang, Seungpil Won, Youbin Ahn, Dohaeng Lee, Minjoon Seo

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.AI

Comments ICLR 2025, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06054 2025-03-11 cs.CL cs.AI 87%

Fine-Grained Bias Detection in LLM: Enhancing detection mechanisms for nuanced biases

Suvendu Mohanty

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

Comments Bias detection, Large Language Models, nuanced biases, fine-grained mechanisms, model transparency, ethical AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13198 2024-09-23 cs.CL cs.LG stat.ML 87%

Exploring Scaling Laws for Local SGD in Large Language Model Training

Qiaozhi He, Xiaomin Zhuang, Zhihua Wu

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09455 2024-06-17 cs.CV cs.AI cs.CL 87%

Pandora: Towards General World Model with Natural Language Actions and Video States

Jiannan Xiang, Guangyi Liu, Yi Gu, Qiyue Gao, Yuting Ning, Yuheng Zha, Zeyu Feng, Tianhua Tao, Shibo Hao, Yemin Shi, Zhengzhong Liu, Eric P. Xing, Zhiting Hu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Website: https://world-model.maitrix.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03304 2024-06-14 cs.CL cs.LG 87%

Large Language Models for Document-Level Event-Argument Data Augmentation for Challenging Role Types

Joseph Gatto, Parker Seegmiller, Omar Sharif, Sarah M. Preum

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

Comments Paper in submission (8 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02385 2024-06-05 cs.CL cs.AI 87%

TinyLlama: An Open-Source Small Language Model

Peiyuan Zhang, Guangtao Zeng, Tianduo Wang, Wei Lu

专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17076 2024-05-28 cs.AI cs.CL cs.IR 87%

Leveraging small language models for Text2SPARQL tasks to improve the resilience of AI assistance

Felix Brei, Johannes Frey, Lars-Peter Meyer

专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI

Comments To appear in Proceedings of the Workshop on Linked Data-driven Resilience Research 2024 (D2R2) co-located with Extended Semantic Web Conference 2024 (ESWC 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02255 2024-02-06 cs.CL cs.LG 87%

Frequency Explains the Inverse Correlation of Large Language Models' Size, Training Data Amount, and Surprisal's Fit to Reading Times

Byung-Doh Oh, Shisen Yue, William Schuler

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

Comments EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01115 2023-04-04 cs.CV cs.AI cs.LG 87%

LASP: Text-to-Text Optimization for Language-Aware Soft Prompting of Vision & Language Models

Adrian Bulat, Georgios Tzimiropoulos

专题命中 预训练与数据 :prompting(title,abstract);language model(title);分类 cs.AI、cs.LG

Comments Accepted at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.01806 2023-02-06 cs.CL cs.AI 87%

Mitigating Data Scarcity for Large Language Models

Hoang Van

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments 155 pages, 26 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15231 2022-10-28 cs.CL cs.AI 87%

Unsupervised Boundary-Aware Language Model Pretraining for Chinese Sequence Labeling

Peijie Jiang, Dingkun Long, Yanzhao Zhang, Pengjun Xie, Meishan Zhang, Min Zhang

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

Comments 12 pages, 2 figures, 7 tables, EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.07055 2022-06-16 cs.CL cs.LG 87%

Large Language Models are not Models of Natural Language: they are Corpus Models

Csaba Veres

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.10318 2021-10-22 cs.CL cs.LG 87%

Improved Multilingual Language Model Pretraining for Social Media Text via Translation Pair Prediction

Shubhanshu Mishra, Aria Haghighi

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG

Comments Camera ready version. Accepted to WNUT 2021. Code for reproducing the experiments can be found at: https://github.com/twitter-research/multilingual-alignment-tpp

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.11241 2020-01-30 cs.CL cs.IR cs.LG 87%

Healthcare NER Models Using Language Model Pretraining

Amogh Kamat Tarcar, Aashis Tiwari, Vineet Naique Dhaimodker, Penjo Rebelo, Rahul Desai, Dattaraj Rao

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.LG

Comments This work was presented at the first Health Search and Data Mining Workshop (HSDM 2020) as part of WSDM 2020 conference

详情

展开后加载摘要…

URL PDF HTML 收藏