arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138434 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2403.07118 2024-04-09 cs.CL 86%

Narrating Causal Graphs with Large Language Models

Atharva Phatak, Vijay K. Mago, Ameeta Agrawal, Aravind Inbasekaran, Philippe J. Giabbanelli

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

Comments HICSS '24

Journal ref Proceedings of the 57th Hawaii International Conference on System Sciences 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19783 2024-04-01 cond-mat.mtrl-sci cs.LG 86%

AlloyBERT: Alloy Property Prediction with Large Language Models

Akshat Chaudhari, Chakradhar Guntuboina, Hongshuo Huang, Amir Barati Farimani

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.LG

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08765 2023-12-20 q-bio.QM cs.LG 86%

Mining Patents with Large Language Models Elucidates the Chemical Function Landscape

Clayton W. Kosonocky, Claus O. Wilke, Edward M. Marcotte, Andrew D. Ellington

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03738 2023-11-14 cs.CY cs.CL 86%

Should ChatGPT be Biased? Challenges and Risks of Bias in Large Language Models

Emilio Ferrara

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

Comments Published on First Monday https://firstmonday.org/ojs/index.php/fm/article/view/13346/11365

Journal ref First Monday, Volume 28, Number 11 - 6 November 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13994 2023-06-23 cs.CL 86%

SweCTRL-Mini: a data-transparent Transformer-based large language model for controllable text generation in Swedish

Dmytro Kalpakchi, Johan Boye

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

Comments Added information about training tokenizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13698 2023-05-24 cs.CL 86%

Exploring Large Language Models for Classical Philology

Frederick Riemenschneider, Anette Frank

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

Comments Paper accepted for publication at ACL 2023 Main; 10 pages, 7 appendix pages, 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.11758 2022-10-25 cs.CL 86%

Analyzing the Mono- and Cross-Lingual Pretraining Dynamics of Multilingual Language Models

Terra Blevins, Hila Gonen, Luke Zettlemoyer

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.12711 2022-09-27 cs.CL 86%

Can Large Language Models Truly Understand Prompts? A Case Study with Negated Prompts

Joel Jang, Seonghyeon Ye, Minjoon Seo

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.00204 2022-05-11 cs.CL 86%

BanglaBERT: Language Model Pretraining and Benchmarks for Low-Resource Language Understanding Evaluation in Bangla

Abhik Bhattacharjee, Tahmid Hasan, Wasi Uddin Ahmad, Kazi Samin, Md Saiful Islam, Anindya Iqbal, M. Sohel Rahman, Rifat Shahriyar

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL

Comments Findings of North American Chapter of the Association for Computational Linguistics, NAACL 2022 (camera-ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.05144 2022-02-11 cs.CL 86%

InPars: Data Augmentation for Information Retrieval using Large Language Models

Luiz Bonifacio, Hugo Abonizio, Marzieh Fadaee, Rodrigo Nogueira

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.15283 2021-09-20 cs.CL 86%

ECONET: Effective Continual Pretraining of Language Models for Event Temporal Reasoning

Rujun Han, Xiang Ren, Nanyun Peng

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL

Comments This paper has been accepted by EMNLP'21 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13517 2026-08-14 cs.CL cs.AI 新提交 86%

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

DFM Mimir v1:仅使用许可的后训练数据,在10亿参数规模下实现前沿性能的开放HRM模型

Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech

专题命中 预训练与数据 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员因大模型开发依赖非许可数据受阻,本文提出仅用许可后训练数据训练的10亿参数HRM模型Mimir v1,其在多基准测试中性能优于同规模HRM-Text 1B,可与更大前沿模型媲美,且在丹麦语任务达新SOTA,已发布于Hugging Face Hub

Comments Technical Report, 20 Pages, 1 Model, Hierarchical Reasoning Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16669 2026-07-21 cs.CL cs.LG cs.SE 新提交 86%

OpenLanguageModel: Readable and Composable Small-Language-Model Pretraining for Education and Research

开放语言模型:用于教育和研究的可读且可组合的小语言模型预训练

Tavish Mankash, Vardhaman Kalloli, Keshava Prasad, Deepan Muthirayan

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 OpenLanguageModel是开源PyTorch库,用于构建和预训练小语言模型。其模型代码易读,能连接多种组件。通过追踪GPT - 2展示完整路径,含27个预设和文档。验证有高一致性和效率等成果,采用MIT许可,可多途径获取。

Comments 8 pages, 3 figures, and 1 table. Website: https://openlanguagemodel.github.io/openlanguagemodel/. Code: https://github.com/openlanguagemodel/openlanguagemodel

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12546 2026-07-21 cs.CL cs.CY cs.LG 86%

Extracting memorized pieces of (copyrighted) books from open-weight language models

从开放式语言模型中提取记忆中的(受版权保护)书籍

A. Feder Cooper, Mark A. Lemley, Allison Casasola, Ahmed Ahmed, Aaron Gokaslan, Amy B. Cyphert, Christopher De Sa, Daniel E. Ho, Percy Liang

机构 * Stanford University(斯坦福大学) Yale University(耶鲁大学) Cornell University(康奈尔大学) West Virginia University(西弗吉尼亚大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过测量书籍在语言模型中的记忆程度,发现大多数模型不完整记忆书籍,但部分模型如Llama 3.1 70B能完整记忆某些书籍,对版权案件有重要影响。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01171 2026-07-17 cs.CL cs.AI 版本更新 86%

Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity

言语化采样:如何减轻模式坍塌并释放大语言模型的多样性

Jiayi Zhang, Simon Yu, Derek Chong, Anthony Sicilia, Michael R. Tomz, Christopher D. Manning, Weiyan Shi

专题命中 预训练与数据 :LLM(title,abstract);post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究发现偏好数据中的典型性偏差致大语言模型模式坍塌,引入言语化采样策略。该策略能促使模型说出响应概率分布,经实验验证可显著提升创意写作等多方面性能,为模式坍塌提供新视角及实用补救方法。

Comments 83 pages, 31 figures, 44 tables. Code is available at https://github.com/CHATS-lab/verbalize-sampling

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24890 2026-07-14 cs.CL cs.AI cs.CY 版本更新 86%

Small edits, large models: How Wikipedia advocacy shapes LLM values

小编辑,大模型:维基百科倡导如何塑造LLM价值观

Jasmine Brazilek, Maria Navas, Alexa Gnauck

机构 * Compassion Aligned Machine Learning (CaML)(慈悲对齐机器学习实验室) Independent researcher(独立研究者) Pro-Animal Wikipedians (PAW)(亲动物维基人组织)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过梯度归因和反事实影响估计,发现维基百科上一个小型倡导组织的编辑活动显著影响了语言模型在动物福利话题上的行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01973 2026-06-17 cs.CL cs.LG 版本更新 86%

Learn-To-Learn on Arbitrary Textual Conditioning: A Hypernetwork-Driven Meta-Gated LLM

在任意文本条件下学习:一种超网络驱动的元门控大语言模型

Luo Ji, Qi Qin, Ningyuan Xi, Teng Chen, Qingqing Gu, Hongyan Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 提出一种超网络驱动的元门控机制,通过动态调整SwiGLU块中的β参数,使LLM适应不同文本条件,优于微调和元学习基线。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11127 2026-06-10 cs.CL cs.AI 新提交 86%

Provenance-Grounded Gating and Adaptive Recovery in Synthetic Post-Training Data Curation

基于来源的门控与自适应恢复在合成后训练数据筛选中的应用

Soham Bhattacharjee, Karun Sharma, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs

专题命中 预训练与数据 :post-training(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究合成后训练数据筛选中的来源证据门控与样本自适应恢复,提出结合故障诊断与定向再生成的自适应恢复流水线,提高产量、恢复率和注入召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03635 2026-06-08 cs.AI cs.CL 版本更新 86%

Finding the Minimal Parameter Budget for Implicit Reasoning: A Data Complexity Driven Scaling Law for Language Models

寻找隐式推理的最小参数预算:一种基于数据复杂度的语言模型缩放定律

Xinyi Wang, Shawn Tan, Shenbo Xu, Mingyu Jin, William Yang Wang, Rameswar Panda, Yikang Shen

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Tokyo(东京大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文通过控制合成环境中的预训练实验,发现语言模型隐式推理所需的最小参数预算与图搜索熵之间存在缩放定律,并确定了每参数最多可处理约0.008比特信息的容量上限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23032 2026-05-25 cs.CL cs.AI q-bio.NC 86%

Brain-LLM Alignment Tracks Training Data, Not Typology

大脑-大语言模型对齐追踪训练数据,而非语言类型学

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 通过分析英语、中文和法语的fMRI数据及多种大语言模型,发现训练语言主导性而非英语本身驱动大脑-模型对齐模式,且类型学距离独立影响对齐退化。

Comments Accepted to CoNLL 2026. 9 pages main content + 4 pages references + 6 pages appendix; 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04674 2026-04-13 cs.SI cs.AI cs.CL 86%

Overstating Attitudes, Ignoring Networks: LLM Biases in Simulating Misinformation Susceptibility

夸大态度,忽视网络:LLM在模拟虚假信息易感性中的偏见

Eun Cheol Choi, Lindsay E. Young, Emilio Ferrara

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨LLM在模拟虚假信息易感性中的偏见,发现其夸大信念与分享的关联,忽视网络特征,建议LLM模拟更适用于诊断而非替代人类判断。

Comments Accepted to ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06499 2026-04-13 cs.CL cs.AI 86%

Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels

Webscale-RL: 用于将强化学习数据扩展到预训练水平的自动化数据管道

Zhepeng Cen, Haolin Chen, Shiyu Wang, Zuxin Liu, Zhiwei Liu, Jielin Qiu, Ding Zhao, Silvio Savarese, Caiming Xiong, Huan Wang, Weiran Yao

机构 * Salesforce AI Research(赛富时人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Webscale-RL数据管道,通过系统性地将大规模预训练文档转换为数百万个多样化的可验证问题-答案对,解决RL数据瓶颈问题,并展示基于该数据集的模型在多个基准测试中表现优于传统预训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01833 2026-04-06 cs.CV cs.CL cs.LG 86%

Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks

语言预训练引入的偏差:一种强大的基础视觉任务通用性基础

Yaxin Luo, Zhiqiang Shen

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :pretraining(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出随机标签桥梁训练方法,通过模态适应学习有效对齐大语言模型参数与视觉任务,揭示部分桥梁训练在视觉任务中的优势。

Comments Main manuscript: 13 pages, 9 figures. Appendix: 8 pages, 5 figures. Accepted in Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22367 2026-04-06 cs.CL cs.AI cs.CY 86%

What Is The Political Content in LLMs' Pre- and Post-Training Data?

大语言模型预训练和后训练数据中的政治内容是什么?

Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach, Debora Nozza

机构 * Bocconi University(博科尼大学) University of Manchester(曼彻斯特大学) Princeton University(普林斯顿大学)

专题命中 预训练与数据 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型训练数据中的政治倾向,发现预训练数据偏向左翼内容,且政治立场与模型行为相关,强调数据组成对模型行为的关键作用。

Comments 10 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22459 2026-03-27 cs.CL cs.AI 86%

LLM-guided headline rewriting for clickability enhancement without clickbait

基于大语言模型的引导性标题重写以增强点击率而不产生标题党

Yehudit Aperstein, Linoy Halifa, Sagiv Bar, Alexander Apartsin

机构 * Intelligent Systems, Afeka Academic College of Engineering(阿菲卡工程学院智能系统系) School of Computer Science, Faculty of Sciences, HIT-Holon Institute of Technology(霍隆理工学院理学院计算机科学系)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种引导性标题重写框架,通过控制生成过程中的语言属性,在保持语义忠实的前提下提升标题吸引力,避免产生误导性内容。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18019 2026-03-26 cs.CL cs.AI 86%

Is Multilingual LLM Watermarking Truly Multilingual? Scaling Robustness to 100+ Languages via Back-Translation

多语言大语言模型水印是否真的多语言?通过回译扩大到100多种语言的鲁棒性

Asim Mohamed, Martin Gubri

机构 * African Institute for Mathematical Sciences Parameter Lab(非洲数学科学研究所参数实验室)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文指出现有多语言水印方法在中低资源语言中鲁棒性不足,提出STEAM方法通过回译恢复水印强度,提升跨语言水印鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14751 2026-03-26 cs.LG cs.AI 86%

Beyond Multi-Token Prediction: Pretraining LLMs with Future Summaries

超越多令牌预测:通过未来摘要预训练语言模型

Divyat Mahajan, Sachin Goyal, Badr Youbi Idrissi, Mohammad Pezeshki, Ioannis Mitliagkas, David Lopez-Paz, Kartik Ahuja

机构 * Carnegie Mellon University(卡内基梅隆大学) FAIR at Meta(Meta的FAIR)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出未来摘要预测(FSP)方法,通过训练辅助头预测紧凑的长期未来表示,提升长形式生成能力,在数学、推理和编码基准测试中优于NTP和MTP。

Comments Proceedings of the Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22186 2026-03-24 cs.CL cs.AI 86%

Enhancing Document-Level Machine Translation via Filtered Synthetic Corpora and Two-Stage LLM Adaptation

通过过滤后的合成语料库和两阶段LLM适应增强文档级机器翻译

Ireh Kim, Tesia Sker, Chanwoo Kim

机构 * 1 Department of Artificial Intelligence Korea University, Seoul, South Korea

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过过滤后的合成语料库和两阶段LLM适应方法,解决文档级机器翻译中平行数据稀缺和生成幻觉问题,提升翻译质量。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21415 2026-03-24 cs.AI cs.CR cs.LG 86%

Silent Commitment Failure in Instruction-Tuned Language Models: Evidence of Governability Divergence Across Architectures

指令调优语言模型中的沉默承诺失败:跨架构可控性分歧的证据

Gregory M. Ruddell

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究发现指令遵循模型在冲突检测中存在沉默承诺失败,可控性差异显著,且基准准确度无法预测可控性,提示可控性在预训练阶段固定。

Comments 39 pages, 5 figures, 5 tables. Preprint. Submitted to NIST CAISI (Docket NIST-2025-0035, March 2026). Also available on Zenodo: https://doi.org/10.5281/zenodo.18971110

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14712 2026-03-17 cs.CL cs.LG 86%

Towards Next-Generation LLM Training: From the Data-Centric Perspective

迈向下一代大语言模型训练:从数据导向的视角

Hao Liang, Zhengyang Zhao, Zhaoyang Han, Meiyi Qiang, Xiaochen Ma, Bohan Zeng, Qifeng Cai, Zhiyu Li, Linpeng Tang, Weinan E, Wentao Zhang

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文从数据导向视角出发,探讨了大语言模型训练中的数据准备瓶颈问题,提出构建自动数据准备系统和统一的数据-模型交互训练系统,以提升数据利用效率和模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏