arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137794 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12318 篇

2604.15461 2026-04-20 cs.LG cs.CL cs.CR 90%

Evaluating LLM Simulators as Differentially Private Data Generators

评估LLM模拟器作为差分隐私数据生成器

Nassima M. Bouzid, Dehao Yuan, Nam H. Nguyen, Mayana Pereira

机构 * Capital One

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 研究评估LLM模拟器在生成复杂合成数据中的有效性,发现其在欺诈检测中表现良好但存在分布偏移问题,需解决系统性偏差以提升应用潜力。

Comments Submitted to ICLR 2026. 6 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12540 2026-04-15 cs.CL cs.AI 90%

When Does Data Augmentation Help? Evaluating LLM and Back-Translation Methods for Hausa and Fongbe NLP

当数据增强有助于什么?评估LLM和回译方法在豪萨语和丰贝语NLP中的应用

Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) Centre for Text Technology(文本技术中心) North-West University(北开普大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文评估了LLM生成和回译方法在豪萨语和丰贝语中的有效性,发现任务类型而非语言或LLM质量决定增强效果,不同任务对增强结果有不同影响。

Comments 13 pages, 6 tables; previously submitted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10799 2026-04-14 cs.CL cs.AI 90%

Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series

通过优化分词器推动波兰语言建模:Bielik v3 7B和11B系列

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

机构 * SpeakLeash ACK Cyfronet AGH(AGH科技大学计算机中心) Jagiellonian University(雅盖隆大学) Azurro Enelpol

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 本文探讨了Bielik v3系列模型中通过优化分词器提升波兰语言建模性能的方法,包括专有词汇表、嵌入初始化、多阶段预训练和后训练对齐技术。

Comments arXiv admin note: text overlap with arXiv:2601.11579

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01505 2024-07-02 cs.CL cs.AI 90%

Self-Cognition in Large Language Models: An Exploratory Study

Dongping Chen, Jiawen Shi, Yao Wan, Pan Zhou, Neil Zhenqiang Gong, Lichao Sun

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at ICML 2024 Large Language Models and Cognition Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04589 2024-01-05 cs.CL cs.AI 90%

TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models

Zhen Yang, Yingxue Zhang, Fandong Meng, Jie Zhou

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Multi-modal, Large Language Models, Tokenizer, Understanding and Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28325 2026-06-30 cs.CY cs.CL 90%

The Digital Afterlife of Empires: Four Language Models Converge on the Same Imperial Cartography of Writing

帝国的数字来世:四种语言模型趋同于同一帝国文字制图

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(犯罪 psychiatry 研究院 / 性犯罪医疗中心) Department of Neuropsychiatry, Kyoto University(京都大学神经精神病学系)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 通过构建数字文字表示指数(DSRI)评估300种文字系统的数字支持,发现仅9.7%得到完全支持;四种LLM在172个特征项上出现一致错误模式,表明历史帝国造成的结构性不平等通过共享训练语料库持续影响当代模型。

Comments Part II of the Kotonoha Series. Companion paper: arXiv:2604.10957 (q-bio.PE). 35 pages, 8 figures, 3 tables. 12,000 API calls across 4 LLM families (Anthropic, OpenAI, xAI, DeepSeek); cross-architecture convergence of typological knowledge biases (Spearman rho = 0.85-0.98, all p < 0.002)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06067 2026-07-08 cs.AI cs.CL cs.LG 版本更新 90%

MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning

MLLM-LLaVA-FL:多模态大语言模型辅助联邦学习

Jianyi Zhang, Hao Frank Yang, Ang Li, Xin Guo, Pu Wang, Haiming Wang, Yiran Chen, Hai Li

机构 * Duke University(杜克大学) Johns Hopkins University(约翰霍普金斯大学) University of Maryland College Park(马里兰大学学院市分校) Lenovo Research(联想研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对联邦学习中数据异质性问题,提出MLLM-LLaVA-FL框架,利用多模态大语言模型,通过全球视觉文本预训练、客户端本地训练和服务器端全局对齐三个阶段,提升联邦学习性能。

Comments Accepted to WACV 2025

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16246 2026-06-23 cs.LG cs.AI cs.CL 新提交 90%

Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining

数据受限语言模型预训练的数据增强

Michael K. Chen, Xikun Zhang, Fan Bai, Zhengding Hu, Zhen Wang

机构 * UC San Diego(加州大学圣地亚哥分校) RMIT University(皇家墨尔本理工大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对数据受限下标准自回归预训练严重过拟合的问题,提出三类数据增强方法(token级噪声、序列排列、目标偏移预测),有效降低验证损失并支持数百epoch训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15503 2026-06-15 cs.SE 90%

Guidelines for Empirical Studies in Software Engineering involving Large Language Models

涉及大语言模型的软件工程实证研究指南

Sebastian Baltes, Florian Angermeir, Chetan Arora, Marvin Muñoz Barón, Chunyang Chen, Lukas Böhme, Fabio Calefato, Neil Ernst, Davide Falessi, Brian Fitzgerald, Davide Fucci, Junda He, Christoph Treude, Marcos Kalinowski, Stefano Lambiase, Daniel Russo, Mircea Lungu, Cristina Martinez Montes, Lutz Prechelt, Paul Ralph, Rijnard van Tonder, Stefan Wagner

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对大语言模型在软件工程研究中的非确定性、不透明训练数据和快速演化问题,通过22位研究者的协作,提出七种研究类型分类和八条设计报告指南,以提升实证研究的可重复性和可复现性。

Comments 86 pages, 4 tables, accepted in Empirical Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05961 2026-06-05 cs.CY physics.soc-ph 90%

Political Persuasion and Endorsement in Large Language Models

大型语言模型中的政治说服与支持

Alessia Antelmi, Alessia Galdeman, Lucio La Cava, Arianna Pera, Giovanni Da San Martino

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究大型语言模型是否支持包含说服技巧的信息,以及党派角色提示如何调节这种支持,发现无政治条件时模型通常不支持,但党派提示加剧极化。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01800 2026-06-02 cs.CL cs.AI cs.LG 90%

Multilinguality of Large Language Models From a Structural Perspective

从结构视角看大语言模型的多语言性

Haruki Sakajo, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过表示结构分析探索大语言模型的多语言性,发现低资源语言与英语的结构差异大于高、中资源语言,且语言特定后训练改变结构但保留语言间关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22467 2026-04-27 eess.AS 90%

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models

DM-ASR:基于说话人识别的多说话人ASR框架

Li Li, Ming Cheng, Weixin Zhu, Yannan Wang, Juan Liu, Ming Li

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 DM-ASR利用说话人识别作为结构先验,将多说话人ASR任务转化为多轮对话生成过程,通过分解转录为说话人和时间条件查询,提升转录质量与结构化输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17585 2026-04-07 cs.AI cs.CL cs.LG 90%

Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models

Cite Pretrain: 无需检索的知识归因于大语言模型

Yukun Huang, Sanxing Chen, Jian Pei, Manzil Zaheer, Bhuwan Dhingra

机构 * Duke University(杜克大学) Meta

专题命中 预训练与数据 :language model(title,abstract);large language model(title);instruction tuning(abstract);pretraining(abstract)

AI总结 本文提出CitePretrainBench基准,通过修改训练过程使大语言模型在无检索情况下可靠归因于训练期间看到的文档。通过两阶段方法提升模型在短形式和长形式引用任务中的表现,实验显示Active Indexing在多个任务和模型中均取得30.2%的引用精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02031 2026-04-03 cs.LG cs.AI cs.CL 90%

Output Embedding Centering for Stable LLM Pretraining

输出嵌入中心化用于稳定大语言模型预训练

Felix Stollenwerk, Anna Lokrantz, Niclas Hertzberg

机构 * AI Sweden

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出输出嵌入中心化(OEC)方法,通过分析输出嵌入几何特性,解决预训练中的输出logit发散问题,提升训练稳定性。

Comments Additional experiments using logit soft-capping & weight tying

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17220 2026-03-19 cs.CL cs.AI cs.LG 90%

TharuChat: Bootstrapping Large Language Models for a Low-Resource Language via Synthetic Data and Human Validation

TharuChat:通过合成数据和人类验证提升低资源语言的大型语言模型

Prajwal Panth, Agniva Maiti

机构 * School of Computer Engineering KIIT Deemed to be University(计算机工程学院 KIIT 研究生大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Tharu-LLaMA(3B)模型,通过合成数据和人类验证构建TharuChat数据集,解决低资源语言在AI中的代表性问题,提升模型性能并证明生成式AI在保护濒危语言中的可行性。

Comments 6 pages, 1 figure, 2 tables. Preprint. Code and dataset available on Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14757 2026-03-09 astro-ph.CO astro-ph.IM hep-ph physics.data-an 90%

Large Language Models -- the Future of Fundamental Physics?

大语言模型——基础物理学的未来?

Caroline Heneka, Florian Nieser, Ayodele Ore, Tilman Plehn, Daniel Schiller

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 本文探讨了大语言模型在基础物理学中的应用,展示了Qwen2.5 LLM结合连接网络在宇宙参数回归和光锥生成中的优越性能。

Comments 35 pages, 10 figures, 6 tables. v2: matched published version

Journal ref SciPost Phys. 20, 070 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10735 2026-03-09 cs.AI cs.CL cs.CY cs.LG 90%

Transforming Agency. On the mode of existence of Large Language Models

代理的转变。大型语言模型的存在模式

Xabier E. Barandiaran, Lola S. Almendros

机构 * IAS-Research Centre for Life, Mind, and Society, Dept. Philosophy UPV/EHU, University of the Basque Country(生命、心灵与社会研究所,哲学系,巴斯克大学) Institute for Science and Technology Studies, University of Salamanca (Spain)(科学与技术研究所,萨拉曼卡大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了大型语言模型作为代理的本体特征,指出其缺乏自主代理的必要条件,但能通过文本和计算躯体影响人类代理形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04066 2026-02-16 cs.SE 90%

Exploring the Potential of Large Language Models in Simulink-Stateflow Mutant Generation

探索大型语言模型在Simulink-Stateflow变异体生成中的潜力

Pablo Valle, Shaukat Ali, Aitor Arrieta

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文利用大型语言模型生成高质量的Simulink-Stateflow变异体,显著提高了生成效率和变异体质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06876 2026-02-03 cs.CL cs.AI cs.LG 90%

Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging

混合数据还是融合模型?通过模型融合平衡大型语言模型的有用性、诚实性和无害性

Jinluan Yang, Dingnan Jin, Anke Tang, Li Shen, Didi Zhu, Zhengyu Chen, Ziyu Zhao, Daixin Wang, Qing Cui, Zhiqiang Zhang, Jun Zhou, Fei Wu, Kun Kuang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RESM方法,通过改进的参数融合策略提升大型语言模型在有用性、诚实性和无害性方面的平衡对齐效果。

Comments arxiv version of NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08924 2025-12-02 cs.LG cs.AI cs.CL 90%

Escaping Collapse: The Strength of Weak Data for Large Language Model Training

摆脱崩溃:弱数据在大语言模型训练中的力量

Kareem Amin, Sara Babakniya, Alex Bie, Weiwei Kong, Umar Syed, Sergei Vassilvitskii

机构 * Google Research(谷歌研究)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了合成数据在大语言模型训练中的作用,提出通过动态聚焦标注资源提升模型性能,并揭示了提升方法在其中的应用与改进机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01252 2025-11-14 cs.CL cs.AI cs.LG 90%

GPT and Prejudice: A Sparse Approach to Understanding Learned Representations in Large Language Models

Mariam Mahran, Katharina Simbeck

机构 * HTW Berlin University of Applied Sciences(柏林应用科学大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint. Draft version, subject to revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25947 2025-10-31 cs.CL cs.AI cs.LG 90%

Revisiting Multilingual Data Mixtures in Language Model Pretraining

Negar Foroutan, Paul Teiletche, Ayush Kumar Tarun, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23811 2025-10-27 cs.CL cs.AI cs.LG 90%

LayerIF: Estimating Layer Quality for Large Language Models using Influence Functions

Hadi Askari, Shivanshu Gupta, Fei Wang, Anshuman Chhabra, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of California, Irvine(加州大学伊市分校) University of Southern California(南加州大学) University of South Florida(佛罗里达州立大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10946 2025-10-23 cs.LG cs.AI cs.CL 90%

GUARD: Guided Unlearning and Retention via Data Attribution for Large Language Models

Peizhi Niu, Evelyn Ma, Huiting Zhou, Duo Zhou, Huan Zhang, S. Rasoul Etesami, Olgica Milenkovic

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20149 2025-10-21 cs.SE 90%

Synergistic Enhancement of Requirement-to-Code Traceability: A Framework Combining Large Language Model based Data Augmentation and an Advanced Encoder

Jianzhang Zhang, Jialong Zhou, Nan Niu, Jinping Hua, Chuang Liu

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09051 2025-10-13 cs.CL cs.AI cs.LG 90%

Alif: Advancing Urdu Large Language Models via Multilingual Synthetic Data Distillation

Muhammad Ali Shafique, Kanwal Mehreen, Muhammad Arham, Maaz Amjad, Sabur Butt, Hamza Farooq

机构 * University of British Columbia(不列颠哥伦比亚大学) Texas Tech University(德克萨斯技术大学) Institute for the Future of Education, Tecnológico de Monterrey(教育未来研究所,墨西哥蒙特雷技术学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to the EMNLP 2025 Workshop on Multilingual Representation Learning (MRL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02441 2025-10-07 stat.ML cs.AI cs.CL cs.CR cs.LG math.ST stat.TH 90%

A Statistical Hypothesis Testing Framework for Data Misappropriation Detection in Large Language Models

Yinpeng Cai, Lexin Li, Linjun Zhang

机构 * Peking University(北京大学) University of California at Berkeley(加州大学伯克利分校) Rutgers University(罗格斯大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13442 2025-09-03 cs.LG cs.AI cs.CL stat.ML 90%

A Law of Next-Token Prediction in Large Language Models

Hangfeng He, Weijie J. Su

机构 * University of Rochester(罗切斯特大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Transferred for publication to Physical Review E from Physical Review Research (to waive publication charges)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01908 2025-08-05 cs.LG cs.AI cs.CL 90%

Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models

Istabrak Abbes, Gopeshh Subbaraj, Matthew Riemer, Nizar Islah, Benjamin Therien, Tsuguchika Tabaru, Hiroaki Kingetsu, Sarath Chandar, Irina Rish

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究院) Chandar Research Lab(Chandar研究实验室) IBM Research(IBM研究院) Fujitsu Research(富士通研究院) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22187 2025-07-31 cs.CL cs.AI cs.LG 90%

A Scalable Pipeline for Estimating Verb Frame Frequencies Using Large Language Models

Adam M. Morgan, Adeen Flinker

机构 * NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) NYU Tandon School of Engineering(纽约大学坦顿工程学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏