arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137794 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12318 篇

2407.20046 2025-09-23 cs.CL cs.HC 89%

Exploring Large Language Models to generate Easy to Read content

Paloma Martínez, Lourdes Moreno, Alberto Ramos

机构 * Computer Science and Engineering Department Universidad Carlos III de Madrid(计算机科学与工程系卡洛斯三世大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref (2024) Exploring Large Language Models to generate Easy to Read content. Front. Comput. Sci. 6:1394705

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00101 2025-03-21 eess.SP cs.HC cs.LG 89%

NeuroLM: A Universal Multi-task Foundation Model for Bridging the Gap between Language and EEG Signals

Wei-Bang Jiang, Yansen Wang, Bao-Liang Lu, Dongsheng Li

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments The Thirteenth International Conference on Learning Representations

Journal ref The Thirteenth International Conference on Learning Representations, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16588 2025-01-29 cs.LG cs.SY eess.SY 89%

Fine-Tuned Language Models as Space Systems Controllers

Enrico M. Zucchelli, Di Wu, Julia Briden, Christian Hofmann, Victor Rodriguez-Fernandez, Richard Linares

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

Journal ref Proceedings of the AAS/AIAA Astrodynamics Specialist Conference, paper number AAS 24-445, Broomfield, CO, August 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08197 2025-01-15 cs.CL 89%

OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training

Yijiong Yu, Ziyun Dai, Zekun Wang, Wei Wang, Ran Chen, Ji Pei

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments The datasets are available on https://huggingface.co/collections/opencsg/chinese-fineweb-66cfed105f502ece8f29643e ; The code is on https://github.com/yuyijiong/fineweb-edu-chinese

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04424 2024-12-06 cs.CV cs.AI 89%

Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion

Jiuhai Chen, Jianwei Yang, Haiping Wu, Dianqi Li, Jianfeng Gao, Tianyi Zhou, Bin Xiao

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12392 2024-05-31 cs.CL 89%

PiVe: Prompting with Iterative Verification Improving Graph-based Generative Capability of LLMs

Jiuzhou Han, Nigel Collier, Wray Buntine, Ehsan Shareghi

专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Our code and data are at https://github.com/Jiuzhouh/PiVe (accepted to ACL 2024 Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00299 2023-10-10 cs.CL 89%

RelBERT: Embedding Relations with Language Models

Asahi Ushio, Jose Camacho-Collados, Steven Schockaert

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.10860 2019-07-24 cs.CL 89%

Can You Tell Me How to Get Past Sesame Street? Sentence-Level Pretraining Beyond Language Modeling

Alex Wang, Jan Hula, Patrick Xia, Raghavendra Pappagari, R. Thomas McCoy, Roma Patel, Najoung Kim, Ian Tenney, Yinghui Huang, Katherin Yu, Shuning Jin, Berlin Chen, Benjamin Van Durme, Edouard Grave, Ellie Pavlick, Samuel R. Bowman

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments ACL 2019. This paper supercedes "Looking for ELMo's Friends: Sentence-Level Pretraining Beyond Language Modeling", an earlier version of this work by the same authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10062 2023-06-21 cs.CL cs.AI cs.LG 89%

Revealing the structure of language model capabilities

Ryan Burnell, Han Hao, Andrew R. A. Conway, Jose Hernandez Orallo

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,comments);large language model(abstract);instruction tuning(abstract)

Comments 10 pages, 3 figures + references and appendices, for data and analysis code see https://github.com/RyanBurnell/revealing-LLM-capabilities

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14198 2026-08-17 cs.LG cs.CL 新提交 88%

MINT: A Universal Zero-Shot Predictor for Transaction Data

MINT:一种用于交易数据的通用零样本预测器

Parameswaran Kamalaruban, Viktor Drobnyi, Maeve Madigan, Julia Rozanova, David Sutton, Stuart Burrell

机构 * Visa Inc.(维萨公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract);foundation model(abstract,abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出通用零样本预测框架MINT,通过轻量级嵌入注入等技术连接交易序列编码器与LLM,在交易预测问答任务中性能领先且资源消耗更低,证实紧凑交易嵌入更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28008 2026-08-17 cs.CL cs.AI 版本更新 88%

RepBench: Compiling Benchmarks into Capability Representations for Large Language Models

RepBench:将基准编译为大语言模型的能力表征

Yanshi Li, Xueru Bai, Shuman Liu, Long Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 RepBench构建多基准支撑的大语言模型能力表征探测数据层,揭示读出方式与聚合准则对评估的重要性,相关资源以闭环工作流形式发布。

Comments 22 pages, 8 figures, with appendices. Yanshi Li and Xueru Bai contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03818 2026-08-13 cs.LG cs.AI cs.PL 版本更新 88%

Program Semantic Inequivalence Game with Large Language Models

基于大语言模型的程序语义不等价博弈

Antonio Valerio Miceli-Barone, Vaishak Belle, Ali Payani

机构 * University of Edinburgh(爱丁堡大学) Cisco Systems(思科系统)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于语义不等价博弈(SInQ)的方法,通过生成器与评估器智能体半对抗训练合成代码推理数据,在跨语言漏洞检测等基准上显著提升LLMs的代码语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24769 2026-07-29 cs.AI cs.CL 新提交 88%

LLM Scheming Inversely Scales with Pretraining Language Coverage

大语言模型的策略规划与预训练语言覆盖范围成反比

Nathan Truong, Aryan Panda, Rayming Ye, Zoe Sun, Maheep Chaudhary

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究前沿模型中策略规划与预训练语言覆盖范围的关系,应用Petri框架评估Qwen3-30B-A3B,发现策略规划得分与预训练语言覆盖范围成反比,低资源语言得分更高,且该影响在不同策略行为中不均一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22458 2026-07-27 cs.LG cs.AI 新提交 88%

Phylogenetic signal in marine mammal and bird vocalizations captured by audio foundation models: the limited benefit of domain-specific pretraining

音频基础模型捕捉到的海洋哺乳动物和鸟类发声中的系统发育信号:特定领域预训练的有限益处

Víctor Rincón Yepes

机构 * Earth Species Project(地球物种计划)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究利用四个预训练音频模型从物种发声恢复系统发育距离,在海洋哺乳动物和鸟类中,通用基础模型能恢复信号,特定领域预训练的BirdNET等未超越,表明预训练音频嵌入可携带进化信息,特定领域预训练非必需。

Comments 17 pages, 5 figures, 2 supplementary tables. Code, embeddings and derived matrices: https://github.com/rinvictor/bioacoustic-phylogeny-embeddings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20548 2026-07-24 cs.LG cs.AI 新提交 88%

SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales

SOAP、Muon及其他:推动语言模型预训练规模

Mikail Khona, Aditya Vavre, Boxiang Wang, Deyu Fu, Hao Wu, Mike Chrzanowski, Bryan Catanzaro, Dheevatsa Mudigere, Jeff Pool, Michael Lightstone, Mohammad Shoeybi, Mostofa Patwary, Nima Tajbakhsh, Tijmen Blankevoort

机构 * NVIDIA(英伟达)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对高阶优化器在大规模语言模型预训练中的挑战,通过改进预处理梯度方法、统一实证研究不同优化器、引入分层分布式优化器及系统级改进,提升训练效果,最终发布含新兴优化算法的代码库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19992 2026-07-23 cs.CL cs.AI cs.DL cs.HC 新提交 88%

TINY_SCHILLER: A Drop-In German Drama Corpus for Small Language Models

TINY_SCHILLER:用于小语言模型的即插即用德语戏剧语料库

Mark Schutera

机构 * Duale Hochschule Baden-Württemberg Ravensburg(巴登-符腾堡双元制应用技术大学 Ravensburg)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对德语文学文本在小语言模型相关应用的空白,提出Tiny_schiller语料库,经特定处理,可通过单文件和一行代码让小语言模型接触德语文学文本,填补了相关研究和应用的空白。

Comments 5 pages. Dataset: https://huggingface.co/datasets/mrkschtr/tiny_schiller ; Code: https://github.com/schutera/tiny_schiller

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09204 2026-07-13 cs.CL cs.LG 新提交 88%

Complexity-Guided Component-wise Initialization for Language Model Pretraining

用于语言模型预训练的复杂度引导的逐组件初始化

Konstantin Garbers, Nicholas Oh

机构 * Peking University(北京大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 研究预训练语言模型中反复出现的谱模式能否用于初始化,通过分析多个检查点构建初始化方案并与其他方法比较,发现预训练权重复用有竞争力,但仅粗略谱匹配非可靠策略,预训练谱是有用诊断,有效复用需保留更多信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05552 2026-07-08 cs.CL cs.AI cs.CY 新提交 88%

The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment

大语言模型的是非偏差反映答案顺序和措辞,而非道德判断的转变

Haonan Huang

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在道德困境判断中的是非偏差,通过交叉对称化等心理测量方法区分逻辑判断、词汇等因素,发现前沿模型立场与形式无关,部分模型存在顺序和词汇偏差,最小模型可总结伪像,强调跨框架测量模型重视内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13873 2026-06-15 cs.LG cs.CL 新提交 88%

Natively Unlearnable Large Language Models

原生不可学习的大语言模型

Gaurav R. Ghosal, Pratyush Maini, Aditi Raghunathan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出NULLs模型,通过共享骨干和稀疏激活的sinks分离数据源贡献,实现无需梯度更新的高效遗忘,在维基百科上验证了单篇文章遗忘的有效性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11081 2026-06-10 cs.LG cs.AI 新提交 88%

Unifying Local Communications and Local Updates for LLM Pretraining

统一大语言模型预训练中的本地通信与本地更新

Pietro Cagnasso, Eugene Belilovsky, Edouard Oyallon

机构 * Concordia University(康考迪亚大学) Mila CNRS, Sorbonne University(法国国家科学研究中心,索邦大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title);分类 cs.AI、cs.LG

AI总结 提出GASLoC算法,通过去中心化训练框架统一本地通信与更新,在异构带宽下优于DiLoCo,支持自适应优化器和多本地步骤。

Comments 38 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14147 2026-06-09 cs.AI cs.LG 版本更新 88%

An Alternative Trajectory for Generative AI

生成AI的另一种轨迹

Margarita Belova, Yuval Kansal, Yihao Liang, Jiaxin Xiao, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出通过构建领域特定超智能(DSS)来改进生成AI,利用符号抽象提升领域推理能力,避免LLM合成数据的模型崩溃问题,实现可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04928 2026-06-04 cs.LG cs.CL 88%

Data Attribution in Large Language Models via Bidirectional Gradient Optimization

通过双向梯度优化实现大型语言模型中的数据归因

Frédéric Berdoz, Luca A. Lanzendörfer, Kaan Bayraktar, Roger Wattenhofer

机构 * EPFL, Switzerland(瑞士联邦理工学院) ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出一种基于双向梯度优化的训练数据归因方法,用于自动回归大型语言模型,以识别影响模型输出的关键训练数据,提升模型可解释性。

Comments Presented at the AI Governance (AIGOV) Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11331 2026-05-29 cs.LG cs.AI 88%

Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover

大型语言模型的越狱缩放定律:多项式-指数交叉

Indranil Halder, Annesya Banerjee, Cengiz Pehlevan

机构 * John A. Paulson School of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) Speech and Hearing Bioscience and Technology, Harvard Medical School(哈佛医学院语音与听力生物科学与技术系) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) Center for Brain Science, Harvard University(哈佛大学脑科学中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现对抗性提示注入攻击可使攻击成功率从无注入时的缓慢多项式增长变为随推理样本数指数增长,并通过自旋玻璃模型从理论上解释了这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21465 2026-05-28 cs.CL cs.LG 88%

DRTriton: Large-Scale Synthetic Data Driven Reinforcement Learning for Triton Kernel Generation

DRTriton:大规模合成数据驱动的强化学习用于Triton内核生成

Siqi Guo, Ming Lin, Tianbao Yang

机构 * Texas A&M University(德克萨斯大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出DRTriton框架,通过合成数据生成、课程强化学习和测试时搜索,训练LLM将PyTorch程序转换为优化的Triton内核,在KernelBench Level 2任务中超越GPT-5.2和Claude-Sonnet-4.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01793 2026-05-21 cs.LG cs.AI 88%

Creating Artificial Students that Never Existed: Leveraging Large Language Models and CTGANs for Synthetic Data Generation

创建从未存在过的虚拟学生:利用大型语言模型和CTGANs进行合成数据生成

Mohammad Khalil, Sam Urmian, Ronas Shakya, Qinyi Liu

机构 * Centre for the Science of Learning & Technology (SLATE)(学习科学与技术中心(SLATE)) University of Bergen(卑尔根大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了利用生成对抗网络(GANs)和大型语言模型(LLMs)生成合成表格数据的潜力,探讨了通过合成数据创建虚拟学生以服务于学习分析模型的可能性,并评估了不同生成模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16823 2026-05-20 cs.CL cs.AI 88%

Disentangling generalization and memorization in large language models using chess

通过国际象棋解构大型语言模型中的泛化与记忆

Leonard S. Pleiss, Maximilian Schiffer, Robert K. von Weizsaecker

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过国际象棋测试环境,研究大型语言模型中泛化与记忆能力的区别,发现模型在相关先验知识稀疏时性能显著下降,表明系统泛化能力有限,需超越规模的机制来实现鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14466 2026-05-19 cs.CL cs.AI 88%

Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages

迈向低资源语言LLM鲁棒多语言适应

Haolin Li, Haipeng Zhang, Mang Li, Yaohua Wang, Lijie Wen, Yu Zhang, Biqing Huang

机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Alibaba International Digital Commerce Group, Beijing, China(阿里巴巴国际数字 commerce 集团) School of Software, Tsinghua University, Beijing, China(清华大学软件学院)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LiRA框架,通过轻量级微调实现低资源语言LLM的鲁棒多语言适应,结合Arca和LaSR组件提升跨语言语义一致性与表示稳定性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17656 2026-05-11 q-bio.QM cs.AI cs.LG 88%

Pretraining a Foundation Model for Small-Molecule Natural Products

为小分子天然产物预训练一个基础模型

Yuheng Ding, Bo Qiang, Shaoning Li, Yiran Zhou, Jie Yu, Qi Li, Cheng Shi, Liangren Zhang, Yusong Wang, Nanning Zheng, Zhenming Liu

机构 * State Key Laboratory of Natural and Biomimetic Drugs(天然与仿生药物国家重点实验室) School of Pharmaceutical Sciences, Peking University(北京大学药学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于天然产物独特性质的预训练基础模型,通过对比学习和掩码图学习目标,提升分子骨架和侧链信息的表征能力,在天然产物挖掘和药物发现任务中取得SOTA成果。

Comments Accepted by Nature Machine Intelligence(2026)

Journal ref Nature Machine Intelligence(2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18381 2026-04-21 cs.AI cs.LG 88%

Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes

在数据较少的情况下:评估RLVR在低数据和计算环境下的有效性

Justin Bauer, Thomas Walshe, Derek Pham, Harit Vishwakarma, Armin Parchami, Frederic Sala, Paroma Varma

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了在低数据和计算资源下,RLVR对小型语言模型性能的影响,发现混合复杂度数据集能显著提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04799 2026-04-17 cs.CL cs.AI 88%

DA-Cramming: Enhancing Cost-Effective Language Model Pretraining with Dependency Agreement Integration

DA-Cramming:通过依赖协议整合提升高效语言模型预训练

Martin Kuo, Jianyi Zhang, Dongting Li, Yiran Chen

机构 * Center for Computational Evolutionary Intelligence, Duke University(计算进化智能中心,杜克大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DA-Cramming框架,通过整合依赖协议信息提升语言模型预训练效果,采用双阶段流程和四个专用子模型捕捉依赖协议并生成嵌入,实验证明其在多种任务上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏