arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138434 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2211.03263 2023-04-06 cs.CL cs.AI cs.LG 85%

AfroLM: A Self-Active Learning-based Multilingual Pretrained Language Model for 23 African Languages

Bonaventure F. P. Dossou, Atnafu Lambebo Tonja, Oreen Yousuf, Salomey Osei, Abigail Oppong, Iyanuoluwa Shode, Oluwabusayo Olufunke Awoyomi, Chris Chinenye Emezue

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Third Workshop on Simple and Efficient Natural Language Processing, EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.00720 2023-01-26 cs.CL cs.AI cs.DB cs.IR cs.LG 85%

LightNER: A Lightweight Tuning Paradigm for Low-resource NER via Pluggable Prompting

Xiang Chen, Lei Li, Shumin Deng, Chuanqi Tan, Changliang Xu, Fei Huang, Luo Si, Huajun Chen, Ningyu Zhang

专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by COLING 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08986 2023-01-24 cs.CL cs.AI cs.LG cs.NE 85%

Adapting a Language Model While Preserving its General Knowledge

Zixuan Ke, Yijia Shao, Haowei Lin, Hu Xu, Lei Shu, Bing Liu

专题命中 预训练与数据 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.07526 2022-10-21 cs.CV 85%

OmniVL:One Foundation Model for Image-Language and Video-Language Tasks

Junke Wang, Dongdong Chen, Zuxuan Wu, Chong Luo, Luowei Zhou, Yucheng Zhao, Yujia Xie, Ce Liu, Yu-Gang Jiang, Lu Yuan

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract)

Comments To appear at NeurIPs 2022, Camera Ready with Typos fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.06020 2021-05-14 cs.CL cs.AI cs.LG 85%

Are Larger Pretrained Language Models Uniformly Better? Comparing Performance at the Instance Level

Ruiqi Zhong, Dhruba Ghosh, Dan Klein, Jacob Steinhardt

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2021 Findings. Code and data: https://github.com/ruiqi-zhong/acl2021-instance-level

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.03648 2021-04-15 cs.CL cs.AI cs.LG stat.ML 85%

A Mathematical Exploration of Why Language Models Help Solve Downstream Tasks

Nikunj Saunshi, Sadhika Malladi, Sanjeev Arora

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This version is the camera-ready version for ICLR 2021. Main changes include a detailed discussion about natural tasks, more detailed proof sketch and updated experimental evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.11784 2021-04-08 cs.CL cs.AI cs.LG 85%

Self-Alignment Pretraining for Biomedical Entity Representations

Fangyu Liu, Ehsan Shareghi, Zaiqiao Meng, Marco Basaldella, Nigel Collier

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NAACL 2021 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.14975 2020-11-11 cs.CL cs.AI cs.LG 85%

Investigating Transferability in Pretrained Language Models

Alex Tamkin, Trisha Singh, Davide Giovanardi, Noah Goodman

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Findings of EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14211 2026-08-17 cs.LG cs.AI 新提交 84%

Training Fair Tabular Foundation Models

训练公平表格基础模型

Patrik Kenfack, Jesse C. Cresswell, Anthony L. Caterini, Samira Ebrahimi Kahou, Ulrich Aïvodji

机构 * ÉTS Montréal(蒙特利尔高等技术学院) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Layer 6 AI(第六层人工智能公司) University of Calgary(卡尔加里大学) CIFAR(加拿大高级研究所)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对表格基础模型(TFMs)公平性未被充分探索的问题,本研究提出FairTFM训练策略,将公平约束融入TFMs训练,在132个公平任务上实现公平性提升且保持竞争力准确性。

Comments Spotlight paper at the ICML 2026 Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30393 2026-06-01 cs.LG cs.AI cs.CR 84%

NumLeak: Public Numeric Benchmarks as Latent Labels in Foundation Models

NumLeak: 基础模型中的公开数值基准作为潜在标签

Anany Kotawala

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :foundation model(title,comments);LLM(abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出NumLeak框架,通过API边界探测和开源因果模型的白盒验证,揭示基础模型在预训练中记忆公开数值基准,导致评估高估泛化能力。

Comments 23 pages, 12 figures, 17 tables. Accepted at the ICML 2026 Workshop on the Impact of Memorization on Trustworthy Foundation Models (MemFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20549 2026-04-23 cs.CL cs.AI 84%

Toward Cross-Lingual Quality Classifiers for Multilingual Pretraining Data Selection

迈向多语言预训练数据选择的跨语言质量分类器

Yassine Turki, Vinko Sabolčec, Bettina Messmer, Martin Jaggi

机构 * Machine Learning Optimization Lab(机器学习优化实验室) Ecole Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了通过跨语言迁移、第三四分位采样和保留率调整策略,提升多语言数据筛选效果,证明大规模多语言池化在稳定性与准确率上优于单语基线,尤其对低资源语言有显著提升。

Comments Accepted at the 3rd Workshop on Navigating and Addressing Data Problems for Foundation Models (DATA-FM @ ICLR 2026). 31 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27522 2025-11-03 cs.LG cs.AI 84%

Leveraging Generic Time Series Foundation Models for EEG Classification

Théo Gnassounou, Yessin Moakher, Shifeng Xie, Vasilii Feofanov, Ievgen Redko

机构 * Université Paris-Saclay, Inria, CEA(巴黎萨克雷大学、法国国家信息与自动化研究所、法国原子能委员会) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Journal ref NeurIPS 2025 Workshop "Recent Advances in Time Series Foundation Models Have We Reached the 'BERT Moment'?"

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03056 2025-06-04 cs.AI cs.CY cs.LG 84%

Corrigibility as a Singular Target: A Vision for Inherently Reliable Foundation Models

Ram Potham, Max Harms

机构 * Independent Researcher(独立研究者) Machine Intelligence Research Institute(机器智能研究院)

专题命中 预训练与数据 :foundation model(title,abstract);SFT(abstract);分类 cs.AI、cs.LG

Comments Preprint. This work has been submitted to the Reliable and Responsible Foundation Models Workshop at ICML 2025 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03608 2024-04-05 cs.CL cs.AI 84%

Sailor: Open Language Models for South-East Asia

Longxu Dou, Qian Liu, Guangtao Zeng, Jia Guo, Jiahui Zhou, Wei Lu, Min Lin

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

Comments Code is available at https://github.com/sail-sg/sailor-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.04878 2022-11-10 cs.LG cs.AI 84%

Foundation Models for Semantic Novelty in Reinforcement Learning

Tarun Gupta, Peter Karkus, Tong Che, Danfei Xu, Marco Pavone

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Foundation Models for Decision Making Workshop at Neural Information Processing Systems, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.07435 2021-12-08 cs.LG cs.CL q-bio.BM 84%

Modeling Protein Using Large-scale Pretrain Language Model

Yijia Xiao, Jiezhong Qiu, Ziang Li, Chang-Yu Hsieh, Jie Tang

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract,comments);分类 cs.CL、cs.LG

Comments Accepted paper in Pretrain@KDD 2021 (The International Workshop on Pretraining: Algorithms, Architectures, and Applications)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06398 2026-08-10 cs.AI 新提交 84%

EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs

EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由

Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EntropyMoE针对无分词器字节级LLM的块计算局限性,提出基于块熵的稀疏专家路由MoE架构,在降低位每字节的同时保持下游准确率,扩展了MoE建模的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06283 2026-08-07 cs.LG math.OC math.PR stat.ML 新提交 84%

The Tamed Subgradient Unadjusted Langevin Algorithm beyond Convexity

超越凸性的驯服次梯度未校正朗之万算法

Iosif Lytras, Nikolaos Makras, Sotirios Sabanis

机构 * University of Edinburgh(爱丁堡大学) National Technical University of Athens(雅典国立技术大学) Athena/Archimedes Research Centre(雅典娜/阿基米德研究中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文针对非光滑、超线性梯度增长且非凸的目标分布采样问题,提出SG-TULA算法,推导其非渐近收敛界,验证假设并用于GPT-2系列LLM预训练,效果优于AdamW等。

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11671 2026-08-04 cs.CR cs.AI cs.SE 版本更新 84%

Cochise: A Reference Harness for Autonomous Penetration Testing

Cochise:自主渗透测试的参考框架

Andreas Happe, Jürgen Cito

机构 * TU Wien(维也纳技术大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 Cochise提供了一个简洁的自主渗透测试框架,支持通过SSH连接LLM代理与Linux主机,并通过分离的规划-执行架构实现可控环境,同时提供重放和分析工具以支持研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26178 2026-07-30 cs.CL 新提交 84%

DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues

DuplexGen:人机交替对话的自适应合成

Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Seoul National University(首尔大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 DuplexGen框架通过将LLM预测与少量槽级人类偏好标注校准,生成场景自适应交替发言对话,契合人类偏好的效果优于未校准方法,证明人类校准对交替发言合成场景特定性的关键作用。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12712 2026-07-16 cs.SE cs.LG 版本更新 84%

Design-Specification Tiling for ICL-based CAD Code Generation

基于ICL的CAD代码生成的Design-Specification Tiling设计

Yali Du, San-Zhuo Xi, Hui Sun, Ming Li

机构 * National Key Laboratory for Novel Software Technology, School of Artificial Intelligence, Nanjing University(新型软件技术国家实验室,人工智能学院,南京大学)

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 本文提出DST方法,通过量化知识充分性提升CAD代码生成质量,优于现有ICL示例选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25198 2026-07-02 cs.AI 新提交 84%

Heuresis: Search Strategies for Autonomous AI Research Agents Across Quality, Diversity and Novelty

Heuresis: 自主AI研究智能体在质量、多样性和新颖性上的搜索策略

Antonis Antoniades, Deepak Nathani, Ritam Saha, Alfonso Amayuelas, Ivan Bercovich, Zhaotian Weng, Vignesh Baskaran, Kunal Bhatia, William Yang Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Hexo AI

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出Heuresis框架,将研究流程抽象为通用原语,实现开放科学探索;在三个领域评估六种搜索策略,发现完全新颖的想法罕见且无法达到最高性能,揭示了当前策略无法扩展质量-新颖性前沿的挑战。

Comments 14 pages main text, 82 pages total including appendix; 38 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17526 2026-06-17 cs.LG 新提交 84%

MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization

MGUP:一种用于随机优化的动量-梯度对齐更新策略

Da Chang, Ganzhao Yuan

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shenzhen University of Advanced Technology(深圳理工大学) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出MGUP机制,通过按固定比例选择参数施加大步长、其余参数用小步长,增强动量优化器,理论保证收敛,实验表明提升训练效率与稳定性。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06184 2026-06-16 cs.SE cs.LG cs.LO cs.PL 84%

Teaching LLMs Program Semantics via Symbolic Execution Traces

通过符号执行轨迹教学LLM程序语义

Jonas Bayer, Stefan Zetzsche, Olivier Bouissou, Remi Delmas, Michael Tautschnig, Soonho Kong

机构 * University of Cambridge(剑桥大学) Amazon Web Services(亚马逊网络服务)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);pretraining(abstract);分类 cs.LG

AI总结 本文通过符号执行轨迹训练提升LLM对程序语义的理解,发现结合推理的训练显著提升了漏洞检测能力,且在不同属性类型上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03785 2026-06-05 cs.CL 84%

Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs

后门遗忘泛化:走向移除大语言模型中未知触发器的路径

Lisa Bouger, Théo Lasnier, Philippe Loubet Moundi, Yannick Teglia, Djamé Seddah

机构 * Inria Paris(法国巴黎国家信息与自动化研究所) Sorbonne Université(索邦大学) Thales CDI(泰雷兹CDI)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过实验证明,针对单个后门的遗忘训练可以泛化抑制其他未明确针对的后门,并引入交叉激活偏移距离量化不同训练引起的模型变化,为利用可控后门移除未知后门提供新方向。

Comments 22 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03899 2026-06-04 cs.LG 84%

Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering

先降噪,后正交:通过谱滤波理解Muon中的动量

Xianliang Li, Zihan Zhang, Weiyang Liu, Han Bao

机构 * The Institute of Statistical Mathematics(统计数学研究所) The Graduate Institute for Advanced Studies, SOKENDAI(SOKENDAI高级研究院) National Institute of Informatics(国家信息研究所) The Chinese University of Hong Kong(香港中文大学) Tohoku University(东北大学) RIKEN AIP(理化学研究所AIP)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过谱滤波理论证明Muon优化器中的动量能抑制梯度扰动、扩大谱间隙,从而稳定正交化步骤,并证明先动量后正交化比相反顺序或去除动量更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01504 2026-06-02 cs.IR cs.LG 84%

Semantic Retrieval for Product Search in E-Commerce

电子商务产品搜索中的语义检索

Nikhil Kothari, Saksham Samdani, Ritam Mallick, Praveen Gupta, Ankit Vijay, Surender Kumar

机构 * Flipkart, India(印度Flipkart)

专题命中 预训练与数据 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.LG

AI总结 针对电商搜索中短、嘈杂、口语化查询和细粒度属性区分问题,提出一种基于Siamese LLM双编码器的两阶段训练方法,通过对比学习和偏好优化实现精确匹配与排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04828 2026-06-02 cs.CL 84%

From Unfamiliar to Familiar: Detecting Pre-training Data via Gradient Deviations in Large Language Models

从陌生到熟悉:通过梯度偏差检测大型语言模型中的预训练数据

Ruiqi Zhang, Lingxiang Wang, Hainan Zhang, Zhiming Zheng, Yanyan Lan

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京未来区块链与隐私计算先进创新中心,北京航空航天大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 提出GDS方法,通过分析目标样本的梯度偏差分数(包括更新幅度、位置和神经元激活集中度)来区分预训练成员与非成员数据,实现高效且跨数据集迁移的预训练数据检测。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05813 2026-05-19 cs.LG math.OC 84%

Where Does Warm-Up Come From? Adaptive Scheduling for Norm-Constrained Optimizers

自适应调度机制:规范约束优化器中的暖启动来源

Artem Riabinin, Andrey Veprikov, Arman Bolatov, Martin Takáč, Aleksandr Beznosikov

机构 * Basic Research of Artificial Intelligence Laboratory(人工智能基础研究实验室) Federated Learning Problems Laboratory(联邦学习问题实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Innopolis University(因诺普里斯大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了规范约束优化器的自适应学习率调度,提出了一种通用平滑性假设,证明了在优化轨迹中局部曲率随次优间隙减小,从而自然产生暖启动而非人工设定。

Comments 30 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21954 2026-05-12 cs.CL 84%

Model-Aware Tokenizer Transfer

模型感知的分词迁移

Mykola Haltiuk, Aleksander Smywinski-Pohl

机构 * Faculty of Computer Science AGH University of Krakow(克拉科夫AGH大学计算机科学学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MATT方法,通过整合模型内部信息提升分词迁移效果,实验表明其在多语言LLM中能有效恢复模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏