arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137794 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12318 篇

2306.11732 2023-06-21 cs.CV 89%

Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models

Junting Pan, Ziyi Lin, Yuying Ge, Xiatian Zhu, Renrui Zhang, Yi Wang, Yu Qiao, Hongsheng Li

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09282 2023-06-06 cs.CL cs.AI cs.LG 89%

APOLLO: A Simple Approach for Adaptive Pretraining of Language Models for Logical Reasoning

Soumya Sanyal, Yichong Xu, Shuohang Wang, Ziyi Yang, Reid Pryzant, Wenhao Yu, Chenguang Zhu, Xiang Ren

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ACL 2023, code available at https://github.com/INK-USC/APOLLO

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12223 2023-05-24 cs.CV 89%

What Makes for Good Visual Tokenizers for Large Language Models?

Guangzhi Wang, Yixiao Ge, Xiaohan Ding, Mohan Kankanhalli, Ying Shan

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract)

Comments 15 pages, 3 figures. Project released at: https://github.com/TencentARC/GVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12268 2023-05-23 cs.CL cs.AI cs.LG 89%

Patton: Language Model Pretraining on Text-Rich Networks

Bowen Jin, Wentao Zhang, Yu Zhang, Yu Meng, Xinyang Zhang, Qi Zhu, Jiawei Han

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2023. (Code: https://github.com/PeterGriffinJin/Patton)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.10475 2023-03-07 cs.CL cs.AI cs.LG 89%

DeepStruct: Pretraining of Language Models for Structure Prediction

Chenguang Wang, Xiao Liu, Zui Chen, Haoyun Hong, Jie Tang, Dawn Song

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04782 2023-02-14 cs.CL cs.AI cs.LG 89%

Robustification of Multilingual Language Models to Real-world Noise in Crosslingual Zero-shot Settings with Robust Contrastive Pretraining

Asa Cooper Stickland, Sailik Sengupta, Jason Krone, Saab Mansour, He He

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted and to be presented at the 17th Conference of the European Chapter of the Association for Computational Linguistics (EACL), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.08184 2022-05-18 cs.CL cs.AI cs.LG 89%

SKILL: Structured Knowledge Infusion for Large Language Models

Fedor Moiseev, Zhe Dong, Enrique Alfonseca, Martin Jaggi

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments NAACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.10360 2022-03-18 cs.CL cs.AI cs.LG 89%

GLM: General Language Model Pretraining with Autoregressive Blank Infilling

Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments to be published in ACL 2022. 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.10685 2021-11-10 cs.CL cs.AI cs.LG 89%

Controllable Generation from Pre-trained Language Models via Inverse Prompting

Xu Zou, Da Yin, Qingyang Zhong, Ming Ding, Hongxia Yang, Zhilin Yang, Jie Tang

专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Slightly different from the KDD version

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.01819 2021-09-07 cs.CL cs.AI cs.LG 89%

Frustratingly Simple Pretraining Alternatives to Masked Language Modeling

Atsuki Yamaguchi, George Chrysostomou, Katerina Margatina, Nikolaos Aletras

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.07040 2021-03-15 cs.CL cs.AI cs.LG 89%

Bilingual Dictionary-based Language Model Pretraining for Neural Machine Translation

Yusen Lin, Jiayong Lin, Shuaicheng Zhang, Haoying Dai

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09912 2026-06-10 cs.LG cs.AI 新提交 89%

Mix, Don't Pick: Why Synthetic Corpus Composition Matters for Time Series Foundation Model Pretraining

混合而非挑选:为什么合成语料组合对时间序列基础模型预训练至关重要

Aaryan Nagpal, Debdeep Sanyal, Murari Mandal, Dhruv Kumar, Saurabh Deshpande

机构 * Birla AI Labs(巴尔拉人工智能实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 针对时间序列基础模型预训练中合成数据生成器选择困难的问题,提出简单等权混合所有生成器的方法,匹配或超越最优单个生成器,并与真实数据结合获得最强预训练语料。

Comments Accepted at the ICML 2026 Workshop on Foundation Models for Structured Data (FMSD), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12241 2026-05-13 eess.SP cs.AI cs.LG 89%

Pretraining Strategies and Scaling for ECG Foundation Models: A Systematic Study

ECG基础模型的预训练策略与扩展:一项系统研究

M A Al-Masud, Nils Strodthoff

机构 * AI4Health Division(AI4Health部门)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文系统评估了ECG基础模型的预训练方法,探讨了不同对比和非对比自监督学习目标在不同预训练数据集规模下的表现,发现对比预测编码在跨临床任务的迁移性能上表现最佳。

Comments 59 pages, 16 figures, 59 Tables. Code available at https://anonymous.4open.science/r/ecg-pretraining-strategies-4DE3

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.04106 2022-03-16 cs.CL cs.AI 89%

Noisy Channel Language Model Prompting for Few-Shot Text Classification

Sewon Min, Mike Lewis, Hannaneh Hajishirzi, Luke Zettlemoyer

专题命中 预训练与数据 :prompting(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 15 pages, 6 figures. Published as a conference paper at ACL 2022 (long). Code available at https://github.com/shmsw25/Channel-LM-Prompting

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14229 2026-08-17 cs.CL 新提交 89%

The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning

越受欢迎,越难遗忘:用于大语言模型遗忘的自适应受欢迎度

Anna Borisiuk, Andrey Savchenko, Alexander Panchenko, Elena Tutubalina

机构 * AIRI Sber AI Lab(Sber AI实验室) Skoltech(斯科尔科沃科学技术研究院) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息学研究所可信人工智能研究中心)

专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(abstract);分类 cs.CL

AI总结 针对现有LLM遗忘方法未区分训练数据频率的问题,提出AdaPop方法,经实验其在转述查询和对抗性重构下均能显著减少遗忘内容泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10690 2026-08-12 cs.CL 新提交 89%

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

已发布的大语言模型词汇表能否支持隐藏语料库的词元级估计?

Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(abstract);分类 cs.CL

AI总结 该研究针对隐藏语料库的词元级估计问题,提出分位数引导密度估计(QGDE)方法,利用已发布的LLM分词器词汇表实现了低误差的细粒度语料估计,为相关任务提供了新的有效信号来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13416 2026-07-16 cs.LG 新提交 89%

EXPLORE: Exploration with Guided Search for Analog Topology Generation using Language Models

EXPLORE:使用语言模型进行引导搜索以生成模拟拓扑结构

Guanglei Zhou, Chen-Chia Chang, Yikang Shen, Jonathan Ku, Isaac Jacobson, Jingyu Pan, Yiran Chen, Xin Zhang

机构 * Duke University(杜克大学) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室) IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文针对自动化模拟电路拓扑设计难题,提出EXPLORE框架,集成模拟器引导蒙特卡罗树搜索与基于变压器的解码,利用语言模型先验优化搜索,在6组件基准测试中显著提升成功率、降低均方误差,推动LLM驱动设计自动化。

Comments MLCAD 26' accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01733 2026-07-03 cs.CL eess.AS 新提交 89%

Rethinking Speech-LLM Integration for ASR: Effective Joint Speech-Text Training by Interleaving

重新思考语音-LLM集成用于ASR:通过交错实现有效的联合语音-文本训练

Ruchao Fan, Yiming Wang, Rui Zhao, Liliang Ren, Keqi Deng, Xiaoyang Chen, Ali Zare, Bo Ren, Yuxuan Hu, Junkun Chen, Yan Huang, Yelong Shen, Jinyu Li

机构 * Microsoft(微软)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL

AI总结 提出JSTIP,一种面向ASR的预训练策略,通过构建词级和段级交错语音-文本序列,在38k小时数据上相比基线提升了实体识别准确率,并缩小了模态差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29654 2026-06-30 cs.AI cs.MA 89%

Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds

预算约束下的多智能体LLM“行动或延迟”协商与局部可靠性界限

Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Devin Zhang, Jae Oh Woo

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) General Motors (GM)(通用汽车(GM))

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种预算约束下的“行动或延迟”决策框架,通过k近邻下置信界评估LLM协商的可靠性,在满足用户指定的错误行动预算时自动执行,否则延迟人工审核,并在六个基准上验证了有效性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01163 2026-06-25 cs.LG stat.ML 版本更新 89%

How Does the Pretraining Distribution Shape In-Context Learning? A Fundamental Trade-Off

预训练分布如何塑造上下文学习?一个基本的权衡

Waïss Azizian, Ali Hasan

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过理论框架和实验,揭示预训练分布的统计特性(如重尾行为)在上下文学习中导致任务选择鲁棒性与泛化能力之间的基本权衡。

Comments 57 pages, 15 figures; to be presented at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17581 2026-06-17 cs.PL cs.AI 新提交 89%

Visored: A Controlled-Natural-Language Prover for LLM-Generated Mathematics

Visored: 一种面向LLM生成数学的受控自然语言证明器

Xiyu Zhai, Xinyi Chen, Yiping Wang, Runlong Zhou, Liao Zhang, Simon S. Du

机构 * University of Washington(华盛顿大学) University of Innsbruck(因斯布鲁克大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于依赖类型的证明器,其表面模仿数学自然语言,并通过规则驱动的自动化层填补常规步骤,使LLM无需专用训练数据即可在miniF2F基准上有效使用,并输出可检查的Lean文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07002 2026-06-09 cs.CL 版本更新 89%

Automated Attribution Graph Interpretation via Probe Prompting

通过探针提示实现自动化归因图解释

Giuseppe Birardi, Gonçalo Paulo

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出探针提示方法,利用跨提示激活签名将归因图特征分组为概念对齐的超节点,并通过因果干预验证标签,在Gemma-2-2B上实现100%的预测转向行为。

Comments 35 pages, 24 figures, 18 tables. Code and interactive demo available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05805 2026-06-05 cs.AI 89%

From Risk Classification to Action Plan Remediation: A Guardrail Feedback Driven Framework for LLM Agents

从风险分类到行动方案修复:一种基于护栏反馈驱动的LLM代理框架

Yuhao Sun, Jiacheng Zhang, Shaanan Cohney, Zhexin Zhang, Feng Liu, Xingliang Yuan

机构 * The University of Melbourne(墨尔本大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出TRIAD框架,通过护栏生成的言语反馈引导代理在规划步骤中保持良性目标,实现安全与效用的最佳平衡。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05610 2026-06-05 cs.CL 89%

Predictable Scaling Laws of Optimal Hyperparameters for LLM Continued Pre-training

LLM持续预训练中最优超参数的可预测缩放定律

Yongwei Zhou, Juncheng Diao, Junlin Shang, Peiguang Li, Rongxiang Weng

机构 * MeiTuan(美团) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文发现持续预训练中学习率和批大小等最优超参数遵循稳定可预测的缩放定律,并提出一个两阶段框架,通过小规模代理模型和状态感知预测,将超参数搜索开销降低90%且性能相当或更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04876 2026-06-04 cs.LG 89%

Towards Pretraining Text Encoders for TabPFN

面向TabPFN的文本编码器预训练

Mustafa Tajjar, Alexander Pfefferle, Lennart Purucker, Frank Hutter

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度思维)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);language model(abstract);foundation model(abstract)

AI总结 提出TabPFN文本适配器,通过轻量级适配器将文本嵌入映射到TabPFN的嵌入空间,避免PCA瓶颈,保留TabPFN数值优势,训练效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04067 2026-06-04 cs.CR cs.AI 89%

Need to Know: Contextual-Integrity-Grounded Query Rewriting for Privacy-Conscious LLM Delegation

须知:基于语境完整性的隐私意识LLM委托查询重写

Xinyue Huang, Xiaochun Cao, Wenyuan Yang

机构 * Sun Yat-sen University(中山大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM委托中查询隐私泄露问题,提出基于语境完整性的查询重写框架,通过CI引导的强化学习训练重写器,在保留任务关键信息的同时抑制非必要敏感披露,实现最佳隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01364 2026-06-02 cs.CR cs.AI cs.SE 89%

Needles at Scale: LLM-Assisted Target Selection for Windows Vulnerability Research

大规模针尖:LLM辅助的Windows漏洞研究目标选择

Michael J. Bommarito

机构 * Microsoft(微软) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出Symbolicate-Enrich-Sample流水线,通过符号恢复、结构特征提取和低成本语言模型排序,从Windows系统数千万函数中筛选出约2.2万个候选目标,解决漏洞研究中目标选择瓶颈问题。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12325 2026-06-02 cs.CL 89%

$M^3$ Scaling Law: Optimizing Multi-Epoch, Multi-Lingual, and Multi-Stage Training for Low-Resource Language Models

$M^3$ 缩放定律:优化低资源语言模型的多周期、多语言和多阶段训练

Kosuke Akimoto, Taiki Miyagawa, Masafumi Oyamada

机构 * NEC Corporation(日本电报电话株式会社)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 本文提出 $M^3$ 缩放定律,统一预测模型规模、目标语料周期数、平均目标语言比例和最终阶段目标语言比例对低资源语言模型预训练损失的影响,并推导出最优训练策略的实用指南。

Comments 35 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14315 2026-05-29 cs.LG math.OC 89%

Enhancing LLM Training via Spectral Clipping

通过谱裁剪增强大语言模型训练

Xiaowen Jiang, Andrei Semenov, Sebastian U. Stich

机构 * CISPA Helmholtz Center for Information Security(信息安全研究中心) EPFL(瑞士联邦理工学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出SPECTRA框架,通过对优化器更新进行谱裁剪以约束谱范数、对梯度进行预谱裁剪以抑制噪声尖峰,从而提升多种优化器在大语言模型预训练中的性能。

Comments v2: ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24448 2025-11-04 cs.CV cs.AI 89%

Rethinking Visual Intelligence: Insights from Video Pretraining

Pablo Acuaviva, Aram Davtyan, Mariam Hassan, Sebastian Stapf, Ahmad Rahimi, Alexandre Alahi, Paolo Favaro

机构 * Computer Vision Group, University of Bern(伯尔尼大学计算机视觉组) VITA Lab, EPFL(苏黎世联邦理工学院VITA实验室)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Updated version from preprint arXiv:2506.07280 (Gen2Gen) focused on visual intelligence. This work can be considered as v2

详情

展开后加载摘要…

URL PDF HTML 收藏