arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137636 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12308 篇

2407.02694 2025-04-21 cs.LG cs.AI cs.CL stat.ML 93%

LLM-Select: Feature Selection with Large Language Models

Daniel P. Jeong, Zachary C. Lipton, Pradeep Ravikumar

专题命中 预训练与数据 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments Published in Transactions on Machine Learning Research (TMLR), April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10880 2025-03-18 cs.CL cs.AI cs.LG 93%

Fine-tuning can Help Detect Pretraining Data from Large Language Models

Hengxiang Zhang, Songxin Zhang, Bingyi Jing, Hongxin Wei

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12038 2024-08-07 cs.CL cs.AI cs.LG 93%

Soft Prompting for Unlearning in Large Language Models

Karuna Bhaila, Minh-Hao Van, Xintao Wu

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13811 2026-07-28 quant-ph cs.AI 版本更新 92%

Aligning Quantum Operators with Large Language Models

对齐量子算子与大型语言模型

Rogerio Feris, Yunchao Liu, Pengyuan Li, Hang Hua, David Kremer

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 提出将酉算子映射到LLM潜空间的方法,实现量子与语言输入的联合建模,在Clifford+T电路合成任务上取得与最先进方法竞争的结果,并支持语言条件合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18268 2026-07-22 cs.AI 新提交 92%

Fence: Specialized SLM Guardrails for LLM Applications

Fence:用于大语言模型应用的专用小型语言模型护栏

Kumud Lakara, Ruibo Shi, Fran Silavong

机构 * JPMorgan(摩根大通)

专题命中 预训练与数据 :LLM(title,abstract);SLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究使用闭源大语言模型的实际应用的安全措施问题,提出用在合成数据上训练的小型语言模型作专用护栏,引入受GAN启发的合成数据生成方法,实验证明该方法训练的护栏比基于提示的性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07494 2026-07-09 cs.DC cs.LG 新提交 92%

GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining

GIFT:用于大语言模型预训练的几何感知低精度梯度通信

Jieying Wang, Shuyuan Fan, Mingkai Zheng, Zhao Zhang

机构 * Rutgers University(罗格斯大学)

专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对LLM预训练中梯度通信瓶颈,提出几何感知梯度缩放方法GIFT,通过变换梯度到近各向同性空间进行低精度通信,开发简化算法平衡开销与减少量,经实验验证可减少预训练时间并改善下游任务保留情况。

Comments 12 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28823 2026-06-30 cs.CL 92%

Labeling Training Data for Entity Matching Using Large Language Models

使用大型语言模型为实体匹配标注训练数据

Aaron Steiner, Christian Bizer

机构 * Data and Web Science Group(数据与网络科学组) University of Mannheim(曼海姆大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);small language model(abstract)

AI总结 研究利用知识蒸馏工作流,以LLM为教师模型标注训练数据,训练小型学生模型进行实体匹配,在五个基准上学生模型性能与基准训练集相当,且成本远低于人工标注。

Comments 13 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15510 2026-06-24 cs.LG 版本更新 92%

Not All Invariants Are Equal: Curating Training Data to Accelerate Program Verification with SLMs

并非所有不变式都同等重要:利用SLM通过精选训练数据加速程序验证

Ido Pinto, Yizhak Yisrael Elboher, Haoze Wu, Nina Narodytska, Guy Katz

机构 * Hebrew University of Jerusalem, Israel(特拉维夫大学) Amherst College, USA(阿默斯特学院) VMware Research by Broadcom, USA(Broadcom VMware 研究)

专题命中 预训练与数据 :SLM(title_cn,summary_cn);LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出Wonda数据筛选流水线,通过AST归一化和LLM语义重写从原始验证器输出中提取高质量训练不变式,微调小语言模型(SLM)后,在多个模型上使不变式正确性和加速率翻倍甚至三倍,小模型性能媲美大模型。

Comments A preprint of the ICML 2026 paper with the same title

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19468 2026-06-19 cs.CL 新提交 92%

Characterizing Narrative Content in Web-scale LLM Pretraining Data

网络规模LLM预训练数据中的叙事内容特征化

Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak

机构 * University of Colorado Boulder(科罗拉多大学波尔德分校) ETH Zürich(苏黎世联邦理工学院) McGill University(麦吉尔大学)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);分类 cs.CL

AI总结 首次细粒度研究LLM预训练语料库Dolma的叙事特征,提出涵盖三个核心叙事元素(能动性、场景、事件)的框架,构建NarraBERT模型并发布NarraDolma数据集,揭示叙事结构在异构数据中可测量且分布不均。

Comments 8 pages of main content, 28 total pages. 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09697 2026-06-09 cs.CL 新提交 92%

PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models

PsychoSafe:在大语言模型中引发基于心理学的拒绝

Gianluca Barmina, Federico Torrielli, Sven Harms, Jacob Nielsen, Felix Mächtle, Stine Lyngsø Beltoft, Peter Schneider-Kamp, Thomas Eisenbarth, Lukas Galke Poech, Anne Lauscher

机构 * University of Southern Denmark(南丹麦大学) University of Turin(都灵大学) University of Hamburg(汉堡大学) University of Lübeck(吕贝克大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出PsychoSafe框架,将LLM的拒绝行为重构为基于证据干预策略的结构化支持性沟通,通过构建5个心理风险领域的8019个提示-响应对,对Qwen 3.5 27B进行提示和参数高效微调,在拒绝质量上比通用基线提升28.1%,同时保持非拒绝任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29223 2026-06-08 cs.LG 版本更新 92%

Inferring the Size of Large Language Models From Popular Text Memorization

从流行文本记忆推断大型语言模型的规模

Ivica Nikolic

机构 * National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 提出一种黑盒方法,通过分析模型对流行文本的记忆准确性,仅从生成文本推断LLM参数规模的下界,并验证了开源和闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01542 2026-05-25 cs.CL 92%

Register Always Matters: Analysis of LLM Pretraining Data Through the Lens of Language Variation

语域始终重要:通过语言变异视角分析LLM预训练数据

Amanda Myntti, Erik Henriksson, Veronika Laippala, Sampo Pyysalo

机构 * University of Turku(图尔库大学)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文首次利用语域(register)对预训练数据进行分类,通过训练小型生成模型并评估,发现语域显著影响LLM性能,其中“观点”类数据有益而“新闻”类效果不佳,组合特定语域可大幅提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22760 2026-04-16 cs.CR cs.LG cs.PL 92%

Malicious and Unintentional Disclosure Risks in Large Language Models for Code Generation

大型语言模型在代码生成中的恶意与非故意披露风险

Rafiqul Rabin, Sean McGregor, Nick Judd

机构 * Digital Safety Research Institute(数字安全研究研究院) UL Research Institutes(UL研究机构)

专题命中 预训练与数据 :language model(title,summary_cn);large language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究了大型语言模型在代码生成训练中可能泄露训练数据中的敏感信息的风险,分析了非故意和恶意披露两种风险,并通过Open Language Model模型评估了不同数据集和模型版本的风险变化。

Comments The 3rd International Workshop on Mining Software Repositories Applications for Privacy and Security (MSR4P&S), co-located with SANER 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20729 2026-06-23 physics.chem-ph cond-mat.mtrl-sci cs.AI cs.LG 新提交 92%

LLM-Guided Test-Time Discovery of Quantum-Chemical Approximation Algorithms

LLM引导的量子化学近似算法测试时发现

Masaya Hagai, Yuta Suzuki, Tomoya Murata, Shuhei Kurita, Masaki Adachi

机构 * Lattice Lab, Toyota Motor Corporation(丰田汽车公司格子实验室) Department of Chemistry, Graduate School of Science, Nagoya University(名古屋大学理学部化学科) National Institute of Informatics(国家信息研究所)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 提出LADeQ框架,利用LLM在测试时自动发现、实现并评估量子化学近似算法,无需预训练或特定数据,可加速CCSD和CISD计算并控制误差。

Comments 13 main pages, 6 main figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14252 2025-10-08 cs.CL cs.AI 92%

LLM-JEPA: Large Language Models Meet Joint Embedding Predictive Architectures

Hai Huang, Yann LeCun, Randall Balestriero

机构 * Atlassian(Atlassian公司) NYU(纽约大学) Brown University(布朗大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02229 2025-05-30 cs.AI cs.CL 92%

CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning

Huimu Yu, Xing Wu, Haotian Xu, Debing Zhang, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Xiaohongshu Inc(小红书公司)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);RLHF(abstract)

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06733 2025-02-11 cs.LG cs.AI 92%

Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining

Daouda Sow, Herbert Woisetschläger, Saikiran Bulusu, Shiqiang Wang, Hans-Arno Jacobsen, Yingbin Liang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

Comments Accepted for publication at ICLR 2025. Code base available: https://github.com/sowmaster/Sample-Level-Loss-Reweighting-ICLR-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06131 2025-01-30 cs.CL cs.AI 92%

Accelerating Large Language Model Pretraining via LFR Pedagogy: Learn, Focus, and Review

Neha Prakriya, Jui-Nan Yen, Cho-Jui Hsieh, Jason Cong

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07815 2025-01-15 cs.AI cs.CL cs.MA 92%

Agent-Centric Projection of Prompting Techniques and Implications for Synthetic Training Data for Large Language Models

Dhruv Dhamani, Mary Lou Maher

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments 8 pages, 5 figures. Accepted at ICAART 2025. Derived from an early draft at 2312.17601. arXiv admin note: substantial text overlap with arXiv:2312.17601

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16789 2024-03-12 cs.CL cs.CR cs.LG 92%

Detecting Pretraining Data from Large Language Models

Weijia Shi, Anirudh Ajith, Mengzhou Xia, Yangsibo Huang, Daogao Liu, Terra Blevins, Danqi Chen, Luke Zettlemoyer

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06524 2026-05-19 cs.CL cs.AI cs.CY cs.DC cs.LG 92%

CarbonScaling: Extending Neural Scaling Laws for Carbon Footprint in Large Language Models

CarbonScaling:扩展神经缩放定律以用于大型语言模型中的碳足迹

Lei Jiang, Fan Chen

机构 * Indiana University(印第安纳大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CarbonScaling框架,结合神经缩放定律和分布式训练策略,准确建模前沿LLM训练的碳足迹,提高硬件配置和排放估计的精度。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07713 2024-05-30 cs.CL cs.AI cs.IR cs.LG 92%

InstructRetro: Instruction Tuning post Retrieval-Augmented Pretraining

Boxin Wang, Wei Ping, Lawrence McAfee, Peng Xu, Bo Li, Mohammad Shoeybi, Bryan Catanzaro

专题命中 预训练与数据 :instruction tuning(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15868 2026-06-16 cs.LG 新提交 92%

David vs. Goliath in Next Activity Prediction: Argmax vs. LSTM, Transformer, and LLM

下一活动预测中的大卫与歌利亚:Argmax 与 LSTM、Transformer 和 LLM

Hans Weytjens, Ingo Weber

机构 * Technical University of Munich(慕尼黑工业大学) Fraunhofer Gesellschaft(弗劳恩霍夫协会)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过系统基准测试,比较了简单计数 argmax 基线、LSTM、Transformer 和 LLM 在下一活动预测中的性能,发现 argmax 基线在多数数据集上可媲美或接近十亿参数 LLM。

Comments Accepted for 24th International Conference on Business Process Management (2026) Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27025 2026-05-27 cs.CL cs.MM 92%

Attribute-Based Diagnosis of LLM Alignment with Hate Speech Annotations

基于属性的LLM与仇恨言论标注的对齐诊断

Mohammad Amine Jradi, Faeze Ghorbanpour, Alexander Fraser

机构 * School of Computation, Information and Technology, TU Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过分析LLM在十个主观属性上的判断与人类标注的对齐情况,发现行为显式维度对齐良好而评价维度系统性反转,并提出基于置信度加权岭回归的属性组合方法,重构连续仇恨言论分数,R²达0.71。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01732 2026-05-20 cs.CL 92%

Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training

Common Corpus: 最大的伦理数据集用于LLM预训练

Pierre-Carl Langlais, Pavel Chizhov, Catherine Arnett, Carlos Rosas Hinostroza, Mattia Nee, Eliot Krzystof Jones, Irène Girard, David Mach, Anastasia Stasenko, Ivan P. Yamshchikov

机构 * PleIAs

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文介绍了Common Corpus,一个最大的开放数据集,用于LLM预训练,该数据集包含大量非受版权或开放许可的数据,涵盖了多种语言和领域,为多语言预训练提供了支持。

Journal ref ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21579 2026-04-24 cs.SE cs.AI 92%

A Metamorphic Testing Approach to Diagnosing Memorization in LLM-Based Program Repair

一种用于诊断基于LLM的程序修复中记忆现象的元测试方法

Milan De Koning, Ali Asgari, Pouria Derakhshanfar, Annibale Panichella

机构 * JetBrains Research(JetBrains研究) Delft University of Technology(代尔夫特理工大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过结合元测试与负对数似然,揭示LLM程序修复中数据泄露问题,发现模型在变换基准上的修复成功率显著下降,与NLL值高度相关。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07825 2026-04-21 cs.IR cs.AI 92%

Filling the Gaps: Selective Knowledge Augmentation for LLM Recommenders

填补空白:面向LLM推荐系统的选择性知识增强

Jaehyun Lee, Sanghwan Jang, SeongKu Kang, Hwanjo Yu

机构 * Pohang University of Science and Technology(釜山科学技术大学) Korea University(韩国大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出KnowSA_CKP方法,通过选择性注入知识来缓解LLM推荐中的知识差距问题,提升推荐准确性和上下文效率。

Comments Accepted to SIGIR 2026 full papers track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15378 2026-02-18 cs.CL 92%

Making Large Language Models Speak Tulu: Structured Prompting for an Extremely Low-Resource Language

让大语言模型开口说图鲁语:一种结构化提示方法用于极低资源语言

Prathamesh Devadiga, Paras Chopra

机构 * Lossfunk

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

AI总结 本研究通过结构化提示方法,在极低资源语言图鲁语上实现基本对话能力,减少词汇污染并提高语法准确性。

Comments Accepted to EACL LoResLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12594 2026-02-13 cs.CL 92%

PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery

PASER:基于后训练数据选择的高效剪枝大语言模型恢复

Bowei He, Lihao Yin, Hui-Ling Zhen, Xiaokun Zhang, Mingxuan Yuan, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);instruction tuning(abstract)

AI总结 PASER通过后训练数据选择方法高效恢复剪枝大语言模型的能力,显著优于传统基线方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08454 2025-09-22 cs.CR cs.CL 92%

Tag&Tab: Pretraining Data Detection in Large Language Models Using Keyword-Based Membership Inference Attack

Sagiv Antebi, Edan Habler, Asaf Shabtai, Yuval Elovici

机构 * Department of Software and Information Systems Engineering, Ben-Gurion University of the Negev(软件与信息系统工程系,贝纳-戈里翁大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏