arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137636 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12308 篇

2606.27632 2026-06-29 cs.CL 新提交 95%

Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety

Yuvion LLM:一种面向内容和AI安全的对抗感知大语言模型

Ting Ma, Xiufeng Huang, Benlei Cui, Xiaowen Xu, Shikai Qiu, Ruijie Jian, Hongxing Li, Guanghui Wang, Longtao Huang, Haiwen Hong, Haolei Xu, Wenjing Jiang, Ziwen Xu, Zhaoyu Fan, Shaoxuan He, Chuxi Xiao, Yujian Li, Xinyue Chen, Chunyang Chai, Wenxuan Liu, Ziheng Wang, Dongjie Zhang, Yangfan Zhou, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Wei Wang, Huiming Zhang, Bin Li, Hui Xue

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 针对大语言模型在对抗性攻击下的安全脆弱性,提出Yuvion LLM,通过对抗感知数据构建、知识增强预训练及多任务安全后训练,在安全基准和对抗鲁棒性上优于GPT-5.4等更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22117 2026-04-29 cs.LG cs.AI cs.CL 94%

PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training

PermaFrost-Attack: stealth pretraining seeding (spS) 用于在LLM训练期间种植逻辑地雷

Harsh Kumar, Rahul Maity, Tanmay Joshi, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * Manipal University Jaipur(Manipal大学斋普尔) NIT, Karnataka(Karnataka理工学院) Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa印度普拉吉亚实验室) Apple, USA(美国苹果公司) Google, USA(美国谷歌公司)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了在LLM训练中通过隐蔽预训练播种(SPS)植入逻辑地雷的威胁模型,通过几何诊断方法揭示了潜藏的中毒行为,展示了SPS对基础模型的安全性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03942 2026-08-05 cs.SD cs.CL cs.MM 版本更新 94%

MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models

MIDI-LLM:通过适配大语言模型改进文本到MIDI的音乐生成

Shih-Lun Wu, Dave Carlton, Ryan Miyakawa, Yoon Kim, Chris Donahue, Cheng-Zhi Anna Huang

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 该研究提出MIDI-LLM,通过适配Llama 3.2(1B)采用两阶段训练改进文本到MIDI生成,在用户研究中证实其在人机音乐协同创作中的有效性。

Comments Accepted to International Society for Music Information Retrieval (ISMIR) Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04167 2024-09-16 cs.CL cs.AI 94%

Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model

Xinrun Du, Zhouliang Yu, Songyang Gao, Ding Pan, Yuyang Cheng, Ziyang Ma, Ruibin Yuan, Xingwei Qu, Jiaheng Liu, Tianyu Zheng, Xinchen Luo, Guorui Zhou, Wenhu Chen, Ge Zhang

专题命中 预训练与数据 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);pretraining(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07608 2025-04-30 cs.LG cs.HC 94%

Time2Lang: Bridging Time-Series Foundation Models and Large Language Models for Health Sensing Beyond Prompting

Arvind Pillai, Dimitris Spathis, Subigya Nepal, Amanda C Collins, Daniel M Mackin, Michael V Heinz, Tess Z Griffin, Nicholas C Jacobson, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院) University of Cambridge(剑桥大学) Stanford University(斯坦福大学) Google Research(谷歌研究)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);foundation model(title,abstract);prompting(title,abstract)

Comments Accepted to CHIL 2025. Code and models: https://github.com/arvind1609/time2lang

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07996 2026-06-09 cs.CL cs.AI 新提交 94%

MC-PDD: Masked Corpus-Level Pretraining Data Detection for Black-Box Large Language Models

MC-PDD: 面向黑盒大语言模型的掩码语料级预训练数据检测

Kaixin Lan, Mu You, Tao Fang, Binkai Ou, Lidia S. Chao, Derek F. Wong

机构 * University of Macau(澳门大学) Macau Millennium College(澳门万人大学) BoardWare Information System Limited(博纬信息系统有限公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(title,abstract)

AI总结 提出MC-PDD方法,通过掩码特定token并利用LLM预测缺失内容,比较候选语料与参考非成员语料的预测命中率差异,以黑盒方式检测预训练数据,性能与现有方法相当。

Comments The manuscript consists of 10 pages formatted in the IEEE/ACM two-column style

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21613 2026-04-21 cs.CL cs.AI cs.LG 94%

Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining

超越URLs:元数据多样性与位置对高效LLM预训练的影响

Dongyang Fan, Diba Hashemi, Sai Praneeth Karimireddy, Martin Jaggi

机构 * EPFL(苏黎世联邦理工学院) University of Southern California(南加州大学)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了元数据类型对LLM预训练的影响,发现细粒度文档质量指标能提升训练效率,并提出元数据追加方法以加速预训练过程。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12419 2026-08-14 cs.LG 新提交 94%

LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining

LoKiFormer:面向高效大语言模型预训练的 locality-aware 注意力与解耦知识记忆

Qiuwu Chen, Zimo Liu, Yuchen Li, Ying Sun, Yifan Zhang, Zhijie Qiu, Zeng You, Ryan Dong, Simeng Ma, Yaofo Chen, Mingkui Tan

机构 * AIGCode South China University of Technology(华南理工大学) Pazhou Laboratory(琶洲实验室)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(title,abstract)

AI总结 针对LLM预训练效率问题,提出含局部融合注意力与知识记忆模块的LoKiFormer,使预训练收敛速度提升1.33倍,性能优于现有架构。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11543 2026-06-16 cs.CL 版本更新 94%

Pretraining A Large Language Model using Distributed GPUs: A Memory-Efficient Decentralized Paradigm

使用分布式GPU预训练大型语言模型:一种内存高效的分散式范式

Jinrui Zhang, Chaodong Xiao, Aoqi Wu, Xindong Zhang, Lei Zhang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) OPPO Research Institute(OPPO研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(title,abstract)

AI总结 提出SPES框架,通过分散式训练MoE LLM的子集专家降低内存需求,结合专家合并预热策略,在16个48GB GPU上训练2B参数模型,性能媲美集中式训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30348 2026-05-29 cs.CL cs.AI cs.LG 93%

LLMSurgeon: Diagnosing Data Mixture of Large Language Models

LLMSurgeon: 诊断大型语言模型的数据混合

Yaxin Luo, Jiacheng Cui, Xiaohan Zhao, Xinyi Shang, Jiacheng Liu, Xinyue Bi, Zhaoyi Li, Zhiqiang Shen

机构 * VILA Lab, MBZUAI(VILA实验室,MBZUAI) UCL

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 提出LLMSurgeon框架,通过逆问题方法从目标LLM生成文本中估计预训练语料的领域分布,实现无需训练数据的后验审计。

Comments ACL 2026 Main. Code at https://github.com/Yaxin9Luo/LLMSurgeon

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06522 2026-08-11 cs.CL cs.AI 93%

Fixing It in Post: A Comparative Study of LLM Post-Training Data Quality and Model Performance

事后修复:对LLM事后训练数据质量和模型性能的比较研究

Aladin Djuhera, Swanand Ravindra Kadhe, Syed Zawad, Farhan Ahmed, Heiko Ludwig, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(title,title_cn);post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 本文通过对比两个开源事后训练数据集,提出了一种系统化编纂方法,生成性能更优的TuluTalk数据集,提升模型表现。

Journal ref The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25356 2026-05-15 cs.CL 93%

Prompting from the bench: Large-scale pretraining is not sufficient to prepare LLMs for ordinary meaning analysis

从bench出发的提示:大规模预训练不足以使LLM为普通意义分析做准备

Abhishek Purushothama, Junghyun Min, Brandon Waldon, Nathan Schneider

机构 * Georgetown University(乔治城大学) University of South Carolina(南卡罗来纳大学)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);pretraining(title);prompting(title);large language model(abstract)

AI总结 本文通过实验证明,LLM在法律文本的普通意义分析中存在鲁棒性不足的问题,质疑其在实际应用中的有效性。

Comments Accepted FAccT 2026; 29 pages, 14 tables, 7 figures. Previous title - Not ready for the bench: LLM legal interpretation is unstable and out of step with human judgments; NLLPW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26133 2026-05-27 cs.CL cs.AI cs.LG 93%

Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications

大型语言模型中的预训练数据暴露:成员推断、数据污染及安全影响综述

Ziyi Tong, Feifei Sun, Le Minh Nguyen

机构 * Japan Advanced Institute of Science and Technology(日本先进科学研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文首次统一综述了大型语言模型中的预训练数据暴露问题,涵盖成员推断和数据污染,形式化定义了暴露级别,回顾了攻击与防御方法,并总结了实证发现及未来研究方向。

Comments accepted by NLDB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06316 2024-06-11 cs.CL cs.AI cs.CE cs.LG 93%

Tx-LLM: A Large Language Model for Therapeutics

Juan Manuel Zambrano Chaves, Eric Wang, Tao Tu, Eeshit Dhaval Vaishnav, Byron Lee, S. Sara Mahdavi, Christopher Semturs, David Fleet, Vivek Natarajan, Shekoofeh Azizi

专题命中 预训练与数据 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10139 2026-06-17 cs.CL 版本更新 93%

TACOMORE: Exploring a replicable prompting protocol for LLM-assisted corpus analysis

TACOMORE: 探索一种可复现的提示协议用于LLM辅助语料库分析

Bingru Li, Han Wang, Nicholas Groom

机构 * Department of Linguistics and Communication, University of Birmingham(伯明翰大学语言学与传播系) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Institute of Foreign Languages and Cultures, University of Tartu(塔尔图大学外国语言与文化研究所)

专题命中 预训练与数据 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出TACOMORE框架,通过结构化提示将LLM从通用概率预测转向基于语料共现模式的推理,提升关键词、搭配和索引行分析的准确性与可复现性,但幻觉问题仍需人工验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01801 2026-04-21 cs.CL 93%

Detecting LLM-Generated Spam Reviews by Integrating Language Model Embeddings and Graph Neural Network

通过整合语言模型嵌入和图神经网络检测LLM生成的垃圾评论

Xin Liu, Rongwu Xu, Xinyi Jia, Jason Liao, Jiao Sun, Ling Huang, Wei Xu

机构 * Tsinghua University(清华大学) University of British Columbia(不列颠哥伦比亚大学) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :LLM(title,title_cn);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出FraudSquad模型,结合预训练语言模型嵌入和门控图变压器,有效检测LLM生成的垃圾评论,实验表明其在精度和召回率上优于现有方法,且模型规模小,训练数据需求低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13538 2026-05-14 cs.CL cs.AI 93%

Locale-Conditioned Few-Shot Prompting Mitigates Demonstration Regurgitation in On-Device PII Substitution with Small Language Models

基于区域条件的少样本提示缓解设备端PII替换中的演示回吐

Anuj Sadani, Deepak Kumar

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);prompting(title,abstract);SLM(abstract,abstract_cn)

AI总结 本文提出一种在设备端运行的管道,通过使用混合专家分类器和规则生成器,生成一致且类型保持的虚假值,以减少PII替换中的演示回吐问题,并在多语言数据集上验证了其有效性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16380 2026-04-21 cs.CL cs.LG 93%

Data Mixing for Large Language Models Pretraining: A Survey and Outlook

大型语言模型预训练中的数据混合:综述与展望

Zhuo Chen, Yuxuan Miao, Supryadi, Deyi Xiong

机构 * The International Joint Institute of Tianjin University(天津大学国际联合研究院) Tianjin University(天津大学) TJUNLP Lab, School of Computer Science and Technology(天津大学自然语言处理实验室,计算机科学与技术学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文综述了大型语言模型预训练中的数据混合方法,分析了静态与动态混合的分类及其性能成本权衡,指出领域迁移性、评估标准不统一等挑战,并提出未来研究方向。

Comments 41 pages, 4 figures, 1 table

Journal ref Data Intelligence 8 (2026), Art. No. 2026r01

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16363 2025-05-23 cs.LG cs.AI stat.ML 93%

AdamS: Momentum Itself Can Be A Normalizer for LLM Pretraining and Post-training

Huishuai Zhang, Bohan Wang, Luoxin Chen

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所) University of Science and Technology of China(中国科学技术大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);post-training(title,abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05291 2026-05-01 cs.CL cs.AI cs.LG 93%

Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining

时间交叉编码:在LLM预训练过程中追踪语言表示的出现与巩固

Deniz Bayazit, Aaron Mueller, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院) Boston University(波士顿大学)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 通过稀疏交叉编码器追踪LLM预训练中语言表示的演变,引入RelIE指标分析特征对任务性能的因果影响,实现对表示学习的可解释性分析。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21218 2026-06-10 cs.CL 版本更新 93%

Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data

参数化知识并非全部:通过检索预训练数据实现诚实的语言模型

Christopher Adrian Kusuma, Muhammad Reza Qorib, Hwee Tou Ng

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对大语言模型在知识不足时产生幻觉的问题,提出利用公开预训练数据构建更鲁棒的诚实性评估基准,并设计检索预训练数据的方法提升模型诚实性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12382 2026-05-13 cs.CL 93%

Pretraining Exposure Explains Popularity Judgments in Large Language Models

预训练暴露解释了大型语言模型中的流行度判断

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究通过分析预训练数据中的暴露统计,发现大型语言模型对流行实体的偏好主要受预训练暴露影响,而非外部流行度信号,揭示了数据暴露在驱动流行度偏差中的核心作用。

Comments Accepted at SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05875 2026-04-08 cs.AI 93%

Joint Knowledge Base Completion and Question Answering by Combining Large Language Models and Small Language Models

通过结合大语言模型和小语言模型实现知识库补全与问答的联合处理

Yinan Liu, Dongying Lin, Sigang Luo, Xiaochun Yang, Bin Wang

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,沈阳,中国) National Frontiers Science Center for Industrial Intelligence and Systems optimization, Northeastern University, Shenyang, China(东北大学工业智能与系统优化国家级前沿科学中心,沈阳,中国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);small language model(title,abstract);LLM(abstract)

AI总结 本文提出JCQL框架,结合大语言模型与小语言模型,通过迭代增强知识库补全与问答任务,提升两者性能。

Comments 20 pages, 11 figures

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21631 2026-06-23 cs.CL cs.LG 新提交 93%

CuratorKIT : Data Curation and Synthetic Data Generation for LLM Post-Training

CuratorKIT:用于LLM后训练的数据策展与合成数据生成

Soham Bhattacharjee, Karun Sharma, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs(Lexsi实验室)

专题命中 预训练与数据 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出开源库CuratorKIT,集成数据摄取、去重、合成生成和质量过滤的全生命周期,通过可配置管道和可审计的样本溯源链提升后训练数据管道的透明度和可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10486 2026-06-05 cs.AI cs.CL 93%

IDEAL: Leveraging Infinite and Dynamic Characterizations of Large Language Models for Query-focused Summarization

IDEAL: 利用大型语言模型的无限和动态特性进行查询导向的摘要

Jie Cao, Dian Jiao, Yang Dai, Rolan Yan, Wenqiao Zhang, Siliang Tang

机构 * Zhejiang University(浙江大学) Tencent, Wechat(腾讯,微信)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 本文针对查询导向摘要问题,提出两种核心方法:高效细粒度查询-LLM对齐和长文档摘要,通过Query-aware HyperExpert和Query-focused Infini-attention模块实现,实验验证了方法的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05308 2026-06-02 cs.CL cs.AI 93%

Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution

Med-V1:用于零样本和可扩展生物医学证据归因的小型语言模型

Qiao Jin, Yin Fang, Lauren He, Yifan Yang, Guangzhi Xiong, Zhizheng Wang, Nicholas Wan, Joey Chan, Donald C. Comeau, Robert Leaman, Charalampos S. Floudas, Aidong Zhang, Michael F. Chiang, Yifan Peng, Zhiyong Lu

机构 * Division of Intramural Research, National Library of Medicine, National Institutes of Health(国家医学图书馆内部研究部,国立卫生研究院) Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系) Center for Cancer Research, National Cancer Institute, National Institutes of Health(国家癌症研究所癌症研究中心,国立卫生研究院) Department of Population Health Sciences, Weill Cornell Medicine Institute of AI for Digital Health, Weill Cornell Medicine(韦尔·科恩医学中心流行病学与健康科学系,韦尔·科恩医学中心人工智能与数字健康研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 提出仅3B参数的小语言模型Med-V1,通过高质量合成数据训练,在生物医学证据归因任务上性能媲美GPT-5等前沿大模型,并用于量化LLM幻觉和识别临床指南中的证据错误归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13329 2026-05-14 cs.CL cs.AI 93%

Tracing Persona Vectors Through LLM Pretraining

通过LLM预训练追溯人格向量

Viktor Moskvoretskii, Dominik Glandorf, Jorge Medina Moreira, Tanja Käser, Robert West

机构 * EPFL(苏黎世联邦理工学院)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究LLM预训练中人格向量的形成机制,发现其在早期阶段就形成并持续优化,为模型安全性和可控性提供新视角。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26404 2026-04-15 cs.CR cs.AI cs.CL 93%

SeedPrints: Fingerprints Can Even Tell Which Seed Your Large Language Model Was Trained From

SeedPrints: 指纹甚至能告诉你是哪种种子训练了你的大型语言模型

Yao Tong, Haonan Wang, Siquan Li, Kenji Kawaguchi, Tianyang Hu

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 本文提出SeedPrints方法,通过随机初始化偏倚实现LLM的内在指纹识别,解决了传统指纹方法在大规模预训练阶段可靠性不足的问题,实现了从初始化到全生命周期的身份验证。

Comments Accepted to ICLR 2026. The code repository linked on OpenReview is outdated; the latest code is available via the final arXiv version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25149 2026-03-06 cs.CL cs.AI cs.LG 93%

Pretraining Large Language Models with NVFP4

用NVFP4预训练大语言模型

NVIDIA, Felix Abecassis, Anjulie Agrusa, Dong Ahn, Jonah Alben, Stefania Alborghetti, Michael Andersch, Sivakumar Arayandi, Alexis Bjorlin, Aaron Blakeman, Evan Briones, Ian Buck, Bryan Catanzaro, Muya Chang, Jinhang Choi, Mike Chrzanowski, Eric Chung, Victor Cui, Steve Dai, Bita Darvish Rouhani, Carlo del Mundo, Deena Donia, Burc Eryilmaz, Henry Estela, Abhinav Goel, Oleg Goncharov, Yugi Guvvala, Robert Hesse, Russell Hewett, Herbert Hum, Ujval Kapasi, Brucek Khailany, Mikail Khona, Nick Knight, Alex Kondratenko, Ronny Krashinsky, Ben Lanir, Simon Layton, Michael Lightstone, Daniel Lo, Paulius Micikevicius, Asit Mishra, Tim Moon, Deepak Narayanan, Chao Ni, Abhijit Paithankar, Satish Pasumarthi, Ankit Patel, Mostofa Patwary, Ashwin Poojary, Gargi Prasad, Sweta Priyadarshi, Yigong Qin, Xiaowei Ren, Oleg Rybakov, Charbel Sakr, Sanjeev Satheesh, Stas Sergienko, Pasha Shamis, Kirthi Shankar, Nishant Sharma, Mohammad Shoeybi, Michael Siu, Misha Smelyanskiy, Darko Stosic, Dusan Stosic, Bor-Yiing Su, Frank Sun, Nima Tajbakhsh, Shelby Thomas, Przemek Tredak, Evgeny Tsykunov, Gandhi Vaithilingam, Aditya Vavre, Rangharajan Venkatesan, Roger Waleffe, Qiyu Wan, Hexin Wang, Mengdi Wang, Lizzie Wei, Hao Wu, Evan Wu, Keith Wyss, Ning Xu, Jinze Xue, Charlene Yang, Yujia Zhai, Ruoxi Zhang, Jingyang Zhu, Zhongbo Zhu

机构 * NVIDIA

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

AI总结 本研究提出了一种基于NVFP4的预训练方法,通过整合随机哈达玛变换、二维量化方案和随机舍入等技术,实现稳定且高效的大型语言模型训练。

Comments Update includes: (1) fixing a typo in eq. 2 (2) updating author list, and (3) adding a related work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22961 2026-03-03 eess.AS 93%

Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models

为统一多模态语音识别适应语音基础模型与大语言模型

Jing-Xuan Zhang, Genshun Wan, Jin Li, Jianqing Gao, Duo Zhao, Zhen-Hua Ling

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);foundation model(title,abstract);LLM(abstract)

AI总结 本文提出UASR-LLM框架,通过大语言模型与语音基础模型结合,实现多模态语音识别的统一优化与性能提升。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏