arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138434 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2602.07425 2026-05-11 cs.LG cs.CL math.OC 85%

Sign-Based Optimizers Are Effective Under Heavy-Tailed Noise

基于符号的优化器在重尾噪声下表现有效

Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun Zhang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Software Technology, Zhejiang University(浙江大学软件学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了在重尾梯度噪声下,基于符号的优化器如SignSGD和Lion相较于传统自适应方法的优越性,通过理论分析和实验验证,证明其在处理重尾噪声时的高效性。

Comments Code is available at https://github.com/Dingzhen230/Heavy-tailed-Noise-in-LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08750 2026-05-08 cs.LG cs.CL 85%

Exploring Cross-Client Memorization of Training Data in Large Language Models for Federated Learning

探索联邦学习中大语言模型训练数据的跨客户端记忆化

Tinnakit Udsa, Can Udomcharoenchaikit, Patomporn Payoungkhamdee, Sarana Nutanong, Norrathep Rattanavipanon

机构 * School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC) College of Computing, Prince of Songkla University(颂克拉大学计算机学院)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.LG

AI总结 本文研究联邦学习中大语言模型训练数据的记忆化问题,提出跨客户端记忆化测量框架,分析客户端间与客户端内记忆化差异及影响因素。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25015 2026-03-27 cs.CL cs.AI cs.SE 85%

Imperative Interference: Social Register Shapes Instruction Topology in Large Language Models

命令干扰:社会语体影响大语言模型中的指令拓扑

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究探讨了社会语体如何影响大语言模型中指令拓扑,通过多语言实验发现指令拓扑反转由社会语体调解,改写指令可减少跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13900 2026-03-06 cs.CL cs.AI 85%

Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences

细粒度微调在激活差异中留下明显可读的痕迹

Julian Minder, Clément Dumas, Stewart Slocum, Helena Casademunt, Cameron Holmes, Robert West, Neel Nanda

机构 * EPFL(苏黎世联邦理工学院) Ecole Normale Supérieure Paris-Saclay(巴黎-萨克雷高等师范学校) Université Paris-Saclay(巴黎-萨克雷大学) Harvard University(哈佛大学) MATS

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究发现狭窄微调会在激活中留下明显痕迹,揭示了微调领域偏见,并警告了使用此类模型进行广泛微调研究的局限性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03543 2026-03-05 cs.CL cs.AI 85%

Tucano 2 Cool: Better Open Source LLMs for Portuguese

Tucano 2 Cool: 更好的开源葡萄牙语大语言模型

Nicholas Kluge Corrêa, Aniket Sen, Shiza Fatimah, Sophia Falk, Lennard Landgraf, Julia Kastner, Lucie Flek

机构 * Bonn-Aachen International Center for Information Technology (b-it) / CAISA Lab(波恩-亚琛国际信息科技中心(b-it)/ CAISA实验室) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Center for Science and Thought(科学与思想研究中心) Helmholtz-Institut für Strahlen- und Kernphysik(亥姆霍兹辐射与核物理研究所) Bonn Sustainable AI Lab(波恩可持续AI实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 Tucano 2推出了一系列开源葡萄牙语大语言模型,通过扩展数据集和改进训练方法,实现了在多种语言任务上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05578 2025-12-15 cs.LG cs.CL cs.CR 85%

The Landscape of Memorization in LLMs: Mechanisms, Measurement, and Mitigation

LLM记忆景观:机制、测量与缓解

Alexander Xiong, Xuandong Zhao, Aneesh Pappu, Dawn Song

机构 * UC Berkeley(伯克利大学) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了LLM记忆现象的机制、测量方法及缓解策略,探讨了影响记忆的因素和检测技术,并分析了其法律伦理影响及缓解措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03307 2025-12-04 cs.LG cs.AI 85%

Robust Tabular Foundation Models

鲁棒表格基础模型

Matthew Peroni, Franck Le, Vadim Sheinin

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出鲁棒表格基础模型(RTFM),通过参数化生成器分布实现对抗鲁棒性,提升表格基础模型的基准性能。

Comments Shaping Responsible Synthetic Data in the Era of Foundation Models, AAAI 2026

Journal ref Shaping Responsible Synthetic Data in the Era of Foundation Models, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21864 2025-10-28 cs.CL cs.AI 85%

DeepOmni: Towards Seamless and Smart Speech Interaction with Adaptive Modality-Specific MoE

Hang Shao, Heting Gao, Yunhang Shen, Jiawei Chen, Zuwei Long, Dong Yang, Ke Li, Xing Sun

机构 * Tencent(腾讯) Fudan University(复旦大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);SLM(abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04482 2025-09-09 cs.CL cs.AI 85%

Energy Landscapes Enable Reliable Abstention in Retrieval-Augmented Large Language Models for Healthcare

Ravi Shankar, Sheng Wong, Lin Li, Magdalena Bachmann, Alex Silverthorne, Beth Albert, Gabriel Davis Jones

机构 * Oxford Digital Health Labs(牛津数字健康实验室) Nuffield Department of Women’s and Reproductive Health(妇女与生殖健康尼富尔德部门) University of Oxford(牛津大学) OATML Department of Computer Science(计算机科学系)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18499 2025-08-20 cs.LG cs.AI stat.ML 85%

G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning

Xiaojun Guo, Ang Li, Yifei Wang, Stefanie Jegelka, Yisen Wang

机构 * Peking University(北京大学) MIT(麻省理工学院) TUM(慕尼黑工业大学) School of CIT, MCML, MDSIEECS and CSAIL(计算机学院、MCML、MDSIEECS和CSAIL)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21676 2025-07-25 cs.CL cs.LG 85%

How do language models learn facts? Dynamics, curricula and hallucinations

Nicolas Zucchet, Jörg Bornschein, Stephanie Chan, Andrew Lampinen, Razvan Pascanu, Soham De

机构 * ETH Zürich(苏黎世联邦理工学院) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments Accepted at the 2nd Conference on Language Modeling (2025)

Journal ref Conference on Language Modeling (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16900 2025-06-10 cs.CL cs.LG 85%

Power-Law Decay Loss for Large Language Model Finetuning: A Theory Perspective

Jintian Shao

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.LG

Comments Short of sufficient experiments and references

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02924 2025-06-04 cs.CL cs.IR cs.LG 85%

INESC-ID @ eRisk 2025: Exploring Fine-Tuned, Similarity-Based, and Prompt-Based Approaches to Depression Symptom Identification

Diogo A. P. Nunes, Eugénio Ribeiro

机构 * INESC-ID Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术学院) Instituto Universitário de Lisboa (ISCTE-IUL)(里斯本大学学院(ISCTE-IUL))

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments 12 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18755 2024-12-02 cs.LG cs.CL cs.CR 85%

Cyber-Attack Technique Classification Using Two-Stage Trained Large Language Models

Weiqiu You, Youngja Park

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18443 2024-10-07 cs.CL cs.AI cs.IR q-bio.QM 85%

BMRetriever: Tuning Large Language Models as Better Biomedical Text Retrievers

Ran Xu, Wenqi Shi, Yue Yu, Yuchen Zhuang, Yanqiao Zhu, May D. Wang, Joyce C. Ho, Chao Zhang, Carl Yang

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2024. The model and data are uploaded to \url{https://github.com/ritaranx/BMRetriever}

Journal ref EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16553 2024-08-28 cs.CL cs.AI 85%

SelectLLM: Can LLMs Select Important Instructions to Annotate?

Ritik Sachin Parkar, Jaehyung Kim, Jong Inn Park, Dongyeop Kang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments First Authors: Ritik Sachin Parkar and Jaehyung Kim | Second Author: Jong Inn Park | PI: Dongyeop Kang

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06484 2024-08-14 cs.CL cs.AI 85%

Cross-Lingual Conversational Speech Summarization with Large Language Models

Max Nelson, Shannon Wotherspoon, Francis Keith, William Hartmann, Matthew Snover

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07969 2024-03-15 cs.LG cs.AI 85%

KnowCoder: Coding Structured Knowledge into LLMs for Universal Information Extraction

Zixuan Li, Yutao Zeng, Yuxin Zuo, Weicheng Ren, Wenxuan Liu, Miao Su, Yucan Guo, Yantao Liu, Xiang Li, Zhilei Hu, Long Bai, Wei Li, Yidan Liu, Pan Yang, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06139 2024-03-12 cs.CL cs.AI 85%

Fine-grainedly Synthesize Streaming Data Based On Large Language Models With Graph Structure Understanding For Data Sparsity

Xin Zhang, Linhai Zhang, Deyu Zhou, Guoqiang Xu

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12060 2024-01-29 cs.CL cs.AI 85%

FlexKBQA: A Flexible LLM-Powered Framework for Few-Shot Knowledge Base Question Answering

Zhenyu Li, Sunqi Fan, Yu Gu, Xiuxing Li, Zhichao Duan, Bowen Dong, Ning Liu, Jianyong Wang

专题命中 预训练与数据 :LLM(title);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

Comments Accepted as AAAI-24 Oral paper; Knowledge Base Question Answering; Large Language Model; Data Generation; Few-Shot & Zero-Shot

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01055 2024-01-15 cs.CL cs.AI 85%

LLaMA Beyond English: An Empirical Study on Language Capability Transfer

Jun Zhao, Zhihao Zhang, Luhui Gao, Qi Zhang, Tao Gui, Xuanjing Huang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16832 2023-11-29 cs.CL cs.AI 85%

CharacterGLM: Customizing Chinese Conversational AI Characters with Large Language Models

Jinfeng Zhou, Zhuang Chen, Dazhen Wan, Bosi Wen, Yi Song, Jifan Yu, Yongkang Huang, Libiao Peng, Jiaming Yang, Xiyao Xiao, Sahand Sabour, Xiaohan Zhang, Wenjing Hou, Yijia Zhang, Yuxiao Dong, Jie Tang, Minlie Huang

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.02540 2020-07-07 cs.CL cs.AI 85%

LMVE at SemEval-2020 Task 4: Commonsense Validation and Explanation using Pretraining Language Model

Shilei Liu, Yu Guo, Bochao Li, Feiliang Ren

专题命中 预训练与数据 :language model(title);pretraining(title);分类 cs.CL、cs.AI

Comments Accepted in SemEval2020. 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15875 2026-08-18 cs.RO 新提交 85%

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

GigaBrain-0.7:采用三系统架构扩展具身基础模型以获得涌现能力

GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 研究针对VLA模型泛化不足问题,提出三系统架构的GigaBrain-0.7具身基础模型,扩展至37000小时异质具身数据,实现零样本等能力显著提升,将开源代码与权重。

Comments https://gigaai.cc/blog/gigabrain07

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13482 2026-08-14 cs.LG cs.AI cs.CL 新提交 85%

Synthetic Persona Pretraining: Alignment from Token Zero

合成角色预训练:从零开始的对齐

Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West

机构 * EPFL(洛桑联邦理工学院) University of Toronto(多伦多大学) Northeastern University(东北大学) SJTU(上海交通大学) Saarland University(萨尔大学) Hereon(亥姆霍兹极地与海洋研究中心) TUHH(汉堡工业大学) Ontocord AI(Ontocord人工智能公司) TUC(德累斯顿工业大学) DFKI(德国人工智能研究中心)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出合成角色预训练(SPP),在预训练token零阶段植入助手角色,通过标注反思、预训练及角色绑定,提升模型价值构成遵循度与鲁棒性,降低对齐错误率,证明预训练时角色干预是对齐的有效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00715 2026-08-11 cs.CL cs.AI cs.LG 版本更新 85%

To Memorize or to Retrieve: Scaling the Interaction Between Pretraining and Retrieval

记忆还是检索:考虑RAG的缩放规律

Karan Singh, Michael Yu, Varun Gangal, Zhuofu Tao, Sachin Kumar, Emmy Liu, Steven Y. Feng

机构 * Stanford University(斯坦福大学) Independent Researcher(独立研究员) Patronus AI The Ohio State University(俄亥俄州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了预训练知识与检索知识的平衡,提出三维缩放框架,揭示在不同模型规模和任务类型下检索的边际效用,为语言模型设计提供数据资源分配指导。

Comments Code available at https://github.com/DegenAI-Labs/RAG-Scaling-Laws

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03930 2026-08-05 cs.CL cs.AI cs.LG 新提交 85%

Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition and Compressibility

语言之前的逻辑:基于形式推导的预预训练可促进技能获取与可压缩性

Jo-Ku Cheng, Nikolaos Aletras, Marco Valentino

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出Logic-PPT策略,通过形式推导预预训练语言模型,可加速技能获取、提升性能,还能增强模型可压缩性,在少用36B token时达80%准确率,33%稀疏度下匹配密集基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11562 2026-07-14 cs.CV 新提交 85%

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

MonkeyOCRv2:用于文档人工智能的视觉-文本基础模型

Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Kingsoft Office(金山办公软件)

专题命中 预训练与数据 :foundation model(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究针对主流视觉编码器难以应用于文档图像的问题,提出MonkeyOCRv2模型。通过构建大型文档图像预训练语料库及采用联合预训练策略,在多个文档分析任务中提升性能,并验证其作为视觉编码器在文档解析和理解任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10277 2026-07-14 cs.SE 新提交 85%

From Business Requirements to Test Assertions: Evaluating LLM-Generated Oracles on Real Bugs

从业务需求到测试断言:评估大语言模型生成的预言机在实际错误上的表现

Tiancheng Ma, Nasir U. Eisty

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究大语言模型能否从自然语言业务需求生成测试预言机,提出基于Defects4J的流程,对10个实际错误进行实验,评估预言机在与需求衍生预言机及被测系统一致性上表现,发现大语言模型有泛化但存在差异,为后续研究提供可行性参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30944 2026-07-01 eess.AS cs.SD 新提交 85%

Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation

保留语音到文本LLM能力的语音到语音生成

Yuxuan Hu, Heng Lu, Ruchao Fan, Yao Qian, Xiaofei Wang, Jian Xue, Heming Wang, Shuohang Wang, Young Jin Kim, Yelong Shen, Jinyu Li

机构 * Microsoft(微软)

专题命中 预训练与数据 :LLM(title,title_cn)

AI总结 提出PRIME-Speech框架,通过冻结骨干网络并仅训练语音生成模块,在保持语音到文本性能的同时实现高质量语音到语音转换,支持多轮对话。

详情

展开后加载摘要…

URL PDF HTML 收藏