arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138237 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12353 篇

2510.14466 2026-05-19 cs.CL cs.AI 88%

Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages

迈向低资源语言LLM鲁棒多语言适应

Haolin Li, Haipeng Zhang, Mang Li, Yaohua Wang, Lijie Wen, Yu Zhang, Biqing Huang

机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Alibaba International Digital Commerce Group, Beijing, China(阿里巴巴国际数字 commerce 集团) School of Software, Tsinghua University, Beijing, China(清华大学软件学院)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LiRA框架,通过轻量级微调实现低资源语言LLM的鲁棒多语言适应,结合Arca和LaSR组件提升跨语言语义一致性与表示稳定性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17656 2026-05-11 q-bio.QM cs.AI cs.LG 88%

Pretraining a Foundation Model for Small-Molecule Natural Products

为小分子天然产物预训练一个基础模型

Yuheng Ding, Bo Qiang, Shaoning Li, Yiran Zhou, Jie Yu, Qi Li, Cheng Shi, Liangren Zhang, Yusong Wang, Nanning Zheng, Zhenming Liu

机构 * State Key Laboratory of Natural and Biomimetic Drugs(天然与仿生药物国家重点实验室) School of Pharmaceutical Sciences, Peking University(北京大学药学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于天然产物独特性质的预训练基础模型,通过对比学习和掩码图学习目标,提升分子骨架和侧链信息的表征能力,在天然产物挖掘和药物发现任务中取得SOTA成果。

Comments Accepted by Nature Machine Intelligence(2026)

Journal ref Nature Machine Intelligence(2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18381 2026-04-21 cs.AI cs.LG 88%

Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes

在数据较少的情况下:评估RLVR在低数据和计算环境下的有效性

Justin Bauer, Thomas Walshe, Derek Pham, Harit Vishwakarma, Armin Parchami, Frederic Sala, Paroma Varma

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了在低数据和计算资源下,RLVR对小型语言模型性能的影响,发现混合复杂度数据集能显著提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04799 2026-04-17 cs.CL cs.AI 88%

DA-Cramming: Enhancing Cost-Effective Language Model Pretraining with Dependency Agreement Integration

DA-Cramming:通过依赖协议整合提升高效语言模型预训练

Martin Kuo, Jianyi Zhang, Dongting Li, Yiran Chen

机构 * Center for Computational Evolutionary Intelligence, Duke University(计算进化智能中心,杜克大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DA-Cramming框架,通过整合依赖协议信息提升语言模型预训练效果,采用双阶段流程和四个专用子模型捕捉依赖协议并生成嵌入,实验证明其在多种任务上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16370 2026-03-26 cs.CL cs.AI 88%

Can structural correspondences ground real world representational content in Large Language Models?

结构对应能否在大语言模型中 grounding 现实世界表征内容?

Iwan Williams

机构 * Centre for Philosophy of AI, University of Copenhagen(人工智能哲学中心,哥本哈根大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨大语言模型是否能表征现实世界,提出结构对应理论,并指出需克服文本局限性以实现真实世界内容的 grounding。

Journal ref Mind & Language (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05598 2026-03-13 cs.LG astro-ph.IM cs.AI physics.comp-ph 88%

On the Value of Tokeniser Pretraining in Physics Foundation Models

在物理基础模型中tokenizer预训练的价值

Hadi Sotoudeh, Payel Mukhopadhyay, Ruben Ohana, Michael McCabe, Neil D. Lawrence, Shirley Ho, Miles Cranmer

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在物理基础模型中预训练tokenizer对准确性和效率的影响,发现领域内预训练可显著提升模拟性能,并引入灵活的时空压缩操作以适应多样化的下游任务。

Comments 16 pages, 4 figures. Workshop paper at ICLR 2026 AI & PDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09437 2026-03-10 cs.LG cs.AI 88%

Diffusion-Guided Pretraining for Brain Graph Foundation Models

基于扩散的脑图基础模型预训练

Xinxu Wei, Rong Zhou, Lifang He, Yu Zhang

机构 * Department of Electrical and Computer Engineering, Lehigh University, Bethlehem, PA, USA(电气与计算机工程系,莱维大学) Department of Computer Science and Engineering, Lehigh University, Bethlehem, PA, USA(计算机科学与工程系,莱维大学) Department of Psychiatry and Behavioral Sciences, Stanford University School of Medicine, Stanford, CA, USA(精神病学与行为科学系,斯坦福大学医学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于扩散的预训练框架,通过结构感知的掩码策略和拓扑感知的图级读出,提升脑图表示的鲁棒性和有效性。

Comments Paper has some mistakes

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01348 2026-03-03 cs.LG cs.AI 88%

UTICA: Multi-Objective Self-Distllation Foundation Model Pretraining for Time Series Classification

UTICA:面向时间序列分类的多目标自蒸馏基础模型预训练

Yessin Moakher, Youssef Attia El Hili, Vasilii Feofanov

机构 * Ecole Polytechnique(巴黎高等师范学院) Huawei Noah’s Ark Lab(华为诺亚实验室) com(42.com)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 UTICA通过自蒸馏方法在时间序列分类中实现最先进的性能,结合增强裁剪和块掩码技术,提升模型对时间和局部结构的表征能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19548 2026-02-24 cs.CL cs.LG 88%

Beyond a Single Extractor: Re-thinking HTML-to-Text Extraction for LLM Pretraining

超越单一提取器:重新思考用于LLM预训练的HTML到文本提取

Jeffrey Li, Josh Gardner, Doug Kang, Fangping Shi, Karanjeet Singh, Chun-Liang Li, Herumb Shandilya, David Hall, Oncel Tuzel, Percy Liang, Ludwig Schmidt, Hadi Pour Ansari, Fartash Faghri

机构 * Apple(苹果公司) Stanford(斯坦福大学) University of Washington(华盛顿大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过结合多种提取器提升HTML到文本提取的效率与效果,显著提高LLM预训练数据的token产出并改善下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05495 2026-02-24 cs.CL cs.AI 88%

Transport and Merge: Cross-Architecture Merging for Large Language Models

传输与合并:面向大语言模型的跨架构合并

Chenhang Cui, Binyun Yang, Fei Shen, Yuxin Chen, Jingnan Zheng, Xiang Wang, An Zhang, Tat-Seng Chua

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于最优传输的跨架构合并框架,实现从高资源模型到低资源模型的有效知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18200 2026-01-27 cs.LG cs.AI 88%

HeterCSI: Channel-Adaptive Heterogeneous CSI Pretraining Framework for Generalized Wireless Foundation Models

HeterCSI:面向通用无线基础模型的通道自适应异构CSI预训练框架

Chenyu Zhang, Xinchen Lyu, Chenshan Ren, Shuhan Liu, Qimei Cui, Xiaofeng Tao

机构 * National Engineering Research Center for Mobile Network Technologies, Beijing University of Posts and Telecommunications(中国移动网络技术国家工程研究中心,北京邮电大学) Department of Broadband Communication, Pengcheng Laboratory(宽带通信系,鹏城实验室) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(民族语言智能分析与安全治理重点实验室,中央民族大学) China Telecom Corporation Limited Gansu Branch(中国电信集团甘肃分公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 HeterCSI通过解决CSI尺度异质性和场景多样性问题,提出一种通道自适应的异构CSI预训练框架,提升无线基础模型的泛化能力和效率。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14160 2026-01-21 cs.CL cs.AI 88%

Domain-Adaptation through Synthetic Data: Fine-Tuning Large Language Models for German Law

通过合成数据实现领域适应:通过合成数据微调大型语言模型进行德国法律问答

Ali Hamza Bashir, Muhammad Rehan Khalid, Kostadin Cvejoski, Jana Birr, Jule Berghaus, Armin Berger, Sandra Halscheidt, Christian Temath, Rafet Sifa, David Berghaus

机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) Georg-August-University Göttingen(哥廷根乔治-亚历山大大学) Lamarr Institute(拉马尔研究所) University of Bonn(波恩大学) JetBrains Research(JetBrains研究)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过合成数据生成方法微调大型语言模型,提升其在德国法律问答任务中的性能,展示合成数据在替代人工标注方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05184 2026-01-09 cs.AI cs.CL 88%

Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop

大语言模型自我消耗表现性循环中的观测与对策

Yaxuan Wang, Zhongteng Cai, Yujia Bao, Xueru Zhang, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) The Ohio State University(俄亥俄州立大学) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出自我消耗表现性循环(SCPL)概念,通过实验发现表现性循环会增加偏好偏见并降低差异偏见,设计奖励拒绝采样策略以缓解偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12608 2025-12-23 cs.CL cs.AI 88%

Human-Inspired Learning for Large Language Models via Obvious Record and Maximum-Entropy Method Discovery

通过明显记录和最大熵方法发现实现大语言模型的人类启发式学习

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(计算机科学学院,成都信息科技学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种人类启发式学习框架,通过明显记录和最大熵方法发现,提升大语言模型在罕见场景下的学习能力和方法多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14887 2025-12-18 cs.CL cs.AI cs.IR 88%

Integrating Large Language Models and Knowledge Graphs to Capture Political Viewpoints in News Media

将大型语言模型与知识图谱结合以捕捉新闻媒体中的政治观点

Massimiliano Fadda, Enrico Motta, Francesco Osborne, Diego Reforgiato Recupero, Angelo Salatino

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大型语言模型和知识图谱结合的方法,提升新闻媒体中政治观点的识别与分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21265 2025-12-03 cs.CL cs.AI 88%

Multilingual Pretraining for Pixel Language Models

多语言预训练用于像素语言模型

Ilker Kesen, Jonas F. Lotz, Ingo Ziegler, Phillip Rust, Desmond Elliott

机构 * Department of Computer Science, University of Copenhagen(计算机科学系,哥本哈根大学) ROCKWOOL Foundation Research Unit(ROCKWOOL基金会研究单位)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

AI总结 PIXEL-M4通过多语言预训练提升了像素语言模型对多种语言的支持能力,尤其在非拉丁字母语言中表现更优。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06031 2025-11-18 q-fin.ST cs.CL cs.LG q-fin.TR 88%

FinGPT: Open-Source Financial Large Language Models

Hongyang Yang, Xiao-Yang Liu, Christina Dan Wang

机构 * AI4Finance Foundation(AI4Finance基金会) Columbia University(哥伦比亚大学) New York University Shanghai(纽约大学上海)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted by the FinLLM Symposium at IJCAI 2023. Recipient of the Best Presentation Award (Hongyang Yang). Workshop link: https://finllm.github.io/workshop. This is the first official FinGPT paper; please cite this work when referencing FinGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02494 2025-10-22 cs.LG cs.CL 88%

Analyzing Similarity Metrics for Data Selection for Language Model Pretraining

Dylan Sam, Ayan Chakrabarti, Afshin Rostamizadeh, Srikumar Ramalingam, Gui Citovsky, Sanjiv Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Google Research(谷歌研究)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10085 2025-10-14 cs.CR cs.AI cs.LG 88%

Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning

Guozhi Liu, Qi Mu, Tiansheng Huang, Xinhua Wang, Li Shen, Weiwei Lin, Zhang Li

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Computer Science at Georgia Institute of Technology(佐治亚理工学院计算机科学系) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院) Second Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第二附属医院) China and Pengcheng Laboratory(中 Pengcheng 实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03781 2025-10-07 cs.CL cs.AI 88%

Rezwan: Leveraging Large Language Models for Comprehensive Hadith Text Processing: A 1.2M Corpus Development

Majid Asgari-Bidhendi, Muhammad Amin Ghaseminia, Alireza Shahbazi, Sayyed Ali Hossayni, Najmeh Torabian, Behrouz Minaei-Bidgoli

机构 * Noor Avaran Jelvehaye Maanaei Najm Co.(诺尔·阿瓦兰·贾尔韦哈耶·马纳埃尼纳姆公司) Iran University of Science and Technology(伊朗科学技术大学) Islamic Azad University(伊斯兰 Azad 大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00125 2025-10-02 cs.CL cs.AI cs.CR 88%

Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning

Hong kyu Lee, Ruixuan Liu, Li Xiong

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14438 2025-09-19 cs.CL cs.AI 88%

Simulating a Bias Mitigation Scenario in Large Language Models

Kiana Kiashemshaki, Mohammad Jalili Torkamani, Negin Mahmoudi, Meysam Shirdel Bilehsavar

机构 * Department of Computer Science, Bowling Green State University(计算机科学系,布恩维尔州立大学) School of Computing, University of Nebraska–Lincoln(计算学院,内布拉斯加-林肯大学) Department of Civil, Environmental, and Ocean Engineering, Stevens Institute of Technology(土木、环境与海洋工程系,史蒂文斯理工学院) Department of Computer Science, University of South Carolina(计算机科学系,南卡罗来纳大学) Artificial Intelligence Institute, University of South Carolina(人工智能研究院,南卡罗来纳大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments preprint, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12443 2025-09-19 cs.CR cs.AI cs.LG 88%

Reconstruction of Differentially Private Text Sanitization via Large Language Models

Shuchao Pang, Zhigang Lu, Haichen Wang, Peng Fu, Yongbin Zhou, Minhui Xue

机构 * Nanjing University of Science and Technology(南京理工大学) Western Sydney University(西澳大学) Institute of Information Engineering(信息工程研究所) Chinese Academy of Sciences(中国科学院) Adelaide University(阿德莱德大学) Responsible AI Research (RAIR) Centre, The University of Adelaide(负责任人工智能研究中心,阿德莱德大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments RAID-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00979 2025-09-16 cs.CL cs.AI 88%

Synthesize-on-Graph: Knowledgeable Synthetic Data Generation for Continue Pre-training of Large Language Models

Shengjie Ma, Xuhui Jiang, Chengjin Xu, Cehao Yang, Liyu Zhang, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) IDEA Research, International Digital Economy Academy(IDEA研究所、国际数字经济学院) Gaoling School of Artificial Intelligence, Renmin University of China(法律人工智能学院,中国人民大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00053 2025-09-03 cs.MM cs.AI cs.CL 88%

Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?

Shuo Liu, Di Yao, Yan Lin, Gao Cong, Jingping Bi

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Computer Science, Aalborg University(奥胡斯大学计算机科学系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10024 2025-08-22 cs.CR cs.AI cs.CL 88%

Private Memorization Editing: Turning Memorization into a Defense to Strengthen Data Privacy in Large Language Models

Elena Sofia Ruzzetti, Giancarlo A. Xompero, Davide Venditti, Fabio Massimo Zanzotto

机构 * Human Centric ART, University of Rome Tor Vergata(罗马托尔维加塔大学人本艺术研究中心) Almawave S.p.A.(阿尔马韦斯公司)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments To be published at ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02532 2025-08-05 cs.CL cs.LG 88%

Contextual Graph Transformer: A Small Language Model for Enhanced Engineering Document Information Extraction

Karan Reddy, Mayukha Pal

专题命中 预训练与数据 :language model(title,abstract);small language model(title);pretraining(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15740 2025-07-17 cs.CL cs.CR cs.IR cs.LG 88%

Protecting Copyrighted Material with Unique Identifiers in Large Language Model Training

Shuai Zhao, Linchao Zhu, Ruijie Quan, Yi Yang

机构 * ReLER Lab, AAII, University of Technology Sydney(ReLER实验室,AAII,悉尼大学) ReLER Lab, CCAI, Zhejiang University(ReLER实验室,CCAI,浙江大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments A technical report, work mainly done in the early of 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10300 2025-07-15 cs.CV cs.AI cs.CL 88%

FaceLLM: A Multimodal Large Language Model for Face Understanding

Hatef Otroshi Shahreza, Sébastien Marcel

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted in ICCV 2025 workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06138 2025-07-09 cs.CL cs.AI 88%

Coding Triangle: How Does Large Language Model Understand Code?

Taolin Zhang, Zihan Ma, Maosong Cao, Junnan Liu, Songyang Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏