arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138434 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2605.01735 2026-05-28 cs.CL 86%

Less is More: Geometric Unlearning for LLMs with Minimal Data Disclosure

少即是多:面向LLM的几何遗忘方法,实现最小数据披露

Chenchen Tan, Xinghao Li, Shujie Cui, Youyang Qu, Cunjian Chen, Longxiang Gao

机构 * Faculty of Information Technology, Monash University, Clayton, Victoria, Australia.(墨尔本大学信息技术学院,澳大利亚维多利亚州克莱顿分校)

专题命中 预训练与数据 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出几何遗忘(GU)方法,通过操作模型隐藏状态并利用少量安全参考提示和锚点上下文合成提示,在无需原始训练数据的情况下实现高效选择性遗忘,在ToFU和UnlearnPII基准上达到强目标抑制且对非目标性能影响最小。

Comments 21 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26454 2026-05-27 cs.CL 86%

Model Unlearning Objectives Vary for Distinct Language Functions

模型遗忘目标因语言功能而异

Berk Atil, Vipul Gupta, Rebecca J. Passonneau

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Scale AI

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出针对不同语言功能(危险知识遗忘和毒性遗忘)应设计不同的遗忘方法,并分别提出基于余弦的元学习变体RMU和多层目标方法,在多个7-8B模型上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20423 2026-05-21 cs.AI 86%

OSCToM: RL-Guided Adversarial Generation for High-Order Theory of Mind

OSCToM: 用于高阶理论之心的强化学习引导对抗生成

Sharmin Sultana Srishty, Kazi Mahathir Rahman, Malaika Parizat Sakkhi, Samia Shahid Prianna, Shaikhul Islam Sinat

机构 * Department of Computer Science(计算机科学系) BRAC University(布拉克大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出OSCToM,一种结合强化学习、领域特定语言和组合替代模型的方法,用于建模LLM中的嵌套信念冲突,通过生成观察者-自我冲突来提升复杂社会场景下的理论之心推理能力。

Comments 15 pages, 12 figures containing 15 images, 3 tables. Code available at https://github.com/sharminsrishty/osct

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13725 2026-05-14 cs.AI cs.SI 86%

ScioMind: Cognitively Grounded Multi-Agent Social Simulation with Anchoring-Based Belief Dynamics and Dynamic Profiles

ScioMind:基于认知的多智能体社交模拟与基于锚定的信念动态和动态资料

Yitian Yang, Yiqun Duan, Linghan Huang, Yiqi Zhu, Francesco Bailo, Chunmeizi Su, Huaming Chen

机构 * The University of Sydney(悉尼大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ScioMind结合结构化意见动态与LLM代理推理,通过记忆锚定信念更新规则、分层记忆架构和动态代理资料提升社交模拟的真实性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10504 2026-05-12 cs.CL 86%

Learning Less Is More: Premature Upper-Layer Attention Specialization Hurts Language Model Pretraining

少即是多:提前的上层注意力专业化损害语言模型预训练

Jinchang Zhu, Jindong Li, Yuwen Hao, Chengyu Zou, Rong Fu, Menglin Yang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL

AI总结 本文发现GPT预训练中上层注意力过早专业化导致性能下降,通过减缓上层Q/K投影可提升效果,揭示解码器架构与优化的交互点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24244 2026-05-12 cs.AI 86%

Model Merging Scaling Laws in Large Language Models

大语言模型中的模型合并缩放规律

Yuanyi Wang, Yanggan Gu, Yiming Zhang, Qi Zhou, Zhaoyi Yan, Congkai Xie, Xinyao Wang, Jianbo Yuan, Hongxia Yang

机构 * The Hong Kong Polytechnic University (PolyU)(香港理工大学) Amazon(亚马逊) Innovation Research Institute(创新研究院)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 研究语言模型合并的缩放规律,发现模型大小与专家数量间存在幂律关系,揭示合并收益随专家数量增加而递减的规律,为模型合并提供可预测的规划方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27643 2026-05-01 cs.AR cs.AI 86%

HAVEN: Hybrid Automated Verification ENgine for UVM Testbench Synthesis with LLMs

HAVEN:基于LLMs的混合自动验证引擎用于UVM测试平台综合

Chang-Chih Meng, Yu-Ren Lu, Guan-Yu Lin, Tsung Tai Yeh, Kai-Chiang Wu, I-Chen Wu

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HAVEN通过结合LLM与协议特定模板生成UVM测试平台,实现100%编译成功和高覆盖率。

Comments 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17001 2026-04-21 cs.CL 86%

Vocab Diet: Reshaping the Vocabulary of LLMs via Vector Arithmetic

词汇饮食:通过向量运算重塑大语言模型的词汇

Yuval Reif, Guy Kaplan, Roy Schwartz

机构 * The Hebrew University of Jerusalem(海法大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出通过向量运算重塑LLM词汇,利用变换向量替代单一词表,减少词汇槽位占用,提升多语言覆盖和多样性,同时保持下游性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10547 2026-03-12 cs.CL 86%

Automatic End-to-End Data Integration using Large Language Models

基于大语言模型的自动端到端数据集成

Aaron Steiner, Christian Bizer

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 本文提出基于大语言模型的自动端到端数据集成方法,通过生成必要 artifacts 实现数据集成管道的自动化配置,实验表明其在性能和成本上均具竞争力。

Comments 8 pages, 9 tables. Accepted at the Beyond SQL Workshop at ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10345 2026-02-12 cs.LG 86%

Identifying Evidence-Based Nudges in Biomedical Literature with Large Language Models

利用大语言模型在生物医学文献中识别基于证据的助推

Jaydeep Chauhan, Mark Seidman, Pezhman Raeisian Parvari, Zhi Zheng, Zina Ben-Miled, Cristina Barboi, Andrew Gonzalez, Malaz Boustani

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.LG

AI总结 利用大语言模型在生物医学文献中识别基于证据的助推,通过多阶段流程实现高效提取和验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02136 2026-02-10 cs.CL 86%

Black Big Boxes: Tracing Adjective Order Preferences in Large Language Models

黑大盒子:在大型语言模型中追溯形容词顺序偏好

Jaap Jumelet, Lisa Bylinina, Willem Zuidema, Jakub Szymanik

机构 * CLCG(认知语言学研究中心) ILS(语言学研究所) ILLC(语言学研究所) CIMeC(计算机科学与工程学院) University of Groningen(格罗宁根大学) Utrecht University(乌得勒支大学) University of Amsterdam(阿姆斯特丹大学) University of Trento(特伦托大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 研究揭示大型语言模型中形容词顺序偏好主要由分布学习决定,但模型能稳健推广至未见组合,且上下文线索影响其输出顺序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24012 2026-02-03 cs.LG 86%

Pretraining Scaling Laws for Generative Evaluations of Language Models

生成评估的预训练扩展定律

Rylan Schaeffer, Noam Levi, Brando Miranda, Sanmi Koyejo

机构 * Computer Science Stanford University(计算机科学 斯坦福大学) AI Center EPFL(人工智能中心 EPFL)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.LG

AI总结 本文提出三种预训练扩展定律,用于生成评估的性能预测,揭示了不同扩展定律在稳定性与预测性能上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18834 2026-01-30 cs.CL 86%

Mix, MinHash, and Match: Cross-Source Agreement for Multilingual Pretraining Datasets

混合、最小哈希与匹配:多语言预训练数据集的跨源一致性

Sultan Alrashed, Francesco Orabona

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,comments);language model(abstract);分类 cs.CL

AI总结 通过跨源一致性技术,结合多语言语料库进行最小哈希去重,提升预训练数据质量并增加独特标记数量。

Comments Multilingual LLM pretraining dataset curation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12179 2026-01-21 cs.CL 86%

Tolerance Principle and Small Language Model Learning

容忍原则与小型语言模型学习

Adam E. Friedman, Stevan Harnad, Rushen Shi

专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.CL

AI总结 本研究通过训练小型语言模型BabyBERTa,探讨了规则泛化所需的最小训练数据量,发现其学习动态与杨提出的容忍原则不符。

Comments 14 pages, 6 figures. BUCLD 50 Proceedings. To be published in 2026 by Cascadilla Press

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19531 2026-01-16 cs.CL 86%

MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models

MiLe Loss:一种新的熵加权损失,用于减轻大语言模型在学习困难方面的偏差

Zhenpeng Su, Xing Wu, Xue Bai, Zijia Lin, Hui Chen, Guiguang Ding, Wei Zhou, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 MiLe Loss通过熵加权机制减轻大语言模型在学习困难方面的偏差,提升模型对难学标记的关注度,从而在下游任务中取得更好的表现。

Comments This paper has been accepted by NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08816 2026-01-14 cs.CL econ.EM 86%

Measuring the Quality of Answers in Political Q&As with Large Language Models

利用大语言模型评估政治问答中的答案质量

R. Michael Alvarez, Jacob Morrier

机构 * Division of the Humanities and Social Sciences(人文与社会科学系) California Institute of Technology(加州理工学院)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本文提出利用大语言模型评估政治问答答案质量的方法,通过语义相关性衡量答案的相关性和深度,并发现答案质量与提问议员政党存在相关性。

Journal ref Polit. Anal. 34 (2026) 78-95

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16380 2025-12-18 eess.IV cs.AI cs.CV 86%

From Pretraining to Privacy: Federated Ultrasound Foundation Model with Self-Supervised Learning

从预训练到隐私:具有自监督学习的联邦超声基础模型

Yuncheng Jiang, Chun-Mei Feng, Jinke Ren, Jun Wei, Zixun Zhang, Yiwen Hu, Yunbi Liu, Rui Sun, Xuemei Tang, Juan Du, Xiang Wan, Yong Xu, Bo Du, Xin Gao, Guangyu Wang, Shaohua Zhou, Shuguang Cui, Zhen Li

机构 * FNii-Shenzhen, The Chinese University of Hong Kong, Shenzhen(深圳FNii,香港中文大学(深圳)) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) West China Hospital of Sichuan University, Chengdu(四川大学华西医院) School of Computer Science, University College Dublin, Ireland(计算机科学学院,都柏林大学(爱尔兰)) College of Computer Science and Software Engineering, Shenzhen University, Shenzhen(计算机科学与软件工程学院,深圳大学) South China Hospital, Health Science Center, Shenzhen University, Shenzhen(南方医院,深圳大学健康科学中心) School of Computer Science, Nanjing University of Posts and Telecommunications, Nanjing(计算机科学学院,南京邮电大学) Affiliated Hospital of North Sichuan Medical College, Sichuan(北川医学院附属医院) North Sichuan Medical College, Sichuan(北川医学院) Shenzhen Research Institute of Big Data, Shenzhen(深圳大数据研究院) Bio-Computing Research Center, Harbin Institute of Technology, Shenzhen(生物计算研究中心,哈尔滨工业大学(深圳)) School of Computer Science, Wuhan University, Wuhan(计算机科学学院,武汉大学) Computer Science Program, Computer, E(计算机科学项目,计算机)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title);分类 cs.AI

AI总结 UltraFedFM通过联邦学习和自监督学习,构建了一个隐私保护的超声基础模型,实现了在多种疾病诊断和病变分割上的高准确率,超越了中级医师水平,达到了专家级表现。

Comments npj digital medicine(2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17289 2025-11-13 cs.CL 86%

Automated Knowledge Graph Construction using Large Language Models and Sentence Complexity Modelling

Sydney Anuyah, Mehedi Mahmud Kaushik, Krishna Dwarampudi, Rakesh Shiradkar, Arjan Durresi, Sunandan Chakraborty

机构 * Indiana University(印第安纳大学) Purdue University(普渡大学) Department of Biomedical Engineering(生物医学工程系) Informatics, Indiana University(印第安纳大学信息学院)

专题命中 预训练与数据 :large language model(title);language model(title);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03570 2025-11-06 cs.LG 86%

TabGemma: Text-Based Tabular ICL via LLM using Continued Pretraining and Retrieval

Günther Schindler, Maximilian Schambach, Michael Medek, Sam Thelin

机构 * SAP SE(SAP公司)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25273 2025-10-30 cs.CL 86%

Adapting Small Language Models to Low-Resource Domains: A Case Study in Hindi Tourism QA

Sandipan Majhi, Paheli Bhattacharya

机构 * Indian Institute of Technology Kharagpur, India(印度理工学院Kharagpur分校) Bosch Research(博世研究) Technology Centre, Bangalore, India(技术中心,班加罗尔,印度)

专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.CL

Comments Accepted at the Forum for Information Retrieval Evaluation 2025 (VATIKA Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20475 2025-10-24 cs.CL 86%

Mask and You Shall Receive: Optimizing Masked Language Modeling For Pretraining BabyLMs

Lukas Edman, Alexander Fraser

机构 * School of Computation, Information and Technology, TU Munich(计算、信息与技术学院,慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL

Comments Submission to the 2025 BabyLM Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09423 2025-10-13 cs.LG 86%

Weight Initialization and Variance Dynamics in Deep Neural Networks and Large Language Models

Yankun Han

机构 * University of Florida(佛罗里达大学)

专题命中 预训练与数据 :large language model(title);language model(title);pretraining(abstract);分类 cs.LG

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25283 2025-10-01 cs.CY cs.AI cs.HC 86%

Effectiveness of Large Language Models in Simulating Regional Psychological Structures: An Empirical Examination of Personality and Subjective Well-being

Ke Luoma, Li Zengyi, Liao Jiangqun, Tong Song, Peng Kaiping

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13638 2025-07-08 cs.CL 86%

Pretraining Language Models Using Translationese

Meet Doshi, Raj Dabre, Pushpak Bhattacharyya

机构 * cse.iitb.ac.in(印度理工学院班加罗尔分校计算机科学与工程系) nict.go.jp(日本国立信息与通信技术研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02873 2025-07-08 math.HO cs.AI 86%

Using Large Language Models to Study Mathematical Practice

William D'Alessandro

机构 * William D’Alessandro(独立研究者)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06239 2024-12-10 cs.CR cs.AI 86%

Unseen Attack Detection in Software-Defined Networking Using a BERT-Based Large Language Model

Mohammed N. Swileh, Shengli Zhang

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.AI

Comments Mohammed N. Swileh is first author. Shengli Zhang is corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17808 2024-11-14 cs.CL 86%

Scaffold-BPE: Enhancing Byte Pair Encoding for Large Language Models with Simple and Effective Scaffold Token Removal

Haoran Lian, Yizhe Xiong, Jianwei Niu, Shasha Mo, Zhenpeng Su, Zijia Lin, Hui Chen, Peng Liu, Jungong Han, Guiguang Ding

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19775 2024-10-29 cs.CY cs.AI 86%

Gender Bias of LLM in Economics: An Existentialism Perspective

Hui Zhong, Songsheng Chen, Mian Liang

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

Comments Gender Bias, Large Language Models, Decision-Making

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16121 2024-10-22 cs.LG cs.CR 86%

Extracting Spatiotemporal Data from Gradients with Large Language Models

Lele Zheng, Yang Cao, Renhe Jiang, Kenjiro Taura, Yulong Shen, Sheng Li, Masatoshi Yoshikawa

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.LG

Comments arXiv admin note: substantial text overlap with arXiv:2407.08529

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03821 2024-05-08 cs.HC cs.AI cs.SE 86%

Thoughtful Things: Building Human-Centric Smart Devices with Small Language Models

Evan King, Haoxiang Yu, Sahil Vartak, Jenna Jacob, Sangsu Lee, Christine Julien

专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.AI

Comments 24 pages (3 pages of references)

详情

展开后加载摘要…

URL PDF HTML 收藏