arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12393 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2510.09846 2025-10-14 cs.LG cs.AI 84%

CALM: A Causal Analysis Language Model for Tabular Data in Complex Systems with Local Scores, Conditional Independence Tests, and Relation Attributes

Zhenjiang Fan, Zengyi Qin, Yuanning Zheng, Bo Xiong, Summer Han

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04268 2025-10-07 cs.CL cs.AI 84%

LongTail-Swap: benchmarking language models' abilities on rare words

Robin Algayres, Charles-Éric Saint-James, Mahi Luthra, Jiayi Shen, Dongyan Lin, Youssef Benchekroun, Rashel Moritz, Juan Pino, Emmanuel Dupoux

机构 * Meta AI

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19551 2025-10-07 cs.CL cs.AI 84%

Scaling Laws of Synthetic Data for Language Models

Zeyu Qin, Qingxiu Dong, Xingxing Zhang, Li Dong, Xiaolong Huang, Ziyi Yang, Mahmoud Khademi, Dongdong Zhang, Hany Hassan Awadalla, Yi R. Fung, Weizhu Chen, Minhao Cheng, Furu Wei

机构 * Microsoft(微软公司) HKUST(香港科技大学) Peking University(北京大学) Penn State University(宾夕法尼亚州立大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01571 2025-10-03 cs.LG cs.AI q-bio.BM 84%

From Supervision to Exploration: What Does Protein Language Model Learn During Reinforcement Learning?

Hanqun Cao, Hongrui Zhang, Junde Xu, Zhou Zhang, Lingdong Shen, Minghao Sun, Ge Liu, Jinbo Xu, Wu-Jun Li, Jinren Ni, Cesar de la Fuente-Nunez, Tianfan Fu, Yejin Choi, Pheng-Ann Heng, Fang Wu

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Stanford University(斯坦福大学) Nanjing University(南京大学) University of Pennsylvania(宾夕法尼亚大学) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments 24 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25498 2025-10-01 cs.CL cs.AI 84%

Not Wrong, But Untrue: LLM Overconfidence in Document-Based Queries

Nick Hagar, Wilma Agustianto, Nicholas Diakopoulos

机构 * Northwestern University(西北大学) University of Minnesota(明尼苏达大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to Computation + Journalism Symposium 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12930 2025-09-30 cs.CL cs.AI 84%

Making Language Model a Hierarchical Classifier

Yihong Wang, Zhonglin Jiang, Ningyuan Xi, Yue Zhao, Qingqing Gu, Xiyuan Chen, Hao Wu, Sheng Xu, Hange Zhou, Yong Chen, Luo Ji

机构 * Geely AI Lab(地平线AI实验室) Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18152 2025-09-24 cs.LG cs.AI 84%

WLFM: A Well-Logs Foundation Model for Multi-Task and Cross-Well Geological Interpretation

Zhenyu Qi, Qing Yu, Jichen Wang, Yun-Bo Zhao, Zerui Li, Wenjun Lv

机构 * Institute of Advanced Technology, University of Science and Technology of China(科学技术大学先进技术研究所) Department of Automation, University of Science and Technology of China(科学技术大学自动化系) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究所)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17317 2025-09-23 cs.CL cs.AI 84%

Scaling, Simplification, and Adaptation: Lessons from Pretraining on Machine-Translated Text

Dan John Velasco, Matthew Theodore Roque

机构 * Samsung R&D Institute Philippines(三星菲律宾研发院)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10369 2025-09-15 cs.LG cs.AI eess.SP q-bio.TO 84%

Data distribution impacts the performance and generalisability of contrastive learning-based foundation models of electrocardiograms

Gul Rukh Khattak, Konstantinos Patlatzoglou, Joseph Barker, Libor Pastika, Boroumand Zeidaabadi, Ahmed El-Medany, Hesham Aggour, Yixiu Liang, Antonio H. Ribeiro, Jeffrey Annis, Antonio Luiz Pinho Ribeiro, Junbo Ge, Daniel B. Kramer, Jonathan W. Waks, Evan Brittain, Nicholas Peters, Fu Siong Ng, Arunashis Sau

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Currently under review at npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03682 2025-09-11 cs.LG cs.AI 84%

Self-Questioning Language Models

Lili Chen, Mihir Prabhudesai, Katerina Fragkiadaki, Hao Liu, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21509 2025-09-08 cs.CL cs.LG 84%

Persona Vectors: Monitoring and Controlling Character Traits in Language Models

Runjin Chen, Andy Arditi, Henry Sleight, Owain Evans, Jack Lindsey

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02046 2025-09-08 cs.LG cs.AI stat.ML 84%

Fantastic Pretraining Optimizers and Where to Find Them

Kaiyue Wen, David Hall, Tengyu Ma, Percy Liang

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 108 pages, 8 figures, reproducible runs available at https://wandb.ai/marin-community/optimizer-scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18598 2025-08-27 cs.CL cs.AI 84%

What do language models model? Transformers, automata, and the format of thought

Colin Klein

机构 * School of Philosophy(哲学学院) The Australian National University(澳大利亚国立大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13069 2025-08-26 cs.CL cs.AI 84%

Evaluating $n$-Gram Novelty of Language Models Using Rusty-DAWG

William Merrill, Noah A. Smith, Yanai Elazar

机构 * New York University(纽约大学) Allen Institute for AI(人工智能研究院) University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments To appear at EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15791 2025-08-25 cs.CL cs.AI 84%

InteChar: A Unified Oracle Bone Character List for Ancient Chinese Language Modeling

Xiaolei Diao, Zhihan Zhou, Lida Shi, Ting Wang, Ruihua Qi, Hao Xu, Daqian Shi

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13603 2025-08-20 cs.CL cs.AI 84%

Who Gets the Mic? Investigating Gender Bias in the Speaker Assignment of a Speech-LLM

Dariia Puhach, Amir H. Payberah, Éva Székely

机构 * Department of Linguistics(语言学系) Department of Speech, Music, and Hearing(语音、音乐与听觉系)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Journal ref Interspeech 2025 (2025), 2058-2062

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11551 2025-08-19 stat.ML cs.AI cs.LG 84%

ADMIRE-BayesOpt: Accelerated Data MIxture RE-weighting for Language Models with Bayesian Optimization

Shengzhuang Chen, Xu Ouyang, Michael Arthur Leopold Pearce, Thomas Hartvigsen, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research & Imperial College London(汤姆逊·路透基础研究与帝国理工学院伦敦) University of Virginia(弗吉尼亚大学) Graphcore Thomson Reuters Foundational Research(汤姆逊·路透基础研究)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07695 2025-08-01 cs.CL cs.AI 84%

KeyKnowledgeRAG (K^2RAG): An Enhanced RAG method for improved LLM question-answering capabilities

Hruday Markondapatnaikuni, Basem Suleiman, Abdelkarim Erradi, Shijing Chen

机构 * University of Sydney(悉尼大学) University of New South Wales(新南威尔士大学) Qatar University(卡塔尔大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11588 2025-07-24 q-bio.GN cs.AI cs.LG 84%

SToFM: a Multi-scale Foundation Model for Spatial Transcriptomics

Suyuan Zhao, Yizhen Luo, Ganbo Yang, Yan Zhong, Hao Zhou, Zaiqing Nie

机构 * Department of Computer Science and Tecnology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) PharMolix Inc.(PharMolix公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Accpeted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14141 2025-07-22 eess.SP cs.AI cs.LG 84%

DIVER-0 : A Fully Channel Equivariant EEG Foundation Model

Danny Dongyeop Han, Ahhyun Lucy Lee, Taeyang Lee, Yonghyeon Gwon, Sebin Lee, Seongjin Lee, David Keetae Park, Shinjae Yoo, Jiook Cha, Chun Kee Chung

机构 * snu(首尔国立大学) bnl(布鲁克海文国家实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments 11 pages, 1 figures, ICML 2025 Workshop on GenBio

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14523 2025-07-21 cs.CL cs.AI 84%

Exploring Graph Representations of Logical Forms for Language Modeling

Michael Sullivan

机构 * University at Buffalo(布法罗大学) Saarland University(萨尔兰州大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments To be published in ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11966 2025-07-17 cs.CL cs.AI cs.CY 84%

Toxicity-Aware Few-Shot Prompting for Low-Resource Singlish Translation

Ziyu Ge, Gabriel Chua, Leanne Tan, Roy Ka-Wei Lee

专题命中 预训练与数据 :prompting(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21018 2025-07-15 cs.CL cs.LG 84%

HYPEROFA: Expanding LLM Vocabulary to New Languages via Hypernetwork-Based Embedding Initialization

Enes Özeren, Yihong Liu, Hinrich Schütze

机构 * LMU Munich(慕尼黑莱布尼茨大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 预训练与数据 :LLM(title);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments 18 pages, 3 figures, 15 tables. After ACL reviews: Corrected typos, Table 4 caption updated and the order of the results changed, numbers are unchanged. This paper will appear in ACL SRW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01450 2025-07-15 cs.LG cs.CL 84%

CASCADE Your Datasets for Cross-Mode Knowledge Retrieval of Language Models

Runlong Zhou, Yi Zhang

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12370 2025-07-04 cs.LG cs.AI 84%

Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models

Samira Abnar, Harshay Shah, Dan Busbridge, Alaaeldin Mohamed Elnouby Ali, Josh Susskind, Vimal Thilak

机构 * Apple(苹果公司) MIT(麻省理工学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01844 2025-07-03 cs.CL cs.LG 84%

Low-Perplexity LLM-Generated Sequences and Where To Find Them

Arthur Wuhrmann, Anastasiia Kucherenko, Andrei Kucharavy

机构 * École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Institute of Entrepreneurship and Management, HES-SO Valais-Wallis(企业家与管理学院) Institute of Informatics, HES-SO Valais-Wallis(信息学院)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Camera-ready version. Accepted to ACL 2025. 10 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01045 2025-07-03 cs.LG cs.AI eess.SP 84%

Sensing Cardiac Health Across Scenarios and Devices: A Multi-Modal Foundation Model Pretrained on Heterogeneous Data from 1.7 Million Individuals

Xiao Gu, Wei Tang, Jinpei Han, Veer Sangha, Fenglin Liu, Shreyank N Gowda, Antonio H. Ribeiro, Patrick Schwab, Kim Branson, Lei Clifton, Antonio Luiz P. Ribeiro, Zhangdaihong Liu, David A. Clifton

机构 * University of Oxford(牛津大学) University of Nottingham(诺丁汉大学) Uppsala University(乌普萨拉大学) GlaxoSmithKline(葛兰素史克)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21803 2025-06-30 eess.SP cs.AI cs.LG 84%

From Token to Rhythm: A Multi-Scale Approach for ECG-Language Pretraining

Fuying Wang, Jiacheng Xu, Lequan Yu

机构 * School of Computing and Data Science, The University of Hong Kong, Hong Kong SAR, China(计算与数据科学学院,香港大学,香港特别行政区,中国)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21071 2025-06-27 cs.LG cs.CL 84%

Enhancing LLM Tool Use with High-quality Instruction Data from Knowledge Graph

Jingwei Wang, Zai Zhang, Hao Qian, Chunjing Gan, Binbin Hu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou, Bin Shi, Bo Dong

机构 * Ant Group, China(蚂蚁集团) School of Computer Science and Technology, Xi’an Jiaotong University, China(西安交通大学计算机科学与技术学院) School of Distance Education, Xi’an Jiaotong University, China(西安交通大学继续教育学院)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20249 2025-06-26 cs.AI cs.CL cs.MA 84%

Language Modeling by Language Models

Junyan Cheng, Peter Clark, Kyle Richardson

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏