arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12393 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2404.02204 2024-04-04 cs.CL cs.LG 84%

Emergent Abilities in Reduced-Scale Generative Language Models

Sherin Muckatira, Vijeta Deshpande, Vladislav Lialin, Anna Rumshisky

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments 16 pages, 4 figures. Accepted to NAACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01260 2024-04-02 cs.CV cs.AI cs.LG 84%

Bridging Remote Sensors with Multisensor Geospatial Foundation Models

Boran Han, Shuai Zhang, Xingjian Shi, Markus Reichstein

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Accepted to CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15486 2024-03-26 cs.CL cs.AI 84%

Sequence-to-Sequence Language Models for Character and Emotion Detection in Dream Narratives

Gustave Cortal

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09712 2024-03-18 cs.CL cs.AI 84%

A Knowledge-Injected Curriculum Pretraining Framework for Question Answering

Xin Lin, Tianhuang Su, Zhenya Huang, Shangzi Xue, Haifeng Liu, Enhong Chen

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by WWW 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19406 2024-03-05 cs.CL cs.AI 84%

On the Scaling Laws of Geographical Representation in Language Models

Nathan Godey, Éric de la Clergerie, Benoît Sagot

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00068 2024-02-26 cs.CL cs.AI 84%

Inconsistencies in Masked Language Models

Tom Young, Yunan Chen, Yang You

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09305 2024-02-15 cs.LG cs.AI 84%

Embracing the black box: Heading towards foundation models for causal discovery from time series data

Gideon Stein, Maha Shadaydeh, Joachim Denzler

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments AAAI Workshop (AI4TS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15096 2024-02-13 cs.CL cs.AI 84%

Dynamic Masking Rate Schedules for MLM Pretraining

Zachary Ankner, Naomi Saphra, Davis Blalock, Jonathan Frankle, Matthew L. Leavitt

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13496 2024-01-26 cs.CV cs.AI cs.LG 84%

The effectiveness of MAE pre-pretraining for billion-scale pretraining

Mannat Singh, Quentin Duval, Kalyan Vasudev Alwala, Haoqi Fan, Vaibhav Aggarwal, Aaron Adcock, Armand Joulin, Piotr Dollár, Christoph Feichtenhofer, Ross Girshick, Rohit Girdhar, Ishan Misra

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

Comments ICCV 2023. Models available at https://github.com/facebookresearch/maws/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10278 2024-01-22 eess.SP cs.AI cs.LG cs.MM q-bio.NC 84%

EEGFormer: Towards Transferable and Interpretable Large-Scale EEG Foundation Model

Yuqi Chen, Kan Ren, Kaitao Song, Yansen Wang, Yifan Wang, Dongsheng Li, Lili Qiu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments A preprint version of an ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17482 2024-01-17 cs.CL cs.LG 84%

MosaicBERT: A Bidirectional Encoder Optimized for Fast Pretraining

Jacob Portes, Alex Trott, Sam Havens, Daniel King, Abhinav Venigalla, Moin Nadeem, Nikhil Sardana, Daya Khudia, Jonathan Frankle

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 10 pages, 4 figures in main text. 25 pages total

Journal ref NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01163 2024-01-15 cs.CL cs.LG cs.NE 84%

Improving Language Plasticity via Pretraining with Active Forgetting

Yihong Chen, Kelly Marchisio, Roberta Raileanu, David Ifeoluwa Adelani, Pontus Stenetorp, Sebastian Riedel, Mikel Artetxe

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2023 Final Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03919 2023-12-15 cs.LG cs.CL 84%

Data Portraits: Recording Foundation Model Training Data

Marc Marone, Benjamin Van Durme

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2023 Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03169 2023-11-21 cs.CL cs.LG 84%

Data Selection for Language Models via Importance Resampling

Sang Michael Xie, Shibani Santurkar, Tengyu Ma, Percy Liang

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03250 2023-11-07 cs.CL cs.AI 84%

Instructed Language Models with Retrievers Are Powerful Entity Linkers

Zilin Xiao, Ming Gong, Jie Wu, Xingyao Zhang, Linjun Shou, Jian Pei, Daxin Jiang

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2023 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02597 2023-11-07 cs.AI cs.CL 84%

FloodBrain: Flood Disaster Reporting by Web-based Retrieval Augmented Generation with an LLM

Grace Colverd, Paul Darm, Leonard Silverberg, Noah Kasmanoff

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Version is the one submitted to Artificial Intelligence for Humanitarian Assistance and Disaster Response Workshop @Neurips2023. All authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12513 2023-11-07 cs.CV cs.CL cs.LG 84%

Is BERT Blind? Exploring the Effect of Vision-and-Language Pretraining on Visual Language Understanding

Morris Alper, Michael Fiman, Hadar Averbuch-Elor

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted to CVPR 2023. Project webpage: https://isbertblind.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19961 2023-11-01 cs.LG cs.AI 84%

ExPT: Synthetic Pretraining for Few-Shot Experimental Design

Tung Nguyen, Sudhanshu Agrawal, Aditya Grover

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

Comments 2023 Conference on Neural Information Processing Systems (NeurIPS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17530 2023-10-27 cs.CV cs.CL cs.LG 84%

Evaluating Bias and Fairness in Gender-Neutral Pretrained Vision-and-Language Models

Laura Cabello, Emanuele Bugliarello, Stephanie Brandl, Desmond Elliott

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments To appear in EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14369 2023-10-24 cs.LG cs.AI 84%

MoPe: Model Perturbation-based Privacy Attacks on Language Models

Marvin Li, Jason Wang, Jeffrey Wang, Seth Neel

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03477 2023-10-06 cs.CL cs.AI 84%

Tik-to-Tok: Translating Language Models One Token at a Time: An Embedding Initialization Strategy for Efficient Language Adaptation

François Remy, Pieter Delobelle, Bettina Berendt, Kris Demuynck, Thomas Demeester

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments As first reviewed at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09380 2023-09-19 cs.CL cs.LG 84%

Mitigating Shortcuts in Language Models with Soft Label Encoding

Zirui He, Huiqi Deng, Haiyan Zhao, Ninghao Liu, Mengnan Du

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12270 2023-08-24 cs.LG cs.AI 84%

Language Reward Modulation for Pretraining Reinforcement Learning

Ademi Adeniji, Amber Xie, Carmelo Sferrazza, Younggyo Seo, Stephen James, Pieter Abbeel

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Code available at https://github.com/ademiadeniji/lamp

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00624 2023-08-02 cs.CL cs.AI 84%

JIANG: Chinese Open Foundation Language Model

Qinhua Duan, Wenchao Gu, Yujia Chen, Wenxin Mao, Zewen Tian, Hui Cao

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14430 2023-08-01 cs.CL cs.LG 84%

Skill-it! A Data-Driven Skills Framework for Understanding and Training Language Models

Mayee F. Chen, Nicholas Roberts, Kush Bhatia, Jue Wang, Ce Zhang, Frederic Sala, Christopher Ré

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04401 2023-07-11 cs.CL cs.AI 84%

Ethicist: Targeted Training Data Extraction Through Loss Smoothed Soft Prompting and Calibrated Confidence Estimation

Zhexin Zhang, Jiaxin Wen, Minlie Huang

专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2023 Long Paper (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10785 2023-05-30 cs.CL cs.AI 84%

SERENGETI: Massively Multilingual Language Models for Africa

Ife Adebara, AbdelRahim Elmadany, Muhammad Abdul-Mageed, Alcides Alcoba Inciarte

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments To appear in Findings of ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15507 2023-05-26 cs.CL cs.AI 84%

The Larger They Are, the Harder They Fail: Language Models do not Recognize Identifier Swaps in Python

Antonio Valerio Miceli-Barone, Fazl Barez, Ioannis Konstas, Shay B. Cohen

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments 17 pages, 5 figure, ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12281 2023-05-23 cs.CL cs.LG 84%

Lifelong Language Pretraining with Distribution-Specialized Experts

Wuyang Chen, Yanqi Zhou, Nan Du, Yanping Huang, James Laudon, Zhifeng Chen, Claire Cu

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

Comments ICML 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10992 2023-05-19 cs.CL cs.AI 84%

How does the task complexity of masked pretraining objectives affect downstream performance?

Atsuki Yamaguchi, Hiroaki Ozaki, Terufumi Morishita, Gaku Morio, Yasuhiro Sogawa

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at ACL 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏