arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138434 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2502.17328 2025-02-25 cs.CL cs.AI cs.LG 85%

Mutual Reinforcement of LLM Dialogue Synthesis and Summarization Capabilities for Few-Shot Dialogue Summarization

Yen-Ju Lu, Ting-Yao Hu, Hema Swetha Koppula, Hadi Pouransari, Jen-Hao Rick Chang, Yin Xia, Xiang Kong, Qi Zhu, Simon Wang, Oncel Tuzel, Raviteja Vemulapalli

专题命中 预训练与数据 :LLM(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17719 2025-02-21 cs.CV 85%

Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?

Boshen Xu, Ziheng Wang, Yang Du, Zhinan Song, Sipeng Zheng, Qin Jin

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract)

Comments Accepted by ICLR 2025. Code: https://github.com/xuboshen/EgoNCEpp

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10322 2025-01-22 cs.CL cs.AI cs.LG 85%

Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models

Pit Neitemeier, Björn Deiseroth, Constantin Eichenberg, Lukas Balles

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08365 2025-01-16 cs.CY cs.AI cs.CL cs.LG 85%

Towards Best Practices for Open Datasets for LLM Training

Stefan Baack, Stella Biderman, Kasia Odrozek, Aviya Skowron, Ayah Bdeir, Jillian Bommarito, Jennifer Ding, Maximilian Gahntz, Paul Keller, Pierre-Carl Langlais, Greg Lindahl, Sebastian Majstorovic, Nik Marda, Guilherme Penedo, Maarten Van Segbroeck, Jennifer Wang, Leandro von Werra, Mitchell Baker, Julie Belião, Kasia Chmielinski, Marzieh Fadaee, Lisa Gutermuth, Hynek Kydlíček, Greg Leppert, EM Lewis-Jong, Solana Larsen, Shayne Longpre, Angela Oduor Lungati, Cullen Miller, Victor Miller, Max Ryabinin, Kathleen Siminyu, Andrew Strait, Mark Surman, Anna Tumadóttir, Maurice Weber, Rebecca Weiss, Lee White, Thomas Wolf

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00698 2025-01-08 cs.CV 85%

Enhancing Remote Sensing Vision-Language Models for Zero-Shot Scene Classification

Karim El Khoury, Maxime Zanella, Benoît Gérin, Tiffanie Godelaine, Benoît Macq, Saïd Mahmoudi, Christophe De Vleeschouwer, Ismail Ben Ayed

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);prompting(abstract)

Comments Accepted at ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02045 2025-01-07 q-bio.GN cs.AI cs.CL cs.LG 85%

METAGENE-1: Metagenomic Foundation Model for Pandemic Monitoring

Ollie Liu, Sami Jaghouar, Johannes Hagemann, Shangshang Wang, Jason Wiemels, Jeff Kaufman, Willie Neiswanger

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13233 2024-12-24 cs.SE 85%

Creating an LLM-based AI-agent: A high-level methodology towards enhancing LLMs with APIs

Ioannis Tzachristas

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments in Greek language. This Master's Thesis was supervised by Prof. Nikolaos Papaspyrou (National Technical University of Athens) and Dr. Aifen Sui (Huawei Munich Research Center). English version: pages 57-104. Original submission link: http://artemis.cslab.ece.ntua.gr:8080/jspui/handle/123456789/19180

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10532 2024-12-18 cs.CL cs.AI cs.CY cs.HC cs.LG 85%

Properties and Challenges of LLM-Generated Explanations

Jenny Kunz, Marco Kuhlmann

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10372 2024-12-16 cs.CV 85%

UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities

Muhammad Uzair Khattak, Shahina Kunhimon, Muzammal Naseer, Salman Khan, Fahad Shahbaz Khan

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract)

Comments Code, models and demo available at https://github.com/mbzuai-oryx/UniMed-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02816 2024-12-05 cs.CR 85%

Unleashing GHOST: An LLM-Powered Framework for Automated Hardware Trojan Design

Md Omar Faruque, Peter Jamieson, Ahmad Patooghy, Abdel-Hameed A. Badawy

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18908 2024-12-04 cs.HC 85%

DuetML: Human-LLM Collaborative Machine Learning Framework for Non-Expert Users

Wataru Kawabe, Yusuke Sugano

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10683 2024-11-19 cs.CR 85%

I'm Spartacus, No, I'm Spartacus: Measuring and Understanding LLM Identity Confusion

Kun Li, Shichao Zhuang, Yue Zhang, Minghui Xu, Ruoxi Wang, Kaidi Xu, Xinwen Fu, Xiuzhen Cheng

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 16 pages, 8 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04704 2024-11-08 cs.SE 85%

Distinguishing LLM-generated from Human-written Code by Contrastive Learning

Xiaodan Xu, Chao Ni, Xinrong Guo, Shaoxuan Liu, Xiaoya Wang, Kui Liu, Xiaohu Yang

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 30 pages, 6 figures, Accepted by TOSEM'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24034 2024-11-01 cs.CV 85%

Handwriting Recognition in Historical Documents with Multimodal LLM

Lucian Li

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23676 2024-11-01 cs.CV 85%

Web-Scale Visual Entity Recognition: An LLM-Driven Data Approach

Mathilde Caron, Alireza Fathi, Cordelia Schmid, Ahmet Iscen

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17120 2024-10-30 cs.CL cs.AI cs.LG 85%

MathPile: A Billion-Token-Scale Pretraining Corpus for Math

Zengzhi Wang, Xuefeng Li, Rui Xia, Pengfei Liu

专题命中 预训练与数据 :pretraining(title);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 43 pages. Accepted by NeurIPS 2024. https://github.com/GAIR-NLP/MathPile/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09687 2024-10-15 cs.LG cs.AI cs.CL 85%

MoIN: Mixture of Introvert Experts to Upcycle an LLM

Ajinkya Tejankar, KL Navaneet, Ujjawal Panchal, Kossar Pourahmadi, Hamed Pirsiavash

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03617 2024-10-10 cs.CL cs.AI cs.LG 85%

Is Child-Directed Speech Effective Training Data for Language Models?

Steven Y. Feng, Noah D. Goodman, Michael C. Frank

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024. Code and data at https://github.com/styfeng/TinyDialogues

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07431 2024-10-04 cs.LG cs.AI cs.CL stat.ML 85%

Synthetic continued pretraining

Zitong Yang, Neil Band, Shuangping Li, Emmanuel Candès, Tatsunori Hashimoto

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Updated organization of experimental results and methods introduction. Released the dataset and model weights artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10938 2024-10-03 cs.LG cs.AI cs.CL stat.ML 85%

Observational Scaling Laws and the Predictability of Language Model Performance

Yangjun Ruan, Chris J. Maddison, Tatsunori Hashimoto

专题命中 预训练与数据 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2024 as a spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11176 2024-09-26 cs.CL cs.AI cs.LG 85%

Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement

Weimin Xiong, Yifan Song, Xiutian Zhao, Wenhao Wu, Xun Wang, Ke Wang, Cheng Li, Wei Peng, Sujian Li

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2024 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15678 2024-09-25 q-bio.QM q-bio.GN 85%

Objectively Evaluating the Reliability of Cell Type Annotation Using LLM-Based Strategies

Wenjin Ye, Yuanchen Ma, Junkai Xiang, Hongjie Liang, Tao Wang, Qiuling Xiang, Andy Peng Xiang, Wu Song, Weiqiang Li, Weijun Huang

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04029 2024-09-17 cs.RO 85%

ChatSim: Underwater Simulation with Natural Language Prompting

Aadi Palnitkar, Rashmi Kapu, Xiaomin Lin, Cheng Liu, Nare Karapetyan, Yiannis Aloimonos

专题命中 预训练与数据 :prompting(title);LLM(abstract);large language model(abstract);language model(abstract)

Journal ref OCEANS 2023 - MTS/IEEE U.S. Gulf Coast

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07091 2024-08-22 cs.LG cs.AI cs.CL 85%

Node Level Graph Autoencoder: Unified Pretraining for Textual Graph Learning

Wenbin Hu, Huihao Jing, Qi Hu, Haoran Li, Yangqiu Song

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20371 2024-08-22 cs.CY cs.AI cs.CL cs.LG 85%

Gender, Race, and Intersectional Bias in Resume Screening via Language Model Retrieval

Kyra Wilson, Aylin Caliskan

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To be published in Proceedings of the 2024 AAAI/ACM Conference on AI, Ethics, and Society; code available at https://github.com/kyrawilson/Resume-Screening-Bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07922 2024-08-20 cs.CL cs.AI cs.LG 85%

RAVEN: In-Context Learning with Retrieval-Augmented Encoder-Decoder Language Models

Jie Huang, Wei Ping, Peng Xu, Mohammad Shoeybi, Kevin Chen-Chuan Chang, Bryan Catanzaro

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01490 2024-07-22 cs.CL cs.AI cs.LG 85%

LLM See, LLM Do: Guiding Data Generation to Target Non-Differentiable Objectives

Luísa Shimabucoro, Sebastian Ruder, Julia Kreutzer, Marzieh Fadaee, Sara Hooker

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12854 2024-07-19 cs.CL cs.AI cs.IR cs.LG 85%

Scaling Retrieval-Based Language Models with a Trillion-Token Datastore

Rulin Shao, Jacqueline He, Akari Asai, Weijia Shi, Tim Dettmers, Sewon Min, Luke Zettlemoyer, Pang Wei Koh

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13972 2024-07-09 cs.SE 85%

CREF: An LLM-based Conversational Software Repair Framework for Programming Tutors

Boyang Yang, Haoye Tian, Weiguo Pian, Haoran Yu, Haitao Wang, Jacques Klein, Tegawendé F. Bissyandé, Shunfu Jin

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04489 2024-07-08 cs.CV 85%

Dude: Dual Distribution-Aware Context Prompt Learning For Large Vision-Language Model

Duy M. H. Nguyen, An T. Le, Trung Q. Nguyen, Nghiem T. Diep, Tai Nguyen, Duy Duong-Tran, Jan Peters, Li Shen, Mathias Niepert, Daniel Sonntag

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract)

Comments Version 1

详情

展开后加载摘要…

URL PDF HTML 收藏