arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137636 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12308 篇

2509.11496 2025-09-16 cs.CL 91%

AKCIT-FN at CheckThat! 2025: Switching Fine-Tuned SLMs and LLM Prompting for Multilingual Claim Normalization

Fabrycio Leite Nakano Almada, Kauan Divino Pouso Mariano, Maykon Adriell Dutra, Victor Emanuel da Silva Monteiro, Juliana Resplande Sant'Anna Gomes, Arlindo Rodrigues Galvão Filho, Anderson da Silva Soares

机构 * Institute of Informatics, Federal University of Goiás, Brazil(信息学院,戈亚斯联邦大学,巴西) Advanced Knowledge Center in Immersive Technology (AKCIT), Federal University of Goiás, Brazil(沉浸式技术高级知识中心(AKCIT),戈亚斯联邦大学,巴西)

专题命中 预训练与数据 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00203 2025-03-11 cs.CL 91%

Llamarine: Open-source Maritime Industry-specific Large Language Model

William Nguyen, An Phan, Konobu Kimura, Hitoshi Maeno, Mika Tanaka, Quynh Le, William Poucher, Christopher Nguyen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13395 2023-10-23 cs.CL 91%

Cache me if you Can: an Online Cost-aware Teacher-Student framework to Reduce the Calls to Large Language Models

Ilias Stogiannidis, Stavros Vassos, Prodromos Malakasiotis, Ion Androutsopoulos

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Short paper (5 pages), accepted at Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24737 2026-05-26 cs.CL cs.AI cs.CY 91%

Who judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoring

谁来评判评判者?基于指标的治理:面向持续LLM合规监控的运行时框架

Jehanne Dussert

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);small language model(abstract);SLM(abstract_cn)

AI总结 针对AI合规作为审计时二元判定而非生产系统持续可测量属性的问题,提出基于指标的治理原则,并开发开源框架govllm,通过运行时可观测性信号实现持续合规监控,验证了多模型陪审团设计在监管评估中的有效性。

Comments 41 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21845 2026-05-22 cs.CL cs.AI 91%

Comparing LLM and Fine-Tuned Model Performance on NVDRS Circumstance Extraction with Varying Prompt Complexity

对比LLM和微调模型在不同提示复杂度下的NVDRS情境提取性能

Geoffrey Martin, Xuan Zhong Feng, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine(人群健康科学系,威尔·康奈尔医学学院) Systems Engineering, Cornell University(系统工程,康奈尔大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在不同提示复杂度下,LLM与微调模型在NVDRS情境提取任务中的表现差异,提出了一种复杂度评分算法,并展示了一个混合方法,通过不同情境选择提示策略,发现LLM在低 prevalence 情境中表现更优,且框架能跨不同前沿LLM通用。

Comments Accepted at IEEE ICHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15556 2025-09-22 cs.CL cs.AI 91%

Exploring Polyglot Harmony: On Multilingual Data Allocation for Large Language Models Pretraining

Ping Guo, Yubing Ren, Binbin Liu, Fengze Liu, Haobin Lin, Yifan Zhang, Bingni Zhang, Taifeng Wang, Yin Zheng

机构 * ByteDance(字节跳动) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17400 2025-08-26 cs.LG cs.AI cs.IR 91%

Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs

Jacob Portes, Connor Jennings, Erica Ji Yuen, Sasha Doubov, Michael Carbin

机构 * Databricks Mosaic Research(Databricks Mosaic研究)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(title);language model(title);LLM(abstract)

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07463 2025-06-10 cs.CL cs.AI 91%

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models

Guang Liu, Liangdong Wang, Jijie Li, Yang Yu, Yao Xu, Jiabei Chen, Yu Bai, Feng Liao, Yonghua Lin

机构 * Data Research Team(数据研究团队) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(title);language model(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00869 2024-12-20 cs.CL cs.AI 91%

KnowledgePrompts: Exploring the Abilities of Large Language Models to Solve Proportional Analogies via Knowledge-Enhanced Prompting

Thilini Wijesiriwardene, Ruwan Wickramarachchi, Sreeram Vennam, Vinija Jain, Aman Chadha, Amitava Das, Ponnurangam Kumaraguru, Amit Sheth

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI

Comments Accepted at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00905 2024-06-21 cs.CL cs.AI 91%

All Languages Matter: On the Multilingual Safety of Large Language Models

Wenxuan Wang, Zhaopeng Tu, Chang Chen, Youliang Yuan, Jen-tse Huang, Wenxiang Jiao, Michael R. Lyu

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);prompting(abstract)

Comments Accepted by ACL 2024 Findings. The first multilingual safety benchmark for large language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12276 2024-03-25 cs.HC cs.AI cs.CL cs.ET 91%

LLMR: Real-time Prompting of Interactive Worlds using Large Language Models

Fernanda De La Torre, Cathy Mengying Fang, Han Huang, Andrzej Banburski-Fahey, Judith Amores Fernandez, Jaron Lanier

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI

Comments 46 pages, 18 figures; Matching version accepted at CHI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03025 2023-05-05 cs.CL cs.AI 91%

Panda LLM: Training Data and Evaluation for Open-Sourced Chinese Instruction-Following Large Language Models

Fangkai Jiao, Bosheng Ding, Tianze Luo, Zhanfeng Mo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26511 2026-03-30 cs.CL cs.AI cs.LG 91%

AMALIA Technical Report: A Fully Open Source Large Language Model for European Portuguese

AMALIA技术报告:一个完全开源的大型语言模型用于葡萄牙语(欧洲葡萄牙语)

Afonso Simplício, Gonçalo Vinagre, Miguel Moura Ramos, Diogo Tavares, Rafael Ferreira, Giuseppe Attanasio, Duarte M. Alves, Inês Calvo, Inês Vieira, Rui Guerra, James Furtado, Beatriz Canaverde, Iago Paulo, Vasco Ramos, Diogo Glória-Silva, Miguel Faria, Marcos Treviso, Daniel Gomes, Pedro Gomes, David Semedo, André Martins, João Magalhães

机构 * NOVA School of Science and Technology(新大学科学与技术学院) NOVA LINCS(新大学LINCS实验室) Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) Fundação para a Ciência e Tecnologia(科学技术基金会)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 AMALIA是一个完全开源的大型语言模型,专注于欧洲葡萄牙语,通过增加高质量数据提升模型性能,并发布新基准测试以评估葡萄牙语生成和语言能力。

Comments PROPOR 2026 - The 17th International Conference on Computational Processing of Portuguese

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00819 2026-03-12 cs.LG cs.AI cs.CL 91%

Large Language Models for Travel Behavior Prediction

基于大语言模型的出行行为预测

Baichuan Mo, Hanyong Xu, Ruoyun Ma, Jung-Hoon Cho, Dingyi Zhuang, Xiaotong Guo, Jinhua Zhao

机构 * Department of Civil Engineering, Tsinghua University, Beijing, China(清华大学土木工程系) Department of Civil and Environmental Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139(麻省理工学院土木与环境工程系) Department of Urban Studies and Planning, Massachusetts Institute of Technology, Cambridge, MA 20139(麻省理工学院城市研究与规划系) Department of Management Science and Engineering, Stanford University, Stanford, CA 94305(斯坦福大学管理科学与工程系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出利用大语言模型进行出行行为预测,通过零样本提示和文本嵌入两种方法,实现了与传统模型相当的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07017 2026-03-10 cs.CL cs.AI cs.LG 91%

Can Safety Emerge from Weak Supervision? A Systematic Analysis of Small Language Models

安全能否从弱监督中涌现?小型语言模型的系统分析

Punyajoy Saha, Sudipta Halder, Debjyoti Mondal, Subhadarshi Panda

机构 * Samsung Research Institute(三星研究院)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);large language model(abstract);preference optimization(abstract)

AI总结 Self-MOA通过弱监督实现小型语言模型的安全对齐,显著提升安全性的同时保持有用性,减少对人工标注数据的依赖。

Comments 19 pages, 10 tables, 7 figures, under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04871 2025-12-05 cs.AI cs.CL cs.LG 91%

STELLA: Guiding Large Language Models for Time Series Forecasting with Semantic Abstractions

STELLA: 通过语义抽象引导大型语言模型进行时间序列预测

Junjie Fan, Hongye Zhao, Linduo Wei, Jiayu Rao, Guijia Li, Jiaxin Yuan, Wenqi Xu, Yong Qi

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 STELLA通过动态语义抽象机制,提升大型语言模型在时间序列预测中的表现,实现更精准的长期和短期预测。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18080 2025-04-28 cs.CL cs.AI cs.LG 91%

Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization

Wataru Kawakami, Keita Suzuki, Junichiro Iwasawa

机构 * Preferred Networks Inc.(Preferred Networks公司) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 预训练与数据 :pretraining(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22269 2025-03-12 cs.LG cs.AI cs.CL stat.ML 91%

Fourier Head: Helping Large Language Models Learn Complex Probability Distributions

Nate Gillman, Daksh Aggarwal, Michael Freeman, Saurabh Singh, Chen Sun

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

Comments Camera ready version (ICLR 2025). Code at https://nategillman.com/fourier-head

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10254 2025-03-07 cs.LG cs.AI cs.CL stat.ML 91%

LoLCATs: On Low-Rank Linearizing of Large Language Models

Michael Zhang, Simran Arora, Rahul Chalamala, Alan Wu, Benjamin Spector, Aaryan Singhal, Krithik Ramesh, Christopher Ré

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments 58 pages, 25 figures, 26 tables, ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14985 2025-03-04 cs.CL cs.AI cs.LG 91%

Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data

Xinyi Wang, Antonis Antoniades, Yanai Elazar, Alfonso Amayuelas, Alon Albalak, Kexun Zhang, William Yang Wang

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01720 2025-02-07 cs.AI cs.CL cs.LG 91%

Towards a Theoretical Understanding of Synthetic Data in LLM Post-Training: A Reverse-Bottleneck Perspective

Zeyu Gan, Yong Liu

专题命中 预训练与数据 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14908 2025-01-28 cs.LG cs.AI cs.CL 91%

BiMix: A Bivariate Data Mixing Law for Language Model Pretraining

Ce Ge, Zhijian Ma, Daoyuan Chen, Yaliang Li, Bolin Ding

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)

Comments Clarify details

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15720 2024-08-13 cs.CL cs.AI cs.LG 91%

Do Large Language Models Have Compositional Ability? An Investigation into Limitations and Scalability

Zhuoyan Xu, Zhenmei Shi, Yingyu Liang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03049 2024-06-25 cs.CL cs.AI cs.HC cs.IR cs.LG 91%

EasyInstruct: An Easy-to-use Instruction Processing Framework for Large Language Models

Yixin Ou, Ningyu Zhang, Honghao Gui, Ziwen Xu, Shuofei Qiao, Yida Xue, Runnan Fang, Kangwei Liu, Lei Li, Zhen Bi, Guozhou Zheng, Huajun Chen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);prompting(abstract)

Comments ACL 2024 System Demonstrations; Project website: https://zjunlp.github.io/project/EasyInstruct Code: https://github.com/zjunlp/EasyInstruct Video: https://youtu.be/rfQOWYfziFo Demo: https://huggingface.co/spaces/zjunlp/EasyInstruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10638 2024-06-25 cs.CL cs.AI cs.LG 91%

In-context Pretraining: Language Modeling Beyond Document Boundaries

Weijia Shi, Sewon Min, Maria Lomeli, Chunting Zhou, Margaret Li, Gergely Szilvasy, Rich James, Xi Victoria Lin, Noah A. Smith, Luke Zettlemoyer, Scott Yih, Mike Lewis

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07793 2024-04-18 cs.CL cs.AI cs.LG 91%

GenTKG: Generative Forecasting on Temporal Knowledge Graph with Large Language Models

Ruotong Liao, Xu Jia, Yangzhe Li, Yunpu Ma, Volker Tresp

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);instruction tuning(abstract)

Comments 14 pages, Findings of NAACL 2024, Spotlight on TGL@NeurIPS2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15166 2024-04-05 cs.CL cs.AI cs.LG 91%

SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling

Dahyun Kim, Chanjun Park, Sanghoon Kim, Wonsung Lee, Wonho Song, Yunsu Kim, Hyeonwoo Kim, Yungi Kim, Hyeonju Lee, Jihoo Kim, Changbae Ahn, Seonghoon Yang, Sukyung Lee, Hyunbyung Park, Gyoungjin Gim, Mikyoung Cha, Hwalsuk Lee, Sunghun Kim

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments accepted to NAACL 2024 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07575 2023-11-14 cs.CV cs.AI cs.CL cs.LG 91%

SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models

Ziyi Lin, Chris Liu, Renrui Zhang, Peng Gao, Longtian Qiu, Han Xiao, Han Qiu, Chen Lin, Wenqi Shao, Keqin Chen, Jiaming Han, Siyuan Huang, Yichi Zhang, Xuming He, Hongsheng Li, Yu Qiao

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments Work in progress. Code and demos are released at https://github.com/Alpha-VLLM/LLaMA2-Accessory

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08041 2023-08-15 cs.CV 91%

Planting a SEED of Vision in Large Language Model

Yuying Ge, Yixiao Ge, Ziyun Zeng, Xintao Wang, Ying Shan

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments Technical Report; Project released at: https://github.com/AILab-CVC/SEED

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16888 2024-04-04 cs.CL cs.CR cs.LG 91%

Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection

Jun Yan, Vikas Yadav, Shiyang Li, Lichang Chen, Zheng Tang, Hai Wang, Vijay Srinivasan, Xiang Ren, Hongxia Jin

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);instruction tuning(abstract)

Comments Accepted to NAACL 2024. Project page: https://poison-llm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏