arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138237 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12353 篇

2112.02125 2022-08-16 cs.CR cs.AI 88%

Examining Zero-Shot Vulnerability Repair with Large Language Models

Hammond Pearce, Benjamin Tan, Baleegh Ahmad, Ramesh Karri, Brendan Dolan-Gavitt

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 18 pages, 19 figures. Accepted for publication in 2023 IEEE Symposium on Security and Privacy (SP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.08534 2022-07-20 cs.CL 88%

Lifelong Pretraining: Continually Adapting Language Models to Emerging Corpora

Xisen Jin, Dejiao Zhang, Henghui Zhu, Wei Xiao, Shang-Wen Li, Xiaokai Wei, Andrew Arnold, Xiang Ren

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments Accepted at NAACL 2022; fixed Figure 7 (a)(b) in Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.13509 2022-05-10 cs.CL 88%

On the Effect of Pretraining Corpora on In-context Learning by a Large-scale Language Model

Seongjin Shin, Sang-Woo Lee, Hwijeen Ahn, Sungdong Kim, HyoungSeok Kim, Boseop Kim, Kyunghyun Cho, Gichang Lee, Woomyoung Park, Jung-Woo Ha, Nako Sung

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments Accepted to NAACL2022 as a long paper. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.08709 2022-05-06 cs.CL 88%

DOCmT5: Document-Level Pretraining of Multilingual Language Models

Chia-Hsuan Lee, Aditya Siddhant, Viresh Ratnakar, Melvin Johnson

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments NAACL 2022 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.10326 2022-03-23 cs.CL 88%

Pretraining with Artificial Language: Studying Transferable Knowledge in Language Models

Ryokan Ri, Yoshimasa Tsuruoka

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11129 2021-09-24 cs.CL 88%

Cross-Lingual Language Model Meta-Pretraining

Zewen Chi, Heyan Huang, Luyang Liu, Yu Bai, Xian-Ling Mao

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.03160 2021-09-10 cs.CL 88%

How much pretraining data do language models need to learn syntax?

Laura Pérez-Mayos, Miguel Ballesteros, Leo Wanner

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments To be published in proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP 2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.09635 2021-03-23 cs.CL 88%

WangchanBERTa: Pretraining transformer-based Thai Language Models

Lalita Lowphansirikul, Charin Polpanumas, Nawat Jantrakulchai, Sarana Nutanong

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments 24 pages, edited the citation of the syllable-level tokenizer from [Chormai et al., 2020] to [Phatthiyaphaibun et al., 2020] as the authors used the syllable-level tokenizer from PyThaiNLP [Phatthiyaphaibun et al., 2020] in the experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.13826 2020-10-28 cs.CL 88%

Semi-Supervised Spoken Language Understanding via Self-Supervised Speech and Language Model Pretraining

Cheng-I Lai, Yung-Sung Chuang, Hung-Yi Lee, Shang-Wen Li, James Glass

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.03720 2020-10-06 cs.CL 88%

Byte Pair Encoding is Suboptimal for Language Model Pretraining

Kaj Bostrom, Greg Durrett

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments 5 pages, 3 figures. To be published in Findings of EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.10389 2020-05-22 cs.CL 88%

Pretraining with Contrastive Sentence Objectives Improves Discourse Performance of Language Models

Dan Iter, Kelvin Guu, Larry Lansing, Dan Jurafsky

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments AC2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.08788 2019-11-22 cs.IR cs.CL 88%

When Low Resource NLP Meets Unsupervised Language Model: Meta-pretraining Then Meta-learning for Few-shot Text Classification

Shumin Deng, Ningyu Zhang, Zhanlin Sun, Jiaoyan Chen, Huajun Chen

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments AAAI student abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.07291 2019-01-23 cs.CL 88%

Cross-lingual Language Model Pretraining

Guillaume Lample, Alexis Conneau

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15195 2026-08-18 cs.CV 新提交 88%

Beyond Natural-Image Foundation Models: Benchmarking Satellite Pretraining for Ophthalmic Image Analysis

超越自然图像基础模型:针对眼科图像分析的卫星图像预训练基准测试

Lovre Antonio Budimir, Mingya Alexa Gong, Alyssa Foong Quinney, Ivana Matovinović, Yukun Zhou, Pearse A. Keane, Sven Lončarić, Marinko V. Šarunić

机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(萨格勒布大学电气工程与计算机学院) University College London(伦敦大学学院) Institute of Ophthalmology, University College London(伦敦大学学院眼科研究所) Department of Computer Science, University College London(伦敦大学学院计算机科学系) NIHR Moorfields Biomedical Research Centre(NIHR穆尔菲尔德生物医学研究中心) Hawkes Institute, University College London(伦敦大学学院霍克斯研究所) Moorfields Eye Hospital NHS Foundation Trust(穆尔菲尔德眼科医院NHS基金会信托)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)

AI总结 本文针对眼科图像分析,对比卫星图像与自然图像预训练的视觉基础模型,发现卫星图像预训练在眼科任务上表现优于自然图像,部分任务可媲美医学专家模型。

Comments Accepted at the ECCV 2026 Workshop on Medical Foundation Models and Benchmarks (MEDFMB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16117 2024-09-26 eess.AS cs.SD 88%

Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration

Pin-Jui Ku, Alexander H. Liu, Roman Korostik, Sung-Feng Huang, Szu-Wei Fu, Ante Jukić

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(title,abstract)

Comments 5 pages, Submitted to ICASSP 2025. The implementation and configuration could be found in https://github.com/NVIDIA/NeMo/blob/main/examples/audio/conf/flow_matching_generative_ssl_pretraining.yaml The audio demo page could be found in https://kuray107.github.io/ssl_gen25-examples/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13430 2024-05-31 cs.CV 88%

MTP: Advancing Remote Sensing Foundation Model via Multi-Task Pretraining

Di Wang, Jing Zhang, Minqiang Xu, Lin Liu, Dongsheng Wang, Erzhong Gao, Chengxi Han, Haonan Guo, Bo Du, Dacheng Tao, Liangpei Zhang

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(title,abstract)

Comments Accepted by IEEE JSTARS Special issue on "Large-Scale Pretraining for Interpretation Promotion in Remote Sensing Domain". The codes and pretrained models are available at https://github.com/ViTAE-Transformer/MTP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16747 2026-08-18 cs.LG cs.AI 新提交 88%

Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments

这会改变你的答案吗?通过反事实实验评估现实场景中大语言模型(LLM)行为的解释

Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks

机构 * Anthropic

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出CHIVE流程,通过反事实实验评估大语言模型行为的解释,发现常见可解释性技术无预测提升,且CHIVE生成的训练数据可实现分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11232 2026-08-13 cs.CL cs.AI 新提交 88%

Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs

Backtrader-Bench:基于自生成多项选择题的算法交易大语言模型智能体基准测试

Ruoxi Zhao, Maziar Raissi

机构 * University of California, Riverside(加利福尼亚大学河滨分校)

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 Backtrader-Bench是用于算法交易LLM智能体的基准框架,通过自生成MCQ解决评估难题,实验显示带工具智能体准确率显著高于无工具模型,还可生成强化学习训练语料以构建专用量化交易智能体。

Comments Accepted to the FinLLM Workshop at IJCAI 2026. Code and data: https://github.com/rzhao999/Backtrader-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24717 2026-07-28 cs.CL cs.AI 新提交 88%

DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data

数据编排器:学习编排预训练数据的示例级整理

Zhen Huang, Yikun Wang, Shijie Xia, Pengfei Liu

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对预训练数据处理未适应各示例需求的问题,提出DataOrchestra框架,统一处理操作并为每个示例编排特定管道,经实验验证该框架在多基准测试中表现良好,在数学持续预训练中有效且能减少计算。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22769 2026-07-28 cs.LG cs.AI 新提交 88%

DomainPilot: Domain-Level Loss-Guided Two-Stage Data Mixture Optimization for Efficient Language Model Fine-Tuning

DomainPilot:用于高效语言模型微调的域级损失引导两阶段数据混合优化

He Zhang

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);SFT(abstract)

AI总结 研究针对大语言模型训练数据问题,提出DomainPilot框架,通过域级损失引导两阶段数据混合优化,经令牌级监测、缩放与混合定律引导优化,在Qwen3-1.7B模型微调中验证,有效提升指标且不增成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14163 2026-07-07 cs.CL cs.AI 版本更新 88%

SeaAlert: Robust Severity Classification and LLM-Based Information Extraction for Noisy Maritime Distress Communications

SeaAlert:基于大型语言模型的海上 distress 通讯关键信息提取

Tomer Atia, Yehudit Aperstein, Alexander Apartsin

机构 * HIT-Holon Institute of Technology(希伯来理工学院) Afeka Academic College of Engineering(阿菲卡工程学院)

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出SeaAlert框架,通过生成合成数据解决海上 distress 通讯标注数据不足问题,利用LLM生成多样化消息并模拟噪声环境,提升自动分析鲁棒性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19168 2026-06-18 cs.AI cs.LG 新提交 88%

Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection

超越安全数据:具有正则安全反射的预训练阶段对齐

Jinhan Li, Kexian Tang, Yihan Xu, Zhuorui Ye, Kaifeng Lyu

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出安全反射预训练方法,在预训练语料中插入安全反思,使模型具备自我监控能力,实验表明该方法能有效降低推理和微调攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15396 2026-06-16 cs.CL cs.AI 新提交 88%

CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

CHILLGuard:面向细粒度中文大语言模型安全护栏的可扩展数据构建与模型感知偏好对齐

Wenbo Yu, Bohua Wang, Hao Fang, Kuofeng Gao, Jingru Zeng, Xiaochen Yang, Tianyi Zhang, Xiaoxiao Ma, Jiawei Kong, Hao Wu, Bin Chen, Shu-Tao Xia, Min Zhang

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen ShenNong Information Technology Co., Ltd.(深圳神农信息技术有限公司)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对中文场景,提出细粒度风险分类体系(5大类31小类),通过可扩展数据构建管道生成高质量训练数据,并采用模型感知直接偏好优化训练CHILLGuard,在基准上F1分数提升15.92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09861 2026-06-10 cs.LG cs.AI 新提交 88%

Time Series as Language: A Universal Tokenizer for General-Purpose Time Series Foundation Models

时间序列作为语言:通用时间序列基础模型的通用分词器

Yunhao Zhang, Ruiying Qi, Jiale Zheng, Jianfeng Zhang, Lujia Pan, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出UniTok通用分词器将时间序列转化为离散令牌,并基于NTP预训练UniTok-FM基础模型,支持零样本预测、提示增强预测以及少样本生成和分类,无需任务特定修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07522 2026-06-09 cs.CL cs.LG cs.SI 新提交 88%

Community-Specific Slang and Entity Detection via Semantic Shift in Fine-Tuned Language Models

通过微调语言模型中的语义偏移检测社区特定俚语和实体

Julia Kruk, Sanchita Porwal, Amitrajit Bhattacharjee, Mansi Phute

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 提出无监督方法,通过测量词在微调前后的语义偏移幅度,从在线社区文本中自动识别俚语、独特实体和民俗用语。

Comments 6 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06833 2026-06-08 cs.LG cs.AI cs.CR 新提交 88%

Hearing the Unspoken: Language Model Priors for Acoustic Adversarial Attacks

听弦外之音:面向声学对抗攻击的语言模型先验

Jiani Xie, Andrew C. Cullen, Paul Montague, Benjamin I. P. Rubinstein

机构 * University of Melbourne(墨尔本大学) DST Group(DST集团)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Semantic Gambit攻击,利用大语言模型实时提供预测上下文,突破因果限制,使实时ASR系统词错误率提升至35.6%,较当前最优方法提高三倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26121 2026-06-01 cs.LG cs.AI 88%

GEM: Geometric Entropy Mixing for Optimal LLM Data Curation

GEM: 用于最优LLM数据策展的几何熵混合

Yue Min, Ziyun Qiao, Ruining Chen, Yujun Li

机构 * The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学) Peking University, Beijing, China(北京大学) University of Science and Technology of China, Hefei, China(中国科学技术大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出GEM框架,通过将数据策展重构为超球面上的变分问题并采用MM算法优化,解决了分类缺陷和嵌入各向异性问题,在1.1B参数模型上实现下游准确率提升1.2%。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26161 2026-05-27 cs.LG cs.AI 88%

TSFMAudit: Data Contamination Auditing in Forecasting Time Series Foundation Models

TSFMAudit: 时间序列基础模型中的数据污染审计

Hongkai Li, Shifeng Xie, Lefei Shen, Zhuo Li, Mouxiang Chen, Xiaobin Zhang, Han Fu, Jianling Sun, Xiaoxue Ren, Chenghao Liu

机构 * Zhejiang University(浙江大学) Télécom Paris(巴黎高等电信学院) State Street Technology (Zhejiang) Ltd.(State Street Technology(浙江)有限公司) Datadog

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对时间序列基础模型(TSFMs)预训练数据污染问题,提出基于探针适应动力学的审计方法TSFMAudit,通过检测微调后损失下降更快且骨干网络移动更小的异常现象来识别污染数据集。

Comments 22 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08809 2026-05-12 cs.CL cs.AI 88%

SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization

SimReg:通过嵌入相似性正则化提升预训练性能

Yan Sun, Guoxia Wang, Jinle Zeng, JiaBin Yang, Shuai Li, Li Shen, Dacheng Tao, DianHai Yu, Haifeng Wang

机构 * Baidu Inc.(百度公司) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SimReg,通过增强相同标签嵌入的相似性与不同标签嵌入的对比,提升预训练效率和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26456 2026-04-30 cs.CL cs.AI 88%

Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation

Naamah:通过DBpedia seeding和LLM生成构建大规模合成梵语命名实体识别语料库

Akhil Rajeev P, Annarao Kulkarni

机构 * Centre for Development of Advanced Computing (C-DAC)(发展高级计算中心)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Naamah,一个包含102942个句子的高质量梵语NER数据集,结合DBpedia实体提取与混合推理模型生成,用于评估XLM RoBERTa和IndicBERTv2模型。

详情

展开后加载摘要…

URL PDF HTML 收藏