arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138627 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12379 篇

2506.03535 2026-04-21 cs.SE 83%

Across Programming Language Silos: A Study on Cross-Lingual Retrieval-augmented Code Generation

跨越编程语言壁垒:关于跨语言检索增强型代码生成的研讨

Qiming Zhu, Jialun Cao, Xuanang Chen, Weili Zhang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Shing-Chi Cheung

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了跨语言检索增强型代码生成中的知识转移,通过构建13种编程语言的14000个实例数据集,发现跨语言知识转移非 trivial,且依赖语言亲和力和预训练语料多样性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21686 2026-04-21 cs.CL cs.AI cs.LG 83%

Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework

矩阵:基于点对点的多智能体合成数据生成框架

Dong Wang, Yang Li, Ansong Ni, Ching-Feng Yeh, Youssef Emad, Xinjie Lei, Liam Robbins, Karthik Padthe, Hu Xu, Xian Li, Asli Celikyilmaz, Ramya Raghavendra, Lifei Huang, Carole-Jean Wu, Shang-Wen Li

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Matrix框架,通过去中心化设计实现多智能体协同生成高质量、多样化的合成数据,提升数据生成效率2-15倍,适用于多智能体对话、网络推理数据提取等场景。

Comments MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14142 2026-04-16 cs.LG cs.AI cs.CL 83%

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space

从P(y|x)到P(y):在预训练空间中研究强化学习

Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tencent AI Lab(腾讯AI实验室)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PreRL和DSRL方法,通过优化预训练空间中的边际分布P(y),提升LLM推理能力,并通过NSR机制增强推理效果,实验表明DSRL在推理任务中表现优异。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13103 2026-04-16 cs.SE cs.MA 83%

Fairness in Multi-Agent Systems for Software Engineering: An SDLC-Oriented Rapid Review

多代理系统在软件工程中的公平性:面向软件开发生命周期的快速综述

Corey Yang-Smith, Ronnie de Souza Santos, Ahmad Abdellatif

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了多代理系统在软件工程中的公平性研究,分析了LLM赋能环境下的公平性框架,指出当前研究在评估实践、泛化能力及缓解机制方面存在三大不足。

Comments 8 pages, 4 figures. Accepted to the LLMTrust workshop at FSE Companion 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08706 2026-03-10 cs.AI cs.CL cs.LG 83%

Agentic Critical Training

代理批判训练

Weize Liu, Minghui Liu, Sy-Tuyen Ho, Souradip Chakraborty, Xiyao Wang, Furong Huang

机构 * University of Maryland College Park(马里兰大学学院公园分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。

Comments Project page: https://attention-is-all-i-need.github.io/ACT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13654 2026-03-03 cs.SE cs.CR 83%

SOSecure: Safer Code Generation with RAG and StackOverflow Discussions

SOSecure: 借助检索增强生成与StackOverflow讨论实现更安全的代码生成

Manisha Mukherjee, Vincent J. Hellendoorn

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 SOSecure通过检索增强生成与StackOverflow讨论提升代码安全性,实现71.7%-96.7%的修复率,优于其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16278 2026-01-26 cs.CL cs.AI cs.LG 83%

Better as Generators Than Classifiers: Leveraging LLMs and Synthetic Data for Low-Resource Multilingual Classification

优于分类器:利用大语言模型和合成数据进行低资源多语言分类

Branislav Pecher, Jan Cegin, Robert Belanec, Ivan Srba, Jakub Simko, Maria Bielikova

机构 * Kempelen Institute of Intelligent Technologies(克姆佩尔智能技术研究所) Faculty of Information Technology, Brno University of Technology(信息科技学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本研究利用大语言模型生成合成数据,训练更小的多语言模型,发现生成器在低资源语言中表现更优。

Comments Accepted to the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11330 2025-10-14 cs.SD cs.AI cs.CL cs.LG eess.AS 83%

Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap

KiHyun Nam, Jongmin Choi, Hyeongkeun Lee, Jungwoo Heo, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) University of Seoul, South Korea(首尔大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 5 pages. Submitted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03323 2025-10-03 cs.CL cs.AI cs.LG 83%

Out-of-Distribution Detection using Synthetic Data Generation

Momin Abbas, Muneeza Azmat, Raya Horesh, Mikhail Yurochkin

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Accepted to COLM 2025. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21611 2025-10-01 cs.CL cs.AI cs.LG 83%

When Does Multimodality Lead to Better Time Series Forecasting?

Xiyuan Zhang, Boran Han, Haoyang Fang, Abdul Fatir Ansari, Shuai Zhang, Danielle C. Maddix, Cuixiong Hu, Andrew Gordon Wilson, Michael W. Mahoney, Hao Wang, Yan Liu, Huzefa Rangwala, George Karypis, Bernie Wang

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16531 2025-09-23 cs.CL cs.AI cs.FL cs.LG 83%

Bayesian scaling laws for in-context learning

Aryaman Arora, Dan Jurafsky, Christopher Potts, Noah D. Goodman

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);post-training(abstract);SFT(abstract)

Comments COLM 2025 camera-ready version; 9 pages main text, 39 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04079 2025-06-18 cs.CL cs.AI cs.LG 83%

EuroLLM-9B: Technical Report

Pedro Henrique Martins, João Alves, Patrick Fernandes, Nuno M. Guerreiro, Ricardo Rei, Amin Farajian, Mateusz Klimaszewski, Duarte M. Alves, José Pombal, Nicolas Boizard, Manuel Faysse, Pierre Colombo, François Yvon, Barry Haddow, José G. C. de Souza, Alexandra Birch, André F. T. Martins

机构 * Unbabel Instituto de Telecomunicações & Instituto Superior Técnico, Universidade de Lisboa(电信研究院 & 莱斯特大学技术学院) Carnegie Mellon University(卡内基梅隆大学) MICS, CentraleSupélec, Université Paris-Saclay(MICS、中央圣埃克苏佩里学院、巴黎萨克雷大学) Illuin Technology(Illuin技术公司) University of Edinburgh(爱丁堡大学) Equall(Equall公司) Aveni(Aveni公司) Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) Diabolocom(Diabolocom公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00070 2025-05-05 cs.CL cs.AI cs.LG 83%

ICLR: In-Context Learning of Representations

Core Francisco Park, Andrew Lee, Ekdeep Singh Lubana, Yongyi Yang, Maya Okawa, Kento Nishi, Martin Wattenberg, Hidenori Tanaka

机构 * CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学物理智能联合项目) Department of Physics, Harvard University(哈佛大学物理系) Physics & Informatics Lab, NTT Research Inc.(NTT研究公司物理与信息学实验室) SEAS, Harvard University(哈佛大学科学与工程学院) CSE, University of Michigan, Ann Arbor(密歇根大学安娜堡分校计算机科学系)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments ICLR 2025

Journal ref International Conference on Learning Representations, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12963 2025-05-01 cs.CL cs.AI cs.LG 83%

Open Llama2 Model for the Lithuanian Language

Artūras Nakvosas, Povilas Daniušis, Vytas Mulevičius

机构 * Neurotechnology(神经技术)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 12 pages, 8 figures, 5 tables

Journal ref Informatica, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17115 2025-02-17 cs.CL cs.AI cs.LG 83%

Programming Every Example: Lifting Pre-training Data Quality Like Experts at Scale

Fan Zhou, Zengzhi Wang, Qian Liu, Junlong Li, Pengfei Liu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments 47 pages, 13 figures, 34 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08394 2025-01-03 cs.CV 83%

VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks

Jiannan Wu, Muyan Zhong, Sen Xing, Zeqiang Lai, Zhaoyang Liu, Zhe Chen, Wenhai Wang, Xizhou Zhu, Lewei Lu, Tong Lu, Ping Luo, Yu Qiao, Jifeng Dai

专题命中 预训练与数据 :large language model(title);language model(title)

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11303 2024-12-30 cs.LG cs.AI cs.CL 83%

TSDS: Data Selection for Task-Specific Model Finetuning

Zifan Liu, Amin Karbasi, Theodoros Rekatsinas

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);instruction tuning(abstract);pretraining(abstract)

Comments 31 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17747 2024-12-24 cs.CL cs.AI cs.LG 83%

Deliberation in Latent Space via Differentiable Cache Augmentation

Luyang Liu, Jonas Pfeiffer, Jiaxing Wu, Jun Xie, Arthur Szlam

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14670 2024-10-31 cs.CL cs.AI cs.LG 83%

Exploring Design Choices for Building Language-Specific LLMs

Atula Tejaswi, Nilesh Gupta, Eunsol Choi

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted to EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11402 2024-10-24 cs.CL cs.AI cs.CV cs.LG cs.MM 83%

NVLM: Open Frontier-Class Multimodal LLMs

Wenliang Dai, Nayeon Lee, Boxin Wang, Zhuolin Yang, Zihan Liu, Jon Barker, Tuomas Rintamaki, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Fixed the typos. For more information, please visit our project page at: https://research.nvidia.com/labs/adlr/NVLM-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13861 2024-10-22 cs.CV 83%

PUMA: Empowering Unified MLLM with Multi-granular Visual Generation

Rongyao Fang, Chengqi Duan, Kun Wang, Hao Li, Hao Tian, Xingyu Zeng, Rui Zhao, Jifeng Dai, Hongsheng Li, Xihui Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);instruction tuning(abstract)

Comments Project page: https://rongyaofang.github.io/puma/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18369 2024-10-04 cs.CL cs.AI cs.LG 83%

PromptWizard: Task-Aware Prompt Optimization Framework

Eshaan Agarwal, Joykirat Singh, Vivek Dani, Raghav Magazine, Tanuja Ganu, Akshay Nambi

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13359 2024-09-13 cs.CL cs.AI cs.LG 83%

Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler

Yikang Shen, Matthew Stallone, Mayank Mishra, Gaoyuan Zhang, Shawn Tan, Aditya Prasad, Adriana Meza Soria, David D. Cox, Rameswar Panda

专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01420 2024-08-05 cs.LG cs.AI cs.CL 83%

Mission Impossible: A Statistical Perspective on Jailbreaking LLMs

Jingtong Su, Julia Kempe, Karen Ullrich

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01783 2024-02-06 cs.CL cs.AI cs.LG 83%

Hierarchical Multi-Label Classification of Online Vaccine Concerns

Chloe Qinyu Zhu, Rickard Stureborg, Bhuwan Dhingra

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Published in AAAI 2024 Health Intelligence workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02125 2023-12-07 cs.CL cs.AI cs.LG 83%

TPPoet: Transformer-Based Persian Poem Generation using Minimal Data and Advanced Decoding Techniques

Amir Panahandeh, Hanie Asemi, Esmaeil Nourani

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01218 2023-10-03 cs.CV 83%

Making LLaMA SEE and Draw with SEED Tokenizer

Yuying Ge, Sijie Zhao, Ziyun Zeng, Yixiao Ge, Chen Li, Xintao Wang, Ying Shan

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments Project released at: https://github.com/AILab-CVC/SEED. arXiv admin note: substantial text overlap with arXiv:2307.08041

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11206 2023-05-22 cs.CL cs.AI cs.LG 83%

LIMA: Less Is More for Alignment

Chunting Zhou, Pengfei Liu, Puxin Xu, Srini Iyer, Jiao Sun, Yuning Mao, Xuezhe Ma, Avia Efrat, Ping Yu, Lili Yu, Susan Zhang, Gargi Ghosh, Mike Lewis, Luke Zettlemoyer, Omer Levy

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10745 2026-08-18 cs.CL 版本更新 83%

The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese

首个中文BabyLM挑战:训练数据高效且认知合理的中文语言模型

Siyuan Song, Zhiheng Qian, Yunhao Zhang, Linyang He, Xiaozhe Ji, Yingxin Lin, Hongao Zhu, Chongtian Shao, Chuhan Lang, Luan Li, Rui Wang, Renfen Hu, Shaonan Wang, Hai Hu

机构 * Princeton University(普林斯顿大学) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Columbia University(哥伦比亚大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) University of California San Diego(加利福尼亚大学圣地亚哥分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 首个中文BabyLM挑战将在2026年自然语言处理与中文计算会议举办,要求用1亿中文词元从头训练语言模型,在自然语言理解、认知对齐和汉字知识三轨道评估,不限分词器、模型架构和训练轮数。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18383 2026-08-14 cs.LG 版本更新 83%

TabH2O: A Unified Foundation Model for Tabular Prediction

TabH2O:用于表格预测的统一基础模型

Pascal Pfeiffer, Dmitry Gordeev, Mathias Müller, Laura Fink, Joan Salvà Soler, Mark Landry, Branden Murray, Marcos V. Conde, Sri Satish Ambati

机构 * H2O.ai

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出TabH2O,一种统一的基础模型,通过上下文学习在单次前向传递中实现分类和回归。该模型基于TabICL架构进行了关键改进,包括统一训练、单阶段预训练和噪声感知预训练,从而在表格数据预测任务中表现出色。

Comments Technical Report - https://tabh2o.h2oai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏