arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138237 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12353 篇

2507.02850 2026-04-21 cs.CL cs.CR cs.LG 88%

LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users

LLM催眠:利用用户反馈进行未经授权的知识注入以影响所有用户

Almog Hilel, Riddhi Bhagwat, Idan Shenfeld, Jacob Andreas, Leshem Choshen

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示语言模型通过用户反馈进行知识注入的漏洞,通过反馈信号可操控模型行为,导致事实错误、代码漏洞和虚假新闻。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02370 2026-04-21 cs.CL cs.AI 88%

How Training Data Shapes the Use of Parametric and In-Context Knowledge in Language Models

训练数据如何塑造语言模型中参数知识和上下文知识的使用

Minsung Kim, Dong-Kyum Kim, Jea Kwon, Nakyeong Yang, Kyomin Jung, Meeyoung Cha

机构 * Seoul National University(首尔国立大学) Max Planck Institute for Security and Privacy(安全与隐私研究所)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 研究通过合成语料库实验,发现语言模型在处理参数知识和上下文知识时,需同时存在文档内重复、适度不一致和知识分布偏斜等特性才能实现稳健平衡的使用。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06056 2026-04-21 cs.CL cs.AI 88%

Data Compressibility Quantifies LLM Memorization

数据压缩性量化大语言模型的记忆性

Yizhan Huang, Zhe Yang, Meifang Chen, Huang Nianchen, Jianping Zhang, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) University of Southern California(南加州大学) Meta

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过数据压缩性量化大语言模型的记忆性,发现集级别指标能揭示熵与记忆性之间的线性关系。

Comments accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20760 2026-04-21 cs.CL cs.AI 88%

Attributing Culture-Conditioned Generations to Pretraining Corpora

将文化条件化生成归因于预训练语料

Huihan Li, Arnav Goel, Keyu He, Xiang Ren

机构 * University of Southern California(南加州大学) IIIT Delhi(德里印度理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析预训练数据模式,探讨预训练如何导致文化条件化生成的偏差,提出MEMOed框架以识别记忆化生成,并发现高频文化生成更多记忆符号,而低频文化则无生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17682 2026-04-14 cs.CL cs.AI 88%

Tuning Language Models for Robust Prediction of Diverse User Behaviors

调优语言模型以鲁棒预测多样化用户行为

Fanjin Meng, Jingtao Ding, Jiahui Gong, Chen Yang, Hong Chen, Zuojian Wang, Haisheng Lu, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系,BNRist) Honor Device Co., Ltd(荣耀终端有限公司)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 本文提出BehaviorLM,通过分阶段微调提升模型对长尾用户行为的预测能力,实验表明其在两个真实数据集上有效提升了对锚点和长尾行为的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06806 2026-04-14 cs.CL cs.AI 88%

MachineLearningLM: Scaling Many-shot In-context Learning via Continued Pretraining

MachineLearningLM: 通过持续预训练扩展多示例上下文学习

Haoyu Dong, Pengkun Zhang, Mingzhe Lu, Yanzhen Shen, Guolin Ke

机构 * UCAS(中国科学院大学) Microsoft(微软) SCUT(华南理工大学) Stanford(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MachineLearningLM通过持续预训练赋予大语言模型强大的上下文机器学习能力,同时保持其通用知识和推理能力,提升多示例任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06829 2026-04-10 cs.CL cs.AI 88%

WRAP++: Web discoveRy Amplified Pretraining

WRAP++:增强式网络发现预训练

Jiang Zhou, Yunhao Wang, Xing Wu, Tinghao Yu, Feng Zhang

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 WRAP++通过发现跨文档关系增强事实关联上下文,生成跨文档问答数据,提升模型在SimpleQA上的表现。

Comments Work in progress. Correspondence to ucaswu@tencent.com or wuxing@iie.ac.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12151 2026-03-13 cs.LG cs.AI 88%

IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL

IsoCompute Playbook: 优化LLM RL中的采样计算规模

Zhoujun Cheng, Yutao Xie, Yuxiao Qu, Amrith Setlur, Shibo Hao, Varad Pimpalkhute, Tongtong Liang, Feng Yao, Zhengzhong Liu, Eric Xing, Virginia Smith, Ruslan Salakhutdinov, Zhiting Hu, Taylor Killian, Aviral Kumar

机构 * UC San Diego(UC圣地亚哥大学) MBZUAI-IFM Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了LLM RL中采样计算的最优分配,发现并行回放数随计算预算增加而增加并饱和,不同问题驱动机制不同,且增加并行回放可减少干扰,问题数影响训练稳定性。

Comments 29 pages, 27 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11089 2026-03-09 cs.CL cs.AI 88%

DataChef: Cooking Up Optimal Data Recipes for LLM Adaptation via Reinforcement Learning

DataChef: 通过强化学习为LLM适应生成最优数据配方

Yicheng Chen, Zerun Ma, Xinchen Xie, Yining Li, Kai Chen

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 DataChef通过强化学习自动生成最优数据配方,使LLM适应性能达到人类专家水平。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04731 2026-02-05 cs.CL cs.LG 88%

Less Finetuning, Better Retrieval: Rethinking LLM Adaptation for Biomedical Retrievers via Synthetic Data and Model Merging

更少微调,更好检索:通过合成数据和模型合并重新思考LLM适应于生物医学检索器

Sameh Khattab, Jean-Philippe Corbeil, Osman Alperen Koraş, Amin Dada, Julian Friedrich, François Beaulieu, Paul Vozila, Jens Kleesiek

机构 * IKIM, University Hospital Essen(IKIM,埃森大学医院) Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出STM框架,通过合成数据和模型合并提升生物医学检索性能,实验显示在任务特定专家上提升23.5%并优于基线模型。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02266 2026-02-03 cs.CL cs.AI 88%

OpenSeal: Good, Fast, and Cheap Construction of an Open-Source Southeast Asian LLM via Parallel Data

OpenSeal: 通过并行数据高效构建开源东南亚LLM

Tan Sang Nguyen, Muhammad Reza Qorib, Hwee Tou Ng

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 OpenSeal通过并行数据高效构建了首个开源东南亚LLM,实现了与现有模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02189 2025-11-10 cs.CL cs.AI 88%

Learning Dynamics of Meta-Learning in Small Model Pretraining

David Demitri Africa, Yuval Weiss, Paula Buttery, Richard Diehl Martinez

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments Accepted (oral) to Student Research Workshop at IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19811 2025-10-23 cs.CL cs.LG 88%

Hubble: a Model Suite to Advance the Study of LLM Memorization

Johnny Tian-Zheng Wei, Ameya Godbole, Mohammad Aflah Khan, Ryan Wang, Xiaoyuan Zhu, James Flemings, Nitya Kashyap, Krishna P. Gummadi, Willie Neiswanger, Robin Jia

机构 * University of Southern California(南加州大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18671 2025-10-17 cs.LG cs.AI 88%

Innovator: Scientific Continued Pretraining with Fine-grained MoE Upcycling

Ning Liao, Xiaoxing Wang, Zehao Lin, Weiyang Guo, Feng Hong, Shixiang Song, Geng Yu, Zihua Zhao, Sitao Xie, Longxuan Wei, Xiangqi Jin, Xiaohan Qin, Jiale Ma, Kai Chen, Jiangchao Yao, Zhouhan Lin, Junchi Yan, Zhiyu Li, Feiyu Xiong, Yanfeng Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)技术有限公司) Institute for Advanced Algorithms Research, Shanghai.(上海先进算法研究所)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18917 2025-10-07 cs.LG cs.AI 88%

Behavior Injection: Preparing Language Models for Reinforcement Learning

Zhepeng Cen, Yihang Yao, William Han, Zuxin Liu, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);post-training(abstract);SFT(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10975 2025-08-21 cs.LG cs.CL 88%

BeyondWeb: Lessons from Scaling Synthetic Data for Trillion-scale Pretraining

DatologyAI, :, Pratyush Maini, Vineeth Dorna, Parth Doshi, Aldo Carranza, Fan Pan, Jack Urbanek, Paul Burstein, Alex Fang, Alvin Deng, Amro Abbas, Brett Larsen, Cody Blakeney, Charvi Bannur, Christina Baek, Darren Teh, David Schwab, Haakon Mongstad, Haoli Yin, Josh Wills, Kaleigh Mentzer, Luke Merrick, Ricardo Monti, Rishabh Adiga, Siddharth Joshi, Spandan Das, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Blog version can be viewed at: http://blog.datologyai.com/beyondweb

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02927 2025-07-08 cs.CL cs.AI cs.SD eess.AS 88%

A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations

Phurich Saengthong, Boonnithi Jiaramaneepinit, Sheng Li, Manabu Okumura, Takahiro Shinozaki

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);SLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23462 2025-07-01 cs.LG cs.AI 88%

Can We Predict the Unpredictable? Leveraging DisasterNet-LLM for Multimodal Disaster Classification

Manaswi Kulahara, Gautam Siddharth Kashyap, Nipun Joshi, Arpita Soni

机构 * TERI School Of Advanced Studies(TERI高级研究学院) Macquarie University(麦考瑞大学) Cornell University(康奈尔大学) Eudoxia Research University(欧多西亚研究大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted in the 2025 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2025), scheduled for 3 - 8 August 2025 in Brisbane, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20331 2025-06-26 cs.CL cs.LG 88%

Biomed-Enriched: A Biomedical Dataset Enriched with LLMs for Pretraining and Extracting Rare and Hidden Content

Rian Touchent, Nathan Godey, Eric de la Clergerie

机构 * Sorbonne Université(索邦大学) INRIA Paris(巴黎国家信息与自动化研究所)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments Dataset link: https://hf.co/datasets/almanach/Biomed-Enriched

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07274 2025-06-10 cs.CL cs.AI 88%

Parsing the Switch: LLM-Based UD Annotation for Complex Code-Switched and Low-Resource Languages

Olga Kellert, Nemika Tyagi, Muhammad Imran, Nelvin Licona-Guevara, Carlos Gómez-Rodríguez

机构 * Arizona State University(亚利桑那州立大学) Universidade da Coruña, CITIC(科鲁纳大学,CITIC)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24871 2025-06-06 cs.CV cs.CL cs.LG 88%

MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning

Yiqing Liang, Jielin Qiu, Wenhao Ding, Zuxin Liu, James Tompkin, Mengdi Xu, Mengzhou Xia, Zhengzhong Tu, Laixi Shi, Jiacheng Zhu

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Project Webpage: https://modomodo-rl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24340 2025-06-02 cs.CV cs.CL cs.LG 88%

GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models

Gilles Quentin Hacheme, Girmaw Abebe Tadesse, Caleb Robinson, Akram Zaytar, Rahul Dodhia, Juan M. Lavista Ferres

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18940 2025-05-30 cs.AI cs.LG cs.MA 88%

Language Agents with Reinforcement Learning for Strategic Play in the Werewolf Game

Zelai Xu, Chao Yu, Fei Fang, Yu Wang, Yi Wu

机构 * Zelai Xu(泽来许) Chao Yu(姚朝) Fei Fang(方飞) Yu Wang(王宇) Yi Wu(吴毅)

专题命中 预训练与数据 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Published in ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19722 2025-05-27 cs.CL cs.AI 88%

Distilling Closed-Source LLM's Knowledge for Locally Stable and Economic Biomedical Entity Linking

Yihao Ai, Zhiyuan Ning, Weiwei Dai, Pengfei Wang, Yi Du, Wenjuan Cui, Kunpeng Liu, Yuanchun Zhou

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Changsha Aier Eye Hospital(长沙爱尔眼科医院) Portland State University(波特兰州立大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted by ICIC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19313 2025-05-07 cs.AI cs.CL econ.GN q-fin.EC 88%

Language Models Trained to do Arithmetic Predict Human Risky and Intertemporal Choice

Jian-Qiao Zhu, Haijiang Yan, Thomas L. Griffiths

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Department of Psychology(心理学系) University of Warwick(沃里克大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09045 2025-04-21 cs.CY cs.AI cs.CL stat.AP 88%

United in Diversity? Contextual Biases in LLM-Based Predictions of the 2024 European Parliament Elections

Leah von der Heyde, Anna-Carolina Haensch, Alexander Wenz, Bolei Ma

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17377 2025-04-08 cs.CL cs.AI cs.IR 88%

Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens

Jiacheng Liu, Sewon Min, Luke Zettlemoyer, Yejin Choi, Hannaneh Hajishirzi

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

Comments Published at COLM 2024, spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05019 2025-04-08 cs.LG cs.CL 88%

Mixture-of-Personas Language Models for Population Simulation

Ngoc Bui, Hieu Trung Nguyen, Shantanu Kumar, Julian Theodore, Weikang Qiu, Viet Anh Nguyen, Rex Ying

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12294 2025-03-18 cs.CL cs.AI 88%

The Lucie-7B LLM and the Lucie Training Dataset: Open resources for multilingual language generation

Olivier Gouvert, Julie Hunter, Jérôme Louradour, Christophe Cerisara, Evan Dufraisse, Yaya Sy, Laura Rivière, Jean-Pierre Lorré, OpenLLM-France community

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10329 2025-02-25 cs.LG cs.AI 88%

GraphCLIP: Enhancing Transferability in Graph Foundation Models for Text-Attributed Graphs

Yun Zhu, Haizhou Shi, Xiaotang Wang, Yongchao Liu, Yaoke Wang, Boci Peng, Chuntao Hong, Siliang Tang

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted to WWW'25

详情

展开后加载摘要…

URL PDF HTML 收藏