arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138237 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12353 篇

2510.27313 2026-08-04 cs.LG cs.AI cs.CL 版本更新 87%

LLM generation novelty through the lens of semantic similarity

通过语义相似性视角探讨大语言模型的生成新颖性

Philipp Davydov, Ameya Prabhu, Matthias Bethge, Elisa Nguyen, Seong Joon Oh

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学)

专题命中 预训练与数据 :LLM(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过语义相似性视角探讨大语言模型生成新颖性的评估方法,揭示模型在预训练数据中的长序列抽取能力及任务领域对生成新颖性的影响

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13977 2026-07-31 cs.CL cs.AI cs.LG 版本更新 87%

How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data

如何合成高质量的预训练数据?提示设计、生成模型和源数据的系统研究

Joel Niklaus, Atsuki Yamaguchi, Michal Štefánik, Guilherme Penedo, Hynek Kydlíček, Elie Bakouch, Lewis Tunstall, Edward Emanuel Beeching, Thibaud Frere, Colin Raffel, Leandro von Werra, Thomas Wolf

机构 * Hugging Face University of Sheffield(谢菲尔德大学) National Institute of Informatics(日本信息处理研究所)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过大规模实验探讨提示设计、生成模型和源数据对合成预训练数据质量的影响,发现结构化输出格式优于现有方法,且生成模型参数超过1B无额外收益,提出开源数据集FinePhrase。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08693 2026-07-30 cs.CR 版本更新 87%

Recognition Without Mitigation: Ethical Frameworks in Autonomous Offensive-LLM Agent Research

自主渗透测试代理研究中的伦理声明

Andreas Happe, Jürgen Cito

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文分析利用大语言模型进行进攻性安全研究的论文,探讨伦理考量的表达与合理性,揭示学术社区在创新与伦理责任之间的平衡现状。

Comments Accepted at AutonomousCyber 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04728 2026-07-07 cs.CL cs.AI cs.LG 新提交 87%

Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment

将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法

Yu Li, Xiuyu Li, Mingyang Yi, Jiaxing Wang, zhangliangxu, Zhaolong Xing, Zhen Chen

机构 * Renmin University of China(中国人民大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31247 2026-07-01 cs.SD eess.AS 新提交 87%

FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model

FlexiSLM:一种动态可控帧率的语音语言模型

Jiaqi Li, Chaoren Wang, Xiaohai Tian, Mingjie Chen, Xinyu Liang, Xu Li, Yufan Lin, Junwen Qiu, Jun Zhang, Lu Lu, Haizhou Li, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 预训练与数据 :language model(title,abstract);SLM(abstract,abstract_cn);LLM(abstract_cn)

AI总结 提出FlexiSLM,首个支持动态可控帧率的语音语言模型,利用动态帧率表示在高质量点超越固定帧率7B模型,并在6.25 Hz时推理速度减半且保持高质量。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17621 2026-06-26 cs.CV 版本更新 87%

PathFLIP: Fine-grained Language-Image Pretraining for Versatile Computational Pathology

PathFLIP:面向多功能计算病理学的细粒度语言-图像预训练

Fengchun Liu, Songhan Jiang, Linghan Cai, Ziyue Wang, Yongbing Zhang

机构 * Harbin Institute of Technology, Shenzhen, School of Computer Science and Technology(哈尔滨工业大学(深圳)计算机科学与技术学院) National University of Singapore, Department of Electronic and Computer Engineering(新加坡国立大学电子与计算机工程系)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出PathFLIP框架,通过将幻灯片级描述分解为区域级子描述并生成文本条件区域嵌入,实现细粒度视觉-语言对齐,在多个基准上优于现有模型且训练数据更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26050 2026-06-25 cs.LG cond-mat.dis-nn cs.AI cs.CL 新提交 87%

Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining

自然去突现:不对称控制哪些规则在预训练中幸存

Juliana Li, Diya Sreedhar

机构 * Harvard University(哈佛大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 发现语言模型在预训练中学习规则后会自动遗忘,规则存亡由训练数据中支持频率决定,且遗忘不可逆。

Comments Foundations of Deep Generative Models (FoGen) Workshop at ICML 2026. 23 pages (5-page main text plus appendices), 5 figures. Code: https://github.com/lijuliana/Natural-Ungrokking

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11137 2026-06-01 cs.LG cs.AI cs.CL 87%

Weight Decay Improves Language Model Plasticity

权重衰减提升语言模型可塑性

Tessa Han, Sebastian Bordt, Hanlin Zhang, Sham Kakade

机构 * Broad Institute, Schmidt Center(Broad研究所,Schmidt中心) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过系统实验表明,预训练中较大的权重衰减能提高模型的可塑性,使微调后下游性能更优,并揭示了其促进线性可分表示、正则化注意力矩阵和减少过拟合的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20268 2026-05-21 cs.LG cs.AI cs.CL 87%

Chronicle: A Multimodal Foundation Model for Joint Language and Time Series Understanding

Chronicle:一种用于联合语言和时间序列理解的多模态基础模型

Paul Quinlan, Jeremy Levasseur, Qingguo Li, Xiaodan Zhu

机构 * InertialAI Department of Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程系) Department of Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程系)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Chronicle,一种联合训练语言和时间序列的多模态基础模型,通过统一架构实现两者共享参数,从而在多个任务上取得了优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17849 2026-05-19 cs.CL cs.AI cs.LG 87%

Generating Pretraining Tokens from Organic Data for Data-Bound Scaling

从有机数据生成预训练令牌以实现数据驱动的扩展

Zichun Yu, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SynPro框架,通过重新表述和重新格式化操作,帮助大语言模型更充分地利用有限的有机数据,从而在数据驱动的预训练中实现更高效的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15854 2026-05-18 eess.AS 87%

Improving Automatic Speech Recognition for Speakers Treated for Oral Cancer using Data Augmentation and LLM Error Correction

通过数据增强和大语言模型错误校正提升口腔癌患者语音识别性能

Hidde Folkertsma, Thomas Tienkamp, Sebastiaan de Visscher, Max Witjes, Rob van Son, Jiapan Guo, Bence Mark Halpern

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过数据增强和大语言模型错误校正技术,有效提升了口腔癌患者语音识别的性能,实验结果显示在Whisper和MMS模型上分别实现了40%和50%的词错误率降低。

Comments 7 pages, 3 tables. Accepted by EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07244 2026-05-11 cs.LG cs.AI cs.CL 87%

Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models

异构语言模型中的互强化学习经验共享

Xiaoze Liu, Dhananjay Ram, Yuting Zhang, Zhaoyang Zhang, Wei Xia, Stefano Soatto

机构 * Purdue University(普渡大学) AWS Agentic AI(AWS智能体实验室)

专题命中 预训练与数据 :language model(title);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出互强化学习框架,通过共享经验提升异构语言模型性能,采用共享经验交换、多工人资源分配和 tokenizer 异质性层实现跨模型经验共享,验证了在稳定与支持之间取得平衡的可行性。

Comments 50 pages, 10 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01158 2026-05-05 cs.CY 87%

The Hidden Cost of Thinking: Energy Use and Environmental Impact of LMs Beyond Pretraining

思考的隐性成本:语言模型的能耗与环境影响(超出预训练阶段)

Jacob Morrison, Noah A. Smith, Emma Strubell

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

AI总结 研究分析了语言模型全开发流程的环境影响,发现推理模型在数据中心能耗上是指令模型的17倍,开发成本占总计算量的82.2%,整体能耗达12.3GWh,排放4251吨CO2eq,水耗15887千升,需纳入环境报告标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20122 2026-05-01 cs.CL cs.AI cs.IR cs.LG 87%

NanoKnow: How to Know What Your Language Model Knows

NanoKnow: 如何了解你的语言模型知道什么

Lingwei Gu, Nour Jedidi, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过NanoKnow基准数据集分析语言模型知识来源,发现预训练数据频率影响准确性,外部证据可缓解频率依赖,参数与外部知识互补,无关信息损害表现。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21159 2026-04-24 cs.CR cs.AI cs.CL cs.LG 87%

Adaptive Instruction Composition for Automated LLM Red-Teaming

自适应指令生成用于自动化大语言模型红队测试

Jesse Zymet, Andy Luo, Swapnil Shinde, Sahil Wadhwa, Emily Chen

机构 * Capital One, AI Foundations(Capital One人工智能基础研究)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出自适应指令生成框架,通过强化学习平衡探索与利用,提升红队测试的攻击效果与多样性,优于随机组合和现有方法。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18484 2026-04-21 cs.CV cs.MM cs.RO 87%

XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型

Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang

机构 * Tsinghua University(清华大学) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) National University of Singapore(新加坡国立大学) McGill University(麦吉尔大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17930 2026-04-21 cs.CL cs.AI cs.LG 87%

Heterogeneity in Formal Linguistic Competence of Language Models: Is Data the Real Bottleneck?

形式语言能力异质性:数据是否是真正的瓶颈?

H S V N S Kowndinya Renduchintala, Sumit Bhatia

机构 * Adobe Inc.(Adobe公司) Media and Data Science Research(媒体与数据科学研究)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨语言模型在形式语言能力上的差异是否源于架构限制或数据稀缺,通过干预性数据增强显著提升了模型在8个最差BLiMP任务上的表现。

Comments ACL'26 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06571 2026-04-09 cs.CL cs.AI cs.IR cs.LG 87%

LLM-based Schema-Guided Extraction and Validation of Missing-Person Intelligence from Heterogeneous Data Sources

基于大型语言模型的异构数据源中缺失人员情报提取与验证方案

Joshua Castillo, Ravi Mukkamala

机构 * Old Dominion University(欧道明大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Guardian Parser Pack,通过AI驱动的解析与规范化流程,将多源调查文档统一为符合模式的表示,提升缺失人员情报的提取与验证效率,同时展示系统架构及性能评估结果。

Comments 9 pages, 6 figures. Accepted at International Conference on Intelligent Digitization of Systems and Services (IDSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02320 2026-04-08 cs.CV cs.GR 87%

Large-scale Codec Avatars: The Unreasonable Effectiveness of Large-scale Avatar Pretraining

大规模编码者人像:大规模人像预训练的不理性有效性

Junxuan Li, Rawal Khirodkar, Chengan He, Zhongshi Jiang, Giljoo Nam, Lingchen Yang, Jihyun Lee, Egor Zakharov, Zhaoen Su, Rinat Abdrashitov, Yuan Dong, Julieta Martinez, Kai Li, Qingyang Tan, Takaaki Shiratori, Matthew Hu, Peihong Guo, Xuhua Huang, Ariyan Zarei, Marco Pesavento, Yichen Xu, He Wen, Teng Deng, Wyatt Borsos, Anjali Thakrar, Jean-Charles Bazin, Carsten Stoll, Ginés Hidalgo, James Booth, Lucy Wang, Xiaowen Ma, Yu Rong, Sairanjith Thalanki, Chen Cao, Christian Häne, Abhishek Kar, Sofien Bouaziz, Jason Saragih, Yaser Sheikh, Shunsuke Saito

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室)

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出大规模编码者人像模型,通过预训练和后训练相结合的方法,在大规模数据上实现高保真的人像生成,支持多样化的身份和精细表情控制,同时具备泛化能力和鲁棒性。

Comments Accepted in CVPR2026. Website: https://junxuan-li.github.io/lca

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05766 2026-04-08 cs.IR 87%

The LLM Effect on IR Benchmarks: A Meta-Analysis of Effectiveness, Baselines, and Contamination

大型语言模型对信息检索基准的影响:有效性、基线和污染的元分析

Moritz Staudinger, Wojciech Kusa, Allan Hanbury

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过分析143篇论文,探讨了LLM对TREC Robust04和DL20基准的有效性影响,发现LLM系统在DL20上提升nDCG@10达8.8%,但存在数据污染问题,影响效果判断。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00022 2026-04-01 cs.CL cs.AI cs.LG 87%

Aleph-Alpha-GermanWeb: Improving German-language LLM pre-training with model-based data curation and synthetic data generation

Aleph-Alpha-GermanWeb:通过基于模型的数据筛选和合成数据生成改进德语LLM预训练

Thomas F Burns, Letitia Parcalabescu, Stephan Wäldchen, Michael Barlow, Gregor Ziegltrum, Volker Stampa, Bastian Harren, Björn Deiseroth

机构 * Aleph Alpha Research(Aleph Alpha 研究)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种结合启发式与模型筛选技术及合成数据生成的德语数据集筛选流程,构建了628B词的预训练数据集,通过在德语基准测试中显著优于FineWeb2,证明了基于模型的数据筛选和合成数据生成对LLM预训练的提升作用。

Comments 17 pages, 3 figures; published at EACL 2026

Journal ref EACL 2026, volume 1, pages 1267-1283

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02375 2026-03-24 cs.CL cs.AI cs.LG 87%

Pretraining with hierarchical memories: separating long-tail and common knowledge

预训练与层次记忆:区分长尾知识与常识

Hadi Pouransari, David Grangier, C Thomas, Michael Kirchhof, Oncel Tuzel

机构 * Apple(苹果公司)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于层次记忆的预训练方法,通过分离长尾知识与常识,提升模型性能。实验显示,使用内存银行可使小模型性能媲美大模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01268 2026-02-03 cs.CL cs.AI cs.LG stat.ML 87%

AdaDetectGPT: Adaptive Detection of LLM-Generated Text with Statistical Guarantees

AdaDetectGPT:具有统计保证的自适应检测LLM生成文本

Hongyi Zhou, Jin Zhu, Pingfan Su, Kai Ye, Ying Yang, Shakeel A O B Gavioli-Akilagun, Chengchun Shi

机构 * Department of Mathematics(数学系) Tsinghua University(清华大学) School of Mathematics(数学学院) University of Birmingham(伯明翰大学) Department of Statistics(统计系) LSE London, UK(伦敦经济学院) Department of Statistics and Data Science(统计与数据科学系) Department of Decision Analytics and Operations(决策分析与运营系) City University Hong Kong(香港城市大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AdaDetectGPT通过自适应学习见证函数,提高LLM生成文本检测的性能,改进幅度可达37%。

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17300 2025-11-24 cs.CV 87%

MolSight: Optical Chemical Structure Recognition with SMILES Pretraining, Multi-Granularity Learning and Reinforcement Learning

MolSight: 基于SMILES预训练、多粒度学习和强化学习的光学化学结构识别

Wenrui Zhang, Xinggang Wang, Bin Feng, Wenyu Liu

专题命中 预训练与数据 :pretraining(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MolSight通过SMILES预训练、多粒度学习和强化学习,实现高精度的立体化学结构识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00661 2025-11-12 cs.CL cs.AI cs.LG 87%

On the generalization of language models from in-context learning and finetuning: a controlled study

Andrew K. Lampinen, Arslan Chaudhry, Stephanie C. Y. Chan, Cody Wild, Diane Wan, Alex Ku, Jörg Bornschein, Razvan Pascanu, Murray Shanahan, James L. McClelland

机构 * Google DeepMind(谷歌DeepMind) Google DeepMind & Stanford University(谷歌DeepMind与斯坦福大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments FoRLM workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07033 2025-11-11 cs.CR 87%

Uncovering Pretraining Code in LLMs: A Syntax-Aware Attribution Approach

Yuanheng Li, Zhuoyang Chen, Xiaoyun Liu, Yuhao Wang, Mingwei Liu, Yang Shi, Kaifeng Huang, Shengjie Zhao

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12563 2025-11-06 cs.CL cs.AI cs.LG 87%

MetaSynth: Meta-Prompting-Driven Agentic Scaffolds for Diverse Synthetic Data Generation

Haris Riaz, Sourav Bhabesh, Vinayak Arannil, Miguel Ballesteros, Graham Horwood

专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 33 pages, 17 figures. Findings of ACL 2025

Journal ref Findings of the Association for Computational Linguistics: ACL 2025, pp. 18770-18803, Vienna, Austria, 2025. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15990 2025-10-21 cs.LG cs.AI cs.CL 87%

Can GRPO Help LLMs Transcend Their Pretraining Origin?

Kangqi Ni, Zhen Tan, Zijie Liu, Pingzhi Li, Tianlong Chen

机构 * cs.unc.edu(北卡罗来纳大学教堂山分校计算机科学系)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01631 2025-10-03 cs.LG cs.AI cs.CL 87%

Demystifying Synthetic Data in LLM Pre-training: A Systematic Study of Scaling Laws, Benefits, and Pitfalls

Feiyang Kang, Newsha Ardalani, Michael Kuchnik, Youssef Emad, Mostafa Elhoushi, Shubhabrata Sengupta, Shang-Wen Li, Ramya Raghavendra, Ruoxi Jia, Carole-Jean Wu

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a Main Conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23543 2025-09-30 q-bio.GN cs.NE q-bio.MN 87%

Contrastive Learning Enhances Language Model Based Cell Embeddings for Low-Sample Single Cell Transcriptomics

Luxuan Zhang, Douglas Jiang, Qinglong Wang, Haoqi Sun, Feng Tian

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

Comments 14 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏