arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12365 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2508.15432 2025-12-12 cs.AI cs.CL cs.LG 86%

SyGra: A Unified Graph-Based Framework for Scalable Generation, Quality Tagging, and Management of Synthetic Data

SyGra:一种统一的基于图的框架,用于可扩展的生成、质量标记和管理合成数据

Bidyapati Pradhan, Surajit Dasgupta, Amit Kumar Saha, Omkar Anustoop, Sriram Puttagunta, Vipul Mittal, Gopal Sarda

机构 * ServiceNow Inc.(ServiceNow公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 SyGra提出一种统一的基于图的框架,用于可扩展生成、质量标记和管理合成数据,通过模块化管道和双阶段质量标记机制提升合成对话数据的质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00785 2024-04-16 cs.CL cs.AI cs.LG 86%

BooookScore: A systematic exploration of book-length summarization in the era of LLMs

Yapei Chang, Kyle Lo, Tanya Goyal, Mohit Iyyer

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments ICLR 2024 camera-ready (updated figure1 and table2; corrected minor details in the explanation of hierarchical merging)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01712 2024-02-06 cs.CL cs.AI cs.LG 86%

Socially Aware Synthetic Data Generation for Suicidal Ideation Detection Using Large Language Models

Hamideh Ghanadian, Isar Nejadgholi, Hussein Al Osman

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

Journal ref IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04637 2024-01-10 cs.SE cs.AI cs.CL cs.LG 86%

Applying Large Language Models API to Issue Classification Problem

Gabriel Aracena, Kyle Luster, Fabio Santos, Igor Steinmacher, Marco A. Gerosa

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

Comments 4 pages, 1 figure, NLBSE and ICSE conference submission, ACM formatted, pre print

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07830 2023-10-13 cs.CL cs.AI cs.LG 86%

Does Synthetic Data Make Large Language Models More Efficient?

Sia Gholami, Marwan Omar

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01317 2023-09-11 cs.CV eess.IV 86%

ELIXR: Towards a general purpose X-ray artificial intelligence system through alignment of large language models and radiology vision encoders

Shawn Xu, Lin Yang, Christopher Kelly, Marcin Sieniek, Timo Kohlberger, Martin Ma, Wei-Hung Weng, Atilla Kiraly, Sahar Kazemzadeh, Zakkai Melamed, Jungyeon Park, Patricia Strachan, Yun Liu, Chuck Lau, Preeti Singh, Christina Chen, Mozziyar Etemadi, Sreenivasa Raju Kalidindi, Yossi Matias, Katherine Chou, Greg S. Corrado, Shravya Shetty, Daniel Tse, Shruthi Prabhakara, Daniel Golden, Rory Pilgrim, Krish Eswaran, Andrew Sellergren

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01597 2026-08-18 cs.CL 85%

Unsupervised Improvement of Factual Knowledge in Language Models

Nafis Sadeq, Byungkyu Kang, Prarit Lamba, Julian McAuley

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

Journal ref Proceedings of the 17th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11911 2026-08-14 quant-ph cond-mat.dis-nn cond-mat.str-el cs.AI 版本更新 85%

Hamilton-Zero: A Neural Tensor-Network Foundation Model for Ground States of Arbitrary Quadratic Qubit Hamiltonians

Hamilton-Zero:适用于任意二次量子比特哈密顿量基态的神经张量网络基础模型

Timothy Heightman, Elena Orlova, Philip Mantrov, Aleksei Ustimenko

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出Hamilton-Zero基础模型,将二次量子比特哈密顿量基态学习转化为流形变分优化,经预训练、微调后可在8100量子比特系统上评估,突破经典模拟局限,实现量子基态的高效计算。

Comments 22 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28432 2026-08-13 cs.AI 版本更新 85%

A foundation model of numerical intelligence with cross-disciplinary generalization

具备跨学科泛化能力的数值智能基础模型

Chenghan Wu, Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出UNICON这一数值智能基础模型,可跨学科泛化,结合语言模型智能体后能超越训练未涉及学科的最先进专业人员,训练语料库多样性可提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08885 2026-08-11 physics.soc-ph cs.CL cs.SD 新提交 85%

Towards an LLM-based method for quantifying the sexual content in song lyrics

面向基于大语言模型的歌曲歌词性内容量化方法

Ignacio M. Sticco

专题命中 预训练与数据 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型的可复现方法,量化歌曲歌词主题内容(含性内容),并将其应用于12位雷鬼顿艺术家的1259首歌曲,还发布相关代码与语料库供他人复现或扩展。

Comments 17 pages, 10 figures. Code, scoring prompt, and corpus: https://github.com/ignaciosticco/open-lyrics-scorer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05447 2026-08-07 cs.CL 新提交 85%

Example-Guided Prompting for Document-Level Text Simplification

示例引导提示用于文档级文本简化

Marina Litvak, Ariel Perstin, Ilan Shtilman, Michael Färber

机构 * SCE(SCE(以色列SCE学院)) ScaDS.AI, TUD Dresden(ScaDS.AI,德累斯顿工业大学)

专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对文档级文本简化中提示指导不足的问题,提出示例引导提示方法,经OneStopEnglish语料库实验,可提升大语言模型的简化质量,性能优于或媲美相关基准系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14306 2026-08-04 cs.AI 版本更新 85%

Tracing LLM Behavior to the Training Data with Empirical Next-Token Distributions

利用经验下一个token分布追踪大语言模型行为到训练数据

Zachary Izzo

机构 * NEC Labs America(美国 NEC 实验室)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究大语言模型输出分布与训练数据的联系,通过经验下一个token分布追踪。发现多数输入下二者近乎完美一致且随模型规模等提升,也存在差异,探讨了差异来源,鼓励以数据为中心的机制可解释性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17351 2026-07-29 cs.CL 版本更新 85%

Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers

语言模型的物理:第4.1部分,架构设计与Canon层的魔力

Zeyuan Allen-Zhu

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL

AI总结 本研究提出Canon层,通过轻量级架构组件提升语言模型的推理深度和广度,验证了其在不同架构中的有效性,并展示了其在学术预训练中的潜力。

Comments V1.1 appeared in NeurIPS 2025 main conference; V2 adds GDN experiments, tightens others for a stronger, fairer comparison, and reorganizes sections; V3 adds Result 2.1 and Section 5.2 on how Canon layers improve hierarchical feature learning, from our Jan 2026 talk

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09657 2026-07-21 cs.CV cs.AI cs.MM 版本更新 85%

Scalable Visual Pretraining for Language Intelligence

用于语言智能的可扩展视觉预训练

Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Huanze Tang, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 研究挑战语言模型仅在文本表示上训练的假设,通过对直接利用视觉文档的无监督视觉预训练范式进行系统研究,发现其在多主干和基准上优于仅文本预训练,为可扩展语言智能提供有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16072 2026-07-20 cs.CL 新提交 85%

Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D

前沿语言模型在复制方面存在困难:文本可在二维视角下得到更好理解

Haodong Wen, Yiran Zhang, Yingfa Chen, Kaifeng Lyu

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 研究发现前沿语言模型复制输入字符串存在困难,归因于Transformer架构位置编码问题。为此引入2D-RoPE,将文本组织成二维网格,使复制任务更易学习。实验表明其在复制任务上优势明显,有助于语言建模,鼓励探索二维位置编码潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11290 2026-07-08 cs.CL 版本更新 85%

Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation

多语言教师:评估语言模型用于多语言合成数据生成

Lester James V. Miranda, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 预训练与数据 :language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文评估了多语言教师模型的有效性,通过Polyglot Score衡量数据质量和学生模型表现,发现Gemma 3和Aya Expanse在不同学生模型家族中表现优异,数据质量如提示多样性、长度和响应流畅度对教学效果影响显著。

Comments Added human evaluation experiment results. Code is in https://github.com/ljvmiranda921/polyglot-teachers

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04927 2026-07-07 cs.RO cs.AI 新提交 85%

DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation

DSWAM:用于细粒度机器人操作的双系统世界行动基础模型

Jian Zhu, Jianjun Zhang, Taiyi Su, Tianbin Liu, Zhangyuan Wang, Kai Xie, Zitai Huang, Chong Ma, Youzhang He, Tianjian Wang, Hanyang Wang, Weihao Ding, Yi Xu

机构 * AIRC, Midea Group(美的集团美云智数) Tongji University(同济大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.AI

AI总结 研究针对世界行动模型在复杂任务指令分解及VLA与WAM执行能力对比方面的不足,引入DSWAM,通过双系统结合,利用视觉历史和任务提示预测子任务,经多种训练及加速等实现细粒度机器人操作并进行公平对比。

Comments 13 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17633 2026-06-29 cs.CL 版本更新 85%

Copy First, Translate Later: Interpreting Translation Dynamics in Multilingual Pretraining

先复制,后翻译:在多语言预训练中解读翻译动态

Felicia Körner, Maria Matveev, Florian Eichin, Gitta Kutyniok, Barbara Plank, Michael A. Hedderich

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Mathematics, LMU Munich(数学系,慕尼黑大学) Department of Physics and Technology, University of Tromsø(物理与技术系,特罗姆瑟大学) DLR-German Aerospace Center(德国航空航天中心)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过多语言预训练模型探索语言和翻译能力的早期发展,发现模型在早期阶段通过token级复制获取基本语言能力,翻译能力分两阶段发展。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27275 2026-06-26 cs.CL cs.DL 新提交 85%

How Surprising Is Historical Italian to Language Models? Tokenization Tax, Comprehension Tax, and a Simple Mitigation

历史意大利语对语言模型有多令人惊讶?分词税、理解税以及一种简单的缓解方法

Maria Levchenko

机构 * University of Bologna(博洛尼亚大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出一个诊断框架,将历史语言难度分解为分词成本、预测不确定性、语义鲁棒性和上下文敏感性四个维度,通过17世纪意大利语等数据集评估,发现历史文本存在分词税但语义表示鲁棒,并证明简单的时间上下文提示可将历史意外性降低约60%。

Comments The 22nd Conference on Information and Research Science Connecting to Digital and Library Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19781 2026-06-19 hep-ex cs.AI 新提交 85%

Towards Engineering Scaling Laws with Pretraining Data Composition

迈向基于预训练数据组成的工程化缩放定律

Jan-Lucas Uslu, Kevin Greif, Daniel Whiteson, Benjamin Nachman

机构 * Department of Applied Physics(应用物理系) Stanford University(斯坦福大学) Department of Physics and Astronomy(物理与天文学系) University of California, Irvine(加州大学尔湾分校) SLAC National Accelerator Laboratory(SLAC国家加速器实验室)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过工程化预训练数据组成(增加多样性和与下游任务的对齐)来改变粒子物理中神经网络的缩放行为,使其更偏向数据扩展而非模型扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11220 2026-06-11 cs.CL 新提交 85%

LifeSentence: Language models can encode human life course trajectories from longitudinal panel data

LifeSentence: 语言模型可以从纵向面板数据编码人类生命历程轨迹

Samuel Liu, Muchen Xi, William Yeoh, Joshua J. Jackson

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 提出LifeSentence模型,将大型语言模型与纵向面板数据结合,通过结构化自然语言记录生命事件并微调预训练模型,在少样本条件下超越传统方法,实现生命事件预测与时间顺序重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09338 2026-06-09 cs.CL 新提交 85%

Multi-Hop Knowledge Composition is Bound by Pretraining Exposure

多跳知识组合受限于预训练暴露

Yannis Karmim, Luis Marti, Djamé Seddah, Valentin Barrière

机构 * Inria, Paris, France(法国国家信息与自动化研究所(巴黎)) Inria, Chile(法国国家信息与自动化研究所(智利)) Dept. of Computer Science, Universidad de Chile(智利大学计算机科学系)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现,即使单跳准确率达97%,大语言模型仍无法进行隐式多跳推理,原因是预训练中缺乏组合上下文,而非知识缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06004 2026-06-05 cs.CL 85%

The Generator-Eraser Paradox: Community Guidelines for Responsible LLM-Assisted Dialect Resource Creation

生成器-擦除器悖论:负责任的大语言模型辅助方言资源创建的社区指南

Wajdi Zaghouani

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出生成器-擦除器悖论理论框架,推导出12条社区指南,并通过阿拉伯方言案例展示如何在大语言模型辅助方言资源创建中平衡效率与语言多样性保护。

Journal ref Proceedings of the Workshop on Dialects in NLP - A Resource Perspective (DialRes) @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02971 2026-06-03 cs.CL 85%

EURO-5K: When Does Domain Pretraining Matter? Benchmarking Transformers for EU Reporting Obligation Extraction

EURO-5K:领域预训练何时重要?用于欧盟报告义务提取的Transformer基准测试

Marios Koniaris, Vasileios Kotronis, Eugenia Giannini, Panayiotis Tsanakas

机构 * Division of Computer Science, School of Electrical and Computer Engineering(计算机科学系,电气与计算机工程学院) National Technical University of Athens(雅典技术大学) Department of Humanities Social Sciences and Law, School of Applied Mathematical and Physical Sciences(人文社会科学与法律系,应用数学与物理科学学院)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);prompting(abstract);分类 cs.CL

AI总结 本文构建了EURO-5K数据集,通过对比判别式与生成式模型在欧盟报告义务提取上的表现,发现领域预训练在参数高效微调时收益显著,且模型可作为专用提取器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02646 2026-06-03 physics.soc-ph cs.AI cs.MA 85%

The Ringelmann Effect in Multi-Agent LLM Systems: A Scaling Law for Effective Team Size

多智能体大语言模型系统中的林格曼效应:有效团队规模的缩放定律

Blaž Bertalanič, Carolina Fortuna

机构 * Jozef Stefan Institute(乔泽夫·斯蒂芬研究所)

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.AI

AI总结 本文推导出两参数缩放定律 $R(N) = N_\text{eff}/N = 1/(1+c(N-1)N^{-\beta})$,将多智能体LLM系统分为三种渐近状态,并通过44个实验单元验证了该定律,发现密集辩论无法增加答案多样性,噪声安慰剂可模拟自我修正效果,且仅异构团队能突破硬上限。

Comments 41 pages, 9 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00284 2026-06-02 cs.CL 85%

Parameter Alignment Mitigates Catastrophic Forgetting in Multilingual Expert Language Models

参数对齐减轻多语言专家语言模型中的灾难性遗忘

Sanchit Ahuja, Terra Blevins

机构 * Northeastern University(东北大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 针对多语言持续预训练中的灾难性遗忘问题,提出五种层感知参数对齐策略(硬冻结、软正则化、事后权重恢复和模型合并),在32种训练语言和保留语言上评估,证明参数对齐能有效减少遗忘且语言获取成本低。

Comments 25 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14842 2026-06-01 cs.CV cs.AI 85%

PictSure: Pretraining Embeddings Matters for In-Context Learning Image Classifiers

PictSure:预训练嵌入对上下文学习图像分类器至关重要

Lukas Schiesser, Cornelius Wolff, Sophie Haas, Simon Pukrop

机构 * German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) Centrum Wiskunde & Informatica (CWI)(数学与信息学研究中心(CWI))

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出PictSure视觉上下文学习模型,发现预训练嵌入质量是下游性能的关键瓶颈,而融合层训练数据的多样性影响有限。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14279 2026-05-29 cs.CV cs.CL 85%

Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance

超越文本:通过多模态双注意力和软图像引导减少大型视觉语言模型中的语言偏差

Haozhe Zhao, Shuzheng Si, Liang Chen, Yichi Zhang, Maosong Sun, Mingjia Zhang, Baobao Chang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL

AI总结 针对大型视觉语言模型因语言偏差导致的幻觉问题,提出LACING框架,采用多模态双注意力机制和软图像引导策略,在不增加训练资源的情况下增强视觉理解并减少幻觉。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09258 2026-05-28 cs.LG 85%

Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima

Nexus: 相同预训练损失,通过公共极小值实现更好的下游泛化

Huanran Chen, Huaqing Zhang, Xiao Li, Yinpeng Dong, Ke Shen, Jun Zhu

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Nexus优化器,通过最大化梯度相似性促使不同数据源的损失函数极小值靠近,在保持相同预训练损失的情况下显著提升下游泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16069 2026-05-18 cs.LG 85%

ITGPT: Generative Pretraining on Irregular Timeseries

ITGPT:对不规则时间序列的生成预训练

Antoine Honoré, Ming Xiao

机构 * Division of Information Science and Engineering, KTH Royal Institute of Technology(信息科学与工程系,皇家理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ITGPT,一种针对多模态不规则时间序列的注意力架构,通过自监督学习和生成预训练目标处理不规则采样数据,在医疗和预测维护任务中实现SOTA性能。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏