arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-07 至 2026-04-07 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 16 篇

2506.17585 2026-04-07 cs.AI cs.CL cs.LG 90%

Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models

Cite Pretrain: 无需检索的知识归因于大语言模型

Yukun Huang, Sanxing Chen, Jian Pei, Manzil Zaheer, Bhuwan Dhingra

机构 * Duke University(杜克大学) Meta

专题命中 预训练与数据 :language model(title,abstract);large language model(title);instruction tuning(abstract);pretraining(abstract)

AI总结 本文提出CitePretrainBench基准,通过修改训练过程使大语言模型在无检索情况下可靠归因于训练期间看到的文档。通过两阶段方法提升模型在短形式和长形式引用任务中的表现,实验显示Active Indexing在多个任务和模型中均取得30.2%的引用精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04204 2026-04-07 cs.CL cs.AI cs.CY cs.ET cs.LG 88%

Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models

LLMs更倾向于哪种英语?通过结构偏见的角度探讨基础模型中对美式英语的偏向

Mir Tafseer Nayeem, Davood Rafiei

机构 * University of Alberta(阿尔伯塔大学)

专题命中 预训练与数据 :foundation model(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过分析基础模型开发各阶段的数据倾向,揭示LLMs在英语方言上的结构性偏见,发现美式英语被优先采用,引发语言同质化和全球AI部署不公的担忧。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21343 2026-04-07 cs.CL cs.AI cs.LG 88%

Self-Improving Pretraining: using post-trained models to pretrain better models

自我改进预训练:利用后训练模型来预训练更好的模型

Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, Ilia Kulikov, Sainbayar Sukhbaatar, Jason Weston, Xian Li, Olga Golovneva

机构 * FAIR at Meta(Meta FAIR)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出一种新的预训练和中训练方法,通过利用已有的强后训练模型来重写预训练数据并判断策略模型的 rollout,从而在早期训练中引入安全、事实性、生成质量和推理能力等关键行为,提升模型整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04723 2026-04-07 cs.CL cs.AI 84%

Individual and Combined Effects of English as a Second Language and Typos on LLM Performance

英语作为第二语言与拼写错误的个体与综合影响

Serena Liu, Yutong Yang, Prisha Sheth, Weixuan Dong, Mingjiao Diao, Xinru Zhu, Nikhil Banga, Oscar Melendez, Arnav Sharma, Minda Zhao, Marina Lin, Mengyu Wang

机构 * Harvard University(哈佛大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了英语作为第二语言和拼写错误对大语言模型性能的影响,发现两者结合时性能下降更显著,且在封闭式任务中表现更一致,而开放式任务结果更混杂。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04271 2026-04-07 cs.NI cs.LG 83%

A Family of Open Time-Series Foundation Models for the Radio Access Network

面向无线接入网络的开放时间序列基础模型家族

Ioannis Panitsas, Leandros Tassiulas

机构 * Department of Electrical and Computer Engineering, Yale University(耶鲁大学电气与计算机工程系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出TimeRAN框架,通过轻量时间序列基础模型和少量任务特定头部,实现跨任务的可迁移表示,提升RAN分析性能并减少系统复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07571 2026-04-07 cs.CL cs.MM 83%

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification

一种通过语音标记增强预训练语言模型用于分类的简单方法

Nicolas Calbucura, Jose Guillen, Valentin Barriere

机构 * Universidad de Chile, DCC(智利大学计算机科学系) Universidad Tecnica Santa Maria(圣玛利亚理工大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出一种简单方法,通过语音信息增强预训练语言模型以提高分类任务性能,采用多模态词袋表示和自监督语言建模目标,实验证明在论证谬误检测和情感计算任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28743 2026-04-07 cs.LG 83%

Rethinking Language Model Scaling under Transferable Hypersphere Optimization

重新思考在可转移超球优化下的语言模型扩展

Liliang Ren, Yang Liu, Yelong Shen, Weizhu Chen

机构 * Microsoft(微软)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出HyperP框架,通过Frobenius球约束和Muon优化器,在模型宽度、深度、训练token和MoE粒度间转移最优学习率,实现更稳定的扩展,同时引入SqrtGate机制提升MoE粒度扩展性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04380 2026-04-07 cs.LG 79%

CPT: Controllable and Editable Design Variations with Language Models

CPT:基于语言模型的可控可编辑设计变体

Karthik Suresh, Amine Ben Khalifa, Li Zhang, Wei-ting Hsu, Fangzheng Wu, Vinay More, Asim Kadav

机构 * Adobe Atta

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本文提出CPT系统,利用解码器-only语言模型生成可编辑的设计变体,通过Creative Markup Language实现结构与细节的精准描述,提升设计流程的可扩展性与个性化。

Comments 18 pages, 6 figures, Accepted at NeurIPS 2025 Workshop on Generative and Protective AI for Content Creation (GenProCC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03911 2026-04-07 cs.LG q-bio.QM 79%

Align Your Structures: Generating Trajectories with Structure Pretraining for Molecular Dynamics

对齐你的结构:利用结构预训练生成分子动力学轨迹

Aniketh Iyengar, Jiaqi Han, Pengwei Sun, Mingjian Jiang, Jianwen Xie, Stefano Ermon

机构 * Stanford University(斯坦福大学) Lambda, Inc(Lambda公司)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文提出利用结构预训练生成分子动力学轨迹的方法,通过扩散模型生成结构并结合插值模块保证时间一致性,有效解决分子动力学数据稀缺问题。

Comments Published at ICLR 2026. 38 pages, 17 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03642 2026-04-07 cs.IR 78%

LLM-based Listwise Reranking under the Effect of Positional Bias

基于大语言模型的列表级重排序在位置偏见影响下的应用

Jingfen Qiao, Jin Huang, Xinyu Ma, Shuaiqiang Wang, Dawei Yin, Evangelos Kanoulas, Andrew Yates

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 本文提出DebiasFirst方法,通过位置校准和位置感知的数据增强缓解大语言模型在列表级重排序中的位置偏见问题,提升排序效果和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01554 2026-04-07 cs.LG cs.AI cs.CV 73%

InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs

InfoTok: 基于信息理论的容量受限共享视觉标记化在统一多模态大语言模型中的应用

Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出InfoTok,一种基于信息瓶颈原理的信息正则化标记化机制,通过互信息约束平衡压缩与任务相关性,提升统一多模态大语言模型的图像理解和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04892 2026-04-07 cs.LG 70%

Data Attribution in Adaptive Learning

自适应学习中的数据归因

Amit Kiran Rege

专题命中 预训练与数据 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文研究自适应学习中的数据归因问题,提出条件干预目标,证明回放信息无法一般性恢复归因,并识别出一个结构类以从日志数据中识别目标。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04469 2026-04-07 cs.CL q-bio.QM 57%

Same Geometry, Opposite Noise: Transformer Magnitude Representations Lack Scalar Variability

相同几何,相反噪声:Transformer幅度表示缺乏标量变异性

Jon-Paul Cacioli

机构 * Independent Researcher, Melbourne, Australia(独立研究者,墨尔本,澳大利亚) Classical Minds, Modern Machines

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 研究发现,Transformer模型在幅度轴上表现出与生物系统相反的标量变异性,其变异性随幅度减小,且分布学习不足以产生恒定变异系数的噪声特征。

Comments 7 pages, 5 figures, 1 table. Pre-registered on OSF (osf.io/w4892). Companion to arXiv:2603.20642

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11298 2026-04-07 cs.AI 57%

Voxtral Realtime

Voxtral Realtime:一种端到端流式自动语音识别模型

Mistral-AI, :, Alexander H. Liu, Andy Ehrenberg, Andy Lo, Chen-Yo Sun, Guillaume Lample, Jean-Malo Delignon, Khyathi Raghavi Chandu, Patrick von Platen, Pavankumar Reddy Muddireddy, Rohin Arora, Sanchit Gandhi, Sandeep Subramanian, Soham Ghosh, Srijan Mishra, Abhinav Rastogi, Adrien Sadé, Alan Jeffares, Albert Jiang, Alexandre Cahill, Alexandre Gavaudan, Alexandre Sablayrolles, Amélie Héliou, Amos You, Andrew Bai, Angele Lenglemetz, Anmol Agarwal, Anton Eliseev, Antonia Calvi, Arjun Majumdar, Avi Sooriyarachchi, Baptiste Bout, Baptiste Rozière, Baudouin De Monicault, Benjamin Tibi, Charlotte Cronjäger, Clémence Lanfranchi, Connor Chen, Corentin Barreau, Corentin Sautier, Cyprien Courtot, Darius Dabert, Diego de las Casas, Elizaveta Demyanenko, Elliot Chane-Sane, Enguerrand Paquin, Etienne Goffinet, Fabien Niel, Faruk Ahmed, Federico Baldassarre, Gabrielle Berrada, Gaëtan Ecrepont, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Giada Pistilli, Guillaume Kunsch, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hope McGovern, Hugo Thimonier, Indraneel Mukherjee, Irene Zhang, Jaeyoung Kim, Jan Ludziejewski, Jason Rute, Joachim Studnia, John Harvill, Jonas Amar, Joséphine Delas, Josselin Somerville Roberts, Julien Tauran, Karmesh Yadav, Kartik Khandelwal, Kilian Tep, Kush Jain, Laurence Aitchison, Laurent Fainsin, Léonard Blier, Lingxiao Zhao, Louis Martin, Lucile Saulnier, Luyu Gao, Maarten Buyl, Manan Sharma, Margaret Jennings, Marie Pellat, Mark Prins, Martin Alexandre, Mathieu Poirée, Mathilde Guillaumin, Matthieu Dinot, Matthieu Futeral, Maxime Darrin, Maximilian Augustin, Mert Unsal, Mia Chiquier, Minh-Quang Pham, Nathan Grinsztajn, Neha Gupta, Olivier Bousquet, Olivier Duchenne, Patricia Wang, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Philippe Pinel, Philomène Chagniot, Pierre Stock, Piotr Miłoś, Prateek Gupta, Pravesh Agrawal, Quentin Torroba, Ram Ramrakhya, Rishi Shah, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Humeau, Sean Cha, Shashwat Verma, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Sumukh Aithal, Szymon Antoniak, Teven Le Scao, Théo Cachet, Theo Simon Sorg, Thibaut Lavril, Thomas Chabal, Thomas Foubert, Thomas Robert, Thomas Wang, Tim Lawson, Tom Bewley, Tom Edwards, Tyler Wang, Umar Jamil, Umberto Tomasini, Valeriia Nemychnikova, Van Phung, Vedant Nanda, Victor Jouault, Vincent Maladière, Virgile Richard, Vladislav Bataev, Wassim Bouaziz, Wen-Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yannic Neuhaus, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yimu Pan, Zaccharie Ramzi, Zhenlin Xu

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 Voxtral Realtime是一种端到端的流式自动语音识别模型,能在亚秒延迟内实现离线转录质量。该模型通过显式对齐音频和文本流,优于传统分块或滑动窗口方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10053 2026-04-07 cs.LG stat.ML 57%

xRFM: Accurate, scalable, and interpretable feature learning models for tabular data

xRFM:用于表格数据的准确、可扩展且可解释的特征学习模型

Daniel Beaglehole, David Holzmüller, Adityanarayanan Radhakrishnan, Mikhail Belkin

机构 * Computer Science and Engineering(计算机科学与工程) INRIA Saclay Halıcıoğlu Data Science Institute(Halıcıoğlu数据科学研究所) UC San Diego(加州大学圣地亚哥分校) MIT Mathematics(麻省理工学院数学系) Broad Institute of MIT and Harvard(麻省理工学院和哈佛大学博德研究所)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 本文提出xRFM,结合特征学习核机与树结构,实现数据局部结构适应和大规模训练数据处理,优于31种方法,在100个回归数据集和200个分类数据集上表现优异且具备可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03572 2026-04-07 cs.CV physics.optics 50%

Physics-Informed Untrained Learning for RGB-Guided Superresolution Single-Pixel Hyperspectral Imaging

基于物理的无训练学习用于RGB引导的超分辨率单像素超光谱成像

Hao Zhang, Bilige Xu, Lichen Wei, Xu Ma, Wenyi Ren

机构 * College of Science, Northwest Agriculture & Forestry University(西北农林科技大学理学院) Key Laboratory of Photoelectronic Imaging Technology and System, School of Optics and Photonics, Beijing Institute of Technology(北京理工大学光电学院光电成像技术与系统教育部重点实验室) State Key Laboratory of Digital Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学数字制造装备与技术国家重点实验室)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出一种基于物理的无训练框架,利用未训练的神经网络和RGB引导,实现超分辨率和超光谱重建,无需外部训练数据,实验表明其在重建精度和光谱保真度上优于现有方法。

Comments 9 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏