arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138627 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12379 篇

2606.03270 2026-06-03 cs.LG cs.AI 84%

Are Common Substructures Transferable? Riemannian Graph Foundation Model with Neural Vector Bundles

常见子结构可迁移吗?基于神经向量丛的黎曼图基础模型

Li Sun, Zhenhao Huang, Yiding Wang, Qin Chen, Pietro Lio, Philip S. Yu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对图结构迁移性理论缺失的问题,提出基于黎曼几何的神经向量丛框架GAUGE,通过内在几何学习实现可迁移子结构表征,在零样本链接预测和图同构任务中验证了优越性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15619 2026-06-03 cs.CL cs.AI 84%

Typhoon: Towards an Effective Task-Specific Masking Strategy for Pre-trained Language Models

Typhoon: 面向预训练语言模型的有效任务特定掩码策略

Muhammed Shahir Abdurrahman, Hashem Elezabi, Bruce Changlong Xu

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Typhoon,一种基于任务损失梯度的自适应掩码策略,在GLUE任务上对比随机掩码和整词掩码,经严格评估发现无显著优势。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00613 2026-06-02 cs.CL cs.AI 84%

Linguistics-Aware Non-Distortionary LLM Watermarking

语言学感知的无失真LLM水印

Shinwoo Park, Hyejin Park, Hyeseon An, Yo-Sub Han

机构 * Yonsei University(延世大学) Rensselaer Polytechnic Institute(罗切斯特理工学院)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出LUNA水印方法,通过语言自适应非失真二元锦标赛采样器,在保持文本质量的同时实现高检测性能,在12种设置中AUROC达0.9959且中位困惑度偏移仅0.045。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31586 2026-06-01 cs.CL cs.AI 84%

Language Models Learn Constructional Semantics, Not To Mention Syntax: Investigating LM Understanding of Paired-Focus Constructions

语言模型学习构式语义,更不用说句法:探究LM对配对焦点构式的理解

Wesley Scivetti, Ethan Wilcox, Nathan Schneider, Kanishka Misra, Leonie Weissweiler

机构 * Georgetown University(乔治城大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Leipzig University(莱比锡大学)

专题命中 预训练与数据 :language model(title);LLM(abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 通过构建新数据集,研究不同规模开源语言模型对英语中稀有配对焦点构式(如“let alone”)的语义理解,发现中等规模模型能掌握其形式和意义,且语义学习晚于句法知识,并与世界知识相关。

Comments Conference on Natural Language Learning (CoNLL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27383 2026-05-28 cs.CL cs.AI 84%

Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models

弥合稳定性与表现力之间的差距:低资源口语语言模型的合成数据扩展与偏好对齐

Yizhong Geng, Yanliang Li, Jinghan Yang, Tianhan Jiang, Boxun An, Ya Li, Xiaoyu Shen

机构 * Beijing University of Posts(北京邮电大学) University of California, USA(美国加州大学) Northwestern University, USA(美国西北大学) Eastern Institute of Technology, Ningbo, China(宁波工程技术学院)

专题命中 预训练与数据 :language model(title,abstract);SLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 针对低资源口语语言模型因合成数据导致的表现力崩溃问题,提出两种自对齐框架(DGSA和TDSC)以恢复韵律多样性,实现超越商业系统的性能并首次支持老挝语零样本语音克隆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26026 2026-05-26 cs.CV cs.AI cs.LG 84%

A Multimodal 3D Foundation Model for Light Sheet Fluorescence Microscopy Enables Few-Shot Segmentation, Classification, and Deblurring

一种用于光片荧光显微镜的多模态3D基础模型实现少样本分割、分类和去模糊

Adina Scheinfeld, Haotan Zhang, Shang Mu, Rudolf L. M. van Herten, Lucas Stoffl, Ali Erturk, Zhuhao Wu, Johannes C. Paetzold

机构 * Tri-Institutional Program in Computational Biology \& Medicine, Weill Cornell Medicine, New York, NY, USA Department of Radiology, Weill Cornell Medicine, New York, NY, USA Helen Robert Appel Alzheimers Disease Research Institute, Feil Family Brain Mind Research Institute, Weill Cornell Medicine, New York, NY, USA Graduate Program in Physiology, Biophysics Systems Biology, Weill Cornell Medicine, New York, NY, USA Cornell Tech, New York, NY, USA Institute for Intelligent Biotechnologies (iBIO), Helmholtz Center Munich, Neuherberg, Germany Institute for Stroke Dementia Research, Klinikum der Universität München, Ludwig-Maximilians University Munich, Munich, Germany

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于掩码重建与图像-文本对齐联合优化的3D基础模型,在光片荧光显微镜数据上预训练,通过少样本适应显著降低标注成本并提升分割、分类和去模糊性能。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19097 2026-05-26 cs.LG cs.AI 84%

DIVER-1: Scaling Intracranial EEG Foundation Models for Transferable Representations

DIVER-1: 扩展颅内脑电图基础模型以实现可迁移表示

Danny Dongyeop Han, Yonghyeon Gwon, Ahhyun Lucy Lee, Taeyang Lee, Seong Jin Lee, Jubin Choi, Sebin Lee, Jihyun Bang, Seungju Lee, David Keetae Park, Shinjae Yoo, Chun Kee Chung, Jiook Cha

机构 * Seoul National University(首尔国立大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出DIVER-1自监督iEEG基础模型,通过可变电极-时间注意力、时空重采样等设计处理可变输入,在5310小时ECoG和SEEG上预训练,在认知解码和癫痫检测任务上超越现有模型,并首次进行受控计算感知的扩展研究。

Comments 31 pages, 12 figures, 14tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04768 2026-05-22 cs.LG cs.AI 84%

Billion-Scale Graph Foundation Models

十亿级图基础模型

Maya Bechler-Speicher, Yoel Gottlieb, Andrey Isakov, David Abensur, Ami Tavory, Daniel Haimovich, Ido Guy, Udi Weinsberg

机构 * Meta

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphBFF,一种用于构建大规模异构图的十亿参数图基础模型的端到端方法,通过引入GraphBFF Transformer架构,揭示了异构图的神经缩放定律,并在多个下游任务中展示了其优越的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19284 2026-05-20 cs.CL cs.LG 84%

Language models struggle with compartmentalization

语言模型在 compartmentalization 方面遇到困难

Thomas Vincent Howe, David Wingate

机构 * Department of Computer Science(计算机科学系) Brigham Young University

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了大型语言模型在处理统一概念的不同表达方式时的 compartmentalization 问题,发现模型在不同表达方式之间无法有效共享统计信息,导致模型容量浪费和样本效率降低。

Comments 9 pages, 8 figures, plus 9 pages of appendices. Submitted to NeurIPS 2026. Code: https://github.com/vinhowe/compartmentalization. Eval data: https://doi.org/10.5281/zenodo.20171021

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18971 2026-05-20 cs.LG cs.AI 84%

Shaping the Prior: How Synthetic Task Distributions Determine Tabular Foundation Model Quality

塑造先验:合成任务分布如何决定表格基础模型的质量

Mohamed Bouadi, Nassim Bouarour, Varun Kulkarni, Shivam Dubey, Aditya Tanna, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了合成任务分布对表格基础模型质量的影响,提出O'Prior方法,通过四个耦合组件构建更真实的先验,提升了下游任务的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12715 2026-05-18 cs.LG cs.CL 84%

Scaling Laws for Mixture Pretraining Under Data Constraints

混合预训练下的扩展规律

Anastasiia Sedova, Skyler Seto, Natalie Schluter, Pierre Ablin

机构 * Apple(苹果公司)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究混合预训练中数据限制下的扩展规律,发现重复是影响目标领域性能的核心因素,提出考虑重复的混合扩展定律以优化预训练配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23410 2026-05-18 cs.LG cs.AI eess.SP q-bio.NC 84%

Brain-OF: An Omnifunctional Foundation Model for fMRI, EEG and MEG

Brain-OF:一种适用于fMRI、EEG和MEG的多功能基础模型

Hanning Guo, Hanwen Bi, Farah Abdellatif, Andrei Galbenus, Jon. N. Shah, Abigail Morrison, Jürgen Dammers

机构 * INM-4, Forschungszentrum Jülich, Germany(Jülich 研究中心 INM-4 实验室,德国) Department of Computer Science(计算机科学系) Software Engineering, RWTH Aachen University, Germany(软件工程,亚琛工业大学,德国) INM-7, Forschungszentrum Jülich, Germany(Jülich 研究中心 INM-7 实验室,德国) Institute of Systems Neuroscience, Heinrich Heine University, Germany(系统神经科学研究所,海因里希·海涅大学,德国) Department of Neurology, RWTH Aachen University, Germany(神经病学系,亚琛工业大学,德国) JARA-BRAIN-Translational Medicine, Germany(JARA-BRAIN 转化医学,德国) INM–11, JARA, Forschungszentrum Jülich, Germany(JARA-INM-11 实验室,Jülich 研究中心,德国) IAS-6, Forschungszentrum Jülich, Germany(IAS-6 实验室,Jülich 研究中心,德国) Department of Psychiatry, Psychotherapy and Psychosomatics, RWTH Aachen University, Germany(精神病学、心理治疗和精神病理学系,亚琛工业大学,德国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 Brain-OF通过联合预训练fMRI、EEG和MEG数据,解决多模态数据语义异质性和分辨率差异问题,提升跨模态数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15179 2026-05-15 cs.LG cs.AI physics.comp-ph 84%

Eradicating Negative Transfer in Multi-Physics Foundation Models via Sparse Mixture-of-Experts Routing

通过稀疏混合专家路由消除多物理基础模型中的负迁移

Ellwil Sharma, Arastu Sharma

机构 * Shodh AI

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Shodh-MoE模型,通过稀疏激活的潜在变换器架构解决多物理传输中的负迁移问题,实现精确质量守恒和领域自适应路由。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10760 2026-05-12 cs.CL cs.LG stat.ML 84%

Why is prompting hard? Understanding prompts on binary sequence predictors

为何提示难以掌握?理解二进制序列预测器上的提示

Li Kevin Wenliang, Anian Ruoss, Jordi Grau-Moya, Marcus Hutter, Tim Genewein

机构 * Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :prompting(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了二进制序列预测器上提示的挑战,通过实验揭示了预训练分布对最优提示识别的影响,并分析了前沿模型中提示的统计和经验模式。

Journal ref Artificial Intelligence and Statistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07554 2026-05-11 cs.LG cs.AI q-bio.BM stat.ML 84%

ProteinJEPA: Latent prediction complements protein language models

ProteinJEPA:潜在预测补充蛋白质语言模型

Dan Ofer, Dafna Shahaf, Michal Linial

机构 * Department of Biological Chemistry(生物化学系) School of Computer Science and Engineering(计算机科学与工程学院) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在匹配的运行时间预算下,潜在空间预测能否补充蛋白质语言模型的token级目标。通过35-150M参数的预训练和随机初始化蛋白质序列编码器,发现最佳的Protein-JEPA设计是仅在掩码位置预测潜在目标并保留MLM交叉熵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15564 2026-05-01 cs.SE cs.AI cs.LG 84%

OpenClassGen: A Large-Scale Corpus of Real-World Python Classes for LLM Research

OpenClassGen: 一个大规模的真实世界Python类语料库用于大语言模型研究

Musfiqur Rahman, SayedHassan Khatoonabadi, Emad Shihab

机构 * Concordia University(康科德大学)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 OpenClassGen提供324,843个Python类的语料库,用于评估大语言模型的代码生成能力,通过类骨架和静态代码度量指标,支持多种应用场景。

Comments This paper has been accepted for publication at the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026) AI models/data track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02132 2026-04-23 cs.CL cs.LG 84%

Model Internal Sleuthing: Finding Lexical Identity and Inflectional Features in Modern Language Models

模型内部侦探:在现代语言模型中寻找词汇身份和屈折特征

Michael Li, Nishant Subramani

机构 * Carnegie Mellon University - Language Technologies Institute(卡内基梅隆大学-语言技术研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究通过分析25个模型的词汇身份和屈折特征,发现屈折特征在模型中线性可解,而词汇身份在早期显著但随深度减弱,揭示了transformer在层间保持屈折特征但牺牲词汇身份以获得紧凑预测表示的机制。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10370 2026-04-21 cs.CV cs.AI cs.LG 84%

SHRUG-FM: Reliability-Aware Foundation Models for Earth Observation

SHRUG-FM:面向地球观测的可靠性感知基础模型

Maria Gonzalez-Calabuig, Kai-Hendrik Cohrs, Vishal Nedungadi, Zuzanna Osika, Ruben Cartuyvels, Steffen Knoblauch, Joppe Massant, Shruti Nath, Patrick Ebel, Vasileios Sitokonstantinou

机构 * Universitat de València(瓦伦西亚大学) Wageningen University & Research(瓦赫宁根大学与研究所) Delft University of Technology(代尔夫特理工大学) European Space Agency(欧洲航天局) Heidelberg University(海德堡大学) Ghent University(根特大学) University of Oxford(牛津大学) Google Research(谷歌研究)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SHRUG-FM框架,通过整合三种互补信号提升地球观测基础模型的可靠性,实验证明其在高风险任务中有效降低预测风险。

Comments Accepted for proceedings at CVPR EarthVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18611 2026-04-21 cs.LG cs.AI 84%

Flow marching for a generative PDE foundation model

基于生成PDE基础模型的流推进

Zituo Chen, Sili Deng

机构 * Department of Mechanical Engineering(机械工程系) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Flow Marching算法,结合物理动力学误差分析,构建生成PDE基础模型,通过联合采样噪声和时间步长,学习统一速度场以减少长期漂移并实现不确定性感知的生成。同时引入P2VAE和FMT提升效率,实现大规模预训练。

Comments This work has been substantially expanded and superseded by arXiv:2602.11229

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16570 2026-04-21 cs.LG cs.AI 84%

In Search of Lost DNA Sequence Pretraining

寻找丢失的DNA序列预训练

Zhijiang Tang, Jiaxin Qi, Yan Cui, Jinli Ou, Yuhua Zheng, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文揭示了DNA预训练中三个关键问题:下游数据集不恰当、邻域遮蔽策略缺陷及词汇讨论不足,并提出评估标准、任务设计指导和词汇分析,通过实验验证问题重要性,最终提出标准化测试平台以推动基因组基础模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10544 2026-04-14 cs.LG cs.AI 84%

WaveMoE: A Wavelet-Enhanced Mixture-of-Experts Foundation Model for Time Series Forecasting

WaveMoE: 一种用于时间序列预测的小波增强混合专家基础模型

Shunyu Wu, Jiawei Huang, Weibin Feng, Boxin Li, Xiao Zhang, Erli Meng, Dan Li, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米集团) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 WaveMoE通过整合小波域表示提升时间序列预测能力,采用双路径架构和共享专家路由机制,实验表明其在16个基准数据集上具有提升预测性能的潜力。

Comments Presented at ICLR 2026 TSALM Workshop (1st Workshop on Time Series in the Age of Large Models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04723 2026-04-07 cs.CL cs.AI 84%

Individual and Combined Effects of English as a Second Language and Typos on LLM Performance

英语作为第二语言与拼写错误的个体与综合影响

Serena Liu, Yutong Yang, Prisha Sheth, Weixuan Dong, Mingjiao Diao, Xinru Zhu, Nikhil Banga, Oscar Melendez, Arnav Sharma, Minda Zhao, Marina Lin, Mengyu Wang

机构 * Harvard University(哈佛大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了英语作为第二语言和拼写错误对大语言模型性能的影响,发现两者结合时性能下降更显著,且在封闭式任务中表现更一致,而开放式任务结果更混杂。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02719 2026-04-06 cs.CV cs.AI cs.LG 84%

MOMO: Mars Orbital Model Foundation Model for Mars Orbital Applications

MOMO:用于火星轨道应用的火星轨道基础模型

Mirali Purohit, Bimal Gajera, Irish Mehta, Bhanu Tokas, Jacob Adler, Steven Lu, Scott Dickenshied, Serina Diniega, Brian Bue, Umaa Rebbapragada, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Jet Propulsion Laboratory, California Institute of Technology(加州理工学院喷气推进实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 MOMO是首个多传感器基础模型,通过模型融合整合来自HiRISE、CTX和THEMIS三种关键火星传感器的数据,提升多分辨率数据的稳定性和泛化能力。

Comments Accepted at CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16739 2026-03-31 cs.LG cs.AI cs.HC 84%

SpecMoE: Spectral Mixture-of-Experts Foundation Model for Cross-Species EEG Decoding

SpecMoE:用于跨物种EEG解码的频谱混合专家基础模型

Davy Darankoum, Chloé Habermacher, Julien Volle, Sergei Grudinin

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK(格勒诺布尔-阿尔卑斯大学、法国国家科学研究中心、格勒诺布尔国立理工学院、让·库尔曼实验室) SynapCell SAS(SynapCell公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SpecMoE模型,通过改进的频谱掩码策略和混合专家框架,提升EEG信号解码性能,实现跨物种和跨受试者的高准确率。

Comments 34 pages (12 pages in the main text and 22 pages in Supplementary Information)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24804 2026-03-27 cs.CV cs.AI cs.LG 84%

GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining

GoldiCLIP:平衡显式监督的Goldilocks方法用于语言-图像预训练

Deen Dayal Mohan, Hossein Souri, Vitali Petsiuk, Juhong Min, Gopal Sharma, Luowei Zhou, Suren Kumar

机构 * AI Center – Mountain View, Samsung Electronics(三星电子山景城AI中心)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GoldiCLIP通过平衡监督信号提出新框架,结合文本条件自蒸馏、编码器解码器与VQA目标及不确定性加权机制,在3000万数据下实现高效预训练,提升多任务检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22039 2026-03-25 cs.LG cs.AI 84%

UniCA: Unified Covariate Adaptation for Time Series Foundation Model

UniCA: 时空基础模型的统一协变量适应

Lu Han, Yu Liu, Lan Li, Qiwen Deng, Jian Jiang, Yinbo Sun, Zhe Yu, Binfeng Wang, Xingyu Lu, Lintao Ma, Han-Jia Ye, De-Chuan Zhan

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院,中国) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) Ant Group, Hangzhou, China(蚂蚁集团,杭州,中国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 UniCA通过协变量同质化和统一注意力融合机制,提升时空基础模型对异质协变量的适应能力,实验证明其在多模态预测任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20969 2026-03-24 cs.LG cs.CL 84%

Understanding Contextual Recall in Transformers: How Finetuning Enables In-Context Reasoning over Pretraining Knowledge

理解Transformer中的上下文回忆:微调如何使模型在预训练知识上进行上下文推理

Bhavya Vasudeva, Puneesh Deora, Alberto Bietti, Vatsal Sharan, Christos Thrampoulidis

机构 * University of Southern California(南加州大学) University of British Columbia(不列颠哥伦比亚大学) Flatiron Institute(Flatiron研究所)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了Transformer模型在上下文学习中如何通过微调实现对预训练知识的推理,探讨了预训练和微调对上下文回忆能力的影响及机制。

Comments 28 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20466 2026-03-24 cs.CL cs.AI 84%

Diffutron: A Masked Diffusion Language Model for Turkish Language

Diffutron:一种针对土耳其语言的掩码扩散语言模型

Şuayp Talha Kocabay, Talha Rüzgar Akkuş

机构 * Hugging Face

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Diffutron,一种专为土耳其语言设计的掩码扩散语言模型,通过高效训练流程和分阶段指令微调,实现了紧凑模型在土耳其语言生成任务中的竞争力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19152 2026-03-20 cs.CL cs.AI 84%

VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models

VEPO:用于低资源语言基础模型的变量熵策略优化

Chonghan Liu, Yimin Du, Qi An, Xin He, Cunqi Zhai, Fei Tan, Weijia Lin, Xiaochun Gong, Yongchao Deng, Shousheng Jia, Xiangzheng Zhang

专题命中 预训练与数据 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VEPO,通过强化学习可验证奖励整合确定性结构约束,提升低资源语言的分词效率和翻译质量。

Comments 23 pages. Includes figures and tables. Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19149 2026-03-20 cs.CL cs.LG 84%

Optimal Splitting of Language Models from Mixtures to Specialized Domains

从混合数据中语言模型的最优分割以专用于特定领域

Skyler Seto, Pierre Ablin, Anastasiia Filippova, Jiayuan Ye, Louis Bethune, Angelos Katharopoulos, David Grangier

机构 * Apple(苹果公司) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种方法,通过独立预训练多个模型并利用缩放定律确定预训练和继续预训练之间的最佳计算分配,从而提升不同模型大小和计算预算下的常识知识和推理基准性能。

Comments 26 pages, 11 tables, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏