TPPoet: Transformer-Based Persian Poem Generation using Minimal Data and Advanced Decoding Techniques
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
Comments Project released at: https://github.com/AILab-CVC/SEED. arXiv admin note: substantial text overlap with arXiv:2307.08041
专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)
首个中文BabyLM挑战:训练数据高效且认知合理的中文语言模型
机构 * Princeton University(普林斯顿大学) ; Shanghai Jiao Tong University(上海交通大学) ; Chinese Academy of Sciences(中国科学院) ; Columbia University(哥伦比亚大学) ; Beijing Normal University(北京师范大学) ; Tsinghua University(清华大学) ; University of California San Diego(加利福尼亚大学圣地亚哥分校) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
AI总结 首个中文BabyLM挑战将在2026年自然语言处理与中文计算会议举办,要求用1亿中文词元从头训练语言模型,在自然语言理解、认知对齐和汉字知识三轨道评估,不限分词器、模型架构和训练轮数。
Comments 13 pages
TabH2O:用于表格预测的统一基础模型
机构 * H2O.ai
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG
AI总结 本文提出TabH2O,一种统一的基础模型,通过上下文学习在单次前向传递中实现分类和回归。该模型基于TabICL架构进行了关键改进,包括统一训练、单阶段预训练和噪声感知预训练,从而在表格数据预测任务中表现出色。
Comments Technical Report - https://tabh2o.h2oai.com/
DegradeQuery:面向上下文感知PROTAC降解预测的反事实元组预训练
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI
AI总结 DegradeQuery是一种上下文感知PROTAC降解预测框架,通过反事实元组预训练利用标签缺失的PROTAC记录,在PROTAC-8K基准上AUC达0.9065、准确率0.8500,性能优于对比方法。
Comments 19 pages, 2 figures, with supplementary material
通过提示随机Transformer实现无训练的通用逼近
机构 * Purdue University(普渡大学)
专题命中 预训练与数据 :prompting(title,abstract);pretraining(abstract);分类 cs.LG
AI总结 该研究证明预训练Transformer可选,随机未训练的单层softmax注意力网络经软提示引导可实现通用逼近,其继承核回归的极小极大最优速率,还揭示了提示相关参数的权衡关系。
Comments 31 pages, 5 figures. Comments welcome!
CellWorld:空间转录组学基础模型中从基因水平重建到潜在细胞预测
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI
AI总结 本文提出CellWorld,将空间转录组学基础模型的预测目标从基因测量转向潜在细胞表示,在多基准测试中其性能优于现有基线,仅用5%语料库预训练的大型模型也表现出色。
迈向多模态预训练的物理学:知识流、模态协同、早期统一与方法指南
机构 * FAIR, Meta(Meta FAIR研究院) ; Reality Labs, Meta(Meta Reality Labs) ; University of Oxford(牛津大学)
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG
AI总结 该研究探索多模态预训练的机制,得出知识流、模态协同等四个关键见解,推导高效预训练方法,为多模态预训练的理解与扩展提供基础。
Comments Project page: https://junlinhan.github.io/projects/physics_of_mm_pretrain/
TESSERA v2:扩展逐像素地球基础模型
机构 * University of Cambridge(剑桥大学) ; NVIDIA(英伟达) ; dClimate Labs(dClimate实验室)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG
AI总结 研究逐像素地球观测基础模型的扩展及预训练预算分配,通过大规模实验发现预训练损失难预测下游性能,给出计算分配规则,训练并蒸馏模型,其成果优于其他模型。
语言模型可泛化出类人的词序偏好
机构 * University of Washington(华盛顿大学)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL
AI总结 本研究发现不同规模的语言模型可从贫乏输入中泛化出类人的范围同态名词短语修饰语顺序偏好,且该偏好无法用点互信息解释。
公平性崩溃现象:在合成数据上训练的语言模型中的偏差放大
机构 * Laboratoire Hubert Curien(于贝尔·屈里安实验室) ; CNRS(法国国家科学研究中心) ; Université Claude Bernard Lyon 1(里昂第一大学) ; Université Lumière Lyon 2(里昂第二大学) ; École Centrale de Lyon(里昂中央理工学院)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
AI总结 该研究发现,在合成数据上反复训练语言模型会出现公平性崩溃,即偏差在标准指标未明显下降时悄然放大,揭示了合成数据污染的关键风险。
LLaDA MoE v2:扩展混合专家扩散语言模型
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI
AI总结 该研究明确MoE扩散语言模型的扩展规律,训练30B-A3B的LLaDA MoE v2,其预训练令牌量为Qwen3的65%,经微调后在多数推理编码基准上优于SDAR Chat且接近Qwen3。
EEG-JEPA:用于脑电基础模型的结构化隐变量预测
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI
AI总结 本研究提出EEG-JEPA结构化隐变量预测框架,通过优化目标设计提升EEG基础模型性能,在EEG-FM-Bench等基准上实现了14任务、9任务的平衡准确率提升,为EEG基础建模提供了新方案。
Comments 9 pages, 6 figures
HarMoE:基于数据集解耦专家的多源胸部X射线预训练
机构 * University of Bern(伯尔尼大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出HarMoE框架,通过解耦数据集专家从异构胸部X射线数据集学习,提升了放射学视觉-语言模型的零样本分类、分布外迁移等性能,相关代码与87.3万份数据集将公开。
脑电(EEG)基础模型中低频偏差的理解与修正
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG
AI总结 针对EEG基础模型存在的低频偏差问题,提出频率平衡掩码自编码框架FAME,在OmniEEG-Bench的41项下游任务中24项达到SOTA,凸显平衡频谱监督的重要性。
LM-GRASP:基于在线模仿学习的组合构造的实例特定语言模型
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.LG
AI总结 本研究提出LM-GRASP框架,将GRASP随机构造阶段转为在线模仿学习任务,用仅解码器Transformer作构造策略,在Taillard PFSP基准上平均比GPU-GRASP提升28.4个制造跨度单位,是手工构造器的实用替代方案。
训练前预测:粒子物理基础模型的缩放定律
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI
AI总结 研究粒子物理基础模型训练成本高及缩放回报难测问题,通过在小模型上拟合联合缩放定律预测大模型损失,还将其与下游物理性能关联,发布相关预训练模型、训练方法及代码。
ChineseBERT:通过字形和拼音信息增强的中文预训练模型
机构 * Zhejiang University(浙江大学) ; Key Lab of Intelligent Information Processing of Chinese Academy of Sciences(中国科学院智能信息处理重点实验室)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
AI总结 研究针对中文预训练模型忽略字形和拼音信息的问题,提出ChineseBERT,将二者纳入预训练,在大规模语料库上训练后,在多种中文NLP任务中性能显著提升,取得新SOTA,代码和模型已公开。
Comments To appear at ACL2021
KletterMix: 攀登高质量德语预训练数据
机构 * AI & ML Group, TU Darmstadt(人工智能与机器学习小组,德累斯顿技术大学) ; Lab1141 ; Lamarr Institute(拉马尔研究所) ; Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) ; hessian.AI(海斯坦.AI) ; German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) ; Centre for Cognitive Science, TU Darmstadt(认知科学中心,德累斯顿技术大学)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
AI总结 通过翻译高质量英语语料库构建德语预训练语料库KletterMix,并验证其在德语下游任务中的有效性。
CuraWeb:网络规模预训练数据的质量、冗余性和多样性联合优化
机构 * Meituan(美团)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究针对开放网络语料库预训练数据优化的局限性,提出质量、冗余性和多样性联合优化范式,结合双轨清理与混合去重,构建CuraWeb语料库,实验证明其在多基准测试中性能显著优于基线。
在人类与大语言模型合作撰写的文本中检测大语言模型生成的令牌
机构 * School of Mathematics, University of Birmingham(伯明翰大学数学学院) ; School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) ; Department of Statistics, The London School of Economics and Political Science(伦敦政治经济学院统计系)
专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);分类 cs.AI
AI总结 针对人类与大语言模型合作撰写文本中难以检测大语言模型生成内容的问题,提出在令牌级别运行、基于现有分数并平滑分数降低变异性的新方法,在合成与真实数据集上性能强,还部署了网站。
MSBraM:用于分层脑电动力学学习的多尺度自监督脑基础模型
机构 * Hunan University(湖南大学)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI
AI总结 针对现有方法难捕捉EEG信号多尺度时间结构的问题,提出MSBraM模型。该模型采用两阶段预训练框架,经多尺度神经分词器和课程多尺度掩码策略学习分层EEG表征。实验显示其在多个下游任务中性能优越,证明显式建模多尺度时间动态对EEG基础模型的重要性。
用于可泛化脑电信号表征学习的多模态预训练
机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校)
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI
AI总结 研究针对癫痫EEG模型应用局限问题,开发多模态EEG基础模型,结合多种编码器,通过创新预训练技术创建癫痫相关表征。在多个数据集和评估设置下实验,该模型实现强大癫痫检测与适应新场景能力,支持可解释癫痫定位,性能达当前最优。
BrainNext:用于脑MRI分析的通用自监督基础模型
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI
AI总结 研究提出BrainNext通用自监督基础模型用于脑MRI分析,结合MAE预训练与三维双向xLSTM-UNet架构,从大量未标记数据学习,经微调用于下游任务,在FOMO 2025评估中表现出色,证明其可转移性和作为基础模型的潜力。
扰动是语言模型外推所需的一切
机构 * School of Mathematics, University of Bristol(布里斯托大学数学系) ; School of Mathematics, University of Birmingham(伯明翰大学数学系) ; Department of Statistics, University of Washington(华盛顿大学统计系) ; Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计系)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG
AI总结 本文针对大语言模型外推问题,提出基于扰动的方法,先转换前缀为语义邻域再进行下一个token预测,构建分层模型。通过建立五个属性发展外推性理论,经合成与真实数据评估,该方法提升支持域外预测性能,为语言建模提供实用路径。
Comments 59 pages
通过选择性权重篡改在联邦语言模型中实现无梯度隐私泄露
机构 * Pennsylvania State University(宾夕法尼亚州立大学) ; Dartmouth College(达特茅斯学院)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG
AI总结 研究联邦语言模型中隐私敏感数据泄露问题,发现中间轮次模型快照及恶意参与者篡改选择性权重会加剧泄露,提出无梯度攻击方法,提升了成员推理召回率和私有数据重建率,还给出客户端防御隐私风险的技术建议。
Comments 21 pages (including bibliography and Appendix), Submitted to PETS'26
无知识语言模型:抑制参数化记忆以进行基于证据的语言建模
机构 * HPI / University of Potsdam(波茨坦大学哈索·普拉特纳数字工程学院) ; African Institute for Mathematical Sciences(非洲数学科学研究所) ; Department of Computer Science Aalborg University(奥尔堡大学计算机科学系) ; Department of Computer Science University of Cape Town(开普敦大学计算机科学系) ; Polytechnique Montréal(蒙特利尔理工大学)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
AI总结 研究修改预训练信号能否使语言模型从参数化记忆转向基于证据的推理,引入无知识语言模型(KLLMs),其在命名实体匿名化语料库上预训练,实验表明能降低闭卷事实记忆,在多任务基准上表现优,提升鲁棒性与校准,为语言模型训练提供新思路。
CITRAS-FM: 面向协变量信息零样本预测的微型时间序列基础模型
机构 * University of Tokyo(东京大学) ; Keio University(庆应大学)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG
AI总结 提出CITRAS-FM,一个仅7M参数的时间序列基础模型,通过引入Shifted Attention和协变量合成方法CovSynth,实现高效零样本预测,在100个任务上达到子10M模型最优精度且CPU推理时间低于0.1秒。
Comments Accepted to EUSIPCO 2026. Code available at https://github.com/hitachi-ais/citras-fm
提示复杂性:大语言模型中用于文本和行为的最短提示
机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA)(达勒·莫利人工智能研究所)
专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);分类 cs.CL
AI总结 研究提示复杂性,定义其为固定语言模型产生目标文本的最短合理提示量,类似资源受限柯尔莫哥洛夫复杂性。介绍计算方法、扩展定义到软提示复杂性,定义提示距离等,据此制定研究议程以探究短提示可实现的文本和行为。