GenEARL: A Training-Free Generative Framework for Multimodal Event Argument Role Labeling
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments 20 pages, 15 Figures, 13 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments 20 pages, 15 Figures, 13 figures
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL
Comments arXiv admin note: text overlap with arXiv:2305.02105 by other authors
专题命中 预训练与数据 :language model(title);pretraining(title);分类 cs.AI
专题命中 预训练与数据 :LLM(abstract,comments);large language model(abstract);language model(abstract);prompting(abstract)
Comments Project page: https://janghyuncho.github.io/Cube-LLM
用于鲁棒代码表示的不变预训练
机构 * University of California at Davis(加州大学戴维斯分校) ; The University of Hong Kong(香港大学)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文针对代码表示模型在不变程序下鲁棒性退化问题,提出仅基于代码的不变预训练(InvPT)方法,在克隆检测、代码分类任务上分别提升鲁棒性最高11、19个百分点,同时保持或提升标准准确率。
Comments To appear in LMPL 2026
用于高效在线强化学习微调的无评判者预训练
机构 * Tsinghua University(清华大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对离线转在线强化学习中复用离线评判者导致的适配问题,提出无评判者预训练范式,兼容主流算法且在多任务上表现更优。
DoGMA:一种用于肿瘤学多组学对齐与多任务学习的中心法则引导基础模型
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出中心法则引导的多组学基础模型DoGMA,通过Transformer-MoE架构结合定向注意力与掩码分层多组学重构预训练,在泛癌多组学下游任务中展现出优异性能,为多组学注意力机制设计提供新方向。
LF²AR:考虑分层动态以改进语言模型的多模态适配
机构 * Université de Toulon, Aix-Marseille Université, CNRS, LIS, France(法国图卢兹大学、马赛大学、CNRS、LIS) ; Department of Engineering, University of Cambridge, UK(剑桥大学工程系) ; Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA(三菱电机研究实验室(MERL)) ; LIA, Avignon Université, France(法国阿维尼翁大学LIA) ; LIUM, Le Mans Université, France(法国勒芒大学LIUM) ; Zenidoc, Marseille, France(法国马赛Zenidoc)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出LF²AR架构,通过分层抽象-细化动态设计适配机制,在文本转图像、语音模态上提升语言模型性能,支持1.9倍生成加速。
Comments Published as a conference paper at COLM 2026
自预训练(SPT)真的有助于改进医疗时间序列的诊断吗?
机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) ; Umeå University(于默奥大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute Tübingen(埃利斯研究所蒂宾根分所)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究探究自预训练(SPT)对Transformer在医疗时间序列诊断任务的影响,发现SPT可提升分类准确率0-6个百分点,是无需修改架构的通用有效策略。
Comments 21 pages, 7 figures,4 tables
MultiPathFormer:迈向多径无线传播的基础模型
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出MultiPathFormer,以多径传播为预训练对象,结合Environmental RAG机制,在27种环境预训练后,在多项无线通信下游任务中超越SOTA模型,验证了路径级预训练的有效性。
无递归预训练循环网络
机构 * MIT(麻省理工学院)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出监督记忆训练(SMT)方法,通过将循环神经网络训练转化为一步记忆转换标签上的监督学习,实现时间并行训练和稳定梯度路径,优于反向传播通过时间(BPTT)方法。
Comments 30 pages, 23 figures
作为编码智能体基础模型中间训练的函数感知中间填充
机构 * University of Waterloo(滑铁卢大学) ; University of British Columbia(英属哥伦比亚大学) ; NVIDIA(英伟达公司) ; Verdent AI(Verdent人工智能公司) ; Vector Institute(向量研究所)
专题命中 预训练与数据 :foundation model(title);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。
预训练数据可通过计算宣传被下毒
机构 * University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(艾伦人工智能研究所)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究发现预训练数据可通过公共讨论界面被下毒,引入HalfLife方法衡量恶意内容,探索在网络规模下毒预训练语料库的可行性,证明估计毒注入重要性,确立第三方网页内容为攻击语言模型预训练的可能载体。
PluRel: 合成数据解锁关系基础模型的扩展定律
机构 * Stanford University(斯坦福大学) ; SAP Labs LLC(SAP实验室)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 PluRel通过合成多表关系数据库,实现了关系基础模型在扩展定律上的突破,展示了合成数据在提升模型泛化能力方面的潜力。
Comments ICML 2026
CDFM:迈向通用因果发现基础模型
机构 * School of Computer Science, Guangdong University of Technology, Guangzhou, China(广东技术大学计算机科学学院) ; College of Mathematics and Computer, Shantou University, Shantou, China(汕头大学数学与计算机学院) ; Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究针对因果发现中特定数据集方法的局限,提出通用框架CDFM,通过研究因果可识别性理论边界构建变分框架,将未知因果机制视为潜在变量,经大量合成模型预训练,性能优于传统算法,推动因果发现范式转变。
语言模型需要睡眠:学习自我修改和巩固记忆
机构 * Google(谷歌) ; Cornell University(康奈尔大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG
AI总结 受人类学习过程启发,提出“睡眠”范式,通过记忆巩固(知识播种)和梦境(自我改进)两阶段,使模型持续学习、将短期记忆转化为长期知识并自我提升。
Comments A version of this work has been publicly available from September 2025 on OpenReview
Inertia-1:可穿戴运动基础模型的开放探索
机构 * John Hopkins University(约翰·霍普金斯大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究可穿戴运动基础模型,利用大量加速度计数据构建框架,涵盖数据、模型和训练选择等,通过多数据集评估得出有趣发现,不仅提供先进方法,还为可穿戴运动表示学习提供全面实用开放指南。
Rosetta: 可组合的原生多模态预训练
机构 * HKUST(香港科技大学) ; Tencent Hunyuan(腾讯混元)
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.CL、cs.LG
AI总结 提出Rosetta框架,通过动量锚定正交投影(MAOP)实现无损模态扩展,解决多模态预训练中的灾难性遗忘和梯度冲突问题。
关于大语言模型训练中学习率缩放的非线性研究
专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文通过实验发现,在大规模训练中,最优学习率呈现向上弯曲的非线性缩放,而使用有效学习率(归一化权重空间的步长)和数据量外推可消除该非线性,并解释了其成因。
MACROCAST: 一种用于实时宏观经济预测的年份一致时间序列基础模型
机构 * School of Economics and Finance, Queen Mary University of London(伦敦大学玛丽女王学院经济与金融学院) ; School of Business and Economics, Brandeis University(布兰迪大学商学院与经济学院)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出MACROCAST,一种轻量级时间序列基础模型,通过纯合成数据预训练和年份特定数据微调,避免时间污染和修正偏差,在实时预测中优于现有模型。
内部数据重复破坏语言模型
机构 * Stanford Computer Science(斯坦福大学计算机科学系) ; Stanford Statistics(斯坦福大学统计学系) ; Tel Aviv University(特拉维夫大学) ; IMC Trading
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究重复数据对语言模型的影响,通过无重复缩放定律量化计算等效损失,发现重复次数存在最坏点,且该点随模型规模呈幂律增长。
NeuroShield: 一种设备无关的EEG认证基础模型
机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) ; Joint Research Centre, European Commission(欧盟委员会联合研究中心)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 针对EEG认证中模型因采集设备差异而难以复用的问题,提出NeuroShield基础模型,采用双阶段Transformer架构从变通道、变长度EEG中学习身份判别嵌入,在三个公开数据集预训练后,微调后等错误率降低0.44-8.06个百分点,并泛化至未见过的通道布局和更长信号段。
去除噪声,而非寻找黄金:大规模预训练的质量过滤
机构 * Work done as an intern at Apple(苹果公司实习生) ; University of Oxford(牛津大学) ; Apple(苹果公司)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文深入分析基于分类器的质量过滤(CQF)方法,发现其虽提升下游任务性能,但会隐式过滤高质量数据,且与基于合成数据的模型行为趋势不同,质疑CQF捕捉数据质量的有效性。
Comments 21 pages, 22 figures, 2 tables, accepted at ICML 2026
多中心研究:共享电子健康记录基础模型的适应性
机构 * Program in Child Health Evaluative Sciences, The Hospital for Sick Children, Toronto, ON, 1 Canada(儿童健康评估科学计划,多伦多医院儿童医学中心,多伦多,加拿大) ; Stanford Center for Biomedical Informatics Research, Stanford University, Palo Alto, CA, USA(斯坦福大学生物医学信息学研究中心,斯坦福大学,帕洛阿尔托,美国) ; Universidad del Norte, Barranquilla, Columbia(北方大学,巴兰基利亚,哥伦比亚) ; Division of Haematology/Oncology, The Hospital for Sick Children, Toronto, ON, Canada(血液肿瘤科,多伦多医院儿童医学中心,多伦多,加拿大)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本研究评估了共享电子健康记录基础模型在不同医院间的适应性,证明其在较少标注数据下仍能提供优于本地训练的性能,且更高效。
Comments 46 pages, 5 figures, 3 tables, 14 appendices
基于队列锚定的电子健康记录基础模型:从风险评分到可审计的同行队列
机构 * National University of Singapore(新加坡国立大学)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出CAFM框架,将患者队列作为一等对象融入学习流程,通过四个阶段提升数据质量、组织表示并支持可审计决策,以解决基础模型在临床部署中的可解释性、分布偏移和临床对齐问题。
B[FM]$^2$: 基于流匹配与SplitUNet的脑基础模型
机构 * Massachusetts Institute of Technology(麻省理工学院) ; KU Leuven(鲁汶大学)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出B[FM]$^2$,通过连续时间流匹配直接在原始EEG信号上预训练,避免离散化带来的时间动态损失,并设计SplitUNet网络处理时间-电极不对称性,在9个下游任务中7个达到最优,预训练数据量减少约30倍。
无中生有:语言模型能否发现0?
机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 研究语言模型能否独立发现“零”的概念,通过算术任务测试,发现GPT-2规模模型无法在测试时泛化,但少量示例训练后显著提升,且语言预训练减少所需示例约50%。
IHUBERT: 面向波斯语资源的基于向量的语义去重与领域平衡预训练
机构 * Department of Artificial Intelligence and Cognitive Science, Imam Hossein Comprehensive University(人工智能与认知科学系,伊玛目·侯赛因综合大学)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出IHUBERT,一个基于RoBERTa-base的波斯语预训练模型,通过多阶段预处理(包括基于向量数据库的语义去重和领域平衡)在45GB语料上训练,在多项NLU任务上取得领先结果,尤其抽取式问答表现突出。
X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器
机构 * Square Robot ; City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学)
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG
AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。
Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/
地理空间多模态基础模型的新兴灵活设计
机构 * Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本文系统比较了不同架构的地理空间基础模型,在统一设置下评估其灵活性与性能,为多模态推理提供设计指导。