Tell, don't show: Declarative facts influence how LLMs generalize
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)
Comments NeurIPS 2023 (Spotlight)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments 17 pages (10 main), 7 figures, 5 tables
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments ACL 2023 camera-ready
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)
面向葡萄牙语的语言模型:一项系统映射研究
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究通过系统映射梳理出46个葡萄牙语语言模型,分析其特征、演变及关系,明确研究缺口并展望未来方向,为该领域发展提供全面概览。
Comments 37 pages; 7 figures; 8 tables
NE-BERT:适用于9种印度东北部语言的多语言语言模型
机构 * MWire Labs(MWire实验室)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对印度东北部9种低资源语言的代表性不足问题,提出NE-BERT多语言语言模型,通过加权采样等技术提升性能,解决词汇碎片化,发布资源推动当地NLP研究与数字包容。
子图像重叠预测:面向遥感图像语义分割的任务对齐自监督预训练
机构 * Instacart ; New York University(纽约大学) ; University of Washington(华盛顿大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出子图像重叠预测任务,通过少量预训练数据提升遥感图像语义分割性能,实现更快收敛和同等或更优的mIoU表现。
Comments Accepted at CV4EO Workshop at WACV 2026
Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) Workshops, 2026, pp. 1414-1423
SymbolicLight V1: 一种具有高激活稀疏性和亚十亿级预训练证据的脉冲门双路径语言建模
机构 * SymbolicLight Research(SymbolicLight研究院)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出SymbolicLight V1,一种结合二进制Leaky Integrate-and-Fire脉冲动力学与连续残差流的脉冲门双路径语言模型,通过长程记忆的指数衰减聚合路径和短程精度的脉冲门局部注意力路径,实现了高激活稀疏性和亚十亿级预训练证据。
Comments 25 pages, 4 figures, 24 tables. Revised preprint: quality-gap framing, token-weighted versus unweighted domain PPL, and tightened architecture claims. Code and checkpoints: AGI/SymbolicLight-V1" target="_blank" rel="noopener">https://github.com/SymbolicLight-AGI/SymbolicLight-V1
Jina-VLM:小规模多语言视觉语言模型
机构 * Jina AI
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 Jina-VLM是一款24亿参数的多语言视觉语言模型,通过结合SigLIP2视觉编码器与Qwen3语言主干,实现了高效多语言视觉问答性能。
Comments 23 pages, 1-10 main content, 11-23 references and appendix
PolicyKG:一种用于将机构政策转换为SHACL知识图谱的智能体大语言模型流水线
机构 * Asian Institute of Technology(亚洲理工学院)
专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出PolicyKG流水线,可自动将机构政策转换为SHACL知识图谱,在AIT语料库上取得高分类准确率,适配新领域仅需替换注册表,解决了人工转换的效率问题。
Comments 23 pages, 3 figures, 4 tables. Under review at IJCKG 2026, Bangkok, Thailand
DataComp-VLM:改进的视觉语言模型开放数据集
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 提出DataComp-VLM基准,通过数据混合(而非过滤)策略提升视觉语言模型训练效果,在8B模型上达到63.6%准确率,比现有最优数据集提升5.4个百分点。
Comments Preprint
在小型合成数据上预训练,免费实现大规模扩展:用于逻辑规则归纳的感知对称性基础模型
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出一种感知对称性的逻辑规则归纳基础模型,通过构造强制对称性将小型合成数据预训练的Neural Rule Inducer扩展至更大模式,提升了规则的可迁移性与保真度。
Comments Accepted at 20th Conference on Neurosymbolic Learning and Reasoning (NeSy 2026)
证据类型竞争:干预数据何时能教会语言模型因果方向?
机构 * Tsingjiao Information Science (Beijing) Co., Ltd(北京清教信息科技有限公司)
专题命中 预训练与数据 :language model(title);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 该研究发现干预数据训练语言模型因果推理的金标准假设存在局限,观测上下文会抑制模型的因果方向判断能力,提出证据平均方案可降低符号错误率。
Comments 13 pages, 6 figures, 4 tables
Point2Radio:面向材料感知点云的跨场景无线电场基础模型
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 Point2Radio是从多环境学习可迁移传播先验的基础模型,基于材料感知点云实现跨场景无线电场预测,在路径增益预测上较UNet基线误差降76.7%,轻量微调可提升环境适应性。
语言模型中的知识崩溃与认知多样性
专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究通过增加语言模型多样性缓解知识崩溃,发现单一模型短期表现好但长期崩溃加剧,多样性水平随训练迭代增加而提升,实验显示生态多样性对缓解崩溃至关重要。
Comments 30 pages, 21 figures. v3 changelog: updated introduction. v2 changelog: added experimental variations, updated theory, writing revisions, updated metadata
弥合计算最优和数据最优预训练之间的差距
机构 * Harvard University(哈佛大学) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 研究针对计算增长快于高质量数据可用性的问题,提出计算-数据(CD)缩放定律框架,通过引入令牌有效性函数η拟合数据扩展策略,划分训练操作模式,指出经典计算最优分配在多数实际设置下次优。
SynPre-FL:合成数据驱动的预训练集成联邦学习训练框架
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 研究针对联邦学习在临床风险预测中面临的问题及局限,提出SynPre-FL框架,结合合成EHR生成与合成预训练联邦学习,通过潜在自动编码器扩散模型等技术,提升非IID条件下预测的稳健性、可扩展性与可解释性。
Comments 18 pages, 10 figures
语言模型能否在其权重中持续学习事实?
机构 * Baseten(巴斯滕)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 研究语言模型能否在权重中持续学习事实,通过追踪写入Qwen3模型的虚构事实及实验发现,训练数据广度决定知识类型,事实可行为遗忘但不擦除,广泛数据能创建可用知识,可靠通道是上下文而非权重。
金融应用中多模态事件序列的基础模型
机构 * Sber(俄罗斯储蓄银行) ; Sber AI Lab(俄罗斯储蓄银行人工智能实验室)
专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究金融应用中多模态事件序列预测建模,提出预训练基础变压器模型统一多源事件成序列,经下一个事件预测学习通用表示,结合现有特征训练轻量级神经模型用于多下游任务,优于传统模型并减少开发开销且已应用取得业务改进。
语言模型中的信息下限:神经坍缩是被禁止的
机构 * NYU Shanghai Leonard N. Stern School of Business, New York University(纽约大学上海纽约大学斯特恩商学院)
专题命中 预训练与数据 :language model(title);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 研究语言模型中信息分配定律,通过单行中心化恒等式等方法,揭示宏观类别结构与令牌内上下文方差占比,理论上说明权重衰减影响,证明二元类别下限,表明定律在多方面成立及预训练中类别份额变化规律。
ProsMAE:用于ISUP分级分类的多源MAE预训练
机构 * Seoul National University(首尔国立大学) ; GIST(韩国科学技术院) ; NVIDIA(英伟达)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 针对全切片图像模型训练难题,提出多源MAE框架ProsMAE,利用多数据集切片预训练编码器,通过ProsCLS用于ISUP分级分类,在不相交PANDA分割下比普通MAE冻结线性探针基线有更高QWK。
Comments Accepted to APCCAS 2026
预训练课程实现选择性微调
机构 * University of Oxford(牛津大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 研究预训练课程如何影响学习、泛化和微调选择性,对比平衡与不平衡预训练方式,发现不平衡预训练促进上下文学习并提高拒绝微调选择性,还扩展到合成语言学习任务。
CRISP:一种通过基于预测的世界模型预训练实现驾驶的时空相机-雷达主干网络
机构 * Department of Robotics, University of Michigan(密歇根大学机器人系)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 研究通过基于预测的表示学习预训练时空相机-雷达主干网络CRISP,利用历史多视图图像和雷达扫描,通过预测未来激光雷达点云学习统一鸟瞰图表示,介绍相关组件,实验表明其能提升点云预测并有效迁移至下游任务。
Comments 17 pages, under review
注意力只是耦合的另一个名字?:关于层级预训练的快速-慢速ODE视角
机构 * Independent scholar(独立学者)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种快慢ODE视角,将因果自注意力视为耦合机制,并引入一个通过零初始化门控反馈到快路径的慢子系统,在理论证明和实验验证中揭示了其与主方程平稳分布的联系。
Clin-JEPA:一种多阶段协同训练框架,用于EHR患者轨迹的联合嵌入预测预训练
机构 * Duke University(杜克大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Clin-JEPA框架,通过多阶段预训练稳定协同训练编码器和预测器,解决EHR数据中联合嵌入预测的挑战,实现多任务下游任务的高性能表现。
Comments 18 pages, 4 figures, 8 tables. Code: https://github.com/Kamaleswaran-Lab/Clin-JEPA
TokSuite:衡量分词器选择对语言模型行为的影响
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; Google DeepMind(谷歌DeepMind) ; McGill University(麦吉尔大学) ; University of Cambridge(剑桥大学) ; Hugging Face
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 提出TokSuite,含模型集合与基准测试,通过不同分词器的预训练模型及多语言鲁棒性基准测试,解耦分词器影响,阐明多种流行分词器优缺点。
Comments ICML 2026. 46 pages, 13 figures
Mantis: 用于时间序列分类的轻量级基础模型
机构 * com(42.com) ; Helmholtz Munich(亥姆霍兹慕尼黑中心) ; Technical University of Munich(慕尼黑工业大学) ; Criteo ; Meta ; Telecom Paris(巴黎电信学院)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出基于Transformer的轻量级基础模型Mantis,通过自监督对比学习在合成数据上预训练,并引入新颖的令牌生成单元和增强测试方法,在多个数据集上超越现有基础模型。
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026