The Limits of LLM Forecasting: Parametric Knowledge Gaps Across Conflict Zones
LLM预测的局限性:冲突区域间的参数化知识差距
专题命中 预训练与数据 :LLM(title,title_cn)
AI总结 研究发现LLM在冲突预测中无法区分稳定与升级期,对低覆盖地区预测为总是升级,对高覆盖地区预测为从不升级,性能低于简单逻辑回归模型。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
LLM预测的局限性:冲突区域间的参数化知识差距
专题命中 预训练与数据 :LLM(title,title_cn)
AI总结 研究发现LLM在冲突预测中无法区分稳定与升级期,对低覆盖地区预测为总是升级,对高覆盖地区预测为从不升级,性能低于简单逻辑回归模型。
使用LLM标注的训练数据扩展稠密检索:面向电商赞助搜索的结构化挖掘与渐进式课程
专题命中 预训练与数据 :LLM(title,title_cn)
AI总结 针对电商搜索中点击信号偏差和人工标注成本高的问题,提出利用多通道检索挖掘、校准的LLM级联标注和五级渐进式课程训练,在Walmart搜索中实现NDCG@10提升5.1%,尾查询提升显著。
Comments Accepted at E-Commerce Workshop, SIGIR 2026
基于患者感知采样的电子健康记录基础模型预训练
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract);分类 cs.LG
AI总结 研究针对电子健康记录自回归基础模型预训练方法存在的问题,提出患者采样方法,通过控制训练信号分布来构建序列,实验表明该方法在真实EHR数据上提升了性能,凸显训练和验证序列构建对相关模型的重要性。
Comments Accepted at the Workshop on Structured Data for Health at the 43rd International Conference on Machine Learning (ICML 2026). 7 pages, 4 figures
Journal ref ICML 2026 Workshop on Structured Data for Health (SD4H)
UNIT:释放大语言模型在图连续学习中的潜力
机构 * Central South University(中南大学) ; Hongkong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Hunan Institute of Engineering(湖南工程学院)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 针对图连续学习面临的语义-结构分离和知识转移不平衡问题,提出UNIT框架,通过微调大语言模型、引入不确定感知锚点生成机制和结构融合建模,提升模型适应性与跨任务知识保留能力,在图连续学习任务中达最优性能。
Comments Accepted by ACM MM 2026
大规模隐藏解码:大语言模型的潜在计算扩展
机构 * WeChat AI Team(微信人工智能团队)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL
AI总结 研究在Transformer主干固定时,通过为token分配更多计算改进大语言模型,提出隐藏解码方法,将token扩展为n个流并结合流分解注意力,实验验证该方法在前沿规模的有效性及跨扩展因子时收益随n增加。
Comments 30 pages, 9 figures
规模能拯救大型语言模型的可塑性丧失吗?
机构 * Zyphra
专题命中 预训练与数据 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究GPT风格Transformer模型在持续学习中的可塑性丧失问题,发现可塑性丧失随模型规模呈亚线性增长,表明增大模型只能延缓而非阻止该现象。
输出向量编辑:缓解大型语言模型中的记忆化问题
机构 * Center for Information and Language Processing, LMU Munich(慕尼黑大学语言与信息处理中心) ; Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Pioneer Centre for AI(人工智能先锋中心)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL
AI总结 提出输出向量编辑方法,通过约束优化修改MLP神经元输出向量引入干扰项,在不改变激活值的情况下抑制记忆化序列,在OLMo-7B上实现87.9%抑制率,并揭示MLP编辑的机制边界。
展示GenDB:通过大语言模型代理实现实例优化和定制化查询处理代码生成
机构 * Cornell University(康奈尔大学)
专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对传统查询处理引擎扩展难题,提出GenDB生成式查询引擎,借助大语言模型代理生成代码。核心方法是通过LLM agents为特定场景生成优化代码,主要贡献是展示其工作流程、性能优势并提供用户探索平台。
Comments Accepted by VLDB 2026 (Demo)
SEFORA:学生论文反馈语料库及LLM反馈评估框架
机构 * University of Pittsburgh(匹兹堡大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 为解决大规模写作反馈中缺乏真实课堂反馈语料和评估方法的问题,构建了SEFORA语料库和UniMatch评估框架,实验表明LLM生成的反馈与教师反馈一致性低(F1≤0.4)。
Comments Under review for EMNLP 2026
信号在哪里?医学编码器预训练的网页数据配方
机构 * Doctolib
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对医学领域编码器预训练数据稀缺问题,提出医学术语密度过滤和信号放大改写两种互补方法,在法语医学NLP上构建FineMed语料库和DoctoBERT编码器,性能优于现有方法。
Comments Code, models, and data: https://github.com/doctolib-lab/doctobert
对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例
机构 * National Taiwan University(国立台湾大学) ; Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) ; Radboud University(拉德堡德大学) ; Institut Jean Nicod(让·尼科研究所)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。
混合而非挑选:为什么合成语料组合对时间序列基础模型预训练至关重要
机构 * Birla AI Labs(巴尔拉人工智能实验室)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 针对时间序列基础模型预训练中合成数据生成器选择困难的问题,提出简单等权混合所有生成器的方法,匹配或超越最优单个生成器,并与真实数据结合获得最强预训练语料。
Comments Accepted at the ICML 2026 Workshop on Foundation Models for Structured Data (FMSD), Seoul, South Korea
已发布的大语言模型词汇表能否支持隐藏语料库的词元级估计?
机构 * Tsinghua University(清华大学) ; Alibaba Group(阿里巴巴集团)
专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(abstract);分类 cs.CL
AI总结 该研究针对隐藏语料库的词元级估计问题,提出分位数引导密度估计(QGDE)方法,利用已发布的LLM分词器词汇表实现了低误差的细粒度语料估计,为相关任务提供了新的有效信号来源。
EXPLORE:使用语言模型进行引导搜索以生成模拟拓扑结构
机构 * Duke University(杜克大学) ; MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室) ; IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)
专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.LG
AI总结 本文针对自动化模拟电路拓扑设计难题,提出EXPLORE框架,集成模拟器引导蒙特卡罗树搜索与基于变压器的解码,利用语言模型先验优化搜索,在6组件基准测试中显著提升成功率、降低均方误差,推动LLM驱动设计自动化。
Comments MLCAD 26' accepted
重新思考语音-LLM集成用于ASR:通过交错实现有效的联合语音-文本训练
机构 * Microsoft(微软)
专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL
AI总结 提出JSTIP,一种面向ASR的预训练策略,通过构建词级和段级交错语音-文本序列,在38k小时数据上相比基线提升了实体识别准确率,并缩小了模态差距。
Visored: 一种面向LLM生成数学的受控自然语言证明器
机构 * University of Washington(华盛顿大学) ; University of Innsbruck(因斯布鲁克大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI
AI总结 提出一种基于依赖类型的证明器,其表面模仿数学自然语言,并通过规则驱动的自动化层填补常规步骤,使LLM无需专用训练数据即可在miniF2F基准上有效使用,并输出可检查的Lean文件。
RepBench:将基准编译为大语言模型的能力表征
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 RepBench构建多基准支撑的大语言模型能力表征探测数据层,揭示读出方式与聚合准则对评估的重要性,相关资源以闭环工作流形式发布。
Comments 22 pages, 8 figures, with appendices. Yanshi Li and Xueru Bai contributed equally
大语言模型的策略规划与预训练语言覆盖范围成反比
专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究前沿模型中策略规划与预训练语言覆盖范围的关系,应用Petri框架评估Qwen3-30B-A3B,发现策略规划得分与预训练语言覆盖范围成反比,低资源语言得分更高,且该影响在不同策略行为中不均一。
音频基础模型捕捉到的海洋哺乳动物和鸟类发声中的系统发育信号:特定领域预训练的有限益处
机构 * Earth Species Project(地球物种计划)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 研究利用四个预训练音频模型从物种发声恢复系统发育距离,在海洋哺乳动物和鸟类中,通用基础模型能恢复信号,特定领域预训练的BirdNET等未超越,表明预训练音频嵌入可携带进化信息,特定领域预训练非必需。
Comments 17 pages, 5 figures, 2 supplementary tables. Code, embeddings and derived matrices: https://github.com/rinvictor/bioacoustic-phylogeny-embeddings
SOAP、Muon及其他:推动语言模型预训练规模
机构 * NVIDIA(英伟达)
专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 研究针对高阶优化器在大规模语言模型预训练中的挑战,通过改进预处理梯度方法、统一实证研究不同优化器、引入分层分布式优化器及系统级改进,提升训练效果,最终发布含新兴优化算法的代码库。
TINY_SCHILLER:用于小语言模型的即插即用德语戏剧语料库
机构 * Duale Hochschule Baden-Württemberg Ravensburg(巴登-符腾堡双元制应用技术大学 Ravensburg)
专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对德语文学文本在小语言模型相关应用的空白,提出Tiny_schiller语料库,经特定处理,可通过单文件和一行代码让小语言模型接触德语文学文本,填补了相关研究和应用的空白。
Comments 5 pages. Dataset: https://huggingface.co/datasets/mrkschtr/tiny_schiller ; Code: https://github.com/schutera/tiny_schiller
用于语言模型预训练的复杂度引导的逐组件初始化
机构 * Peking University(北京大学)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG
AI总结 研究预训练语言模型中反复出现的谱模式能否用于初始化,通过分析多个检查点构建初始化方案并与其他方法比较,发现预训练权重复用有竞争力,但仅粗略谱匹配非可靠策略,预训练谱是有用诊断,有效复用需保留更多信息。
大语言模型的是非偏差反映答案顺序和措辞,而非道德判断的转变
机构 * Princeton University(普林斯顿大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型在道德困境判断中的是非偏差,通过交叉对称化等心理测量方法区分逻辑判断、词汇等因素,发现前沿模型立场与形式无关,部分模型存在顺序和词汇偏差,最小模型可总结伪像,强调跨框架测量模型重视内容。
原生不可学习的大语言模型
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 提出NULLs模型,通过共享骨干和稀疏激活的sinks分离数据源贡献,实现无需梯度更新的高效遗忘,在维基百科上验证了单篇文章遗忘的有效性和鲁棒性。
统一大语言模型预训练中的本地通信与本地更新
机构 * Concordia University(康考迪亚大学) ; Mila ; CNRS, Sorbonne University(法国国家科学研究中心,索邦大学)
专题命中 预训练与数据 :LLM(title,abstract);pretraining(title);分类 cs.AI、cs.LG
AI总结 提出GASLoC算法,通过去中心化训练框架统一本地通信与更新,在异构带宽下优于DiLoCo,支持自适应优化器和多本地步骤。
Comments 38 pages, 9 figures
CausalMix: 数据混合作为语言模型训练的因果推断
机构 * Tsinghua University(清华大学) ; Ant Group(蚂蚁集团) ; Renmin University of China(中国人民大学)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出CausalMix框架,将数据混合优化视为因果推断问题,通过条件平均处理效应估计最优混合比例,在7B模型上提升多任务性能,并具备可解释性。
Comments 22 pages, 3 figures
HumanScale: 以自我为中心的人类视频在具身预训练中可超越真实机器人数据
机构 * PKU(北京大学) ; NUS(新加坡国立大学) ; MIT(麻省理工学院) ; UCSB(加州大学圣塔芭芭拉分校) ; NVIDIA(英伟达)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 本文通过系统比较发现,经过精心设计的过滤和标注流程,以自我为中心的人类视频在具身基础模型预训练中不仅可行,而且性能优于遥操作真实机器人数据,验证了“预训练于人类视频+少量机器人数据适配”的可扩展范式。
Comments Github: https://github.com/DAGroup-PKU/HumanNet/
测量语言模型预训练中与任务无关的训练数据影响
机构 * Nara Institute of Science and Technology(奈良科学技术研究所) ; Waseda University(早稻田大学) ; The University of Tokyo(东京大学) ; IT University of Copenhagen(哥本哈根信息技术大学) ; Tohoku University(东北大学)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
AI总结 本文提出无需依赖下游任务或验证集的训练数据影响度量方法,经实验发现预训练中有影响力的数据存在时间变化,早期文献相关数据、后期STEM数据与最终参数轨迹的一致性更强。
Comments Accepted to COLM 2026
CASA:结合语音编码器与大语言模型的内容-语音口语评估
机构 * Aalto University(阿尔托大学) ; University of Helsinki(赫尔辛基大学) ; Walton Institute(沃尔顿研究所)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 该研究提出结合Whisper-medium与Qwen3.5-2B的CASA架构,在Speak & Improve Corpus 2025上RMSE达0.358,参数量减半,可分离语音表达与内容,还分析了声学与内容信息的贡献及性能稳定性。
Comments To be submitted to ICASSP 2027. Code is available at https://github.com/aalto-speech/casa
PROVE-RT:使用大语言模型为实时系统生成机械化定理证明器脚本
机构 * Florida International University(佛罗里达国际大学) ; University of South Florida(南佛罗里达大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 PROVE-RT是一种LLM辅助框架,通过依赖感知草图、PROSA文档检索等步骤生成PROSA/ROCQ脚本,在1191篇实时系统论文构建的语料库上,其机械化可调度性分析的成功率达44.7%,优于直接提示的LLM。