Unsupervised Boundary-Aware Language Model Pretraining for Chinese Sequence Labeling
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI
Comments 12 pages, 2 figures, 7 tables, EMNLP 2022
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI
Comments 12 pages, 2 figures, 7 tables, EMNLP 2022
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG
Comments Camera ready version. Accepted to WNUT 2021. Code for reproducing the experiments can be found at: https://github.com/twitter-research/multilingual-alignment-tpp
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.LG
Comments This work was presented at the first Health Search and Data Mining Workshop (HSDM 2020) as part of WSDM 2020 conference
将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法
机构 * Renmin University of China(中国人民大学)
专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。
通过语义相似性视角探讨大语言模型的生成新颖性
机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学)
专题命中 预训练与数据 :LLM(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过语义相似性视角探讨大语言模型生成新颖性的评估方法,揭示模型在预训练数据中的长序列抽取能力及任务领域对生成新颖性的影响
如何合成高质量的预训练数据?提示设计、生成模型和源数据的系统研究
机构 * Hugging Face ; University of Sheffield(谢菲尔德大学) ; National Institute of Informatics(日本信息处理研究所)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过大规模实验探讨提示设计、生成模型和源数据对合成预训练数据质量的影响,发现结构化输出格式优于现有方法,且生成模型参数超过1B无额外收益,提出开源数据集FinePhrase。
Comments Accepted to COLM 2026
自主渗透测试代理研究中的伦理声明
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文分析利用大语言模型进行进攻性安全研究的论文,探讨伦理考量的表达与合理性,揭示学术社区在创新与伦理责任之间的平衡现状。
Comments Accepted at AutonomousCyber 2026
FlexiSLM:一种动态可控帧率的语音语言模型
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; ByteDance(字节跳动)
专题命中 预训练与数据 :language model(title,abstract);SLM(abstract,abstract_cn);LLM(abstract_cn)
AI总结 提出FlexiSLM,首个支持动态可控帧率的语音语言模型,利用动态帧率表示在高质量点超越固定帧率7B模型,并在6.25 Hz时推理速度减半且保持高质量。
Comments Preprint, under review
PathFLIP:面向多功能计算病理学的细粒度语言-图像预训练
机构 * Harbin Institute of Technology, Shenzhen, School of Computer Science and Technology(哈尔滨工业大学(深圳)计算机科学与技术学院) ; National University of Singapore, Department of Electronic and Computer Engineering(新加坡国立大学电子与计算机工程系)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出PathFLIP框架,通过将幻灯片级描述分解为区域级子描述并生成文本条件区域嵌入,实现细粒度视觉-语言对齐,在多个基准上优于现有模型且训练数据更少。
自然去突现:不对称控制哪些规则在预训练中幸存
机构 * Harvard University(哈佛大学)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 发现语言模型在预训练中学习规则后会自动遗忘,规则存亡由训练数据中支持频率决定,且遗忘不可逆。
Comments Foundations of Deep Generative Models (FoGen) Workshop at ICML 2026. 23 pages (5-page main text plus appendices), 5 figures. Code: https://github.com/lijuliana/Natural-Ungrokking
权重衰减提升语言模型可塑性
机构 * Broad Institute, Schmidt Center(Broad研究所,Schmidt中心) ; University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) ; Harvard University(哈佛大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过系统实验表明,预训练中较大的权重衰减能提高模型的可塑性,使微调后下游性能更优,并揭示了其促进线性可分表示、正则化注意力矩阵和减少过拟合的机制。
Chronicle:一种用于联合语言和时间序列理解的多模态基础模型
机构 * InertialAI ; Department of Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程系) ; Department of Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程系)
专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Chronicle,一种联合训练语言和时间序列的多模态基础模型,通过统一架构实现两者共享参数,从而在多个任务上取得了优异表现。
从有机数据生成预训练令牌以实现数据驱动的扩展
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出SynPro框架,通过重新表述和重新格式化操作,帮助大语言模型更充分地利用有限的有机数据,从而在数据驱动的预训练中实现更高效的扩展。
通过数据增强和大语言模型错误校正提升口腔癌患者语音识别性能
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文通过数据增强和大语言模型错误校正技术,有效提升了口腔癌患者语音识别的性能,实验结果显示在Whisper和MMS模型上分别实现了40%和50%的词错误率降低。
Comments 7 pages, 3 tables. Accepted by EMBC 2026
异构语言模型中的互强化学习经验共享
机构 * Purdue University(普渡大学) ; AWS Agentic AI(AWS智能体实验室)
专题命中 预训练与数据 :language model(title);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出互强化学习框架,通过共享经验提升异构语言模型性能,采用共享经验交换、多工人资源分配和 tokenizer 异质性层实现跨模型经验共享,验证了在稳定与支持之间取得平衡的可行性。
Comments 50 pages, 10 figures, 14 tables
思考的隐性成本:语言模型的能耗与环境影响(超出预训练阶段)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);post-training(abstract);preference optimization(abstract)
AI总结 研究分析了语言模型全开发流程的环境影响,发现推理模型在数据中心能耗上是指令模型的17倍,开发成本占总计算量的82.2%,整体能耗达12.3GWh,排放4251吨CO2eq,水耗15887千升,需纳入环境报告标准。
NanoKnow: 如何了解你的语言模型知道什么
机构 * University of Waterloo(滑铁卢大学)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过NanoKnow基准数据集分析语言模型知识来源,发现预训练数据频率影响准确性,外部证据可缓解频率依赖,参数与外部知识互补,无关信息损害表现。
Comments SIGIR 2026
自适应指令生成用于自动化大语言模型红队测试
机构 * Capital One, AI Foundations(Capital One人工智能基础研究)
专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出自适应指令生成框架,通过强化学习平衡探索与利用,提升红队测试的攻击效果与多样性,优于随机组合和现有方法。
Comments Accepted to ACL 2026 Main Conference
XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型
机构 * Tsinghua University(清华大学) ; Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) ; National University of Singapore(新加坡国立大学) ; McGill University(麦吉尔大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);post-training(abstract)
AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。
Comments 15 pages, 5 figures
形式语言能力异质性:数据是否是真正的瓶颈?
机构 * Adobe Inc.(Adobe公司) ; Media and Data Science Research(媒体与数据科学研究)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究探讨语言模型在形式语言能力上的差异是否源于架构限制或数据稀缺,通过干预性数据增强显著提升了模型在8个最差BLiMP任务上的表现。
Comments ACL'26 (Findings)
基于大型语言模型的异构数据源中缺失人员情报提取与验证方案
机构 * Old Dominion University(欧道明大学)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Guardian Parser Pack,通过AI驱动的解析与规范化流程,将多源调查文档统一为符合模式的表示,提升缺失人员情报的提取与验证效率,同时展示系统架构及性能评估结果。
Comments 9 pages, 6 figures. Accepted at International Conference on Intelligent Digitization of Systems and Services (IDSS 2026)
大规模编码者人像:大规模人像预训练的不理性有效性
机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室)
专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 本文提出大规模编码者人像模型,通过预训练和后训练相结合的方法,在大规模数据上实现高保真的人像生成,支持多样化的身份和精细表情控制,同时具备泛化能力和鲁棒性。
Comments Accepted in CVPR2026. Website: https://junxuan-li.github.io/lca
大型语言模型对信息检索基准的影响:有效性、基线和污染的元分析
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 本文通过分析143篇论文,探讨了LLM对TREC Robust04和DL20基准的有效性影响,发现LLM系统在DL20上提升nDCG@10达8.8%,但存在数据污染问题,影响效果判断。
Comments Accepted at SIGIR 2026
Aleph-Alpha-GermanWeb:通过基于模型的数据筛选和合成数据生成改进德语LLM预训练
机构 * Aleph Alpha Research(Aleph Alpha 研究)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种结合启发式与模型筛选技术及合成数据生成的德语数据集筛选流程,构建了628B词的预训练数据集,通过在德语基准测试中显著优于FineWeb2,证明了基于模型的数据筛选和合成数据生成对LLM预训练的提升作用。
Comments 17 pages, 3 figures; published at EACL 2026
Journal ref EACL 2026, volume 1, pages 1267-1283
预训练与层次记忆:区分长尾知识与常识
机构 * Apple(苹果公司)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种基于层次记忆的预训练方法,通过分离长尾知识与常识,提升模型性能。实验显示,使用内存银行可使小模型性能媲美大模型。
Comments ICLR 2026
AdaDetectGPT:具有统计保证的自适应检测LLM生成文本
机构 * Department of Mathematics(数学系) ; Tsinghua University(清华大学) ; School of Mathematics(数学学院) ; University of Birmingham(伯明翰大学) ; Department of Statistics(统计系) ; LSE London, UK(伦敦经济学院) ; Department of Statistics and Data Science(统计与数据科学系) ; Department of Decision Analytics and Operations(决策分析与运营系) ; City University Hong Kong(香港城市大学)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 AdaDetectGPT通过自适应学习见证函数,提高LLM生成文本检测的性能,改进幅度可达37%。
Comments Accepted by NeurIPS2025
MolSight: 基于SMILES预训练、多粒度学习和强化学习的光学化学结构识别
专题命中 预训练与数据 :pretraining(title);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 MolSight通过SMILES预训练、多粒度学习和强化学习,实现高精度的立体化学结构识别。
机构 * Google DeepMind(谷歌DeepMind) ; Google DeepMind & Stanford University(谷歌DeepMind与斯坦福大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments FoRLM workshop, NeurIPS 2025
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments Paper has been accepted by AAAI 2026