Generating Datasets with Pretrained Language Models
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
Comments Accepted at EMNLP2021
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
Comments Accepted at EMNLP2021
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI
Comments Accepted to ACM MM 2021
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI
Comments 6 pages, to appear in ACL2021
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
Comments Published in Proceedings of the 8th Workshop on Balto-Slavic Natural Language Processing
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
Comments v2: Fixed error in Figure 2
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments Accepted in ACL2020
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
Comments Accepted at SIGIR 2020 (Long)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments AAAI 2020 - The Thirty-Fourth AAAI Conference on Artificial Intelligence
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments Pretrained models and code are available at https://github.com/zihangdai/xlnet
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
Comments 12 pages, conference
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
Comments NAACL 2019
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments Updated to accepted EMNLP 2017 version
表格基础模型的出人意料的泛化特性研究
机构 * Polytechnique Montréal(蒙特利尔理工学院) ; Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) ; Chandar Research Lab(钱达尔研究实验室) ; University of Toronto(多伦多大学) ; Layer 6 AI(第六层人工智能公司) ; Prior Labs(普里奥实验室) ; ELLIS Institute Tübingen(埃利斯研究所图宾根分部) ; University of Freiburg(弗赖堡大学) ; Cohere(科here公司)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG
AI总结 该研究揭示仅在单个真实表格上预训练的TFMs有强迁移性,提出以任务为中心、基于检索的新视角,为TFMs的模型与语料库设计提供了新框架。
Comments This work extends our previous work, Generalization Can Emerge in Tabular Foundation Models From a Single Table (arXiv:2511.09665)
PluRel-to-RDB-PFN:模式引导的合成关系预训练
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract,comments);分类 cs.LG
AI总结 该研究将合成关系数据库生成器PluRel作为RDB-PFN的外部预训练数据源,通过三种课程策略对比,发现模式优先引导策略仅用少量数据即可恢复RDB-PFN近94%的性能,证实早期接触真实模式的有效性。
Comments Proceedings of the 2nd ICML on Foundation Models for Structured Data
奇妙预训练优化器及其发现之处 II:超球优化
机构 * Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学) ; Tsinghua University(清华大学)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG
AI总结 针对Muon等优化器在大模型预训练中增益随规模增大而减弱的问题,提出Hyperball包装器,固定权重矩阵及其更新的Frobenius范数,在1.2B参数模型上实现20-30%的token等效加速,并改善学习率迁移。
Comments Corresponding blog post: https://psychedelic-sunstone-851.notion.site/Fantastic-Pretraining-Optimizers-and-Where-to-Find-Them-2-1-Hyperball-Optimization-2e924306e6f280e7a5ffee00eb40a0dd
机构 * School of Computer Science, University of Birmingham(英国伯明翰大学计算机科学学院) ; Department of Information Systems and Computer Science, Ateneo de Manila University(马尼拉亚托大学信息系统与计算机科学系)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Accepted for presentation at The First Workshop on Language Models for Low-Resource Languages (LoResLM) at The 31st International Conference on Computational Linguistics (COLING 2025)
Journal ref https://aclanthology.org/2025.loreslm-1.9/
专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);分类 cs.AI;foundation model(comments)
Comments Accepted by ICCV Workshop 2023 (What is Next in Multimodal Foundation Models?)
SLIM-RL: 无需轨迹切分的扩散LLM风险预算随机掩码强化学习
机构 * Technical University of Denmark(丹麦技术大学) ; MBZUAI Institute of Foundation Models(穆罕默德·本·扎耶德人工智能大学基础模型研究所) ; Iowa State University(爱荷华州立大学) ; Red Hat AI Innovation(红帽人工智能创新实验室) ; MIT–IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)
专题命中 预训练与数据 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SLIM-RL方法,通过τ预算解码器控制每步提交风险,结合无迹随机掩码目标和自适应方差缩减技术,在不重构训练轨迹的情况下匹配或超越现有轨迹感知方法,在数学和代码任务上取得显著提升。
Comments 17 pages
SpeakerCard-1M:面向野外说话人确认的基于证据的说话人卡片语料库
机构 * Brno University of Technology, Czechia(布拉格技术大学,捷克) ; Peking University, China(北京大学,中国) ; Xiaomi, China(小米,中国) ; Athens University of Economics and Business, Greece(雅典经济与商业大学,希腊) ; The Hong Kong Polytechnic University, Hong Kong(香港理工大学,香港) ; Nanjing University, China(南京大学,中国)
专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(abstract)
AI总结 提出SpeakerCard-1M双语说话人资源,通过声学探针和受限LLM生成结构化说话人卡片,并定义跨模态协议以支持基于证据的说话人确认。
Comments Corpus and protocols at https://junyipeng00.github.io/SpeakerCard-1M-page
立场:术语“机器遗忘”在大型语言模型中被过度使用
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文主张机器遗忘应限于数据集定义的删除,而许多标为“遗忘”的任务(如拒绝有害请求、实体/知识移除)实为不同目标,需不同术语和基线,并指出术语混淆导致指标误用。
Comments 13 pages; ICML 2026 Position Paper Track. Sangyeon Yoon and Yeachan Jun contributed equally
轻量级3D特征预训练:基于2D基础模型的贝叶斯反演
机构 * U2IS, ENSTA – Institut Polytechnique de Paris, Palaiseau, France(U2IS,ENSTA – 巴黎综合理工学院,法国帕莱索) ; Pôle Recherche, Agence Ministérielle pour l’IA de Défense, Palaiseau, France(研究部,国防人工智能部级机构,法国帕莱索)
专题命中 预训练与数据 :foundation model(title);pretraining(title)
AI总结 提出Casper3D,一种轻量级概率框架,通过贝叶斯反演将多视图2D基础模型嵌入转换为潜在3D语义表示,实现开放词汇3D理解。
统一Transformer缩放定律中的学习动力学与泛化
机构 * Sun Yat-sen University(中山大学)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过将Transformer学习动力学形式化为ODE系统并近似为核行为,严格分析了随机梯度下降训练下的泛化误差,揭示了计算资源缩放时泛化误差的指数衰减与幂律衰减的两阶段相变,并建立了紧的上下界。
Comments 87 pages, 10 figures, 3 tables
将信号转换为语言以实现基于sEMG的活动识别
机构 * Lancaster University(兰卡斯特大学) ; Monash University(墨尔本大学) ; Cardiff University(卡迪夫大学)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 本文提出了一种基于大语言模型的sEMG活动识别框架,通过将连续sEMG信号转换为语言形式,提升活动识别的准确性。
数据混合可在知识获取中引发相变
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) ; College of AI, Tsinghua University(清华大学人工智能学院) ; Shanghai Qizhi Institute(上海启智研究院) ; Simons Institute for the Theory of Computing, UC Berkeley(伯克利理论计算研究所)
专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了在数据混合训练中LLM的知识获取行为,发现混合比例和模型规模会影响知识获取的相变现象,揭示了容量分配机制与信息理论框架下的预测关系。
Comments NeurIPS'25 Spotlight
BARRED: 通过不对称辩论合成定制策略的守卫规则
机构 * Plurai Inc.(Plurai公司)
专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);small language model(abstract);prompting(abstract)
AI总结 BARRED通过不对称辩论生成合成训练数据,提升定制策略的安全性与效率,实验表明其优于现有模型。
SkillX: 为智能体自动构建技能知识库
机构 * Zhejiang University(浙江大学) ; Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SkillX通过多级技能设计、迭代技能精炼和探索性技能扩展,构建可复用的技能知识库,提升智能体在长周期任务中的表现和泛化能力。
Comments Work in progress