On Extracting Specialized Code Abilities from Large Language Models: A Feasibility Study
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments 13 pages
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments 13 pages
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 13 pages, six visualizations (four figures, two tables)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2023 Findings
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ACL 2023, code available at https://github.com/INK-USC/APOLLO
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract)
Comments 15 pages, 3 figures. Project released at: https://github.com/TencentARC/GVT
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2023. (Code: https://github.com/PeterGriffinJin/Patton)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2022
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted and to be presented at the 17th Conference of the European Chapter of the Association for Computational Linguistics (EACL), 2023
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments NAACL 2022
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments to be published in ACL 2022. 16 pages, 4 figures
专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Slightly different from the KDD version
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at EMNLP 2021
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
混合而非挑选:为什么合成语料组合对时间序列基础模型预训练至关重要
机构 * Birla AI Labs(巴尔拉人工智能实验室)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 针对时间序列基础模型预训练中合成数据生成器选择困难的问题,提出简单等权混合所有生成器的方法,匹配或超越最优单个生成器,并与真实数据结合获得最强预训练语料。
Comments Accepted at the ICML 2026 Workshop on Foundation Models for Structured Data (FMSD), Seoul, South Korea
ECG基础模型的预训练策略与扩展:一项系统研究
机构 * AI4Health Division(AI4Health部门)
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文系统评估了ECG基础模型的预训练方法,探讨了不同对比和非对比自监督学习目标在不同预训练数据集规模下的表现,发现对比预测编码在跨临床任务的迁移性能上表现最佳。
Comments 59 pages, 16 figures, 59 Tables. Code available at https://anonymous.4open.science/r/ecg-pretraining-strategies-4DE3
专题命中 预训练与数据 :prompting(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Comments 15 pages, 6 figures. Published as a conference paper at ACL 2022 (long). Code available at https://github.com/shmsw25/Channel-LM-Prompting
6G原生AI与信道基础模型
专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 本文从系统设计视角界定6G原生AI的内涵,提出信道基础模型(CFMs)作为6G原生AI的技术范式,阐明其类型与优势,验证其在标注有限时可提升定位与波束预测性能。
Comments Awesome GitHub: https://github.com/GREAT-ISAC/Awesome-Channel-Foundation-Models
越受欢迎,越难遗忘:用于大语言模型遗忘的自适应受欢迎度
机构 * AIRI ; Sber AI Lab(Sber AI实验室) ; Skoltech(斯科尔科沃科学技术研究院) ; ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息学研究所可信人工智能研究中心)
专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(abstract);分类 cs.CL
AI总结 针对现有LLM遗忘方法未区分训练数据频率的问题,提出AdaPop方法,经实验其在转述查询和对抗性重构下均能显著减少遗忘内容泄露。
已发布的大语言模型词汇表能否支持隐藏语料库的词元级估计?
机构 * Tsinghua University(清华大学) ; Alibaba Group(阿里巴巴集团)
专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(abstract);分类 cs.CL
AI总结 该研究针对隐藏语料库的词元级估计问题,提出分位数引导密度估计(QGDE)方法,利用已发布的LLM分词器词汇表实现了低误差的细粒度语料估计,为相关任务提供了新的有效信号来源。
EXPLORE:使用语言模型进行引导搜索以生成模拟拓扑结构
机构 * Duke University(杜克大学) ; MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室) ; IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)
专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.LG
AI总结 本文针对自动化模拟电路拓扑设计难题,提出EXPLORE框架,集成模拟器引导蒙特卡罗树搜索与基于变压器的解码,利用语言模型先验优化搜索,在6组件基准测试中显著提升成功率、降低均方误差,推动LLM驱动设计自动化。
Comments MLCAD 26' accepted
重新思考语音-LLM集成用于ASR:通过交错实现有效的联合语音-文本训练
机构 * Microsoft(微软)
专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL
AI总结 提出JSTIP,一种面向ASR的预训练策略,通过构建词级和段级交错语音-文本序列,在38k小时数据上相比基线提升了实体识别准确率,并缩小了模态差距。
预算约束下的多智能体LLM“行动或延迟”协商与局部可靠性界限
机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) ; General Motors (GM)(通用汽车(GM))
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI
AI总结 提出一种预算约束下的“行动或延迟”决策框架,通过k近邻下置信界评估LLM协商的可靠性,在满足用户指定的错误行动预算时自动执行,否则延迟人工审核,并在六个基准上验证了有效性和安全性。
预训练分布如何塑造上下文学习?一个基本的权衡
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 通过理论框架和实验,揭示预训练分布的统计特性(如重尾行为)在上下文学习中导致任务选择鲁棒性与泛化能力之间的基本权衡。
Comments 57 pages, 15 figures; to be presented at ICML 2026
Visored: 一种面向LLM生成数学的受控自然语言证明器
机构 * University of Washington(华盛顿大学) ; University of Innsbruck(因斯布鲁克大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI
AI总结 提出一种基于依赖类型的证明器,其表面模仿数学自然语言,并通过规则驱动的自动化层填补常规步骤,使LLM无需专用训练数据即可在miniF2F基准上有效使用,并输出可检查的Lean文件。
通过探针提示实现自动化归因图解释
机构 * University of Cambridge(剑桥大学)
专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出探针提示方法,利用跨提示激活签名将归因图特征分组为概念对齐的超节点,并通过因果干预验证标签,在Gemma-2-2B上实现100%的预测转向行为。
Comments 35 pages, 24 figures, 18 tables. Code and interactive demo available
从风险分类到行动方案修复:一种基于护栏反馈驱动的LLM代理框架
机构 * The University of Melbourne(墨尔本大学) ; Tsinghua University(清华大学)
专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.AI
AI总结 提出TRIAD框架,通过护栏生成的言语反馈引导代理在规划步骤中保持良性目标,实现安全与效用的最佳平衡。
Comments 32 pages
LLM持续预训练中最优超参数的可预测缩放定律
机构 * MeiTuan(美团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文发现持续预训练中学习率和批大小等最优超参数遵循稳定可预测的缩放定律,并提出一个两阶段框架,通过小规模代理模型和状态感知预测,将超参数搜索开销降低90%且性能相当或更优。
面向TabPFN的文本编码器预训练
机构 * University of California, Berkeley(加州大学伯克利分校) ; DeepMind(深度思维)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);language model(abstract);foundation model(abstract)
AI总结 提出TabPFN文本适配器,通过轻量级适配器将文本嵌入映射到TabPFN的嵌入空间,避免PCA瓶颈,保留TabPFN数值优势,训练效率更高。
须知:基于语境完整性的隐私意识LLM委托查询重写
机构 * Sun Yat-sen University(中山大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI
AI总结 针对LLM委托中查询隐私泄露问题,提出基于语境完整性的查询重写框架,通过CI引导的强化学习训练重写器,在保留任务关键信息的同时抑制非必要敏感披露,实现最佳隐私-效用权衡。