Assessing Privacy Risks in Language Models: A Case Study on Summarization Tasks
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments accepted at WMT 2023
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published in ICML 2023. Project page: https://jykoh.com/fromage
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments To be published in the KDD 2023 proceedings as a full paper
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICLR 2023
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Third Workshop on Simple and Efficient Natural Language Processing, EMNLP 2022
专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted by COLING 2022
专题命中 预训练与数据 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2022
专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract)
Comments To appear at NeurIPs 2022, Camera Ready with Typos fixed
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2021 Findings. Code and data: https://github.com/ruiqi-zhong/acl2021-instance-level
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments This version is the camera-ready version for ICLR 2021. Main changes include a detailed discussion about natural tasks, more detailed proof sketch and updated experimental evaluations
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NAACL 2021 camera-ready version
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Findings of EMNLP 2020
训练公平表格基础模型
机构 * ÉTS Montréal(蒙特利尔高等技术学院) ; Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) ; Layer 6 AI(第六层人工智能公司) ; University of Calgary(卡尔加里大学) ; CIFAR(加拿大高级研究所)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 针对表格基础模型(TFMs)公平性未被充分探索的问题,本研究提出FairTFM训练策略,将公平约束融入TFMs训练,在132个公平任务上实现公平性提升且保持竞争力准确性。
Comments Spotlight paper at the ICML 2026 Workshop on Foundation Models for Structured Data
NumLeak: 基础模型中的公开数值基准作为潜在标签
机构 * Princeton University(普林斯顿大学)
专题命中 预训练与数据 :foundation model(title,comments);LLM(abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出NumLeak框架,通过API边界探测和开源因果模型的白盒验证,揭示基础模型在预训练中记忆公开数值基准,导致评估高估泛化能力。
Comments 23 pages, 12 figures, 17 tables. Accepted at the ICML 2026 Workshop on the Impact of Memorization on Trustworthy Foundation Models (MemFM)
迈向多语言预训练数据选择的跨语言质量分类器
机构 * Machine Learning Optimization Lab(机器学习优化实验室) ; Ecole Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)
专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了通过跨语言迁移、第三四分位采样和保留率调整策略,提升多语言数据筛选效果,证明大规模多语言池化在稳定性与准确率上优于单语基线,尤其对低资源语言有显著提升。
Comments Accepted at the 3rd Workshop on Navigating and Addressing Data Problems for Foundation Models (DATA-FM @ ICLR 2026). 31 pages, 4 figures
机构 * Université Paris-Saclay, Inria, CEA(巴黎萨克雷大学、法国国家信息与自动化研究所、法国原子能委员会) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
Journal ref NeurIPS 2025 Workshop "Recent Advances in Time Series Foundation Models Have We Reached the 'BERT Moment'?"
机构 * Independent Researcher(独立研究者) ; Machine Intelligence Research Institute(机器智能研究院)
专题命中 预训练与数据 :foundation model(title,abstract);SFT(abstract);分类 cs.AI、cs.LG
Comments Preprint. This work has been submitted to the Reliable and Responsible Foundation Models Workshop at ICML 2025 for review
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI;LLM(comments)
Comments Code is available at https://github.com/sail-sg/sailor-llm
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
Comments Foundation Models for Decision Making Workshop at Neural Information Processing Systems, 2022
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract,comments);分类 cs.CL、cs.LG
Comments Accepted paper in Pretrain@KDD 2021 (The International Workshop on Pretraining: Algorithms, Architectures, and Applications)
EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由
专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 EntropyMoE针对无分词器字节级LLM的块计算局限性,提出基于块熵的稀疏专家路由MoE架构,在降低位每字节的同时保持下游准确率,扩展了MoE建模的应用范围。
超越凸性的驯服次梯度未校正朗之万算法
机构 * University of Edinburgh(爱丁堡大学) ; National Technical University of Athens(雅典国立技术大学) ; Athena/Archimedes Research Centre(雅典娜/阿基米德研究中心)
专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.LG
AI总结 本文针对非光滑、超线性梯度增长且非凸的目标分布采样问题,提出SG-TULA算法,推导其非渐近收敛界,验证假设并用于GPT-2系列LLM预训练,效果优于AdamW等。
Comments 53 pages
Cochise:自主渗透测试的参考框架
机构 * TU Wien(维也纳技术大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI
AI总结 Cochise提供了一个简洁的自主渗透测试框架,支持通过SSH连接LLM代理与Linux主机,并通过分离的规划-执行架构实现可控环境,同时提供重放和分析工具以支持研究。
DuplexGen:人机交替对话的自适应合成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Seoul National University(首尔大学) ; Columbia University(哥伦比亚大学) ; University of California, Berkeley(加州大学伯克利分校) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 预训练与数据 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL
AI总结 DuplexGen框架通过将LLM预测与少量槽级人类偏好标注校准,生成场景自适应交替发言对话,契合人类偏好的效果优于未校准方法,证明人类校准对交替发言合成场景特定性的关键作用。
Comments Manuscript under review
基于ICL的CAD代码生成的Design-Specification Tiling设计
机构 * National Key Laboratory for Novel Software Technology, School of Artificial Intelligence, Nanjing University(新型软件技术国家实验室,人工智能学院,南京大学)
专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);prompting(abstract);分类 cs.LG
AI总结 本文提出DST方法,通过量化知识充分性提升CAD代码生成质量,优于现有ICL示例选择策略。
Heuresis: 自主AI研究智能体在质量、多样性和新颖性上的搜索策略
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; Hexo AI
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 提出Heuresis框架,将研究流程抽象为通用原语,实现开放科学探索;在三个领域评估六种搜索策略,发现完全新颖的想法罕见且无法达到最高性能,揭示了当前策略无法扩展质量-新颖性前沿的挑战。
Comments 14 pages main text, 82 pages total including appendix; 38 figures, 4 tables
MGUP:一种用于随机优化的动量-梯度对齐更新策略
机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Pengcheng Laboratory(鹏城实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 提出MGUP机制,通过按固定比例选择参数施加大步长、其余参数用小步长,增强动量优化器,理论保证收敛,实验表明提升训练效率与稳定性。
Comments Published in NeurIPS 2025