Unsupervised Pretraining for Neural Machine Translation Using Elastic Weight Consolidation
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
Comments ACL-SRW 2019 (camera-ready)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
Comments ACL-SRW 2019 (camera-ready)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments EMNLP 2020, main conference
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Findings in EMNLP 2020
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
Comments 17 pages, 6 tables, 2 figures. AK and LK contributed equally
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
Comments 9 pages
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Accepted to ICLR 2020
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments accepted at EMNLP 2019
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL
Comments NAACL 2019
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Accepted in CICLing 2019
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Journal ref Blackbox NLP Workshop, EMNLP 2018
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);SLM(abstract);分类 cs.CL
Comments EMNLP'01, Pittsburgh; 8 pages
Journal ref EMNLP/NAACL 2001 Conference Proceedings
专题命中 预训练与数据 :language model(title,abstract);SLM(abstract);分类 cs.CL
Comments 4 pages + 2 pages of ERRATA
Journal ref Proceedings of NLDB'99, Klagenfurt, Austria
小实验,更经济的决策:微预训练中分阶段提升的案例研究
机构 * Hewlett Packard Enterprise(慧与科技公司)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究微预训练中分阶段提升协议,通过固定预算筛选配置,在Windows A100和Linux L40S上验证,发现早期排名不稳定,但最终协议以144 GPU小时找到最优配置,成本低于全量筛选。
Comments 14 pages, 5 figures; 12-hour dual-host micro-pretraining promotion study; source package includes curated ancillary artifacts
理解语言模型中转向向量的不可靠性:几何预测器与线性近似的局限性
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;foundation model(comments)
AI总结 该研究探讨了语言模型中转向向量的可靠性问题,发现训练数据和行为表示对转向效果有显著影响,提出几何预测器和非线性近似方法以提升稳定性。
Comments Master's Thesis, University of Tübingen. 89 pages, 34 figures. Portions of this work were published at the ICLR 2025 Workshop on Foundation Models in the Wild (see arXiv:2505.22637)
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Vanderbilt University(范德比尔特大学)
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)
Comments Accepted by MIDL 2025. Code available at https://github.com/junyuchen245/Pretraining_Image_Registration_DNNs
TabularQGAN:一种用于表格数据合成的量子生成模型
机构 * SAP SE(SAP公司) ; BASF Digital Solutions(巴斯夫数字解决方案) ; QUTAC Quantum Technology and Application Consortium(QUTAC量子技术与应用联盟) ; Technical University of Munich CIT(慕尼黑技术大学CIT) ; Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) ; Merck KGaA(默克公司)
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文提出新型量子生成对抗网络TabularQGAN,针对异构表格数据建模,在MIMIC-III等数据集上与经典及LLM方法对比,取得有竞争力甚至领先的合成性能,验证了其泛化能力。
Comments 19 pages,8 figures and 4 tables
Journal ref Sci. Rep. 16, 23555 (2026)1-19
基于模拟响应概率的多模态题目参数估计
机构 * College Board(大学理事会)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究基于Qwen3.5微调多模态大语言模型,利用含图像与文本的多项选择题训练语料,通过学习学生能力相关的选择概率,实现了题目参数的准确估计。
Comments Submitted and Accepted for AIME-Con 2026
自然语言处理心理测量学
机构 * University of Trento(特伦托大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 该研究将文本心理预测视为心理测量问题,用9种LLM角色完成问卷,结合多特征构建RF模型,解释了SWLS等的方差,还能区分角色、分类临床与对照参与者,明确了NLP心理测量的区分方法。
MetaSICL: 通过元语音上下文学习适应听觉大语言模型
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。
FACTWASH:捕捉将传闻洗成事实的AI改写
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出开源工具factwash,用于捕捉AI将传闻洗成事实的改写,明确否定线索检测F1达0.91,LLM见证者可提升线索检测召回率,在mem0 2.0.7上标记8个模糊传闻写入中的5个。
Comments 15 pages, 3 figures. Code and data: https://github.com/collapseindex/factwash
ScalableRAG:零摄入成本下的高质量检索增强生成
机构 * Cohesity(科赫思)
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 研究提出零摄入成本的ScalableRAG及有限摄入的改进版本,通过维护工作区实现即时聚合推理,在六个语料库测试中表现出色,平均准确率大幅超越基线,还通过固定LLM调用次数等进一步提升大规模时的准确率。
位置:AI安全政策应针对系统,而非模型
机构 * AI Safety Department(人工智能安全部门) ; SimulaMet and OsloMet(SimulaMet和奥斯陆计量)
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文提出swarm-attack框架,展示通过协调轻量级LLM代理发现系统漏洞和绕过安全机制的可能性,证明在低成本硬件上可实现零成本安全测试。
智能体技能中的跨层错位检测:一种渐进式加载感知对比学习方法
机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究智能体技能跨层错位问题,提出渐进式加载感知分层对比学习框架PL-HCL,通过建模技能分层结构和学习跨层一致性来检测错位,使用相关语料库与挑战集,提升宏F1指标,为用户和运营商提供筛选工具与设计原则。
Comments 10 pages, 5 pages supplemental. Accepted at the KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI