BTLM-3B-8K: 7B Parameter Performance in a 3B Parameter Model
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)
Comments In Proceedings NCMA 2023, arXiv:2309.07333
Journal ref EPTCS 388, 2023, pp. 16-27
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICML 2023
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments accepted at AACL2022
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NAACL 2022 (16 pages)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to the 39th International Conference on Machine Learning (ICML'22)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)
Comments 7 pages, 2 figures. Accepted to the ReNeuIR workshop at SIGIR 2022
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments the SIGNLL Conference on Computational Natural Language Learning (CoNLL, 2018)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published as a conference paper at ICLR 2022 (spotlight)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 5 pages, 3 figures, 3 tables
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted by AAAI 2021 main conference
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at NAACL 2019; This is camera Ready version; Code is available at https://github.com/Frozenmad/AMN_SRL
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at ICLR 2019
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published in ICLR 2018 ( the Sixth International Conference on Learning Representations)
Trellis: 在注意力模型中学习压缩键值记忆
机构 * Google Research(谷歌研究)
专题命中 长上下文与记忆 :language model(abstract,comments);分类 cs.CL、cs.LG
AI总结 Trellis通过动态压缩键值内存提升注意力模型的效率与长上下文处理能力
Comments In Second Conference on Language Modeling (COLM) (2025)
专题命中 长上下文与记忆 :language model(abstract,comments);分类 cs.CL、cs.AI
Comments This is an old and now obsolete draft. See arXiv:2109.14723 ("BeliefBank: Adding Memory to a Pre-Trained Language Model for a Systematic Notion of Belief") for the final paper
利用工具链持续学习:超越模型参数的持续适应
机构 * University of Wollongong(卧龙岗大学) ; Nanjing University(南京大学)
专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出工具链持续学习(HCL)范式,围绕冻结基础模型演化工具链,通过受保护演化机制缓解工具链级遗忘,在多任务实验中相对基准增益超10%,可调整稳定性-可塑性权衡。
预测随机低维重参数化何时能训练神经网络
机构 * Tsinghua University(清华大学) ; The University of Manchester(曼彻斯特大学) ; University of Kentucky(肯塔基大学) ; Miami University(迈阿密大学) ; University of Dayton(代顿大学) ; Institute for Biomedical Informatics, University of Kentucky(肯塔基大学生物医学信息学研究所)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对随机低维重参数化训练神经网络的潜在空间规模问题,提出取向分辨二次主公式,引入RaMaN模型,实现内存优化,实验验证其预测与转换跟踪性能优于取向无关近似。
优化器状态应存于何处?内存高效的专家混合训练分层状态分配
专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG
AI总结 研究MoE训练中优化器状态存储位置,提出SkewAdam方法,根据参数群体差异分层分配状态,大幅减少内存占用,提升训练效率,验证了优化器状态存储位置对训练效果的重要性。
Comments 12 pages, 4 figures, 9 tables. v2: adds Adam-mini discussion, learning-rate sweeps with repeated seeds for the AdamW and Adafactor baselines, and a tier ablation; corrects the attribution of the perplexity advantage between momentum and the factored estimator. Code and per-run training logs: https://github.com/nuemaan/skewadam
Consolidator:学习跨上下文边界的持久路由记忆
机构 * College of Pharmacy, Chungnam National University(忠南国立大学药学院) ; Department of Computer Science & Engineering, Chungnam National University(忠南国立大学计算机科学与工程学院)
专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出Consolidator算子,在冻结骨干与记忆接口的情况下,通过少量可训练参数实现跨上下文边界的持久路由记忆,在两段式模10映射任务中显著提升了更新后映射的召回率。
内存管理的长上下文注意力:可编辑请求局部记忆的初步研究
机构 * Zjydiary(智纪日记)
专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.LG
AI总结 提出一种混合架构,将快速循环或稀疏骨干与可编辑的请求局部记忆槽和查询时稀疏回退相结合,以解决长上下文模型中的记忆写入、覆盖和抗污染问题。
Comments 16 pages, 11 figures, 5 tables. Substantially rewritten v3: retitled and reframed as MMLA; adds an eventized architecture, trusted row assembly, hard atomic overwrite/NULL, claim-evidence mapping, PM-I2 negative results, stop rules, and a conditional roadmap. Preserves the original Llama budget-gate failure. Project: https://github.com/MMLA-org/mmla-memory
π-注意力:用于高效长上下文建模的周期性稀疏变换器
机构 * University of California - Los Angeles(加州大学洛杉矶分校) ; Columbia University(哥伦比亚大学)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出π注意力,通过周期性稀疏结构实现高效长上下文建模,相比环形注意力在接收场增长上更优,且在相同上下文长度下使用更少的GPU。
AgentMemBench:用于评估对话AI智能体长期记忆管理策略的系统基准
机构 * Sofrecom(索弗雷科姆)
专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 该研究构建了AgentMemBench基准,评估五种记忆策略及两款现有系统,发现外部键值存储(EKV)在长程对话记忆任务中表现最优,但存在内存占用成本,同时公开了全部可复现资源。
Comments 22 pages, 3 figures submitted on Neural Computing and Applications
ECHO: 在智能体强化学习中通过选择性回合记忆进行剪枝行动与追踪学习
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Baidu Inc.(百度公司) ; University of Science and Technology of China(中国科学技术大学)
专题命中 长上下文与记忆 :language agent(abstract);分类 cs.AI、cs.LG
AI总结 提出ECHO框架,通过选择性回合记忆和源索引重建解决长程智能体强化学习中的历史崩溃与可追踪学习问题,在BrowseComp-Plus上达到43.4%准确率,优于GRPO和SUPO。
TFGformer:基于时频图学习与协变量融合的多变量时间序列预测
专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 针对异构IoT传感器多变量时间序列预测问题,提出CrossRAG框架,结合SAM、FCC学习与CATF,在7个基准上性能优于仅参数化基线及现有检索增强预测方法。
Transformer 的拓扑困境
机构 * Google DeepMind(谷歌DeepMind)
专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了Transformer在处理序列结构时的拓扑问题,指出其纯前馈架构限制了动态状态跟踪,提出应通过递归架构转向隐含激活动态,并介绍了连续思维Transformer架构的分类方法及未来研究方向。
不遗忘的艺术:面向持续学习的局部学习架构
机构 * Arkadhi Research(阿卡迪研究机构)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出持续学习架构CMP,采用稀疏关系编码、两层竞争记忆与局部更新,在语言建模实验中较参数匹配的Transformer基线表现出更低的灾难性遗忘,为持续学习提供了新方向。
Comments 28 pages, 11 figures