Memory-Augmented Generative Adversarial Transformers
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2023 (Long Paper). 17 pages, 2 figures, 15 tables. The Appendix starts on page 12
Journal ref Findings of the Association for Computational Linguistics: EMNLP 2023, pages 8943-8960
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG
Comments ASPLOS 2023, Wild and Crazy Ideas session
专题命中 长上下文与记忆 :language model(abstract);language agent(abstract);分类 cs.AI
Comments 12 pages, 4 figures
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG
Comments 10 pages, 10 figures
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
Comments EMNLP 2023 Main Paper (Camera Ready)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI
Comments 11 pages, 15 figures
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
Comments Accepted by ACL 2023
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
Comments The 24th International Conference on Artificial Intelligence in Education (AIED 2023)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
Comments Accepted to SemEval 2023, winners for 9 out of 13 tracks, performance beyond ChatGPT
专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);分类 cs.CL
Journal ref ACL 2023 main proceedings
专题命中 长上下文与记忆 :LLM(abstract);language model(abstract);分类 cs.LG
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
Comments 17 pages
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG
Comments 36 pages, 7 figures; ICML 2022
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG
Comments 11 pages, 3 figures, submitted to NeurIPS 2021
专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);分类 cs.CL
Comments Accepted by ACL 2021 (main conference, long paper)
超越教师似然:面向长上下文推理的组校准在线策略蒸馏
机构 * Tsinghua University(清华大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; OpenBMB
专题命中 长上下文与记忆 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对长上下文推理中 OPD 的教师-验证器分歧问题,提出 GC-OPD 方法,结合验证器结果优化 OPD,在五个长上下文基准上显著提升 Qwen3 模型性能。
Comments 20 pages, 5 figures
LT-Mem:面向终身场景理解的感知时间动态的时空记忆
机构 * DGIST(大邱庆北科学技术院)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)
AI总结 该研究针对机器人长期场景理解的时间遗忘问题,提出LT-Mem时空记忆框架,结合多会话SLAM与Tri-Memory结构,在LT-VQA数据集上性能优于基线且token消耗更少。
Comments 8 pages, 8 figures, 6 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
干草堆中的越狱攻击
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对长上下文语言模型,提出 NINJA 越狱攻击方法,利用有害目标位置的关键作用,在 HarmBench 基准上提升了多款先进模型的攻击成功率,且该方法低资源、可迁移、难检测、计算最优,揭示了长上下文可引入模型安全漏洞。
全在线KV缓存调度的紧线性确定性竞争比
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)
AI总结 该研究针对全在线KV缓存调度问题,通过构造困难实例得到确定性竞争比下界,利用均匀因果串行策略得到上界,在Lean 4中完成机器验证,证明其竞争比为紧线性的Θ(n)。
Comments 6 pages. The exact fully online model, fixed-memory-before-scheduler quantifier order, serial upper bound, and wide-short lower bound are checked in Lean 4. A separate reproducibility archive contains pinned-source bootstraps, exact finite controls, formal proofs, tests, and canonical SHA-256 manifests
Proteus:面向长上下文序列建模的增量式内存激活机制
机构 * Mila(米拉计算科学研究所) ; Google(谷歌公司)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Proteus 是一种增量式内存激活机制,可嵌入多种神经内存架构,应用于 SWLA 等模型后,能在长上下文相关任务上实现性能提升,证明调度有效容量对序列建模的适用性。
该记住什么,该透露什么:面向对话智能体的隐私感知记忆
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)
AI总结 该研究针对对话智能体的隐私风险,提出SP-Mem隐私感知记忆架构,通过全生命周期隐私设计实现更强个性化并减少不必要隐私暴露,还构建了相关基准。
BCMT:分块因果记忆Transformer
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出BCMT架构,通过分块局部自注意力与指数因果记忆解耦长程依赖建模,在1024token上下文的语言建模中,性能与密集Transformer相当,且训练吞吐量更高、内存消耗更低。
Comments 19 pages. Official implementation: https://github.com/rachidlabs/BCMT
TIEM:用于事件驱动金融预测的超图证据与技能记忆的时间整合框架
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)
AI总结 该研究针对事件驱动金融预测中大型语言模型智能体存在的证据鸿沟问题,提出带时间戳门控的TIEM框架,引入FinPURE基准,经多组金融基准验证其性能优于现有基线。
Memoir:针对静态应用安全测试工具的误报记忆学习、验证与演化
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)
AI总结 本研究针对SAST工具的误报问题,提出Memoir框架,通过构建与演化语义记忆实现误报识别,在CWE-Bench-Java上表现优异,且记忆库可跨工具泛化。
智能体的肌肉记忆:编译而非仅检索
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)
AI总结 本文提出将重复用户意图编译为专用专家智能体的肌肉记忆范式,通过四阶段流水线实现,在90个场景中专家触发时胜率达88.9%,优于传统检索模式,为智能体记忆设计提供新方向。
Comments 12 pages, 2 figures
视觉世界的搜索:持久视觉记忆、分层索引与基于源的证据
专题命中 长上下文与记忆 :foundation model(abstract);pretraining(abstract)
AI总结 该研究针对智能体持续观测视觉数据的场景,提出基于持久视觉记忆等的视频检索基础设施模型,经9800+查询对比,通用组件流水线在Recall@1/@3/@10上优于商业视频原生引擎
Comments 33 pages, 5 figures, 17 tables. Technical report. Benchmark configurations and reproduction instructions: https://github.com/video-db/search-over-the-visual-world