arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4779 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4779 篇

2404.09231 2024-04-16 cs.CV 75%

Tri-modal Confluence with Temporal Dynamics for Scene Graph Generation in Operating Rooms

Diandian Guo, Manxi Lin, Jialun Pei, He Tang, Yueming Jin, Pheng-Ann Heng

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06082 2024-04-10 cs.SE 75%

A RAG Method for Source Code Inquiry Tailored to Long-Context LLMs

Toshihiro Kamiya

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 6 pages, 2 columns, English translation of the manuscript originally presented in Japanese at a domestic workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01096 2024-04-02 cs.SE cs.PL 75%

Enabling Memory Safety of C Programs using LLMs

Nausheen Mohammed, Akash Lal, Aseem Rastogi, Subhajit Roy, Rahul Sharma

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16449 2024-03-12 cs.CV 75%

MovieChat: From Dense Token to Sparse Memory for Long Video Understanding

Enxin Song, Wenhao Chai, Guanhong Wang, Yucheng Zhang, Haoyang Zhou, Feiyang Wu, Haozhe Chi, Xun Guo, Tian Ye, Yanting Zhang, Yan Lu, Jenq-Neng Hwang, Gaoang Wang

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);foundation model(abstract)

Comments CVPR 2024. First three authors contribute equally to this work. Project Website https://rese1f.github.io/MovieChat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08646 2024-02-29 cs.LG cs.AI cs.CL 75%

CoCA: Fusing Position Embedding with Collinear Constrained Attention in Transformers for Long Context Window Extending

Shiyi Zhu, Jing Ye, Wei Jiang, Siqiao Xue, Qi Zhang, Yifan Wu, Jianguo Li

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12399 2024-02-22 cs.LG cs.AI cs.CL 75%

Turn Waste into Worth: Rectifying Top-$k$ Router of MoE

Zhiyuan Zeng, Qipeng Guo, Zhaoye Fei, Zhangyue Yin, Yunhua Zhou, Linyang Li, Tianxiang Sun, Hang Yan, Dahua Lin, Xipeng Qiu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01279 2023-12-05 cs.CL cs.AI cs.LG 75%

TextGenSHAP: Scalable Post-hoc Explanations in Text Generation with Long Documents

James Enouen, Hootan Nakhost, Sayna Ebrahimi, Sercan O Arik, Yan Liu, Tomas Pfister

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03170 2023-12-01 cs.CL cs.AI cs.LG 75%

Focused Transformer: Contrastive Training for Context Scaling

Szymon Tworkowski, Konrad Staniszewski, Mikołaj Pacek, Yuhuai Wu, Henryk Michalewski, Piotr Miłoś

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at 37th Conference on Neural Information Processing Systems (NeurIPS 2023). 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03736 2023-09-08 q-fin.PM q-fin.TR 75%

TradingGPT: Multi-Agent System with Layered Memory and Distinct Characters for Enhanced Financial Trading Performance

Yang Li, Yangyang Yu, Haohang Li, Zhi Chen, Khaldoun Khashanah

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01542 2023-08-04 cs.HC 75%

Memory Sandbox: Transparent and Interactive Memory Management for Conversational Agents

Ziheng Huang, Sebastian Gutierrez, Hemanth Kamana, Stephen MacNeil

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06718 2023-07-13 cs.CV 75%

Segment Everything Everywhere All at Once

Xueyan Zou, Jianwei Yang, Hao Zhang, Feng Li, Linjie Li, Jianfeng Wang, Lijuan Wang, Jianfeng Gao, Yong Jae Lee

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17034 2026-07-14 cs.CL cs.LG 版本更新 74%

KVEraser: Learning to Steer KV Cache for Efficient Localized Context Erasing

KVEraser: 学习操控KV缓存以实现高效的局部上下文擦除

Mufei Li, Shikun Liu, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG;foundation model(comments)

AI总结 提出KVEraser方法,通过学习操控KV缓存实现局部上下文擦除,避免全局重计算,在长上下文任务中接近全重算性能且延迟仅增加24%。

Comments Oral at the ICML 2026 Workshop on the Impact of Memorization on Trustworthy Foundation Models; Code available at https://github.com/Graph-COM/KVEraser

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01761 2026-06-17 cs.LG cs.AI 版本更新 74%

Position: Modular Memory is the Key to Continual Learning Agents

Position: 模块化记忆是持续学习智能体的关键

Vaggelis Dorovatas, Malte Schwerin, Andrew D. Bagdanov, Lucas Caccia, Antonio Carta, Laurent Charlin, Barbara Hammer, Tyler L. Hayes, Timm Hess, Christopher Kanan, Dhireesha Kudithipudi, Xialei Liu, Vincenzo Lomonaco, Jorge Mendez-Mendez, Darshan Patil, Ameya Prabhu, Elisa Ricci, Tinne Tuytelaars, Gido M. van de Ven, Liyuan Wang, Joost van de Weijer, Jonghyun Choi, Martin Mundt, Rahaf Aljundi

机构 * University of Bremen(不莱梅大学) Seoul National University(首尔国立大学) Computer Vision Center Barcelona(巴塞罗那计算机视觉中心) University of Florence(佛罗伦萨大学) Microsoft Research(微软研究院) HEC Montreal, Mila--Quebec AI Institute, Canada CIFAR AI Chair(蒙特利尔HEC学院、魁北克人工智能研究所、加拿大CIFAR人工智能 chair) Bielefeld University(比勒海姆大学) Georgia Institute of Technology(佐治亚理工学院) University of Rochester(罗切斯特大学) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Nankai University(南开大学) LUISS University(卢西亚诺大学) Stony Brook University(石溪大学) University of Tübingen(图宾根大学) University of Trento, FBK(特伦托大学,FBK) Tsinghua University(清华大学) University of Groningen(Groningen大学)

专题命中 长上下文与记忆 :foundation model(abstract,comments);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过模块化记忆结合权重内学习与上下文学习,解决持续学习中的灾难性遗忘问题,实现大规模持续适应。

Comments ICML 2026 Position Track Spotlight. This work stems from discussions held at the Dagstuhl seminar on Continual Learning in the Era of Foundation Models (October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13365 2025-02-25 cs.CL cs.AI 74%

Pay Attention to What You Need

Yifei Gao, Shaohong Chen, Lei Wang, Ruiting Dai, Ziyun Zhang, Kerui Ren, Jiaji Wu, Jun Cheng

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

Comments LLM for long context comprehension, attention mechanism

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07144 2026-08-07 cs.LG 版本更新 74%

Fractal KV-Cache Archives: Lossless Symbolic Storage with In-Place Retrieval for Long-Context LLM Inference

分形KV缓存存档:用于长上下文语言模型推理的带原地检索的无损符号存储

Vladimir Gusev

机构 * Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :LLM(title);分类 cs.LG

AI总结 研究长上下文语言模型推理中KV缓存的存储问题,提出用分形KV缓存存档方法,该方法无损、线性时间运行且支持随机访问与追加,经实验验证能大幅减少存档缓存,还兼具搜索索引功能,发布代码可重现结果。

Comments 10 pages, 3 figures. Code: https://github.com/eighteight/fractal-kv

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05095 2026-08-06 cs.AI 新提交 74%

Hierarchical Graph Memory for LLM Agents with Path-level Localization and Rewrite

面向具备路径级定位与重写能力的大语言模型智能体的分层图记忆框架HiGram

Xiawei Yue, Boran Wang, Xiaoqing Zhang, Shuxin Zheng, Ziwei Zhang

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI

AI总结 本文提出具备路径级定位与重写能力的分层图记忆框架HiGram,解决扁平图记忆的无关信息多、重写效率低问题,在相关基准上提升了答案质量、令牌效率及冲突场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18199 2026-08-06 cs.CL 74%

Linear-Time and Constant-Memory Text Embeddings Based on Recurrent Language Models

基于循环语言模型的线性时间与常数内存文本嵌入

Tobias Grantner, Emanuel Sallinger, Martin Flechl

机构 * Dynatrace Research(DynaTrace研究)

专题命中 长上下文与记忆 :language model(title);分类 cs.CL

AI总结 本文提出基于循环架构的高效文本嵌入方法,通过垂直分块推理策略实现线性时间复杂度和常数内存使用,验证了Mamba2等模型在文本嵌入任务中的有效性。

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2026, pages 41459-41481

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03893 2026-08-05 cs.LG 新提交 74%

Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse

大语言模型家族中的跨模型KV缓存迁移:用于预填充复用的闭式线性映射

Taekyung Heo, Rasoul Shafipour, Ritchie Zhao, Maximilian Golub, Mohammad Mahdi Kamani, Ritika Borkar, Makesh Tarun Chandran, Pantea Zardoshti, Bita Darvish Rouhani

专题命中 长上下文与记忆 :LLM(title);分类 cs.LG

AI总结 针对大语言模型家族切换时需重新预填充的问题,提出跨模型KV缓存迁移方法,通过闭式线性映射器复用源模型KV缓存,可提升预填充速度,保留大部分准确率,具备实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23942 2026-07-28 cs.AI 新提交 74%

From Cognitive Architectures to Language Agents: A Mechanism-Level Review of Lineage, Convergence, and Migration Gaps

从认知架构到语言智能体:谱系、融合与迁移差距的机制层面综述

Haodi Fan, Zucong Lan

专题命中 长上下文与记忆 :language agent(title);分类 cs.AI

AI总结 该综述连接多个认知架构与语言智能体系统,重构机制并编码相关关系,指出现代智能体部分功能已实现,最强机会在机制耦合,存在五个剩余组合,贡献了机制目录、证据深度框架及可证伪议程。

Comments 28 pages, 9 figures, 14 tables. Review article

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22575 2026-07-28 cs.AI 新提交 74%

Temporal Context Reinstatement Drives Episodic-Like Order Memory in Long-Context Language Models

时间上下文恢复驱动长上下文语言模型中的情景式顺序记忆

Mathis Pink, Vy Ai Vo, Qinyuan Wu, Jianing Mu, Javier Turek, Uri Hasson, Kenneth A. Norman, Sebastian Michelmann, Alexander Huth, Mariya Toneva

专题命中 长上下文与记忆 :language model(title);分类 cs.AI

AI总结 研究长上下文语言模型中情景式顺序记忆的机制,通过时间顺序记忆任务及新数据集,发现模型呈现与人类相同的距离效应,且性能依赖一维时间编码,由单个注意力头在检索时恢复,支持时间上下文恢复是重要机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18213 2026-07-21 cs.CL cs.SE 新提交 74%

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

SWE-Pruner Pro:编码语言模型已知道该修剪什么

Yuhang Wang, Yuling Shi, Shaoqiu Zhang, Jialiang Liang, Shilin He, Siyu Ye, Yuting Chen, Kai Cai, Xiaodong Gu

专题命中 长上下文与记忆 :LLM(title);分类 cs.CL

AI总结 研究针对编码代理长上下文修剪问题,提出SWE-Pruner Pro,利用代理内部表示直接修剪工具输出。在多基准测试中节省令牌,保持任务质量,在MiMo-V2-Flash上提升解决率和准确率。

Comments Project page: https://github.com/Ayanami1314/swe-pruner-pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14651 2026-07-17 cs.CR cs.AI 新提交 74%

MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents

MemPoison:揭示大语言模型智能体中持久内存威胁和结构盲点

Jifeng Gao, Kang Xia, Yi Zhang, Xiaobin Hong, Mingkai Lin, Xingshen Wei, Wenzhong Li, Sanglu Lu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) NARI Group Corporation/State Grid Electric Power Research Institute, China(国网电力研究院/国电电力集团)

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI

AI总结 研究大语言模型智能体持久内存安全漏洞,提出MemPoison框架,含1227个案例,涵盖多种攻击类型等并评估多个模型系列。引入分类法,揭示防御边界及盲点,主张转向自适应、上下文敏感的内存防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12145 2026-07-10 cs.LG 版本更新 74%

Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling

阈值差分注意力:用于无汇、超稀疏和非分散语言建模

Xingyue Huang, Xueying Ding, Mingxuan Ju, Yozen Liu, Neil Shah, Tong Zhao

机构 * University of Oxford(牛津大学) Carnegie Mellon University(卡内基梅隆大学) Snap Inc

专题命中 长上下文与记忆 :language model(title);分类 cs.LG

AI总结 本文提出阈值差分注意力机制,解决长上下文下的注意力汇问题,实现超稀疏和鲁棒性提升,无需投影方法或标准注意力的噪声积累。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01790 2026-06-02 cs.CV cs.AI 74%

STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models

STaR-KV: 面向GUI视觉语言模型的时空自适应KV缓存压缩重加权方法

Yuhang Han, Wenzheng Yang, Yujie Chen, Xiangqi Jin, Yaojie Zhang, Siteng Huang, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) HKUST (GZ)(香港科技大学(广州)) The University of Sydney(悉尼大学) UESTC(电子科技大学) ZJU(浙江大学)

专题命中 长上下文与记忆 :language model(title);分类 cs.AI

AI总结 提出STaR-KV,一种无需训练的KV缓存压缩框架,通过子空间感知评分、时间稳定性折扣和熵驱动温度三个维度自适应校准令牌重要性,在GUI任务中实现高精度和近40%的峰值GPU内存节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12852 2026-05-14 cs.LG q-bio.QM 74%

Multitask Multimodal Fusion with Tabular Foundation Models for Peak and Durability Prediction of Pertussis Booster Response

多任务多模态融合:基于表格基础模型的百日咳加强针反应峰值和持续性预测

Divya Sitani

机构 * Berlin, Germany(柏林,德国)

专题命中 长上下文与记忆 :foundation model(title);分类 cs.LG

AI总结 本文提出多任务对比多模态融合架构,用于预测百日咳加强针反应的峰值和持续性,通过结合冻结的TabPFN-v2模态编码器、双标签监督对比损失、模态dropout和缺失性掩码注意力融合,实现了对两个任务的联合预测。

Comments 22 pages, 8 figures, 4 tables. Code available at https://github.com/Divya1205/cmi-pb-multitask

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27221 2026-05-01 cs.AI 74%

Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and Extraction

Web2BigTable: 一种用于互联网级信息搜索与提取的双层多智能体大语言模型系统

Yuxuan Huang, Yihang Chen, Zhiyuan He, Yuxiang Chen, Ka Yiu Lee, Huichi Zhou, Weilin Luo, Meng Fang, Jun Wang

机构 * University of Liverpool(利物浦大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI

AI总结 Web2BigTable通过双层架构实现互联网级信息搜索与提取,结合任务分解与并行执行,提升深度推理和结构化聚合能力,达到新的性能标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29194 2026-04-01 cs.CV cs.AI 74%

Multi-Layered Memory Architectures for LLM Agents: An Experimental Evaluation of Long-Term Context Retention

多层记忆架构用于LLM代理:长期上下文保留的实验评估

Sunil Tiwari, Payal Fofadiya

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI

AI总结 本文提出多层记忆框架,通过分解对话历史为工作、事件和语义层,提升长期上下文保留与推理稳定性,实验显示在LOCOMO等数据集上性能提升,同时降低虚假记忆率和上下文使用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21564 2026-03-24 cs.IR cs.AI cs.IT cs.SI math.IT 74%

Toward a Theory of Hierarchical Memory for Language Agents

迈向语言智能体的分层记忆理论

Yashar Talebirad, Ali Parsaee, Csongor Y. Szepesvari, Amirhossein Nadiri, Osmar Zaiane

机构 * University of Alberta(阿尔伯塔大学) York University(约克大学)

专题命中 长上下文与记忆 :language agent(title);分类 cs.AI

AI总结 本文提出分层记忆理论,通过三个操作符统一描述语言智能体的上下文处理机制,分析代表函数的自足谱并展示其在不同系统中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18631 2026-03-20 cs.AI 74%

D-Mem: A Dual-Process Memory System for LLM Agents

D-Mem:一种用于LLM代理的双过程记忆系统

Zhixing You, Jiachen Yuan, Jason Cai

机构 * Einstein Institute of Mathematics(爱因斯坦数学研究所) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) AWS AI(AWS人工智能)

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI

AI总结 本文提出D-Mem双过程记忆系统,通过轻量向量检索与全面深入模块结合,提升长期推理准确性,实验表明其在LoCoMo基准上F1得分达53.5,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13944 2026-02-12 cs.CL 74%

WAVE++: Capturing Within-Task Variance for Continual Relation Extraction with Adaptive Prompting

WAVE++: 通过自适应提示捕捉任务内方差以实现连续关系抽取

Bao-Ngoc Dao, Minh Le, Quang Nguyen, Luyen Ngo Dinh, Nam Le, Linh Ngo Van

机构 * Hanoi University of Science and Technology(河内科学技术大学)

专题命中 长上下文与记忆 :prompting(title);分类 cs.CL

AI总结 WAVE++通过自适应提示捕捉任务内方差,提升连续关系抽取的鲁棒性与准确性。

Comments Accepted in Neurocomputing, Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏