arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4760 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4760 篇

2606.12703 2026-06-12 cs.CR cs.AI cs.LG 新提交 84%

SMSR: Certified Defence Against Runtime Memory Poisoning in Persistent LLM Agent Systems

SMSR:针对持久化LLM代理系统中运行时内存投毒的认证防御

Tarun Sharma

机构 * Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出SMSR防御框架,通过写入时HMAC签名和查询时随机化内存消融与基于判决的多数投票,首次为多会话内存投毒攻击提供认证鲁棒性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10435 2026-06-10 cs.LG cs.CL 新提交 84%

Parallel Causal Associative Fields: Gated Sparse Memory for Long-Context Language Modeling

并行因果关联域:用于长上下文语言建模的门控稀疏记忆

Muhammad Ahmed

机构 * Independent Researcher(独立研究员)

专题命中 长上下文与记忆 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 提出并行因果关联域(PCAF),通过哈希桶存储局部记录、检索候选集形成稀疏缓存,并与参数化语言模型门控混合,实现稀疏长上下文访问,避免固定状态瓶颈。

Comments 17 pages, 5 figures, and 6 tables. Experiments on WikiText-103, PG-19, and WikiText-2 using TPU v4-32 and NVIDIA RTX 3060 hardware. Code: https://github.com/ahmed123hds/PCAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12851 2026-06-01 cs.CL cs.AI 84%

MeMo: Towards Language Models with Associative Memory Mechanisms

MeMo:迈向具有联想记忆机制的语言模型

Fabio Massimo Zanzotto, Elena Sofia Ruzzetti, Giancarlo A. Xompero, Leonardo Ranaldi, Davide Venditti, Federico Ranaldi, Cristina Giannone, Andrea Favalli, Raniero Romagnoli

机构 * Human-centric ART, University of Rome Tor Vergata(人文导向的ART,罗马大学Tor Vergata) University of Edinburgh(爱丁堡大学) Almawave S.p.A.(Almawave公司)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MeMo架构,通过分层联想记忆直接记忆文本,实现透明化和模型编辑,实验证明单层和多层配置的记忆能力。

Journal ref Proceedings of Association for Computational Linguistics (Findings), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25680 2026-05-26 cs.CL cs.AI 84%

Simulating Human Memory with Language Models

用语言模型模拟人类记忆

Qihan Wang, Nicholas Tomlin, Michael Hu, Brian Dillon, Tal Linzen

机构 * NYU(纽约大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 长上下文与记忆 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过心理学经典记忆实验对比语言模型与人类记忆,发现未经调优的模型记忆优于人类,但通过提示策略和压缩器可使模型遗忘方式更接近人类,从而在下游教育任务中成为更有效的用户模拟器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21240 2026-05-21 cs.LG cs.AI 84%

APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents

APEX:自主策略探索用于自演化大语言模型代理

Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出APEX,一种用于自演化大语言模型代理的自主策略探索方法,通过构建和维护显式的策略空间来解决探索崩溃问题,并在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00505 2026-05-19 cs.IR cs.AI cs.CL 84%

LLM-Oriented Information Retrieval: A Denoising-First Perspective

面向大语言模型的信息检索:一种去噪优先的视角

Lu Dai, Liang Sun, Fanpu Cao, Ziyang Rao, Cehao Yang, Hao Liu, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种以去噪为核心的信息检索方法,强调在信息检索全流程中,最大化可利用证据密度和可验证性是关键瓶颈,通过四个阶段框架和信号-噪声优化技术分类,探讨了信息检索中的挑战和解决方案。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16746 2026-05-19 cs.AI cs.LG 84%

State Contamination in Memory-Augmented LLM Agents

内存增强型大语言模型代理中的状态污染

Yian Wang, Agam Goyal, Yuen Chen, Hari Sundaram

机构 * Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了内存增强型大语言模型代理中由于状态污染导致的安全问题,通过分析内存总结中的毒性内容传播,提出了一种新的衡量指标,并指出在信息压缩前进行净化可以有效减少潜在影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15343 2026-05-18 cs.AI cs.LG cs.MA 84%

Belief Engine: Configurable and Inspectable Stance Dynamics in Multi-Agent LLM Deliberation

信念引擎:多智能体大语言模型协商中的可配置和可检查立场动态

Joshua C. Yang, Maurice Flechtner, Damian Dailisan, Michiel A. Bakker

机构 * ETH Zurich(苏黎世联邦理工学院) Centre for Democracy Studies Aarau, University of Zurich(苏黎世大学民主研究中心) Massachusetts Institute of Technology(麻省理工学院)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Belief Engine,通过可配置的信念更新机制,研究多智能体协商中的立场动态,揭示立场变化背后的证据吸收与锚定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14177 2026-05-15 cs.IR cs.AI cs.CL 84%

Thinking Ahead: Prospection-Guided Retrieval of Memory with Language Models

前瞻性引导的记忆检索:语言模型中的记忆检索

Harshita Chopra, Krishna Kant Chintalapudi, Suman Nath, Ryen W. White, Chirag Shah

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 长上下文与记忆 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 前瞻性引导的记忆检索通过模拟未来步骤来增强长周期检索,提升用户个性化需求的响应质量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16909 2026-04-28 cs.CL cs.AI 84%

PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations

PRISM:探究语言模型幻觉中的推理、指令和来源记忆

Yuhe Wu, Guangyu Wang, Yuran Chen, Jiatong Zhang, Yutong Zhang, Yujie Chen, Jiaming Shang, Guang Zhang, Zhuang Liu

机构 * HKUST(GZ)(香港科技大学(广州)) NYUSH(纽约大学上海分校) DUFE(东华大学) CUHK(SZ)(香港城市大学(深圳)) CUFE(中国金融学院)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PRISM通过四个维度分析语言模型幻觉,提供细粒度诊断评估,揭示不同模型在指令遵循、记忆检索和逻辑推理上的权衡。

Comments Accepted by ACL main conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23040 2026-03-03 cs.CL cs.AI 84%

Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents

回望以推导前行:用于长上下文LLM代理的可回溯记忆

Yaorui Shi, Yuxin Chen, Siyuan Wang, Sihang Li, Hengxing Cai, Qi Gu, Xiang Wang, An Zhang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) DP Technology(DP科技) Meituan(美团)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ReMemR1通过整合记忆检索机制和多级奖励设计,提升长上下文问答任务的推理能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16411 2026-03-03 cs.CL cs.LG 84%

When Does Divide and Conquer Work for Long Context LLM? A Noise Decomposition Framework

当分治策略在长上下文LLM中何时有效?一种噪声分解框架

Zhen Xu, Shang Zhu, Jue Wang, Junlin Wang, Ben Athiwaratkun, Chi Wang, James Zou, Ce Zhang

机构 * University of Chicago(芝加哥大学) Together AI Duke University(杜克大学) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种噪声分解框架,分析了长上下文LLM中分治策略的有效条件,揭示了任务噪声、模型噪声和聚合噪声的区分,并通过实验验证了多代理分块策略在处理长上下文任务中的有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04919 2026-02-10 cs.CL cs.AI 84%

BudgetMem: Learning Selective Memory Policies for Cost-Efficient Long-Context Processing in Language Models

BudgetMem: 为语言模型中的低成本长上下文处理学习选择性记忆策略

Chandra Vamsi Krishna Alla, Harish Naidu Gaddam, Manohar Kommi

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 BudgetMem通过学习选择性记忆策略,在语言模型中实现低成本长上下文处理,相比基线RAG节省72.4%内存且F1分数仅下降1.0%。

Comments 11 pages, 3 figures, 5 tables. Evaluated on 700 QA pairs across multiple document lengths

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02197 2026-02-03 cs.LG cs.AI 84%

Hierarchical Adaptive Eviction for KV Cache Management in Multimodal Language Models

分层自适应淘汰用于多模态语言模型的KV缓存管理

Xindian Ma, Yidi Lu, Peng Zhang, Jing Zhang

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HAE框架,通过双注意力修剪和动态解码淘汰策略优化多模态语言模型的KV缓存管理,减少内存使用并提升推理效率。

Comments 10 oages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00040 2026-02-03 cs.LG cs.AI 84%

Enhancing few-shot time series forecasting with LLM-guided diffusion

通过LLM引导扩散增强少样本时间序列预测

Haonan Shi, Dehua Shuai, Liming Wang, Xiyang Liu, Long Tian

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LTSM-DIFF通过结合大语言模型与扩散模型,提升少样本时间序列预测的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15231 2026-01-22 cs.CL cs.AI cs.SD eess.AS 84%

Extending Audio Context for Long-Form Understanding in Large Audio-Language Models

在大型音频-语言模型中扩展音频上下文以实现长形式理解

Yuatyong Chaichana, Pittawat Taveekitworachai, Warit Sirichotedumrong, Potsawee Manakul, Kunat Pipatanakul

机构 * Chulalongkorn University(朱拉隆功大学) SCB 10X SCBX Group(SCBX集团)

专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Partial YaRN和VLAT,通过扩展音频上下文提升大型音频-语言模型对长形式音频的理解能力。

Comments EACL 2026. Code and dataset are available at: https://github.com/yophis/partial-yarn

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13476 2026-01-21 cs.LG cs.AI 84%

A Unified Variational Imputation Framework for Electric Vehicle Charging Data Using Retrieval-Augmented Language Model

基于检索增强语言模型的统一变分填补框架用于电动汽车充电数据

Jinhao Li, Hao Wang

机构 * Department of Data Science and AI, Faculty of IT and Monash Energy Institute, Monash University(数据科学与人工智能系,信息科技学院和莫纳什能源研究所,莫纳什大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PRAIM框架,利用检索增强语言模型和变分神经架构,提升电动汽车充电数据填补的准确性和统计分布保留能力,从而提高预测性能。

Comments 15 pages

Journal ref IEEE Transactions on Smart Grid, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11564 2026-01-21 cs.CL cs.AI 84%

Context Discipline and Performance Correlation: Analyzing LLM Performance and Quality Degradation Under Varying Context Lengths

上下文学科与性能相关性:分析在不同上下文长度下LLM性能及质量退化

Ahilan Ayyachamy Nadar Ponnusamy, Karthic Chandran, M Maruf Hossain

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了不同上下文长度下LLM性能与质量退化的关系,发现KV缓存增长导致性能非线性退化,并揭示了MoE架构在高token体积时受基础设施瓶颈影响的问题。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12712 2025-12-29 cs.CL cs.AI 84%

Adaptive Focus Memory for Language Models

自适应聚焦记忆用于语言模型

Christopher Cruz

机构 * Purdue University(普渡大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 自适应聚焦记忆通过动态分配保真度级别,实现多轮对话中有效约束保持,无需修改模型权重或外部检索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17407 2025-11-26 cs.CL cs.LG 84%

A Comprehensive Survey on Long Context Language Modeling

对长上下文语言模型的全面综述

Jiaheng Liu, Dawei Zhu, Zhiqi Bai, Yancheng He, Huanxuan Liao, Haoran Que, Zekun Wang, Chenchen Zhang, Ge Zhang, Jiebin Zhang, Yuanxing Zhang, Zhuo Chen, Hangyu Guo, Shilong Li, Ziqiang Liu, Yong Shan, Yifan Song, Jiayi Tian, Wenhao Wu, Zhejian Zhou, Ruijie Zhu, Junlan Feng, Yang Gao, Shizhu He, Zhoujun Li, Tianyu Liu, Fanyu Meng, Wenbo Su, Yingshui Tan, Zili Wang, Jian Yang, Wei Ye, Bo Zheng, Wangchunshu Zhou, Wenhao Huang, Sujian Li, Zhaoxiang Zhang

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了长上下文语言模型的最新进展,涵盖模型构建、训练部署及评估分析,为研究人员和工程师提供全面的资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14868 2025-11-20 cs.CL cs.LG 84%

Hierarchical Token Prepending: Enhancing Information Flow in Decoder-based LLM Embeddings

Xueying Ding, Xingyue Huang, Mingxuan Ju, Liam Collins, Yozen Liu, Leman Akoglu, Neil Shah, Tong Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) Snap Inc(Snap公司)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05034 2025-11-20 cs.CR cs.AI cs.CL 84%

Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization

Tiantian Liu, Hongwei Yao, Feng Lin, Tong Wu, Zhan Qin, Kui Ren

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24219 2025-09-30 cs.RO cs.AI cs.LG 84%

ViReSkill: Vision-Grounded Replanning with Skill Memory for LLM-Based Planning in Lifelong Robot Learning

Tomoyuki Kagaya, Subramanian Lakshmi, Anbang Ye, Thong Jing Yuan, Jayashree Karlekar, Sugiri Pranata, Natsuki Murakami, Akira Kinose, Yang You

机构 * Panasonic Connect Co., Ltd.(松下电器(株式会社)) Panasonic R&D Center(松下研发中心) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09076 2025-09-25 cs.CL cs.AI 84%

Dynamic Parameter Memory: Temporary LoRA-Enhanced LLM for Long-Sequence Emotion Recognition in Conversation

Jialong Mai, Xiaofen Xing, Yawei Li, Weidong Chen, Zhipeng Li, Jingyuan Xing, Xiangmin Xu

机构 * South China University of Technology, China(华南理工大学) MiniMax, China(MiniMax) The Chinese University of Hong Kong, China(香港中文大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments submitted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14067 2025-08-21 cs.CL cs.LG 84%

Punctuation and Predicates in Language Models

Sonakshi Chauhan, Maheep Chaudhary, Koby Choy, Samuel Nellessen, Nandi Schoots

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14051 2025-08-14 cs.CL cs.LG 84%

RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression

Payman Behnam, Yaosheng Fu, Ritchie Zhao, Po-An Tsai, Zhiding Yu, Alexey Tumanov

机构 * NVIDIA, Santa Clara, USA(NVIDIA公司) Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12465 2025-08-05 cs.CL cs.LG 84%

Core Context Aware Transformers for Long Context Language Modeling

Yaofo Chen, Zeng You, Shuhai Zhang, Haokun Li, Yirui Li, Yaowei Wang, Mingkui Tan

机构 * South China University of Technology(华南理工大学) Peng Cheng Laboratory(鹏城实验室) Pazhou Laboratory(琶洲实验室) Harbin Institute of Technology(哈尔滨工业大学) Key Laboratory of Big Data and Intelligent Robot, Ministry of Education(教育部大数据与智能机器人重点实验室)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments Accepted for publication at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23771 2025-07-29 cs.CL cs.LG 84%

What is Wrong with Perplexity for Long-context Language Modeling?

Lizhe Fang, Yifei Wang, Zhaoyang Liu, Chenheng Zhang, Stefanie Jegelka, Jinyang Gao, Bolin Ding, Yisen Wang

机构 * State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(一般人工智能国家重点实验室,智能科学与技术学院,北京大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Alibaba Group(阿里巴巴集团) TUM CIT, MCML, MDSI(技术大学(TUM) CIT、MCML、MDSI) MIT EECS, CSAIL(麻省理工学院电子工程与计算机科学系,计算机科学与人工智能实验室) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07957 2025-07-11 cs.CL cs.AI 84%

MIRIX: Multi-Agent Memory System for LLM-Based Agents

Yu Wang, Xi Chen

机构 * MIRIX AI

专题命中 长上下文与记忆 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21805 2025-06-30 cs.AI cs.CL 84%

CitySim: Modeling Urban Behaviors and City Dynamics with Large-Scale LLM-Driven Agent Simulation

Nicolas Bougie, Narimasa Watanabe

机构 * Woven by Toyota(丰田织造)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏