arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2603.29093 2026-04-06 cs.CL cs.AI cs.IR 62%

APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay

APEX-EM:通过结构化程序-经验经验回放实现自主代理的非参数在线学习

Pratyay Banerjee, Masud Moshtaghi, Ankit Chadha

机构 * Amazon, AGI / Sunnyvale, USA(亚马逊 AGI / 美国森尼韦尔)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出APEX-EM框架,通过结构化经验表示和PRGII工作流,实现自主代理的非参数在线学习,提升跨领域任务的性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00556 2026-04-02 cs.LG cs.AI cs.ET q-fin.CP q-fin.RM 62%

HabitatAgent: An End-to-End Multi-Agent System for Housing Consultation

HabitatAgent:一种端到端的多智能体系统用于住房咨询

Hongyang Yang, Yanxin Zhang, Yang She, Yue Xiao, Hao Wu, Yiyang Zhang, Jiapeng Hou, Rongshan Zhang

机构 * Fangdongdong(方东东) Tsinghua University(清华大学) Columbia University(哥伦比亚大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HabitatAgent,一种基于LLM的多智能体系统,通过四个专业角色提供可审计且可靠的住房咨询流程,实现高准确率的住房选择支持。

Comments Accepted at the DMO-FinTech Workshop (PAKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30033 2026-04-01 cs.LG cs.AI 62%

Tucker Attention: A generalization of approximate attention mechanisms

Tucker Attention: 多头自注意机制近似机制的推广

Timon Klein, Jonas Kusch, Sebastian Sager, Stefan Schnake, Steffen Schotthöfer

机构 * Otto von Guericke University Magdeburg(奥托·冯·格里克大学马格德堡) Max Planck Institute for Dynamics of Complex Technical Systems(马克斯·普朗克复杂技术系统动力学研究所) Norwegian University of Life Sciences(挪威生命科学大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tucker Attention,通过改进自注意层的权重对象和分解策略,实现更高效的参数方案,相比GQA和MLA在参数量上更优,并兼容Flash Attention和RoPE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04427 2026-03-31 cs.LG cs.AI 62%

Thin Keys, Full Values: Reducing KV Cache via Low-Dimensional Attention Selection

细键,全值:通过低维注意力选择减少KV缓存

Hengshuai Yao, Xing Chen, Ahmed Murtadha, Guan Wang

机构 * Sapient Intelligence Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系)

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过低维注意力选择减少KV缓存,展示选择仅需O(logN)维度即可区分N个相关token类别,相比传统Transformer注意力节省参数和训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16950 2026-03-26 cs.LG cs.AI cs.IT math.IT 62%

Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning

瓶颈化Transformer:用于通用推理的周期性KV缓存整合

Adnan Oomerjee, Zafeirios Fountas, Haitham Bou-Ammar, Jun Wang

机构 * University College London(伦敦大学学院) Huawei Noah’s Ark(华为诺亚方舟)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出瓶颈化Transformer,通过周期性非因果的KV重写提升推理能力,基于信息瓶颈理论分析其有效性,并在数学推理任务中验证性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09604 2026-03-26 cs.LG cs.AI cs.CR 62%

Mitigating Many-Shot Jailbreaking

缓解多示例劫持

Christopher M. Ackerman, Nina Panickssery

专题命中 长上下文与记忆 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过微调和输入净化缓解多示例劫持攻击的有效性,发现组合方法显著降低攻击效果,同时保持模型在正常上下文学习中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23840 2026-03-26 cs.AI cs.CL 62%

VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents

VehicleMemBench:多用户长期记忆的可执行基准

Yuhao Chen, Yi Xu, Xinyun Ding, Xiang Fang, Shuochen Liu, Luxi Lin, Qingyu Zhang, Ya Li, Quan Liu, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院) Xiamen University(厦门大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VehicleMemBench,用于评估车载代理的多用户长期记忆能力,通过可执行仿真环境比较行动后环境状态与目标状态,揭示强大模型在动态偏好变化场景中的不足,强调需更 robust 的记忆管理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20586 2026-03-25 cs.LG cs.AI 62%

MKA: Memory-Keyed Attention for Efficient Long-Context Reasoning

MKA:用于高效长上下文推理的内存键注意

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MKA机制,通过多级KV缓存和动态路由提升长上下文推理效率,FastMKA在保持准确率的同时显著提升训练速度和评估效率。

Comments Accepted to the ACM Computing Frontiers 2026 Conference (Oral Presentation) and the ICML 2025 Long Context Modeling Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05919 2026-03-25 cs.CR cs.AI cs.CL 62%

Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs

注入虚假信息:对抗性中间人攻击削弱大语言模型的事实回忆

Alina Fastowski, Bardh Prenkaj, Yuxiao Li, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个基于提示注入的LLM事实记忆攻击评估框架Xmera,通过扰动输入在封闭书本和事实基础QA场景中降低响应正确性并评估生成过程的不确定性,提出基于响应不确定性的随机森林分类器作为防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22333 2026-03-25 cs.LG cs.AI 62%

Graph Signal Processing Meets Mamba2: Adaptive Filter Bank via Delta Modulation

图信号处理与Mamba2交汇:通过Delta调制实现自适应滤波器组

Yehjin Shin, Seojin Kim, Noseong Park

机构 * KAIST(韩国科学技术院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HADES框架,将Mamba2重新解释为线图上的自适应滤波器组,通过结构化偏置实现全局低通和局部高通滤波,提升效率和可解释性。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22329 2026-03-25 cs.LG cs.AI 62%

Trained Persistent Memory for Frozen Decoder-Only LLMs

训练的持久内存用于冻结的解码器-only LLMs

Hong Jeong

机构 * Inha University in Tashkent, Uzbekistan(乌兹别克斯坦塔什克恩的因哈大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究解码器-only LLMs中持久内存的实现,通过六种方法在冻结的GPT-2上训练小型适配器,发现架构先验对保留内存性能有显著影响,且在10倍容量下所有方法均收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08435 2026-03-19 cs.LG cs.AI q-bio.NC 62%

Fast weight programming and linear transformers: from machine learning to neurobiology

快速权重编程与线性变换器:从机器学习到神经生物学

Kazuki Irie, Samuel J. Gershman

机构 * Harvard University(哈佛大学) Center for Brain Science(脑科学中心) Kempner Institute for the Study of Natural and Artificial Intelligence(自然与人工智能研究学院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了快速权重编程器(FWPs)的理论基础、计算特性及其与变换器和状态空间模型的联系,并讨论了FWPs与大脑突触可塑性模型的关联,揭示了自然与人工智能的交汇。

Comments Accepted to TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13258 2026-03-17 cs.LG cs.AI cs.SE 62%

Your Code Agent Can Grow Alongside You with Structured Memory

你的代码代理可以与你一同成长,借助结构化记忆

Yi-Xuan Deng, Xiaoqin Liu, Yi Zhang, Guo-Wei Yang, Shuojin Yang

机构 * Tsinghua University(清华大学)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。

Comments Code Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09982 2026-03-13 cs.CL cs.AI 62%

AraModernBERT: Transtokenized Initialization and Long-Context Encoder Modeling for Arabic

AraModernBERT:阿拉伯语的转令牌初始化和长上下文编码器建模

Omar Elshehy, Omer Nacar, Abdelbasset Djamai, Muhammed Ragab, Khloud Al Jallad, Mona Abdelazim

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 AraModernBERT通过转令牌初始化和长上下文建模提升了阿拉伯语的编码器性能,验证了其在多种自然语言理解任务中的有效性。

Comments 9 pages, 1 figure. Accepted at AbjadNLP Workshop, EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10291 2026-03-12 cs.AI cs.LG 62%

Hybrid Self-evolving Structured Memory for GUI Agents

混合自进化结构记忆用于GUI代理

Sibo Zhu, Wenyi Wu, Kun Zhou, Stephen Wang, Biwei Huang

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 HyMEM通过结合离散符号节点与连续轨迹嵌入,提升GUI代理的结构化记忆与自进化能力,使开源模型性能超越闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01313 2026-03-12 cs.CL cs.AI 62%

Evaluating Long-Horizon Memory for Multi-Party Collaborative Dialogues

评估多方协作对话的长周期记忆

Chuanrui Hu, Tong Li, Xingze Gao, Hongda Chen, Yi Bai, Dannong Xu, Tianwei Lin, Xiaohong Li, Yunyun Han, Jian Pei, Yafeng Deng

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EverMemBench,首个评估多方协作对话长周期记忆的基准,揭示当前系统在多跳推理、时间推理和记忆意识方面的局限性。

Comments 25 pages, 21 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05498 2026-03-06 cs.AI cs.CL 62%

The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks

尖峰、稀疏与汇点:大规模激活与注意力汇点的解剖

Shangwen Sun, Alfredo Canziani, Yann LeCun, Jiachen Zhu

机构 * New York University(纽约大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了Transformer中大规模激活与注意力汇点的关联性及作用机制,指出预归一化配置是二者共存的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04688 2026-03-06 q-bio.NC cs.AI cs.LG stat.ML 62%

Why the Brain Consolidates: Predictive Forgetting for Optimal Generalisation

为何大脑进行巩固:为最优泛化而预测遗忘

Zafeirios Fountas, Adnan Oomerjee, Haitham Bou-Ammar, Jun Wang, Neil Burgess

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) AI Centre, Department of Computer Science, University College London(大学计算机科学系人工智能中心) UCL Institute of Cognitive Neuroscience, University College London(大学认知神经科学研究所) UCL Queen Square Institute of Neurology, University College London(大学Queen Square神经学研究所)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出高容量神经网络通过预测遗忘优化存储表征的泛化能力,揭示了离线巩固在优化保留与泛化权衡中的计算作用。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01966 2026-03-03 cs.CL cs.AI 62%

AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations

AMemGym:用于长时对话中助手的交互式记忆基准测试

Cheng Jiayang, Dongyu Ru, Lin Qiu, Yiyang Li, Xuezhi Cao, Yangqiu Song, Xunliang Cai

机构 * The Hong Kong University of Science and Technology(香港科技大学) Meituan(美团)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 AMemGym通过交互式环境实现长时对话中助手的内存管理优化,揭示现有内存系统性能差距并推动策略自我进化。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16640 2026-03-03 cs.CL cs.AI 62%

Long-Context Generalization with Sparse Attention

长上下文泛化与稀疏注意力

Pavlo Vasylenko, Hugo Pitorro, André F. T. Martins, Marcos Treviso

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术高级学院) Instituto de Telecomunicações(电信研究所) TransPerfect(TransPerfect公司) ELLIS Unit Lisbon(里斯本ELLIS单位)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ASEntmax,通过动态稀疏注意力机制提升长上下文泛化能力,在合成任务和语言建模中表现优于传统softmax和α-entmax方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01481 2026-03-03 cs.LG cs.CL 62%

Intrinsic Entropy of Context Length Scaling in LLMs

大语言模型中上下文长度扩展的内在熵

Jingzhe Shi, Qinwei Ma, Hongyi Liu, Hang Zhao, Jeng-Neng Hwang, Lei Li

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Carnegie Mellon University(卡内基梅隆大学) CPHOS University of Washington(华盛顿大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出'内在熵'理论,通过实验验证长上下文对语言模型的影响,揭示训练数据集大小与最佳上下文长度的关系。

Comments 36 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03324 2026-03-03 cs.LG cs.AI 62%

Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs

缓存什么更持久:用于LLMs中内存受限KV缓存的令牌保留

Ngoc Bui, Shubham Sharma, Simran Lamba, Saumitra Mishra, Rex Ying

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) JPMorganChase AI Research(摩根大通人工智能研究)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 TRIM-KV通过学习令牌的内在重要性实现内存受限的KV缓存优化,有效提升LLM在低内存环境下的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22603 2026-03-03 cs.AI cs.LG 62%

SideQuest: Model-Driven KV Cache Management for Long-Horizon Agentic Reasoning

SideQuest: 为长时间范围代理推理的模型驱动KV缓存管理

Sanjay Kariyappa, G. Edward Suh

机构 * NVIDIA

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 SideQuest通过利用大型推理模型自身进行KV缓存压缩,有效减少代理任务中的内存使用,同时保持较高的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24281 2026-03-02 cs.LG cs.AI 62%

Memory Caching: RNNs with Growing Memory

记忆缓存:具有增长记忆的RNNs

Ali Behrouz, Zeman Li, Yuan Deng, Peilin Zhong, Meisam Razaviyayn, Vahab Mirrokni

机构 * Google(谷歌)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Memory Caching技术,通过缓存RNN的记忆状态以增强其记忆容量,实现与Transformer的平衡性能,在长上下文任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00671 2026-02-24 cs.CL cs.AI 62%

Fast-weight Product Key Memory

快速权重产品键内存

Tianyu Zhao, Llion Jones

机构 * Sakana AI

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 FwPKM是一种稀疏快速权重内存层,通过稀疏梯度下降实现高效存储与检索,有效降低困惑度并提升长上下文处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17641 2026-02-20 cs.LG cs.AI 62%

FAMOSE: A ReAct Approach to Automated Feature Discovery

FAMOSE:一种用于自动化特征发现的ReAct方法

Keith Burghardt, Jienan Liu, Sadman Sakib, Yuning Hao, Bo Li

机构 * Amazon.com, Inc.(亚马逊公司)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 FAMOSE通过ReAct方法实现自动化特征发现,显著提升分类和回归任务的性能,展示了AI代理在创新解决方案中的有效性。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07348 2026-02-13 cs.CL cs.AI cs.NE 62%

Controlled Self-Evolution for Algorithmic Code Optimization

算法代码优化的受控自演进

Tu Hu, Ronghao Chen, Shuo Zhang, Jianghao Yin, Mou Xiao Feng, Jingping Liu, Shaolei Zhang, Wenqi Jiang, Yuqi Fang, Sen Hu, Huacan Wang, Yi Xu

机构 * NJU(南京大学) PKU(北京大学) Midea-AIRC(美的人工智能研究院) ECNU(华东师范大学) SYSU(南方科技大学) RUC(中国人民大学) QuantaAlpha(量子Alpha) QuantML(量子机器学习)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 受控自演进通过改进初始化、反馈引导和经验记忆,提升算法代码优化的效率和效果。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11185 2026-02-13 cs.LG cs.AI 62%

Spectra: Rethinking Optimizers for LLMs Under Spectral Anisotropy

Spectra: 重新思考在谱各向异性下大语言模型的优化器

Zhendong Huang, Hengjie Cao, Fang Dong, Ruijun Huang, Mengyi Chen, Yifeng Yang, Xin Zhang, Anrui Chen, Mingzhi Dong, Yujiang Wang, Jinlong Hou, Qin Lv, Robert P. Dick, Yuan Cheng, Fan Yang, Tun Lu, Li Shang

机构 * Fudan University, Shanghai, China(复旦大学) University of Bath, Bath, United Kingdom(巴斯大学) Oxford Suzhou Centre for Advanced Research, Suzhou, China(牛津苏格兰先进研究中心) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Department of Computer Science, University of Colorado Boulder, Colorado, USA(计算机科学系,科罗拉多大学博尔德分校) Department of Electrical Engineering and Computer Science, University of Michigan(电气工程与计算机科学系,密歇根大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Spectra通过抑制主导低秩尖峰子空间并减少优化器状态内存,提升了大语言模型的训练效率和下游准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01744 2026-02-03 cs.LG cs.AI 62%

Softmax Linear Attention: Reclaiming Global Competition

Mingwei Xu, Xuan Lin, Xinnan Guo, Wanqing Xu, Wanyun Cui

机构 * MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(跨学科计算与经济研究莫艾实验室) Shanghai University of Finance and Economics(上海财经大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

Comments 11 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07327 2026-02-03 cs.AI cs.CL 62%

IterResearch: Rethinking Long-Horizon Agents with Interaction Scaling

IterResearch: 重新思考长视界智能体与交互扩展

Guoxin Chen, Zile Qiao, Xuanzhong Chen, Donglei Yu, Haotian Xu, Wayne Xin Zhao, Ruihua Song, Wenbiao Yin, Huifeng Yin, Liwen Zhang, Kuan Li, Minpeng Liao, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 长上下文与记忆 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 IterResearch通过交互扩展范式提升长视界推理能力,实现高效探索与稳定训练,显著提升性能并缩小与前沿系统的差距。

Comments Camera Ready version for ICLR 2026. https://github.com/Chen-GX/IterResearch

详情

展开后加载摘要…

URL PDF HTML 收藏