arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-25 至 2026-03-25 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 10 篇

2603.22866 2026-03-25 cs.IT math.IT 91%

Aerial Agentic AI: Synergizing LLM and SLM for Low-Altitude Wireless Networks

空域代理AI:融合LLM和SLM用于低空无线网络

Li Dong, Feibo Jiang, Kezhi Wang, Cunhua Pan, Dong In Kim, Ekram Hossain

专题命中 长上下文与记忆 :LLM(title,abstract);SLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出空域代理AI框架,通过融合小型语言模型和大型语言模型,解决低空无线网络中的计算、通信和实时性冲突问题,实现高效协同与决策优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18788 2026-03-25 cs.CL cs.AI 79%

Mi:dm K 2.5 Pro

KT Tech innovation Group

专题命中 长上下文与记忆 :LLM(abstract);post-training(abstract);SFT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22289 2026-03-25 cs.CL cs.AI 79%

MERIT: Memory-Enhanced Retrieval for Interpretable Knowledge Tracing

MERIT: 用于可解释知识追踪的记忆增强检索

Runze Li, Kedi Chen, Guwei Feng, Mo Yu, Jun Wang, Wei Zhang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai Innovation Institute(上海创新研究院) WeChat AI, Tencent(微信AI,腾讯)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MERIT提出一种无需训练的框架,结合冻结LLM推理与结构化教学记忆,通过语义去噪将学生分类为潜在认知模式,并构建模式库生成显式推理依据,提升教育诊断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22704 2026-03-25 cs.CL 77%

Synthetic or Authentic? Building Mental Patient Simulators from Longitudinal Evidence

合成还是真实?从纵向证据构建心理健康患者模拟器

Baihan Li, Bingrui Jin, Kunyao Lan, Ming Wang, Mengyue Wu

机构 * SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院) X-LANCE Lab(X-LANCE实验室) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DEPROFILE框架,通过整合多源数据构建统一患者档案,提升对话真实性和行为多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22367 2026-03-25 cs.IR cs.AI 77%

Reasoner-Executor-Synthesizer: Scalable Agentic Architecture with Static O(1) Context Window

推理-执行-合成器:具有静态O(1)上下文窗口的可扩展代理架构

Ivan Dobrovolskyi

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RES架构,通过分离意图解析、确定性数据检索与叙事生成,实现O(1)的token复杂度,有效解决LLM代理中上下文窗口过大导致的幻觉风险和token成本问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07861 2026-03-25 cs.LG cs.AI cs.DS 73%

Streaming Attention Approximation via Discrepancy Theory

通过偏差理论实现流式注意力近似

Ekaterina Kochetkova, Kshiteej Sheth, Insu Han, Amir Zandieh, Michael Kapralov

机构 * EPFL(苏黎世联邦理工学院) KAIST(韩国科学技术院) Google Research(谷歌研究)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BalanceKV算法,基于几何过程选择平衡的Key和Value token,实现流式注意力近似,理论和实验均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20586 2026-03-25 cs.LG cs.AI 62%

MKA: Memory-Keyed Attention for Efficient Long-Context Reasoning

MKA:用于高效长上下文推理的内存键注意

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MKA机制,通过多级KV缓存和动态路由提升长上下文推理效率,FastMKA在保持准确率的同时显著提升训练速度和评估效率。

Comments Accepted to the ACM Computing Frontiers 2026 Conference (Oral Presentation) and the ICML 2025 Long Context Modeling Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05919 2026-03-25 cs.CR cs.AI cs.CL 62%

Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs

注入虚假信息:对抗性中间人攻击削弱大语言模型的事实回忆

Alina Fastowski, Bardh Prenkaj, Yuxiao Li, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个基于提示注入的LLM事实记忆攻击评估框架Xmera,通过扰动输入在封闭书本和事实基础QA场景中降低响应正确性并评估生成过程的不确定性,提出基于响应不确定性的随机森林分类器作为防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22333 2026-03-25 cs.LG cs.AI 62%

Graph Signal Processing Meets Mamba2: Adaptive Filter Bank via Delta Modulation

图信号处理与Mamba2交汇:通过Delta调制实现自适应滤波器组

Yehjin Shin, Seojin Kim, Noseong Park

机构 * KAIST(韩国科学技术院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HADES框架,将Mamba2重新解释为线图上的自适应滤波器组,通过结构化偏置实现全局低通和局部高通滤波,提升效率和可解释性。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22329 2026-03-25 cs.LG cs.AI 62%

Trained Persistent Memory for Frozen Decoder-Only LLMs

训练的持久内存用于冻结的解码器-only LLMs

Hong Jeong

机构 * Inha University in Tashkent, Uzbekistan(乌兹别克斯坦塔什克恩的因哈大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究解码器-only LLMs中持久内存的实现,通过六种方法在冻结的GPT-2上训练小型适配器,发现架构先验对保留内存性能有显著影响,且在10倍容量下所有方法均收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏