arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-04 至 2026-06-04 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 19 篇

2510.17281 2026-06-04 cs.LG cs.AI cs.IR 90%

MemoryBench: A Benchmark for Memory and Continual Learning in LLM Systems

MemoryBench:面向LLM系统的记忆与持续学习基准

Qingyao Ai, Yichen Tang, Changyue Wang, Jianming Long, Weihang Su, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出用户反馈模拟框架及跨领域、多语言、多任务类型的综合基准MemoryBench,评估LLM系统从累积用户反馈中持续学习的能力,实验表明现有方法效果与效率均不理想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04197 2026-06-04 cs.MA cs.CL cs.SI physics.soc-ph 90%

Exploring the Topology and Memory of Consensus: How LLM Agents Agree, Fragment, or Settle When Forming Conventions

探索共识的拓扑与记忆:LLM智能体在形成惯例时如何达成一致、分裂或稳定

Aliakbar Mehdizadeh, Martin Hilbert

机构 * Department of Communication, University of California, Davis(通信系,加州大学戴维斯分校)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL

AI总结 研究LLM多智能体系统中记忆深度与通信拓扑的交互作用,发现记忆对协调的影响符号会因网络中心化程度而反转,并揭示了记忆介导的速度-统一性权衡。

Comments Submitted to the Journal of Artificial Societies and Social Simulation (JASSS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04141 2026-06-04 cs.CR cs.AI 90%

Caught in the Act(ivation): Toward Pre-Output and Multi-Turn Detection of Credential Exfiltration by LLM Agents

当场抓获(激活):面向LLM智能体的凭证泄露预输出和多轮检测

Kargi Chauhan, Pratibha Revankar

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 研究通过激活探针、蜜令令牌和累积信息流追踪三种互补防御方法,在预输出和多轮对话中检测LLM智能体的凭证泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02655 2026-06-04 cs.CY cs.AI 90%

BioBlue: Systematic runaway-optimiser-like LLM failure modes on biologically and economically aligned AI safety benchmarks for LLMs with simplified observation format

BioBlue:在生物与经济对齐的AI安全基准上,具有简化观察格式的LLM的系统性类失控优化失败模式

Roland Pihlakas, Sruthi Susan Kuriakose

机构 * Independent researcher(独立研究者) Three Laws research collaboration(Three Laws研究合作) Rakvere, Estonia(爱沙尼亚拉克雷市)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过长期控制环境测试LLM,发现尽管LLM能理解目标,但在多目标场景下会系统性偏离至单目标、无界优化行为,表现出类似失控优化的失败模式。

Comments 27 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11166 2026-06-04 cs.CL cs.AI 88%

SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization

SoLoPO: 通过短到长偏好优化解锁大语言模型的长上下文能力

Huashan Sun, Shengyi Liao, Yansen Han, Yu Bai, Yang Gao, Cheng Fu, Weizhou Shen, Fanqi Wan, Ming Yan, Ji Zhang, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 长上下文与记忆 :preference optimization(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出SoLoPO框架,将长上下文偏好优化解耦为短上下文偏好优化和短到长奖励对齐,以提升大语言模型的长上下文利用能力。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04780 2026-06-04 cs.CL 87%

PersonaTree: Structured Lifecycle Memory for Person Understanding in LLM Agents

PersonaTree: 面向LLM智能体人物理解的结构化生命周期记忆

Yubo Hou, Jingwei Song, Hongbo Zhang, Zhisheng Chen, Bang Xiao, Tao Wan, Zengchang Qin

机构 * School of ASEE, Beihang University, Beijing, China(北京航空航天大学航空科学与工程学院) The University of Hong Kong, Hong Kong, China(香港大学) Peking University, Beijing, China(北京大学) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) School of BME, Beihang University, Beijing, China(北京航空航天大学生物医学工程学院) CAIR and CECS, VinUniversity, Hanoi, Vietnam(越南河内 Vin 大学 CAIR 和 CECS)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL

AI总结 提出PersonaTree,一种结构化生命周期记忆框架,通过三级人物树和显式支持路径,将交互证据抽象为人物理解,在多个基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01146 2026-06-04 cs.AI 84%

PersistBench: When Should Long-Term Memories Be Forgotten by LLMs?

PersistBench: 大型语言模型何时应忘记长期记忆?

Sidharth Pulipaka, Oliver Chen, Manas Sharma, Taaha S Bajwa, Vyas Raina, Ivaxi Sheth

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 PersistBench 基准,评估 LLM 长期记忆带来的跨域泄露和记忆诱导的谄媚安全风险,发现主流模型失败率高达 53% 和 97%。

Comments 76 pages, 34 figures, ICML (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04668 2026-06-04 cs.CR cs.AI cs.CL 82%

Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs

拓扑结构至关重要:多智能体大语言模型中的内存泄漏测量

Jinbo Liu, Defu Cao, Yifei Wei, Tianyao Su, Yuan Liang, Yushun Dong, Yan Liu, Yue Zhao, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Florida State University(佛罗里达州立大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出MAMA框架,通过控制图拓扑结构评估多智能体LLM系统中的内存泄漏,发现密集连接、短攻击距离和高中心性增加泄漏,并给出稀疏或层次化拓扑的设计建议。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17315 2026-06-04 cs.AI cs.CL cs.LG 80%

Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning

更长上下文,更深思考:揭示长上下文能力在推理中的作用

Wang Yang, Zirui Liu, Hongye Jin, Qingyu Yin, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) University of Minnesota - Twin Cities(明尼苏达大学双城分校) Texas A&M University(德克萨斯阿姆大学)

专题命中 长上下文与记忆 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过实验发现,增强模型的长上下文能力(在监督微调前)能显著提升推理性能,即使对于短输入任务也有泛化收益,表明长上下文建模是推理能力的关键基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19293 2026-06-04 cs.CL cs.AI cs.LG 75%

100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?

100-LongBench:事实上的长上下文基准是否真的在评估长上下文能力?

Wang Yang, Hongye Jin, Shaochen Zhong, Song Jiang, Qifan Wang, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) Texas A&M University(德克萨斯A&M大学) Rice University(里德大学) University of California, Los Angeles(加州大学洛杉矶分校) Meta

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有长上下文基准无法分离基线能力与真实长上下文能力、且输入长度固定等问题,提出长度可控的长上下文基准和新指标,以有效评估大语言模型的长上下文能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04557 2026-06-04 cs.CL cs.IR cs.LG 73%

Cartridges at Scale: Training Modular KV Caches over Large Document Collections

大规模弹匣:训练模块化KV缓存以处理大型文档集合

Momchil Hardalov, Gonzalo Iglesias, Adrià de Gispert

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出Cartridges at Scale (CAS)框架,通过动态干扰混合和内存高效预算管理器实现大规模多弹匣训练,在减少预填充开销的同时保持准确性,性能优于单块弹匣10-31点,接近全上下文学习。

Comments 21 pages, 5 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04555 2026-06-04 cs.CL cs.AI 73%

Temporal Order Matters for Agentic Memory: Segment Trees for Long-Horizon Agents

时间顺序对智能体记忆至关重要:面向长程智能体的线段树

Yifan Simon Liu, Liam Gallagher, Faeze Moradi Kalarde, Jiazhou Liang, Armin Toroghi, Scott Sanner

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(人工智能向量研究所)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出线段树记忆架构SegTreeMem,通过在线右边缘更新规则保持对话历史的时间顺序,结合层次化时间上下文进行检索,在长程记忆基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04442 2026-06-04 cs.CL cs.AI 73%

MemoryDocDataSet: A Benchmark for Joint Conversational Memory and Long Document Reasoning

MemoryDocDataSet: 联合对话记忆与长文档推理的基准测试

Qiyang Xie, Jialun Wu, Xinjie He, Su Liu, Shuai Xiao, Zhiyuan Lin, Weikai Zhou

机构 * Northeastern University(东北大学) Johns Hopkins University(约翰霍普金斯大学) Columbia University(哥伦比亚大学) Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出MemoryDocDataSet合成基准,包含50个微世界和1000个QA对,评估系统同时处理多轮对话历史和长文档阅读理解的能力,其中75.1%的问题需要混合推理(先导航对话历史再提取文档答案),实验显示联合检索存在明显差距。

Comments 17 pages, 2 figures, 8 tables. Submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04628 2026-06-04 cs.CL cs.MA 70%

RAMPART: Registry-based Agentic Memory with Priority-Aware Runtime Transformation

RAMPART: 基于注册表的代理记忆与优先级感知运行时转换

Nikodem Tomczak

机构 * Nikodem Tomczak

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出RAMPART编译时记忆模型和纯内存块注册表,通过可编程运行时操作和五种原语实现上下文组装,实验表明块位置和分组显著影响任务成功率,并实现零提示令牌成本的共享注册表协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04315 2026-06-04 cs.AI 70%

Exploring Cross-Scenario Generality of Agentic Memory Systems: Diagnostics and a Strong Baseline

探索智能体记忆系统的跨场景通用性:诊断与强基线

Zhikai Chen, Jialiang Gu, Junyu Yin, Xianxuan Long, Shenglai Zeng, Xiaoze Liu, Kai Guo, Keren Zhou, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) George Mason University(乔治·马歇尔大学) Purdue University(普渡大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 通过诊断现有记忆系统在多种场景下的表现,提出一个基于工具调用的自管理记忆框架AutoMEM,实现最佳跨场景通用性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05233 2026-06-04 cs.LG cs.AI cs.CL 67%

MesaNet: Sequence Modeling by Locally Optimal Test-Time Training

MesaNet: 通过局部最优测试时训练进行序列建模

Johannes von Oswald, Nino Scherrer, Seijin Kobayashi, Luca Versari, Songlin Yang, Sarthak Mittal, Maximilian Schlegel, Kaitlin Maile, Yanick Schimpf, Oliver Sieberling, Alexander Meulemans, Rif A. Saurous, Guillaume Lajoie, Charlotte Frenkel, Razvan Pascanu, Blaise Agüera y Arcas, João Sacramento

机构 * Google(谷歌) Paradigms of Intelligence Team(智能范式团队) Google DeepMind(谷歌DeepMind) MIT CSAIL(麻省理工学院CSAIL)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于共轭梯度求解器实现局部最优测试时训练的Mesa层,在保持常数推理成本的同时,在语言建模困惑度和下游基准性能上超越现有RNN模型。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04240 2026-06-04 cs.CV cs.AI cs.CL 62%

Overview of the EReL@MIR 2025 Multimodal Document Retrieval Challenge (Track 1)

EReL@MIR 2025 多模态文档检索挑战赛(赛道1)概述

Jingbiao Mei

机构 * University of Cambridge(剑桥大学) Cambridge United Kingdom(剑桥英国)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文介绍了EReL@MIR 2025多模态文档检索挑战赛(赛道1)的设计、数据集、评估协议、最终排名及前三名获胜系统的分析,所有系统均基于Qwen2-VL系列解码器多模态大语言模型嵌入器。

Comments MDR Challenge Report at WWW2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04120 2026-06-04 cs.CL cs.AI 62%

SaliMory: Orchestrating Cognitive Memory for Conversational Agents

SaliMory: 为对话代理编排认知记忆

Kai Zhang, Xinyuan Zhang, Hongda Jiang, Shiun-Zu Kuo, Hyokun Yun, Ejaz Ahmed, Shereen Oraby, Ziyun Li, Sanat Sharma, Ann Lee, Ahmed A Aly, Anuj Kumar, Raffay Hamid, Xin Luna Dong

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SALIMORY框架,通过层级阶段过程奖励和奖励分解对比优化,端到端训练单一语言模型管理认知结构记忆,显著降低记忆相关错误并提升个性化表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05078 2026-06-04 cs.CR 50%

Attention-Augmented LSTMs for Automatic Homophonic Ciphertext Decipherment

注意力增强LSTM用于自动同音替换密码破译

Micaella Bruton, Meriem Beloucif, Beáta Megyesi

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文评估注意力增强LSTM模型在共享密钥设置下自动破译同音替换密码的能力,在历史英语和瑞典语文本上实现接近完美的字符级解密准确率。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏