arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-24 至 2026-07-24 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 16 篇

2601.01885 2026-07-24 cs.CL 版本更新 90%

Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents

代理记忆:为大语言模型代理学习统一的长期和短期记忆管理

Yi Yu, Liuyi Yao, Yuexiang Xie, Qingquan Tan, Jiaqi Feng, Yaliang Li, Libing Wu

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) Alibaba Group(阿里巴巴集团)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出Agentic Memory框架,统一管理大语言模型的长期和短期记忆,通过分步GRPO和三阶段强化学习提升记忆效率与任务表现。

Comments ACL'26 SAC Highlight. The code is available at https://github.com/y1y5/AgeMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05704 2026-07-24 cs.CR cs.AI 版本更新 89%

SafeHarbor: Defining Precise Decision Boundaries via Hierarchical Memory-Augmented Guardrail for LLM Agent Safety

SafeHarbor:用于LLM智能体安全的分层记忆增强防护栏

Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Hao Peng

机构 * School of Cyber Science and Technology, Beihang University, Beijing, China(北京航空航天大学网络安全学院) Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) AI Security Lab, Beijing, China(360人工智能安全实验室)

专题命中 长上下文与记忆 :LLM(title,title_cn);foundation model(abstract);分类 cs.AI

AI总结 提出SafeHarbor框架,通过分层记忆系统和信息熵自进化机制,在保持高安全拒绝率的同时提升对良性请求的响应能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20064 2026-07-24 cs.AI 版本更新 86%

PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning

PRO-LONG:程序化内存实现长程推理

Alexis Fox, Junlin Wang, Paul Rosu, Bhuwan Dhingra

机构 * Duke University(杜克大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长程任务中LLM智能体的挑战,提出PRO-LONG框架,通过程序化内存管理上下文,保留交互日志并利用编码智能体进展高效搜索历史,在ARC-AGI-3上有显著提升,减少令牌使用并达到高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21028 2026-07-24 cs.AI 版本更新 86%

SciTrek: Evaluating and Improving Long-Context Numerical Reasoning over Scientific Articles

谁被引用最多?在科学文章上基准测试长上下文数值推理

Miao Li, Alexander Gurung, Irina Saparina, Mirella Lapata

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SciTrek基准测试通过长上下文科学文章问题探索LLM的数值推理能力,发现即使最佳模型在长上下文下也面临显著挑战,尤其在处理引用和复合逻辑问题时表现不佳。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20458 2026-07-24 cs.CL cs.AI 新提交 86%

CAMeR: Keyword-Gated Hybrid Activation for Adaptive Memory Retention in LLM Agents

CAMeR:用于大语言模型智能体中自适应记忆保留的关键词门控混合激活

Haowen Lai

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型智能体记忆问题,提出CAMeR框架,结合关键词门控混合激活与自适应权重动态。通过CAMeR-Bench测试,表明其关键词门控效果好,能有效节省令牌并提高检索精度,证明混合符号-神经门控可实现自适应记忆保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20827 2026-07-24 cs.AI 新提交 79%

Auditing Provenance Sensitivity in LLM Agent Action Selection

审计大语言模型智能体动作选择中的溯源敏感性

Junchi Liao

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型智能体动作选择中的溯源敏感性,引入针对特定目标的授权审计,通过改变命题源权威等测试行为,发现可信和不可信变体在部分案例中产生不同动作,模型对线索有反应但不可信证据仍影响行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12997 2026-07-24 cs.AI cs.CL 版本更新 79%

WebCoach: Self-Evolving Web Agents with Cross-Session Memory Guidance

WebCoach:具有跨会话记忆引导的自我进化网络代理

Genglin Liu, Shijie Geng, Sha Li, Hejie Cui, Sarah Zhang, Xin Liu, Tianyi Liu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Amazon(亚马逊)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究针对网页代理跨会话学习不足问题,提出WebCoach框架,通过三个关键组件赋予代理跨会话记忆,可长期规划与自我进化,在WebVoyager基准测试中提升了不同LLM backbone的代理性能。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20489 2026-07-24 cs.AI cs.DB 新提交 77%

EvoSQL: Memory-Augmented Critic-Generator Co-Evolution for Text-to-SQL

EvoSQL:用于文本到SQL的内存增强型评论家-生成器协同进化

Jiawei Zhou, Jianwei Wang, Chenyu Zhou, Chaojian Shi, Ming Dong, Kai Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of New South Wales(新南威尔士大学) Fudan University(复旦大学) Wuhan University of Technology(武汉理工大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究文本到SQL问题,提出EvoSQL协同进化框架,通过生成器与评论家迭代交互、维护内存、验证候选及自蒸馏策略优化微调等,在Spider和BIRD实验中持续改进开源模型,证明该方法是有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21361 2026-07-24 cs.MA 新提交 75%

FedAgentKE: Federated Semantic Knowledge Evolution for Heterogeneous Agents

FedAgentKE:异构智能体的联邦语义知识演化

Weihao Li, Jun Bai, Ziyang Song

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究异构智能体孤立运行问题,提出 FedAgentKE 框架,通过语义知识蒸馏、聚合和Adapt实现联邦语义知识演化,实验验证其在跨框架和跨任务设置下能改进智能体协作,为未来协作智能体生态系统发展提供潜力。

Comments 9 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20709 2026-07-24 cs.AI cs.CL 新提交 73%

NVIDIA-labs OO Agents: Native Python Object-Oriented Agents

NVIDIA实验室的OO智能体:原生Python面向对象智能体

Paul Furgale, Severin Klingler, James Nolan, Matt Staats, Gaia Di Lorenzo, Elisa Martinez Abad, Christian Schüller, Razvan Dinu, Alessio Devoto, Pascal Berard, Gal Kaplun, Elad Sarafian, Riccardo Roveri, Leon Derczynski, Ricardo Silveira Cabral

机构 * NVIDIA-labs(英伟达实验室)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究提出NOOA这一Python框架构建可靠AI智能体,采用智能体即Python对象的编程模型,结合六个面向模型的理念,证明当前模型能有效使用此接口并在相关测试中表现良好,为智能体开发提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00004 2026-07-24 cs.CL cs.AI 版本更新 73%

LinearARD: Linear-Memory Attention Distillation for RoPE Restoration

线性记忆注意力蒸馏:用于RoPE修复的线性内存注意力蒸馏

Ning Yang, Hengyu Zhong, Wentao Wang, Baoliang Tian, Haijun Zhang, Jun Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southwest University(西南大学) Dalian University of Technology(大连理工大学) University of Science and Technology Beijing(北京科技大学) University College London(伦敦大学学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LinearARD,通过冻结的原生RoPE教师模型,利用注意力结构一致性恢复RoPE缩放的学生模型,以线性内存核克服二次内存瓶颈,提升长上下文性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21284 2026-07-24 cs.CL 新提交 70%

news-crawler-LM: A Small Long-Context Model For High-Quality News Crawling

新闻爬虫语言模型:一种用于高质量新闻爬虫的小型长上下文模型

Pascal Stolzenburg, Jonas Golde, Max Dallabetta, Alan Akbik

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究旨在解决新闻页面结构化内容提取难题,提出基于眼底新闻爬虫库微调的小型长上下文语言模型news-crawler-LM,能将HTML转换为文本和JSON,在HTML到Markdown和JSON提取任务中性能出色,且向研究社区发布了所有模型和工件。

Comments KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21067 2026-07-24 cs.CL 新提交 70%

PrefReward: Learning User Preference Matrix for Personalized Text Generation

PrefReward:学习用于个性化文本生成的用户偏好矩阵

Yue Wu, Chengbing Wang, Yimeng Bai, Xiaoyan Zhao, Yang Zhang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对大语言模型个性化生成中存在的问题,提出PrefReward框架,通过提取用户特定偏好矩阵并将其作为奖励信号指导生成,实验证明该框架在生成质量和个性化可解释性上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20553 2026-07-24 cs.AI cs.CL 新提交 62%

CMI-Mem: Toward Generalizable Long-Term Memory Management via CMI-Augmented Reinforcement Learning

CMI-Mem:通过CMI增强的强化学习实现可泛化的长期内存管理

Yubo Wang, Qiuyu Zhao, Zenghui Sun, Shichao Dong, Jinsong Lan, Xiaoyong Zhu, Haoyang Li, Bo Zheng, Lei Chen

机构 * Alibaba Group(阿里巴巴集团) HKUST(香港科技大学) PolyU(香港理工大学) HKUST(GZ)(香港科技大学(广州))

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有内存管理器模型局限,提出基于强化学习的CMI-Mem模型,结合下游问答正确性与内在条件互信息CMI作为混合奖励,可评估新输入信息,补充而非取代问答基础,实现可泛化的长期内存管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21000 2026-07-24 cs.AI 新提交 57%

Naju: A Native Discrete State-Space Model with Independent Retention and Writing for Long-Sequence Memory

Naju:一种具有独立保留和写入功能的用于长序列记忆的原生离散状态空间模型

Hyuk Lim, Seunghyun Yoon

机构 * Korea Institute of Energy Technology (KENTECH)(韩国能源技术研究所)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 研究针对长序列记忆跟踪中保留与覆盖的矛盾需求,提出Naju模型,将循环更新分解为离散极点、写入增益及映射。该模型在训练长度4倍时仍兼具保留与覆盖能力,在多任务中结合长距记忆与良好性能,优于Mamba基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20764 2026-07-24 cs.AI 新提交 57%

ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management

ArbiGraph:用于评估上下文管理的任意可扩展可验证任务图

Pavel Golikov, Evgenii Opryshko, Gennady Pekhimenko, Mark C. Jeffrey

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 长上下文与记忆 :language agent(abstract);分类 cs.AI

AI总结 ArbiGraph作为基准生成器,将任务表示为带Python求解器的自然语言问题,通过类型化中间状态组合任务。用多种任务类别实例化并评估智能体,发现其在孤立任务和复杂相关任务上表现不同,揭示了单任务评估无法发现的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏