arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 778 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 59 篇

2606.23075 2026-06-23 cs.CR cs.AI 新提交 90%

Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies

自进化LLM智能体系统中的安全性:威胁、放大与案例研究

Ruixiao Lin, Xinhao Deng, Qingming Li, Jianan Ma, Yunhao Feng, Yuqi Qing, Zhenyuan Li, Yechao Zhang, Shiwen Cui, Changhua Meng, Tianwei Zhang, Xingjun Ma, Qi Li, Ke Xu, Shouling Ji

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Hangzhou Dianzi University(杭州电子科技大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 本文系统分析自进化LLM智能体系统的安全威胁,提出模块-生命周期攻击面矩阵,揭示17个关键威胁和7种跨模块放大效应,并通过案例证明进化设计激活3.5倍攻击面且静态防御失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22528 2026-06-23 cs.AI 新提交 90%

Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents

治理衰减:上下文压缩如何悄然消除长周期LLM智能体中的安全约束

Shiyang Chen

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 研究发现LLM智能体的上下文压缩机制会无意中移除安全约束,导致违规行为;提出ConstraintRot基准和Constraint Pinning缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15874 2026-06-23 cs.AI cs.SE 新提交 90%

LLM-as-Code: Agentic Programming for Agent Harness

LLM即代码:面向Agent框架的编程范式

Junjia Qi, Zichuan Fu, Jingtong Gao, Wenlin Zhang, Hanyu Yan, Xian Wu, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯贾维斯实验室)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM作为编排器导致控制流幻觉和不可靠执行的问题,提出Agentic Programming范式,由程序控制所有流程,LLM仅作为代码组件在需要推理或生成时被调用,显著提升长序列操作的稳定性。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04329 2026-06-23 cs.CR cs.AI 版本更新 90%

From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents

从不可信输入到可信内存:LLM智能体中内存投毒攻击的系统研究

Pritam Dash, Tongyu Ge, Aditi Jain, Tanmay Shah, Zhiwei Shang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 本文系统研究了基于LLM的智能体中的内存投毒攻击,识别了四种内存写入通道和九种结构漏洞,提出了六类攻击的分类法,并设计了评估基准MPBench,发现更积极读写内存的智能体更易被利用,且现有提示注入防御无法覆盖内存投毒攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23668 2026-06-23 cs.LG 新提交 89%

On the Limits of Prompt-Conditioned Language Models as General-Purpose Learners

关于提示条件语言模型作为通用学习器的局限性

David Mguni, Julian Ma, Jun Wang

机构 * Queen Mary University London(伦敦玛丽女王大学) University College London(伦敦大学学院)

专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);prompting(abstract)

AI总结 本文通过廉价谈话博弈模型分析提示条件语言模型,证明语言作为容量受限通道导致任务不可区分性,并因对齐约束产生不可约误差,从而否定其通过提示实现通用问题求解的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22692 2026-06-23 cs.AI cs.CL cs.DB cs.IR 新提交 88%

VISTA Architect: A graph database-oriented health AI system demonstrated in multidisciplinary tumor boards

VISTA Architect:一种面向图数据库的健康AI系统,在多学科肿瘤委员会中展示

Tuomo Kiiskinen, Jason Fries, Philip Adamson, David Wu, Timothy John Ellis-Caleo, Aaron Fanous, Balasubramanian Narasimhan, Joel Neal, Sylvia Plevritis, Manuel A. Rivas

机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) Department of Medicine, Stanford University School of Medicine(斯坦福大学医学院医学系)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出VISTA Architect架构,通过图数据库和LLM将EHR转化为持久知识图谱,解决长上下文提示和RAG的时序缺失与高成本问题,在胸科肿瘤委员会中实现96.4%准确率。

Comments 22 pages, 4 figures, 6 tables; includes Supplementary Information. Code: https://github.com/VISTA-Stanford/vista-architect (tag v0.1.0-preprint, commit 8837d44)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21166 2026-06-23 cs.LG cs.AI 版本更新 88%

The Ratchet Effect in Silico: How Interaction Drives Cumulative Intelligence in Large Language Models

通过交互驱动的累积智能在大语言模型中实现的“棘轮效应

Ren Zhuang

机构 * School of Information Science and Technology, Hangzhou Normal University(杭州师范大学信息科学与技术学院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出POLIS框架,通过异质智能体之间的交互实现知识积累,展示出在数学推理任务中,群体模型的性能提升显著。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23164 2026-06-23 cs.CL 新提交 88%

Same question, different history: language, national identity, and credit in large language models

相同问题,不同历史:语言、国家认同与大型语言模型中的归因

William Guey, Pierrick Bougault, Wei Zhang, Vitor D. de Moura, José O. Gomes

机构 * Tsinghua University(清华大学) Federal University of Rio de Janeiro(里约热内卢联邦大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大型语言模型在21项有争议的发明/发现中,查询语言如何系统性地影响不同国家主张者的出现频率,揭示语言作为激活不同国家历史版本的开关,产生系统性不同的国家记忆。

Comments 27 pages (main text and Supplementary Information combined), 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10251 2026-06-23 math.NA cs.LG cs.NA stat.ML 版本更新 88%

Numerical stability analysis of large language models

大型语言模型的数值稳定性分析

Stanislav Budzinskiy, Wenyi Fang, Longbin Zeng, Philipp Petersen

机构 * Faculty of Mathematics(数学系) University of Vienna(维也纳大学) Huawei Technologies(华为技术)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文通过混合精度分析推导Transformer推理的条件数和前向误差界,比较LayerNorm与RMSNorm在极端异常值下的稳定性,并量化注意力汇聚对扰动敏感性的影响,发现数值稳定性由权重幅度与残差流增长共同决定。

Comments Major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22330 2026-06-23 cs.AI cs.SE 新提交 87%

Hypothesis-Driven Skill Optimization for LLM Agents

假设驱动的技能优化用于LLM智能体

Fangxin Shang, Yehui Yang

机构 * AI Lab, Qifu Technology(奇富科技人工智能实验室)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 提出HDSO框架,通过可证伪假设与验证机制从稀疏轨迹中提取可靠技能,无需训练,在ALFWorld上提升平均成功率6.9-7.1个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21822 2026-06-23 cs.PL cs.AI cs.SE 新提交 87%

CNnotator: LLM-Guided Memory Safety Annotation Synthesis

CNnotator: LLM引导的内存安全注释合成

Twain Byrnes, Mike Dodds

机构 * Carnegie Mellon University(卡内基梅隆大学) Galois, Inc.(Galois公司)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CNnotator工具,利用大语言模型自动生成CN规范来标注C代码的内存使用模式,OpenAI o3模型首次尝试成功率达90%,表明AI辅助注释对实际C代码库可行。

Comments 6 pages. Published at ReCode 2026 (1st Workshop on Code Translation, Transformation, and Modernization), co-located with ICSE 2026. This version corrects the description of the property-based testing backend (Bennet, built on Fulminate) relative to the published version

Journal ref Proceedings of the 1st Workshop on Code Translation, Transformation, and Modernization (ReCode '26), April 12-18, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21203 2026-06-23 cs.CL cs.AI 新提交 87%

When Context Misleads: Surprisal, Energy and Attention Entropy as Metrics of Coherence Illusions in LLMs

当上下文误导:惊讶度、能量和注意力熵作为LLM中连贯性错觉的度量

Ece Takmaz, Nitin Kumar, Li Kloostra, Jakub Dotlacil

机构 * Utrecht University(乌得勒支大学)

专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究荷兰语LLM在连贯性错觉中的表现,使用惊讶度、注意力熵和能量指标揭示模型受干扰词影响而忽略不连贯的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23283 2026-06-23 cs.CL 新提交 86%

Towards Root Memories: Benchmarking and Enhancing Implicit Logical Memory Retrieval for Personalized LLMs

迈向根记忆:面向个性化大语言模型的隐式逻辑记忆检索基准与增强

Hongxun Ding, Xiang Yu, Chengbing Wang, Jianfei Xiao, Keqin Bao, Wenjie Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有记忆系统依赖语义相似性而忽略逻辑关键记忆的问题,构建首个高质量基准IMLogic,并提出根记忆表示与RootMem框架,通过结构化逻辑记忆提升个性化LLM检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22263 2026-06-23 cs.CR cs.AI cs.MA cs.SE 新提交 86%

Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases

Revelio: 面向仓库级代码库的高性价比智能体内存安全漏洞检测

Yiwei Hou, Hao Wang, Muxi Lyu, Marius Momeu, Eric Nguyen, Taige Yang, Koushik Sen, Dawn Song, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Revelio框架,通过生成可执行漏洞证明并用确定性消毒器验证,结合低成本LLM和轻量静态分析,在仓库级代码库中高效发现内存安全漏洞,7个项目中19个新漏洞,成本约300美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20758 2026-06-23 cs.SE cs.AI 新提交 86%

A Topology-Aware, Memory-Centric Architecture that Separates Root-Cause Derivation from Root-Cause Explanation

一种拓扑感知、以记忆为中心的架构,将根本原因推导与根本原因解释分离

Momil Seedat

机构 * Independent Research Prototype(独立研究原型)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出OPS CORTEX多智能体原型,通过四层操作记忆分离根本原因推导(基于依赖图与阈值时序)与解释(LLM),解决微服务故障诊断中上下文丢失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06843 2026-06-23 cs.AI 版本更新 86%

United Minds or Isolated Agents? Exploring Coordination of LLMs under Cognitive Load Theory

统一思维还是孤立代理?探索认知负荷理论下LLM的协调

HaoYang Shang, Xuan Liu, Zi Liang, Jie Zhang, Haibo Hu, Song Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) University of California San Diego(加州大学圣地亚哥分校) Hong Kong Polytechnic University(香港理工大学)

专题命中 长上下文与记忆 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 受认知负荷理论启发,提出CoThinker多智能体框架,通过智能体分工和结构化通信降低认知负荷,在复杂推理任务上提升性能,但在低负荷任务上协调开销占优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22647 2026-06-23 cs.CR cs.LG cs.SE 新提交 84%

RAVEN: Agentic RAG for Automated Vulnerability Repair

RAVEN:用于自动化漏洞修复的智能体检索增强生成框架

Varun Gadey, Zijie Liu, Alexandra Dmitrienko

机构 * University of Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出RAVEN框架,集成智能体RAG管道与可控迭代修复,利用开源LLM实现跨类型、跨语言的自动化漏洞修复,在160个真实CVE上达到83.13%修复成功率。

Comments 17 Pages, 4 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20898 2026-06-23 cs.IR cs.AI cs.CL cs.CY 新提交 82%

The Token Tax of Epistemic Accuracy: Comparing RAG and Long-Context Architectures for Document-Grounded Generative AI Applications

认知准确性的Token税:比较RAG与长上下文架构在文档基础生成式AI应用中的表现

Austin Hamilton, Ryan Singh, Michael Wise, Ibrahim Yousif, Arthur Carvalho, Zhe Shan, Mohammad Mayyas, Lora A. Cavuoto, Fadel M. Megahed

机构 * Miami University(迈阿密大学) University at Buffalo(布法罗大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);small language model(abstract);prompting(abstract)

AI总结 研究比较RAG与长上下文提示两种架构在文档基础生成式AI中的认知准确性与成本权衡,发现长上下文虽准确率更高(73.1% vs 65.4%),但Token成本增加26倍。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23670 2026-06-23 cs.LG cs.AI cs.CL 新提交 82%

Tapered Language Models

锥形语言模型

Reza Bayat, Ali Behrouz, Aaron Courville

机构 * Mila Cornell University(康奈尔大学) Université de Montréal(蒙特利尔大学) CIFAR AI Chair(CIFAR人工智能教席)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有语言模型各层参数均匀分配的问题,提出锥形语言模型(TLM),在固定预算下单调递减层容量,实验表明MLP宽度按余弦调度锥形化可提升困惑度和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11975 2026-06-23 cs.RO 版本更新 82%

M2HRI: An LLM-Driven Multimodal Multi-Agent Framework for Personalized Human-Robot Interaction

M2HRI:一种LLM驱动的多模态多智能体框架,用于个性化人机交互

Shaid Hasan, Breenice Lee, Sujan Sarker, Tariq Iqbal

机构 * University of Virginia(弗吉尼亚大学)

专题命中 长上下文与记忆 :LLM(title,title_cn)

AI总结 提出M2HRI框架,通过个性、长期记忆和情境化协调机制赋予每个机器人独特身份,实验表明该方法能提升交互自然性和协调性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23050 2026-06-23 cs.CV cs.CL 新提交 81%

Unlimited OCR Works

无限OCR工作

Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia

机构 * Baidu Inc.(百度公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Unlimited OCR模型,通过Reference Sliding Window Attention机制,实现高效长文本处理,适用于OCR及ASR等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22877 2026-06-23 cs.CL 新提交 81%

DynamicMem: A Long-Horizon Memory Benchmark in Real-World Settings

DynamicMem:真实世界场景下的长时记忆基准测试

Wenya Xie, Shengming Zhou, Zelin Li, Pouya Parsa, Shuang Zhou, Xinheng Ding, Chinmay Arvind, Guanchu Wang, Vladimir Braverman, Ali Payani, Yantao Zheng, Zirui Liu

机构 * University of Minnesota(明尼苏达大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Johns Hopkins University(约翰霍普金斯大学) Cisco(思科) Adobe

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出DynamicMem基准,通过合成15个月的多应用用户活动数据,评估LLM代理在异构、动态变化且隐含的用户画像记忆能力,发现记忆检索是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19121 2026-06-23 cs.SE cs.CL cs.HC 新提交 81%

Written by AI, Managed by AI: Semantic Space Control and Index Sickness Elimination Across 391 Consecutive Sessions

由AI编写,由AI管理:跨越391个连续会话的语义空间控制与索引病消除

Hui Zhang, Shuren Song

机构 * Shenzhen Yunxi Technology Co., Ltd.(深圳云曦科技有限公司) Information Technology Center, Tsinghua University(清华大学信息科学技术中心)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文通过真实软件项目中的行动研究,发现长期LLM协作中增加形式约束反而导致“索引病”,提出“基线-日志物理分离”机制,有效消除该问题。

Comments 22 pages, 2 tables, 1 figure. Action research. Bilingual submission (Chinese companion version included as supplementary). Submitted to ICSE 2027 IOR track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12945 2026-06-23 cs.AI 新提交 81%

Learning What to Remember: A Cognitively Grounded Multi-Factor Value Model for Agentic Memory

学习该记住什么:一种基于认知的多因素记忆价值模型

Zhibao Chen, Qian Cheng

机构 * Huatai Securities(华泰证券) OneBeget.com

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对长期LLM代理的记忆管理问题,提出一种基于认知心理学的多因素记忆价值函数,通过无梯度优化学习权重,统一控制编码深度、遗忘风险和检索排名,在LongMemEval上显著优于单一因素和近因策略。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21842 2026-06-23 cs.CR 新提交 80%

Agent-Assisted Side-Channel Attacks on Non-Prefix KV Cache in RAG

代理辅助的非前缀KV缓存侧信道攻击

He Sun, Shinan Liu, Siyuan Ma, Junhao Li, Mingjun Xiao, Wenhao Jiang

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对RAG系统中非前缀KV缓存融合的侧信道漏洞,提出SpliceLeak攻击,利用“阶梯波”时序特征提取私有提示长度和语义内容,并设计SpliceDefense防御机制。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10616 2026-06-23 cs.AI 新提交 79%

Learning What to Remember: Observability-Safe Memory Retention via Constrained Optimization for Long-Horizon Language Agents

学习记住什么:通过约束优化实现长时域语言代理的观测安全记忆保留

Qingcan Kang, Liu Mingyang, Shixiong Kai, Kaichao Liang, Tao Zhong, Mingxuan Yuan

机构 * Huawei Noah's Ark Lab(华为诺亚方舟实验室) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 长上下文与记忆 :language agent(title,abstract);分类 cs.AI

AI总结 针对长时域语言代理的有限上下文窗口,提出OSL-MR框架,将记忆保留建模为约束随机优化问题,通过在线可观测特征与离线监督的严格分离学习查询条件化的证据价值,实验表明在严格预算下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21803 2026-06-23 cs.CL 新提交 77%

Test-Time Training with Next-Token Prediction

基于下一个词预测的测试时训练

Xuan Ouyang, Zefan Cai, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出TTT-NTP方法,利用预训练语言模型自身的下一个隐藏状态作为自监督信号进行测试时训练,无需重新设计骨干网络,在多个长上下文基准上显著提升性能。

Comments 17 pages, 2 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20625 2026-06-23 cs.AI cs.CL cs.LG 新提交 75%

AlphaMemo: Structured Search-Process Memory for Self-Evolving Alpha Mining Agents

AlphaMemo: 用于自我进化的Alpha挖掘智能体的结构化搜索过程记忆

Hang Yu, Zifan Zheng, Jeff Z. Pan, Tongliang Liu, Zhiyong Wang, Fengxiang He

机构 * University of Sydney(悉尼大学) University of Edinburgh(爱丁堡大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AlphaMemo,一种具有结构化搜索过程记忆的自我进化Alpha挖掘智能体,通过记录编辑模式在特定父因子上下文中的成败证据,结合置信门控残差记忆和非对称否决控制,提升样本外表现和固定预算发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14470 2026-06-23 cs.AI cs.CL cs.LG 新提交 75%

GitOfThoughts: Version-Controlled Reasoning and Agent Memory You Can Replay, Diff, and Merge

GitOfThoughts: 版本控制的推理与可回放、差异比较和合并的智能体记忆

Pavan C Shekar, Abhishek H S, Aswanth Krishnan

机构 * QpiAI

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GitOfThoughts框架,将智能体推理树存储为git仓库,实现推理的可回放、审计和合并;实验表明,对于新问题,任何记忆格式均不能可靠提升准确率,仅当检索案例与当前问题高度相似(>0.8)时才有显著提升,且收益来自答案检索而非方法迁移。

Comments 10 pages, 1 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30711 2026-06-23 cs.CL cs.AI cs.LG stat.ML 版本更新 75%

SAGE: A Novelty Gate for Efficient Memory Evolution in Agentic LLMs

SAGE: 一种用于智能体大语言模型中高效记忆演化的新颖门控机制

Sijia Wang, Dhanajit Brahma, Ricardo Henao

机构 * Duke University(杜克大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SAGE门控机制,基于von Mises-Fisher密度估计和自适应阈值,将记忆写入控制建模为新奇性检测问题,在LoCoMo上以更低成本实现最优token-F1。

详情

展开后加载摘要…

URL PDF HTML 收藏