arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-26 至 2026-06-26 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 9 篇

2606.07552 2026-06-26 cs.MA cs.AI cs.LG 新提交 88%

Symbolic Reasoning Frameworks Trigger Memory-Mediated Ecosystem Dynamics in Multi-Agent LLM Systems

符号推理框架在多智能体战略环境中调节大语言模型的风险规避

Augustin Chan

机构 * iterative.day

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过注入符号推理框架(如易经、塔罗牌)作为反思提示,发现其能差异化调节LLM的风险规避倾向,并在多智能体博弈中产生框架特定的胜者分布,且该效应源于反思过程而非内容遵循。

Comments 28 pages, 4 figures, 9 tables, 6 listings. Code and data: https://doi.org/10.5281/zenodo.20338937

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26629 2026-06-26 cs.LG cs.CL 新提交 84%

From Weights to Features: SAE-Guided Activation Regularization for LLM Continual Learning

从权重到特征:SAE引导的激活正则化用于大语言模型持续学习

Evan Ning, Wei Xue, Dong Lou, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对大语言模型持续学习中的灾难性遗忘问题,提出利用预训练稀疏自编码器(SAE)在激活空间进行正则化,通过特征掩码平衡稳定性和可塑性,无需旧任务数据,内存效率高,在TRACE和MedCL基准上超越EWC等方法。

Comments 21 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26403 2026-06-26 cs.CL 新提交 83%

ProfileFoundry: A Synthetic Person-Object Substrate for Privacy, Memory, and Tool-Use Evaluation in LLM Agent

ProfileFoundry: 用于LLM智能体隐私、记忆和工具使用评估的合成人物-对象基底

Sriram Selvam, Anneswa Ghosh

机构 * NVIDIA Corporation(英伟达公司)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL

AI总结 提出ProfileFoundry,一个确定性生成器,发布10万个合成成人人物对象,包含快照、家庭、雇主等字段及事件、关系边,用于下游基础模型评估中的记忆、隐私等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26758 2026-06-26 cs.AI 新提交 81%

EGG: An Expert-Guided Agent Framework for Kernel Generation

EGG: 一种专家引导的核函数生成智能体框架

Yaochen Han, Ke Fan, Hongxu Jiang, Wanqi Xu, Weiyu Xie, Runhua Zhang, Chenhui Zhu, Yixiang Zhang

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EGG框架,通过将核函数生成分解为算法结构设计与硬件特定调优两阶段,并采用阶段感知的多智能体协作机制,实现正确性与高性能,在KernelBench上平均加速比PyTorch达2.13倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26511 2026-06-26 cs.CL cs.AI cs.ET cs.LG 新提交 75%

Temporal Validity in Retrieval Memory: Eliminating Stale-Fact Errors for AI Agents over Evolving Knowledge

检索记忆中的时间有效性:消除AI智能体在知识演化中的过时事实错误

Neeraj Yadav

机构 * MemStrata.dev — Called It Inc. (Enterprise)(MemStrata.dev — Called It Inc.(企业))

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对RAG无法处理知识演化导致过时事实错误的问题,提出MemStrata,通过确定性替换规则维护时间有效性,在演化知识上准确率达0.95-1.00,过时事实错误率降至~0%。

Comments 21 pages, 5 tables. Code, prompts, and evaluation datasets included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26875 2026-06-26 cs.CL cs.AI 新提交 73%

Information-Aware KV Cache Compression for Long Reasoning

面向长推理的信息感知KV缓存压缩

Jushi Kai, Zhuiri Xiao, Alexandra Birch, Zhouhan Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出InfoKV框架,通过结合预测不确定性与注意力分数进行KV缓存压缩,在长上下文推理中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26654 2026-06-26 cs.CL cs.HC cs.IR 新提交 70%

SocialPersona: Benchmarking Personalized Profiling and Response with Multimodal Social-Media Context

SocialPersona: 基于多模态社交媒体上下文的个性化画像与回复基准测试

Qinkai Zhang, Yanyan Zhao, Xin Lu, Yulin Hu, Pengtao Han, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SocialPersona基准,评估多模态大语言模型从社交媒体时间线推断用户偏好并用于对话的能力,实验表明模型在细粒度与近期偏好上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26749 2026-06-26 cs.LG cs.CL 新提交 62%

Structure Before Collapse: Transient semantic geometry in next-token prediction

坍塌前的结构:下一词预测中的瞬态语义几何

Yize Zhao, Isabel Papadimitriou, Christos Thrampoulidis

机构 * The University of British Columbia(不列颠哥伦比亚大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究下一词预测语言模型在独热标签训练下如何学习语义结构,发现早期训练出现语义聚类但最终会过渡到对称态,通过Gram矩阵分析提出改进模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26560 2026-06-26 cs.CL 新提交 57%

Erase-then-Delta Attention: Decoupling Erase and Write Addresses in Delta-Rule Linear Attention

先擦除后增量注意力:在Delta规则线性注意力中解耦擦除与写入地址

Xiao Li, Chengruidong Zhang, Hao Luo, Xi Lin, Zekun Wang, Zihan Qiu, Yunfei Mao, Langshi Chen, Man Yuan, Minmin Sun, Huiqiang Jiang, Siqi Zhang, Rui Men, Wei Hu, Gong Cheng, Bo Zheng, Dayiheng Liu, Jingren Zhou

机构 * Qwen Team(Qwen团队) Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.CL

AI总结 提出Erase-then-Delta Attention (EDA),通过解耦擦除和写入地址,在Delta规则基础上增加选择性擦除步骤,提升循环记忆模型的记忆管理能力,在2.5B密集和MoE 25B-A2.8B模型上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏