arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2606.04120 2026-06-04 cs.CL cs.AI 62%

SaliMory: Orchestrating Cognitive Memory for Conversational Agents

SaliMory: 为对话代理编排认知记忆

Kai Zhang, Xinyuan Zhang, Hongda Jiang, Shiun-Zu Kuo, Hyokun Yun, Ejaz Ahmed, Shereen Oraby, Ziyun Li, Sanat Sharma, Ann Lee, Ahmed A Aly, Anuj Kumar, Raffay Hamid, Xin Luna Dong

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SALIMORY框架,通过层级阶段过程奖励和奖励分解对比优化,端到端训练单一语言模型管理认知结构记忆,显著降低记忆相关错误并提升个性化表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03099 2026-06-03 cs.CL cs.AI 62%

PhotoCraft: Agentic Reasoning with Hierarchical Self-Evolving Memory for Deep Image Search

PhotoCraft: 具有层次自进化记忆的深度图像搜索代理推理

Kailin Lyu, Zhiqiang Yuan, Jianwei He, Qiwei Yan, Xuanbo Su, Nanxing Hu, Yang Liu, Ce Hao, Shengqian Qin, Lianyu Hu, Jinchao Zhang, Jie Zhou

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc.(微信AI模式识别中心,腾讯公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 提出PhotoCraft,一种无需训练的分层记忆系统,通过工作、情景和语义记忆增强多模态大语言模型,实现深度图像搜索中的多步推理和知识迁移,在DISBench上提升检索性能达18.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24684 2026-05-26 cs.LG cs.AI 62%

Beyond the Aggregation Dilemma: Prior-Retaining Decoupled Learning for Multimodal Graphs

超越聚合困境:多模态图的先验保持解耦学习

Hao Yan, Xuanru Wang, Jun Yin, Shirui Pan, Senzhang Wang, Chengqi Zhang

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 针对多模态属性图学习中强制聚合导致性能反转的聚合困境,提出解耦双路径架构SUPRA,通过保持先验特征的独立性和轻量级共享GNN捕获结构协同,并辅以深度监督缓解梯度饥饿,实现SOTA性能且显著降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24411 2026-05-26 cs.AI cs.LG 62%

The Model Is Not the Product: A Dual-Pillar Architecture for Local-First Psychological Coaching

模型并非产品:面向本地优先心理辅导的双支柱架构

Alexander Mihalcea

机构 * iOS application(iOS应用)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Psych LM,一种基于本地优先架构的iOS应用,通过自动记忆语料库和检索增强生成实现近无限上下文窗口,在移动设备上提供可靠的上下文感知心理辅导。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22884 2026-05-25 cs.LG cs.AI 62%

Tensor Cache: Eviction-conditioned Associative Memory for Transformers

Tensor Cache: 基于驱逐条件的Transformer联想记忆

Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, Antonio Torralba

机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院) IBM Research, Cambridge, MA, USA(IBM研究院) University of Toronto, Toronto, Canada(多伦多大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Tensor Cache,一种双层缓存结构,将滑动窗口注意力作为L1缓存,将窗口驱逐的KV对压缩为外积快速权重记忆作为L2缓存,通过门控融合和端到端训练,在有限状态基线中提升记忆-质量边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22872 2026-05-25 cs.LG cs.AI cs.CV 62%

MedExpMem: Adapting Experience Memory for Differential Diagnosis

MedExpMem:适应经验记忆用于鉴别诊断

Qianhan Feng, Zhongzhen Huang, Yakun Zhu, Yannian Gu, Winnie Chiu Wing Chu, Xiaofan Zhang, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MedExpMem经验记忆框架,通过存储和利用诊断失败中的判别经验,增强医学视觉语言模型的鉴别诊断能力,在放射学基准上最高提升7.0%准确率。

Comments MICCAI 2026 Early Accept. Submission Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21649 2026-05-22 cs.LG cs.CL 62%

EntmaxKV: Support-Aware Decoding for Entmax Attention

EntmaxKV: 基于支持的解码方法用于Entmax注意力

Gonçalo Duarte, Miguel Couceiro, Marcos V. Treviso

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) ELLIS Unit Lisbon(里斯本ELLIS单位) INESC-ID Instituto de Telecomunicações(电信研究所)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出EntmaxKV,一种基于支持的解码框架,利用熵最大注意力的稀疏性在KV页面加载前进行稀疏解码,通过查询感知的页面评分、支持感知的候选选择和稀疏熵最大注意力,减少概率质量丢失,提高长上下文语言模型的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20626 2026-05-21 cs.CL cs.AI cs.CV 62%

Retrieval-Augmented Long-Context Translation for Cultural Image Captioning: Gators submission for AmericasNLP 2026 shared task

基于检索的长上下文翻译用于文化图像描述:佛罗里达大学Gators参加2026年美洲自然语言处理共享任务的提交

Aashish Dhawan, Christopher Driggers-Ellis, Dzmitry Kasinets, Daisy Zhe Wang, Christan Grant

机构 * University of Florida(佛罗里达大学)

专题命中 长上下文与记忆 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于检索的长上下文翻译方法,用于文化图像描述,通过两阶段流程生成西班牙语中间描述,再利用检索增强的多示例提示生成目标语言描述,显著提升了Bribri、Guaraní和Orizaba Nahuatl语言的描述生成性能,并在共享任务中获得冠军。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19150 2026-05-20 cs.LG cs.AI 62%

Flash PD-SSM: Memory-Optimized Structured Sparse State-Space Models

Flash PD-SSM: 一种内存优化的结构稀疏状态空间模型

Aleksandar Terzić, Francesco Carzaniga, Nicolas Menet, Yannick Biehl, Michael Hersche, Thomas Hofmann, Abbas Rahimi

机构 * IBM Research – Zurich(IBM瑞士研究中心) Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Flash PD-SSM,一种内存优化的结构稀疏状态空间模型,通过在保持高效的同时提升表达能力,实现了与传统结构化状态空间模型相当的吞吐量,并在多个任务中展示了更高的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17398 2026-05-19 cs.CL cs.LG 62%

MiniGPT: Rebuilding GPT from First Principles

MiniGPT:从第一原理重新构建GPT

Jibin Joseph

机构 * Department of Computer Science(计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MiniGPT,一个基于PyTorch从头实现的GPT风格自回归语言模型,旨在在研究nanoGPT设计后,从第一原理重新构建GPT核心流程,同时保持模型和训练代码独立编写。MiniGPT实现了词嵌入、位置嵌入、因果多头自注意力、预层归一化Transformer块、残差连接、前馈MLP层、下一词交叉熵训练(教师强制)、验证跟踪、检查点选择和自回归文本生成。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14800 2026-05-19 cs.IR cs.AI cs.LG 62%

Long Context Modeling with Ranked Memory-Augmented Retrieval

长上下文建模与排名记忆增强检索

Ghadir Alselwi, Hao Xue, Shoaib Jameel, Basem Suleiman, Flora D. Salim, Imran Razzak

机构 * University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) University of Southampton(南安普顿大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种增强的排名记忆增强检索框架,通过动态排名记忆条目和学习到的排名技术,提升语言模型在长上下文任务中的性能和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13370 2026-05-14 cs.LG cs.CL 62%

Phasor Memory Networks: Stable Backpropagation Through Time for Scalable Explicit Memory

相位记忆网络:用于可扩展显式记忆的稳定反向传播通过时间

Sungwoo Goo, Hwi-yeol Yun, Sangkeun Jung

机构 * College of Pharmacy(药学院) Chungnam National University(Chungnam国立大学) Department of Computer Science & Engineering(计算机科学与工程系)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Phasor Memory Network,通过相位动力学和分层可学习锚点解决显式记忆的稳定性问题,实验证明其在Copy-Paste任务中达到高精确度,且在参数规模上超越了Mamba模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02007 2026-05-13 cs.CL cs.AI 62%

Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation

超越RAG的代理记忆:通过解耦与聚合进行检索

Zhanghao Hu, Qinglin Zhu, Runcong Zhao, Di Liang, Hanqi Yan, Yulan He, Lin Gui

机构 * King’s College London(伦敦国王学院) Tencent, Yuanbao Team(腾讯元宝团队)

专题命中 长上下文与记忆 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出xMemory,通过解耦与聚合原则优化代理记忆检索,提升答案质量和推理效率。

Comments Project Address: https://zhanghao-xmemory.github.io/Academic-project-page-template/; Code Address: https://github.com/HU-xiaobai/xMemory

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09998 2026-05-12 cs.LG cs.AI 62%

Continual Harness: Online Adaptation for Self-Improving Foundation Agents

持续Harness:面向自我改进基础代理的在线适应

Seth Karten, Joel Zhang, Tersoo Upaa, Ruirong Feng, Wenzhe Li, Chengshuai Shi, Chi Jin, Kiran Vodrahalli

机构 * Princeton University(普林斯顿大学) ARISE Foundation(ARISE基金会) Google DeepMind(谷歌DeepMind)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出持续Harness,一种无需人工干预的自我改进机制,通过在线适应提升具身代理在长视界部分可观察决策中的表现,实验证明其在Pokémon游戏中显著降低操作成本并接近专家水平。

Comments 28 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09330 2026-05-12 cs.LG cs.AI 62%

The Trap of Trajectory: Towards Understanding and Mitigating Spurious Correlations in Agentic Memory

轨迹的陷阱:朝着理解并缓解代理记忆中的虚假相关性

Luoxi Tang, Rupali Rajendra Vaje, Yuqiao Meng, Sakshi Sunil Narkar, Weicheng Ma, Zeyu Ding, Dazheng Zhang, Zhaohan Xi

机构 * Binghamton University, State University of New York(宾夕法尼亚州立大学) Oakland University(奥克兰大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 长上下文与记忆 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究代理记忆中的虚假相关性问题,通过基准测试揭示记忆在清洁输入下提升推理但放大虚假模式依赖性,并提出CAMEL方法在写入和检索时减少对虚假模式的依赖,同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13751 2026-05-12 cs.LG cs.AI 62%

MIDUS: Memory-Infused Depth Up-Scaling

MIDUS:记忆融合深度上采样

Taero Kim, Hoyoon Byun, Youngjun Choi, Sungrae Park, Kyungwoo Song

机构 * Yonsei University(延世大学) Upstage AI

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MIDUS,通过将复制的FFN分支替换为记忆层,利用轻量级检索残差能力提升模型性能与效率,引入Head-wise Memory Layer和HIVE实现头条件残差扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06946 2026-05-11 cs.LG cs.AI 62%

Adaptive Memory Decay for Log-Linear Attention

自适应记忆衰减的对数线性注意

Yaxita Amin, Helen Zichen Li, Mengfan Zhang, Samet Ayhan

机构 * University of Maryland(马里兰大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过轻量级两层MLP学习记忆衰减参数λ,实现按内容自适应的衰减,提升长距离记忆任务性能。

Comments 19 pages, 13 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05583 2026-05-11 cs.AI cs.CL 62%

Belief Memory: Agent Memory Under Partial Observability

信念记忆:在部分可观测性下的智能体记忆

Junfeng Liao, Qizhou Wang, Jianing Zhu, Bo Du, Rui Yan, Xiuying Chen

机构 * MBZUAI RIKEN AIP UT Austin Wuhan University(武汉大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BeliefMem,通过保留多个候选结论及其概率,解决智能体在部分可观测环境中记忆的不确定性问题,实验证明其在LoCoMo和ALFWorld基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22842 2026-05-11 cs.CL cs.LG 62%

Bayesian Attention Mechanism: A Probabilistic Framework for Positional Encoding and Context Length Extrapolation

贝叶斯注意机制:一种用于位置编码和上下文长度外推的概率框架

Arthur S. Bianchessi, Yasmin C. Aguirre, Rodrigo C. Barros, Lucas S. Kupssinskü

机构 * MALTA – Machine Learning Theory and Applications Lab, PUCRS – Porto Alegre, Brazil(MALTA机器学习理论与应用实验室,PUCRS-波士顿实验室,巴西) Kunumi Institute, Brazil(昆米研究所,巴西)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出贝叶斯注意机制,通过概率模型将位置编码作为先验,统一了现有方法并改进了长上下文泛化能力,在500倍训练上下文长度下实现更准确的信息检索。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06614 2026-05-08 cs.AI cs.CL 62%

SkillOS: Learning Skill Curation for Self-Evolving Agents

SkillOS: 为自演化代理学习技能编目

Siru Ouyang, Jun Yan, Yanfei Chen, Rujun Han, Zifeng Wang, Bhavana Dalvi Mishra, Rui Meng, Chun-Liang Li, Yizhu Jiao, Kaiwen Zha, Maohao Shen, Vishy Tirumalashetty, George Lee, Jiawei Han, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 SkillOS通过经验驱动的强化学习方法,解决自演化代理中复杂长期技能编目的学习问题,优于记忆-free和强记忆基线,在效果和效率上均表现优异,技能库逐步演变成更丰富的Markdown文件。

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06316 2026-05-08 cs.LG cs.AI 62%

Pro-KLShampoo: Projected KL-Shampoo with Whitening Recovered by Orthogonalization

Pro-KLShampoo:利用正交化恢复白化过程的投影KL-Shampoo

Ruotong Sun, Ermin Wei

机构 * Department of Electrical & Computer Engineering, Northwestern University(电气与计算机工程系,西北大学) Department of Industrial Engineering & Management Sciences, Northwestern University(工业工程与管理科学系,西北大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Pro-KLShampoo,通过正交化恢复白化过程,改进了KL-Shampoo的Kronecker预置器结构,实验证明其在预训练任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01229 2026-05-05 cs.LG cs.CL 62%

Attention Sinks in Massively Multilingual Neural Machine Translation:Discovery, Analysis, and Mitigation

大规模多语言神经机器翻译中的注意力 sinks:发现、分析与缓解

Hillary Mutisya, John Mugane

机构 * Harvard University(哈佛大学)

专题命中 长上下文与记忆 :LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 研究发现神经机器翻译中跨注意力模式存在注意力 sinks,非内容token占据大部分注意力质量,影响相似性评估,提出内容过滤方法以恢复语言信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07791 2026-04-21 cs.AI cs.LG 62%

SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents

SEARL:自进化智能体中策略与工具图记忆的联合优化

Xinshun Feng, Xinhao Song, Lijun Li, Gongshen Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学)

专题命中 长上下文与记忆 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 SEARL通过构建结构化经验记忆实现策略与工具图记忆的联合优化,提升智能体在知识推理和数学任务中的实用性和效率。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04008 2026-04-21 cs.LG cs.AI 62%

RACE Attention: A Strictly Linear-Time Attention Layer for Training on Outrageously Large Contexts

RACE 注意力:一种严格线性时间的注意力层,用于在极端长上下文中训练

Sahil Joshi, Agniva Chowdhury, Amar Kanakamedala, Ekam Singh, Evan Tu, Anshumali Shrivastava

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 RACE 注意力通过替代指数核为锐化角相似性,并利用高斯随机投影和软局部敏感哈希,实现线性时间复杂度的注意力层,适用于超长上下文训练,同时减少时间和内存消耗。

Comments Accepted at ICLR 2026. 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15356 2026-04-20 cs.LG cs.AI cs.IT cs.NE math.IT 62%

Sequential KV Cache Compression via Probabilistic Language Tries: Beyond the Per-Vector Shannon Limit

基于概率语言tries的序列KV缓存压缩:超越每向量香农极限

Gregory Magarshak

机构 * faculty.ienyc.edu(伊恩耶克大学教员)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出序列KV压缩方法,通过概率前缀去重和预测delta编码,实现超越每向量香农极限的压缩,理论压缩比达914000倍。

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11544 2026-04-14 cs.CL cs.AI 62%

Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory

时间并非标签:连续相位旋转用于时间知识图谱与智能记忆

Weixian Waylon Li, Jiaxin Zhang, Xianan Jim Yang, Tiejun Ma, Yiwen Guo

机构 * University of Edinburgh(爱丁堡大学) LIGHTSPEED University of St Andrews(圣安德鲁斯大学) Independent Researcher(独立研究员)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RoMem模块,通过连续相位旋转技术解决时间信息在知识图谱中的表示问题,提升时间推理和记忆保持性能,实现状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08256 2026-04-13 cs.CL cs.AI 62%

HyperMem: Hypergraph Memory for Long-Term Conversations

HyperMem:用于长期对话的超图记忆

Juwei Yue, Chuanrui Hu, Jiawei Sheng, Zuyi Zhou, Wenyuan Zhang, Tingwen Liu, Li Guo, Yafeng Deng

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) EverMind AI

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 HyperMem通过超图结构建模高阶关联,提升长期对话中的记忆检索效率与准确性,实验表明其在LoCoMo基准上达到92.73%的LLM-as-a-judge准确率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07809 2026-04-10 cs.LG cs.AI 62%

PolicyLong: Towards On-Policy Context Extension

PolicyLong:迈向基于策略的上下文扩展

Junlong Jia, Ziyang Chen, Xing Wu, Chaochen Gao, TingHao Yu, Feng Zhang, Songlin Hu

机构 * Hunyuan Team, Tencent(腾讯混元团队) Chinese Academy of Sciences(中国科学院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 PolicyLong通过动态在线策略方法解决LLM上下文扩展中的数据稀缺问题,通过迭代重新执行数据筛选,确保训练分布与模型能力同步,提升长上下文性能。

Comments Work in progress. Correspondence to ucaswu@tencent.com or wuxing@iie.ac.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06845 2026-04-09 cs.CL cs.AI 62%

HingeMem: Boundary Guided Long-Term Memory with Query Adaptive Retrieval for Scalable Dialogues

HingeMem: 基于边界的长期记忆与查询自适应检索用于可扩展对话

Yijie Zhong, Yunfan Gao, Haofen Wang

机构 * College of Design and Innovation, Tongji University(同济大学设计创意学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 HingeMem通过边界引导的长期记忆和查询自适应检索,提升对话系统在多轮交互中的记忆效率与适应性,实验表明在不同规模的LLM上实现20%的性能提升并降低计算成本。

Comments Accepted by TheWebConf 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06070 2026-04-08 cs.CL cs.LG 62%

Short Data, Long Context: Distilling Positional Knowledge in Transformers

短数据,长上下文:在Transformer中蒸馏位置知识

Patrick Huber, Ernie Chang, Chinnadhurai Sankar, Rylan Conway, Igor Fedorov, Md Rifat Arefin, Adithya Sagar

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过基于logit的知识蒸馏,在不使用长上下文预训练的情况下,实现了长上下文检索能力的转移,揭示了位置信息在模型中的传播机制及参数更新模式。

详情

展开后加载摘要…

URL PDF HTML 收藏