arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4779 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4779 篇

2605.10923 2026-05-19 cs.LG cs.CL 73%

Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning

动态技能生命周期管理用于代理强化学习

Junhao Shen, Teng Zhang, Xiaoyan Zhao, Hong Cheng

机构 * Database Group, The Chinese University of Hong Kong(香港中文大学数据库组) Lanzhou University(兰州大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SLIM框架,通过动态优化变量管理代理强化学习中的外部技能集,提升任务性能。

Comments Implementation code is available at https://github.com/ejhshen/SLIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13957 2026-05-19 cs.CL cs.AI 73%

Supervising the search process produces reliable and generalizable information-seeking agents

通过监督搜索过程产生可靠且可推广的信息寻求代理

Guangzhi Xiong, Qiao Jin, Xiao Wang, Yin Fang, Haolin Liu, Yifan Yang, Fangyuan Chen, Zhixing Song, Dengyu Wang, Minjia Zhang, Zhiyong Lu, Aidong Zhang

机构 * Department of Computer Science, University of Virginia, USA(弗吉尼亚大学计算机科学系) National Library of Medicine, National Institutes of Health, USA(美国国立卫生研究院国家医学图书馆) Department of Computer Science, University of Illinois Urbana–Champaign, USA(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Medical Oncology, Dana–Farber Cancer Institute, USA(达纳-法伯癌症研究所医学肿瘤科) Surgery, University of Alabama at Birmingham, USA(阿拉巴马大学伯明翰分校外科系) Department of Neurology, Yale School of Medicine, USA(耶鲁医学院神经病学系)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过监督搜索过程来构建更可靠且可推广的信息寻求代理,通过RAG-Gym框架系统研究了架构设计、参数优化和动作评估,发现推理反思是关键能力,Re$^2$Search++在多跳信息检索基准上取得显著提升,尤其在领域外任务中表现更优。

Comments Homepage: https://rag-gym.github.io; Code: https://github.com/RAG-Gym/RAG-Gym

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12636 2026-05-18 cs.DC cs.AI cs.LG cs.PF 73%

TrainMover: An Interruption-Resilient Runtime for ML Training

TrainMover: 一种具有中断容错能力的机器学习训练运行时

ChonLam Lao, Jiaqi Gao, Jiamin Cao, Zhipeng Zhang, Pengcheng Zhang, Jiangfei Duan, Zhilong Zheng, Yu Guan, Yichi Xu, Yong Li, Zhengping Qian, Aditya Akella, Minlan Yu, Ennan Zhai, Dennis Cai, Jingren Zhou

机构 * Harvard University(哈佛大学) Alibaba Group(阿里巴巴集团) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 TrainMover通过弹性与备用机器处理中断,实现最小停机时间和零内存开销,减少GPU浪费时间达55%。

Comments 14 pages body, 19 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13805 2026-05-18 cs.CV cs.AI cs.LG 73%

RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition

RAR:用于视觉识别的检索与排序增强多模态大语言模型

Ziyu Liu, Zeyi Sun, Yuhang Zang, Wei Li, Pan Zhang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) MThreads, Inc.(MThreads公司) Nanyang Technological University(南洋理工大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RAR结合CLIP的检索与MLLM的排序,提升细粒度识别精度,增强少样本和零样本任务表现。

Comments Project: https://github.com/Liuziyu77/RAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21496 2026-05-14 cs.AI cs.CL cs.CY 73%

How English Print Media Frames Human-Elephant Conflicts in India

印度人类-大象冲突在英语印刷媒体中的框架分析

Bonala Sai Punith, Salveru Jayati, Garima Shakya, Shubham Kumar Nigam

机构 * Chhattisgarh Forest Department(恰特里什加尔森林部门)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过大规模计算分析研究印度人类-大象冲突在英语媒体中的报道框架,揭示了恐惧和攻击性语言的主导地位,并提出透明可扩展的方法以促进负责任的野生动物报道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08317 2026-05-12 cs.LG cs.AI 73%

RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache

RDKV: 用于联合擦除和量化KV缓存的率-失真位分配

Junkai Zhang, Hang Guo, Luca Benini, Yawei Li

机构 * ETH Zurich(苏黎世联邦理工学院) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RDKV通过联合优化擦除与量化,提升长序列推理效率,实现9.1%的性能提升和97.81%的准确率恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06920 2026-05-11 cs.GT cs.AI cs.LG 73%

In-Context Credit Assignment via the Core

通过核心进行上下文内信用分配

Keegan Harris, Siddharth Prasad, Asher Trockman

机构 * UC Berkeley(伯克利大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Google Research(谷歌研究)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出了一种激励对齐的上下文内信用分配机制,基于合作博弈理论中的核心解概念,通过算法近似核心解来稳定分配价值,实验显示其在网页检索任务中效率显著高于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06611 2026-05-08 cs.LG cs.AI stat.ML 73%

The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity

注意力陷阱的结构起源:方差差异、超级神经元和维度不均等

Siquan Li, Kaiqi Jiang, Jiacheng Sun, Tianyang Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Foundation Model Department(华为基础模型部门)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文揭示了大语言模型中注意力陷阱现象的结构成因,通过分析自注意力机制中的方差差异和前馈网络中超级神经元的激活,证明了维度不均等导致注意力陷阱的形成,并提出head-wise RMSNorm架构改进以稳定值聚合。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03482 2026-05-08 cs.CR cs.AI cs.LG 73%

MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents

MEMSAD: 基于梯度耦合的内存污染异常检测用于检索增强型智能体

Ishrith Gowda

机构 * Department of Electrical Engineering and Computer Sciences(电气工程与计算机科学系) University of California, Berkeley(加州大学伯克利分校) Berkeley AI Research(伯克利人工智能研究)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出MEMSAD,通过梯度耦合定理实现内存污染攻击的检测,证明其在对抗策略下的正确分类保证,并通过实验验证复合防御在所有攻击下的高检测率和低误报率。

Comments 28 pages, 9 figures, 6 theorems. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14724 2026-05-08 cs.CV cs.AI cs.CL 73%

HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding

HERMES: KV缓存作为分层内存用于高效视频流理解

Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HERMES提出一种无需训练的架构,通过将KV缓存视为分层内存框架,实现视频流的实时准确理解,提升处理速度并降低内存消耗。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11144 2026-05-05 cs.AI cs.CL 73%

$How^{2}$: How to learn from procedural How-to questions

$How^{2}$: 如何从过程性如何问题中学习

Gautier Dagan, Frank Keller, Alex Lascarides

机构 * University of Edinburgh(爱丁堡大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出$How^{2}$框架,使智能体能提问、存储并复用如何问题答案,提升长期学习能力。在Plancraft环境中,抽象化答案对任务完成更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00789 2026-05-04 cs.CV cs.AI cs.LG 73%

Make Your LVLM KV Cache More Lightweight

使大型视觉-语言模型的KV缓存更轻量

Xihao Chen, Yangyang Guo, Roger Zimmermann

机构 * Integrative Sciences and Engineering Programme, National University of Singapore(国立新加坡大学整合科学与工程学程) School of Computing, National University of Singapore(国立新加坡大学计算机学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LightKV方法,通过利用视觉token嵌入的冗余性,减少KV缓存大小,提升解码效率并降低GPU内存消耗。

Comments Accepted to Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10702 2026-05-01 cs.CL cs.AI cs.IR 73%

Grounding Agent Memory in Contextual Intent

在上下文意图中 grounding 代理记忆

Ruozhen Yang, Yucheng Jiang, Yueqi Jiang, Priyanka Kargupta, Yunyi Zhang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 STITCH通过上下文意图索引提升长周期交互的记忆检索能力,有效减少歧义和干扰,实现在动态目标轨迹中的高效检索。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02845 2026-05-01 cs.CL cs.AI 73%

TiMem: Temporal-Hierarchical Memory Consolidation for Long-Horizon Conversational Agents

TiMem:用于长时域对话代理的时序-层次记忆巩固

Kai Li, Xuanqing Yu, Ziyi Ni, Yi Zeng, Yao Xu, Zheqing Zhang, Xin Li, Jitao Sang, Xiaogang Duan, Xuelei Wang, Chengbao Liu, Jie Tan

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) AI Lab, AIGility Cloud Innovation(AIGility云创新AI实验室) North China Electric Power University(华北电力大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Gaoling School of Artificial Intelligence, RUC(中国人民大学高陵人工智能学院) School of Biomedical Engineering, USTC(中国科学技术大学生物医学工程学院) Suzhou Institute for Advance Research, USTC(中国科学技术大学苏州市先进研究院) School of Computer Science and Technology, BJTU(北京理工大学计算机科学与技术学院) Hunan Central South Intelligent Equipment Co., Ltd.(湖南中南智能装备有限公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TiMem通过时序记忆树实现对话记忆的系统性巩固,提升长时域个性化效果,实现75.30%和76.88%的基准测试准确率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26243 2026-04-30 cs.CL cs.AI 73%

StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall

StratMem-Bench:评估虚拟角色对话中的战略记忆使用超越事实回忆

Yerong Wu, Tianxing Wu, Minghao Zhu, Hangyu Sha, Haofen Wang

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Key Laboratory of New Generation Artificial Intelligence Technology and its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室(东南大学),中华人民共和国教育部,中国) College of Design and Innovation, Tongji University, China(同济大学设计与创新学院,中国)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 StratMem-Bench旨在评估虚拟角色对话中战略记忆的使用,通过异构记忆池测试角色在不同记忆类型间的决策能力,提出多种评估指标以衡量记忆整合与利用效果。

Comments 20 pages, accepted by ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24809 2026-04-29 cs.LG cs.AI 73%

Nautile-370M: Spectral Memory Meets Attention in a Small Reasoning Model

Nautile-370M:在小推理模型中融合频谱记忆与注意力

Maixent Chenebaux

专题命中 长上下文与记忆 :language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 Nautile-370M是一款3.7亿参数的小语言模型,通过融合频谱记忆与注意力机制,在有限参数和推理预算下实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13847 2026-04-27 cs.LG cs.AI 73%

SparseBalance: Load-Balanced Long Context Training with Dynamic Sparse Attention

SparseBalance: 基于动态稀疏注意力的负载平衡长上下文训练

Hongtao Xu, Jianchao Tan, Yuxuan Hu, Pengju Lu, Hongyu Wang, Pingwei Sun, Yerui Sun, Yuchen Xie, Xunliang Cai, Mingzhen Li, Weile Jia

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出SparseBalance算法系统协同设计框架,通过动态稀疏调整和稀疏感知批处理策略,解决长上下文训练中的负载不平衡问题,提升模型精度与系统效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20487 2026-04-24 cs.CL cs.AI 73%

Knowledge Capsules: Structured Nonparametric Memory Units for LLMs

知识胶囊:用于大语言模型的结构非参数记忆单元

Bin Ju, Shenfeng Weng, Danying Zhou, Rongkai Xu, Kunkai Su

机构 * Zhejiang Angel Medical AI Technology Co., Ltd.(浙江天使医疗人工智能科技有限公司) Miti AI Technology Co., Ltd.(米蒂人工智能科技有限公司) China-Singapore Belt and Road Joint Laboratory on Translational Infection Biology for Diagnostics and Therapies(中英一带一路联合实验室(转化感染生物学诊断与治疗)) State Key Laboratory for Diagnosis and Treatment of Infectious Diseases(传染病诊断与治疗国家重点实验室) The First Affiliated Hospital(第一附属医院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出知识胶囊,一种结构化的非参数记忆单元,通过冻结基础模型直接从文档语料构建,采用外部键值注入框架提升外部知识在注意力计算中的参与度,提升长上下文和多跳推理的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18027 2026-04-22 cs.AI cs.CL 73%

Sentipolis: Emotion-Aware Agents for Social Simulations

Sentipolis:用于社交模拟的情感意识代理

Chiyuan Fu, Lyuhao Chen, Yunze Xiao, Weihao Xuan, Carlos Busso, Mona Diab

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Tokyo(东京大学) RIKEN AIP(日本研究机构AIP)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 Sentipolis通过整合持续性Pleasure-Arousal-Dominance表示、双速情感动态和情感-记忆耦合,提升社交模拟中情感驱动行为的连续性与沟通能力,其效果依赖于模型容量,且可能影响社交规范的遵守。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10306 2026-04-21 cs.AI cs.CL 73%

Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning

增强证据的策略优化用于长上下文推理

Xin Guan, Zijian Li, Shen Huang, Pengjun Xie, Jingren Zhou, Jiuxin Cao

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出EAPO方法,通过引入组相对证据奖励和适应性奖励-策略共演机制,提升长上下文推理中的证据提取质量,从而增强推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20626 2026-04-21 cs.AI cs.CL cs.CV cs.IR 73%

MegaRAG: Multimodal Knowledge Graph-Based Retrieval Augmented Generation

MegaRAG:基于多模态知识图谱的检索增强生成

Chi-Hsiang Hsiao, Yi-Cheng Wang, Tzung-Sheng Lin, Yi-Ren Yeh, Chu-Song Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与信息工程系) Department of Mathematics, National Kaohsiung Normal University(高雄师范大学数学系) FinTech Center, National Taiwan University(国立台湾大学金融科技中心) E.SUN Financial Holding Co., Ltd.(E.SUN财务公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MegaRAG通过引入多模态知识图谱,提升大语言模型在跨模态推理中的内容理解能力,在文本和多模态语料中均优于现有RAG方法。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17695 2026-04-21 cs.LG cs.CL 73%

MoE-nD: Per-Layer Mixture-of-Experts Routing for Multi-Axis KV Cache Compression

MoE-nD:多轴KV缓存压缩的分层专家路由

Libo Sun, Peixiong He, Po-Wei Harn, Xiao Qin

机构 * Department of Computer Science and Software Engineering, Auburn University, Auburn, AL, USA(计算机科学与软件工程系,阿伯拉罕大学,阿伯丁,阿拉巴马州,美国) Department of Information Management, National Central University, Taoyuan, Taiwan(信息管理系,国立中央大学,桃园,台湾)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出MoE-nD方法,通过分层专家路由实现多轴KV缓存压缩,优化每层的缓存策略以提升模型性能,实验表明其在多个基准测试中表现优异。

Comments 9 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14922 2026-04-17 cs.LG cs.CL 73%

LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

LongAct:利用内在激活模式促进长上下文强化学习

Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li, Junchi Yan, Baobao Chang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LongAct方法,通过利用长上下文推理中的稀疏结构,改进大语言模型的训练,提升长上下文处理能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14362 2026-04-17 cs.CL cs.AI cs.IR 73%

APEX-MEM: Agentic Semi-Structured Memory with Temporal Reasoning for Long-Term Conversational AI

APEX-MEM: 基于时序推理的代理半结构化记忆用于长期对话AI

Pratyay Banerjee, Masud Moshtaghi, Shivashankar Subramanian, Amita Misra, Ankit Chadha

机构 * Amazon(亚马逊)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 APEX-MEM通过结合属性图、只追加存储和多工具检索代理,解决大语言模型在长期对话记忆中的可靠性问题,实现88.88%的LOCOMO问答准确率和86.2%的LongMemEval表现。

Comments Accepted to ACL 2026 Mains

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17934 2026-04-14 cs.CL cs.AI 73%

AtlasKV: Augmenting LLMs with Billion-Scale Knowledge Graphs in 20GB VRAM

AtlasKV:在20GB VRAM中通过十亿级知识图谱增强大语言模型

Haoyu Huang, Hong Ting Tsang, Jiaxin Bai, Xi Peng, Gong Zhang, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学) Theory Lab, Huawei(华为理论实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AtlasKV,一种通过十亿级知识图谱增强大语言模型的方法,利用子线性时间与内存复杂度实现高效知识整合,无需外部检索模块或长上下文先验。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10426 2026-04-14 cs.CL cs.AI 73%

CodaRAG: Connecting the Dots with Associativity Inspired by Complementary Learning

CodaRAG: 通过互补学习启发的关联性连接点

Cheng-Yen Li, Xuanjun Chen, Claire Lin, Wei-Yu Chen, Wenhua Nie, Hung-Yi Lee, Jyh-Shing Roger Jang

机构 * National Taiwan University(国立台湾大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CodaRAG通过互补学习系统启发,提出了一种将碎片化信息整合为稳定记忆基础,通过多维路径遍历图结构,消除超关联噪声,提升检索和生成精度的框架。

Comments Preprint, Submitted to ACM TIST

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23516 2026-04-14 cs.CL cs.AI cs.IR 73%

MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens

MSA:内存稀疏注意力用于高效端到端内存模型扩展至100M标记

Yu Chen, Runkai Chen, Sheng Yi, Xinda Zhao, Xiaohong Li, Jianjin Zhang, Jun Sun, Chuanrui Hu, Yunyun Han, Lidong Bing, Yafeng Deng, Tianqiao Chen

机构 * Evermind Shanda Group(盛大集团) Peking University(北京大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MSA,一种高效的端到端可训练内存模型框架,通过可扩展稀疏注意力和文档级RoPE实现线性复杂度,支持从16K到100M标记的扩展,同时保持稳定性,且在100M标记推理中实现2xA800 GPU的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02967 2026-04-13 cs.LG cs.AI eess.SP 73%

AR-KAN: Autoregressive-Weight-Enhanced Kolmogorov-Arnold Network for Time Series Forecasting

AR-KAN:用于时间序列预测的自回归权重增强的科莫戈洛夫-阿诺尔德网络

Chen Zeng, Tiehang Xu, Qiao Wang

机构 * School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院) School of Economics and Management, Southeast University(东南大学经济管理学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AR-KAN,结合自回归模块和KAN,通过理论证明和实验验证,展示了其在时间序列预测中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05248 2026-04-08 cs.LG cs.CL 73%

Improving Sparse Memory Finetuning

改进稀疏记忆微调

Satyam Goyal, Anirudh Kanchi, Garv Shah, Prakhar Gupta

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出稀疏记忆微调方法,通过局部更新显式内存层参数,解决持续学习中的灾难性遗忘问题,并在消费级硬件上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01002 2026-04-02 cs.CV cs.AI cs.LG 73%

Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding

基于证据的关键帧采样用于基于MLLM的长视频理解

Yiheng Wang, Lichen Zhu, Yueqian Lin, Yudong Liu, Jingyang Zhang, Hai "Helen" Li, Yiran Chen

机构 * Duke University(杜克大学) Independent Researcher(独立研究员)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于信息瓶颈理论的证据驱动关键帧采样框架,通过最大化选帧与查询的条件互信息,提升长视频理解性能,实验表明在严格token预算下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏