arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4760 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4760 篇

2605.30169 2026-07-07 cs.CY cs.AI cs.MA 版本更新 83%

Dissociative Identity: Language Model Agents Lack Grounding for Reputation Mechanisms

分离性身份:语言模型代理缺乏声誉机制的基础

Botao Amber Hu, Helena Rong, Max Van Kleek

机构 * University of Oxford(牛津大学) New York University Shanghai(纽约大学上海分校)

专题命中 长上下文与记忆 :language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文指出语言模型代理因本体上的分离性(模块可替换、身份流动)而无法满足声誉机制所需的身份持续性、行为可预测性和制裁敏感性,从而提出转向基于可观察性、事前、构成性、协议的行为约束。

Comments Accepted by FaccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07663 2026-07-03 cs.LG 83%

SAGE: Sign-Adaptive Gradient for Memory-Efficient LLM Optimization

SAGE:用于内存高效大语言模型优化的符号自适应梯度

Wooin Lee, Hyun-Tae Kim

机构 * London, United Kingdom(英国伦敦) Seoul, Republic of Korea(韩国首尔)

专题命中 长上下文与记忆 :LLM(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出SAGE优化器,通过结合Lion风格的更新方向和新的内存高效O(d)自适应缩放,解决嵌入层稀疏高方差梯度问题,实现更稳定的收敛并提升性能。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26403 2026-06-26 cs.CL 新提交 83%

ProfileFoundry: A Synthetic Person-Object Substrate for Privacy, Memory, and Tool-Use Evaluation in LLM Agent

ProfileFoundry: 用于LLM智能体隐私、记忆和工具使用评估的合成人物-对象基底

Sriram Selvam, Anneswa Ghosh

机构 * NVIDIA Corporation(英伟达公司)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL

AI总结 提出ProfileFoundry,一个确定性生成器,发布10万个合成成人人物对象,包含快照、家庭、雇主等字段及事件、关系边,用于下游基础模型评估中的记忆、隐私等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25115 2026-06-25 cs.LG cs.NI 新提交 83%

Forget to Improve: On-Device LLM-Agent Continual Learning via Budget-Curated Memory

遗忘以改进:通过预算策划内存的设备端LLM智能体持续学习

Beining Wu, Zihao Ding, Jun Huang, Yanxiao Zhao

机构 * Apple(苹果) Google(谷歌) Microsoft(微软) Meta Alibaba(阿里巴巴)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.LG

AI总结 提出净价值每字节评分机制,在设备端智能体内存中权衡价值与危害,实现预算约束下的记忆保留、共享与信任决策,降低内存和上行带宽并防御注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10537 2026-06-10 cs.CL 新提交 83%

Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models

Prefilling-dLLM: 扩散语言模型中长上下文推理的预测性预填充

Jing Xiong, Qi Han, Shansan Gong, Yunta Hsieh, Chengyue Wu, Chaofan Tao, Chenyang Zhao, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) LMSYS Org(LMSYS组织)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 针对扩散语言模型在长上下文中因重复编码前缀导致计算量二次增长的问题,提出Prefilling-dLLM框架,通过分块缓存KV表示并基于稀疏性选择相关块,实现高效解码,在LongBench等基准上达到最先进加速效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16392 2026-06-03 cs.AI 83%

RGMem: Renormalization Group-inspired Memory Evolution for Language Agents

RGMem:基于重正化群启发的语言智能体记忆演化

Ao Tian, Yunfeng Lu, Xinxin Fan, Changhao Wang, Lanzhi Zhou, Yeyao Zhang, Yanfang Liu

机构 * School of Computer Science Engineering, Beihang University, Beijing, China School of Reliability Systems Engineering, Beihang University, Beijing, China State Key Laboratory of Complex \& Critical Software Environment National Key Laboratory of Reliability State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences

专题命中 长上下文与记忆 :language agent(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出RGMem框架,利用重正化群思想对长期对话记忆进行多尺度粗粒化、阈值更新和重缩放,实现从事实到用户偏好的层次化整合,在LOCOMO和PersonaMem基准上超越现有记忆系统。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26778 2026-05-27 cs.AI 83%

The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context

归因盲点:检测语言模型何时依赖记忆而非检索到的上下文

Zhe Yu, Wenpeng Xing, Yunzhao Wei, Bo Yang, Chen Ye, Gaolei Li, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) National Fintech Evaluation Center(国家金融科技评估中心) Hangzhou Dianzi University(杭州电子科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出计算现实监控(CRM)方法,通过比较有无上下文时的内部表征差异,检测语言模型是否依赖预训练记忆而非检索到的上下文进行生成,解决了输出级监控无法识别的归因盲点问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11378 2026-04-14 cs.AI cs.SY eess.SY 83%

From Agent Loops to Structured Graphs:A Scheduler-Theoretic Framework for LLM Agent Execution

从代理循环到结构化图:一个用于LLM代理执行的调度理论框架

Hu Wei

专题命中 长上下文与记忆 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SGH框架,通过将控制流显式化为静态DAG,解决代理循环的隐式依赖、无限恢复循环和调试困难问题,同时分析可控性、表达性和可实现性之间的权衡。

Comments 51 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15313 2026-04-13 cs.CL 83%

Mnemis: Dual-Route Retrieval on Hierarchical Graphs for Long-Term LLM Memory

Mnemis:基于分层图的双路检索用于长期LLM记忆

Zihao Tang, Xin Yu, Ziyu Xiao, Zengxuan Wen, Zelin Li, Jiaxi Zhou, Hualei Wang, Haohua Wang, Haizhen Huang, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Microsoft(微软)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Mnemis提出一种结合系统1相似性搜索和系统2全局选择机制的新型记忆框架,通过分层图实现语义层次的自顶向下检索,提升长期记忆检索性能。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04250 2026-04-07 cs.CL 83%

CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling

CAWN:连续声波网络用于自回归语言建模

Dejan Čugalj, Aleksandar Jevremovic

机构 * Singidunum University(辛吉杜努姆大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 CAWN提出一种连续序列混合架构,通过相位累积机制实现序列混合,结合选择性相位共振机制和深度谐波卷积,提升超长上下文处理能力,实验证明其在词汇获取和上下文去噪方面的优越性。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18052 2026-04-07 cs.CL cs.CY 83%

The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies

PIMMUR 原则:确保 LLM 社会集体行为的有效性

Jiaxu Zhou, Jen-tse Huang, Xuhui Zhou, Man Ho Lam, Xintao Wang, Hao Zhu, Wenxuan Wang, Maarten Sap

机构 * Chinese University of Hong Kong(香港中文大学) Johns Hopkins University(约翰斯·霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学) Stanford University(斯坦福大学) Renmin University of China(中国人民大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过审计39项研究,识别出六个普遍缺陷,指出89.7%的研究违反至少一个原则,导致模拟有效性受损。通过复现实验发现,当遵循PIMMUR原则时,报告的集体现象往往消失或反转,表明许多'涌现'行为可能是方法学伪影而非真实社会动态。

Comments 13 pages, 9 figures, 3 tables; add more papers in our systematic audit (39 in total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02734 2026-04-06 cs.AI 83%

Aligning Progress and Feasibility: A Neuro-Symbolic Dual Memory Framework for Long-Horizon LLM Agents

对齐进展与可行性:一种神经符号双记忆框架用于长周期LLM智能体

Bin Wen, Ruoxuan Zhang, Yang Chen, Hongxia Xie, Lan-Zhe Guo

机构 * Nanjing University(南京大学) Jilin University(吉林大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出神经符号双记忆框架,通过分离语义进展指导与逻辑可行性验证,解决长周期任务中进展漂移与可行性违反问题,实验显示在ALFWorld、WebShop和TextCraft上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00344 2026-04-02 cs.CL stat.AP 83%

Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning

Agent Q-Mix: 通过强化学习选择LLM多智能体系统的合适动作

Eric Hanchen Jiang, Levina Li, Rui Sun, Xiao Liang, Yubei Li, Yuchen Wu, Haozheng Luo, Hengli Li, Zhi Zhang, Zhaolu Kang, Kai-Wei Chang, Ying Nian Wu

机构 * University of California Los Angeles(加州大学洛杉矶分校) University of Washington(华盛顿大学) Northwestern University(西北大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Agent Q-Mix框架,通过强化学习解决多智能体系统中拓扑选择问题,实现去中心化通信决策,提升任务准确率与token效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18489 2026-03-20 cs.CL 83%

EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models

EntropyCache: 基于解码令牌熵的KV缓存用于扩散语言模型

Minsoo Cheong, Donghyun Son, Woosang Lim, Sungjoo Yoo

机构 * Seoul National University(首尔国立大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 EntropyCache利用解码令牌熵指导KV缓存,通过最大熵信号决定是否重新计算,实现高效缓存更新,提升推理速度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18480 2026-03-20 cs.CV cs.AI cs.HC 83%

Do Vision Language Models Understand Human Engagement in Games?

视觉语言模型是否能理解游戏中的玩家参与度?

Ziyi Wang, Qizan Guo, Rishitosh Singh, Xiyang Hu

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 长上下文与记忆 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究评估了三种视觉语言模型在不同提示策略下的表现,发现零样本预测效果差,而基于理论的提示策略难以有效提升参与度预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17781 2026-03-19 cs.AI 83%

Facts as First Class Objects: Knowledge Objects for Persistent LLM Memory

事实作为一等对象:用于持久LLM记忆的知识对象

Oliver Zahn, Simran Chana

机构 * Independent Researcher(独立研究者) University of Cambridge(剑桥大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出知识对象(KOs)作为持久LLM记忆的解决方案,通过对比上下文记忆和KOs,在多跳推理中KOs表现更优,且能有效应对容量限制、压缩损失和目标漂移等挑战。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06922 2026-03-17 cs.LG 83%

NerVE: Nonlinear Eigenspectrum Dynamics in LLM Feed-Forward Networks

NerVE:大型语言模型中前馈网络的非线性特征谱动态

Nandan Kumar Jha, Brandon Reagen

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 NerVE通过四个互补指标分析LLM中FFN的信息流动,揭示非线性特性对潜在空间利用的影响,验证了优化器几何对方差再注入的作用,适用于多种架构和优化器配置。

Comments Accepted to ICLR 2026. Project page: https://nerve-eigenspectrum.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23863 2026-03-16 cs.CL 83%

SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models

SPELL: 自我扮演强化学习用于进化长上下文语言模型

Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang

机构 * Sun Yat-sen University(中山大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出SPELL框架,通过自我扮演问答和验证角色实现长上下文推理的无监督优化,实验显示其在多个基准上优于传统微调方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19239 2026-02-24 stat.ML cs.LG 83%

Attention Deficits in Language Models: Causal Explanations for Procedural Hallucinations

语言模型中的注意力缺陷:对程序性幻觉的因果解释

Ahmed Karim, Fatima Sheaib, Zein Khamis, Maggie Chlon, Jad Awada, Leon Chlon

机构 * Hassana Labs(Hassana 实验室) University of Oxford(牛津大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 语言模型在执行复杂流程时出现程序性幻觉,研究发现其源于回答模式未激活或候选选择偏差,通过干预可显著提升远距离绑定准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15311 2026-02-18 cs.AI 83%

Aeon: High-Performance Neuro-Symbolic Memory Management for Long-Horizon LLM Agents

Aeon: 高性能神经符号记忆管理用于长时域大语言模型智能体

Mustafa Arslan

机构 * Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Aeon通过神经符号认知操作系统优化长时域大语言模型的记忆管理,实现高效内存压缩和加速,提升推理性能与稳定性。

Comments v3: Production hardening. Added INT8 quantization (5.6x dot product speedup, 3.1x compression), crash recovery via decoupled WAL (<1% overhead), unlimited text storage via sidecar blob arena with generational GC, and epoch-based reclamation for lock-free reads (P99 750ns under 16-thread contention). Revised for systems engineering clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02744 2026-02-17 cs.CL 83%

SYNAPSE: Empowering LLM Agents with Episodic-Semantic Memory via Spreading Activation

SYNAPSE:通过扩散激活实现LLM代理的片段语义记忆

Hanqi Jiang, Junhao Chen, Yi Pan, Ling Chen, Weihang You, Yifan Zhou, Ruidong Zhang, Andrea Sikora, Lin Zhao, Yohannes Abate, Tianming Liu

机构 * School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Biosystems Engineering and Soil Science, University of Tennessee(田纳西大学生物系统工程与土壤科学系) Department of Biomedical Informatics, University of Colorado School of Medicine(科罗拉多医学院生物医学信息学系) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) Department of Physics and Astronomy, The University of Georgia(佐治亚大学物理与天文学系)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SYNAPSE通过动态图与扩散激活机制,提升LLM在复杂时间序列和多跳推理任务中的性能,解决上下文隧道问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13783 2026-02-17 cs.LG 83%

MEMTS: Internalizing Domain Knowledge via Parameterized Memory for Retrieval-Free Domain Adaptation of Time Series Foundation Models

MEMTS: 通过参数化内存内化领域知识以实现时间序列基础模型的无检索领域适应

Xiaoyun Yu, Li fan, Xiangfei Qiu, Nanqing Dong, Yonggui Huang, Honggang Qi, Geguang Pu, Wanli Ouyang, Xi Chen, Jilin Hu

机构 * East China Normal University(东华师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 MEMTS通过参数化内存内化领域知识,实现时间序列基础模型的无检索领域适应,提升实时流处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12108 2026-02-13 cs.AI 83%

The Pensieve Paradigm: Stateful Language Models Mastering Their Own Context

Pensieve范式:具备状态的语言模型掌握自身上下文

Xiaoyuan Liu, Tian Liang, Dongyang Ma, Deyu Zhou, Haitao Mi, Pinjia He, Yan Wang

机构 * Tencent AI Lab(腾讯人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 长上下文与记忆 :language model(title);LLM(abstract);foundation model(abstract);分类 cs.AI

AI总结 StateLM 通过内部推理循环和记忆工具,使语言模型具备状态管理能力,从而在长文档问答、聊天记忆和深度研究任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11598 2026-02-13 cs.RO cs.AI cs.CV 83%

ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

ABot-N0:关于VLA基础模型在多功能具身导航中的技术报告

Zedong Chu, Shichao Xie, Xiaolong Wu, Yanfen Shen, Minghua Luo, Zhengbo Wang, Fei Liu, Xiaoxu Leng, Junjun Hu, Mingyang Yin, Jia Lu, Yingnan Guo, Kai Yang, Jiawei Han, Xu Chen, Yanqing Zhu, Yuxiang Zhao, Xin Liu, Yirong Yang, Ye He, Jiahang Wang, Yang Cai, Tianlin Zhang, Li Gao, Liu Liu, Mingchao Sun, Fan Jiang, Chiyu Wang, Zhicheng Liu, Hongyu Pan, Honglin Han, Zhining Gu, Kuan Yang, Jianfang Zhang, Di Jing, Zihao Guan, Wei Guo, Guoqing Liu, Di Yang, Xiangpo Yang, Menglin Yang, Hongguang Xing, Weiguo Li, Mu Xu

专题命中 长上下文与记忆 :foundation model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 ABot-N0通过统一的VLA基础模型实现多功能具身导航,结合认知大脑与动作专家架构,在多个基准测试中超越专用模型,支持动态环境中的长周期任务。

Comments Project Page: https://amap-cvlab.github.io/ABot-Navigation/ABot-N0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07398 2026-02-10 cs.CR cs.AI 83%

AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management

AgentSys: 通过显式分层内存管理实现安全且动态的LLM代理

Ruoyao Wen, Hao Li, Chaowei Xiao, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 长上下文与记忆 :LLM(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 AgentSys通过显式分层内存管理有效防御间接提示注入攻击,显著降低攻击成功率并提升LLM代理的安全性和动态性。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04355 2026-02-05 cs.CL 83%

Can Vision Replace Text in Working Memory? Evidence from Spatial n-Back in Vision-Language Models

视觉能否取代文本在工作记忆中的作用?来自视觉-语言模型中空间n-Back任务的证据

Sichu Liang, Hongyu Zhu, Wenwen Wang, Deyu Zhou

机构 * Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究通过空间n-Back任务评估视觉-语言模型中视觉与文本对工作记忆的影响,发现文本条件下的表现优于视觉条件,揭示了视觉信息处理中的计算差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11129 2026-02-04 cs.CV cs.AI 83%

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

视频-SALMONN S:内存增强的流式音频视觉大语言模型

Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 视频-SALMONN S通过引入测试时训练机制,实现高效流式视频理解,显著提升长视频任务的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01215 2026-02-03 cs.SE cs.AI 83%

Correctness isnt Efficiency: Runtime Memory Divergence in LLM-Generated Code

正确性不等于效率:LLM生成代码的运行时内存分歧

Prateek Rajput, Yewei Song, Abdoul Aziz Bonkoungou, Iyiola E. Olatunji, Abdoul Kader Kabore, Jacques Klein, Tegawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现LLM生成代码在运行时存在内存稳定性差异,提出DMPD方法评估不同解的稳定性,实验显示正确解间存在显著运行时分歧,且稳定性与软件工程指标相关,支持在CI/CD中选择稳定解以降低风险。

Comments 11 Pages, 11 figures, Accepted at ICSE SEIP, typo fixed for first author the "of" was missing in University of Luxembourg

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24067 2026-01-08 cs.LG 83%

TransMamba: A Sequence-Level Hybrid Transformer-Mamba Language Model

TransMamba: 一种序列级混合Transformer-Mamba语言模型

Yixing Li, Ruobing Xie, Zhen Yang, Xingwu Sun, Shuaipeng Li, Weidong Han, Zhanhui Kang, Yu Cheng, Chengzhong Xu, Di Wang, Jie Jiang

机构 * Tencent Hunyuan(腾讯文英) The Chinese University of Hong Kong(香港中文大学) University of Macau(澳门大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 TransMamba通过共享参数矩阵统一Transformer和Mamba,实现序列级动态切换注意力与SSM机制,提升训练效率和性能。

Comments Accepted by AAAI 2026. Code: https://github.com/Yixing-Li/TransMamba

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10547 2025-12-12 cs.LG 83%

Unlocking the Address Book: Dissecting the Sparse Semantic Structure of LLM Key-Value Caches via Sparse Autoencoders

解开地址簿:通过稀疏自编码器解剖LLM键值缓存的稀疏语义结构

Qingsen Ma, Dianyun Wang, Jiaming Lyu, Yaoye Wang, Lechen Ning, Sujie Zhu, Zhenbo Xu, Liuyu Xiang, Huining Li, Huijia Wu, Zhaofeng He

机构 * Beijing University of Posts(北京邮电大学) Baidu Inc.(百度公司)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出STA-Attention框架,通过Top-K稀疏自编码器解剖LLM键值缓存的稀疏语义结构,实现可解释的语义原子分解,提升模型的可解释性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏