arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4779 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4779 篇

2505.00570 2026-01-30 cs.CL cs.AI 73%

FreqKV: Key-Value Compression in Frequency Domain for Context Window Extension

FreqKV: 频域中的键值压缩用于上下文窗口扩展

Jushi Kai, Yixuan Wang, Boyi Zeng, Haoli Bai, Bo Jiang, Ziwei He, Zhouhan Lin

机构 * LUMIA Lab, Shanghai Jiao Tong University(上海交通大学LUMIA实验室) Huawei Noah’s Ark Lab(华为诺亚实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FreqKV通过频域键值压缩技术,实现长上下文处理,使LLaMA-2-7B的上下文窗口扩展至256K个令牌,同时保持稳定的困惑度。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22716 2026-01-30 cs.AI cs.CV cs.LG 73%

Memento 2: Learning by Stateful Reflective Memory

Memento 2: 通过状态化反思记忆进行学习

Jun Wang

机构 * UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Memento 2通过状态化反思记忆机制,实现无需参数更新的持续学习,提升代理在开放任务中的泛化能力。

Comments 35 pages, four figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18771 2026-01-27 cs.CL cs.AI cs.IR 73%

Dep-Search: Learning Dependency-Aware Reasoning Traces with Persistent Memory

Dep-Search: 基于持久记忆的学习依赖意识推理轨迹

Yanming Liu, Xinyue Peng, Zixuan Yan, Yanxin Shen, Wenjie Xu, Yuefeng Huang, Xinyi Wang, Jiannan Cao, Jianwei Yin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Intel Corporation(英特尔公司) Tsinghua University(清华大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Dep-Search 通过 GRPO 集成结构化推理、检索和持久记忆,提升 LLM 处理复杂多跳推理任务的能力。

Comments Dep-Search 1st version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16781 2026-01-27 cs.CL cs.LG 73%

Persuasion Tokens for Editing Factual Knowledge in LLMs

说服令牌用于编辑大语言模型中的事实知识

Paul Youssef, Christin Seifert, Jörg Schlötterer

机构 * Marburg University(马尔堡大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出说服令牌技术,通过训练特殊令牌实现高效的大语言模型事实知识编辑,无需依赖长演示,且在多个数据集和模型上表现优异。

Comments Accepted at EACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16032 2026-01-27 cs.PF cs.AI cs.LG cs.OS 73%

Sawtooth Wavefront Reordering: Enhanced CuTile FlashAttention on NVIDIA GB10

锯齿波前重排:增强的CuTile FlashAttention on NVIDIA GB10

Yifan Zhu, Yekai Pan, Chen Ding

机构 * University of Rochester(罗切斯特大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出锯齿波前重排技术,通过减少L2缓存缺失提升CuTile FlashAttention在NVIDIA GB10上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15609 2026-01-27 cs.LG cs.CL 73%

When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards

当锐化变成崩溃:可验证奖励强化学习中的采样偏差与语义耦合

Mingyuan Fan, Weiguang Han, Daixin Wang, Cen Chen, Zhiqiang Zhang, Jun Zhou

机构 * School of Data Science\&Engineering, East China Normal University(数据科学与工程学院,东华大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了可验证奖励强化学习中的采样偏差与语义耦合问题,提出逆成功优势校准和分布级校准方法以提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05903 2026-01-27 cs.CY cs.AI cs.CL cs.HC 73%

The Imperfect Learner: Incorporating Developmental Trajectories in Memory-based Student Simulation

不完美的学习者:在基于记忆的学生模拟中纳入发展轨迹

Zhengyuan Liu, Stella Xin Yin, Bryan Chen Zhengyu Tan, Roy Ka-Wei Lee, Guimei Liu, Dion Hoe-Lian Goh, Wenya Wang, Nancy F. Chen

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于记忆的学生模拟框架,通过分层记忆机制和结构化知识表示,整合发展轨迹和元认知过程,以更准确地模拟学习者的知识发展和学习困难。

Comments Fixed some grammar and format issues. Added some experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06037 2026-01-23 cs.CL cs.AI cs.CV 73%

TeleMem: Building Long-Term and Multimodal Memory for Agentic AI

TeleMem: 构建面向代理AI的长期和多模态记忆

Chunliang Chen, Ming Guan, Xiao Lin, Jiaxu Li, Luxi Lin, Qiyi Wang, Xiangyu Chen, Jixiang Luo, Changzhi Sun, Dell Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TeleMem通过统一的长期和多模态记忆系统,提升代理AI在长对话和多模态任务中的表现,实现更高的准确率、更低的令牌使用和更快的操作速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13722 2026-01-21 cs.CL cs.AI 73%

OP-Bench: Benchmarking Over-Personalization for Memory-Augmented Personalized Conversational Agents

OP-Bench:用于内存增强个性化对话代理的过个性化基准测试

Yulin Hu, Zimo Long, Jiahe Guo, Xingyu Sui, Xing Fu, Weixiang Zhao, Yanyan Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OP-Bench通过评估多种模型和方法,揭示了内存增强对话代理中过个性化问题的普遍性,并提出Self-ReCheck机制以缓解该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10798 2026-01-16 cs.CL cs.AI 73%

Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction

Judge Q: 用于优化KV缓存淘汰信息保留的可训练查询

Yijun Liu, Yixuan Wang, Yuzhuang Xu, Shiyu Ji, Yang Xu, Qingfu Zhu, Wanxiang Che

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Judge Q通过引入软令牌列表,优化KV缓存淘汰中的信息保留,提升解码质量与性能表现。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00056 2026-01-15 cs.LG cs.AI 73%

MISA: Memory-Efficient LLMs Optimization with Module-wise Importance Sampling

MISA: 通过模块级重要性采样实现内存高效的LLM优化

Yuxi Liu, Renjia Deng, Yutong He, Xue Wang, Tao Yao, Kun Yuan

机构 * Peking University(北京大学) Alibaba DAMO Academy(阿里巴巴达摩院) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MISA通过模块级重要性采样优化LLM,减少内存需求并提高收敛效率。

Comments This paper is accepted to Neural Information Processing Systems (NeurIPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08079 2026-01-14 cs.AI cs.CL cs.IR 73%

MemoBrain: Executive Memory as an Agentic Brain for Reasoning

MemoBrain: 作为推理代理的执行记忆脑

Hongjin Qian, Zhao Cao, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MemoBrain通过构建依赖感知的记忆模型,实现对长周期推理轨迹的显式认知控制,提升工具增强代理的推理连贯性和任务对齐性。

Comments Our codes are in https://github.com/qhjqhj00/MemoBrain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13564 2026-01-14 cs.CL cs.AI 73%

Memory in the Age of AI Agents

人工智能代理时代的记忆

Yuyang Hu, Shichun Liu, Yanwei Yue, Guibin Zhang, Boyang Liu, Fangyi Zhu, Jiahang Lin, Honglin Guo, Shihan Dou, Zhiheng Xi, Senjie Jin, Jiejun Tan, Yanbin Yin, Jiongnan Liu, Zeyu Zhang, Zhongxiang Sun, Yutao Zhu, Hao Sun, Boci Peng, Zhenrong Cheng, Xuanbo Fan, Jiaxin Guo, Xinlei Yu, Zhenhong Zhou, Zewen Hu, Jiahao Huo, Junhao Wang, Yuwei Niu, Yu Wang, Zhenfei Yin, Xiaobin Hu, Yue Liao, Qiankun Li, Kun Wang, Wangchunshu Zhou, Yixin Liu, Dawei Cheng, Qi Zhang, Tao Gui, Shirui Pan, Yan Zhang, Philip Torr, Zhicheng Dou, Ji-Rong Wen, Xuanjing Huang, Yu-Gang Jiang, Shuicheng Yan

机构 * Core Supervisors. 0.5em Affiliations: National University of Singapore, Renmin University of China, Fudan University, Peking University, Nanyang Technological University, Tongji University, University of California San Diego, Hong Kong University of Science Technology (Guangzhou), Griffith University, Georgia Institute of Technology, OPPO, Oxford University

专题命中 长上下文与记忆 :LLM(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统梳理了人工智能代理记忆的现状与分类,提出了记忆的三种形式、功能分类及动态分析,为未来智能设计提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06966 2026-01-13 cs.CL cs.AI 73%

RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction

RealMem: 在真实世界中评估大语言模型的内存驱动交互

Haonan Bian, Zhiyuan Yao, Sen Hu, Zishan Xu, Shaolei Zhang, Yifu Guo, Ziliang Yang, Xueran Han, Huacan Wang, Ronghao Chen

机构 * Xidian University(西安电子科技大学) Zhejiang University(浙江大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Sun Yat-sen University(中山大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RealMem是一个基于真实项目场景的基准,评估大语言模型在长期项目导向交互中的记忆管理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14086 2026-01-13 cs.CV cs.AI cs.LG 73%

Seg-LSTM: Performance of xLSTM for Semantic Segmentation of Remotely Sensed Images

Seg-LSTM:xLSTM在遥感图像语义分割中的性能

Qinfeng Zhu, Yuanzhi Cai, Lei Fan

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Seg-LSTM首次评估了xLSTM在遥感图像语义分割中的性能,发现其表现逊于基于Transformer和Mamba的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05589 2026-01-12 cs.CL cs.AI 73%

ACR: Adaptive Context Refactoring via Context Refactoring Operators for Multi-Turn Dialogue

ACR: 通过上下文重构运算符进行多轮对话的自适应上下文重构

Jiawei Shen, Jia Zhu, Hanghui Guo, Weijie Shi, Yue Cui, Qingyu Niu, Guoqing Ma, Yidan Liang, Jingjiang Liu, Yiling Wang, Shimin Di, Jiajie Xu

机构 * Zhejiang Normal University(浙江师范大学) Alibaba Group(阿里巴巴集团) Hong Kong University of Science and Technology(香港科学与技术大学) Southeast University(东南大学) Soochow University(苏州大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ACR通过动态上下文重构运算符和教师指导的自我进化训练范式,有效缓解多轮对话中的上下文惯性和状态漂移问题,提升对话性能并降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02163 2026-01-12 cs.AI cs.CL 73%

EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning

EverMemOS:一种用于结构化长时程推理的自组织记忆操作系统

Chuanrui Hu, Xingze Gao, Zuyi Zhou, Dannong Xu, Yi Bai, Xintong Li, Hui Zhang, Tong Li, Chong Zhang, Lidong Bing, Yafeng Deng

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EverMemOS通过自组织记忆系统提升长时程推理能力,实现事件轨迹捕捉、语义整合与重构性回忆,有效增强记忆增强推理任务的性能。

Comments 16 pages, 7 figures, 12 tables. Code available at https://github.com/EverMind-AI/EverMemOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01739 2026-01-12 cs.CL cs.AI 73%

K-EXAONE Technical Report

K-EXAONE 技术报告

Eunbi Choi, Kibong Choi, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Hyunjik Jo, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Haeju Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Heuiyeen Yeen, Hwan Chang, Stanley Jungkyu Choi, Yejin Choi, Jiwon Ham, Kijeong Jeon, Geunyeong Jeong, Gerrard Jeongwon Jo, Yonghwan Jo, Jiyeon Jung, Naeun Kang, Dohoon Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Hyunseo Kim, Jieun Kim, Minu Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, YoungJin Kim, Chaeeun Lee, Chaeyoon Lee, Changhun Lee, Dahm Lee, Edward Hwayoung Lee, Honglak Lee, Jinsang Lee, Jiyoung Lee, Sangeun Lee, Seungwon Lim, Solji Lim, Woohyung Lim, Chanwoo Moon, Jaewoo Park, Jinho Park, Yongmin Park, Hyerin Seo, Wooseok Seo, Yongwoo Song, Sejong Yang, Sihoon Yang, Chang En Yea, Sihyuk Yi, Chansik Yoon, Dongkeun Yoon, Sangyeon Yoon, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究所)

专题命中 长上下文与记忆 :language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 K-EXAONE是一款由LG AI Research开发的大型多语言语言模型,基于专家混合架构,支持256K-token上下文窗口,具备多语言能力,其性能与同类开源模型相当,适用于多种工业和研究应用。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04726 2026-01-09 cs.AI cs.CL 73%

Memory Matters More: Event-Centric Memory as a Logic Map for Agent Searching and Reasoning

记忆更重要:以事件为中心的记忆作为智能体搜索和推理的逻辑图

Yuyang Hu, Jiongnan Liu, Jiejun Tan, Yutao Zhu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CompassMem,一种以事件为中心的记忆框架,通过构建事件图实现智能体的结构化记忆导航,提升长周期推理能力。

Comments 19 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03515 2026-01-08 cs.CL cs.AI 73%

Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents

Mem-Gallery: 多模态长时对话记忆的基准测试用于 MLLM 代理

Yuanchen Bei, Tianxin Wei, Xuying Ning, Yanjun Zhao, Zhining Liu, Xiao Lin, Yada Zhu, Hendrik Hamann, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究) Stony Brook University(石溪大学) Brookhaven National Laboratory(布鲁赫斯国家实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Mem-Gallery 是一个用于评估多模态长时对话记忆的基准测试,通过多会话对话数据集和系统评估框架,揭示了记忆提取、推理和知识管理的关键发现。

Comments 34 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05509 2026-01-08 cs.CL cs.AI 73%

LAG: Logic-Augmented Generation from a Cartesian Perspective

LAG: 从笛卡尔视角出发的逻辑增强生成

Yilin Xiao, Chuang Zhou, Yujing Zhang, Qinggang Zhang, Su Dong, Shengyuan Chen, Chang Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LAG通过系统的问题分解、原子记忆库和逻辑感知推理,提升知识密集型任务的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18773 2026-01-06 cs.AR cs.AI cs.CL cs.PF 73%

BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache

BitDecoding: 通过低精度KV缓存解锁Tensor Cores用于长上下文LLM

Dayou Du, Shijie Cao, Jianyi Cheng, Luo Mai, Ting Cao, Mao Yang

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 BitDecoding通过协同利用CUDA核心和Tensor Core,实现低精度KV缓存的高效解码,提升长上下文LLM的解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15759 2025-12-30 cs.CL cs.AI cs.CV 73%

Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs

视觉增强大语言模型:赋能大语言模型中的多模态知识存储与共享

Yunxin Li, Zhenyu Liu, Baotian Hu, Wei Wang, Yuxin Ding, Xiaochun Cao, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MKS2方法,通过多模态知识存储与共享增强大语言模型的推理能力,提升其在物理和常识知识场景下的表现。

Comments 21 pages, 7 figures; Accepted by IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20920 2025-12-25 cs.LG cs.AI 73%

RevFFN: Memory-Efficient Full-Parameter Fine-Tuning of Mixture-of-Experts LLMs with Reversible Blocks

RevFFN: 一种内存高效的混合专家语言模型全参数微调方法,采用可逆块

Ningyuan Liu, Jing Yang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RevFFN通过可逆Transformer块实现混合专家语言模型的高效全参数微调,减少内存消耗,提升训练效率。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19206 2025-12-23 cs.LG cs.AI 73%

MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning

MixKVQ: 为长上下文推理的查询感知混合精度KV缓存量化

Tao Zhang, Ziqian Zeng, Hao Peng, Huiping Zhuang, Cen Chen

机构 * South China University of Technology(南方科技大学) Beihang University(北航) Pazhou Laboratory(琶洲实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MixKVQ通过查询感知的混合精度量化策略,提升长上下文推理性能并降低内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13109 2025-12-16 cs.CL cs.AI 73%

Uncovering the Role of Initial Saliency in U-Shaped Attention Bias: Scaling Initial Token Weight for Enhanced Long-Text Processing

揭示初始显著性在U形注意力偏差中的作用:通过缩放初始标记权重提升长文本处理

Zewen Qiang, Sendong Zhao, Haochun Wang, Bing Qin, Ting Liu

机构 * ir.hit.edu.cn(哈尔滨工业大学信息科学学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过缩放初始标记权重以提升长文本处理能力,发现初始显著性对U形注意力偏差有重要影响,并在多个任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12008 2025-12-16 cs.CL cs.AI cs.PF 73%

Hold Onto That Thought: Assessing KV Cache Compression On Reasoning

Hold Onto That Thought: 评估KV缓存压缩在推理中的表现

Minghui Liu, Aadi Palnitkar, Tahseen Rabbani, Hyunwoo Jae, Kyle Rui Sang, Dixi Yao, Shayan Shabihi, Fuheng Zhao, Tian Li, Ce Zhang, Furong Huang, Kunpeng Zhang

机构 * University of Maryland(马里兰大学) University of Chicago(芝加哥大学) University of Utah(犹他大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了多种KV缓存压缩策略在长推理任务中的表现,发现H2O和改进的SnapKV在推理模型中表现优异,揭示了重 hitter 跟踪的有效性及缓存大小与推理成本的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07011 2025-12-09 cs.LG cs.CL cs.PF 73%

Block Sparse Flash Attention

块稀疏Flash注意力

Daniel Ohayon, Itay Lamprecht, Itay Hubara, Israel Cohen, Daniel Soudry, Noam Elata

机构 * Technion -- Israel Institute of Technology, Haifa, Israel(技术离子-以色列理工学院, 海法, 以色列) Intel -- Habana Labs, Tel Aviv, Israel(英特尔 -- Habana实验室, 特拉维夫, 以色列)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 块稀疏Flash注意力通过精确计算查询-键相似性,提升长上下文推理效率并保持高准确性。

Comments 10 pages, 5 figures. Code: https://github.com/Danielohayon/Block-Sparse-Flash-Attention

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20964 2025-12-09 cs.CL cs.AI cs.OS cs.PL cs.SE 73%

OSVBench: Benchmarking LLMs on Specification Generation Tasks for Operating System Verification

OSVBench:用于操作系统验证的大型语言模型规范生成基准测试

Shangyu Li, Juyong Jiang, Tiancheng Zhao, Jiasi Shen

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OSVBench通过长上下文任务评估LLMs在操作系统验证中的规范生成能力,揭示现有模型在复杂代码生成任务中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01311 2025-12-04 cs.AI cs.LG 73%

CuES: A Curiosity-driven and Environment-grounded Synthesis Framework for Agentic RL

CuES: 一种基于好奇心和环境导向的代理强化学习合成框架

Shinji Mai, Yunpeng Zhai, Ziqian Chen, Cheng Chen, Anni Zou, Shuchang Tao, Zhaoyang Liu, Bolin Ding

机构 * Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CuES通过好奇心驱动和环境导向的方法自动生成任务,提升代理强化学习的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏