GenDistiller: Distilling Pre-trained Language Models based on Generative Models
专题命中 长上下文与记忆 :language model(title,abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 长上下文与记忆 :language model(title,abstract)
专题命中 长上下文与记忆 :foundation model(title,abstract)
Comments CVPR 2023
专题命中 长上下文与记忆 :foundation model(title,abstract)
Comments Accepted by IEEE TGRS. The codes and models are released at https://github.com/ViTAE-Transformer/Remote-Sensing-RVSA
专题命中 长上下文与记忆 :language model(title,abstract)
专题命中 长上下文与记忆 :language model(title,abstract)
Comments To appear at Interspeech 2020
专题命中 长上下文与记忆 :language model(title,abstract)
专题命中 长上下文与记忆 :language model(title,abstract)
AttriMem:用于智能体记忆学习的归因引导过程反馈
机构 * Zhejiang University(浙江大学)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 研究针对LLM智能体有效构建记忆难的问题,提出AttriMem框架,通过用token级对最终答案贡献的局部奖励增强全局结果奖励,以学习记忆构建策略,实验表明该框架性能优于多种基线,具有泛化性且稳定了RL优化。
经验记忆图:智能体的一次性错误纠正
机构 * University of Electronic Science and Technology of China(电子科技大学)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对大语言模型智能体在复杂任务中易出错且难恢复的问题,提出经验记忆图框架,将失败恢复转化为图匹配问题,训练时提取相关子图和路径存储,测试时指导智能体,实验证明其性能优于现有基线且无需测试时反复试验。
Comments 11 pages, 6 figures
SocietyBench:反事实社会世界演化预测
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文推出SocietyBench基准,通过构建反事实社会世界,测试LLMs预测社会事件的概率校准与时间准确性,发现前沿LLMs表现远逊于基准,智能体框架未提升性能,强调多事件评估的必要性。
Comments Project page: https://co-minder.github.io/Societybench
利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架
机构 * National University of Singapore(新加坡国立大学) ; Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR)) ; Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Jilin University(吉林大学)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型长视频理解受限问题,提出ReMem框架,通过双级记忆增强自适应,在查询和视频级别分别处理,能适应不同时间粒度,经实验验证在多个基准测试中实现高效零样本性能,提升模型长视频推理能力。
Comments Accepted by ECCV 2026
EvoSQL:用于文本到SQL的内存增强型评论家-生成器协同进化
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of New South Wales(新南威尔士大学) ; Fudan University(复旦大学) ; Wuhan University of Technology(武汉理工大学)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究文本到SQL问题,提出EvoSQL协同进化框架,通过生成器与评论家迭代交互、维护内存、验证候选及自蒸馏策略优化微调等,在Spider和BIRD实验中持续改进开源模型,证明该方法是有效途径。
RECON:用于长上下文组合推理的智能体内存基准测试
机构 * RV College of Engineering(RV工程学院) ; Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究引入RECON基准测试,用于评估长上下文组合推理,跨越三个领域24个案例文件,测试智能体六个内存密集型任务,揭示当前架构在内存相关任务上存在重大局限,非预言机系统准确率低,检索和推理有挑战。
Comments 25 pages
NEMO: 通过自主编码代理实现执行感知的优化建模
机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,计算机科学学院,卡内基梅隆大学,匹兹堡,PA,美国)
专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出NEMO系统,利用自主编码代理将决策问题的自然语言描述转化为可执行的数学优化实现,通过执行感知的架构和协调模式实现最先进的性能。
Comments Accepted at ICML 2026
Harness手册:使不断演进的智能体框架具有可读性、可导航性和可编辑性
机构 * Tencent(腾讯) ; Indiana University(印第安纳大学) ; University of Maryland, College Park(马里兰大学帕克分校) ; University of Georgia(佐治亚大学) ; National University of Singapore(新加坡国立大学)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI
AI总结 研究智能体框架演进中行为定位难的问题,提出通过Harness手册和行为引导的渐进式披露,以行为为中心自动合成框架表示并辅助规划,提高行为定位和编辑计划质量,助力复杂智能体系统发展。
Comments 29 pages, 6 figures. Project page: https://ruhan-wang.github.io/Harness-Handbook/
EntSQL:一个将Text-to-SQL置于长上下文企业知识中的基准
机构 * HKUST (GZ)(香港科技大学(广州)) ; Alibaba Group(阿里巴巴集团) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))
专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);分类 cs.CL
AI总结 提出EntSQL基准,通过包含1066个跨五个业务领域的中英文对齐示例,评估LLM在长上下文企业文档中基于私有业务知识生成SQL的能力,最佳系统仅达15.9%准确率。
SynthDocBench:用于长上下文视觉文档理解的可控基准测试
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI
AI总结 研究针对视觉语言模型在现实文档理解中归因失败原因困难的问题,引入SynthDocBench基准测试,通过组合设计控制多因素,端到端生成多样长文档,评估模型发现三种现有基准未暴露的失败模式,揭示模型或过度拟合基准工件。
Comments 29 Pages, 27 Tables, 13 Figures, Accepted at COLM 2026
利用代码智能体进行自动软件验证
机构 * Singapore Management University, Barkhausen Institut(新加坡管理大学, 巴克豪森研究所)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究利用大语言模型代码智能体进行自动软件验证,将引理交给智能体自由选择方法并置于验证框架,该方法简单有效,能完全覆盖目标引理,在多维度评估中表现出色,可自动为软件开发编写证明。
修复放大器,而非症状:面向智能体轨迹的稳定世界模型修正
机构 * Emory University(埃默里大学) ; The University of Tokyo(东京大学) ; LocationMind
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);language agent(abstract);分类 cs.AI
AI总结 针对长流程规划中的图级错误,提出WM-SAR方法,通过子图放大反向定位因果子图进行修复,在有限token预算下优于传统扫描修复方法。
Comments Under Review
GSRQ: 面向亚1比特KV缓存的增益-形状残差量化
专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 针对大语言模型KV缓存压缩中向量量化导致的方向保持问题,提出增益-形状K均值(GSKM)替代标准K均值,并构建增益-形状残差量化(GSRQ),在1比特下将LongBench平均准确率从11.34提升至33.54。
Comments ICML 2026
面向低资源语言机器翻译的多示例上下文学习的实证研究
机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; Athabasca University(阿特拉斯大学) ; Peking University(北京大学) ; Howard University(霍华德大学)
专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究实证分析多示例上下文学习在低资源语言机器翻译中的效果,发现BM25检索可大幅提升数据效率,且ICL能在微调基础上带来额外增益。
Comments 24 pages, 3 figures, 20 tables
推理作为吸引子动力学:通过吉布斯加权能量最小化的潜在记忆检索
机构 * Independent Researcher(独立研究者)
专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出将大语言模型视为高维稠密联想记忆,通过吉布斯加权能量最小化从潜在吸引子中检索正确推理链,在GSM8K上提升Phi-3.5性能5.38%。
Comments Accepted at ICLR Workshop 2026
逃离自我确认陷阱:一种用于智能体经验学习的执行-蒸馏-验证范式
机构 * Zhejiang University(浙江大学) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Northwestern Polytechnical University(西北工业大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiaotong University(上海交通大学)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出EDV框架,通过多智能体并行执行、第三方蒸馏和共识验证,解决单智能体经验学习中的自我确认陷阱问题,在三个长时任务基准上取得一致提升。
Comments 28 pages, 11 figures
基于下一个词预测的测试时训练
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL
AI总结 提出TTT-NTP方法,利用预训练语言模型自身的下一个隐藏状态作为自监督信号进行测试时训练,无需重新设计骨干网络,在多个长上下文基准上显著提升性能。
Comments 17 pages, 2 figures, 7 tables. Preprint
关于次二次架构:从应用到原理
机构 * ELLIS Unit Linz, LIT AI Lab, Institute for Machine Learning, Johannes Kepler University Linz(林茨ELLIS单元、LIT AI实验室、机器学习研究所、约翰内斯·开普勒大学林茨) ; NVIDIA(英伟达)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG
AI总结 本文比较了xLSTM、Mamba-2和Gated DeltaNet三种次二次架构,发现xLSTM在代码预训练、蒸馏和时间序列预训练中表现最佳,其优势源于灵活稳定的门控记忆校正机制。
多语言大模型中冲突信息下的语言偏见
机构 * Stockholm University(斯德哥尔摩大学) ; RISE Research Institutes of Sweden(瑞典RISE研究机构)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL
AI总结 本研究通过扩展“干草堆中的冲突针”范式至多语言环境,评估了不同规模的多语言大模型在回答问题时对冲突信息中不同语言的偏好,发现模型普遍存在语言偏见,尤其是对俄语的普遍偏见和对中文的偏好,且提示语言与信息语言匹配时更受青睐。
超越静态对话:对现实、异构和演化长期记忆的基准测试
机构 * Center for Applied Statistics, Renmin University of China(中国人民大学应用统计中心) ; School of Statistics, Renmin University of China(中国人民大学统计学院) ; Microsoft(微软公司)
专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对现有大语言模型记忆基准中对话缺乏长期语义一致性、人物静态化以及忽视异构数据流的问题,提出RHELM基准,通过用户画像和LOOP模块生成具有动态时间演化和长期连贯性的现实对话,并整合异构外部源,评估模型在多源聚合和现实上下文推理方面的能力。
CriticalKV: 从输出扰动角度优化 KV 缓存淘汰
机构 * School of Computer Science, University of Science and Technology of China(科学技术大学计算机科学学院) ; School of Biomedical Engineering, USTC(USTC生物医学工程学院) ; Data Darkness Lab, MIRACLE Center, Suzhou Institute for Advanced Research(苏州先进研究院数据黑暗实验室、奇迹中心) ; School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)
专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文通过分析注意力输出扰动,提出一种基于扰动约束的 KV 缓存条目选择算法,显著降低压缩损失。
Comments ICML 2026
VitaBench 2.0:评估长期用户交互中的个性化与主动型代理
机构 * National University of Singapore(新加坡国立大学) ; Meituan(美团) ; University of Science and Technology of China(中国科学技术大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Zhejiang University(浙江大学)
专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有代理基准忽视用户偏好推断与利用的问题,提出VitaBench 2.0基准,通过时间序列任务和可扩展记忆接口评估代理在长期交互中的个性化与主动性,实验表明最先进模型仍面临挑战。
NestedKV: 用于长上下文KV缓存压缩的嵌套内存路由
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Jimei University(集美大学)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL
AI总结 提出NestedKV方法,通过多时间尺度余弦异常评分和头自适应混合的免训练键缓存压缩,在长上下文任务中优于现有方法。