arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2601.20282 2026-01-29 cs.LG 70%

Memory Retrieval in Transformers: Insights from The Encoding Specificity Principle

Transformer中的记忆检索:来自编码特异性原理的见解

Viet Hung Dinh, Ming Ding, Youyang Qu, Kanchana Thilakarathna

机构 * University of Sydney(悉尼大学) Data61 CSIRO(Data61澳大利亚联邦科学与工业研究组织)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究基于编码特异性原理,探讨了Transformer中注意力层的记忆机制,并通过实验验证了关键词作为提示的假设,为隐私保护机器无学习提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19578 2026-01-28 cs.CL 70%

Yunque DeepResearch Technical Report

Yunque DeepResearch 技术报告

Yuxuan Cai, Xinyi Lai, Peng Yuan, Weiting Liu, Huajian Li, Mingda Li, Xinghua Wang, Shengxie Zheng, Yanchao Hao, Yuyang Yin, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Yunque DeepResearch提出了一种分层、模块化且稳健的框架,通过多代理协调、动态上下文管理和主动监督模块解决深度研究中的关键挑战,实现先进性能并开源支持社区发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19096 2026-01-28 cs.CL 70%

PsyProbe: Proactive and Interpretable Dialogue through User State Modeling for Exploratory Counseling

PsyProbe: 通过用户状态建模实现探索性辅导的主动与可解释对话

Sohhyung Park, Hyunji Kang, Sungzoon Cho, Dongil Kim

机构 * Department of Industrial Engineering, Seoul National University(工业工程系,首尔国立大学) Department of Education, Seoul National University(教育系,首尔国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PsyProbe通过系统性用户状态建模和主动提问提升探索性辅导的互动效果和专业性。

Comments In Findings of the Association for Computational Linguistics: EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07713 2026-01-27 cs.CL 70%

MemWeaver: A Hierarchical Memory from Textual Interactive Behaviors for Personalized Generation

MemWeaver: 一种从文本交互行为构建的分层记忆用于个性化生成

Shuo Yu, Mingyue Cheng, Daoyu Wang, Qi Liu, Zirui Liu, Ze Guo, Xiaoyu Tao

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MemWeaver通过构建分层记忆模型,利用文本交互行为捕捉用户兴趣的时间演变和语义关系,实现深度个性化内容生成。

Comments Accepted by The Web Conference 2026 (WWW'26) 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16649 2026-01-26 cs.AI 70%

LUMINA: Long-horizon Understanding for Multi-turn Interactive Agents

LUMINA:多轮交互智能体的长视图理解

Amin Rakhsha, Thomas Hehn, Pietro Mazzaglia, Fabio Valerio Massoli, Arash Behboodi, Tribhuvanesh Orekondy

机构 * University of Toronto(多伦多大学) Qualcomm AI Research(高通人工智能研究)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LUMINA研究通过oracle反事实框架分析多轮交互智能体中各基础能力的重要性,揭示了不同技能在不同环境下的有效性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15300 2026-01-23 cs.CL 70%

Intelligence Degradation in Long-Context LLMs: Critical Threshold Determination via Natural Length Distribution Analysis

长上下文大语言模型中的智能退化:通过自然长度分布分析确定关键阈值

Weiwei Wang, Jiyong Min, Weijie Zou

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过自然长度分布分析确定长上下文LLM的关键阈值,揭示智能退化机制并提出统一框架以指导缓解策略。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13753 2026-01-23 cs.CL 70%

SCALAR: Scientific Citation-based Live Assessment of Long-context Academic Reasoning

SCALAR: 基于科学引用的长上下文学术推理实时评估

Renxi Wang, Honglin Mu, Liqun Ma, Lizhi Lin, Yunlong Feng, Timothy Baldwin, Xudong Han, Haonan Li

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SCALAR通过基于学术引用的长上下文推理评估框架,评估模型在学术写作中的推理能力,发现多项选择任务能有效区分模型性能,而填空式引用预测任务更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19699 2026-01-22 cs.NI cs.AI cs.MA 70%

A Layered Protocol Architecture for the Internet of Agents

面向智能体的分层协议架构

Charles Fleming, Luca Muscariello, Vijoy Pandey, Ramana Kompella

机构 * Cisco Research(思科研究)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出分层协议架构,通过智能体通信层和语义层实现智能体协作,解决LLMs在内存和计算能力上的限制,推动多智能体系统的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12030 2026-01-21 cs.AI 70%

ARC: Active and Reflection-driven Context Management for Long-Horizon Information Seeking Agents

ARC:面向长周期信息检索代理的主动与反思驱动上下文管理

Yilun Yao, Shan Huang, Elsie Dai, Zhewen Tan, Zhenyu Duan, Shousheng Jia, Yanbing Jiang, Tong Yang

机构 * Peking University(北京大学) Beihang University(北京航空航天大学) Qiyuan Tech(启元科技)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ARC 通过主动和反思驱动的上下文管理方法,提升了长周期信息检索代理的性能,显著提高了准确性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03285 2026-01-15 cs.AI 70%

Memory Mosaics at scale

大规模记忆马赛克

Jianyu Zhang, Léon Bottou

机构 * New York University, New York(纽约大学) FAIR, Meta Inc.(FAIR、Meta公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究展示了大规模记忆马赛克在扩展到大语言模型规模和真实数据集后,在训练知识学习和新任务执行方面优于transformers。

Comments Oral @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09113 2026-01-15 cs.AI 70%

The AI Hippocampus: How Far are We From Human Memory?

人工智能海马体:我们离人类记忆还有多远?

Zixia Jia, Jiaqi Li, Yipeng Kang, Yuxuan Wang, Tong Wu, Quansen Wang, Xiaobo Wang, Shuyi Zhang, Junzhe Shen, Qing Li, Siyuan Qi, Yitao Liang, Di He, Zilong Zheng, Song-Chun Zhu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了大语言模型和多模态大语言模型中记忆机制的分类与研究进展,探讨了隐性、显性和代理记忆框架,以及多模态场景下的记忆整合与挑战。

Journal ref Transactions on Machine Learning Research (11/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08435 2026-01-14 cs.CL 70%

Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management

细粒度反馈对齐的长期记忆管理:Fine-Mem

Weitao Ma, Xiaocheng Feng, Lei Huang, Xiachong Feng, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Meituan(美团) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Fine-Mem通过细粒度反馈对齐提升长周期内存管理,通过块级奖励和证据锚定奖励分配优化策略,实现更高效的内存操作与长期效用对齐。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06842 2026-01-13 cs.AI 70%

Seeing through the Conflict: Transparent Knowledge Conflict Handling in Retrieval-Augmented Generation

通过冲突看见:在检索增强生成中实现透明的知识冲突处理

Hua Ye, Siyuan Chen, Ziqi Zhong, Canran Xiao, Haoliang Zhang, Yuhan Wu, Fei Shen

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TCR通过透明冲突解决框架提升检索增强生成中的冲突检测与知识恢复能力,减少误导性上下文影响。

Comments 9 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06562 2026-01-13 cs.LG 70%

Mosaic: Unlocking Long-Context Inference for Diffusion LLMs via Global Memory Planning and Dynamic Peak Taming

Mosaic: 通过全局内存规划和动态峰值镇压解锁扩散语言模型的长上下文推理

Liang Zheng, Bowen Shi, Yitao Hu, Jiawei Zhang, Ruofan Li, Sheng Chen, Wenxin Li, Keqiu Li

机构 * Tianjin University, China(天津大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Mosaic通过全局内存规划和动态峰值镇压,提升扩散语言模型的长上下文推理能力,实现内存效率和推理长度的显著提升。

Comments 11 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05107 2026-01-09 cs.AI 70%

Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction

可控的记忆使用:在长期人机交互中平衡锚定与创新

Muzhao Tian, Zisu Huang, Xiaohua Wang, Jingwen Xu, Zhengkang Guo, Qi Qian, Yuanzhe Shen, Kaitao Song, Jiakang Yuan, Changze Lv, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 长上下文与记忆 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 SteeM通过动态调节记忆依赖程度,在长期人机交互中平衡锚定与创新,提升个性化协作效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13197 2026-01-08 cs.CL 70%

Text Anomaly Detection with Simplified Isolation Kernel

基于简化隔离核的文本异常检测

Yang Cao, Sikun Yang, Yujiu Yang, Lianyong Qi, Ming Liu

机构 * School of Computing and Information Technology, Great Bay University(大湾大学计算机与信息科技学院) Great Bay Institute for Advanced Study, Great Bay University(大湾大学先进研究学院) Guangdong Provincial Key Laboratory of Mathematical and Neural Dynamical Systems(广东省数学与神经动力系统重点实验室) Dongguan Key Laboratory for Intelligence and Information Technology, China(东莞智能与信息技术重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) China University of Petroleum (East China), China(中国石油大学(华东)) School of IT, Deakin University(德肯大学信息科技学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出简化隔离核(SIK)方法,通过将高维嵌入转换为低维稀疏表示,提升文本异常检测的性能与效率。

Comments EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02311 2026-01-06 cs.DC cs.AI 70%

Placement Semantics for Distributed Deep Learning: A Systematic Framework for Analyzing Parallelism Strategies

分布式深度学习中的放置语义:一种分析并行策略的系统框架

Deep Pankajbhai Mehta

机构 * Adobe Inc(Adobe公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出放置语义框架,通过分析不同并行策略在设备上的状态放置方式,统一了多种分布式训练方法,实现了对内存和通信成本的准确预测。

Comments 8 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21394 2026-01-06 cs.AI 70%

AI Compute Architecture and Evolution Trends

人工智能计算架构与演进趋势

Bor-Sung Liang

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出七层人工智能计算架构模型,分析了大型语言模型演进的三个阶段及各层技术发展与影响。

Comments 33 pages, 17 figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09238 2026-01-05 cs.CL 70%

Training-free Context-adaptive Attention for Efficient Long Context Modeling

无需训练的上下文自适应注意力:用于高效长上下文建模

Zeng You, Yaofo Chen, Shuhai Zhang, Zhijie Qiu, Tingyu Wu, Yingjian Li, Yaowei Wang, Mingkui Tan

机构 * School of Future Technology, South China University of Technology, Guangzhou, China(未来技术学院,华南理工大学,广州,中国) Pengcheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) School of Software Engineering, South China University of Technology, Guangzhou, China(软件学院,华南理工大学,广州,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学,深圳,中国)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出无需训练的上下文自适应注意力机制,通过轻量级阶段实现高效长上下文推理,减少内存占用并提升速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24077 2026-01-01 cs.AI 70%

LoongFlow: Directed Evolutionary Search via a Cognitive Plan-Execute-Summarize Paradigm

LoongFlow:通过认知计划-执行-总结范式实现定向进化搜索

Chunhui Wan, Xunan Dai, Zhuo Wang, Minglei Li, Yanpeng Wang, Yinan Mao, Yu Lan, Zhiwen Xiao

机构 * Baidu Inc(百度公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LoongFlow通过认知计划-执行-总结范式实现高效进化搜索,提升算法发现与流水线优化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23760 2026-01-01 cs.CR cs.AI 70%

Audited Skill-Graph Self-Improvement for Agentic LLMs via Verifiable Rewards, Experience Synthesis, and Continual Memory

通过可验证奖励、经验合成和持续记忆对代理LLM进行审计化技能图自改进

Ken Huang, Jerry Huang

机构 * OWASP Fairfax, VA, USA Kleiner Perkins

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ASG-SI框架,通过可验证奖励、经验合成和持续记忆实现代理LLM的审计化技能图自改进,以提升安全性和可追溯性。

Comments 11 pages, 4 figures. Includes a complete runnable reference implementation and audit logging framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22087 2025-12-29 cs.CL 70%

Context as a Tool: Context Management for Long-Horizon SWE-Agents

上下文作为工具:长周期SWE代理的上下文管理

Shukai Liu, Jian Yang, Bo Jiang, Yizhi Li, Jinyang Guo, Xianglong Liu, Bryan Dai

机构 * Beihang University(北航大学) Manchester(曼彻斯特) Ubiquant

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CAT通过整合上下文管理工具,提升SWE代理的长周期推理能力,实验表明其在SWE-Bench-Verified上达到57.6%的解决率,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14856 2025-12-25 cs.CL 70%

T5Gemma 2: Seeing, Reading, and Understanding Longer

T5Gemma 2: 视觉、阅读与理解更长内容

Biao Zhang, Paul Suganthan, Gaël Liu, Ilya Philippov, Sahil Dua, Ben Hora, Kat Black, Gus Martins, Omar Sanseviero, Shreya Pathak, Cassidy Hardin, Francesco Visin, Jiageng Zhang, Kathleen Kenealy, Qin Yin, Xiaodan Song, Olivier Lacombe, Armand Joulin, Tris Warkentin, Adam Roberts

机构 * Google(谷歌)

专题命中 长上下文与记忆 :pretraining(abstract);post-training(abstract);分类 cs.CL

AI总结 T5Gemma 2通过改进的编码器-解码器架构,实现了多模态和长上下文处理能力,同时在预训练和微调性能上优于Gemma 3。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12491 2025-12-25 cs.CL 70%

CAKE: Cascading and Adaptive KV Cache Eviction with Layer Preferences

CAKE:基于层优先级的级联和自适应KV缓存淘汰

Ziran Qin, Yuchen Cao, Mingbao Lin, Wen Hu, Shixuan Fan, Ke Cheng, Weiyao Lin, Jianguo Li

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CAKE通过级联和自适应机制优化KV缓存淘汰,提升低内存下的模型性能和解码效率。

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20278 2025-12-24 cs.AI 70%

Synthesizing Procedural Memory: Challenges and Architectures in Automated Workflow Generation

生成程序记忆:自动化工作流生成中的挑战与架构

Nishant Gaurav, Adit Akarsh, Ankit Ranjan, Manoj Bajaj

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过科学方法自主生成工作流技能,解决自动化技能生成中的四个结构性瓶颈。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20245 2025-12-24 cs.NE cs.AI cs.IR cs.SC cs.SE 70%

Memory as Resonance: A Biomimetic Architecture for Infinite Context Memory on Ergodic Phonetic Manifolds

记忆作为共振:一种仿生架构,用于在周期性语音流形上实现无限上下文记忆

Tarik Houichime, Abdelghani Souhar, Younes El Amrani

机构 * System Research & Development Laboratory(系统研究与开发实验室) EME AXE LLC(5EME AXE公司) Faculty of Science, Mohammed V University In Rabat(穆罕默德五世大学科学学院) Computer Science Research Laboratory (LaRI)(计算机科学研究实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出语音轨迹记忆架构,通过神经符号方法实现无限上下文记忆,利用周期性流形上的连续路径实现高压缩比和低延迟检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18060 2025-12-23 cs.DS cs.LG 70%

Graph-based Nearest Neighbors with Dynamic Updates via Random Walks

通过随机游走实现的基于图的最近邻搜索与动态更新

Nina Mishra, Yonatan Naamad, Tal Wagner, Lichen Zhang

机构 * Amazon(亚马逊公司) Tel Aviv University(特拉维夫大学) MIT(麻省理工学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于随机游走的图结构,用于实现支持动态更新的近似最近邻搜索,并通过实验验证了其在效率和性能上的优势。

Comments 37 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14516 2025-12-19 cs.CR cs.CV cs.LG 70%

Memory Backdoor Attacks on Neural Networks

神经网络中的记忆后门攻击

Eden Luzon, Guy Amit, Roy Weiss, Torsten Kraub, Alexandra Dmitrienko, Yisroel Mirsky

机构 * Ben-Gurion University, Institute of Software Systems and Security(本·加隆大学软件系统与安全研究所) University of Würzburg(魏泽堡大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种神经网络的记忆后门攻击方法,通过恶意服务器系统性地提取客户端训练样本,揭示了联邦学习中的隐私安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16262 2025-12-19 cs.AI 70%

Learning to Wait: Synchronizing Agents with the Physical World

学习等待:与物理世界同步智能体

Yifei She, Ping Zhang, He Liu, Yanmin Jia, Yang Jing, Zijun Liu, Peng Sun, Xiangbin Li, Xiaohe Hu

机构 * Infrawaves Shanghai Qiji Zhifeng Co., Ltd.(上海启智风有限公司) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种智能体侧方法,使大语言模型通过预测等待时间实现与物理世界的同步,解决了异步环境中动作延迟的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15653 2025-12-18 cs.CL 70%

Characterizing Mamba's Selective Memory using Auto-Encoders

利用自编码器表征Mamba的选择性记忆

Tamanna Hossain, Robert L. Logan, Ganesh Jagadeesan, Sameer Singh, Joel Tetreault, Alejandro Jaimes

机构 * University of California, Irvine(加州大学尔湾分校) Dataminr Inc.(Dataminr公司)

专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文通过自编码器研究Mamba模型在处理长序列时对特定类型信息的遗忘特性,发现数学相关和组织实体等标记更易被遗忘。

Comments AACL 2025. Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏