arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2603.01783 2026-03-03 cs.AI 70%

GAM-RAG: Gain-Adaptive Memory for Evolving Retrieval in Retrieval-Augmented Generation

GAM-RAG:基于增益的记忆用于演化检索的检索增强生成

Yifan Wang, Mingxuan Jiang, Zhihao Sun, Yixin Cao, Yicun Liu, Keyang Chen, Guangnan Ye, Hongfeng Chai

机构 * Fudan University(复旦大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GAM-RAG通过动态更新检索记忆提升检索增强生成的性能,减少计算成本,提高推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08237 2026-03-03 cs.CL 70%

Document Reconstruction Unlocks Scalable Long-Context RLVR

文档重建解锁可扩展的长上下文强化学习验证奖励

Yao Xiao, Lei Wang, Yue Deng, Guanzheng Chen, Ziqi Jin, Jung-jae Kim, Xiaoli Li, Roy Ka-wei Lee, Lidong Bing

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过文档重建提升大型语言模型长上下文能力的方法,无需人工标注或教师模型监督,有效提升模型在RULER和LongBench~v2上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03152 2026-03-03 cs.CL 70%

FASA: Frequency-aware Sparse Attention

FASA: 基于频率的稀疏注意力

Yifei Wang, Yueqi Wang, Zhenrui Yue, Huimin Zeng, Yong Wang, Ismini Lourentzou, Zhengzhong Tu, Xiangxiang Chu, Julian McAuley

机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP) UCSD(加州大学圣迭戈分校) UIUC(伊利诺伊大学香槟分校) Texas A&M University(德克萨斯农工大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FASA通过动态预测令牌重要性,实现基于频率块的稀疏注意力机制,在长上下文任务中表现出色,达到接近全缓存性能且显著提升效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23944 2026-03-02 cs.CL 70%

MemEmo: Evaluating Emotion in Memory Systems of Agents

MemEmo:评估智能体记忆系统中的情感

Peng Liu, Zhen Tao, Jihao Zhao, Ding Chen, Yansong Zhang, Cuiping Li, Zhiyu Li, Hong Chen

机构 * School of Information, Renmin University of China(中国人民大学信息学院) China Telecom Research Institute(中国电信研究院) MemTensor (Shanghai) Technology(MemTensor(上海)科技)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MemEmo提出情感增强的记忆评估基准,通过HLME数据集评估记忆系统在情感信息处理上的性能,揭示当前系统在处理情感记忆方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21800 2026-02-26 cs.SE cs.AI 70%

An Evaluation of Context Length Extrapolation in Long Code via Positional Embeddings and Efficient Attention

通过位置嵌入和高效注意力机制评估长代码中的上下文长度外推

Madhusudan Ghosh, Rishabh Gupta

机构 * Bosch Research and Technology Centre, Bangalore, India(博世研究与技术中心,班加罗尔,印度)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过位置嵌入和高效注意力机制评估长代码中的上下文长度外推,旨在提升代码生成任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21611 2026-02-26 cs.SE cs.AI 70%

Structurally Aligned Subtask-Level Memory for Software Engineering Agents

结构对齐的子任务级记忆用于软件工程代理

Kangning Shen, Jingyuan Zhang, Chenxi Sun, Wencong Zeng, Yang Yue

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结构对齐的子任务级记忆方法,通过与代理功能分解对齐来提升软件工程代理的长周期推理能力,实验表明在多种backbone上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18374 2026-02-23 cs.RO cs.AI 70%

Zero-shot Interactive Perception

零样本交互感知

Venkatesh Sripada, Frank Guerin, Amir Ghalamzan

机构 * University of Surrey(萨里大学) University of Sheffield(谢菲尔德大学)

专题命中 长上下文与记忆 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 ZS-IP通过结合多策略操作与基于记忆的视觉语言模型,实现零样本交互感知,提升复杂场景中推操作的性能。

Comments Original manuscript submitted on April 24, 2025. Timestamped and publicly available on OpenReview: https://openreview.net/forum?id=7MhpFcr5Nx

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16704 2026-02-19 cs.CL 70%

Reinforced Fast Weights with Next-Sequence Prediction

增强型快速权重与下序列预测

Hee Seung Hwang, Xindi Wu, Sanghyuk Chun, Olga Russakovsky

专题命中 长上下文与记忆 :language model(abstract);post-training(abstract);分类 cs.CL

AI总结 REFINE通过强化学习框架在下序列预测目标下训练快速权重模型,提升长上下文建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15156 2026-02-18 cs.AI 70%

Panini: Continual Learning in Token Space via Structured Memory

Panini:通过结构化记忆在令牌空间中实现持续学习

Shreyas Rajesh, Pavan Holur, Mehmet Yigit Turali, Chenda Duan, Vwani Roychowdhury

机构 * ucla(加州大学洛杉矶分校)

专题命中 长上下文与记忆 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 Panini通过结构化记忆在令牌空间中实现持续学习,提升推理效率和准确性。

Comments 35 pages, code available at: https://github.com/roychowdhuryresearch/gsw-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15055 2026-02-18 cs.MA cs.AI 70%

Beyond Context Sharing: A Unified Agent Communication Protocol (ACP) for Secure, Federated, and Autonomous Agent-to-Agent (A2A) Orchestration

超越上下文共享:一种统一的智能体通信协议(ACP)用于安全、联邦化和自主的智能体到智能体(A2A)编排

Naveen Kumar Krishnan

机构 * Naveen Krishnan

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种统一的智能体通信协议(ACP),旨在通过安全、联邦化和自主的智能体到智能体编排,解决跨平台、去中心化和安全交互的挑战,提升智能体协作效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10915 2026-02-16 cs.CR cs.AI 70%

Blind Gods and Broken Screens: Architecting a Secure, Intent-Centric Mobile Agent Operating System

无目神祇与破碎屏幕:构建一个安全的、以意图为中心的移动代理操作系统

Zhenhua Zou, Sheng Guo, Qiuyang Zhan, Lepeng Zhao, Shuo Li, Qi Li, Ke Xu, Mingwei Xu, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Aura架构,通过结构化交互模型和四项防御支柱,提升移动代理系统的安全性与效率。

Comments 35 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12278 2026-02-13 cs.IR cs.AI 70%

AttentionRetriever: Attention Layers are Secretly Long Document Retrievers

AttentionRetriever: 注意力层其实是秘密的长文档检索器

David Jiahao Fu, Lam Thanh Do, Jiayu Li, Kevin Chen-Chuan Chang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AttentionRetriever通过结合注意力机制和实体检索,实现高效长文档检索,优于现有方法并保持高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10652 2026-02-12 cs.CL 70%

UMEM: Unified Memory Extraction and Management Framework for Generalizable Memory

UMEM: 通用记忆的统一记忆提取与管理框架

Yongshi Ye, Hui Jiang, Feihu Jiang, Tian Lan, Yichao Du, Biao Fu, Xiaodong Shi, Qianghuai Jia, Longyue Wang, Weihua Luo

机构 * Xiamen University(厦门大学) Alibaba International Digital Commerce(阿里巴巴国际数字商务) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 UMEM通过联合优化大语言模型,实现记忆的提取与管理,提升记忆的泛化能力,实验显示在多轮交互任务中表现优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09712 2026-02-11 cs.CL 70%

TraceMem: Weaving Narrative Memory Schemata from User Conversational Traces

TraceMem: 从用户对话轨迹编织叙事记忆图式

Yiming Shu, Pei Liu, Tiange Zhang, Ruiyang Gao, Jun Ma, Chen Sun

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nankai University(南开大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TraceMem通过三阶段流程从用户对话轨迹中编织叙事记忆图式,提升多跳和时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06411 2026-02-11 cs.CL 70%

Structured Episodic Event Memory

结构化事件记忆

Zhengxuan Lu, Dongfang Li, Yukun Shi, Beilun Wang, Longyue Wang, Baotian Hu

机构 * Southeast University(东南大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Alibaba Group(阿里巴巴集团)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SEEM通过结构化事件记忆框架提升自主代理的叙述连贯性和逻辑一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07652 2026-02-10 cs.CR cs.AI 70%

Agent-Fence: Mapping Security Vulnerabilities Across Deep Research Agents

Agent-Fence: 在深度研究代理中映射安全漏洞

Sai Puppala, Ismail Hossain, Md Jahangir Alam, Yoonpyo Lee, Jay Yoo, Tanzim Ahad, Syed Bahauddin Alam, Sajedul Talukder

机构 * Computer Science Department, Southern Illinois University(索尔坦大学计算机科学系) Computer Science Department, University of Texas(德克萨斯大学计算机科学系) Hanyang University(翰阳大学) The Grainger College of Engineering, Nuclear, Plasma & Radiological Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格雷格尔工程学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Agent-Fence通过定义14种信任边界攻击类别,评估深度代理的安全性,发现高风险类别如Denial-of-Wallet和Authorization Confusion,揭示代理在持久交互中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05853 2026-02-06 cs.CL 70%

RRAttention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context Inference

RRAttention: 通过每头轮换位移实现动态块稀疏注意力以支持长上下文推理

Siran Liu, Guoxia Wang, Sa Wang, Jinle Zeng, HaoYang Xie, Siyu Lou, JiaBin Yang, DianHai Yu, Haifeng Wang, Chao Yang

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RRAttention通过轮换位移策略实现动态块稀疏注意力,提升长上下文推理效率,实现99%的完整注意力性能和2.4倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05366 2026-02-06 cs.IR cs.CL 70%

Multi-Field Tool Retrieval

多领域工具检索

Yichen Tang, Weihang Su, Yiqun Liu, Qingyao Ai

机构 * DCST, Tsinghua University(清华大学北京研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出多领域工具检索框架,通过细粒度多字段建模解决工具检索中的文档不完整、语义不匹配和多方面效用问题,实现更高效的任务解决。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04764 2026-02-05 cs.CL 70%

Beyond Many-Shot Translation: Scaling In-Context Demonstrations For Low-Resource Machine Translation

超越多示例翻译:为低资源机器翻译扩展上下文演示

Luis Frentzen Salim, Esteban Carlin, Alexandre Morinvil, Xi Ai, Lun-Wei Ku

机构 * Institute of Information Science, Academia Sinica(台湾“中央研究院”信息科学研究所) National Taiwan University of Science and Technology(台湾科技大学) Ecole Centrale de Marseille(马赛中央理工学院) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探索了通过扩展上下文长度来改进低资源机器翻译的ICL方法,发现增加上下文可提升性能但存在饱和点,且不同语料库类型对结果影响显著。

Comments 8 pages, 18 figures, EACL 2026 Conference - LoResMT workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02499 2026-02-05 cs.CL 70%

ROSA-Tuning: Enhancing Long-Context Modeling via Suffix Matching

ROSA-Tuning: 通过后缀匹配增强长上下文建模

Yunao Zheng, Xiaojie Wang, Lei Ren, Wei Chen

机构 * Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学) Li Auto Inc.(Li Auto公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ROSA-Tuning通过结合CPU的ROSA检索模块与范围受限注意力,提升长上下文建模能力,实现高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03200 2026-02-04 cs.CV cs.AI 70%

Hand3R: Online 4D Hand-Scene Reconstruction in the Wild

Hand3R: 在线4D手-场景重建

Wendi Hu, Haonan Zhou, Wenhao Hu, Gaoang Wang

机构 * Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 Hand3R通过结合预训练手专家和4D场景基础模型,实现了在线4D手-场景重建,无需离线优化,提升了手部和场景的联合重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12992 2026-02-04 cs.CL 70%

MemoryFormer: Minimize Transformer Computation by Removing Fully-Connected Layers

MemoryFormer: 通过移除全连接层来减少Transformer计算

Ning Ding, Yehui Tang, Haochen Qin, Zhenli Zhou, Chao Xu, Lin Li, Kai Han, Heng Liao, Yunhe Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei HiSilicon(华为海思)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MemoryFormer通过移除全连接层,利用内存查找表和哈希算法替代线性投影,显著降低Transformer计算复杂度并提升效率。

Comments NeurIPS 2024. Code available at https://github.com/ningding-o/MemoryFormer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01683 2026-02-03 cs.CV cs.AI 70%

FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding

FreshMem: 基于大脑的频率-空间混合内存用于流视频理解

Kangcong Li, Peng Ye, Lin Zhang, Chao Wang, Huafeng Qin, Tao Chen

机构 * College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FreshMem通过频率-空间混合内存网络,提升流视频理解的连续感知能力,实现短期保真与长期一致性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01362 2026-02-03 cs.CL 70%

Balancing Understanding and Generation in Discrete Diffusion Models

在离散扩散模型中实现理解和生成的平衡

Yue Liu, Yuzhong Zhao, Zheyong Xie, Qixiang Ye, Jianbin Jiao, Yao Hu, Shaosheng Cao, Yunfan Liu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 XDLM通过平稳噪声核平衡理解和生成能力,实现MDLM和UDLM的理论统一并提升生成质量与理解能力。

Comments 32 pages, Code is available at https://github.com/MzeroMiko/XDLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23654 2026-02-03 cs.CL 70%

ARC: Argument Representation and Coverage Analysis for Zero-Shot Long Document Summarization with Instruction Following LLMs

ARC:用于遵循指令的LLM在零样本长文档摘要中的论点表示与覆盖分析

Mohamed Elaraby, Diane Litman

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ARC通过评估摘要对关键论点的保留情况,揭示了LLM在长文档摘要中的覆盖不足问题,并为改进摘要策略提供指导。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23188 2026-02-02 cs.CL 70%

Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience

受认知神经科学启发的深度搜索与分层元认知监控

Zhongxiang Sun, Qipeng Wang, Weijie Yu, Jingxuan Yang, Haolang Lu, Jun Xu

机构 * Gaoling School of Artificial Intelligence\ University of China Beijing China School of Information Technology Search Applications Department, Tencent Beijing China Beijing University of Posts Gaoling School of Artificial Intelligence\ University of China Search Applications Department, Tencent

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出DS-MCM框架,通过分层元认知监控机制提升深度搜索的性能和鲁棒性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22966 2026-02-02 cs.CL 70%

A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training

注意力与残差汇流的统一视角:异常驱动的重缩放对变换器训练至关重要

Zihan Qiu, Zeyu Huang, Kaiyue Wen, Peng Jin, Bo Zheng, Yuxin Zhou, Haofeng Huang, Zekun Wang, Xiao Li, Huaqing Zhang, Yang Xu, Haoran Lian, Siqi Zhang, Rui Men, Jianwei Zhang, Ivan Titov, Dayiheng Liu, Jingren Zhou, Junyang Lin

机构 * Qwen Team(Qwen团队) University of Edinburgh(爱丁堡大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出异常驱动重缩放对变换器训练的重要性,通过统一注意力与残差汇流的起源,展示了异常值在训练稳定性与性能提升中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22570 2026-02-02 cs.CV cs.LG 70%

Leveraging Data to Say No: Memory Augmented Plug-and-Play Selective Prediction

利用数据说不:基于记忆的插拔式选择预测

Aditya Sarkar, Yi Li, Jiacheng Cheng, Shlok Mishra, Nuno Vasconcelos

机构 * University of Maryland, College Park(马里兰大学) University of California, San Diego(加州大学圣地亚哥分校) Qualcomm AI(高通人工智能) Yale University(耶鲁大学) Meta AI

专题命中 长上下文与记忆 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出基于记忆的插拔式选择预测方法,通过增强视觉语言嵌入来减少方差并改进分数校准,提升图像描述、匹配和细粒度分类性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22528 2026-02-02 cs.AI 70%

Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution

达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化

Hongze Mi, Yibo Feng, WenJie Lu, Song Cao, Jinyuan Li, Yanming Li, Xuelin Zhang, Haotian Luo, Songyang Peng, He Cui, Tengfei Tian, Jun Fang, Hua Chai, Naiqiang Tan

机构 * Didichuxing Co. Ltd(滴滴出行有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21609 2026-01-30 cs.AI 70%

RecNet: Self-Evolving Preference Propagation for Agentic Recommender Systems

RecNet: 为代理推荐系统设计的自进化偏好传播

Bingqian Li, Xiaolei Wang, Junyi Li, Weitao Li, Long Zhang, Sheng Chen, Wayne Xin Zhao, Ji-Rong Wen

机构 * GSAI, Renmin University of China(清华大学) Department of Data Science, City University of Hong Kong(城市大学数据科学系)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RecNet通过自进化机制实现代理推荐系统的实时偏好传播,利用路由代理和反馈驱动优化提升偏好传播的准确性和持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏