arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 19 篇

2603.14646 2026-03-17 cs.AI 89%

Dynamic Theory of Mind as a Temporal Memory Problem: Evidence from Large Language Models

动态心智理论作为时间记忆问题:来自大语言模型的证据

Thuy Ngoc Nguyen, Duy Nhat Phan, Cleotilde Gonzalez

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究探讨了动态心智理论作为时间延伸表征记忆问题,发现大语言模型在跟踪信念轨迹方面存在挑战,揭示了记忆与干扰机制在社会推理中的影响。

Comments 8 pages, 4 figures, 3 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14517 2026-03-17 cs.AI cs.LG 88%

Learning to Forget: Sleep-Inspired Memory Consolidation for Resolving Proactive Interference in Large Language Models

学习遗忘:受睡眠启发的记忆巩固用于缓解大语言模型中的前瞻性干扰

Ying Xie

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SleepGate框架,通过引入学习睡眠周期和三个机制缓解大语言模型中的前瞻性干扰,理论分析显示其将干扰范围从O(n)降至O(log n)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13289 2026-03-17 cs.LG cs.AI 86%

RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse

RelayCaching: 通过解码KV缓存重用加速LLM协作

Yingsheng Geng, Yuchong Gao, Weihong Wu, Guyue Liu, Jiang Liu

机构 * Beijing University of Posts(北京邮电大学) Tsinghua University, Beijing, China(清华大学) University of Electronic Science(电子科学大学) Peking University, Beijing, China(北京大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RelayCaching方法,通过重用前序代理的解码阶段KV缓存,在多代理LLM系统中减少冗余预填充计算,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06922 2026-03-17 cs.LG 83%

NerVE: Nonlinear Eigenspectrum Dynamics in LLM Feed-Forward Networks

NerVE:大型语言模型中前馈网络的非线性特征谱动态

Nandan Kumar Jha, Brandon Reagen

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 NerVE通过四个互补指标分析LLM中FFN的信息流动,揭示非线性特性对潜在空间利用的影响,验证了优化器几何对方差再注入的作用,适用于多种架构和优化器配置。

Comments Accepted to ICLR 2026. Project page: https://nerve-eigenspectrum.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14588 2026-03-17 cs.AI cs.IR cs.LG 81%

SuperLocalMemory V3: Information-Geometric Foundations for Zero-LLM Enterprise Agent Memory

SuperLocalMemory V3:信息几何基础用于零LLM企业代理记忆

Varun Pratap Bhardwaj

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于信息几何的零LLM企业代理记忆系统,通过信息几何度量、黎曼流形动力学和细胞sheaf模型,提升记忆检索与一致性,实验显示在LoCoMo基准上性能提升显著。

Comments 43 pages, 5 figures, 9 tables, 3 appendices. Code: https://github.com/qualixar/superlocalmemory. Zenodo DOI: 10.5281/zenodo.19038659

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13644 2026-03-17 cs.AI 77%

StatePlane: A Cognitive State Plane for Long-Horizon AI Systems Under Bounded Context

StatePlane:一种适用于受限上下文的长期智能系统认知状态平面

Sasank Annapureddy, John Mulcahy, Anjaneya Prasad Thamatani

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 StatePlane通过认知状态管理实现长期智能,无需扩展上下文窗口或重新训练模型,适用于多会话任务。

Comments 5 pages, 1 figure, 3 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13414 2026-03-17 cs.SE cs.AI 77%

Neuro-Symbolic Generation and Validation of Memory-Aware Formal Function Specifications

神经符号生成与验证内存感知的形式函数规范

Liao Zhang, Tong Chen, Xiwei Wu, Qi Liu, Xiyu Zhai, Xinqi Wang, Qinxiang Cao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) School of Computer Science and Engineering, University of Washington(华盛顿大学计算机科学与工程学院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出神经符号框架,通过自然语言描述和函数签名生成内存感知的形式函数规范,结合符号证明器和验证工具链迭代优化,提升形式规范的正确性与语法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15280 2026-03-17 cs.AI 70%

Advancing Multimodal Agent Reasoning with Long-Term Neuro-Symbolic Memory

通过长期神经符号记忆推进多模态代理推理

Rongjie Jiang, Jianwei Wang, Gengda Zhao, Chengyang Luo, Kai Wang, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出NS-Mem框架,结合神经记忆与符号结构,提升多模态代理的推理能力,实验证明其在推理准确率上优于纯神经记忆系统。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14212 2026-03-17 cs.AI 70%

Memory as Asset: From Agent-centric to Human-centric Memory Management

记忆作为资产:从以代理为中心到以人类为中心的记忆管理

Yanqi Pan, Qinghao Huang, Weihao Yang

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出以人类为中心的记忆管理范式,通过个人记忆存储、智能进化层和去中心化记忆交换网络,构建持续增长的知识基础架构,推动可扩展的人类中心AGI系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14050 2026-03-17 cs.NE 67%

A Theory of Appropriateness That Accounts for Norms of Rationality

一种考虑理性规范的适当性理论

Joel Z. Leibo, Alexander Sasha Vezhnevets, Manfred Diaz, John P. Agapiou, William A. Cunningham, Peter Sunehag, Logan Cross, Raphael Koster, Stanley M. Bileschi, Minsuk Chang, Iyad Rahwan, Simon Osindero, James A. Evans

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出一种以社会为基础的规范适当性理论,通过预训练的具有类大语言模型认知架构的个体生成行为,解释人类规范的上下文依赖性、任意性等特征,挑战传统理性选择理论。

Comments 39 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13412 2026-03-17 cs.CV 67%

WAT: Online Video Understanding Needs Watching Before Thinking

WAT:在线视频理解需要先观看再思考

Zifan Han, Hongbo Sun, Jinglin Xu, Canhui Tang, Yulong Lei, Xuchong Zhang, Hongbin Sun, Zhongjiang He, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) University of Science and Technology Beijing(北京科技大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13258 2026-03-17 cs.LG cs.AI cs.SE 62%

Your Code Agent Can Grow Alongside You with Structured Memory

你的代码代理可以与你一同成长,借助结构化记忆

Yi-Xuan Deng, Xiaoqin Liu, Yi Zhang, Guo-Wei Yang, Shuojin Yang

机构 * Tsinghua University(清华大学)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。

Comments Code Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15599 2026-03-17 cs.LG 57%

SmartSearch: How Ranking Beats Structure for Conversational Memory Retrieval

SmartSearch: 排序如何超越结构进行对话记忆检索

Jesper Derehag, Carlos Calva, Timmy Ghiurau

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.LG

AI总结 SmartSearch通过确定性流程从无结构对话历史中检索,利用实体发现规则和排序融合阶段,无需结构化和学习策略,在低资源下实现高召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14669 2026-03-17 cs.AI 57%

RenderMem: Rendering as Spatial Memory Retrieval

RenderMem:将渲染作为空间记忆检索

JooHyun Park, HyeongYeop Kang

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 RenderMem通过将渲染作为3D世界与空间推理的接口,使智能体能直接进行视角相关的可见性与遮挡推理,提升空间记忆系统的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14597 2026-03-17 q-bio.NC cs.AI 57%

D-MEM: Dopamine-Gated Agentic Memory via Reward Prediction Error Routing

D-MEM:通过奖励预测误差路由的多巴胺门控代理记忆

Yuru Song, Qi Xin

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 D-MEM通过奖励预测误差路由实现多巴胺门控代理记忆,减少token消耗并提升多跳推理和对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13676 2026-03-17 cs.AI 57%

TheraAgent: Multi-Agent Framework with Self-Evolving Memory and Evidence-Calibrated Reasoning for PET Theranostics

TheraAgent:具有自我进化记忆和证据校准推理的多智能体框架用于PET治疗诊断

Zhihao Chen, Jiahui Wang, Yizhou Chen, Xiaozhong Ji, Xiaobin Hu, Jimin Hong, Wolfram Andreas Bosbach, Axel Rominger, Ali Afshar-Oromieh, Hongming Shan, Kuangyu Shi

机构 * Fudan University(复旦大学) University of Bern(伯尔尼大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 TheraAgent通过自我进化记忆和证据校准推理,解决PET治疗诊断中数据稀缺、信息异构和证据推理的问题,实现75.7%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13360 2026-03-17 cs.CV cs.LG 57%

Graph2Video: Leveraging Video Models to Model Dynamic Graph Evolution

图2视频:利用视频模型建模动态图演变

Hua Liu, Yanbin Wei, Fei Xing, Tyler Derr, Haoyu Han, Yu Zhang

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

AI总结 本文提出Graph2Video框架,通过将目标链接的时序邻域视为视频帧序列,利用视频模型捕捉局部和长时动态,提升链接预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16443 2026-03-17 cs.CV 50%

VGGT-Long: Chunk it, Loop it, Align it -- Pushing VGGT's Limits on Kilometer-scale Long RGB Sequences

VGGT-Long:分块、循环、对齐——在千米级长RGB序列上推动VGGT的极限

Kai Deng, Zexin Ti, Jiawei Xu, Jian Yang, Jin Xie

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出VGGT-Long,通过分块处理、重叠对齐和轻量循环闭合优化,解决现有模型的可扩展性瓶颈,实现千米级户外环境的单目3D重建。

Comments IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14002 2026-03-17 cs.HC cs.SD 50%

LightBeam: An Accurate and Memory-Efficient CTC Decoder for Speech Neuroprostheses

LightBeam: 一种准确且内存高效的CTC解码器用于语音神经假体

Ebrahim Feghhi, Junlin Hu, Nima Hadidi, Jonathan C. Kao

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出LightBeam,一种无需WFST的CTC解码器,仅需10GB内存即可在Brain-to-Text'24和'25基准上实现最佳性能,通过延迟融合集成LLM,无需大N-gram语言模型。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏