arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-06 至 2026-03-06 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 18 篇

2510.08966 2026-03-06 cs.AI cs.CL 90%

Beyond Prefixes: Graph-as-Memory Cross-Attention for Knowledge Graph Completion with Large Language Models

超越前缀:基于图记忆的交叉注意力用于大型语言模型的知识图谱补全

Ruitong Liu, Boxu Lin, Peize Li, Siyuan Li, Yunjia Wu, Te Sun, Chaohan Wu

机构 * Peking University(北京大学) Dalian University of Technology(大连理工大学) King’s College London(伦敦国王学院) Peng Cheng Laboratory(鹏城实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出图记忆调优方法,通过深度交叉注意力机制提升大型语言模型在知识图谱补全任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09982 2026-03-06 cs.CL 89%

INMS: Memory Sharing for Large Language Model based Agents

INMS: 基于大语言模型的智能体中的记忆共享

Hang Gao, Yongfeng Zhang

机构 * Rutgers University(罗格斯大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 INMS通过异步交互范式实现多智能体间的动态记忆共享,提升开放性场景下的智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04412 2026-03-06 cs.CL 88%

Additive Multi-Step Markov Chains and the Curse of Dimensionality in Large Language Models

加性多步马尔可夫链与大语言模型中维度灾难

O. V. Usatenko, S. S. Melnyk, G. M. Pritula

机构 * A. Ya. Usikov Institute for Radiophysics and Electronics Ukrainian Academy of Science(A. Ya. Usikov 无线电物理与电子研究所 乌克兰科学院)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL

AI总结 本文提出加性多步马尔可夫链模型,用于近似大语言模型动态,通过分解条件概率减少高阶马尔可夫过程的组合爆炸问题。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13586 2026-03-06 cs.CL cs.AI cs.LG 86%

ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding

ReFusion:一种具有并行自回归解码的扩散大语言模型

Jia-Nan Li, Jian Guan, Wei Wu, Chongxuan Li

专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 ReFusion通过整合序列重组到因果注意框架中,实现并行解码和高效生成,显著提升性能和速度,缩小与传统自回归模型的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05738 2026-03-06 cs.SE 85%

MioHint: LLM-assisted Mutation for Whitebox API Testing

MioHint: 利用大语言模型进行白盒API测试

Jia Li, Jiacheng Shen, Yuxin Su, Michael R. Lyu

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 MioHint利用大语言模型提升白盒API测试效率,实现更高的代码覆盖和突变准确性

Comments Accepted by ICSE 2026 (research track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04549 2026-03-06 cs.AI cs.CL cs.MA 81%

Adaptive Memory Admission Control for LLM Agents

自适应记忆准入控制用于大语言模型代理

Guilin Zhang, Wei Jiang, Xiejiashan Wang, Aisha Behr, Kai Zhao, Jeffrey Friedman, Xu Chu, Amine Anoun

机构 * Workday AI

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 提出自适应记忆准入控制框架,通过分解记忆价值因素提升大语言模型代理的长期记忆管理效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15654 2026-03-06 cs.CR cs.AI 79%

Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections

僵尸代理:通过自我强化注入实现自我演化大语言模型代理的持续控制

Xianglin Yang, Yufei He, Shuo Ji, Bryan Hooi, Jin Song Dong

机构 * School of Computing National University of Singapore(计算学院新加坡国立大学)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 研究提出僵尸代理攻击,通过自我强化注入实现对自我演化大语言模型代理的持续控制,揭示内存演化可将一次间接注入转化为持久妥协,表明单一会话提示过滤防御不足。

Comments Published as a workshop paper in Lifelong Agent @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22503 2026-03-06 cs.LG cond-mat.mtrl-sci cs.AI cs.NE 79%

LLEMA: Evolutionary Search with LLMs for Multi-Objective Materials Discovery

LLEMA:基于LLM的多目标材料发现进化搜索

Nikhil Abhyankar, Sanchit Kabra, Saaketh Desai, Chandan K. Reddy

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系) Center of Integrated Nanotechnologies, Sandia National Laboratories(桑迪亚国家实验室集成纳米技术中心)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LLEMA结合大语言模型与进化规则,通过多目标优化提升材料发现效率,实现高命中率和稳定性质的候选材料生成。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20685 2026-03-06 cs.CE 78%

GIT-BO: High-Dimensional Bayesian Optimization with Tabular Foundation Models

GIT-BO:基于表格基础模型的高维贝叶斯优化

Rosen Ting-Ying Yu, Cyril Picard, Faez Ahmed

专题命中 长上下文与记忆 :foundation model(title,abstract)

AI总结 GIT-BO通过结合表格基础模型和主动子空间机制,在高维空间中实现更高效的贝叶斯优化,优于现有GP方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04814 2026-03-06 cs.CL 77%

Beyond the Context Window: A Cost-Performance Analysis of Fact-Based Memory vs. Long-Context LLMs for Persistent Agents

超越上下文窗口:基于事实的记忆与长上下文LLM在持久代理中的成本性能分析

Natchanon Pollertlam, Witchayut Kornsuwannawit

机构 * Bricks Technology

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了基于事实的记忆系统与长上下文LLM在持久代理中的性能,发现记忆系统在成本上更具优势,尤其在长上下文下更经济。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04460 2026-03-06 cs.LG cs.AI 73%

VSPrefill: Vertical-Slash Sparse Attention with Lightweight Indexing for Long-Context Prefilling

VSPrefill:用于长上下文预填充的垂直斜线稀疏注意力与轻量级索引

Chen Guanzhong

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VSPrefill通过轻量级索引和垂直斜线结构提升长上下文预填充效率,实现高精度与高速度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04454 2026-03-06 cs.CL cs.AI 73%

Query Disambiguation via Answer-Free Context: Doubling Performance on Humanity's Last Exam

通过无答案上下文进行查询消歧:在人类最后一场考试中性能翻倍

Michael Majurski, Cynthia Matuszek

机构 * National Institute of Standards and Technology(国家标准与技术研究院) University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 长上下文与记忆 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过无答案上下文重写问题以减少歧义,显著提升模型在Humanity's Last Exam上的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05451 2026-03-06 cs.CL 70%

FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling

FlashAttention-4:异构硬件扩展下的算法与内核流水线协同设计

Ted Zadouri, Markus Hoehnerbach, Jay Shah, Timmy Liu, Vijay Thakkar, Tri Dao

机构 * Princeton University(普林斯顿大学) Meta Colfax Research(Colfax研究公司) NVIDIA(NVIDIA公司) Georgia Tech(佐治亚理工学院) Together AI

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FlashAttention-4通过异构硬件扩展下的算法与内核流水线协同设计,提升B200 GPU上的注意力计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05498 2026-03-06 cs.AI cs.CL 62%

The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks

尖峰、稀疏与汇点:大规模激活与注意力汇点的解剖

Shangwen Sun, Alfredo Canziani, Yann LeCun, Jiachen Zhu

机构 * New York University(纽约大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了Transformer中大规模激活与注意力汇点的关联性及作用机制,指出预归一化配置是二者共存的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04688 2026-03-06 q-bio.NC cs.AI cs.LG stat.ML 62%

Why the Brain Consolidates: Predictive Forgetting for Optimal Generalisation

为何大脑进行巩固:为最优泛化而预测遗忘

Zafeirios Fountas, Adnan Oomerjee, Haitham Bou-Ammar, Jun Wang, Neil Burgess

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) AI Centre, Department of Computer Science, University College London(大学计算机科学系人工智能中心) UCL Institute of Cognitive Neuroscience, University College London(大学认知神经科学研究所) UCL Queen Square Institute of Neurology, University College London(大学Queen Square神经学研究所)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出高容量神经网络通过预测遗忘优化存储表征的泛化能力,揭示了离线巩固在优化保留与泛化权衡中的计算作用。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04815 2026-03-06 cs.AI 57%

EchoGuard: An Agentic Framework with Knowledge-Graph Memory for Detecting Manipulative Communication in Longitudinal Dialogue

EchoGuard: 一种基于知识图谱记忆的代理框架,用于检测纵向对话中的操纵性沟通

Ratna Kandala, Niva Manchanda, Akshata Kishore Moharir, Ananth Kandala

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 EchoGuard通过知识图谱记忆和结构化循环检测纵向对话中的操纵性沟通,提升个体识别能力与自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01145 2026-03-06 cs.AI 57%

AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolution

AutoSkill: 通过技能自我进化实现经验驱动的终身学习

Yutao Yang, Junsong Li, Qianjun Pan, Bihao Zhan, Yuxuan Cai, Lin Du, Jie Zhou, Kai Chen, Qin Chen, Xin Li, Bo Zhang, Liang He

机构 * School of Computer Science and Technology, East China Normal University(1 计算机科学与技术学院,东华大学) Shanghai AI Laboratory(2 上海人工智能实验室)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 AutoSkill通过技能自我进化实现经验驱动的终身学习,使LLM代理能够自动推导、维护和重用技能,提升个性化能力的持续性和可重用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04826 2026-03-06 cs.DC 50%

The Semantic Arrow of Time, Part V: The Leibniz Bridge -- Toward a Unified Theory of Semantic Time

时间的语义箭头,第五部分:莱布尼茨桥——语义时间的统一理论

Paul Borrill

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文通过构建莱布尼茨桥,提出一个连接哲学、协议工程和物理的统一框架,解决FITO系统中的分布式计算难题。

Comments 6 figures. Part V of V in "The Semantic Arrow of Time" series

详情

展开后加载摘要…

URL PDF HTML 收藏