arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-06 至 2026-04-06 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 6 篇

2604.02734 2026-04-06 cs.AI 83%

Aligning Progress and Feasibility: A Neuro-Symbolic Dual Memory Framework for Long-Horizon LLM Agents

对齐进展与可行性:一种神经符号双记忆框架用于长周期LLM智能体

Bin Wen, Ruoxuan Zhang, Yang Chen, Hongxia Xie, Lan-Zhe Guo

机构 * Nanjing University(南京大学) Jilin University(吉林大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出神经符号双记忆框架,通过分离语义进展指导与逻辑可行性验证,解决长周期任务中进展漂移与可行性违反问题,实验显示在ALFWorld、WebShop和TextCraft上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03143 2026-04-06 cs.DC 78%

TokenDance: Scaling Multi-Agent LLM Serving via Collective KV Cache Sharing

TokenDance: 通过集体KV缓存共享扩展多智能体LLM服务

Zhuohang Bian, Feiyang Wu, Chengrui Zhang, Hangcheng Dong, Yun Liang, Youwei Zhuo

专题命中 长上下文与记忆 :LLM(title,abstract)

AI总结 TokenDance通过利用All-Gather模式实现集体KV缓存共享,提升多智能体LLM服务的并发数量,减少缓存存储并加快预填充速度。

Comments 14 pages, 14 figures, arXiv:submit/7438760 [cs.DC], preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02655 2026-04-06 cs.DB 75%

Semantic Data Processing with Holistic Data Understanding

基于整体数据理解的语义数据处理

Youran Sun, Sepanta Zeighami, Bhavya Chopra, Shreya Shankar, Aditya G. Parameswaran

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出HoldUp方法,通过联合处理数据记录并利用跨记录关系,提升语义数据处理的准确性,在15个真实数据集上表现优于现有方案,分类和聚类任务准确率分别提高33%和30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02650 2026-04-06 cs.CL 70%

Revealing the Learning Dynamics of Long-Context Continual Pre-training

揭示长上下文持续预训练的学习动态

Yupu Liang, Shuang Chen, Guanwei Zhang, Shaolei Wang, Suncong Zheng

机构 * Tencent Hunyuan(腾讯混元)

专题命中 长上下文与记忆 :LLM(abstract);SFT(abstract);分类 cs.CL

AI总结 本文通过Hunyuan-A13B模型系统研究长上下文持续预训练的学习动态,揭示大规模数据训练的必要性、欺骗性饱和与内在饱和的区别,以及通过检索头监测训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29093 2026-04-06 cs.CL cs.AI cs.IR 62%

APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay

APEX-EM:通过结构化程序-经验经验回放实现自主代理的非参数在线学习

Pratyay Banerjee, Masud Moshtaghi, Ankit Chadha

机构 * Amazon, AGI / Sunnyvale, USA(亚马逊 AGI / 美国森尼韦尔)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出APEX-EM框架,通过结构化经验表示和PRGII工作流,实现自主代理的非参数在线学习,提升跨领域任务的性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02431 2026-04-06 cs.IR 50%

SelRoute: Query-Type-Aware Routing for Long-Term Conversational Memory Retrieval

SelRoute:基于查询类型的长期对话记忆检索路由

Matthew McKee

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 SelRoute通过根据查询类型选择专用检索管道提升长期对话记忆检索效果,实验显示其在多个基准测试中表现优异,但存在推理密集型检索任务的失败模式。

Comments 12 pages, 12 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏