arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-01 至 2026-05-01 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 11 篇

2604.27283 2026-05-01 cs.CL cs.AI cs.LG 90%

Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents

学习何时记忆:风险敏感的上下文老虎机用于具有回避意识的记忆检索的LLM编码代理

Mehmet Iscan

机构 * PythaLab Yildiz Technical University(Yildiz技术大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RSCB-MC方法,通过风险敏感的上下文老虎机机制,解决编码代理在记忆检索中的安全性和有效性问题,实现非注入和回避作为首要安全动作。

Comments 26 pages, 7 figures, 10 tables. Code and deterministic local artifacts are available at the repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27003 2026-05-01 cs.LG cs.AI 90%

When Continual Learning Moves to Memory: A Study of Experience Reuse in LLM Agents

当持续学习转向记忆:对LLM智能体经验重用的研究

Qisheng Hu, Quanyu Long, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究揭示了内存增强型LLM智能体在持续学习中经验重用的问题,发现记忆检索时旧经验与新经验的竞争加剧了持续学习的瓶颈,提出了(k,v)框架以解耦外部记忆的设计关键要素。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27089 2026-05-01 cs.LG cs.DC cs.PF 90%

AutoSP: Unlocking Long-Context LLM Training Via Compiler-Based Sequence Parallelism

AutoSP:通过编译器基于的序列并行性解锁长上下文LLM训练

Ahan Gupta, Zhihao Wang, Neel Dani, Masahiro Tanaka, Olatunji Ruwase, Minjia Zhang

机构 * SSAIL Lab, University of Illinois Urbana-Champaign(SSAIL实验室,伊利诺伊大学厄巴纳-香槟分校) Anyscale Snowflake

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出AutoSP,一种自动优化长上下文LLM训练的解决方案,通过编译器实现序列并行性和激活检查点优化,提升训练效率。

Comments 13 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28157 2026-05-01 cs.CR 86%

FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption

FlashRT: 向计算和内存高效方向发展用于提示注入和知识腐败的红队测试

Yanting Wang, Chenlong Yin, Ying Chen, Jinyuan Jia

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出FlashRT框架,通过提升计算和内存效率,优化长上下文LLM的提示注入和知识腐败攻击,实现2-7倍的加速和2-4倍的内存节省,为系统评估长上下文LLM的安全性提供工具。

Comments The code is available at https://github.com/Wang-Yanting/FlashRT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27045 2026-05-01 cs.LG cs.AI cs.CL 83%

Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture

在健康教练代理中检测临床差异:一种双流记忆与协调架构

Samuel L Pugh, Eric Yang, Alexander Muir Sutherland, Alessandra Breschi

机构 * Verily Health Inc(Verily健康公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出双流记忆与协调架构,用于检测健康教练代理中的临床差异,通过验证患者报告与临床记录以确保安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27436 2026-05-01 eess.AS eess.IV 80%

BUT System Description for CHiME-9 MCoRec Challenge

BUT系统描述用于CHiME-9 MCoRec挑战

Dominik Klement, Alexander Polok, Nguyen Hai Phong, Prachi Singh, Lukáš Burget

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 本文提出BUT系统,通过长上下文目标说话人音频视频ASR模型和LLM聚类方法,在CHiME-9 MCoRec任务中实现高精度语音识别与对话组划分。

Comments Accepted to HSCMA 2026 Workshop at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28149 2026-05-01 cs.LG 79%

Explainable Load Forecasting with Covariate-Informed Time Series Foundation Models

具有协变量信息的时间序列基础模型可解释性负荷预测

Matthias Hertel, Alexandra Nikoltchovska, Sebastian Pütz, Ralf Mikut, Benjamin Schäfer, Veit Hagenmeyer

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出一种高效计算SHAP的方法,用于增强时间序列基础模型的透明度,通过在负荷预测任务中评估两种TSFMs,展示其在电力系统中的可靠性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27221 2026-05-01 cs.AI 74%

Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and Extraction

Web2BigTable: 一种用于互联网级信息搜索与提取的双层多智能体大语言模型系统

Yuxuan Huang, Yihang Chen, Zhiyuan He, Yuxiang Chen, Ka Yiu Lee, Huichi Zhou, Weilin Luo, Meng Fang, Jun Wang

机构 * University of Liverpool(利物浦大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI

AI总结 Web2BigTable通过双层架构实现互联网级信息搜索与提取,结合任务分解与并行执行,提升深度推理和结构化聚合能力,达到新的性能标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10702 2026-05-01 cs.CL cs.AI cs.IR 73%

Grounding Agent Memory in Contextual Intent

在上下文意图中 grounding 代理记忆

Ruozhen Yang, Yucheng Jiang, Yueqi Jiang, Priyanka Kargupta, Yunyi Zhang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 STITCH通过上下文意图索引提升长周期交互的记忆检索能力,有效减少歧义和干扰,实现在动态目标轨迹中的高效检索。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02845 2026-05-01 cs.CL cs.AI 73%

TiMem: Temporal-Hierarchical Memory Consolidation for Long-Horizon Conversational Agents

TiMem:用于长时域对话代理的时序-层次记忆巩固

Kai Li, Xuanqing Yu, Ziyi Ni, Yi Zeng, Yao Xu, Zheqing Zhang, Xin Li, Jitao Sang, Xiaogang Duan, Xuelei Wang, Chengbao Liu, Jie Tan

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) AI Lab, AIGility Cloud Innovation(AIGility云创新AI实验室) North China Electric Power University(华北电力大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Gaoling School of Artificial Intelligence, RUC(中国人民大学高陵人工智能学院) School of Biomedical Engineering, USTC(中国科学技术大学生物医学工程学院) Suzhou Institute for Advance Research, USTC(中国科学技术大学苏州市先进研究院) School of Computer Science and Technology, BJTU(北京理工大学计算机科学与技术学院) Hunan Central South Intelligent Equipment Co., Ltd.(湖南中南智能装备有限公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TiMem通过时序记忆树实现对话记忆的系统性巩固,提升长时域个性化效果,实现75.30%和76.88%的基准测试准确率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17196 2026-05-01 cs.CL cs.AI cs.LG 67%

Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models

理解并改进层次稀疏注意力模型中的长度泛化

Jiaqi Leng, Xiang Hu, Junxiong Wang, Jianguo Li, Wei Wu, Yucheng Lu

机构 * Fudan University(复旦大学) Tencent AI Lab(腾讯AI实验室) Cornell University(康奈尔大学) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) NYU Shanghai(纽约大学上海分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过系统分析揭示了层次稀疏注意力模型中长度泛化的核心设计原则,提出三种关键组件:非线性Chunk编码器、旁路残差路径和预训练中的稀疏选择,从而在RULER和BABILong数据集上实现了免训练的长度外推。

Comments ICLR 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏