arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-08 至 2026-05-08 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 20 篇

2605.05716 2026-05-08 cs.AI cs.CL 90%

More Is Not Always Better: Cross-Component Interference in LLM Agent Scaffolding

更多并不总是更好:LLM代理构建中的跨组件干扰

Ming Liu

机构 * Amazon(亚马逊)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究LLM代理系统中组件交互导致的性能下降,发现最优组件数量依赖任务和模型规模,贪心选择不可靠,需通过交互分析进行任务特定子集选择。

Comments 10 pages, 5 tables; preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05247 2026-05-08 cs.SE 89%

DADL: A Declarative Description Language for Enterprise Tool Libraries in LLM Agent Systems

DADL:用于LLM代理系统企业工具库的声明性描述语言

Axel Dunkel

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 DADL通过单一声明性文件描述REST API的端点、认证、分页等,实现企业工具库的集中管理和高效调用,显著降低上下文窗口消耗。

Comments 14 pages, 1 figure. Also published on Zenodo: https://doi.org/10.5281/zenodo.19931788

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05499 2026-05-08 cs.AI 85%

FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis

FoodCHA:多模态LLM代理用于细粒度食物分析

Woojin Lee, Pranav Mekkoth, Ye Tian, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 长上下文与记忆 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文提出FoodCHA,一种多模态代理框架,通过分层决策过程提升食物识别的细粒度属性区分能力,实验显示其在类别和子类识别精度上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06313 2026-05-08 cs.IR cs.AI cs.CL 82%

Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering

超越分块:面向长文档问答的篇章意识层次检索

Huiyao Chen, Yi Yang, Yinghui Li, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology (Shenzhen)(计算与智能研究院,哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute (SLAI)(深圳环形区研究院(SLAI))

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种篇章意识层次检索框架,利用修辞结构理论处理长文档问答,通过 discourse parsing 和 LLM 增强实现结构与语义信息的融合,实验表明在多种语言和文档类型上均取得显著提升。

Comments 21 pages, 9 figures. Accepted at ACL 2026 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05794 2026-05-08 cs.LG cs.AI 82%

Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio

揭示大语言模型中模块梯度噪声不平衡:通过信噪比校准Adam

Ziqing Wen, Zhouyang Liu, Jiahuan Wang, Ping Luo, Li Shen, Dongsheng Li, Tao Sun

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究大语言模型中模块梯度噪声不平衡问题,提出基于信噪比的模块学习率校准方法,提升收敛速度和泛化能力,兼容高效内存训练算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04400 2026-05-08 cs.IT cs.LG math.IT 81%

Contextual Memory-Enhanced Source Coding for Low-SNR Communications

上下文记忆增强的信源编码用于低信噪比通信

Ziqiong Wang, Rongpeng Li

机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种内存增强的信源编码方案,通过内部化上下文模式提升信源编码的鲁棒性,减少残余信道错误对解码的影响,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22457 2026-05-08 cs.DC cs.ET 80%

CCCL: Node-Spanning GPU Collectives with CXL Memory Pooling

CCCL: 基于CXL内存池的节点跨度GPU集体通信

Dong Xu, Han Meng, Xinyu Chen, Dengcheng Zhu, Wei Tang, Fei Liu, Liguang Xie, Wu Xiang, Rui Shi, Yue Li, Henry Hu, Hui Zhang, Jianping Jiang, Dong Li

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CCCL库,利用CXL共享内存池实现跨节点GPU操作,解决同步、数据交错和通信并行化问题,实验显示在多个节点上性能提升显著,证明CXL在可扩展内存导向GPU通信中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06611 2026-05-08 cs.LG cs.AI stat.ML 73%

The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity

注意力陷阱的结构起源:方差差异、超级神经元和维度不均等

Siquan Li, Kaiqi Jiang, Jiacheng Sun, Tianyang Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Foundation Model Department(华为基础模型部门)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文揭示了大语言模型中注意力陷阱现象的结构成因,通过分析自注意力机制中的方差差异和前馈网络中超级神经元的激活,证明了维度不均等导致注意力陷阱的形成,并提出head-wise RMSNorm架构改进以稳定值聚合。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03482 2026-05-08 cs.CR cs.AI cs.LG 73%

MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents

MEMSAD: 基于梯度耦合的内存污染异常检测用于检索增强型智能体

Ishrith Gowda

机构 * Department of Electrical Engineering and Computer Sciences(电气工程与计算机科学系) University of California, Berkeley(加州大学伯克利分校) Berkeley AI Research(伯克利人工智能研究)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出MEMSAD,通过梯度耦合定理实现内存污染攻击的检测,证明其在对抗策略下的正确分类保证,并通过实验验证复合防御在所有攻击下的高检测率和低误报率。

Comments 28 pages, 9 figures, 6 theorems. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14724 2026-05-08 cs.CV cs.AI cs.CL 73%

HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding

HERMES: KV缓存作为分层内存用于高效视频流理解

Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HERMES提出一种无需训练的架构,通过将KV缓存视为分层内存框架,实现视频流的实时准确理解,提升处理速度并降低内存消耗。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06554 2026-05-08 cs.CL 70%

Long Context Pre-Training with Lighthouse Attention

长上下文预训练与Lighthouse注意力

Bowen Peng, Subho Ghosh, Jeffrey Quesnelle

机构 * Nous Research(Nous研究院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出Lighthouse注意力机制,通过分层选择策略实现高效长序列训练,减少计算复杂度,提升并行效率,并在训练后期恢复完整注意力模型,实验证明其在训练速度和最终损失上的优势。

Comments 18 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06365 2026-05-08 cs.AI cs.MA cs.SE 70%

From Agent Loops to Deterministic Graphs: Execution Lineage for Reproducible AI-Native Work

从代理循环到确定性图:可重复AI原生工作的执行轨迹

Josh Rosen, Seth Rosen

机构 * ThruWire, Inc.(ThruWire公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出执行轨迹模型,通过有向无环图表示AI生成工作,确保在变化中保持稳定性。对比实验显示,DAG在保持最终结果和中间状态一致性方面优于循环更新方法。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06342 2026-05-08 cs.CL 70%

Don't Lose Focus: Activation Steering via Key-Orthogonal Projections

不要失去焦点:通过键正交投影进行激活引导

Haoyan Luo, Mateo Espinosa Zarlenga, Mateja Jamnik

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出SKOP方法,通过约束有害的注意力重路由,减少激活引导对推理和检索性能的负面影响,实现最佳的引导-实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12635 2026-05-08 cs.AI 70%

Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks

记忆作为行动:面向长周期智能任务的自主上下文编纂

Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Hithink Research(慧思科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Huawei Noah’s Ark Lab(华为诺亚实验室) Peng Cheng Lab(鹏城实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MemAct框架,将工作记忆管理作为可学习的策略动作,通过端到端强化学习优化信息保留与任务表现,实验显示其在保持准确性的同时显著减少上下文长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03354 2026-05-08 cs.AI 70%

What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis

代理记忆内部发生了什么?从涌现到诊断的电路分析

Xutao Mao, Jinman Zhao, Gerald Penn, Cong Wang

机构 * City University of Hong Kong(香港城市大学) University of Toronto(多伦多大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究揭示了代理记忆中控制与内容电路的因果关系及共享枢纽的机制,开发出76.2%准确率的无监督诊断工具,优于监督基线13分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14337 2026-05-08 cs.CV 67%

On the Nature of Attention Sink that Shapes Decoding Strategy in Omni-LLMs

关于塑造 Omni-LLMs 解码策略的注意力 sink 性质

Suho Yoo, Youngjoon Jang, Joon Son Chung

机构 * KAIST(韩国科学技术院) VGG, University of Oxford(牛津大学视觉感知实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文研究 Omni-LLMs 中注意力 sink 的行为,发现其不仅反映头部冗余,还承担额外功能,提出 OutRo 方法通过特征空间对齐和放松因果掩码提升解码性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06614 2026-05-08 cs.AI cs.CL 62%

SkillOS: Learning Skill Curation for Self-Evolving Agents

SkillOS: 为自演化代理学习技能编目

Siru Ouyang, Jun Yan, Yanfei Chen, Rujun Han, Zifeng Wang, Bhavana Dalvi Mishra, Rui Meng, Chun-Liang Li, Yizhu Jiao, Kaiwen Zha, Maohao Shen, Vishy Tirumalashetty, George Lee, Jiawei Han, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 SkillOS通过经验驱动的强化学习方法,解决自演化代理中复杂长期技能编目的学习问题,优于记忆-free和强记忆基线,在效果和效率上均表现优异,技能库逐步演变成更丰富的Markdown文件。

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06316 2026-05-08 cs.LG cs.AI 62%

Pro-KLShampoo: Projected KL-Shampoo with Whitening Recovered by Orthogonalization

Pro-KLShampoo:利用正交化恢复白化过程的投影KL-Shampoo

Ruotong Sun, Ermin Wei

机构 * Department of Electrical & Computer Engineering, Northwestern University(电气与计算机工程系,西北大学) Department of Industrial Engineering & Management Sciences, Northwestern University(工业工程与管理科学系,西北大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Pro-KLShampoo,通过正交化恢复白化过程,改进了KL-Shampoo的Kronecker预置器结构,实验证明其在预训练任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06416 2026-05-08 cs.CL 57%

MiA-Signature: Approximating Global Activation for Long-Context Understanding

MiA-Signature:近似全局激活以实现长上下文理解

Yuqing Li, Jiangnan Li, Mo Yu, Zheng Lin, Weiping Wang, Jie Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Pattern Recognition Center, WeChat AI, Tencent(微信AI模式识别中心) Hunyuan Team, Tencent(腾讯文心一言团队)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 本文提出MiA-Signature,通过压缩表示近似全局激活对下游处理的影响,提升长上下文理解任务的性能。

Comments This is a work in progress; we will continue to revise and improve the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04334 2026-05-08 cs.CV cs.LG 57%

Submanifold Sparse Convolutional Networks for Automated 3D Segmentation of Kidneys and Kidney Tumours in Computed Tomography

子流形稀疏卷积网络用于计算机断层扫描中肾脏及肾肿瘤的自动三维分割

Saúl Alonso-Monsalve, Leigh H. Whitehead, Adam Aurisano, Lorena Escudero Sanchez

机构 * ETH Zürich, Institute for Particle Physics and Astrophysics(苏黎世联邦理工学院,粒子物理与天体物理研究所) University of Cambridge, Department of Physics(剑桥大学,物理系) University of Cincinnati, Department of Physics(辛辛那提大学,物理系) University of Cambridge, Department of Radiology(剑桥大学,放射学系)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

AI总结 本文提出基于体素稀疏化和子流形稀疏卷积网络的两阶段3D分割方法,用于提高CT图像中肾脏及肿瘤的分割效率与精度,实验表明其在速度和内存使用上均优于现有方法。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏