arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 14 篇

2608.20274 2026-08-21 cs.AI cs.CL 新提交 90%

Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents

分解与传递:大语言模型智能体的跨任务技能迁移

Yiyang Feng, Biddut Sarker Bijoy, Niranjan Balasubramanian, Jiawei Zhou

机构 * Stony Brook University(石溪大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究探究LLM智能体跨任务技能迁移的可靠性,对比任务级与子任务级、文本与代码两种技能格式,提出结合特异性与抽象性的技能效用分数,发现子任务级文本技能迁移效果更优,可用于诊断技能记忆。

Comments 34 pages, 28 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19993 2026-08-21 cs.AI 新提交 90%

Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees

具备可证明双准则保证的大语言模型智能体最优技能选择

Yu Chen, Ruishuo Chen, Xun Wang, Zhuoran Li, Longbo Huang

机构 * Institute for Interdisciplinary Information Sciences Tsinghua University(清华大学交叉信息研究院)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体的技能选择问题,提出了具备可证明双准则保证的BPS算法,在BigCodeBench变体上实现了更高任务成功率且标记使用更少的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20202 2026-08-21 cs.AI cs.CL cs.CY cs.DB cs.LG 新提交 89%

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

MemTrapBench:大语言模型记忆使用中认知陷阱的基准测试

Mengru Wang, Haozhe Luo, Zhenqian Xu, Zhixiang Cui, Haoming Xu, Qu Yang, Jizhan Fang, Junfeng Fang, Ningyu Zhang

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究人员提出MemTrapBench基准测试,发现现有LLM记忆策略存在认知陷阱致性能下降,进而提出AdaptiveMem方法可缓解该问题并提升标准记忆基准性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19621 2026-08-21 cs.CL 新提交 89%

Mitigating Identity Essentialism in LLM Agents with Longitudinal Life Trajectories

通过纵向生活轨迹缓解大语言模型智能体中的本质主义身份偏差

Hexi Wang, Yujia Zhou, Bangde Du, Weihang Su, Xinyuan Cao, Qingyi Pan, Qingyao Ai, Yueyue Wu, Min Zhang, Yiqun Liu

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM智能体存在的身份本质主义偏差导致组内反应同质化的问题,提出LifeMem纵向记忆框架,在Add Health等数据集上验证其可提升与人类数据的一致性。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19564 2026-08-21 cs.CL 新提交 89%

Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM Agents

记住、验证还是询问?大语言模型智能体中记忆承诺的跨家族评估

Baichuan Li, Junyi Yao, Zihao Zheng

机构 * Southern Methodist University(南卫理公会大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);prompting(abstract);分类 cs.CL

AI总结 本研究通过MCB数据集评估LLM智能体的记忆承诺,发现模型验证事实变化更可靠,策略提示可降低错误持久率,少样本提示能提升部分任务准确率,但澄清召回率仍较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19758 2026-08-21 cs.CL 新提交 87%

FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving

FlashPrefill V2:面向长上下文大语言模型服务的块稀疏预填充注意力机制

Qihang Fan, Huaibo Huang, Zhiying Wu, Bingning Wang, Ran He

机构 * MAIS&NLPR, CASIA(中国科学院自动化研究所多模态人工智能系统与国家重点实验室) UCAS(中国科学院大学) WeChat, Tencent(腾讯微信)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FlashPrefill V2通过均值校正、适配FlashAttention-3/4的算子设计及原生支持分页KV缓存等,在128K上下文长度下为长上下文LLM服务提供了高效的块稀疏预填充注意力方案,加速比显著。

Comments FlashPrefill V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00554 2026-08-21 q-fin.TR cs.CL q-fin.CP 版本更新 86%

ContestTrade: A Multi-Agent Trading System Based on Internal Contest Mechanism

ContestTrade:一种基于内部竞争机制的多智能体交易系统

Li Zhao, Rui Sun, Zuoyou Jiang, Bo Yang, Yuxiao Bai, Mengting Chen, Jing Li, Zuo Bai

机构 * Stepfun FinStep

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对基于LLM的智能体在金融交易中决策受市场信息影响的问题,提出ContestTrade多智能体交易系统,通过“量化 - 预测 - 分配”竞争机制及两个专业团队协作,在A股回测中取得较好收益和风险调整绩效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19652 2026-08-21 cs.AI cs.CL 新提交 82%

Can Agent Memory Systems Track Evolving State?

智能体记忆系统能否追踪演化状态?

Xinyi Fan, Miri Liu, Ruozhen Yang, Siru Ouyang, Jiawei Han

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM智能体记忆系统的状态追踪能力不足问题,构建StateMemBench基准,提出StateMem方法,可显著提升当前状态准确率,且作为轻量包装器适配现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01548 2026-08-21 cs.AI cs.LG 版本更新 81%

LLM Capability Limits: Static Emergence and Dynamic Boundary Control

涌现不变性:从符号化思维到结构控制

Yi Liu

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19857 2026-08-21 cs.LG cs.CR 新提交 74%

Inadvertent Context Leakage in Language Models

语言模型中的无意上下文泄漏

Jaiden Fairoze, Neal Mangaokar, Kamalika Chaudhuri, Sanjam Garg, Saeed Mahloujifar

机构 * FAIR, Meta Superintelligence Labs(Meta超级智能实验室FAIR) University of California, Berkeley(加利福尼亚大学伯克利分校) Google DeepMind(谷歌DeepMind)

专题命中 长上下文与记忆 :language model(title);分类 cs.LG

AI总结 该研究发现语言模型的上下文窗口会无意泄漏敏感用户信息,提出自适应攻击方法,在8个专有模型上验证了2、4位数秘密的重建准确率,还展示了两种实际攻击方式,指出泄漏是模型能力的副产品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10828 2026-08-21 cs.AI 版本更新 70%

The First Drop of Ink: Nonlinear Impact of Distracting Information in Long-Context Reasoning

第一滴墨水:误导信息在长上下文推理中的非线性影响

Muhan Gao, Zih-Ching Chen, Kuan-Hao Huang

机构 * Department of Computer Science Engineering, Texas A\&M University, College Station, TX, USA NVIDIA AI Technology Center, NVIDIA Corporation, Santa Clara, CA, USA

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了误导信息在长上下文推理中的非线性影响,发现误导信息比例增加时,性能在初期急剧下降,后续变化较小。通过理论和实证分析,揭示了误导信息对注意力的 disproportionate 影响,并指出过滤收益主要来自减少上下文长度而非去除误导信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19920 2026-08-21 cs.CL 新提交 57%

Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

学习如何遗忘:面向长上下文稀疏注意力的微调

Matthias Seeger, Zeyu Zhang, Vihang Patil, Konstantinos Benidis, Sebastian Schelter

机构 * Amazon Web Services(亚马逊网络服务) University of Amsterdam(阿姆斯特丹大学) Amazon(亚马逊) Technical University Berlin(柏林工业大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 本文提出一种适配任意KV缓存策略的稀疏注意力模型微调方法,仅需中等硬件预算,性能优于精确注意力训练模型,还提供H2O稀疏注意力高效实现及开源库KeysAndValues支持。

Comments 39 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19723 2026-08-21 cs.CV cs.CL 新提交 57%

StreamSoccer: Event-Driven Memory for Streaming Soccer Commentary

StreamSoccer:用于流式足球解说的事件驱动记忆

Chenxi Shao, Bozhong Wang, Jiaxin Huang, Zhao Liu, Sunwei Zhu, Tianxin Hang, Gaoqi He, Yang Li, Changbo Wang

机构 * Migu Video Technology Co., Ltd.(咪咕视讯科技有限公司) South China University of Technology(华南理工大学) East China Normal University(华东师范大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 本研究提出StreamSoccer,一种用于流式足球解说的事件驱动系统,通过建模事件生命周期实现多时间范围解说,在数据集评估中取得优异性能且计算开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12616 2026-08-21 cs.AI cs.MM 版本更新 57%

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs

Jianhao Chen, Shiqin Wang, Haoyang Chen, Hanjie Zhao, Haozhe Liang, Zheng Wang, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Tianjin University(天津大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。

Comments This work was accepted by WISE2026. 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏