arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-29 至 2026-07-29 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 21 篇

2607.25380 2026-07-29 cs.CL 新提交 92%

Memory for Large Language Models

大语言模型的记忆

Sining Zhoubian, Dan Zhang, Evgeny Kharlamov, Jie Tang

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Bosch AI(博世人工智能)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 综述对大语言模型中记忆这一基础架构维度进行系统分类,沿表示、更新动态、持久性三个正交轴表征记忆,形式化相关机制,阐明不同内存概念界限,分析混合架构等,为以记忆为中心的LLM设计及未来创新提供基础。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25992 2026-07-29 cs.DB cs.AI 新提交 87%

MemLens: A Value-Aware Memory Management System with Interactive Analytics for LLM-based Agents

MemLens:一种用于基于大语言模型的智能体的具有交互式分析的价值感知内存管理系统

Shuyue Wei, Chang Liu, Zimu Zhou, Yongxin Tong, Lizhen Cui

专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.AI

AI总结 研究针对基于LLM的智能体内存管理问题,提出价值感知内存管理系统MemLens,通过端到端交互式分析仪表板展示内存生命周期,经学习助手应用程序帮助用户比较策略,可实现高效、可解释和个性化的长期内存管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24759 2026-07-29 cs.AI cs.CY cs.DL 新提交 87%

Beyond Memory: A Templated Substrate for Heterogeneous Collaborative Knowledge Work with LLM Agents

超越记忆:一种用于异构协作知识工作的带大语言模型代理的模板化基础架构

Priscila Saboia Moreira, Christopher R. Sweet

机构 * University of Notre Dame(圣母大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.AI

AI总结 研究指出知识工作成果难传承,大语言模型代理无持久记忆。提出llm-wiki-memory-template,它是异构协作知识工作基础架构,沿多人类、多代理、多领域三个轴,通过案例研究展示其能保留失败路径等,解决负面结果丢失问题。

Comments 15 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24841 2026-07-29 cs.CL cs.LG eess.SP 新提交 86%

Neuromorphic Diffusion Language Models: Addressing Compute and Memory Bottlenecks via Sparsity and Block Denoising

神经形态扩散语言模型:通过稀疏性和块去噪解决计算和内存瓶颈

Dengyu Wu, Clement Ruah, Jiechen Chen, Bipin Rajendran, Osvaldo Simeone

机构 * King’s College London(伦敦国王学院) Institute for Intelligent Networked Systems (INSI), Northeastern University London(伦敦东北大学智能网络系统研究所)

专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对自回归大语言模型推理低效问题,提出神经形态掩码扩散语言模型,结合块扩散与脉冲神经形态计算,利用脉冲诱导稀疏性减少参数流量和计算,开发模型分析协同效应,实验表明该模型在能源效率和吞吐量上有显著提升。

Comments Accepted for presentation at 2026 IEEE Workshop on Signal Processing Systems (SiPS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25140 2026-07-29 cs.AI cs.CL cs.GR cs.MA 新提交 84%

How Affect Propagates among LLM Agents: Emergent Emotional Contagion in Crowd Simulation

情感如何在大语言模型智能体之间传播:人群模拟中的涌现情感传染

Funda Durupinar

机构 * University of Massachusetts(马萨诸塞大学)

专题命中 长上下文与记忆 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究多智能体人群模拟中情感传播,通过感知 - 评估 - 表达循环及借鉴相关模型构建架构,在多场景评估,揭示情感传染动态,包括警报扩散、个性影响等,还发现评估步骤动态依赖后端。

Comments 31 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25820 2026-07-29 cs.CV 新提交 82%

Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion

基于大语言模型衍生成分标签和多模态融合的食品图像分割

Jui-Feng Chi, Wei-Ta Chu, Sheng-Long Lin

机构 * National Cheng Kung University(国立成功大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract)

AI总结 针对现有食品图像分割模型在相似成分和罕见类别上表现不佳的问题,提出两个多模态模块LIM-F和LIM-Q,利用大语言模型衍生标签提升分割性能,在FoodSeg103基准测试中取得领先,且内存消耗增加适度,为细粒度食品理解提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25614 2026-07-29 cs.LG cs.CL 新提交 79%

MemSFT: Mitigating Alignment Tax with an External Parametric Memory

MemSFT:使用外部参数内存减轻对齐代价

Jiarui Wang, Xiang Shi, Jiaqi Cao, Rubin Wei, Xiquan Wang, Hao Sun, Jingzhi Wang, Zhiqi Yang, Qipeng Guo, Bowen Zhou, Zhouhan Lin

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型应用于特定领域产生的对齐代价问题,提出MemSFT方法,通过参数内存解耦领域专业化与主干参数更新,经多领域多模型评估,能提升领域性能且通用性能下降小,实现通用与专业能力解耦。

Comments 33 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24794 2026-07-29 cs.AI cs.CV 新提交 77%

Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding

利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架

Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Jilin University(吉林大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型长视频理解受限问题,提出ReMem框架,通过双级记忆增强自适应,在查询和视频级别分别处理,能适应不同时间粒度,经实验验证在多个基准测试中实现高效零样本性能,提升模型长视频推理能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30880 2026-07-29 cs.CL cs.AI 版本更新 73%

PatchWorld: Gradient-Free Optimization of Executable World Models for Agent Environments

PatchWorld:可执行世界模型的免梯度优化

Jiaxin Bai, Yue Guo, Yifei Dong, Jiaxuan Xiong, Tianshi Zheng, Yixia Li, Tianqing Fang, Yufei Li, Yisen Gao, Haoyu Huang, Zhongwei Xie, Hong Ting Tsang, Zihao Wang, Lihui Liu, Jeff Z. Pan, Yangqiu Song

机构 * Hong Kong Baptist University(香港 Baptist 大学) Independent Researcher(独立研究员) HKUST(香港科技大学) Beijing Institute of Technology(北京理工大学) Southern University of Science and Technology(南方科技大学) Wayne State University(韦恩州立大学) University of Edinburgh(爱丁堡大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出 PatchWorld 框架,通过反例引导的代码修复将离线轨迹转化为可执行的 Python 世界模型,实现无需梯度优化的符号信念状态程序,在 AgentGym 环境中达到 76.4% 的宏观成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25816 2026-07-29 cs.AI 新提交 70%

Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL

推理时进行推测:通过联合智能体-推测器强化学习教智能体预测其下一个工具调用

Jiabao Ji, Yujian Liu, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Linkedin Inc(领英公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大型语言模型智能体等待工具调用结果时间长的问题,提出联合智能体-推测器强化学习方法,统一智能体和推测器为自推测智能体,复用缓存,提升了Qwen不同模型下一个工具调用的Hit@1指标及任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25032 2026-07-29 cs.SE cs.AI 新提交 70%

Authoring Agent Skills: A Software-Engineering Approach

编写智能体技能:一种软件工程方法

Giuseppe Destefanis

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究如何编写智能体技能,遵循软件工程原则,以Claude Code为参考实现阐述技能结构等,与其他塑造智能体行为机制比较并给出选择规则,还介绍评估驱动编写过程等,为智能体技能编写提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24873 2026-07-29 cs.AI cs.SD 新提交 70%

MusiChat: Vibe Composing for Music Creation

MusiChat:用于音乐创作的氛围作曲

Callie C. Liao, Duoduo Liao, Ellie L. Zhang

机构 * Stanford University(斯坦福大学) George Mason University(乔治梅森大学) IntelliSky(智能天空)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对AI音乐创作中迭代难问题,提出MusiChat系统,通过分层可控框架、记忆增强架构及混合意图路由机制,实现人机协作音乐创作,经评估在交互准确率和用户喜好比例上表现良好,支持多轮音乐创作和人机共创。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25125 2026-07-29 cs.CV 新提交 67%

LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos

LENS:用于长视频关键帧采样的自适应时空缩放

Ce Zhang, Jinxi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 研究针对长视频理解受限于上下文窗口的问题,提出无需训练的关键帧采样框架LENS,它能基于文本查询动态分配帧预算,在时空缩放间平衡,提升关键帧采样效果,优于现有方法,提高了Video-MME准确率。

Comments Accepted at ECCV 2026. Project page: https://zhangce01.github.io/LENS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25066 2026-07-29 cs.AI cs.CL 新提交 62%

Addressable Recall Compaction for Long Context-Window Control in AI Agents

用于人工智能代理中长上下文窗口控制的可寻址召回压缩

Thang Dang, Yuma Ichikawa, Sakina Fatima, Koichi Shirahata

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对长时程语言模型代理上下文窗口超界问题,提出ARC框架,将存档与活动上下文分离,以ID可寻址日志存储工具观察结果,压缩时替换旧观察结果。实验表明该方法能提高信息保留和服务效率。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24772 2026-07-29 cs.AI cs.CL 新提交 62%

RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation

RSMeM:用于遥感智能体的知识增强记忆进化及系统评估

Bingxian Wu, Yu Zhang, Zonghao Guo, Tang Liu, Chen Qian, Yuxiang Lu, Xingbo Du, Yanghao Li, Yidan Zhang, Chi Chen, Ling Yao, Maosong Sun

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有遥感智能体问题,提出RSMeM机制,通过分层知识基础和失败感知经验提炼两个组件,迭代吸收领域知识转化为执行经验,经实验验证能提升工具使用性能和答案质量,具有强大知识密度。

Comments Accepted to ACL 2026 Main. Code: https://github.com/AI9Stars/RSMeM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26017 2026-07-29 cs.CL 新提交 57%

UniMem: Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams

UniMem:用于无边界任务流的互补情景到参数记忆

Siyu Xia, Chenheng Zhang, Yanting Wu, Haoxuan Li, Jiajun Chai, Xiaohan Wang, Guojun Yin, Wei Lin, Zhouchen Lin, Haifeng Zhang, Jun Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Meituan(美团) AI Centre, Department of Computer Science, University College London(伦敦大学学院计算机科学系人工智能中心)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 研究针对大语言模型在无边界任务流部署的稳定性 - 可塑性困境,提出UniMem自路由框架,用可学习路由令牌协调互补记忆路径,能按需扩展记忆,实验证明其在长周期流任务序列中优于基线并保持执行保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25076 2026-07-29 cs.AI 新提交 57%

Towards an Agent Operating System - Lessons from Classical and Cloud OS

迈向智能体操作系统——从经典操作系统和云操作系统中汲取的经验教训

Gosia Steinder, Hubertus Franke

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 智能体人工智能系统处于发展试验阶段,缺乏核心抽象概念共识。研究提出借鉴经典和云操作系统发展路径,扩展原语推导新智能体抽象概念,精确指定语义并整合,以推动该领域发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23929 2026-07-29 cs.AI 版本更新 57%

MemTX: Transactional Belief Commit for Stateful Agent Memory

MemTX:用于有状态智能体内存的事务性信念提交

Xiaoyang Li, Yiqi Wang, Haohui Lu, Zhi Chen, Mo Li, Pingan Song, Mingkai Zheng, Taotao Cai

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体通过共享内存协调时内存写入问题,提出事务性信念提交协议MemTX,通过携带多种信息、在事务中暂存写入等方式,经机器检查确保不变量,在多主干上领先基线且无下游危害。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22690 2026-07-29 cs.AI 版本更新 57%

LazyMem: Retrieve Broadly, Construct Selectively for Efficient Long-Term Agent Memory

LazyMem:广泛检索,按需构建以实现高效长期智能体记忆

Jing Yu, Yibo Zhao, Jiaming Zhang, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,华东师范大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体长期记忆中原始对话历史的问题,提出LazyMem方法,将记忆构建推迟到查询时,通过轻量级模型处理候选池,经特定训练方式,在基准测试中取得高准确率,减少记忆令牌数和延迟。

Comments 29 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24998 2026-07-29 cs.AR 新提交 50%

VPR-Evolve: Multi-Agent-Driven Algorithm Evolution for FPGA Place and Route

VPR-Evolve:用于FPGA布局布线的多智能体驱动算法进化

Qihang Wu, Taizun Jafri, Aman Arora, Vidya A. Chhabria

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 研究针对CAD工具固定算法在不同电路设计效果不佳的问题,提出VPR-Evolve多智能体框架,通过进化VPR源代码优化布局布线。经实验,相比原始VPR和超参数调整基线,该框架在关键路径延迟、布线线长和工具运行时等方面有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00918 2026-07-29 cs.DC 版本更新 50%

DisDP: Disaggregating Compute, Network, and Storage for Model-Sharded Data-Parallel Training

DisDP:用于模型分片数据并行训练的计算、网络和存储解耦

Mo Sun, Zihan Yang, Changyue Liao, Yingtao Li, Jie Zhang, Kaiqi Chen, Fei Wu, Zeke Wang

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 研究针对模型分片数据并行训练中网络通信开销大问题,提出DisDP架构,通过将计算、网络和存储解耦,把集合操作卸载到智能网卡和交换机,存储卸载到增强型参数服务器,提升了GPU利用率,实验验证了该方法的高效性。

Comments Accepted by ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏