arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 271 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 271 篇

2509.21862 2026-06-16 cs.AI cs.MA cs.SI econ.GN q-fin.EC 版本更新 87%

Shachi: A Modular, Controllable Framework for LLM-Based Agent-Based Modeling of Emergent Collective Behavior

Shachi: 一种用于基于LLM的涌现集体行为建模的模块化、可控框架

So Kuroki, Yingtao Tian, Kou Misaki, Takashi Ikegami, Takuya Akiba, Yujin Tang

机构 * Sakana AI, Japan(日本Sakana AI) The University of Tokyo, Japan(日本东京大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Shachi框架,将智能体认知分解为配置、记忆和工具等独立可控组件,通过扰动实验研究微观认知特征如何影响宏观群体动态,并在10任务基准和关税冲击案例中验证其有效性。

Comments Accepted to ALIFE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29640 2026-06-15 cs.AI 版本更新 87%

VikingMem: A Memory Base Management System for Stateful LLM-based Applications

VikingMem:面向有状态LLM应用的记忆库管理系统

Jiajie Fu, Junwen Chen, Mengzhao Wang, Aoxiang He, Maojia Sheng, Xiangyu Ke, Yifan Zhu, Yunjun Gao

机构 * Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出记忆库(Memory Base)数据管理范式,并基于VikingDB向量引擎实现VikingMem系统,通过事件与实体抽象、主题时间线压缩和时间加权召回,在长期记忆基准上提升检索效果达30%。

Comments Accepted by VLDB26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12213 2026-06-09 cs.AI 版本更新 87%

Goal-Oriented Reasoning for RAG-based Memory in Conversational Agentic LLM Systems

面向目标的推理用于基于RAG的记忆在对话型代理LLM系统中

Jiazhou Liang, Armin Toroghi, Yifan Simon Liu, Faeze Moradi Kalarde, Liam Gallagher, Scott Sanner

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Goal-Mem框架,通过目标导向的推理提升RAG记忆在复杂任务中的表现,尤其在多跳推理和隐含推理中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19138 2026-08-05 cs.CR cs.AI cs.LG cs.SE 版本更新 87%

AgenticSCR: An Autonomous Agentic Secure Code Review for Immature Vulnerabilities Detection

AgenticSCR: 一种用于检测初期漏洞的自主代理安全代码审查

Wachiraphan Charoenwet, Kla Tantithamthavorn, Patanamon Thongtanunam, Hong Yi Lin, Minwoo Jeong, Ming Wu

机构 * The University of Melbourne(墨尔本大学) Monash University(莫纳什大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 AgenticSCR通过结合LLMs、自主决策和语义记忆,有效检测预提交阶段的初期漏洞,优于传统SAST工具和静态LLM基线。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE'26 Industry-Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01435 2026-08-04 cs.AI cs.CL cs.IR 版本更新 87%

Reliable Post-Retrieval Assembly for Agent Memory: Separating Evidence Extraction from Policy Execution

不要询问LLM追踪新鲜度:一种确定性的内存冲突解决策略

Vikas Reddy, Sumanth Reddy Challaram

机构 * IIT Kgp(印度理工学院科钦分校)

专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 针对基于LLM的内存系统中事实冲突解决性能低下的问题,提出用候选提取加Python max(serial)的确定性聚合替代LLM判断,在单跳任务上提升10.8个百分点,并扩展到多跳任务。

Comments 11 pages, 5 tables. Accepted as a poster at the Lifelong Agent Workshop at COLM 2026. Code: https://github.com/cvikasreddy/memory-conflict-resolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12447 2026-07-27 cs.LG cs.AI 版本更新 87%

The Computational Basis of Confidence in Large Language Models

大语言模型中置信度的计算基础

Dharshan Kumaran, Viorica Patraucean, Maks Ovsjanikov, Petar Veličković, Nathaniel Daw

机构 * Google DeepMind(谷歌DeepMind) École Polytechnique(巴黎综合理工学院) Princeton University(普林斯顿大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(title);分类 cs.AI、cs.LG

AI总结 研究大语言模型中置信度的计算基础,利用统计决策置信度框架,通过答案 - 对数差异测试其预测特征,结果表明在多种任务中答案对数可作潜在决策变量读出,为多模态语言模型置信度提供解释并统一研究框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15543 2026-07-10 cs.CL cs.AI 版本更新 87%

ParamMute: Suppressing Knowledge-Critical FFNs for Faithful Retrieval-Augmented Generation

ParamMute:抑制知识关键的前馈神经网络以实现忠实的检索增强生成

Pengcheng Huang, Zhenghao Liu, Yukun Yan, Haiyan Zhao, Xiaoyuan Yi, Hao Chen, Zhiyuan Liu, Maosong Sun, Tong Xiao, Ge Yu, Chenyan Xiong

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Language Technologies Institute, Carnegie Mellon University, United States(卡内基梅隆大学语言技术研究所)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究RAG中LLMs不忠实生成问题,提出ParamMute框架抑制相关FFNs激活并校准模型,通过CoFaithfulQA基准评估,显著提升忠实性,减少对参数记忆依赖,为提高LLM在RAG中的可信度提供新方向。

Comments 26 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26476 2026-06-17 cs.CL cs.AI cs.LG cs.PF cs.SE 版本更新 87%

Regression Language Models for Code

代码的回归语言模型

Yash Akhauri, Xingyou Song, Arissa Wongpanich, Bryan Lewandowski, Mohamed S. Abdelfattah

机构 * Cornell University(康奈尔大学) Google DeepMind(谷歌DeepMind) Google Cloud(谷歌云)

专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出回归语言模型(RLM),利用冻结的大语言模型编码器直接从文本预测代码执行结果(如内存占用、延迟、神经网络精度等),在多个任务上达到高相关度。

Comments Published in International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14391 2026-06-08 cs.LG cs.AI cs.CL 版本更新 87%

RePo: Language Models with Context Re-Positioning

RePo:具有上下文重定位的语言模型

Huayang Li, Tianyu Zhao, Deng Cai, Richard Sproat

机构 * University of Maryland(马里兰大学)

专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RePo机制,通过可微分模块重新分配token位置以减轻注意力层负担,在噪声上下文、结构化数据和长上下文任务上持续提升性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20064 2026-07-24 cs.AI 版本更新 86%

PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning

PRO-LONG:程序化内存实现长程推理

Alexis Fox, Junlin Wang, Paul Rosu, Bhuwan Dhingra

机构 * Duke University(杜克大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长程任务中LLM智能体的挑战,提出PRO-LONG框架,通过程序化内存管理上下文,保留交互日志并利用编码智能体进展高效搜索历史,在ARC-AGI-3上有显著提升,减少令牌使用并达到高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21028 2026-07-24 cs.AI 版本更新 86%

SciTrek: Evaluating and Improving Long-Context Numerical Reasoning over Scientific Articles

谁被引用最多?在科学文章上基准测试长上下文数值推理

Miao Li, Alexander Gurung, Irina Saparina, Mirella Lapata

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SciTrek基准测试通过长上下文科学文章问题探索LLM的数值推理能力,发现即使最佳模型在长上下文下也面临显著挑战,尤其在处理引用和复合逻辑问题时表现不佳。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01483 2026-07-21 cs.RO cs.AI 版本更新 86%

Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering

VL-KnG:从单目视频构建持久时空知识图谱以实现具身场景理解

Mohamad Al Mdfaa, Svetlana Lukina, Timur Akhtyamov, Arthur Nigmatzyanov, Dmitrii Nalberskii, Sergey Zagoruyko, Gonzalo Ferrer

机构 * Applied AI Institute, Moscow, Russia(莫斯科应用人工智能研究所)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VL-KnG通过构建时空知识图谱实现高效具身场景理解,采用LLM驱动的时空对象关联和图增强检索,无需3D重建,支持常数时间推理,优于现有前沿VLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21833 2026-07-14 cs.LG 版本更新 86%

Memory Savings at What Cost? A Study of Alternatives to Backpropagation

以何种代价节省内存?反向传播替代方案研究

Kunjal Panchal, Sunav Choudhary, Yuriy Brun, Hui Guan

机构 * College of Information and Computer Sciences, University of Massachusetts, Amherst(信息与计算机科学学院,马萨诸塞大学阿默斯特分校) Adobe, San Jose(Adobe公司,圣乔斯)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究比较BP、检查点BP、FmAD和ZO在LLM及视觉语言模型训练中的表现,发现FmAD和ZO虽省内存但有计算成本等问题,带检查点的BP在多方面更优,纠正了此前关于LLM优化的片面基准测试观点。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00554 2026-07-09 q-fin.TR cs.CL q-fin.CP 版本更新 86%

ContestTrade: A Multi-Agent Trading System Based on Internal Contest Mechanism

ContestTrade:一种基于内部竞争机制的多智能体交易系统

Rui Sun, Li Zhao, Zuoyou Jiang, Bo Yang, Yuxiao Bai, Mengting Chen, Jing Li, Zuo Bai

机构 * Stepfun FinStep

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对基于LLM的智能体在金融交易中决策受市场信息影响的问题,提出ContestTrade多智能体交易系统,通过“量化 - 预测 - 分配”竞争机制及两个专业团队协作,在A股回测中取得较好收益和风险调整绩效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18558 2026-06-29 cs.CV cs.AI 版本更新 86%

HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

HiMu: 面向长视频问答的分层多模态帧选择

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学INSIGHT实验室,以色列) Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学,以色列)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出HiMu框架,通过文本LLM将查询分解为层次逻辑树,由视觉和音频专家处理原子谓词,经模糊逻辑算子组合生成连续帧满意度曲线,在16帧预算下达到帧选择方法的最优精度,并作为即插即用模块提升多种MLLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06843 2026-06-23 cs.AI 版本更新 86%

United Minds or Isolated Agents? Exploring Coordination of LLMs under Cognitive Load Theory

统一思维还是孤立代理?探索认知负荷理论下LLM的协调

HaoYang Shang, Xuan Liu, Zi Liang, Jie Zhang, Haibo Hu, Song Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) University of California San Diego(加州大学圣地亚哥分校) Hong Kong Polytechnic University(香港理工大学)

专题命中 长上下文与记忆 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 受认知负荷理论启发,提出CoThinker多智能体框架,通过智能体分工和结构化通信降低认知负荷,在复杂推理任务上提升性能,但在低负荷任务上协调开销占优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16309 2026-06-09 cs.AI cs.LG cs.MA 版本更新 86%

ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning

ANNEAL:通过受控符号补丁学习适应大语言模型代理

Safayat Bin Hakim, Keyan Guo, Wenkai Tan, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) University at Buffalo(布法罗大学) University of Colorado Boulder(科罗拉多大学博尔德分校) University of Colorado Colorado Springs(科罗拉多大学科罗拉多州立分校)

专题命中 长上下文与记忆 :LLM(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 ANNEAL通过受控符号补丁学习适应大语言模型代理,解决重复故障问题,其核心机制FDKA能定位责任操作符并生成类型补丁,实现持久结构修复,优于现有方法。

Comments Code Implementation: https://github.com/sbhakim/anneal-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01952 2026-08-11 cs.CL cs.AI cs.LG 版本更新 86%

WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks

WebChoreArena:在现实繁琐网页任务上评估网页浏览智能体

Atsuyuki Miyai, Zaiying Zhao, Kazuki Egashira, Atsuki Sato, Tatsumi Sunada, Shota Onohara, Hiromasa Yamanishi, Mashiro Toyooka, Kunato Nishina, Ryoma Maeda, Kiyoharu Aizawa, Toshihiko Yamasaki

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出WebChoreArena,作为WebArena的扩展,包含532个耗时300多小时开发的繁琐网页任务,从大规模记忆、计算、长期记忆三维度评估网页浏览智能体,实验显示其能清晰衡量LLM进展且难度高于WebArena。

Comments COLM2026. Project Page: https://webchorearena.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17545 2026-07-22 cs.AI 版本更新 85%

Retain or Consolidate? Budget-Dependent Operator Selection for Language Agent Memory

保留还是合并?语言智能体记忆中依赖预算的算子选择

Qingcan Kang, Mingyang Liu, Shixiong Kai, Kaichao Liang, Zhentao Tang, Yuqi Cui, Tao Zhong, Mingxuan Yuan

专题命中 长上下文与记忆 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究语言智能体记忆中预算依赖的算子选择问题,核心方法是将算子效用分解,用离线抽象安全机制实现,主要贡献是通过实验揭示在不同预算下保留和合并策略的适用情况及算子效果差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24080 2026-06-11 cs.CL cs.DB 版本更新 85%

LLMpedia: A Transparent Framework to Materialize an LLM's Encyclopedic Knowledge at Scale

LLMpedia:一个大规模实现LLM百科全书知识的透明框架

Muhammed Saeed, Simon Razniewski

机构 * ScaDS.AI Dresden/Leipzig & TU Dresden, Germany(ScaDS.AI 德累斯顿/莱比锡及德累斯顿技术大学,德国)

专题命中 长上下文与记忆 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 提出LLMpedia框架,从三个模型家族中提取约130万篇百科全书文章,通过维基百科和网络证据审计,发现可验证真实率远低于MMLU基准,揭示了模型知识的事实性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13353 2026-07-14 cs.CL cs.LG cs.SE 版本更新 85%

Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Understanding

感知与敏感性:探讨语义回忆对长上下文代码推理的影响

Adam Štorek, Mukur Gupta, Samira Hajizadeh, Prashast Srivastava, Suman Jana

机构 * Columbia University(哥伦比亚大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了语义回忆对长上下文代码推理的影响,通过评估10种先进LLM发现,前沿模型在词汇回忆上表现优异,但语义回忆在长上下文中央位置时显著下降。引入语义回忆敏感性指标,提出SemTrace任务,展示LLM在长上下文中的位置效应。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07372 2026-07-14 cs.CL cs.AI 版本更新 85%

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

通过可扩展查找实现条件记忆:大语言模型稀疏性的新轴

Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Zhang, Yixu Wei, M. Y Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang

机构 * Peking University(北京大学) DeepSeek-AI

专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究针对Transformer缺乏知识查找原语的问题,引入条件记忆及Engram模块,通过制定稀疏分配问题发现U形缩放定律,扩展Engram至27B参数,在多领域提升性能,揭示其优势,为下一代稀疏模型提供重要建模原语。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21335 2026-06-15 cs.LG cs.CL 版本更新 85%

Sub-Token Routing for KV Cache Compression

子令牌路由用于KV缓存压缩

Wei Jiang, Wei Wang

机构 * Futurewei Technologies(未来智科)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出子令牌路由方法,在保留令牌内对值向量分组并选择性保留,与令牌级压缩互补,在LLM和VLM中提升压缩性能。

Comments 17 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03316 2026-07-28 cs.CV 版本更新 85%

When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models

当汇点帮助或伤害:面向大视觉-语言模型的注意力汇点统一框架

Jiho Choi, Jaemin Kim, Sanghwan Kim, Seunghoon Hong, Jin-Hwi Park

机构 * KAIST(韩国科学技术院) Chung-Ang University(中央大学) Technical University of Munich(慕尼黑工业大学)

专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文研究了大视觉-语言模型中注意力汇点的影响,提出统一框架分析其作为冗余 artifacts 或全局先验的作用,并通过 Layer-wise Sink Gating 模块平衡全局推理与局部证据。

Comments Acknowledgments updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00533 2026-07-09 cs.LG cs.IT math.IT 版本更新 84%

Toward Robust Open-set Adaptation: Synapse Consolidation Inspired by Rac1/MAPK Pathways

在开放测试流中学习并适应未知

Xiao Zhang, Tianyu Hu, Juntao Lyu, Qianchuan Zhao, Huimin Ma

机构 * University of Science and Technology Beijing(北京科技大学) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SyCo方法,通过Rac1和MAPK路径实现参数高效适应,解决LLM在动态任务中的适应问题,实验表明其在18个NLP数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01742 2026-08-06 cs.AI cs.CL 版本更新 84%

MemSIF: From Structured Interactions to Dual-Track Fact Memory for LLM Agents

MemSIF:从结构化交互到面向大语言模型智能体的双轨事实记忆

YuFei Luo, Xiucheng Xu, Zhen Yang

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大语言模型智能体的长期记忆问题,提出MemSIF框架,通过结构化交互记忆与双轨事实记忆缓解两种错位模式,在两个数据集上的五种主干模型中均取得最高总准确率。

Comments Submitted to AAAI 2027. 19 pages, 10 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24060 2026-08-13 cs.RO 版本更新 83%

RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation

SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统

Zhuoran Li, Zhiyang Li, Kaijun Zhou, Jinyu Gu

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。

Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29247 2026-06-18 cs.CL cs.AI cs.LG 版本更新 83%

MemRerank: Preference Memory for Personalized Product Reranking

MemRerank:用于个性化产品重排序的偏好记忆

Zhiyuan Peng, Xuyang Wu, Huaixiao Tou, Yi Fang, Yu Gong

机构 * Santa Clara University(圣克拉拉大学) Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MemRerank框架,通过强化学习将用户购买历史提炼为查询无关的偏好记忆,用于LLM购物代理的个性化重排序,在1-in-5选择任务中准确率提升高达10.61个百分点。

Comments correct author name in metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18421 2026-06-16 cs.CL cs.AI cs.LG 版本更新 83%

EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

EvoMemBench: 从自演化视角评估智能体记忆

Yuyao Wang, Zhongjian Zhang, Mo Chi, Kaichi Yu, Yuhan Li, Miao Peng, Bing Tong, Chen Zhang, Yan Zhou, Jia Li

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Createlink Technology(创-link科技) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Institute of Technology(北京理工大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EvoMemBench,从自演化视角评估智能体记忆,通过内存范围和内容两个维度构建统一基准,比较15种内存方法并发现当前内存系统尚未达到通用解决方案,长上下文基线仍具竞争力,内存在上下文不足或任务困难时效果显著,检索方法在知识密集型任务中表现优异,而程序和长期记忆方法在任务结构匹配时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17074 2026-08-04 cs.AR cs.AI cs.DC 版本更新 83%

ThAME: 3D Memory-Enabled Heterogeneous Accelerator for LLM Mixture of Experts

ThAME:用于大语言模型专家混合的支持3D内存的异构加速器

Pratyush Dhingra, Pramit Kumar Pal, Janardhan Rao Doppa, Partha Pratim Pande

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对传统硬件上MoE推理的瓶颈,提出ThAME这一3D异构多芯片架构,采用特殊内存芯片及计算映射策略,设计优化的片上网络通信主干,实验显示其在加速和能源效率上比现有技术有显著提升。

Comments Accepted for Publication in IEEE/ACM Embedded Systems Week (ESWEEK-26)

详情

展开后加载摘要…

URL PDF HTML 收藏