LAMPO: Large Language Models as Preference Machines for Few-shot Ordinal Classification
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments COLM 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments COLM 2024
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 5 pages; slightly revised abstract
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 13+3 pages; v2: abstract expanded and future research directions added; v3: minor clarifications added
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at ICLR 2024
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
LycheeMemory V2:基于语义片段级整合的LLM智能体高效长期记忆
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL
AI总结 LycheeMemory V2用语义片段级整合替代轮次级整合,降低LLM编码成本,在LoCoMo、LongMemEval-S上实现SOTA性能,构建token用量较A-Mem大幅减少且未增加查询开销。
Comments 34 pages, 5 figures
SHE:面向大语言模型智能体的轨迹驱动安全管控机制演化
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出SHE框架,将LLM智能体的安全管控机制分解为四个构件并引入归因引导演化循环,在Agent-SafetyBench上使攻击成功率降低3.1倍,还具备泛化与跨模型迁移能力。
Comments Project: https://github.com/RainbowQTT/SHE
SodaMem:面向大语言模型智能体的基于证据的时序图记忆
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对LLM智能体对话的时效性、来源追溯等问题,提出基于证据的时序图记忆SodaMem,在LongMemEval-S上以Flash级花费达到高准确率,性能优于部分高成本系统。
MNC:面向私有大语言模型智能体通信的范围受限语义解密
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对多智能体LLM系统的隐私泄露问题,提出范围受限语义解密协议MNC,通过绑定披露范围实现授权信息传递,阻止未授权操作,为私有LLM智能体系统提供实用通信边界。
面向LLM智能体的实用在线KV缓存压缩:一项实证研究
机构 * UC Santa Barbara(加州大学圣巴巴拉分校) ; LinkedIn(领英公司)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL
AI总结 该研究针对LLM智能体的KV缓存瓶颈,实证对比了令牌驱逐与注意力匹配两类在线压缩方法,发现延迟压缩可恢复性能,令牌驱逐在代理不完善时更鲁棒,能大幅压缩KV缓存并提升吞吐量。
AiFlow:面向流式大语言模型应用的带界背压令牌原生反应式编排框架
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有流式LLM工作流编排的背压等管理缺陷,提出AiFlow令牌原生反应式编排模型,经实验验证可降低应用TTFPT并控制队列深度。
Comments 24 pages, 5 figures, 12 tables, 1 algorithm, and 1 code listing. Public implementation: https://github.com/ModelEngine-Group/fit-framework
了解它,执行它:研究大语言模型个性化中的记忆利用
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究针对LLM个性化中记忆利用的问题,提出解耦评估范式,发现智能体常能回忆用户偏好却未在行为中体现,健康相关偏好的利用薄弱且风险最高。
大语言模型智能体中的内存来源洗白:用于持久内存的非放大防火墙
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对LLM智能体内存来源洗白的安全问题,提出PPMF防火墙,通过匹配行动风险与记忆权限,成功阻止高风险未授权行动,保障智能体内存安全。
Comments EMNLP2026 submitted
MIND:基于意图感知信息瓶颈的轻量且有效的LLM智能体记忆注入防御
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 针对LLM智能体记忆注入攻击,提出轻量防御框架MIND,通过意图感知信息瓶颈过滤冗余信息并识别恶意记忆,在ReAct-StrategyQA上大幅降低攻击成功率且保留任务性能与效率。
Σ-Mem:面向基于大语言模型(LLM)的多智能体系统的在线可靠性记忆
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 针对现有LLM多智能体系统记忆系统无法建模智能体可信度的问题,提出Σ-Mem在线可靠性记忆,基于决策后反馈更新实对称状态,在Qwen系列模型上实现自适应协调与更优性能。
IFCMemoryBench:评估基于大语言模型(LLM)的智能体在建筑信息模型(BIM)信息检索中的长期记忆能力
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 本文推出IFCMemoryBench基准,评估基于LLM的智能体在BIM信息检索中的长期记忆,发现现有通用记忆系统在该场景下表现差,存在领域迁移差距。
Comments KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI
全景监控:基于个人身份信息的自然主义输出令牌集合,用于研究大语言模型上下文窗口内的隐私泄露
机构 * Meta
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型上下文窗口内隐私泄露问题,引入PANOPTICON管道和数据集,由Meta模型生成含PII片段的提示,测量数据集多样性评估真实性,通过案例展示其在理解提示反转攻击中的效用及为LLM隐私研究奠基。
Comments 9 pages, 3 figures, 3 tables. Submitted to IEEE CARS 2026
学习交朋友:引导大语言模型智能体形成新兴社会关系
机构 * EPFL Lausanne, Switzerland(洛桑联邦理工学院) ; University of Technology Sydney(悉尼技术大学)
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究LLM智能体能否再现人类在线行为社会动态及相关机制。提出多智能体LLM模拟框架,设计行为奖励函数,经实验发现引导后的智能体形成稳定互动与社会关系,为研究LLM群体集体动态建立测试平台。
Comments NeurIPS 2025 Workshop: Scaling Environments for Agents (SEA)
通过BREW改进语言智能体:引导式经验学习环境知识
机构 * University of Michigan(密歇根大学) ; Independent(独立研究者) ; Microsoft(微软) ; Apple(苹果公司)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);language agent(title);large language model(abstract);language model(abstract)
AI总结 研究基于LLM的智能体无法从经验学习的问题,提出BREW框架,通过提炼交互轨迹成知识库、引入EG-MCTS算法及适应事后重标记等方法,在多基准测试中提升任务成功率并减少执行步骤,且知识库具有良好特性。
基于基于检索增强生成的记忆和多模态教练代理的端到端大语言模型飞行规划
机构 * George Washington University(乔治华盛顿大学) ; Metis Solutions Technology Inc
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对电动垂直起降飞机部署中传统飞行规划算法难以融入人类偏好的问题,提出FRAMe工具,集成规划器LLM、多模态教练代理和基于RAG的记忆,在多场景演示中效果最佳,能将自然语言指令转化为优质飞行路线。
Comments Accepted at the ICML 2026 LM4Plan Workshop
DeadPool: 通过零开销检查点热替换实现弹性LLM训练
机构 * Rutgers University(罗格斯大学) ; George Mason University(乔治·马歇尔大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出DeadPool,利用非关键路径内存检查点和通信器重建协议实现零开销热替换,在无故障时无额外开销,故障时40秒内恢复,支持高达512 GPU和65B参数模型。
BigMac: 打破多模态大语言模型训练中的计算与内存帕累托前沿
机构 * Peking University(北京大学) ; Independent Researcher(独立研究员) ; Xiaohongshu, Inc(小红书公司)
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出BigMac训练流水线,通过嵌套编码器和生成器计算到LLM流水线中,同时优化计算效率和内存使用,打破帕累托前沿。
TokenMizer: 面向长程LLM上下文管理的图结构会话记忆
机构 * Independent Researcher(独立研究者)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 提出TokenMizer,一种将LLM会话历史建模为类型化知识图的开源代理系统,通过混合提取、三级检查点和8层压缩流水线,在显著减少token开销的同时保留结构化决策信息。
Comments 9 pages, 6 figures. Code and benchmark: https://github.com/Shweta-Mishra-ai/tokenmizer
重新思考LLM集成应用的复杂性度量:超越源代码
机构 * Zihao Xu1, Yuekang Li1, Gelei Deng2, Yi Liu3, Zhenchang Xing45(未明确机构)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 提出HECATE工具,基于Prompt-as-Specification形式化方法,从提示层和代码层评估LLM集成应用的复杂性,发现提示层复杂性是独立维度,10个有效度量中7个为新增的结构广度度量。
Agri-SAGE:基于模拟的多智能体LLM用于上下文感知的农业咨询生成
机构 * Indian Institute of Science, Bengaluru(印度科学理工学院,班加罗尔) ; BNM Institute of Technology, Bengaluru(BNM理工学院,班加罗尔)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 提出Agri-SAGE框架,结合检索增强的多智能体LLM推理与APSIM生物物理模拟,生成并验证农艺建议;通过十年回顾分析,三种推理方法均优于静态基线,其中思维树实现最高产量,反思法以较低计算成本达到相当效果。
可对话的复杂性:作为可解释基质的智能体LLM集体
机构 * IT University of Copenhagen(哥本哈根信息技术大学) ; University of Oslo(奥斯陆大学) ; Østfold University of Applied Sciences(东福尔应用科学大学) ; Sakana AI
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出将智能体大语言模型集体作为人工生命研究的计算基质,利用自然语言通信实现可解释性,并综述了相关实例。
超越困惑度:面向LLM测试时训练中部署记忆声称的行为评估框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出行为评估框架,通过证据阶梯和显式记忆基线校准LLM测试时训练的记忆声称,揭示代理指标与部署行为之间的差距。
SeKV:面向长上下文LLM推理的分辨率自适应KV缓存与层次化语义记忆
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Microsoft Research(微软研究院)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出SeKV,一种分辨率自适应的语义KV缓存方法,通过熵引导的语义片段和GPU-CPU层次化存储,在不丢弃信息的情况下实现按需token级重建,平均性能提升5.9%,GPU内存减少53.3%。
重叠何时有帮助?OSU-Mem及LLM智能体轨迹记忆的细胞条件分析
机构 * Courant Institute of Mathematical Sciences(Courant数学科学研究所) ; Southeast University(东南大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出OSU-Mem方法,通过重叠语义单元组织轨迹记忆,发现当查询所需证据步骤共享工具调用或实体时重叠有帮助,否则有害。
Comments 32 pages, 4 figures, 18 tables