Quantized Side Tuning: Fast and Memory-Efficient Tuning of Quantized Large Language Models
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
Comments Published on NeurIPS 2023
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
Comments 10 pages
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.CL、cs.LG
Comments 15 pages, 6 figures
采用高带宽ReRAM近内存架构的分散式大语言模型(LLM)服务中的MoE专家执行
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 本文针对分散式LLM服务中MoE专家执行的资源效率问题,提出ReRAM近内存架构,通过优化池化、放置与取数策略提升资源占用率,在实测中大幅降低延迟与能耗。
用于LLM推理中可扩展KV缓存管理的光子-CXL存储设备
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 该研究针对LLM推理的存储墙问题,提出Marvell光子-CXL混合存储设备,实现32 TB共享内存,延迟降超50%,多轮对话首token时间提升6.6倍,解决了电气CXL池的部署痛点。
AgentTether:用于可靠大语言模型代理操作的图引导诊断与运行时干预
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究LLM代理生产可靠性有限问题,提出AgentTether运行时修复框架,通过抽象运行、构建关键转换图等定位故障子轨迹并转换为指导,经实验评估,该框架能提高修复效果,减少资源消耗,为代理部署提供实用可靠性层。
EconSimulacra:基于LLM代理的社会经济系统数字孪生平台
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出EconSimulacra,一种通过共享内部状态机制耦合消费经济、移动性和社交网络的多智能体模拟器,使代理能产生跨领域一致行为,并复现线上关注与线下流行度的非线性关系。
ESAA-Conversational:一种用于异构LLM编码智能体之间连续性、交接和策管的事件溯源记忆层
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 提出ESAA-Conversational架构,通过事件溯源实现跨多个LLM编码智能体的共享会话记忆,解决会话状态漂移问题,支持连续性、交接和策管。
Comments 11 pages, 1 table
LLM:基于历史恶意扫描的LSTM前瞻移动目标防御
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 提出LLM方法,利用LSTM网络预测攻击者可能扫描的目标地址,结合集成学习和动态变异机制,提升IP shuffling的安全性和降低开销。
统一KV池化以加速长上下文LLM服务
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 针对长上下文LLM服务中KV缓存卸载到主机内存和SSD时的高延迟问题,提出统一KV池化方法,聚合多设备并绕过内核文件系统,实现TTFT降低约4.1倍。
Comments 7 pages, 12 figures, 1 table
AerialClaw:一个用于LLM驱动的自主空中智能体的开源框架
机构 * Xidian University(西安电子科技大学) ; Xi'an University of Architecture and Technology(西安建筑科技大学)
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 提出AerialClaw开源框架,采用模块化脑-技能-运行时架构,使基于LLM的智能体能够理解自然语言任务、调用空中技能、闭环决策,提升无人机系统的灵活性、可复现性和可扩展性。
EviRerank:面向长文档LLM重排序的自适应证据构建
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 针对解码器-only LLM重排序长文档时推理成本高、相关信号被无关上下文稀释的问题,提出EviRerank框架,通过轻量选择器分块、自适应证据预算(AEB)和摘要增强(SA)构建紧凑证据上下文,再用LLM重排序,在多个基准上超越全文档重排序和强基线。
LIMCA: 用于自动化模拟内存计算架构设计探索的LLM
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出一种无需微调的大语言模型驱动框架LIMCA,通过无人工干预的自动化流程生成和验证模拟内存计算交叉阵列的电路网表,实现设计空间探索,在MNIST分类任务中达到≥96%准确率和≤3W功耗。
Comments 4 Figures, 6 Tables
Parallax: 参数化局部线性注意力用于语言建模
机构 * Northwestern University(西北大学) ; Tilde Research(Tilde研究) ; University of Washington(华盛顿大学)
专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);pretraining(abstract)
AI总结 提出Parallax,一种可扩展的参数化局部线性注意力机制,通过消除数值求解器并学习查询投影器,在语言模型预训练中实现一致的困惑度改进和下游任务迁移优势。
APS:面向群体规模LLM智能体的偏差控制自适应原型模拟
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 提出自适应原型模拟(APS)框架,通过原型响应、影子审计和尾部保护机制减少在线LLM调用,实现群体规模多轮模拟的高效近似,并在千万级智能体模拟中实现381倍加速且保持低分布差异。
Comments 32 pages, 5 figures
RecMem:基于递归的记忆巩固用于高效且有效的长运行LLM代理
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) ; Huawei Cloud(华为云) ; Huawei Theory Lab(华为理论实验室) ; Institute for Math and AI, Wuhan University(武汉大学数学与人工智能研究院)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 RecMem通过递归机制优化内存巩固,减少token消耗并提升准确性,有效解决长运行LLM代理的内存管理问题。
Comments Accepted to ACL 2026 Findings
有人隐藏了它:针对基于大语言模型的检索的查询无关黑盒攻击
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文提出一种无需查询或模型知识的黑盒攻击方法,通过零样本代理LLM生成可迁移的注入标记,揭示LLM检索系统的脆弱性。
多路径内存访问:突破LLM服务中的主机-GPU带宽瓶颈
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 本文提出MMA系统,通过多路径内存访问技术提升主机与GPU间的数据传输效率,减少LLM服务中的延迟瓶颈。
安全多智能体行为必须被维护,而非仅仅被断言:基于LLM的多智能体系统中的约束漂移
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 本文探讨了基于LLM的多智能体系统中约束漂移问题,指出安全约束在执行过程中可能丢失、扭曲或减弱,提出约束状态治理作为研究范式,以确保安全行为在轨迹中持续有效。
Comments 12 pages, 2 figures, 4 tables. Preprint
DADL:用于LLM代理系统企业工具库的声明性描述语言
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 DADL通过单一声明性文件描述REST API的端点、认证、分页等,实现企业工具库的集中管理和高效调用,显著降低上下文窗口消耗。
Comments 14 pages, 1 figure. Also published on Zenodo: https://doi.org/10.5281/zenodo.19931788
符号执行与多LLM协调:在不完整的Rust CVE代码片段中检测内存漏洞
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 本文提出结合符号执行(KLEE)与四代理多LLM架构,解决不完整代码问题,通过协作合成可编译的KLEE测试用例,检测Rust不安全代码中的内存漏洞,实现90.3%的测试用例编译成功率,检测到1,206个关键错误。
Comments 11 pages, 1 figure, to be published in : Ease 2026 The 6th International Workshop on Software Security Engineering
自动化-漏洞利用:一种多智能体LLM框架,用于基于数字孪生的自适应进攻性安全与风险缓解漏洞利用
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出自动化-漏洞利用框架,通过多智能体系统在复杂黑盒场景中实现自适应进攻性安全,利用数字孪生技术缓解风险,有效解决内存漏洞等安全问题。
虚拟代理能关心吗?设计一个具有同理心和个性化的LLM驱动对话代理
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出一种框架,通过检索增强架构、结构化记忆和多模态交互,设计出具有同理心和个性化支持的虚拟代理,以提升心理健康支持的质量和可靠性。
Comments Accepted manuscript version to be presented at the SCI-2026
多LLM协同生成高质量代码:利用互补模型优势
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出PerfOrch系统,通过分阶段、分类别的多模型协作提升代码生成质量,利用Memory模块选择最适合的模型,实现高准确率和效率。
CLPsych 2026 中的心理技术实验室:利用自然语言处理方法和大语言模型进行社交媒体文本分析
机构 * psytechlab(心理技术实验室)
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL
AI总结 在 CLPsych 2026 共享任务中,利用自然语言处理方法和大语言模型对社交媒体文本进行自我状态和幸福感分析与总结,为改进心理健康支持系统做贡献。
Comments Accepted by CLPsych2026. CLPsych 2026 will be held at ACL in San Diego July 4th, 2026
基于LLM的物理查询计划测试时优化
机构 * Stanford University(斯坦福大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; TogetherAI ; Bauplan
专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出DBPlanBench框架,利用LLM在测试时通过语义推理和进化搜索优化物理查询计划,在OLAP查询中实现1.05-1.12倍中位数加速,并支持小规模到大规模的迁移。
Comments Code is available at: https://github.com/BauplanLabs/DBPLANBENCH
人格攻击:针对大型语言模型的增量记忆注入越狱攻击
机构 * Chung-Ang University(Chung-Ang 大学)
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI
AI总结 提出一种基于记忆注入的越狱方法Persona Attack,通过逐步操纵模型上下文窗口,使模型在记忆积累中优先处理注入指令,从而绕过安全对齐,在特定配置下攻击成功率可达95%。