OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents
OCELOT:面向隐私保护LLM代理的推理泄露预算
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
OCELOT:面向隐私保护LLM代理的推理泄露预算
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。
CompRank: 通过令牌级压缩和无解码评分实现高效的LLM重排序
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出CompRank框架,通过令牌级压缩和无解码注意力评分减少冗余计算,在BEIR数据集上仅保留10.2%文档令牌即达到接近全令牌的排序性能,并实现4.9-9.5倍端到端加速。
对抗提示反转攻击:面向LLM协作推理的信息论方法
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出信息论防御框架,通过最小化中间激活与输入提示的互信息来学习隐私表示,实现隐私-效用-延迟权衡,攻击成功率降低35%。
Comments Preprint. 33 pages, 5 figures
紧凑型大语言模型部署与世界模型辅助的卸载在移动边缘计算中
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文研究了移动边缘计算网络中紧凑型大语言模型(LLM)部署和世界模型辅助的推断卸载问题,提出了一种边缘紧凑型LLM部署(ECLD)框架,结合结构化剪枝、低比特量化和知识蒸馏来构建可部署于边缘的LLM变种,并通过四个互补指标评估这些模型。基于这些紧凑模型,提出了一个MEC卸载优化问题,旨在最小化长期平均推断延迟,同时满足设备能耗预算和LLM特定的服务质量约束。为了解决未知且时间变化的网络动态问题,开发了一种世界模型-近端策略优化(PPO)算法,该算法在原策略优化算法中加入了学习的递归世界模型,以提供改进的价值目标和短时间想象回放。
Comments 16 pages, 10 figures
RadKey: 一种基于LLM引导的RF反向散射系统用于穿墙击键推断
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 提出RadKey系统,利用无源反向散射标签捕获击键振动和声音,通过RF信号远距离穿墙窃听,结合信号处理与LLM在线自适应,实现跨用户、跨键盘的准确击键推断。
Comments Accepted to the 47th IEEE Symposium on Security and Privacy (IEEE S&P), 2026
理解企业如何采用模型上下文协议进行基于LLM的软件工程
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 通过对20名从业者的访谈,研究企业采用模型上下文协议(MCP)的现状,发现MCP支持跨系统协作和任务解耦,但面临生态系统碎片化、协调困难等问题,并提出标准化和低代码等改进需求。
Comments 12pages, preliminary version accepted at the 26th International Conference on Quality, Reliability, and Security (QRS 2026)
PALUTE: 基于查找表的处理-内存加速用于边缘LLM推理
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出PALUTE,一种基于查找表的3D DRAM处理-内存加速器,通过垂直组织实现高并行度,降低面积开销,在0.16W功耗下达到1264 TPS吞吐量,能效比CHIME提升12.8倍。
Comments ISLPED 2026 IEEE/ACM International Symposium on Low Power Electronics and Design
SparseX: 面向交错式LLM服务的高效段级KV缓存共享
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 针对长上下文LLM服务中非前缀重复内容导致的缓存效率低问题,提出SparseX,一种基于稀疏Q索引的段级KV缓存共享方法,通过单次前向传播中的稀疏KV重计算恢复跨段上下文交互,实现无额外模型或预处理的缓存复用。
Comments Corrected author metadata only; no changes to the paper content
基于拓扑的LLM驱动社交模拟:一种统一框架用于高效且真实的代理动态
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出TopoSim框架,通过整合拓扑结构推理提升社交模拟的效率和真实性,实验显示其在多个框架和数据集上均表现出更优的模拟精度和更低的资源消耗。
走向代理治理:什么决定了LLM代理在公共论坛中的干预?
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 研究LLM代理在公共论坛中干预行为的变化,发现四个部署选择(模型版本、权重开放状态、服务提供商、系统提示策略)独立影响响应率,且开放权重与封闭权重模型在可见挑战上的拒绝倾向存在系统性差异。
超越贪婪分块:面向LLM推理的SLO感知滑动窗口调度
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出SlidingServe系统,通过滑动窗口分块、轻量级批次延迟预测和动态规划批次构建,在保证服务质量约束下提升大语言模型在线推理的吞吐量并降低SLO违规率。
DeployBench: 用于研究工件部署的LLM智能体基准测试
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 提出DeployBench基准,包含51个跨领域的研究工件部署任务,评估LLM智能体在环境设置中的表现,发现主要失败原因是智能体过早停止且验证不充分。
Video-OPD:通过在线策略蒸馏实现多模态大语言模型在时序视频定位中的高效后训练
机构 * Nanyang Technological University(南洋理工大学)
专题命中 效率与部署 :post-training(title,abstract);large language model(title);language model(title)
AI总结 提出Video-OPD框架,利用在线策略蒸馏和教师验证分歧聚焦课程,以高效后训练多模态大语言模型进行时序视频定位,克服稀疏奖励和高计算开销问题。
通过消除不可扩展开销将LLM推理扩展到超越Amdahl极限
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 针对LLM推理中张量并行度增加导致的不可扩展开销问题,提出Albireo系统,通过重叠调度、I/O与计算及序列并行采样来提升最优并行度,从而显著提高吞吐量、降低延迟和能耗。
将Resident KV声明降级到LLM服务运行时的故障关闭
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 本文提出一种故障关闭的降级关系,用于将未来KV重用声明映射到LLM服务运行时的原语,通过检查器验证运行时是否满足声明义务。
Comments 24 pages, 2 figures. Public artifact: https://github.com/gustavgauge/resident-kv-lowering-artifact
基于多层潜在原型的高效LLM审核
机构 * University of Warsaw(华沙大学)
专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出多层原型审核器(MLPM),利用多层中间表示的原型实现轻量、高效且可定制的输入审核,在多个基准上达到最优性能,并可与输出审核结合提升响应安全性。
重新审视LLM剪枝对测试时缩放的有效性
机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究非结构化剪枝对推理型大语言模型测试时缩放性能的影响,发现其优于结构化剪枝甚至有时超过未剪枝模型,并探讨了层间稀疏分配策略的作用。
SiDP:面向离线LLM推理的内存高效数据并行
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出SiDP,一种将权重视为带宽支持的共享资源的内存高效数据并行范式,通过Weight-as-a-Service和Compute-as-a-Service两种模式,在相同配置下将可用KV容量提升至1.8倍,端到端吞吐量提升至1.5倍。
重新思考智能体RAG:迈向超越嵌入的LLM驱动逻辑检索
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 提出一种智能体RAG框架,让LLM通过逻辑表达式控制检索,使用轻量级倒排索引后端,在降低成本和幻觉的同时匹配强基线性能。
AlignedServe:编排前缀感知批处理以构建高吞吐量和计算高效的LLM服务系统
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对LLM服务中解码迭代内的气泡问题,提出基于前缀感知批处理的AlignedServe框架,通过分组相似KV缓存长度的请求、CPU内存维护大量飞行请求、批级调度和GPU间预取KV缓存,显著提升解码吞吐量并降低延迟。
TokenCake: 一种面向基于LLM的多智能体应用的KV缓存中心化服务框架
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出TokenCake,一种面向基于LLM的多智能体应用的KV缓存中心化服务框架,通过智能体感知设计共同优化调度和内存管理,以解决KV缓存中的空间竞争和时间利用率问题,实验表明其显著降低了端到端延迟并提高了GPU内存利用率。
Comments 14 pages, 17 figures, 3 tables, 2 algorithms
C2CServe: 利用NVLink-C2C实现弹性无服务器LLM服务的MIG
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 本文提出C2CServe,一种基于MIG的无服务器LLM服务系统,利用NVLink-C2C实现模型在请求粒度上的切换,减少冷启动延迟并保持高响应质量。
CASPIAN: 通过跨通道因果监控在线检测和归因LLM多智能体系统中的级联攻击
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 本文提出CASPIAN框架,通过跨通道因果监控在线检测和归因LLM多智能体系统中的级联攻击,其核心方法是利用动态因果影响矩阵和晚交互条件转移熵公式,实现对级联行为的统一分析,并在检测准确性和早期级联识别方面优于现有方法。
先手势,LLM辅助语音补充:通过增强现实中的虚拟对应物探索多模态机器人'提线人'遥控
机构 * KTH Royal Institute of Technology(皇家理工学院)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文探讨了通过增强现实中的虚拟对应物实现多模态机器人遥控的方法,比较了仅手势和结合语音与手势的交互方式在性能和用户体验上的差异,提出设计指南以平衡效率、鲁棒性和用户专业性。
Comments This work is under peer review
PersonaFingerprint:基于LLM驱动浏览的现代网站人格推断测量
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 本文研究了现代网站中通过加密流量元数据推断用户人格的隐私风险,提出了一种基于LLM驱动的多代理浏览框架,并展示了在混合网站流量中人格推断的高准确率。
GEAR:通过自蒸馏实现的粒度自适应优势重加权用于LLM智能体
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 GEAR通过自蒸馏获取token和片段级信号,实现粒度自适应的优势重加权,提升长时间跨度任务中的智能体性能,实验表明在数学推理和工具使用任务中优于传统方法。
SieveFL:面向可扩展LLM故障定位的分层运行时感知剪枝
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 SieveFL通过分层过滤机制提升LLM故障定位效率,通过预处理过滤减少候选方法数量,提升准确率和排名质量,无需使用前沿模型。
位置:LLM推理应作为能量到令牌生产进行评估
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 本文提出将LLM推理视为能量到令牌生产,强调在固定质量和性能目标下,约束从理论峰值计算转向实际能源、冷却和效率问题,呼吁报告能耗、绑定约束和效率指标。
TourMart: 一种用于LLM旅行代理佣金管理的参数审计工具
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 TourMart通过参数lambda和kappa驱动反事实分析,区分LLM工程故障与真实商业引导,验证代理引导效果,输出合规报告。
基于代理AI的无人机网络部署:一种增强型精确势博弈方法
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文提出基于精确势博弈的无人机网络部署优化框架,结合代理AI与双重空间尺度算法,提升网络连接性与吞吐量,通过LLM自动生成效用权重以增强适应性。
Comments 16 pages, 8 figures