AnchorKV: Anchor-Residual KV Cache Compression
AnchorKV:锚点-残差键值缓存压缩
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 针对长上下文LLM推理的KV缓存内存瓶颈,提出AnchorKV压缩方案,不丢令牌且压缩20倍,70B规模下保留99%全缓存精度,大幅降低上下文成本。
Comments Under review
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
AnchorKV:锚点-残差键值缓存压缩
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 针对长上下文LLM推理的KV缓存内存瓶颈,提出AnchorKV压缩方案,不丢令牌且压缩20倍,70B规模下保留99%全缓存精度,大幅降低上下文成本。
Comments Under review
野外环境下的智能体编码:生产规模下GitHub Copilot轨迹的特征分析
机构 * Microsoft Azure Research(微软Azure研究院) ; Microsoft Azure(微软Azure)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 该研究对GitHub Copilot等AI编码智能体的生产规模轨迹进行特征分析,揭示其工作负载特性,设计轻量级空闲预测器,为智能体原生LLM服务基础设施提供实证基础。
Prox:基于大语言模型中近似中间通道显著性的无训练前馈网络激活稀疏化方法
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 Prox是一种两阶段无训练的SwiGLU前馈网络激活稀疏化框架,通过近似中间通道显著性构建掩码,在多类大语言模型上实现了优于基线的性能与解码加速,且兼容量化和稀疏注意力。
自适应深度稀疏框架:基于相似性驱动的预训练语言模型资源分配
机构 * Southern University of Science and Technology(南方科技大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究针对预训练语言模型推理成本高的问题,提出自适应深度稀疏框架AdaDSF,基于层输入输出隐藏状态余弦相似性分配令牌保留率,用轻量级路由器选择信息令牌,在多任务中大幅降推理FLOPs且精度退化小。
Comments Accepted by ICIC 2026. 12 pages, 2 figures, 4 tables
TriAgent:用于成本效益型金融情绪分析的差异感知多智能体委员会
机构 * The Overlake School(奥弗湖学校) ; Edwards Vacuum Inc.(爱德华兹真空公司) ; The University of Memphis(孟菲斯大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 研究针对基于生产LLM的金融情绪分析成本高问题,提出TriAgent多智能体委员会,按上下文粒度分层,用SDI衡量分歧并路由查询,有批评者平稳期等发现及三个推论,节省成本且效果好。
野外的智能体:研究与部署的交汇点
机构 * Georgetown University(乔治敦大学) ; Salesforce(Salesforce公司) ; Bayer(拜耳公司) ; Bloomberg(彭博公司) ; Microsoft Research(微软研究院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 探讨基于大语言模型的智能体系统从研究到部署的转变,通过案例研究分析成功设计模式及失败缓解策略,为与会者提供跨行业安全可靠部署的全面视角、设计模式、评估清单和模板。
DSpark:结合半自回归生成的置信度调度投机解码框架
机构 * Peking University(北京大学) ; DeepSeek-AI(深势科技人工智能)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对现有投机解码接受率衰减、高并发下吞吐量劣化问题,DSpark采用半自回归架构与置信度调度验证,在实测中显著提升大模型推理速度与系统性能边界。
为人工智能智能体提供自然语言工具的显著有效性:一项在14个模型上验证自然语言工具性能的复制研究
机构 * Sage.is AI-UI(Sage.is人工智能用户界面)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究独立复制并扩展了自然语言工具(NLT)框架,在14个模型和8560次试验中评估NLT,验证其效果,发现其能提升工具调用准确率、减少关键错误、降低令牌使用量,还证实模型能力对NLT优势有调节作用。
Comments 28 pages, 6 figures, replication study, replication of arXiv:2510.14453 findings
用于大语言模型中顺序信息收集的摊销贝叶斯实验设计
机构 * University of Oxford(牛津大学) ; Ellison Institute of Technology(埃里森理工学院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型在顺序决策中信息收集问题,提出摊销顺序信息收集方法,将贝叶斯实验设计融入模型策略,经实验验证该方法能有效提升成功率并降低推理成本。
Comments 20 pages, 7 figures. Accepted to FoGen 2026: Foundations of Deep Generative Models: Understanding Memorization, Generalization, and Reasoning, an ICML 2026 workshop (non-archival)
召回再排序:面向大规模代码到代码检索的深度学习模型基准测试
机构 * Sant’Anna School of Advanced Studies(圣安娜高级研究院)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 本文评估了当代深度学习模型在大规模代码到代码搜索引擎中第一阶段召回的有效性、效率和可扩展性,并提出了基于LLM的代码标准化和查询重写方案,以提升低性能模型的精度。
Comments 15 pages, 4 figures
Project Auto-World: 迈向神经关系推理器的自动化基准测试
机构 * Cardiff University(卡迪夫大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 利用大语言模型自动化生成基准测试实例,通过进化搜索和自主代理搜索发现困难样本,提升Edge Transformer的泛化能力,并应用于新世界以推动神经关系推理的自主研究。
Comments Submitted to NeurIPS 2026 E&D track. Code is available at https://github.com/autoworldrules/auto-world-rules
ThermoLLM: 基于空间语义知识图谱的热力学感知HVAC控制
机构 * University of New South Wales(新南威尔士大学) ; CSIRO Energy Centre(澳大利亚联邦科学与工业研究组织能源中心)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 提出一种热力学感知的LLM控制框架,利用物理信息空间知识图谱和近期交互历史,实现多区域HVAC的节能与舒适度优化。
Comments 10 pages, 5 figures. Submitted to ACM SIGSPATIAL 2026
小型LLM:剪枝 vs. 从头训练
机构 * Princeton University(普林斯顿大学) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 效率与部署 :LLM(title_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.LG
AI总结 本文通过六种剪枝方法在Llama-3.1-8B上比较剪枝与从头训练,发现有限预算下剪枝更优,预算充足时粗粒度剪枝可被超越。
Comments Our code is available at https://github.com/zlab-princeton/pruning-vs-scratch
通过演化程序瓶颈解释神经组合优化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Nanyang Technological University(南洋理工大学) ; Microsoft Research(微软研究院) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 提出演化程序瓶颈(EPB)框架,通过将黑盒神经组合优化模型蒸馏为可读程序组合,利用LLM和混合梯度下降实现可解释性,揭示模型行为与经典启发式变体的关系。
Comments Under Review
大语言吉布斯结构化推理
机构 * University of Edinburgh, School of Informatics(爱丁堡大学信息学院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出大语言吉布斯方法,利用大语言模型的条件分布作为转移算子进行结构化概率推理,通过迭代重采样变量避免顺序偏差,在合成分布、一致性推理和贝叶斯结构学习中验证有效性。
Comments Code: https://github.com/hyeok9855/large-language-gibbs
模型选择在因果推断中的关键作用:基于InferBERT框架的药物警戒分类模型比较分析
机构 * Department of Stochastics, Institute of Mathematics, Budapest University of Technology and Economics(布达佩斯技术与经济大学数学研究所随机学系) ; Institute of Biostatistics and Network Science, Semmelweis University(塞梅维什大学生物统计学与网络科学研究所) ; Department of Computer Science, University of Warwick(华威大学计算机科学系)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 本研究在InferBERT框架下比较XGBoost、ALBERT、BioBERT和Med-LLaMA四种模型,发现领域特定预训练(BioBERT)在药物警戒因果ADE检测中优于简单基线和大型LLM,校准改善ECE但对准确率和因果发现影响不一。
Comments 10 pages, 5 figures
移动NPU上的能效型设备端RAG:Snapdragon X Elite系统设计与基准测试
机构 * Qualcomm(高通) ; Snapdragon X Elite(骁龙X Elite) ; Dell XPS 13 laptop(戴尔XPS 13笔记本电脑) ; Qualcomm Hexagon NPU(高通Hexagon NPU) ; Adreno X1-85
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文首次在Snapdragon X Elite的Hexagon NPU上实现端到端RAG流水线,通过对比CPU和GPU,NPU在嵌入吞吐量、系统能耗和查询延迟上分别提升9.1倍、降低12.3倍和4.0倍,且答案质量相当。
Comments 9 pages, 2 figures, 6 tables
从感知到决策:多模态大语言模型中听觉与视觉感知的信息流
机构 * Surrey Institute for People-Centred AI (PAI)(萨里人本人工智能研究所) ; University of Surrey(萨里大学) ; Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究多模态大语言模型(AVLLMs)中音频和视觉信息流的路径与整合机制,发现顺序流与并行流两种路由模式,并证明信息传递后可丢弃无关token以提升效率。
Comments 40 pages, 29 figures
IntentKV: 面向Agent推理的跨轮次意图感知KV缓存剪枝
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 针对多轮LLM Agent中KV缓存成为服务瓶颈的问题,提出IntentKV方法,通过会话级QueryMemory和残差注意力头实现跨轮次意图感知的KV剪枝,在保持精度的同时大幅降低峰值请求token和KV读取量。
语义缓存蒸馏:通过重用和选择性修补实现高效状态传输
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型推理中KV缓存传输的通信瓶颈和跨模型重用时的语义错位问题,提出语义缓存蒸馏(SCD)框架,通过低秩子空间重建和稀疏过渡层归一化输入预测,实现高达2.65倍的首令牌时间加速,且生成质量接近理想情况。
Comments Accepted to ICML 2026
激活与影响感知秩 (AIR):保持功能的SVD压缩用于大语言模型
机构 * Fraunhofer HHI(弗劳恩霍夫研究所)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG;foundation model(comments)
AI总结 提出AIR框架,基于SVD和反向信号影响度量,通过单次交替最小二乘扫描实现权重矩阵的低秩近似,在参数保留≤60%时困惑度比SVD-LLM(W)改善>18%,并减少90%校准数据。
Comments Accepted at the ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference (AdaptFM), Seoul, South Korea (non-archival)
减少矩阵乘法:面向大语言模型推理的输入自适应矩阵乘积约简方法
机构 * University of Chicago(芝加哥大学) ; Stony Brook University(石溪大学)
专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对Transformer语言模型推理开销高的问题,提出无需训练的输入自适应RMM方法,通过选择矩阵乘积信息切片减少计算,在多任务多模型上验证其鲁棒性,可提升长序列推理效率,且适用于多模态场景。
Comments 24 pages
基于基础模型的高效数据采样(FEEDS):用于泛癌、多示踪剂PET/CT数据集的标签高效训练策略
机构 * Geisel School of Medicine at Dartmouth(达特茅斯盖泽尔医学院) ; Dartmouth Hitchcock Medical Center(达特茅斯-希区柯克医疗中心) ; Yale University(耶鲁大学)
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 该研究提出FEEDS策略,利用视觉基础模型嵌入选择信息性和多样性未标注病例,在减少70%标注负担时达到全标注训练性能,解决了PET/CT病灶分割的标签稀缺问题。
Comments Code is publicly available on https://github.com/Image-and-Multimodal-Data-Analytics/FEEDS
评估基础模型在遥感影像中小规模光伏分割的语义与空间引导
机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学) ; The Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; Ben Gurion Institute for the Study of Israel & Zionism(本-古里安以色列与犹太复国主义研究所) ; Ben-Gurion Israel Research Institute(本-古里安以色列研究所)
专题命中 效率与部署 :foundation model(title,abstract);prompting(abstract)
AI总结 该研究评估了SAM3在遥感影像中小规模光伏分割中不同提示策略的效果,发现混合提示性能最优,仅需少量标注样本即可实现高效分割,为无电网地区光伏测绘提供了可行方案。
WiFo-INR:一种基于隐式神经表示的无线基础模型
专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)
AI总结 本研究提出基于隐式神经表示的无线基础模型WiFo-INR,通过两阶段自监督预训练实现高效紧凑的CSI表示,在性能提升的同时降低延迟,可高效迁移至多任务并实现零样本泛化。
SlimVLM:面向高效视觉-语言模型的感知敏感性动态结构化剪枝与自适应视觉token选择
专题命中 效率与部署 :language model(title,abstract);large language model(abstract)
AI总结 SlimVLM是一种结构化剪枝框架,通过自适应视觉token选择和感知敏感性动态剪枝机制,在压缩视觉-语言模型的同时保持性能,在多模态基准测试中达到最优。
TextNCA:通过分层局部注意力实现语言建模的神经细胞自动机
机构 * Singapore Institute of Technology(新加坡理工学院) ; IIIT Delhi(德里印度信息技术学院) ; Nanyang Technological University(南洋理工大学) ; NVIDIA AI Technology Centre(英伟达人工智能技术中心)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出分层局部注意力的TextNCA模型作为分析探针,发现其性能受从窄到宽的分阶段调度主导,迭代和GRU门控等仅带来小增益。
利用对抗蒸馏定制去偏差的、针对乳腺癌的疾病专用病理学基础模型
机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) ; School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) ; Leicester Cancer Research Centre, University of Leicester(莱斯特大学莱斯特癌症研究中心) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Nuffield Department of Medicine, University of Oxford(牛津大学纳菲尔德医学院) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程学系) ; ZoyMed(佐医医疗(ZoyMed))
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 本研究提出SmartStu框架,通过多教师集成蒸馏与对抗蒸馏等技术,定制出比通用PFMs小30倍以上且性能相当的乳腺癌专用病理学基础模型。
Comments 11 pages, 2 figures, 2 tables. Accepted to MICCAI 2026 (early accept)
MedARC:面向3D医学视觉-语言模型的无训练视觉令牌自适应冗余压缩
专题命中 效率与部署 :language model(title,abstract);foundation model(abstract)
AI总结 针对3D医学VLMs的视觉令牌冗余压缩问题,本文提出无训练框架MedARC,整合三类线索估计令牌重要性,通过显著性感知合并策略压缩令牌,在CT-RATE和MR-RATE上实现性能保持的同时降低开销。
Comments 9 pages
UltraViT:用于大型视觉语言模型的延迟优化设备端视觉编码器
机构 * Samsung AI Cambridge(三星人工智能剑桥实验室) ; Technical University of Iasi(雅西技术大学) ; Queen Mary University of London(伦敦玛丽女王大学)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract)
AI总结 针对大型视觉语言模型在设备端部署受限问题,提出UltraViT视觉编码器,通过考虑设备延迟设计金字塔架构,并采用两阶段生成式预训练策略,有效提升编码效率,优于现有基线。
Comments Accepted at ECCV 2026