Leech Lattice Vector Quantization for Efficient LLM Compression
Leech晶格向量量化用于高效的LLM压缩
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出Leech晶格向量量化方法,通过高维晶格结构实现高效LLM压缩,优于现有量化方法。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
Leech晶格向量量化用于高效的LLM压缩
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出Leech晶格向量量化方法,通过高维晶格结构实现高效LLM压缩,优于现有量化方法。
RSF-GLLM:通过循环软流和去耦语言模型生成弥合多跳知识图谱问答中的语义鸿沟
机构 * Adobe Research(Adobe研究院) ; Adobe Systems(Adobe系统公司)
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究多跳知识图谱问答中传统方法的语义鸿沟问题,提出RSF-GLLM框架,通过循环软流模块传播分数、引入正则化保证收敛,提取路径微调LLM,实验证明该方法性能优且推理效率高。
Comments Accepted for publication in ICML 2026 as a full research paper; 21 pages
AutoSpec: 通过归纳逻辑编程实现LLM智能体的安全规则演化
机构 * Zhejiang University of Technology(浙江工业大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出AutoSpec框架,利用归纳逻辑编程引导的CEGIS自动演化专家定义的安全规则,平衡精确率和召回率,在代码执行和具身智能体领域将F1提升至0.98和0.93,减少高达94%的误报。
使用RAG增强大语言模型进行空间图像隐写术的代码级成本函数生成
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 该研究针对空间图像隐写术成本函数设计难题,提出利用RAG增强大语言模型的进化系统,含SE-RAG模块及反馈机制。实验表明,此框架安全性更高,还提升了代码执行率并降低搜索成本,凸显结合大语言模型与领域知识的优势。
用于资源受限嵌入式设备上小型语言模型微调的节能GPU动态电压频率缩放
机构 * School of Engineering and Digital Sciences, Nazarbayev University(工程与数字科学学院,纳扎尔拜耶夫大学)
专题命中 效率与部署 :SLM(summary_cn,abstract);language model(abstract);small language model(abstract);分类 cs.LG
AI总结 研究资源受限嵌入式设备上SLM微调的节能问题,提出基于机器学习的模型选择方法来选GPU DVFS设置,在NVIDIA Jetson AGX Orin上实验,相比MAXN模式0平均节能13.11%,最高达26.73%。
LLMs 与隔离内核:轻量、无学习的二进制嵌入用于快速检索
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出无学习的隔离内核嵌入(IKE),将LLM嵌入转换为二进制嵌入,实现低内存和快速检索,实验显示其检索速度提升16.7倍,内存使用降低16倍,同时保持相似精度。
Comments Accepted to ACL 2026
DT-Guard:用于无推理语言模型安全护栏的意图驱动推理主动训练
机构 * Ant Group(蚂蚁集团)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 研究为开放世界应用的语言模型设计安全护栏的问题,提出基于推理主动训练、无推理推理范式的DT-Guard模型,通过构建意图驱动数据集等方法提升性能,实验证明其在安全基准测试中表现优异,能有效将推理监督内化到低延迟安全判别中。
你的NPU是否适用于大语言模型?剖析移动大语言模型推理中隐藏的效率瓶颈
机构 * Tsinghua University(清华大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究剖析移动大语言模型推理隐藏的效率瓶颈,通过跨层测量及PowerBench工具,发现框架性能差距在NPU上被放大、不同后端在不同阶段各有优劣及存在调度空间浪费,据此提出配置可降NPU后端能耗54.8%。
用于边缘高效病理学基础模型的多教师对比蒸馏
机构 * EKFZ for Digital Health(数字健康EKFZ) ; TU Dresden(德累斯顿工业大学) ; University of Augsburg(奥格斯堡大学) ; Bavarian Cancer Research Center (BZKF)(巴伐利亚癌症研究中心) ; Department of Medicine I, TU Dresden(德累斯顿工业大学第一医学院) ; NCT Heidelberg(海德堡NCT) ; University of Leeds(利兹大学)
专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)
AI总结 研究针对计算病理学基础模型本地部署难题,提出MuCoDi预训练框架,通过多教师对比蒸馏,将多个PFMs的切片嵌入蒸馏到轻量级编码器,经实验验证该方法能大幅减小模型大小并保持性能,推动病理学表示向边缘部署发展。
不退化文本智能的统一音频智能
机构 * Nemotron-Labs(Nemotron实验室)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。
Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex
重新审视并扩展IPv6网络边缘:全球规模测量与安全分析
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 本文重新审视并扩展了IPv6网络边缘的研究,通过全球范围内的测量发现超过2.8亿个活跃的IPv6网络边缘,揭示了服务暴露和路由环等安全问题,并提出Hierarchical LLM Exposure Verification框架以识别未授权访问风险。
Comments 13 pages, 7 figures, 8 tables. Submitted to IEEE Transactions on Information Forensics and Security
用于可信工业过程推理的大语言模型引导的测量可信度校正
机构 * College of Information Science and Engineering, Northeastern University(信息科学与工程学院,东北大学)
专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI
AI总结 研究工业过程推理中测量可信度问题,提出大语言模型引导的测量可信度校正方法,通过转换测量语义、构建参考并校正冲突,使预测器输入更可信,在多任务中降低误差,增加少量参数且推理时间短,提升了预测准确性。
Nemotron-Labs-Diffusion:一种统一自回归、扩散和自推测解码的三模式语言模型
机构 * Nemotron-Labs(Nemotron实验室)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL
AI总结 介绍了统一AR、扩散和自推测解码的三模式语言模型Nemotron-Labs-Diffusion,通过联合目标训练,能切换模式。研究表明其目标互补,自推测模式表现优,有长期潜力,该模型家族在精度和速度上优于现有开源模型。
FourTune:迈向扩散模型的全4位高效训练后优化
机构 * Nunchux AI ; MIT(麻省理工学院) ; CMU(卡内基梅隆大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG
AI总结 针对大型扩散模型训练后优化的挑战,提出FourTune框架,基于端到端W4A4G4范式,引入三分支混合管道、硬件高效量化等,在多任务中质量与全精度微调相当,在特定数据集上降低内存开销、提高训练吞吐量。
Akashic:一种基于内存注意力机制的低开销大语言模型推理服务
机构 * Xiaohongshu Inc.(小红书公司) ; ShangHai JiaoTong University(上海交通大学) ; Peking University(北京大学)
专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI
AI总结 针对大语言模型推理中重放完整历史记录不切实际的问题,提出基于内存注意力机制的低开销内存系统Akashic,通过组织上下文成有界块、建模块间语义关系及应用软硬件协同设计内存放置,提升了任务准确率、吞吐量和可持续请求率。
FADE: 通过减少大型视觉语言模型中的语言先验主导性来缓解幻觉
专题命中 效率与部署 :language model(title,abstract);分类 cs.AI
AI总结 本文通过分析信息流,发现FFN模块在关键层引入语言先验,主导视觉证据,导致幻觉;提出无需训练的FADE方法衰减FFN输出,有效缓解幻觉并保持推理效率。
Comments 18 pages, 5 figures, 27 tables
AVA-VLM:用于野外建筑工地监测的自适应视觉注意力视觉语言模型
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; AI+KCIR Global Resilience Research Center(人工智能与韩国气候变化影响韧性研究中心) ; SmartInside AI Co., Ltd.(思玛特因赛德人工智能有限公司) ; Sungkyunkwan University(成均馆大学)
专题命中 效率与部署 :language model(title,abstract)
AI总结 针对野外建筑工地监测,提出AVA-VLM自适应视觉注意力视觉语言模型,遵循粗到细推理策略,先对低分辨率全局图像推理,按需请求高分辨率局部裁剪,并引入区域感知思维链数据集,提升了低分辨率下的可靠性并减少视觉令牌使用。
SAMBA:一种散射引导的掩码双向Mamba基础模型用于SAR目标识别
机构 * College of Electronic Science and Technology, National University of Defense Technology(国防科技大学电子科学学院)
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 提出SAMBA模型,通过线性复杂度Mamba编码器、散射引导掩码策略和SpatialMix模块,解决SAR目标识别中标注数据稀缺和计算复杂度高的问题,在多个下游任务上达到SOTA性能。
Comments 15 pages, 5figures
生成式人工智能模型在先进加速器上的性能优化与比较分析
机构 * University of California San Diego(加州大学圣地亚哥分校) ; San Diego Supercomputer Center(圣地亚哥超级计算机中心)
专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 针对生成式人工智能模型部署难题,开展系统研究,通过新颖的混合精度训练后量化评估等方法,对多种模型在不同下游任务及跨异构平台进行性能优化与比较分析。
Comments 6 pages, 3 figures
智能体何时撒谎:重复博弈中的预谋、持续性与可利用性研究
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Vector Institute(向量研究所) ; University of Toronto(多伦多大学) ; EuroSafeAI
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文针对大语言模型智能体行动前公示意图的诚信问题,设计三阶段n人重复博弈协议,评测前沿模型,发现其偏离公示行为多属预谋,不同模型对公示的语义理解不兼容。
Comments Best Paper Award at ICML NExT-Game Workshop
ShadowProbe:语言可扩展的隐藏算法复杂性漏洞检测
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究针对算法复杂性漏洞,提出ShadowProbe框架,通过轻量级静态分析、自动重建执行上下文及大语言模型辅助测试生成来检测。经实验验证,该框架能有效识别不同代码库中的隐藏算法风险,提升分析效率,发现诸多未知漏洞。
具有跨情节记忆和策略蒸馏的自我审查强化学习
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对强化学习中环境反馈稀疏或延迟问题,提出自我审查强化学习框架,通过策略梯度优化自我审查,经选择性蒸馏内化改进到基础策略,用跨情节记忆保留成功审查,在GSM8K基准上评估,该框架优于基线且学习效率更高。
Comments 9 pages, 2 figures
针对长上下文服务,跨任务质量和系统性能对KV缓存优化进行基准测试
机构 * University of Bayreuth(拜罗伊特大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究长上下文服务中KV缓存优化,通过工作负载感知基准评估多种优化机制,测量多项指标。发现仅压缩率不能预测性能,不同机制表现各异,为长上下文服务系统提供工作负载感知的KV缓存机制选择及部署指导。
基础模型知道如何推理,思维模型在训练中学习时机
专题命中 效率与部署 :language model(abstract);SFT(abstract);分类 cs.AI、cs.LG
AI总结 研究思维语言模型训练中比基础模型多学到了什么,提出无监督方法和建设性模型差异分析,通过九个基础/思维模型对实验发现强化学习教编排基础机制启发式,监督微调蒸馏装新机制,为训练范式及推理模型开发提供新视角。
Comments Accepted as a Spotlight at the International Conference on Machine Learning 2026
UI2App:可执行Web应用程序生成中视觉交互推理的基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对现有网页生成基准测试对交互能力评估不足的问题,引入UI2App基准测试,通过设计端到端管道沿四个维度评估工件,实验发现视觉与交互能力不匹配,复杂交互是瓶颈,为相关研究提供了参考。
Stream2LLM: 重叠上下文流式传输与预填充以减少时间到第一个标记(TTFT)
机构 * Georgia Tech(佐治亚理工学院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出Stream2LLM,一种针对并发预填充-解码分离部署的流式感知大语言模型服务系统,通过自适应调度和抢占机制,有效解决上下文检索与推理之间的延迟问题,从而减少时间到第一个标记(TTFT),并在内存压力下保持吞吐量与非流式基线相等。
Comments Accepted to MLSys 2026. Minor formatting fixes
SuperVoxelGPT: 自适应有序3D令牌化用于自回归形状生成
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Tencent America(腾讯美国)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出SuperVoxelGPT框架,通过自适应且有序的超体素令牌化解决自回归3D生成中序列长度与空间顺序的矛盾,实现高质量、高效率的形状生成。
重新思考多智能体系统的查询优化 [视觉]
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 研究多智能体系统的查询优化问题,提出NOMA框架,针对其面临的多维搜索等挑战,通过控制实验揭示差异,最优计划为异构配置,实际部署存在低效率,还提出集成优化循环设定研究议程。
ELSA3D:用于统一3D理解与生成的弹性语义锚定
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 研究统一3D基础模型文本-3D交互隐式问题,提出ELSA3D模型,通过弹性语义锚定联合构建语言和几何推理,用尺度感知八叉树令牌化器和锚定令牌表示几何,轻量级路由器使计算和推理弹性化,性能领先且减少计算量和延迟。
TurnOPD:使在线策略蒸馏具有转向意识以实现高效的长期智能体训练
机构 * Fudan University(复旦大学) ; Tencent Hunyuan(腾讯文言)
专题命中 效率与部署 :language agent(abstract);分类 cs.CL、cs.AI
AI总结 研究针对在线策略蒸馏在长期智能体任务应用不足的问题,提出TurnOPD,通过自适应展开深度预算和渐进式转向归一化损失预算两个策略,在多任务实验中实现更高验证准确率,超越普通OPD,推进了准确率-时间前沿。