Tevatron Meets Megatron: Expert-Parallel LLM Reranker Training on an Academic Budget
特瓦特龙遇上巨神:学术预算下的专家并行大语言模型重排序器训练
专题命中 效率与部署 :LLM(title);分类 cs.LG
AI总结 该研究提出Tevatron 3.0,集成Megatron-Core后端实现专家并行,在学术预算下成功训练30B参数MoE重排序器,其性能优于稠密模型且推理吞吐量更高。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
特瓦特龙遇上巨神:学术预算下的专家并行大语言模型重排序器训练
专题命中 效率与部署 :LLM(title);分类 cs.LG
AI总结 该研究提出Tevatron 3.0,集成Megatron-Core后端实现专家并行,在学术预算下成功训练30B参数MoE重排序器,其性能优于稠密模型且推理吞吐量更高。
行为语法:通过微型语言模型先验和二阶时序分析检测自适应恶意软件
专题命中 效率与部署 :language model(title);分类 cs.AI
AI总结 本文提出Behavioral Grammar架构,用0.88M参数的TinyGPT学习主机行为语法,结合多模块提升检测能力,在AAA威胁下实现93%检测率,建立利于防御者的结构不对称性。
Comments 29 pages, 8 figures
语音到语音大语言模型助手的保障措施:以汽车应用为例
专题命中 效率与部署 :LLM(title);分类 cs.AI
AI总结 研究汽车应用中语音到语音大语言模型助手的保障措施,探讨基于转录本和工具的两种实现方法,经实证评估发现因高延迟和技术障碍,这两种策略大多不适用于工业部署,还概述了面临的开放挑战。
Journal ref LNCS Volume 16830, 2026
超越准确性和成本:针对动态工作负载的延迟感知大语言模型查询路由
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软)
专题命中 效率与部署 :LLM(title);分类 cs.AI
AI总结 研究针对动态工作负载的大语言模型查询路由,设计轻量级延迟估计器,纳入延迟感知路由器,联合优化延迟、准确性和成本,实验表明该方法能在保持延迟的同时提升准确性 - 成本效用达40%。
洛梅奎:大语言模型智能体中资源受限的工具发现
机构 * Sea12 Technologies(Sea12科技公司) ; Yale University(耶鲁大学)
专题命中 效率与部署 :LLM(title);分类 cs.AI
AI总结 研究受认知科学启发区分工具使用与发现,将工具发现分解为好奇心、识别和效率,表明该框架可用于现有任务,证明识别与模型大小成反比,还通过组合博弈及模拟环境观察到反比缩放。
Comments All authors contributed equally. 17 pages, 6 figures. Presented at the 2026 Conference on Learning Theory Workshop on Learning in an Agentic World
基于开放视觉语言模型的空间问答与导航的二值追踪
机构 * RGA Inc.(RGA公司)
专题命中 效率与部署 :language model(title);分类 cs.AI
AI总结 提出BinTrack,一种全开源的空间定位代理,通过二值搜索轨迹段,在SpaceLocQA基准上准确率提升22.8%,推理速度提升1.5倍,并发布多行程室外数据集GangnamLoop。
Comments 21 pages, 4 figures, 15 tables. Project page: https://ndb796.github.io/BinaryTracking ; Code and dataset: https://github.com/ndb796/BinaryTracking
GLACIER:用于分子性质预测的多模态师生基础模型
机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) ; Department of Quantitative and Computational Biology, University of Southern California(南加州大学定量与计算生物学系) ; Amazon(亚马逊) ; Department of Medical Biochemistry and Biophysics, Science for Life Laboratory, Karolinska Institutet(卡罗林斯卡学院医学生物化学与生物物理系,生命科学实验室)
专题命中 效率与部署 :foundation model(title);分类 cs.LG
AI总结 提出GLACIER师生框架,通过融合分子图、SMILES和物理化学描述符三种模态,并利用大模型蒸馏,实现高效准确的分子性质预测。
预训练、冻结、仍在泄露:脑电图基础模型中跨编码器属性转移的审计
机构 * Jianwei Tai(Tai Jianwei)
专题命中 效率与部署 :foundation model(title);分类 cs.AI
AI总结 提出跨编码器桥接攻击,证明单一端点审计无法检测属性泄露,并引入审计端点分歧分数(AEDS)作为联合发布决策规则。
匹配结果,不同注视:中央凹多模态大语言模型(MLLM)的搜索方式与人类的对比
机构 * F-initiatives(F计划) ; Université Sorbonne Paris Nord(巴黎北索邦大学) ; Northwestern University(西北大学) ; IULM university(IULM大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究对比三款通用MLLM与人类在目标导向视觉搜索中的表现,发现模型在决策和目标获取上优于人类,但注视过程与人类不同,现有指标无法验证类人视觉,零样本模型不适用于过程层面问题。
Comments Paper accepted at 3rd HCV workshop at ECCV 2026. 12 pages main text, 16 pages supp
DumpsterCluster:从“废品回收”到在60美元级GPU上部署LLaMA-70B
机构 * University of Cambridge(剑桥大学) ; University of Oxford(牛津大学) ; Quettaflop AI
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文搭建了二手GPU组成的DumpsterCluster,可在60美元级GPU上支撑LLaMA-70B推理,经济优势显著,但需结合低价电力与清洁能源以保障可持续性。
通过二进制背包优化统一大语言模型的深度与宽度剪枝
机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(德里印度理工学院亚迪人工智能学院) ; Indian Institute of Technology Delhi(德里印度理工学院) ; Microsoft Research (MSR) India(微软研究院印度分部)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究针对LLMs结构化剪枝的贪心启发式算法缺陷,提出SNIPER两阶段剪枝框架,引入CRAFT量化预算保真度,在多架构多任务上较现有剪枝器实现性能与稳定性提升,泛化性强。
Comments 29 pages, 5 figures, 17 tables
更好、更快、更强:程序化技能学习最能降低智能体成本
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。
解析器已掌握:约束解码中的轻量级偏差校正
专题命中 效率与部署 :language model(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 该研究针对语法约束解码中刚性屏蔽扭曲模型分布的问题,利用增量解析的语法状态提出轻量级离线 logit 校正,在几乎不增加开销的情况下优于基线方法,兼顾了语言模型的概率完整性与语法一致性。
Comments 9 pages, 5 figures
SR-OPSD:自引用同策略自蒸馏
机构 * Shanghai University of Finance and Economics(上海财经大学) ; Imperial College London(伦敦帝国学院) ; University of Science and Technology of China(中国科学技术大学) ; University College London(伦敦大学学院) ; Nanyang Technological University(南洋理工大学) ; Technical University of Denmark(丹麦技术大学) ; University of Copenhagen(哥本哈根大学) ; Peking University(北京大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对同策略自蒸馏的优化不稳定问题,提出SR-OPSD方法,通过几何插值结合Rényi散度优化蒸馏目标,在多任务大语言模型实验中取得最优或竞争性能。
绑定三进制平面:将PTQTP约束为统一九级量化器,并为磁盘流式混合专家服务提供持久折叠格式
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本研究将PTQTP约束为统一九级量化器,提出持久折叠格式,在DeepSeek-V4-Flash-0731混合专家模型上实现量化,提升解码速度并减小文件体积,且保真度与基线相当,相关成果开源。
LibraSpec:基于动态扩散的推测解码,通过边际增益驱动优化
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 LibraSpec是一种无需训练的即插即用推测解码算法,通过边际增益驱动优化动态确定推测长度,可提升大语言模型推理速度,在多基准上较基线加速0.5~1.5倍、较自回归解码最高达8.49倍。
防御检索增强型入侵检测系统免受知识投毒与提示注入攻击
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RAG-IDS三层多智能体入侵检测框架,通过软信任评分、LECC和提示净化的检索边界防御,可在知识投毒与提示注入攻击下恢复分类质量,在CIC-UNSW-NB15数据集上表现出良好的防御效果。
Comments 14 pages with Appnedix, 11 figures. Submitted to IEEE CIC 2026, Research Track (double-blind review)
MolBioKG:通过多分辨率结构锚定将图外分子锚定到生物医学知识图谱中
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 MolBioKG是解决生物医学KG中图外分子冷启动问题的两层系统,通过多分辨率结构锚定实现分子与KG的关联,在多项任务中优于基线并提升关键指标。
Comments Preprint
SkillZip:用于可扩展智能体技能库的保留契约的图压缩方法
机构 * UNSW(新南威尔士大学) ; CSIRO(联邦科学与工业研究组织)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 SkillZip是一种执行感知的过程抽象框架,通过对节级图进行保留契约的压缩,解决了智能体技能库的可扩展问题,在基准测试中优于基线,实现了高压缩率和稳健检索。
啄木鸟蒸馏:弱模型诊断强模型中的推理错误
机构 * Baidu Inc.(百度公司) ; Nanyang Technological University(南洋理工大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出Woodpecker Distillation框架,通过弱模型的局部干预对比学习,修复强模型的推理错误,在数学推理基准上提升了强模型性能且优于直接模仿基线。
CARVE:用于高效3D医学体积理解的视觉证据跨切片各向异性重分配
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 针对3D医学体积理解中切片式MLLM的视觉令牌冗余问题,提出无需训练的CARVE框架,通过跨切片各向异性重分配压缩80%令牌,在AMOS-MM等基准上性能优于现有方法。
右侧重置:通过前缀移除进行分块
专题命中 效率与部署 :language model(abstract);prompting(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出右侧重置(RR)方法,通过前缀移除探测将因果语言模型的上下文依赖转化为边界信号,在文本分块任务上优于基线方法,减少局部输出干扰。
Comments 12 pages, 2 figures, 4 tables. Code, data, and reproduction materials: https://github.com/ZECTBynmo/right-reset-paper
将比特分配至查询关注处:基于注意力保留变换的KV缓存向量量化
机构 * University of Southern California(南加州大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出名为NOVA-KV的KV缓存量化方法,将其建模为变换编码问题,推导闭式最优变换,在每元素2比特时可恢复标量量化方法损失的大部分长上下文检索精度。
大型语言模型(LLMs)能否测试终端用户界面?
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究针对终端用户界面(TUIs)缺乏专门测试方法的问题,构建多框架基准测试对比前沿LLMs与随机探索,发现自动生成输入可提升测试效果,验证了自动化TUI测试的可行性。
RING:用于持续大规模知识注入的检索内化生成
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Xiaohongshu Inc.(小红书科技有限公司)
专题命中 效率与部署 :LLM(abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 RING是一种将检索内化的范式,通过三阶段训练学习参数化记忆的检索策略,在自主构建的News-2025基准上,其知识注入的准确性与效率优于或匹配现有方法。
Comments 16 pages
Slot2Text:面向高效且空间可追溯的手术多模态大语言模型的以对象为中心的视觉分词
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 Slot2Text将视觉输入转为槽潜变量,推出双模式手术MLLM,在多基准上实现高效推理,Slot2Text-Fast大幅降本,Slot2Text-Reason支持可追溯空间推理。
Comments 17 pages, 8 Figures
当重规划成为瓶颈:具身智能体的预算型重规划
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 针对具身智能体重规划延迟超标的瓶颈问题,提出搭载E-RECAP渐进式token剪枝方法的BRACE控制器,通过预算控制循环减少token消耗、降低SLO违反率,在多平台任务中提升了重规划的实时性与成功率。
Comments 20 pages total: 9 pages main text, 3 pages references, and 8 pages appendix; 18 figures and 32 tables. Accepted at ICML 2026
用于公平强化学习的推理时策略对齐
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出乘法策略塑造框架,在不更新预训练RL策略参数的情况下,于推理时提升公平性,同时保留核心任务性能,适用于各类深度RL智能体。
Comments Accepted at the Reinforcement Learning Conference (RLC) 2026. 13 pages main + appendix, 5 figures, 6 tables
DiffusionGemma 技术报告
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出开放权重语言模型 DiffusionGemma,通过并行优化 256 个 token 块规避 AR 模型顺序解码瓶颈,经两阶段微调后实现 1500 token/秒生成速度,性能优于带推测解码的 AR 模型,还支持多模态等功能并为混合解码提供方向。
基于大型语言模型的神经环路功能推断
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究提出LLantia方法,结合连接组与文献,分层推断神经环路及细胞类型功能,以果蝇大脑为对象验证方法,为神经环路研究提供支撑。
Comments 26 pages, 7 figures