CelerLog: Fast Log Parsing via Dynamic Routing
CelerLog: 通过动态路由实现快速日志解析
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 提出CelerLog,通过动态路由将日志分为密集和稀疏组,分别用统计方法和LLM处理,在保持高精度的同时大幅提升速度和降低成本。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
CelerLog: 通过动态路由实现快速日志解析
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 提出CelerLog,通过动态路由将日志分为密集和稀疏组,分别用统计方法和LLM处理,在保持高精度的同时大幅提升速度和降低成本。
StreamChar: 基于解耦编排的长时程流式角色音频-视频生成
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 提出StreamChar流式框架,通过LLM编排器与联合音频-视频DiT解耦长时程编排与短窗去噪,实现实时、稳定、高质量的角色动画生成。
使用Cornstarch高效分布式多模态大语言模型训练
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出Cornstarch框架,通过冻结感知流水线并行和令牌工作负载平衡的上下文并行,解决多模态大语言模型训练中的异构性问题,平均吞吐量提升2.26倍。
Comments ICML'26
LiteFrame: 高效视觉编码器解锁视频大语言模型中的帧缩放
机构 * Seoul National University(首尔国立大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对视频大语言模型处理长视频时视觉令牌上下文长度爆炸的问题,提出LiteFrame高效视频编码器,通过压缩令牌蒸馏(CTD)训练框架,使紧凑的学生模型直接预测教师模型的信息密集时空压缩表示,从而在降低35%端到端延迟的同时处理8倍帧数并提升视频理解精度。
Comments Project Page: https://jjihwan.github.io/projects/LiteFrame
循环扩散语言模型
机构 * KAIST(韩国科学技术院) ; KRAFTON(KRAFTON公司) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 效率与部署 :language model(title,abstract);分类 cs.LG
AI总结 提出LoopMDM,通过选择性循环早期-中间Transformer层,在训练时实现深度缩放效果而不增加参数,在推理时通过调整循环次数灵活扩展计算量,从而提升掩码扩散模型的训练效率和性能。
Comments 23 pages
局部性对音频-语言模型中免训练音频令牌压缩的重要性
机构 * Zhejiang University(浙江大学)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL
AI总结 提出局部时间二分图合并(LTBM)方法,通过显式时间窗口约束合并相似邻近音频令牌,实现免训练的编码器空间压缩,并验证了局部性归纳偏置在音频令牌压缩中的任务依赖性优势。
Comments Preprint. 8 pages main text, 10 pages total
语言模型中的关系线性性质:一项实证研究
机构 * University of Copenhagen(哥本哈根大学) ; University of Trento(特伦托大学) ; University of Bologna(博洛尼亚大学) ; University of Pisa(比萨大学)
专题命中 效率与部署 :language model(title,abstract);分类 cs.LG
AI总结 本文提出基于KL散度的探针方法,实证检验语言模型中关系线性假设(即固定关系下对象解嵌入可由主体嵌入线性映射预测),发现其随模型、层和关系表述变化。
频率至关重要:用于剪枝和量化的快速模型无关数据筛选
机构 * University of Trento(特伦托大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 提出一种基于Zipf幂律的模型无关数据筛选策略ZipCal,通过最大化词汇多样性来选择校准数据,在剪枝和量化中实现与依赖模型困惑度的最先进方法相当的性能,且速度快约240倍。
Comments Added statistical analysis, mechanistic analysis and a comparison with a generative baseline. 22 pages
HEAPr: 基于Hessian的输出空间中高效原子专家剪枝
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; FABU Inc.(FABU公司) ; Hangzhou Kuaidi Science and Technology Co., Ltd.(杭州快的科学技术有限公司)
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对MoE模型粗粒度专家剪枝导致精度下降的问题,提出HEAPr算法,通过将专家分解为原子专家并利用二阶信息(最优脑外科原理)评估重要性,在输出空间简化计算,实现高比例无损压缩。
Comments ICLR 2026
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
通过因果路由门控减轻大型视觉语言模型中的幻觉
机构 * Center of Statistical Research, School of Statistics and Data Science, Southwestern University of Finance and Economics, Chengdu, China.(统计研究中心,统计与数据科学学院,西南财经大学,成都,中国) ; Department of Biomedical Engineering, College of Design and Engineering, National University of Singapore, Singapore(生物医学工程系,设计与工程学院,新加坡国立大学,新加坡)
专题命中 效率与部署 :language model(title,abstract)
AI总结 针对大型视觉语言模型中因文本路径主导导致幻觉的问题,提出一种无训练、决策对齐的干预方法,通过分解注意力头为视觉和文本路由并抑制文本路由,有效减少幻觉错误。
Comments Accepted as a Spotlight Paper at ICML 2026. 33 pages, 8 figures
基于结构引导编排的多智能体协调适应
机构 * Nanjing University(南京大学) ; University of Technology Sydney(悉尼科技大学) ; University of New South Wales(新南威尔士大学)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出MACA框架,通过概率视角将多智能体协调视为结构与编排的联合后验推断,利用任务和预算条件结构先验指导策略编排,实现高效自适应协调,性能平均提升8.42%且令牌消耗减少43.19%。
Comments 21 pages
面向多智能体协作的令牌/KV缓存通信介质选择与资源分配策略
机构 * State Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, 210008, China(新型软件技术国家重点实验室,南京大学,南京) ; Institute of Intelligent Networks and Communications (NINE), Nanjing University (Suzhou Campus), Suzhou, 215163, China(智能网络与通信研究院(NINE),南京大学(苏州校区),苏州)
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对多智能体协作中异构交互介质带来的端到端延迟权衡问题,提出一种联合通信介质选择与无线资源分配的优化方法,并设计低复杂度算法以最小化延迟。
OPAL: 全方位路径高效空中三维探索
机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系)
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出OPAL框架,通过在歧义分支点进行360度偏航旋转替代计算密集的全局路径规划,实现计算简单、路径短且覆盖率高的自主探索。
Comments Submitted to IEEE Robotics and Automation Letters (RA-L)
深度寄存器解锁 SwiGLU 上的 W4A4:一种读取器/生成器分解
专题命中 效率与部署 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过深度寄存器和铰链损失(DR+sink)训练时干预,将 SwiGLU 解码器语言模型的 W4A4 量化困惑度从 1727 降至 119,并分解出残差轴读取器主导误差,而生成器 w2 的双线性输入是剩余差距的主因。
Comments The authors have decided to withdraw this version following internal review regarding authorship and contribution agreements
虚假不动点:大语言模型中的康德反馈、稳定误校准与表征压缩
机构 * ToppyMicroServices OÜ(ToppyMicroServices公司)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过康德承诺门控框架和线性反馈模型,研究大语言模型中高置信度错误作为局部稳定、内部一致且自信错误的虚假不动点现象,发现稳定性与正确性可分离,并探索高信噪比惯性和表征压缩作为稳定误校准的可能机制。
Comments 27 pages, 8 figures, v3.0
SkillOpt: 自我进化智能体技能的执行策略
机构 * Microsoft(微软公司) ; Shanghai Jiao Tong University(上海交通大学) ; Tongji University(同济大学) ; Fudan University(复旦大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出SkillOpt,一种系统性的可控文本空间优化器,通过分离的优化器模型对技能文档进行有界编辑,并仅在严格改善验证分数时接受编辑,从而稳定训练技能,在六个基准测试中全面优于现有方法。
Comments 27 pages, 4 figures, 6 tables
人工标注是否必要?用于机器翻译错误跨度检测的迭代MBR蒸馏
机构 * Institute of Science Tokyo(东京科学研究所) ; National Institute of Information and Communications Technology(信息与通信技术国家研究所)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出一种基于最小贝叶斯风险解码的迭代MBR蒸馏自演化框架,利用现成大语言模型生成伪标签,无需人工标注即可在错误跨度检测任务上超越监督基线。
Agent Primitives: 面向多智能体系统的可复用潜在构建模块
机构 * School of Information Sciences, University of Illinois at Urbana-Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校信息科学学院) ; Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出Agent Primitives,一组可复用的潜在构建模块,通过KV缓存内部通信和自动组合,提升多智能体系统的鲁棒性、效率和跨任务复用性。
Comments 16 pages
ChunkLLM: 一种轻量级可插拔的LLM推理加速框架
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学信息学院)
专题命中 效率与部署 :LLM(title_cn);分类 cs.CL、cs.AI
AI总结 针对Transformer自注意力二次复杂度导致的推理效率低下问题,提出ChunkLLM框架,通过QK适配器和块适配器实现块选择与压缩,在保持性能的同时显著加速推理。
语法引导的稀疏注意力:高效且可解释的Transformer
机构 * Independent Researcher(独立研究者)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出语法引导的稀疏注意力方法,通过词性标签动态生成注意力掩码,在保持精度的同时降低计算复杂度。
Comments 9 pages, 2 tables Code available at https://github.com/toughthinktank/grammatically_guided_attention#
EchoDistill:面向鲁棒音频大语言模型的噪声到干净自蒸馏对齐
机构 * NTU(国立台湾大学) ; SHU(上海大学) ; ICT, CAS(中国科学院信息科技研究院) ; HDU(华中科技大学) ; BUPT(北京邮电大学) ; USTC(中国科学技术大学) ; SKL-NST, BUPT(北京邮电大学国家智能计算研究中心)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出EchoDistill框架,通过冻结的干净音频教师模型指导噪声学生模型进行组相对策略优化,实现噪声到干净的自蒸馏对齐,提升音频大语言模型在复杂噪声下的语义可靠性和任务性能。
JacQuant: 通过学习的雅可比替代实现无STE的量化感知训练
机构 * Meta AI
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 提出JacQuant框架,通过学习模型对参数变化的局部敏感性的轻量级替代,在不使用直通估计器的情况下稳定和加速量化感知训练,在低比特大语言模型上达到更高精度。
HyLaT: 通过混合潜在-文本协议实现高效多智能体通信
机构 * Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学) ; King’s College London(伦敦国王学院) ; The Alan Turing Institute(艾伦·图灵研究所) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对多智能体通信中的三元困境,提出混合潜在-文本协议HyLaT,通过潜在通道传输认知信号提升效率,自然语言表达关键信号保证可解释性,并设计两阶段训练框架,显著降低通信开销同时保持任务性能。
ScrapMem: 一种基于生物启发的光学遗忘机制用于设备端个性化智能体记忆
机构 * Nanjing Agricultural University(南京农业大学) ; Nanjing University(南京大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出ScrapMem框架,通过光学遗忘机制压缩旧记忆并构建情节记忆图,在资源受限设备上实现高效多模态长期记忆,在ATM-Bench上取得51.0% Joint@10新最优,存储降低93%,召回率提升至70.3%。
Comments 10 pages, 4 figures
MVR-cache:通过多向量检索和学习型提示分割优化语义缓存
机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院,北京,中国) ; School of Information, Renmin University of China, Beijing, China(中国人民大学信息学院,北京,中国)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 提出MVR-cache方法,利用多向量检索和学习型提示分割模型,通过强化学习优化缓存命中率,在保证正确性的前提下将缓存命中率提升高达37%。
Comments Published in ICML 2026
超越纯推理部署:比较基于权重的巩固与级联压缩
机构 * University of Melbourne(墨尔本大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对大型语言模型纯推理部署中用户知识无法持久化的问题,提出通过夜间反射、合成和LoRA微调将交互知识巩固到模型权重中,实验表明该方法相比级联压缩知识保留率提升43.6个百分点。
Comments 15 pages
通过上下文学习推进图少样本学习
机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; College of Software, Jilin University(吉林大学软件学院) ; Department of Computer Science and Technology, Yanbian University(延边大学计算机科学与技术系) ; Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) ; School of Mathematical and Computer Sciences, Heriot-Watt University(赫瑞斯泰大学数学与计算机科学学院)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出VISION模型,将图少样本学习重构为免微调的序列推理问题,利用无监督任务生成器从无标签数据中构建伪任务,通过上下文感知网络融合局部拓扑和全局任务依赖,实现高效推理。
Comments KDD26
ScaleAcross Explorer:探索跨规模AI模型训练的通信优化
机构 * Harvard University(哈佛大学) ; Meta Platforms, Inc.(Meta平台公司)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对跨数据中心大规模AI模型训练(scale-across)的复杂设计空间,提出ScaleAcross Explorer优化器,通过联合优化并行放置、并行调度和网络层技术,实现高达64.62%的训练加速。
Comments 28 pages, 27 figures
EPPC-OASIS:面向安全消息中电子患者-提供者通信挖掘的本体感知适应与结构化推理精炼
机构 * Yale University(耶鲁大学) ; Cleveland Clinic Lerner College of Medicine of Case Western Reserve University, Cleveland Clinic(克利夫兰医学中心勒纳医学院,克利夫兰医学中心) ; Medical Oncology, Yale School of Medicine(耶鲁医学院医学肿瘤学)
专题命中 效率与部署 :language model(abstract);prompting(abstract);分类 cs.AI
AI总结 提出EPPC-OASIS框架,通过本体感知的Wasserstein对齐目标增强微调,并结合推理精炼步骤,从安全消息中自动提取结构化EPPC编码,在多个语言模型上取得一致改进。
MGVQ:协同多维敏感度感知与梯度-海森融合的向量量化
机构 * Bauman Moscow State Technical University(巴甫洛夫莫斯科国立技术大学)
专题命中 效率与部署 :language model(abstract);post-training(abstract);分类 cs.LG
AI总结 提出MGVQ框架,通过敏感度引导的结构化混合精度量化和梯度感知的二阶误差补偿,实现视觉-语言模型的超低位向量量化,在2-bit量化下最高提升4.9个点。