Accelerating LLaMA Inference by Enabling Intermediate Layer Decoding via Instruction Tuning with LITE
专题命中 效率与部署 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments The code and models are available at https://github.com/princeton-nlp/LLM-Shearing
绝非数字:将答案作为事实使用的AI系统的结构弃权
机构 * Apple Inc.(苹果公司)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对LLM文本转SQL系统返回错误答案且无法区分的问题,提出带生成式外壳的可信内核架构,即结构弃权,在生产案例中验证其可靠性优于两种生成式替代方案。
Comments 26 pages, 5 figures, 5 tables. Technical report. Describes architecture and design principles only; contains no code, schemas, datasets, or performance metrics
生命周期最优分词:词汇表大小作为与部署 regime 相关的基础设施参数
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 该研究发现 LLM 分词器的最优词汇表大小随部署 regime 变化,提出生命周期部署成本模型,经实验证实其与训练最优值差异最高达 16 倍,且最优范围内质量损失极小,为 LLM 部署提供词汇表容量规划指导。
Comments 6 pages, 3 figures, 6 tables
前沿大语言模型能否媲美原生多模态嵌入?在难负例文本到图像检索上的对比
机构 * Westcliff University(韦克利夫大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究在Flickr30k数据集上对比Gemini Embedding 2等原生多模态嵌入与GPT-4.1、Claude Sonnet 4.6等前沿LLM的难负例文本到图像检索性能,发现二者表现相当,且多模态嵌入更适配低延迟应用
面向大型语言模型的可部署实例级多层激活调控
专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
AI总结 本研究提出可部署的实例级多层激活调控方案,解决现有全局固定层调控的缺陷,在两个8B模型和六个人格特质任务上,实现接近先验的性能,且避免流畅性崩溃。
Comments 43 pages, 24 figures, 30 tables. Under review at ACL Rolling Review (August 2026)
缓解英罗机器翻译中的性别偏差
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出结合LLM性别分类与Transformer翻译的混合流水线,引入新数据集,使英罗机器翻译在WinoMT等基准上性别准确率提升超40个百分点,为缓解该领域性别偏差提供新方法。
大型语言模型(LLM)无训练低秩压缩中的校准与截断误差传播研究
机构 * LG Electronics, North America(北美LG电子)
专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI
AI总结 本研究针对现有LLM无训练低秩压缩框架的两个关键局限,提出带校准修正的逐层压缩与带秩分配修正的迭代压缩方法,在Llama、Qwen3模型的零样本任务上实现1-2.5个准确率点提升。
Comments COLM 2026
AISPA:面向大语言模型应用的以用户为中心的系统提示审计框架
机构 * Stanford University(斯坦福大学) ; CMU(卡内基梅隆大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; University of Toronto(多伦多大学) ; UCSB(加利福尼亚大学圣巴巴拉分校) ; WashU(华盛顿大学) ; OSU(俄亥俄州立大学) ; UCSC(加利福尼亚大学圣克鲁兹分校) ; Northwestern University(西北大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; KAUST(阿卜杜拉国王科技大学) ; MIT(麻省理工学院) ; University of Oxford(牛津大学) ; Institute for Decentralized AI(去中心化人工智能研究所)
专题命中 效率与部署 :large language model(title);language model(title);foundation model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出以用户为中心的AISPA框架,审计88款商业AI产品的3249条系统提示指令,发现其设计差异大、保护指令范围浅、长度增长但仍存问题指令,凸显系统提示需更高透明度与监督。
循环残差量化:面向大语言模型的渐进式多精度表示
机构 * Intel(英特尔)
专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出循环残差量化(RRQ)框架,可从单个检查点生成LLM的多种精度表示,构建速度比MatGPTQ快3.3倍,在6、8比特精度下表现有竞争力,代码将公开。
Comments NeurIPS 2026 submission; 14 tables, 1 algorithm, and no figures
用于增强边缘部署小模型的大小模型协作
专题命中 效率与部署 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);language model(abstract);small language model(abstract)
AI总结 该研究提出自适应边缘-云框架G-Boost,通过动态选择推理或对数融合的协作方式,提升边缘部署小语言模型的任务性能,在两个数学推理数据集上优于多种基线方法。
CARE:通过科学实验中的可审计证据审查控制LLM生成的策略
机构 * University of Macau(澳门大学) ; University of Toronto(多伦多大学) ; UCLA(加州大学洛杉矶分校) ; Harvard University(哈佛大学) ; XtalPi(晶泰科技) ; McGill University(麦吉尔大学)
专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI、cs.LG
AI总结 提出CARE框架,通过可审计的干预门控机制,在保留非LLM优化器作为默认路径的同时,利用LLM修正挑战者排序策略,显著提升高通量实验优化性能。
Comments 27 pages, 5 figures. Code: https://github.com/SHITIANYU-hue/care
IRIS:来自冻结语言模型的可重复使用身份表示用于实体对齐
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究实体对齐问题,传统方法语义理解不足,基于LLM的方法未形成稳定身份空间。提出IRIS框架,从冻结LLM提取上下文表示构建实体签名,形成共享空间实现跨图谱对齐,在多个基准测试中取得良好成绩。
Comments 9 pages, 1 figure, 3 tables
理解大语言模型中与语气相关的推理成本
专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究提示语气对大语言模型答案准确性及推理成本的影响,通过在MMLU数据集上对七种语气进行实验,发现输出令牌长度变化超准确性变化,不同模型在不同语气下有不同表现,揭示语气对答案质量和推理资源消耗的作用。
Comments 16 pages, 1 figure, 9-page Appendix
MixQuant:大语言模型的自适应混合精度量化
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 效率与部署 :large language model(title);language model(title);post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型量化中预算变化及层敏感度评估问题,提出MixQuant自适应框架,通过边缘化失真获与预算无关分数、校准参数并惩罚不合理分配,在多种模型上优于基线,提升准确率并降低困惑度。
Comments Preprint
GQLA: 面向硬件自适应的大语言模型解码的分组查询潜在注意力
机构 * Institute for Artificial Intelligence(人工智能研究院)
专题命中 效率与部署 :large language model(title);language model(title);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出GQLA,一种对MLA的极小修改,通过暴露MQA和GQA两种等价解码路径,使单一权重集在不同硬件(如H100和H20)上达到最优性能,并支持零冗余张量并行,同时通过TransGQLA将预训练GQA检查点转换为GQLA模型,显著压缩KV缓存。
FinRAG-12B:一家银行中基于事实的问题回答的生产验证配方
机构 * Kasisto ; Textualization ; NBME
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种高效框架,通过数据生成管道和校准拒绝机制,提升银行领域LLM的准确性与合规性,实现7.1个百分点的查询解决率提升。
Comments 7 pages, ACL 2026 conference
SelectInfer:用于设备端语言模型的选择性神经元加载与计算
机构 * Paderborn University(帕德博恩大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型在边缘设备部署的挑战,提出SelectInfer框架,通过离线分析识别特定任务和通用神经元,实施选择性加载和计算两项关键优化,可显著减少内存与计算量,同时保持任务性能,推动LLM在边缘设备的部署。
检测、归因、叙述:用于可解释的洗钱者识别的端到端管道
机构 * OCBC, Singapore(新加坡华侨银行)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对洗钱者账户检测难题,提出端到端管道,含LightGBM分类器、TreeSHAP归因层和LLM模块。经评估,系统收益率提升,警报量增加,LLM叙述减少认知负荷,在实际部署中表现出色,还探讨了在监管金融环境中的应用影响。
QDEvo:用于自动启发式设计的多目标质量多样性框架
机构 * Hanoi University of Science and Technology(河内科学技术大学) ; George Mason University(乔治·梅森大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对LLMs与进化计算集成用于自动启发式设计时的模式崩溃问题,提出多目标QDEvo框架,结合质量多样性优化与LLM驱动启发式搜索,通过实验证明该框架能发现高性能、高效且语义多样的启发式方法,优于现有方法。
Comments 4 pages; Accepted as poster at GECCO 2026
dMX: 低精度浮点格式的可微分混合精度分配
机构 * AMD
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出可微分混合精度量化框架 dMX,通过连续优化每层浮点格式参数并配合退火调度和正则化项,实现硬件兼容的 MXFP 格式分配,在 LLM 上取得帕累托最优效果。
LC-QAT: 通过线性约束向量量化实现LLM的数据高效2比特QAT
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 效率与部署 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出LC-QAT,一种2比特权重量化的向量量化感知训练框架,通过可微的线性映射避免离散码本查找,实现高质量PTQ初始化和端到端优化,仅用0.1%-10%训练数据即超越现有方法。
Comments Accepted by ICML 2026
Skill-MAS: 演化元技能以自动生成多智能体系统
机构 * Ant Group(蚂蚁集团) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出Skill-MAS,通过将高层编排能力解耦为可演化的元技能,在无需参数更新的情况下实现经验保留,利用多轨迹采样和选择性反思优化元技能,在多个基准和LLM上取得显著性能提升且成本可控。
少即是多:面向边缘设备问答应用的轻量级提示压缩
机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) ; Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)
AI总结 提出CORE,一种无需辅助语言模型的两阶段句子级提示压缩方法,通过NER和语义匹配构建答案集与线索集,结合正交残差检索和空间邻近度过滤,在边缘设备上显著提升准确率、降低内存和能耗。
统一声学特征与文本的多模态大语言模型用于神经退行性疾病筛查
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出NeurMLLM框架,通过多模态大语言模型融合声谱图、MFCC和文本,实现阿尔茨海默病和帕金森病的精细分期,优于传统方法和现有LLM方法。
Comments IEEE International Conference on Healthcare Informatics, 2026
语义法定数保证:面向非确定性AI基础设施的集体认证
机构 * OpenKedge.io
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出语义法定数保证(SQA),一种通过多样化验证者群体和风险自适应法定数谓词,将非确定性LLM代理的不安全操作批准率从18.5%降至0.3%的控制平面原语。
Comments 21 pages, 2 figures, 6 tables
DYCP:基于LLMs的长格式对话动态上下文修剪
机构 * Computer Science Emory University(计算机科学 埃默里大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 DYCP通过动态识别和检索对话段落,提升长格式对话中LLM的上下文管理效率,实现更精确的上下文选择和推理效率提升。
Comments Accepted (B) to TACL 2026
QuBLAST: 一种采用块级压缩方法和激活缩放策略量化大语言模型的框架
机构 * eBRAIN Lab, Division of Engineering, New York University (NYU) Abu Dhabi(eBRAIN实验室,工程系,纽约大学(NYU)阿布扎赫德分校)
专题命中 效率与部署 :large language model(title);language model(title);post-training(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型部署困难,提出QuBLAST框架,通过块级混合精度量化和激活缩放策略,在降低模型大小40%-45.2%的同时保持困惑度增加不超过5%。
Comments 10 pages, 9 figures, 5 tables
AlignAtt4LLM:面向仅解码器LLM的快速AlignAtt方法在IWSLT 2026同声传译任务中的应用
机构 * Charles University, MFF, ÚFAL(查理大学,人文学院,ÚFAL) ; University of Edinburgh(爱丁堡大学)
专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI
AI总结 提出AlignAtt4LLM系统,通过显式源文本跨度、离线选择翻译对齐头、选择性qk快速重放和运行时查询/键捕获,首次将AlignAtt策略应用于仅解码器LLM,在英德、英意同声传译中优于基线。
Comments Accepted to IWSLT 2026
黑盒、自适应、高效、可迁移、有害、适用……攻击是破解LLM所需的一切
机构 * University of St. Gallen(圣加尔大学)
专题命中 效率与部署 :LLM(title_cn,abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG
AI总结 提出间接危害优化(IHO)方法,通过迭代偏好优化训练掩码扩散语言模型攻击器,实现黑盒、高效、可迁移的自适应攻击,显著提升对分层防御的破解成功率。