Balcony: A Lightweight Approach to Dynamic Inference of Generative Language Models
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);foundation model(abstract);instruction tuning(abstract)
Comments To appear at the 13th International Conference on Learning Representations (ICLR 2025) as a Spotlight presentation
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
Comments ICLR 2025
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);small language model(abstract)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments ICLR 2025 Accepted
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)
Comments Efficient Video Large Language Models
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 效率与部署 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
专题命中 效率与部署 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments 19 pages
专题命中 效率与部署 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments 22 Pages
知识盲区:一种用于审计LLM辅助分析中先验污染的推理时协议
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出了一种在代理系统中用于审计LLM辅助分析中先验污染的推理时协议,通过替换实体标识符以匿名代码并比较输出与未盲对照组,以恢复审计性。
Comments code and LLM skill at: https://github.com/mcuccarese/epistemic-blinding 7 pages 3 figures
专题命中 效率与部署 :LLM(title,abstract);foundation model(abstract,comments);large language model(abstract);language model(abstract)
Comments Accepted at International Workshop on Foundation Models for Cyber-Physical Systems & Internet of Things (FMSys) 2024, Co-located at CPS-IoT Week 2024
COMIC:面向多模态大语言模型的参考感知安全门控
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本研究针对多模态大语言模型的参考依赖型安全缺陷,提出COMIC参考感知安全门控,通过解析操作-目标对评估安全性,提升了模型鲁棒性且保留良性效用。
大语言模型:数学表述
机构 * Statistical Sciences, University of Toronto(多伦多大学统计科学系) ; Vector Institute(向量研究所) ; Amazon Search(亚马逊搜索) ; Computing and Mathematical Sciences, California Institute of Technology(加州理工学院计算与数学科学系)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI总结 本文提出了一种大语言模型的数学框架,涵盖文本编码、模型架构、学习过程及部署方法,旨在提升算法的准确性、效率和鲁棒性。
Comments 56 pages, 2 figures
超越二元优先级:面向大语言模型服务的多层级SLA调度
专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.LG
AI总结 本研究扩展Llumnix的优先级模型支持任意层级,在Vidur模拟器中对比多基线,发现四层优先级调度成本效益最优,10层时仍能维持收益且无尾部延迟崩溃。
Comments 13 pages, 9 figures, 4 tables
波纹枢轴搜索:扩散大语言模型的主动并行解码
机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学合作中位数网络创新中心) ; Alibaba Group TMLR Group(阿里巴巴集团TMLR团队) ; Hong Kong Baptist University(香港浸会大学) ; A*STAR CFAR and Nanyang Technological University(新加坡科研局计算科学中心和南洋理工大学) ; School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 提出RPS方法,利用dLLM解码的波纹效应,在保持生成质量的同时,大幅提升解码速度与准确率,适用于推理及代码生成任务。
针对大语言模型幻觉风险的置信约束推断
机构 * International Institute of Information Technology, Hyderabad, India(国际信息科技研究所,海得拉巴,印度)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI总结 本研究提出置信约束推断方法,通过限制幻觉发生的概率,实现大语言模型在部署时的风险控制,实验显示其在风险控制、输入检测和重复使用中的有效性。
Journal ref Transactions on Machine Learning Research (TMLR), 2026
大语言模型的统计无损量化
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI总结 本文提出统计无损压缩的中间路径,定义任务无损与分布无损的量化标准,证明对称与非对称量化的方差差异,通过SLQ方法实现大语言模型的任务无损、分布无损压缩及1.7-3.7倍推理加速。
GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文提出即插即用的GSTEP剪枝框架,解决现有视频令牌剪枝方法的局部剪枝缺陷,在多个VideoLLMs上实现良好的准确率-效率权衡,在LLaVA-OneVision-7B上剪去75%视觉令牌,保留100.2%原始性能并获1.17倍端到端加速。
Comments 4 figures, accepted to ACM MM 26'
零样本大型语言模型能否预测儿童营养不良?一项关于公平性与时序鲁棒性的研究
机构 * School of Computing, Mathematics and Engineering, Charles Sturt University(查尔斯斯特大学计算、数学与工程学院)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 本研究评估零样本LLM预测儿童营养不良的可行性,发现GPT-4o-mini零样本预测儿童发育迟缓性能接近随机森林基线,灵敏度更高、性别公平性好、时序稳定,但居住地和家庭财富维度存在公平性差异,需进一步研究。
Comments Accepted to AIME 2026 Workshop
提示工程对用于安全查询路由的小型语言模型的影响
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.CL
AI总结 研究安全查询路由问题,探究紧凑型开放权重小型语言模型在延迟约束下处理任务的能力。通过实验评估发现中等规模模型在低延迟下接近前沿,提示优化技术可提升模型表现,是安全查询路由的有用第一步,部分弱模型仍需其他调整。
KQFuzz:通过大语言模型对量子库进行知识引导的模糊测试
专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);prompting(abstract)
AI总结 针对量子库模糊测试灵活性和效率不足问题,提出KQFuzz,利用代码库知识结合适应度引导评估与两级变异,实现高质量测试生成。在三个量子库上测试效果显著优于其他方法,发现多个错误,推动量子计算领域发展。
Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering. 17 pages, 9 figures. Comments are welcome
Omni-Prune:用于高效全模态大语言模型的查询感知统一令牌剪枝
机构 * Nanjing University(南京大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 研究针对全模态大语言模型推理时音频-视频令牌序列长、预填充延迟高和GPU内存使用量大的问题,提出无需训练的查询感知Omni-Prune框架,联合去除冗余并保留跨模态证据,实验证明其性能优于基线方法,能加速预填充并减少内存。
Comments 14 pages, 7 figures. Code: https://github.com/kimberlyii/Omni-Prune
TriSP:用于大语言模型的三信号结构化剪枝
机构 * National School of Artificial Intelligence (ENSIA)(国家人工智能学院)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 研究针对大语言模型部署受参数成本限制问题,提出TriSP方法,结合权重幅度、激活范数与梯度敏感性产生通道级分数,联合自适应预算分配和低秩适应恢复,实现低困惑度、高零样本准确率及高推理吞吐量。
关键词很重要:揭示设备端大语言模型提示的能量敏感性
机构 * Georgia State University(佐治亚州立大学)
专题命中 效率与部署 :LLM(title);prompting(title);large language model(abstract);language model(abstract)
AI总结 研究设备端大语言模型提示措辞与能耗关系,通过在智能手机上收集功率测量数据,量化语言特征对解码长度和总能量的影响,发现提示工程是提高能效的有效手段。
用MoP压缩LLM:剪枝混合方法
专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 MoP通过结合深度和宽度剪枝,提升了LLM的压缩效率和推理速度,同时在视觉-语言模型中实现了更高的计算效率。
Comments Code and models are available at: https://github.com/c2d-usp/Efficient-LLMs-with-MoP
LaCache:用于扩散大语言模型的精确缓存和精度自适应推理
机构 * Li Auto Inc.(理想汽车公司)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 研究针对扩散大语言模型算子级冗余问题,提出LaCache加速框架,通过无损缓存中间结果及集成FP8量化策略,无需训练,单独使用可实现约1.3倍端到端加速,与现有方法结合可达40.2倍加速且保持任务精度。
Transformer及大语言模型在无人机应用中的最新进展
机构 * LSEA Laboratory, Department of Electrical Engineering, University of Medea, 26000, Algeria(里塞阿实验室,电气工程系,梅迪亚大学,阿尔及利亚) ; Institute of Technology, University Centre Salhi Ahmed, Naama, Algeria(技术研究所,萨利哈·阿赫迈德大学中心,纳马,阿尔及利亚) ; Cybersecurity Institute, Department of Computer Science, University of Liverpool, L69 3BX, Liverpool, UK(网络安全研究所,计算机科学系,利物浦大学,英国) ; LCPTS Laboratory, University of Sciences(LCPTS实验室,科学大学) ; College of Computing(计算学院) ; Data Science, Nanyang Technological University, Singapore.(数据科学,南洋理工大学,新加坡)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文综述了Transformer及大语言模型在无人机应用中的最新进展,包括分类、混合模型、强化学习和大语言模型的应用,以及精准农业和自主导航等新兴应用。
Journal ref ACM Computing Surveys, 2026
EasyOPD:一种易于使用的大语言模型在线策略蒸馏框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Tencent(腾讯) ; Shanghai Innovation Institute(上海创新研究院) ; National University of Singapore(新加坡国立大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 研究针对传统语言模型蒸馏问题,提出基于verl构建的EasyOPD框架,分离用户配置等,为三种OPD设置实例化方法,经多基准测试,其实现可通过同一后端执行,还发布了相关配置、文档及演示包。
Comments 10 pages, 2 figures