Efficient On-Device Diffusion LLM Inference with Mobile NPU
基于移动NPU的高效设备端扩散大语言模型推理
机构 * Tsinghua University(清华大学) ; Beihang University(北京航空航天大学)
AI总结 提出首个NPU感知推理框架Diffusion-LLM-on-NPU,通过多块推测解码、双路径渐进修正和交换优化内存运行时,在移动设备上加速扩散大语言模型推理,相比CPU基线实现17-42倍延迟降低。
高校专区
基于移动NPU的高效设备端扩散大语言模型推理
机构 * Tsinghua University(清华大学) ; Beihang University(北京航空航天大学)
AI总结 提出首个NPU感知推理框架Diffusion-LLM-on-NPU,通过多块推测解码、双路径渐进修正和交换优化内存运行时,在移动设备上加速扩散大语言模型推理,相比CPU基线实现17-42倍延迟降低。
FreoStream: 通过未来感知推理和安全对齐优化增强流式护栏
机构 * South China University of Technology(华南理工大学) ; BUAA(北京航空航天大学)
AI总结 提出FreoStream框架,通过未来感知推理减少过度拒绝,并利用安全对齐优化提升流式安全检测,在多个基准上实现更低过度拒绝率和更好越狱防御。
Comments 19 page,11 figures
StainFlow: GUI代理中实体痕迹追踪与证据链接用于过程奖励
机构 * Beihang University(北京航空航天大学) ; Peking University(北京大学) ; Renmin University of China(中国人民大学) ; Northwestern Polytechnical University(西北工业大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; National University of Singapore(新加坡国立大学) ; Zhongguancun Laboratory(中关村实验室)
AI总结 提出StainFlow模型,通过全局实体痕迹追踪和局部证据链接,解决GUI代理过程奖励中的里程碑分解主观性和局部窗口证据遗漏问题,提升在线强化学习成功率3.2%。
MASLab:基于LLM的多智能体系统的统一全面代码库
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; University of Oxford(牛津大学) ; Princeton University(普林斯顿大学) ; Meta ; University of Michigan(密歇根大学) ; The University of Sydney(悉尼大学) ; Beihang University(北航) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学)
AI总结 提出MASLab代码库,集成20余种方法,提供统一环境与标准化评估,降低研究门槛,覆盖10+基准测试和8种模型。
Comments 18 pages, 11 figures