BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)
专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG
Comments 22 pages, 8 figures
零样本嵌入漂移检测:一种轻量级防御对抗提示注入的LLM方法
机构 * Algoverse AI Research(Algoverse AI研究院) ; Berkeley(伯克利大学)
专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI
AI总结 本文提出ZEDD,通过量化嵌入空间中良性与可疑输入之间的语义变化,实现对直接和间接提示注入的检测。该方法无需模型内部访问或先验知识,具有低工程开销,能高效部署于多种LLM架构,准确率达93%以上。
Comments Accepted to NeurIPS 2025 Lock-LLM Workshop
FleetSieve:面向SLO感知的大语言模型集群配置的决策关键型性能分析
机构 * Meta
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG
AI总结 FleetSieve是一种面向SLO感知的LLM集群配置的决策关键型性能分析方法,通过联合建模容量与尾部延迟选择测量,可减少GPU资源消耗,避免违反SLO,提升集群决策效率。
PrefixAgent:一种基于大语言模型的高效前缀加法器优化设计框架
机构 * HKUST(GZ)(香港科技大学(广州))
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI
AI总结 本研究针对前缀加法器设计空间随位宽指数增长的优化难题,提出基于LLM的PrefixAgent框架,通过将任务拆分为两个子任务并利用等价图构建训练数据,在几乎所有配置下实现了更小的加法器面积,且在位宽更大时优势更显著。
Ventor-QTest:威胁模型驱动的供应商托管大语言模型API验证
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Ventor-QTest是一种无需目标API概率信息的复合黑盒审计方法,通过AFL和EFL指标审计供应商托管LLM API质量,可反映长视野任务的极端保真度损失,开源实现可获取。
当熵不够用时:在大语言模型输出长度预测中恢复丢失的语义
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究针对 LLM 服务中序列填充导致的算力浪费问题,提出 ESTP 框架结合熵与语义重要性预测输出长度,在 ForeLen 基准及端到端测试中均表现更优,可提升吞吐量并降低填充率。
面向移动边缘计算中流处理的、基于大语言模型辅助合同网协商的多智能体调度
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI
AI总结 针对移动边缘计算流处理的分散调度难题,提出MAS-DecStream模型,其核心为LLM-MR-CNP协议,实验表明该模型可降低延迟违规、提升冲突解决率与效用,多轮CNP优化及LLM辅助均具价值。
Comments 8
基于模型合并的大语言模型推荐系统高效推理研究
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究针对LLM推荐系统推理冗长导致成本高的问题,提出首个用于推理压缩的注意力头级细粒度模型合并框架,在不降低推荐准确率的前提下最多缩短24.3%的推理长度。
SafeQL:基于搜索的安全高效大语言模型Text-to-SQL优化方法
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 SafeQL是将DBMS设为主动引导者的基于搜索的Text-to-SQL优化方法,可修复SQL错误,在Bird和Spider基准上提升了执行准确率与效率。
Comments VLDB 2026
Journal ref Proc. VLDB Endow. 19(9): 2210-2223, 2026
基于大语言模型的时间序列预测的高效测试时缩放
机构 * The University of Melbourne(墨尔本大学) ; Monash University(莫纳什大学)
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG
AI总结 本研究提出 SCALER 框架,通过轻量 Transformer 预测未来粗粒度形状引导 LLM 迭代精调,在多类预测任务中优于基线且降低推理成本。
Comments Accepted at KDD 2026 (Oral)
当大语言模型智能体进行谈判:供应链中的私人信息与动态议价
机构 * School of Business, University of Connecticut(康涅狄格大学商学院)
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究以供应链议价问题为场景,将9个LLM与完美贝叶斯均衡基准测试,发现LLM智能体的谈判能力、提供商身份及提示策略对剩余分配和效率有显著影响,为AI智能体审计提供了三维框架。
知识蒸馏中语言模型的知识记忆动态
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Meta Central Applied Science(Meta中央应用科学) ; FAIR at Meta(Meta的FAIR) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL
AI总结 本研究探讨了知识蒸馏中语言模型的知识记忆动态,发现蒸馏模型比标准微调记忆更少,且硬蒸馏方法风险更高。
通过渐进压缩实现口语语言模型的高效模态链推理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Token Foundry, Alibaba Group(阿里巴巴集团淘系技术)
专题命中 效率与部署 :language model(title,abstract);SLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL
AI总结 针对口语语言模型推理能力落后问题,提出高效模态链推理(ECoM推理),通过压缩文本组件提高推理准确性,并用渐进压缩策略训练,实验显示其在口语数学问答基准测试中,增强推理且保持效率,准确率提升显著。
MicroEvo:知识引导的大语言模型采样用于高效微架构设计空间探索
机构 * Southeast University(东南大学) ; National Center of Technology Innovation for EDA(国家EDA技术创新中心) ; NVIDIA Corporation(英伟达公司) ; Fudan University(复旦大学) ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Peking University(北京大学)
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI
AI总结 MicroEvo是结合LLM与MCTS的知识引导框架,用于多目标微架构优化,可提升帕累托前沿质量与搜索效率,具备工业级可扩展性。
Comments Accepted by ICCAD 2026
多智能体大语言模型系统推理时并行性的两层视角
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出整合两类并行性的TIPEX框架,在GAIA基准上验证推理时并行性可提升多智能体系统性能,中等难度任务从两类并行性协调中获益最多。
Comments Accepted to ICML 2026
PriDyG:结合大语言模型与图神经网络的隐私保护动态图推理
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG
AI总结 PriDyG是结合GNN结构学习与LLM语义推理的隐私保护动态图推理框架,可在边级差分隐私约束下,在节点分类等任务中降低累计隐私开销并保持良好效用。
LatentGuard:面向大语言模型安全防护的高效可检查潜在推理方法
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI
AI总结 LatentGuard是将连续潜在推理引入防护模型的高效可检查框架,其8B参数版本在提升安全判定性能的同时大幅降低推理成本,还具备良好的审计效用,为可部署的LLM安全防护提供了可行路径。
通过解耦注意力机制与前馈网络及灵活频率缩放实现高能效大语言模型服务
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 AFlex框架通过全局调度器、局部DVFS控制器及交错A/F流水线,优化解耦A/F服务的资源配置与GPU频率,在满足SLO的同时将每token能耗降低最高49%
压缩前诊断:面向大语言模型服务轨迹的预测独立瓶颈见证优化
机构 * Central South University(中南大学) ; University of Technology Sydney(悉尼科技大学) ; Chongqing Normal University(重庆师范大学) ; East China Normal University(华东师范大学) ; Alibaba Group(阿里巴巴集团)
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI
AI总结 针对LLM服务轨迹重放成本高及现有方法的局限,提出BPW框架,通过三阶段流程构建紧凑可靠的重放套件,在三个数据集上优于16种策略,获两项指标提升
跨语言令牌套利:通过本地LLM预处理优化代码智能体上下文窗口
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI
AI总结 提出一种预处理的边缘端提示重写中间件,利用本地Llama 3.2模型进行跨语言翻译和结构重写,在保持或提升任务准确率的同时减少34-47%的提示令牌和最高18.8%的总令牌消耗。
Comments Updated References
云到边缘:在硬件加速的单板计算机上评估大语言模型推理
机构 * Kaze Technologies(凯兹技术) ; Kaze Consulting(凯兹咨询) ; Electrical and Computer Engineering(电气与计算机工程) ; Lebanese American University(黎巴嫩美国大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Exeter(埃克塞特大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出一种多维评估方法,评估四种物联网适用的边缘平台配置,测试最新硬件加速器的单板计算机,揭示硬件加速器在隐私敏感和连接受限环境中的优势。
当派生测量值产生误导时:利用特权模态可靠性证据量化并缓解大语言模型的过度信任问题
机构 * Politecnico di Milano(米兰理工大学) ; Zhejiang University(浙江大学) ; China-Japan Friendship Hospital(中日友好医院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Emory University(埃默里大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究定义了派生特征过度信任(DFOT)问题,构建了量化该问题的估计量框架,在PPG-ECG数据集上验证了基于特权蒸馏的基线方法可缓解DFOT,为相关研究提供通用评估目标。
Comments 25 pages, including references and supplementary material; 3 figures and 19 tables. Code: https://github.com/Zongheng-Guo/When-Derived-Measurements-Mislead
从评分到行动:面向大语言模型智能体的结果验证式对比自蒸馏
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究针对LLM智能体现有自蒸馏方法的局限,提出OVCSD方法,经实验在ALFWorld和WebShop数据集上显著提升了智能体任务完成成功率。
GyRot:利用旋转与细粒度组量化之间的隐藏协同实现低位大语言模型推理
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG
AI总结 GyRot通过算法-硬件协同设计,结合旋转与细粒度组量化,在LLaMA系列模型4位量化推理中实现先进精度,同时提升加速比与能效,为LLM部署提供可行方案。
Comments 15 pages, 12 figures. Published in 2026 IEEE International Symposium on High-Performance Computer Architecture (HPCA), Sydney, Australia, pp. 1-15, DOI: 10.1109/HPCA68181.2026.11408453
Journal ref Proc. 2026 IEEE Int. Symp. High-Performance Computer Architecture (HPCA), 2026, pp. 1-15
HiSkill:利用分层技能图增强大语言模型智能体
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; China Mobile Group Shaanxi Co., Ltd(中国移动通信集团陕西有限公司) ; Ant Group(蚂蚁集团)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究提出HiSkill分层技能图框架,将交互轨迹组织成有向图,连接高级技能与可执行动作模板并捕捉多种关系。推理时检索子图引导任务执行,实验表明其在减少推理令牌消耗方面优于基线,有效弥合技能与动作差距。
PILA:用于大语言模型原生广告的即插即用插入法
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究如何通过自然整合赞助内容实现大语言模型盈利的问题,提出PILA方法,将广告插入重构成条件响应重写问题并解耦为轻量级边车模块,实验证明该方法能在保持回复质量的同时提高广告效果。
KBF:知识边界作为语言模型和黑盒API审计的指纹
机构 * Beihang University China(北航中国) ; Xidian University China(西电中国)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI
AI总结 提出KBF协议,利用知识边界附近的稳定数值召回率作为指纹,低成本黑盒审计模型API,检测替代和混合路由攻击。
通过Rao-Blackwellized E过程实现高效在线大语言模型水印检测
机构 * Yunnan Key Laboratory of Statistical Modeling and Data Analysis(云南统计建模与数据分析重点实验室) ; Yunnan University(云南大学) ; School of Statistics and Management(统计与管理学院) ; Shanghai University of Finance and Economics(上海财经大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究如何在大语言模型中高效检测水印,基于Rao-Blackwellized e过程开发在线检测框架,针对Gumbel-max水印实例化,能随时有效推理、递归更新证据,理论证明其有效性,模拟和实验验证了高效在线检测。
Comments 25 pages, 3 figures