EcoRank: Budget-Constrained Text Re-ranking Using Large Language Models
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Accepted to Findings of ACL 24
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Accepted to Findings of ACL 24
专题命中 效率与部署 :LLM(title,abstract);language agent(title,abstract);large language model(abstract);language model(abstract)
Comments This paper is accpeted by AAMAS 2024. More demonstrations can be seen on our website https://sites.google.com/view/overcooked-hla/
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Accepted to MT Summit 2023
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments arXiv admin note: text overlap with arXiv:2309.04213
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments MLSys 2023
专题命中 效率与部署 :language model(title,abstract);small language model(title);large language model(abstract);instruction tuning(abstract)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI、cs.LG
Comments Code available at https://github.com/ctlllll/LLM-ToolMaker
FluxBin:基于灵活查找表的超低位大语言模型推理——算法与内核协同设计
机构 * The University of Hong Kong(香港大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本研究针对二值量化LLM推理的硬件内核缺失问题,提出FluxBin算法-内核协同设计,实现超低位推理的加速、能效提升与内存压缩,可高效部署70B规模模型。
通过表格网格导航和逐步推理提示实现高效的表格问答
机构 * Vision Intelligence Lab, IIIT Allahabad, Prayagraj, India(视觉智能实验室,印度拉贾斯坦邦阿拉哈巴德)
专题命中 效率与部署 :prompting(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种无需训练的表格问答方法,通过TableGrid导航和Progressive Inference Prompting框架,提升了表格问答的精度和效率,并在多个数据集上验证了其有效性。
Comments Accepted for Presentation in ICDAR 2026, Vienna, Austria
LlamaRec-LKG-RAG:一种用于基于大语言模型的排序的单遍可学习知识图谱-RAG框架
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出LlamaRec-LKG-RAG框架,将个性化知识图谱上下文集成到LLM推荐排序中,经ML-100K等数据集实验,在MRR等指标上较LlamaRec取得提升,为知识感知个性化推荐奠定基础。
DOCSCHISEL:面向大语言模型智能体的自适应工具文档优化框架
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对LLM智能体工具文档的异质性与泛化问题,提出DocsChisel自适应优化框架,经实验较原始文档及EasyTool、DRAFT基线大幅提升任务成功率,且开销有限。
了解你就是一切:LLM智能体在社交媒体模拟中实现近乎完美的个人资料一致反应预测
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 本研究通过基准测试12种LLM配置,发现其在社交媒体反应预测中表现优异,可用于推荐系统压力测试,同时也揭示了大规模合成智能体群对公众意见的潜在威胁。
Comments 28 pages, 6 figures
用于高效大语言模型推理的统一静态-动态剪枝
机构 * Seoul National University(首尔国立大学)
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型推理瓶颈,提出统一静态-动态剪枝框架SPDP,集成非结构化SP与输入自适应DP,设计新格式和内核,经评估其加速效果显著,推进推理效率-质量前沿,提升大规模LLM服务的吞吐量和性能功耗比。
Comments Proceedings of the VLDB Endowment (PVLDB), Volume 19, Issue 11, 2026
中继而非路由:面向成本高效的大语言模型驱动演化的自适应种群交接
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对LLM驱动演化全程用强模型成本高的问题,提出无需训练的自适应种群交接框架,通过廉价模型探索、中继增益触发交接,在12个测试设置中11个获最高平均分数,性能优于基线。
EdgeXpert:一种基于混合专家与推测解码的内存高效型大语言模型推理边缘设备
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 EdgeXpert是一款软硬件协同设计的LLM加速器,通过优化预填充与解码阶段的专家处理,解决推测解码与MoE的兼容性问题,在降低延迟与能耗的同时维持精度,适用于边缘设备的LLM推理。
Comments Accepted at the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)
野外环境下的大语言模型服务:框架、方法与系统设计的实证研究
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过实证分析开源软件系统中5种LLM服务框架的应用情况,明确了框架使用特点、常用服务方法及应用场景,为相关人员提供了实践见解。
TraceCompiler:技能引导的LLM智能体轨迹挖掘与编译为近确定性工作流
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 本文提出TraceCompiler系统,通过技能引导挖掘含噪声的LLM智能体轨迹并编译为近确定性工作流,在T1、AppWorld数据集上验证了依赖恢复的高精度,实现了Venmo资金请求意图的调用减少。
Comments 17 pages, 4 figures, 5 tables
FLARE: 混合语言模型的扩散方法
机构 * Adobe Research(Adobe研究院) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 效率与部署 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);post-training(abstract)
AI总结 提出FLARE框架,通过结合自回归和扩散目标、硬件感知内核和统一推理,将混合注意力LLM转换为支持并行解码的扩散模型,在保持能力的同时提升吞吐量。
TELLER:面向大语言模型推理的非侵入式跨层根因分析
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 TELLER是面向LLM推理的非侵入式跨层根因分析框架,通过跟踪与日志结合实现异常定位与自然语言解释,在多节点GPU工作负载上兼具高效压缩与诊断性能,为LLM推理RCA提供实用支撑。
Comments 12 pages, 1 figure, 9 tables. Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
Bole:面向混合注意力语言模型的高效树推测解码
专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
AI总结 Bole是内核-运行时协同设计方案,通过优化树推测解码的线性注意力树验证与瞬态内存管理,显著提升混合注意力LLM的离线解码吞吐量与在线智能体工作负载的延迟性能。
Comments 14 pages, 12 figures, 7 tables
双智能体语言模型中继中的状态压缩:约束保留的封闭世界研究
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究双智能体LLM中继中交接压缩问题,比较无压缩、叙述性总结、JSON提取、基于嵌入的修剪四种交接条件,发现交接表示影响下游可行性,JSON提取可行性准确率最高达0.96,结构化可审计表示利于约束检查。
Comments 8 pages, 2 figures, 3 tables
将尝试矢量化:为基于LLM的生成检索在加速器上实现高效的受限解码
机构 * Yale University(耶鲁大学) ; Google DeepMind(谷歌DeepMind)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG
AI总结 STATIC通过矢量化技术实现高效受限解码,显著提升基于LLM的生成检索性能。
Comments KDD 2026 camera-ready
FlowBot:通过双层优化和文本梯度诱导LLM工作流
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG
AI总结 本文提出FlowBot,一种基于双层优化和文本梯度的数据驱动方法,自动诱导LLM代理和工作流,与人类设计的基线相比表现相当。
通过渐进式树状草稿的推测性解码解锁自回归语言模型中的并行性
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 研究提出渐进式树状草稿(PTD)方法,通过结构化、引导式并行草稿策略利用模型并行潜力,结合渐进树结构与逐步修剪机制,在单次前向传播中引导LLM探索多条语义路径,实现高达2倍解码加速且无需训练、与模型无关。
从原子动作到标准操作程序:自进化语言模型智能体的迭代工具优化
机构 * Renmin University of China(中国人民大学) ; Alibaba Group(阿里巴巴集团)
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对现有LLM智能体框架问题,提出将原子动作合成SOP实现自进化,介绍EvoSOP框架,经实验验证该框架能显著提升任务成功率、减少交互轮数,为自进化智能体开发提供可扩展路径。
RSF-GLLM:通过循环软流和去耦语言模型生成弥合多跳知识图谱问答中的语义鸿沟
机构 * Adobe Research(Adobe研究院) ; Adobe Systems(Adobe系统公司)
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究多跳知识图谱问答中传统方法的语义鸿沟问题,提出RSF-GLLM框架,通过循环软流模块传播分数、引入正则化保证收敛,提取路径微调LLM,实验证明该方法性能优且推理效率高。
Comments Accepted for publication in ICML 2026 as a full research paper; 21 pages
LLM引导的ODE发现与小群体聚合数据的参数推断
机构 * Institute of Medical Biometry and Statistics, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院医学统计与生物统计研究所) ; Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院皮肤科) ; Prior Labs, University of Freiburg(弗莱堡大学Prior实验室)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 提出AgentODE框架,利用LLM提出候选ODE结构,并通过工具增强的推理代理仅基于群体级汇总统计量迭代优化参数分布,实现从稀疏、噪声数据中发现可解释的ODE结构。
TraceLab: 表征用于LLM服务的编码代理工作负载
机构 * University of Washington(华盛顿大学) ; Wuhan University of Technology(武汉理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 通过收集4300个编码代理会话(含35万LLM步骤和43万工具调用)的真实轨迹,分析发现长自主循环、长上下文短输出、多样化重尾工具调用及高但不完美前缀缓存命中率等特征,为优化服务提供具体方向。
结构化渐进知识激活用于LLM驱动的神经架构搜索
机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University.(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) ; MiLM Plus, Xiaomi Inc.(小米MiLM Plus) ; North China University of Technology, Beijing.(华北电力大学(北京)) ; Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SPARK方法,通过显式选择功能因素并条件化编辑,减少功能耦合影响,提升神经架构搜索的样本效率和OOD准确性。