FATE: Future-State-Aware Scheduling for Heterogeneous LLM Workflows
FATE:面向异构大语言模型工作流的未来状态感知调度
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 FATE通过结合前沿规划、前瞻性候选评分和多设备分片执行,优化异构LLM工作流的未来状态,降低延迟并提升效率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
FATE:面向异构大语言模型工作流的未来状态感知调度
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 FATE通过结合前沿规划、前瞻性候选评分和多设备分片执行,优化异构LLM工作流的未来状态,降低延迟并提升效率。
解决大规模LLM服务中的数据并行负载均衡瓶颈:大规模下的实用在线路由
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 本文提出BalanceRoute算法,通过在线路由减少LLM服务中的数据并行负载不均衡,提升端到端服务吞吐量。
Comments 30 pages, 14 figures
Nitsum:通过自适应张量并行性服务分层LLM请求
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 Nitsum通过自适应张量并行性优化分层LLM服务,提升多租户场景下的吞吐量,实验显示性能提升达5.3倍。
GLiNER Guard:面向生产LLM安全与隐私的统一编码器家族
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 本文提出GLiNER Guard统一编码器,实现安全分类与PII检测,提升生产LLM的安全性和隐私保护效率。
Comments Models: https://huggingface.co/collections/hivetrace/gliner-guard-v1 PII-Bench: https://huggingface.co/datasets/hivetrace/pii-bench
eLLM:一种高效的大型语言模型服务弹性内存管理框架
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 eLLM提出一种弹性内存管理框架,通过虚拟张量抽象、弹性内存机制和轻量调度策略,提升LLM服务的内存利用效率,实现在动态负载下的更高吞吐量和更大批次大小。
Comments 7pages, accepted to DAC'2026
LLM-Emu: 通过基于性能的采样实现LLM推理的原生运行时仿真
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 LLM-Emu通过基于性能的采样实现LLM推理的原生运行时仿真,能够准确模拟vLLM服务行为,支持在线实验。
Comments 6 page, 2 figures, workshop paper shape
基于大型语言模型的网络测量
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文探讨利用大型语言模型进行定向网络测量,通过构建定制数据集评估不同模型性能,提出两步方法提升测量效率,并验证LLM在安全隐私趋势分析中的有效性。
Comments 23 pages, 2 figures, 8 tables
ProMax:探索基于分布塑造的LLM衍生资料在推荐系统中的潜力
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出ProMax框架,通过分布塑造技术提升推荐系统性能,利用用户和物品资料的协同关系,改进推荐模型对未见物品的偏好学习。
Comments 11 pages, 8 figures, accepted by SIGIR 2026
基于查找表加速器的硬件生成与探索:用于1.58位LLM推理
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出一种基于查找表的加速器设计框架,通过系统化分析揭示了三元权重计算的架构权衡,优化设计在面积上比乘法器基线减少了2.2倍,并通过基准测试证明了参数修正可进一步提升性能。
Comments Presented as ISPASS 2026
基于大语言模型的并行QPSK-AWGN信道功率分配
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文提出LLM-Steered Power Allocation,通过大语言模型与数值优化器协同,实现安全灵活的通信系统优化,实验表明不同自然语言策略可引导不同的操作点,且在突发信道变化时显著提升信息熵。
基于ISO合规感知-计算-控制架构的LLM引导安全代理用于边缘机器人
机构 * Shanghai Jiao Tong University(上海交通大学) ; SIMMIR Tech(SIMMIR科技)
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 本文提出一种基于ISO合规架构的LLM引导安全代理,通过将安全规范转化为可执行谓词,实现边缘机器人中的功能安全,支持ISO 13849 Category 3和PL d的实用部署。
Amoeba:LLM推理服务中的运行时张量并行转换
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 Amoeba通过动态调整张量并行度,优化不同上下文长度请求的处理效率,提升吞吐量1.75至6.57倍。
FASER:面向动态LLM服务的细粒度推测解码相管理
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 FASER通过细粒度推测解码相管理提升动态LLM服务性能,减少计算浪费并降低延迟。
Comments 14 pages, 17 figures
HybridGen: 通过CPU-GPU混合计算实现高效的LLM生成推理
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 HybridGen通过CPU-GPU混合计算解决长上下文LLM推理中的内存带宽和负载不平衡问题,采用注意力logit并行、反馈调度器和语义感知的KV缓存映射,提升效率1.41倍至3.2倍。
通过拟人化LLM实现自动化众包测试
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出PersonaTester框架,通过注入三种维度的拟人化特征,模拟多样化的测试行为,提升自动化众包GUI测试的现实性和有效性。
Comments Research Paper Accepted by the ACM International Conference on the Foundations of Software Engineering (FSE 2026)
LLM-SrcLog: 通过大语言模型实现前瞻性与统一的日志模板提取
专题命中 效率与部署 :LLM(title,abstract);large language model(title);language model(title)
AI总结 LLM-SrcLog通过结合源代码分析与大语言模型,实现前瞻性日志模板提取,提升解析效率和准确性。
机构 * Department of Computing, Gachon Univ.(高恩大学计算机系) ; School of Computer Engineering, Nanyang Technological University(南洋理工大学计算机工程学院) ; Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)
Comments 17 pages, 16 figures, IEEE Internet of Things
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)
Comments Work in progress. Code: https://github.com/ritaranx/Collab-RAG/
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Journal ref Proceedings of the 31st International Conference on Computational Linguistics (COLING 2025), "LOLA - An Open-Source Massively Multilingual Large Language Model", ACL Anthology, https://aclanthology.org/2025.coling-main.428/
专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments Accepted by EMNLP 2024 findings
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Frist work to exclusively quantize weight and Key/Value cache for large language models
多模态生存分析与可本地部署的大语言模型
机构 * University of Oxford(牛津大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG;foundation model(comments)
AI总结 本文提出利用可本地部署的大语言模型进行多模态生存分析,结合临床文本、表格数据和基因组数据,通过教师-学生蒸馏和原理化的多模态融合,实现校准的生存概率估计和简洁的诊断文本生成,优于标准基线并在隐私和准确性方面表现更优。
Comments NeurIPS 2025 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences
DIRECT:基于大语言模型的高效对齐序列标注直接解码方法
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL
AI总结 针对现有大语言模型序列标注方法的领域对齐不足与推理效率低问题,提出DIRECT框架,结合训练时优化与推理时校正,在8个数据集上实现性能与效率的显著提升。
超越块边界:扩散大语言模型的多块编辑
机构 * Ant Group(蚂蚁集团) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新院)
专题命中 效率与部署 :language model(title,abstract);large language model(title);SFT(abstract,abstract_cn);分类 cs.AI
AI总结 研究针对块扩散语言模型的块边界问题,提出多块编辑(MBE)方法。通过无需训练的解码算法编辑前序块令牌,引入监督微调策略,扩展SGLang提升效率。实验表明该方法在保持吞吐量时优于基线,在长程一致性任务上有显著性能提升。
RDQ:大语言模型的残差分布量化
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG
AI总结 研究大语言模型PTQ在低精度下降问题,提出RDQ框架,通过级联误差补偿,在多种测试架构上取得最优结果,输出标准量化且零运行时开销。
Comments I am withdrawing due to compliance issue of my organisation
轻量级大语言模型剖析
机构 * Graduate School of Science and Engineering, Saitama University(埼玉大学理工学研究科) ; ITIS, University of Malaga(马拉加大学信息技术与系统研究所)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究轻量级大语言模型在资源受限环境中的情况,提出基于PTME的实验框架,通过硬件级测量联合测量精度、时间、内存和能耗,对一组模型进行测试,发现代理描述符不足,揭示非主导配置,为不同资源下选模型提供指导。
克服大语言模型预训练中的通信-性能权衡
机构 * Covenant AI ; Université de Montréal, Mila(蒙特利尔大学,Mila) ; Concordia University, Mila(康科德大学,Mila)
专题命中 效率与部署 :LLM(title,abstract);pretraining(title);large language model(abstract);language model(abstract)
AI总结 研究旨在克服大语言模型预训练中的通信-性能权衡,提出SparseLoCo算法,利用Top-k稀疏化和2比特量化,使传输伪梯度极端稀疏,在不同模型规模等情况下,相比DiLoCo性能更好且伪梯度压缩优势明显。
Comments 22 pages, 19 tables, 7 figures
通过高效多样响应采样暴露大语言模型中的长尾安全故障
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL
AI总结 本文通过多样响应生成方法系统暴露大语言模型的安全故障,提出PDPS算法在降低计算成本的同时提高攻击成功率,并生成更多多样化的不安全输出。
Comments Accepted by Transactions on Machine Learning Research (TMLR)
延迟-响应理论模型:通过响应准确性和思维链长度评估大语言模型
机构 * Department of Statistics, Columbia University(哥伦比亚大学统计系) ; Department of Statistics, University of Michigan(密歇根大学统计系)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 针对大语言模型评估问题,提出延迟-响应理论(LaRT)模型,联合考虑响应准确性和思维链长度,通过引入关键参数建模,推导高效算法估计参数,经理论和模拟研究验证其优势,实际数据评估中表现优于项目反应理论(IRT)。
量化大语言模型的可靠性缩放定律
机构 * Technical University of Munich(慕尼黑工业大学) ; Munich Data Science Institute(慕尼黑数据科学研究所) ; Pruna AI(Pruna人工智能公司)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG
AI总结 研究量化大语言模型的可靠性缩放定律,通过对其不确定性、校准和鲁棒性进行全面评估,刻画可靠性与模型比特总数的关系,发现4比特量化模型有可靠性峰值,且量化增强了模型对自然输入扰动的鲁棒性。
Comments Transactions on Machine Learning Research (TMLR), 2026