arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22210 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22210 篇

2605.07238 2026-05-11 cs.DC 89%

FATE: Future-State-Aware Scheduling for Heterogeneous LLM Workflows

FATE:面向异构大语言模型工作流的未来状态感知调度

Zirui Huang, Yi-Xiang Hu, Feng Wu, Xiangyang Li

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 FATE通过结合前沿规划、前瞻性候选评分和多设备分片执行,优化异构LLM工作流的未来状态,降低延迟并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06113 2026-05-11 cs.DC 89%

Tackling the Data-Parallel Load Balancing Bottleneck in LLM Serving: Practical Online Routing at Scale

解决大规模LLM服务中的数据并行负载均衡瓶颈:大规模下的实用在线路由

Tianci Bu, Yuan Lyu, Zixi Chen, Chendong Song, Hong Liang, Tsepten Gurung, Yuwei Fan, Yinyu Ye, Zijie Zhou

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出BalanceRoute算法,通过在线路由减少LLM服务中的数据并行负载不均衡,提升端到端服务吞吐量。

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05467 2026-05-08 cs.DC 89%

Nitsum: Serving Tiered LLM Requests with Adaptive Tensor Parallelism

Nitsum:通过自适应张量并行性服务分层LLM请求

Vikranth Srivatsa, Zijian He, Pu Guo, Dongming Li, Yiying Zhang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 Nitsum通过自适应张量并行性优化分层LLM服务,提升多租户场景下的吞吐量,实验显示性能提升达5.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05277 2026-05-08 cs.CR 89%

GLiNER Guard: Unified Encoder Family for Production LLM Safety and Privacy

GLiNER Guard:面向生产LLM安全与隐私的统一编码器家族

Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出GLiNER Guard统一编码器,实现安全分类与PII检测,提升生产LLM的安全性和隐私保护效率。

Comments Models: https://huggingface.co/collections/hivetrace/gliner-guard-v1 PII-Bench: https://huggingface.co/datasets/hivetrace/pii-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15155 2026-05-08 cs.DC 89%

eLLM: Elastic Memory Management Framework for Efficient LLM Serving

eLLM:一种高效的大型语言模型服务弹性内存管理框架

Jiale Xu, Rui Zhang, Yi Xiong, Cong Guo, Zihan Liu, Yangjie Zhou, Weiming Hu, Hao Wu, Changxu Shao, Ziqing Wang, Yongjie Yuan, Junping Zhao, Minyi Guo, Jingwen Leng

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 eLLM提出一种弹性内存管理框架,通过虚拟张量抽象、弹性内存机制和轻量调度策略,提升LLM服务的内存利用效率,实现在动态负载下的更高吞吐量和更大批次大小。

Comments 7pages, accepted to DAC'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00616 2026-05-04 cs.DC 89%

LLM-Emu: Native Runtime Emulation of LLM Inference via Profile-Driven Sampling

LLM-Emu: 通过基于性能的采样实现LLM推理的原生运行时仿真

Wei Da, Evangelia Kalyvianaki

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 LLM-Emu通过基于性能的采样实现LLM推理的原生运行时仿真,能够准确模拟vLLM服务行为,支持在线实验。

Comments 6 page, 2 figures, workshop paper shape

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08101 2026-05-01 cs.CR 89%

LLM-Assisted Web Measurements

基于大型语言模型的网络测量

Simone Bozzolan, Stefano Calzavara, Lorenzo Cazzaro

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨利用大型语言模型进行定向网络测量,通过构建定制数据集评估不同模型性能,提出两步方法提升测量效率,并验证LLM在安全隐私趋势分析中的有效性。

Comments 23 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26231 2026-04-30 cs.IR 89%

ProMax: Exploring the Potential of LLM-derived Profiles with Distribution Shaping for Recommender Systems

ProMax:探索基于分布塑造的LLM衍生资料在推荐系统中的潜力

Yi Zhang, Yiwen Zhang, Kai Zheng, Tong Chen, Hongzhi Yin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ProMax框架,通过分布塑造技术提升推荐系统性能,利用用户和物品资料的协同关系,改进推荐模型对未见物品的偏好学习。

Comments 11 pages, 8 figures, accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25183 2026-04-29 cs.AR 89%

Hardware Generation and Exploration of Lookup Table-Based Accelerators for 1.58-bit LLM Inference

基于查找表加速器的硬件生成与探索:用于1.58位LLM推理

Robin Geens, Joran Heldens, Joren Dumoulin, Marian Verhelst

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于查找表的加速器设计框架,通过系统化分析揭示了三元权重计算的架构权衡,优化设计在面积上比乘法器基线减少了2.2倍,并通过基准测试证明了参数修正可进一步提升性能。

Comments Presented as ISPASS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21316 2026-04-24 cs.IT math.IT 89%

LLM-Steered Power Allocation for Parallel QPSK-AWGN Channels

基于大语言模型的并行QPSK-AWGN信道功率分配

Tadashi Wadayama

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出LLM-Steered Power Allocation,通过大语言模型与数值优化器协同,实现安全灵活的通信系统优化,实验表明不同自然语言策略可引导不同的操作点,且在突发信道变化时显著提升信息熵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20193 2026-04-23 cs.RO 89%

LLM-Guided Safety Agent for Edge Robotics with an ISO-Compliant Perception-Compute-Control Architecture

基于ISO合规感知-计算-控制架构的LLM引导安全代理用于边缘机器人

Xu Huang, Ruofan Zhang, Lu Cheng, Yuefeng Song, Xu Huang, Huayu Zhang, Sheng Yin, Anyang Liang, Chen Qian, Yin Zhou, Xiaoyun Yuan, Yuan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) SIMMIR Tech(SIMMIR科技)

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出一种基于ISO合规架构的LLM引导安全代理,通过将安全规范转化为可执行谓词,实现边缘机器人中的功能安全,支持ISO 13849 Category 3和PL d的实用部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19729 2026-04-23 cs.DC 89%

Amoeba: Runtime Tensor Parallel Transformation for LLM Inference Services

Amoeba:LLM推理服务中的运行时张量并行转换

Haoyu Chen, Xue Li, Kun Qian, Yu Guan, Jin Zhao, Xin Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 Amoeba通过动态调整张量并行度,优化不同上下文长度请求的处理效率,提升吞吐量1.75至6.57倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20503 2026-04-23 cs.DC 89%

FASER: Fine-Grained Phase Management for Speculative Decoding in Dynamic LLM Serving

FASER:面向动态LLM服务的细粒度推测解码相管理

Wenyan Chen, Chengzhi Lu, Yanying Lin, Dmitrii Ustiugov

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 FASER通过细粒度推测解码相管理提升动态LLM服务性能,减少计算浪费并降低延迟。

Comments 14 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18529 2026-04-21 cs.PF cs.DC 89%

HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing

HybridGen: 通过CPU-GPU混合计算实现高效的LLM生成推理

Mao Lin, Xi Wang, Guilherme Cox, Dong Li, Hyeran Jeon

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 HybridGen通过CPU-GPU混合计算解决长上下文LLM推理中的内存带宽和负载不平衡问题,采用注意力logit并行、反馈调度器和语义感知的KV缓存映射,提升效率1.41倍至3.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24160 2026-04-16 cs.SE 89%

Towards Automated Crowdsourced Testing via Personified-LLM

通过拟人化LLM实现自动化众包测试

Shengcheng Yu, Yuchen Ling, Chunrong Fang, Zhenyu Chen, Chunyang Chen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出PersonaTester框架,通过注入三种维度的拟人化特征,模拟多样化的测试行为,提升自动化众包GUI测试的现实性和有效性。

Comments Research Paper Accepted by the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04474 2025-12-05 cs.SE 89%

LLM-SrcLog: Towards Proactive and Unified Log Template Extraction via Large Language Models

LLM-SrcLog: 通过大语言模型实现前瞻性与统一的日志模板提取

Jiaqi Sun, Wei Li, Heng Zhang, Chutong Ding, Shiyou Qian, Jian Cao, Guangtao Xue

专题命中 效率与部署 :LLM(title,abstract);large language model(title);language model(title)

AI总结 LLM-SrcLog通过结合源代码分析与大语言模型,实现前瞻性日志模板提取,提升解析效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00082 2025-07-02 cs.LG cs.AI cs.CL 89%

Federated Learning-Enabled Hybrid Language Models for Communication-Efficient Token Transmission

Faranaksadat Solat, Joohyung Lee, Mohamed Seif, Dusit Niyato, H. Vincent Poor

机构 * Department of Computing, Gachon Univ.(高恩大学计算机系) School of Computer Engineering, Nanyang Technological University(南洋理工大学计算机工程学院) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

Comments 17 pages, 16 figures, IEEE Internet of Things

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04915 2025-04-08 cs.CL cs.AI cs.IR cs.LG 89%

Collab-RAG: Boosting Retrieval-Augmented Generation for Complex Question Answering via White-Box and Black-Box LLM Collaboration

Ran Xu, Wenqi Shi, Yuchen Zhuang, Yue Yu, Joyce C. Ho, Haoyu Wang, Carl Yang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments Work in progress. Code: https://github.com/ritaranx/Collab-RAG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11272 2025-02-04 cs.CL cs.AI cs.LG 89%

LOLA -- An Open-Source Massively Multilingual Large Language Model

Nikit Srivastava, Denis Kuchelev, Tatiana Moteu Ngoli, Kshitij Shetty, Michael Röder, Hamada Zahera, Diego Moussallem, Axel-Cyrille Ngonga Ngomo

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref Proceedings of the 31st International Conference on Computational Linguistics (COLING 2025), "LOLA - An Open-Source Massively Multilingual Large Language Model", ACL Anthology, https://aclanthology.org/2025.coling-main.428/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15567 2024-10-22 cs.LG cs.AI cs.CL 89%

Pruning Foundation Models for High Accuracy without Retraining

Pu Zhao, Fei Sun, Xuan Shen, Pinrui Yu, Zhenglun Kong, Yanzhi Wang, Xue Lin

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by EMNLP 2024 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12065 2024-02-21 cs.LG cs.AI cs.CL 89%

WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More

Yuxuan Yue, Zhihang Yuan, Haojie Duanmu, Sifan Zhou, Jianlong Wu, Liqiang Nie

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Frist work to exclusively quantize weight and Key/Value cache for large language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22158 2026-03-24 cs.LG cs.AI 89%

Multimodal Survival Analysis with Locally Deployable Large Language Models

多模态生存分析与可本地部署的大语言模型

Moritz Gögl, Christopher Yau

机构 * University of Oxford(牛津大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG;foundation model(comments)

AI总结 本文提出利用可本地部署的大语言模型进行多模态生存分析,结合临床文本、表格数据和基因组数据,通过教师-学生蒸馏和原理化的多模态融合,实现校准的生存概率估计和简洁的诊断文本生成,优于标准基线并在隐私和准确性方面表现更优。

Comments NeurIPS 2025 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26891 2026-07-30 cs.CL 新提交 89%

DIRECT: Direct Decoding for Efficient and Aligned Sequence Labeling with Large Language Models

DIRECT:基于大语言模型的高效对齐序列标注直接解码方法

Yilei Wang, Jiaxin Gan, Kexuan Zhang, Ling Li, Wentao Zhang, Peichao Lai

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 针对现有大语言模型序列标注方法的领域对齐不足与推理效率低问题,提出DIRECT框架,结合训练时优化与推理时校正,在8个数据集上实现性能与效率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22663 2026-07-30 cs.AI 版本更新 89%

Beyond Block Boundaries: Multi-Block Editing for Diffusion Large Language Models

超越块边界:扩散大语言模型的多块编辑

Xingyu Mou, Zijin Huang, Tianze Zhang, Yuxin Ma, Lanning Wei, Zengfeng Huang, Da Zheng, Lun Du

机构 * Ant Group(蚂蚁集团) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新院)

专题命中 效率与部署 :language model(title,abstract);large language model(title);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对块扩散语言模型的块边界问题,提出多块编辑(MBE)方法。通过无需训练的解码算法编辑前序块令牌,引入监督微调策略,扩展SGLang提升效率。实验表明该方法在保持吞吐量时优于基线,在长程一致性任务上有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10137 2026-07-29 cs.LG 版本更新 89%

RDQ: Residual Distribution Quantization for Large Language Models

RDQ:大语言模型的残差分布量化

Prateek Singh

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 研究大语言模型PTQ在低精度下降问题,提出RDQ框架,通过级联误差补偿,在多种测试架构上取得最优结果,输出标准量化且零运行时开销。

Comments I am withdrawing due to compliance issue of my organisation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20806 2026-07-24 cs.AI 新提交 89%

Profiling Lightweight Large Language Models

轻量级大语言模型剖析

Tomohiro Harada, Enrique Alba, Gabriel Luque

机构 * Graduate School of Science and Engineering, Saitama University(埼玉大学理工学研究科) ITIS, University of Malaga(马拉加大学信息技术与系统研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究轻量级大语言模型在资源受限环境中的情况,提出基于PTME的实验框架,通过硬件级测量联合测量精度、时间、内存和能耗,对一组模型进行测试,发现代理描述符不足,揭示非主导配置,为不同资源下选模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15706 2026-07-24 cs.LG 版本更新 89%

Overcoming the Communication-Performance Tradeoff in LLM Pretraining

克服大语言模型预训练中的通信-性能权衡

Amir Sarfi, Benjamin Thérien, Joel Lidin, Eugene Belilovsky

机构 * Covenant AI Université de Montréal, Mila(蒙特利尔大学,Mila) Concordia University, Mila(康科德大学,Mila)

专题命中 效率与部署 :LLM(title,abstract);pretraining(title);large language model(abstract);language model(abstract)

AI总结 研究旨在克服大语言模型预训练中的通信-性能权衡,提出SparseLoCo算法,利用Top-k稀疏化和2比特量化,使传输伪梯度极端稀疏,在不同模型规模等情况下,相比DiLoCo性能更好且伪梯度压缩优势明显。

Comments 22 pages, 19 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14355 2026-07-21 cs.CL 版本更新 89%

Exposing Long-Tail Safety Failures in Large Language Models through Efficient Diverse Response Sampling

通过高效多样响应采样暴露大语言模型中的长尾安全故障

Suvadeep Hajra, Palash Nandi, Tanmoy Chakraborty

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文通过多样响应生成方法系统暴露大语言模型的安全故障,提出PDPS算法在降低计算成本的同时提高攻击成功率,并生成更多多样化的不安全输出。

Comments Accepted by Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07019 2026-07-20 stat.ME cs.AI stat.AP stat.ML 版本更新 89%

Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length

延迟-响应理论模型:通过响应准确性和思维链长度评估大语言模型

Zhiyu Xu, Jia Liu, Yixin Wang, Yuqi Gu

机构 * Department of Statistics, Columbia University(哥伦比亚大学统计系) Department of Statistics, University of Michigan(密歇根大学统计系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对大语言模型评估问题,提出延迟-响应理论(LaRT)模型,联合考虑响应准确性和思维链长度,通过引入关键参数建模,推导高效算法估计参数,经理论和模拟研究验证其优势,实际数据评估中表现优于项目反应理论(IRT)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10855 2026-07-14 cs.LG 新提交 89%

Reliability Scaling Laws for Quantized Large Language Models

量化大语言模型的可靠性缩放定律

Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier

机构 * Technical University of Munich(慕尼黑工业大学) Munich Data Science Institute(慕尼黑数据科学研究所) Pruna AI(Pruna人工智能公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 研究量化大语言模型的可靠性缩放定律,通过对其不确定性、校准和鲁棒性进行全面评估,刻画可靠性与模型比特总数的关系,发现4比特量化模型有可靠性峰值,且量化增强了模型对自然输入扰动的鲁棒性。

Comments Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏