arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2603.22774 2026-05-26 cs.AR cs.DC 87%

Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference

多GPU大语言模型推理中CPU引起的性能下降特征分析

Euijun Chung, Yuxiao Jia, Aaron Jezghani, Hyesoon Kim

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 通过分析多GPU大语言模型推理负载,发现CPU资源不足导致GPU利用率低下,增加CPU核心数可显著提升性能并降低首令牌延迟。

Comments 13 pages, 13 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23294 2026-05-25 cs.AR 87%

NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference

NASiC: 基于3D NAND的CAM选择多比特CIM架构,用于高效设备端混合专家大语言模型推理

Weikai Xu, Meng Li, Shuzhang Zhong, Tianyang Luo, Dongxue Zhao, Ling Liang, Zongwei Wang, Qianqian Huang, Yimao Cai, Ru Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对MoE模型在设备端部署时动态稀疏专家激活导致计算并行度下降和Flash多比特存储能力利用不足的问题,提出NASiC架构,通过CAM掩码机制融合专家选择与CIM计算,结合电路级优化和多比特CIM单元,显著提升吞吐量和能效。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19893 2026-05-21 cs.OS 87%

SSV: Sparse Speculative Verification for Efficient LLM Inference

SSV:用于高效LLM推理的稀疏推测验证

Zhibin Wang, Ziyu Zhong, Nuo Shen, Yuhang Zhou, Rong Gu, Sheng Zhong

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出SSV框架,通过结合重叠感知的分组查询执行、基于刷新/重用的NSA内核融合和基于性能配置文件的提示自适应调度,提升跨查询重用率,减少所选索引和分支融合开销,并在用户指定的精度类别下选择有效的草稿验证策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25120 2026-05-20 cs.DC 87%

DFLOP: A Data-driven Framework for Multimodal LLM Training Pipeline Optimization

DFLOP: 一种基于数据的多模态大语言模型训练流水线优化框架

Hyeonjun An, Sihyun Kim, Chaerim Lim, Hyunjoon Kim, Rathijit Sen, Sangmin Jung, Hyeonsoo Lee, Dongwook Kim, Takki Yu, Jinkyu Jeong, Youngsok Kim, Kwanghyun Park

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DFLOP框架,通过数据驱动的方法优化多模态大语言模型的训练流水线,提升GPU利用率和训练效率,实验证明其比现有框架快3.6倍。

Comments Accepted to Proceedings of the ACM on Management of Data (SIGMOD 2026)

Journal ref Proc. ACM Manag. Data 4, 3, Article 160 (June 2026), 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16637 2026-05-19 cs.DC 87%

HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling

HexAGenT: 通过工作流和异构性感知调度实现高效的代理LLM服务

You Peng, Youhe Jiang, Wenshuang Li, Xu Xu, Ke Zhou, Jiawei Jiang, Chen Wang, Binhang Yuan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出HexAGenT,一种异构prefill-decode推理服务的工作流感知调度器,通过动态调整预填和解码位置及队列优先级,减少工作流完成SLO需求,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25899 2026-05-15 cs.MA cs.DC cs.SY eess.SY 87%

Pythia: Exploiting Workflow Predictability for Efficient Agent-Native LLM Serving

Pythia:利用工作流可预测性实现高效的智能体原生LLM服务

Shan Yu, Junyi Shu, Yuanjiang Ni, Kun Qian, Xue Li, Yang Wang, Jinyuan Zhang, Ziyi Xu, Shuo Yang, Lingjun Zhu, Ennan Zhai, Qingda Lu, Jiarong Xing, Youyou Lu, Xin Jin, Xuanzhe Liu, Harry Xu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出Pythia系统,通过在服务层简单接口捕获工作流语义,解决智能体服务中的缓存命中率低、资源竞争和队列延迟问题,提升吞吐量和任务完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10501 2026-05-12 cs.DC 87%

Accelerating Compound LLM Training Workloads with Maestro

通过Maestro加速复合大语言模型训练工作负载

Xiulong Yuan, Hongqing Chen, Jiaxuan Peng, Fan Zhou, Zhixiang Ruan, Zekun Wang, Bo Zheng, Rui Men, Haiquan Wang, Zhipeng Zhang, Langshi Chen, Man Yuan, Jiaqi Gao, Zhengping Qian, Junyang Lin, Yong Li, Wei Lin, Junhua Wang, Jingren Zhou

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 本文提出Maestro框架,针对复合LLM训练中的静态异构性和动态不规则性,通过分段图重构和波前调度算法提升硬件利用率,减少40%的GPU消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06374 2026-05-12 cs.DC 87%

ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism

ResiHP: 通过动态混合并行性缓解LLM训练故障

Tenghui Ma, Jihu Guo, Wei Gao, Sitian Lu, Zhisheng Ye, Hanjing Wang, Dahua Lin

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 ResiHP通过动态调整并行组大小、模型分区和工作负载调度策略,提升混合并行训练的鲁棒性和效率,实验显示在不同故障场景下训练吞吐量提升1.04-4.39倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08962 2026-05-12 cs.DC 87%

MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production

MegaScale-Omni: 一种面向多模态大语言模型生产训练的超大规模、工作负载容错系统

Chunyu Xue, Yangrui Chen, Jianyu Jiang, Ningxin Zheng, Junda Feng, Jingji Chen, Shixiong Zhao, Shen Yan, Yi Lin, Lei Shi, Zanbo Wang, Lishu Luo, Faming Wu, Haibin Lin, Xin Liu, Yanghua Peng, Quan Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出MegaScale-Omni系统,通过解耦并行策略、统一表示和负载平衡技术,提升多模态大语言模型在动态工作负载下的训练效率,实现1.27倍至7.57倍的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05419 2026-05-08 cs.CY 87%

LLMorphism: When humans come to see themselves as language models

LLMorphism:当人类开始将自己视为语言模型

Valerio Capraro

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文探讨了人类将自身认知类比为大语言模型的偏误信念,分析了这种偏误的形成机制及其对社会各领域的潜在影响。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27396 2026-05-05 cs.AR 87%

VitaLLM: A Versatile, Ultra-Compact Ternary LLM Accelerator with Dependency-Aware Scheduling

VitaLLM:一种多功能、超紧凑的三进制大语言模型加速器及其依赖感知调度

Zi-Wei Lin, Tian-Sheuan Chang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出VitaLLM,一种针对三进制大语言模型推理的高效加速器,通过双核计算策略和依赖感知调度框架,实现高吞吐量和低功耗。

Journal ref IEEE Transactions on Circuits and Systems for Artificial Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26074 2026-04-30 cs.DC 87%

DAK: Direct-Access-Enabled GPU Memory Offloading with Optimal Efficiency for LLM Inference

DAK:支持直接访问的GPU内存卸载,以实现LLM推理的最优效率

Shouxu Lin, Zhiyuan Guo, Jiaxin Lin

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出DAK框架,通过直接访问远程内存优化GPU内存卸载,提升系统带宽效率,实验显示在NVLink-C2C和PCIe系统中性能提升达3倍和1.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25317 2026-04-29 cs.AR 87%

FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture

FusionCIM: 通过融合驱动的计算存内架构加速大语言模型推理

Zihao Xuan, Jia Chen, Yewen Li, Wei Xuan, Hegan Chen, Xiao Huo, Fengbin Tu

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 本文提出FusionCIM架构,通过融合驱动的计算存内架构提升LLM推理效率,核心方法包括混合CIM流水线、QO静态数据流和模式感知在线softmax机制,实现3.86倍能效提升和1.98倍加速。

Comments 7 Pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23950 2026-04-28 cs.CV 87%

LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models

LearnPruner: 重新思考基于注意力的视觉语言模型中令牌修剪

Rinyoichi Takezoe, Yaqian Li, Zihao Bo, Anzhou Hou, Mo Guang, Kaiwen Long

机构 * Li Auto Inc.(利自动公司)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文提出LearnPruner,通过两阶段令牌修剪框架在视觉语言模型中实现高效修剪,保留95%性能的同时减少5.5%视觉令牌使用,提升3.2倍推理速度。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23640 2026-04-28 cs.IR 87%

Prompt-Unknown Promotion Attacks against LLM-based Sequential Recommender Systems

针对基于大语言模型的序列推荐系统的提示未知推广攻击

Yuchuan Zhao, Tong Chen, Junliang Yu, Zongwei Wang, Lizhen Cui, Hongzhi Yin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究提出在攻击者无法获取系统提示和受害者模型的情况下,通过进化优化策略生成有效替代模型,实现对目标物品的推广攻击,实验表明该方法在提升冷门物品曝光方面优于现有方法。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22935 2026-04-28 cs.CR 87%

Secure eFPGA-Enabled Edge LLM Inference: Architectural and Hardware Countermeasures

安全的eFPGA启用边缘LLM推断:架构和硬件防护措施

Voktho Das, M Zafir Sadik Khan, Jafar Vafaei, Kimia Azar, Hadi Kamali

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出一种混合ASIC+eFPGA架构,结合ASIC的效率和eFPGA的灵活性,通过动态运行监控、侧信道缓解和部署后修补等机制,提升边缘LLM推断系统的安全性和抗攻击能力。

Comments This paper will be presented at IEEE VLSI Test Symposium (VTS) 2026 (Special Session)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21072 2026-04-24 cs.DC 87%

Distributed Generative Inference of LLM at Internet Scales with Multi-Dimensional Communication Optimization

在互联网规模上通过多维通信优化实现大语言模型的分布式生成推理

Jiu Chen, Shuangyan Yang, Xu Xiong, Hexiao Duan, Xinran Zhang, Jie Ren, Dong Li

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 本文提出BloomBee框架,通过多维优化提升分布式LLM推理性能,降低通信开销,提升吞吐量和减少延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19884 2026-04-23 cs.CL cs.AI cs.LG 87%

From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization

从信号退化到计算崩溃:揭示大语言模型量化中的两种失败模式

Chenxi Zhou, Pengfei Cao, Jiang Li, Bohan Yu, Jinyu Ye, Jun Zhao, Kang Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究揭示大语言模型量化中两种不同失败模式:信号退化和计算崩溃,并提出针对性修复方法,表明结构重建比单纯补偿更有效。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18231 2026-04-21 cs.CR cs.OS 87%

AgenTEE: Confidential LLM Agent Execution on Edge Devices

AgenTEE: 在边缘设备上实现保密大语言模型代理执行

Sina Abdollahi, Mohammad M Maheri, Javad Forough, Amir Al Sadi, Josh Millar, David Kotz, Marios Kogias, Hamed Haddadi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出AgenTEE系统,通过在边缘设备上部署保密虚拟机实现安全代理管道执行,降低延迟并保护隐私,实验显示其性能接近原生水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12402 2026-04-16 cs.CR 87%

Automated Profile Inference with Language Model Agents

基于语言模型代理的自动资料推断

Yuntao Du, Zitao Li, Bolin Ding, Yaliang Li, Hanshen Xiao, Jingren Zhou, Ninghui Li

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文研究了大型语言模型对在线匿名性造成的新型威胁——自动资料推断,提出AutoProfiler框架展示攻击可行性,并探讨缓解策略以提升隐私保护意识。

Comments Accepted to Findings of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12127 2026-04-15 cs.NI 87%

BLAST: Blockchain-based LLM-powered Agentic Spectrum Trading

BLAST:基于区块链的大型语言模型驱动的代理频谱交易

Anas Abognah, Otman Basir

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出BLAST框架,结合大型语言模型代理与许可区块链,实现自主、隐私和安全的频谱交易生态系统。通过三种拍卖机制评估,证明第二价格拍卖在提升社会福利和分配效率方面最优,同时验证了隐私保护机制。

Comments This work has been submitted to the IEEE Transactions on Cognitive Communications and Networking for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08826 2026-04-13 cs.LG cs.AI cs.CL 87%

HiFloat4 Format for Language Model Pre-training on Ascend NPUs

HiFloat4格式用于在Ascend NPUs上预训练语言模型

Mehran Taghian, Yunke Peng, Xing Huang, Yao Wang, Yaoyuan Wang, Wei Guo, Yuanyong Luo, Tianchi Hu, Junsong Wang, Xin Wang, Hu Liu, Yu Cheng, Ziwei Yu, Hongliang Li, Mehdi Rahimifar, Lei Yan, Xuefei Wang, Zhuang Ma, Lei Liu, Hui Yu, Anandharaju Durai Raju, Hoang Le, Hei Yi Mak, Tanzila Rahman, Shadan Golestan

机构 * Huawei(华为)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了HiFloat4 4位浮点格式在Ascend NPUs上的应用,比较了其与MXFP4在大规模训练中的性能,展示了FP4在计算效率和内存利用率上的优势,同时探讨了FP4训练中的稳定性技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06183 2026-04-09 cs.HC 87%

The Impact of Response Latency and Task Type on Human-LLM Interaction and Perception

响应延迟和任务类型对人与大语言模型交互与感知的影响

Felicia Fang-Yi Tan, Moritz A. Messerschmidt, Wen Yin, Oded Nov

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨了响应延迟和任务类型对人与LLM交互行为及感知的影响,发现任务类型影响用户提示频率,延迟时间影响输出评价,提出延迟是可调节的设计变量。

Comments To be published in ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05137 2026-04-08 cs.PL cs.AI cs.CL cs.LG cs.SE 87%

EffiPair: Improving the Efficiency of LLM-generated Code with Relative Contrastive Feedback

EffiPair:通过相对对比反馈提升LLM生成代码的效率

Samira Hajizadeh, Suman Jana

机构 * Columbia University(哥伦比亚大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出EffiPair框架,通过相对对比反馈机制在测试时迭代优化代码效率,减少性能反馈开销,实验证明其在代码效率提升方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24535 2026-04-07 cs.LG cs.AI cs.CL 87%

Beyond Linear Steering: Unified Multi-Attribute Control for Language Models

超越线性操控:语言模型的统一多属性控制

Narmeen Oozeer, Luke Marks, Shreyans Jain, Fazl Barez, Amirali Abdullah

机构 * Martian University of Oxford(牛津大学) Thoughtworks

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出K-Steering方法,通过训练非线性多标签分类器实现语言模型的多属性控制,避免线性假设,无需存储和调整个别属性向量,支持动态行为组合。

Comments Accepted to Findings of EMNLP, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22651 2026-03-25 cs.AI cs.CL cs.LG 87%

Benchmarking Multi-Agent LLM Architectures for Financial Document Processing: A Comparative Study of Orchestration Patterns, Cost-Accuracy Tradeoffs and Production Scaling Strategies

多代理LLM架构在金融文档处理中的基准测试:协作模式、成本准确性权衡及生产扩展策略的比较研究

Siddhant Kulkarni, Yukta Kulkarni

机构 * Department of Computer Science and Engineering(计算机科学与工程系) New York University(纽约大学) New York, NY 10012(纽约市NY 10012)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文比较四种多代理架构在金融文档处理中的表现,揭示了反射架构在字段级F1得分最高但成本更高,而分层架构在成本准确性帕累托前沿表现最佳,同时展示了语义缓存等策略对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04087 2026-03-25 cs.IR 87%

E-CARE: An Efficient LLM-based Commonsense-Augmented Framework for E-Commerce

E-CARE: 一种高效的基于大语言模型的常识增强框架用于电子商务

Ge Zhang, Rohan Deepak Ajwani, Yaochen Hu, Tony Zheng, Hongjian Gu, Wei Guo, Mark Coates, Yingxue Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出E-CARE框架,利用大语言模型的常识推理能力提升电子商务推荐效率,无需监督微调或人工标注,实验显示在两个下游任务中精度@5提升了12.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21800 2026-03-20 cs.CL cs.AI cs.LG 87%

ELM: A Hybrid Ensemble of Language Models for Automated Tumor Group Classification in Population-Based Cancer Registries

ELM:一种语言模型的混合集成,用于人口基于癌症登记处的肿瘤分组自动分类

Lovedeep Gondara, Jonathan Simkin, Shebnum Devji, Gregory Arbour, Raymond Ng

机构 * British Columbia Cancer Registry, Provincial Health Services Authority(不列颠哥伦比亚省癌症登记处、省级卫生服务局) The Data Science Institute, University of British Columbia(数据科学研究院、不列颠哥伦比亚大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ELM结合小型编码器-only模型和大型语言模型,通过集成六个微调模型提高肿瘤分组分类的准确性和效率,显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12229 2026-03-13 cs.MA 87%

Language Model Teams as Distributed Systems

语言模型团队作为分布式系统

Elizabeth Mieczkowski, Katherine M. Collins, Ilia Sucholutsky, Natalia Vélez, Thomas L. Griffiths

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 本文提出将分布式系统作为原则性基础,用于创建和评估语言模型团队,揭示LLM团队与分布式计算中的共同挑战和优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10862 2026-03-12 cs.SD 87%

OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs

OSUM-Pangu:基于OpenPangu在Ascend NPUs上的开源多维语音理解基础模型

Yujie Liao, Xuelong Geng, Hongfei Xue, Shuiyuan Wang, Lei Xie

机构 * Ascend NPUs(Ascend NPU)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 OSUM-Pangu基于非CUDA的Ascend NPU平台,结合openPangu-7B LLM后端,实现语音理解任务的高准确率与自然语言交互能力。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏