arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1859 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1859 篇

2608.06989 2026-08-10 cs.AR 新提交 87%

Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM

重新思考NPU-PIM系统的统一内存:面向大语言模型动态推理的双视图内存

Shixin Zhao, Lian Liu, Tianhua Han, Mengdi Wang, Yinhe Han, Ying Wang

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 针对NPU-PIM系统现有统一内存无法适配LLM动态推理导致的带宽浪费问题,提出双视图内存方案PFM,可将端到端吞吐量提升最高达2.32倍。

Comments Accepted by MICRO'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03741 2026-08-05 cs.DC 新提交 87%

When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference

拆分何时划算?智能体大语言模型推理的预填-解码-注意力-前馈网络专业化模拟

Przemyslaw Forys, Haoran Wu, Can Xiao, Jiayi Nie, Tony Liu, Rika Antonova, Timothy Jones, Robert Mullins, Wayne Luk, Aaron Zhao, George A. Constantinides

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究提出HeteroPanacea模拟框架,针对智能体LLM推理的预填-解码-注意力-前馈网络拆分,验证其可提升吞吐量,为异构智能体服务系统提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02681 2026-08-05 cs.CR 新提交 87%

Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting

批量提示中的安全性?理解并缓解批量提示中的安全故障

Kihyun Kim, Hee-Seon Kim, Wonjun Lee, Changick Kim

专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 该研究发现批量提示存在独特安全故障模式,可作为黑盒攻击实现高成功率,提出感知批量的偏好优化可缓解该漏洞,为大语言模型安全对齐提供了新方向。

Comments jailbreak, safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00690 2026-08-04 cs.NI 新提交 87%

LLM-Assisted Coalition Formation for Cooperative Perception in Autonomous Driving

大语言模型辅助的自动驾驶协同感知联盟形成

Ahmad Sarlak, Hao Wang, Rahul Amin, Abolfazl Razi

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究针对现有协同感知方法未优化车辆选择的问题,提出LLM辅助的联盟形成框架,结合DPP与ADMM优化,在OPV2V等数据集上实现更优性能与网络效率。

Comments Accepted for presentation at IEEE Global Communications Conference (GLOBECOM 2026), Cognitive Radio and AI-Enabled Networks Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27249 2026-07-31 cs.SE 新提交 87%

OwlPath: Lossless Knowledge Compression for LLM Bug Repair

OwlPath:面向大语言模型漏洞修复的无损知识压缩

Bo Zhang, Ren Pan, Huan Chen, Xiang Song

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 OwlPath是构建于CodeGraph之上的OWL2推理层,通过无损知识压缩将代码编码为OWL2本体,提升LLM漏洞修复的结构检索性能,在多组基准测试中实现了严格应用率、召回率等指标的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26475 2026-07-30 cs.DC 新提交 87%

DualDecoder: Accelerate Long Context LLM Inference by Predictive Prefetch

DualDecoder:通过预测预取加速长上下文大语言模型推理

Zuning Liang, Zhiyi Yao, Qi Chen, Yuedong Xu, Hao Dai, Zhiqiang Ding, Tongkai Yang, Jinlong Hou, Yuan Cheng

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究针对长上下文LLM推理的内存墙瓶颈,提出轻量级服务系统DualDecoder,通过双token解码流水线预测预取关键KV条目,消除辅助状态开销,使解码吞吐量最高提升2.62倍且保留延迟与模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19438 2026-07-23 cs.AR cs.AI cs.CL cs.DC cs.LG cs.PF 新提交 87%

BaseRT: Advancing Best-in-Class LLM Inference with Apple M5 Neural Accelerators

BaseRT:利用苹果M5神经加速器提升一流大语言模型推理性能

Fabian Waschkowski, Prabod Rathnayaka, Lukas Wesemann

机构 * Base Compute

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究利用苹果M5神经加速器提升大语言模型推理性能,通过BaseRT无框架设计及添加特定内核,将计算密集型矩阵乘法经M5处理,大幅提升推理吞吐量及解码优势,确立了设备上大语言模型推理新性能上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16488 2026-07-21 cs.AR 新提交 87%

Auto-Scaling Heterogeneous Neural Processing Units for Energy and Cost-Efficient LLM Serving

用于高效能和低成本的大语言模型服务的异构神经处理单元自动缩放

Yuqi Xue, Jichuan Chang, Jian Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究如何利用异构神经处理单元为大语言模型服务实现能源和成本高效。提出NeuScale自动缩放框架,通过新vPod抽象管理资源,基于屋顶线分析分配,支持动态供应。经模拟器验证,可显著提升成本效率和SLO满意度。

Comments Accepted to MICRO'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16473 2026-07-21 cs.AR 新提交 87%

Enabling Spatially Fine-Grained DVFS in Neural Processing Units for Energy-Efficient LLM Serving

在神经处理单元中实现空间细粒度动态电压频率调节以实现高效节能的大语言模型服务

Yuqi Xue, Jerry Wu, Corey Yu, Jian Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对NPU服务LLMs时功耗问题,开发eNPU支持空间细粒度、组件级DVFS,通过重构流水线、引入通信机制、扩展ISA及采用编译器驱动搜索优化,实现能耗降低25.8% - 35.2%且保持SLO保证。

Comments Accepted by MICRO'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20576 2026-06-23 cs.NI 新提交 87%

Exploring LLM in Semantic Communication for V2X Networks

探索V2X网络中的语义通信大语言模型

Sihem Bakri, Navdeep Singh, Nicola Marchetti

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出将大语言模型与图知识表示结合的语义通信框架,通过传输高级语义消息而非原始数据,在V2X网络中平均降低33.54%带宽消耗。

Comments Accepted at: IEEE 103rd Vehicular Technology Conference (VTC2026-Spring) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16824 2026-06-16 cs.DC cs.OS 新提交 87%

CacheWise: Understanding Workloads and Optimizing KVCache Management for Efficiently Serving LLM Coding Agents

CacheWise:理解工作负载并优化KVCache管理以高效服务LLM编码代理

Shubham Tiwari, Tapan Chugh, Nash Rickert, Simon Peter, Ratul Mahajan, Haiying Shen

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对编码代理会话中大量前缀复用导致KVCache压力的问题,提出CacheWise管理层,结合前缀感知调度和基于工具调用元数据的轻量级预测驱逐策略,减少KVCache驱逐并提升会话完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16135 2026-06-16 cs.DC 新提交 87%

SwiftCache: Efficient LLM Serving for Multi-turn Conversations with Heterogeneous KV Cache Sharing

SwiftCache: 面向多轮对话的高效LLM服务与异构KV缓存共享

Jianmin Hu, Minxian Xu, Sa Wang, Chong Ma, Min Shen, Kejiang Ye, Lin Qu, Chengzhong Xu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对多轮对话中KV缓存占用显存导致推理延迟高、上下文受限的问题,提出SwiftCache系统,通过异构模型间共享空闲GPU内存和NVLink带宽,仅保留当前层KV缓存,降低延迟并扩展上下文长度。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15177 2026-06-16 cs.DC 新提交 87%

Coordinated Scheduling for MoE LLM Serving

MoE大语言模型服务的协调调度

Yifan Sun, Zhexiang Zhang, Jiantong Jiang, Gholamreza Haffari, Minxian Xu, Feng Liu, Rajkumar Buyya, Adel N. Toosi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出Gimbal,一种跨层协调调度系统,通过细粒度DP引擎调度和专家负载均衡,减少平均TTFT 42.9%和TPOT 33.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11690 2026-06-11 cs.DC cs.PF 新提交 87%

Beyond Per-Token Pricing: A Concurrency-Aware Methodology for LLM Infrastructure Cost Estimation

超越按Token定价:一种考虑并发性的LLM基础设施成本估算方法

Chitral Patil

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对现有成本计算器将GPU利用率作为固定输入导致严重误差的问题,提出一种基于测量请求率λ的并发感知成本估算方法,并开源vllm-cost-meter工具,验证了低负载下成本被低估2.5-36.3倍。

Comments 26 pages, 9 figures. Code: https://github.com/pChitral/vllm-cost-meter

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13576 2026-08-17 cs.HC cs.LG q-bio.NC 新提交 86%

BCIJelly: An integrated ecosystem for brain-computer interface research

BCIJelly:用于脑机接口研究的集成生态系统

Liyuan Han, Xinrui Yang, Tianyu Zheng, Qizhi Yang, Yitao Qin, Liang Chen, Qinglai Wei, Binjie Hong, Xinhe Zhang, Rui Xiong, Yong Gu, Mu-ming Poo, Bo Xu, Chengyu Li, Tielin Zhang

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 BCIJelly是集成多类BCI数据集、解码器及工具的Python生态系统,可通过AAS与LLM支持多任务跨物种解码,经多范式多物种验证,为BCI研究提供统一可扩展的开发部署基础设施。

Comments 67 pages, 6 figures, 7 extended data figures, 20 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08713 2026-08-11 cs.CV cs.AI 新提交 86%

Resolution Meets Reduction: Efficient Visual Context for 3D Radiology Report Generation

分辨率与压缩结合:面向3D放射报告生成的高效视觉上下文

Jonathan Suprijadi, Raphael Stock, Moritz Langenberg, David Zimmerer, Kim-Celine Kahl, Stefan Denner, Yannick Kirchhoff, Karol Gotkowski, Maximilian Rokuss, Jeremias Traub, Tassilo Wald, Constantin Ulrich, Klaus Maier-Hein

机构 * German Cancer Research Center (DKFZ)(德国癌症研究中心)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对3D放射报告生成中视觉序列的计算瓶颈,通过实验评估不同视觉编码器、投影器和LLM,提出解剖学引导的ROI裁剪等策略,在两个数据集上取得最先进的临床macro F1结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08037 2026-08-11 cs.AI 新提交 86%

SkillSmith: Enhancing Locally Deployed Agents via Automatic Skill Construction and Evolution

SkillSmith:通过自动技能构建与演进增强本地部署智能体

Xinle Jiang, Remy Xie, Ming Tang

专题命中 效率与部署 :SLM(summary_cn,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 SkillSmith是云端-本地智能体协作框架,通过自动构建和演进技能增强本地智能体,使搭载Qwen3.6-27B的本地智能体任务有效性接近云端智能体,在AppWorld上平均动作数从36.1降至9.9且可泛化至其他SLM。

Comments 10 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07193 2026-08-10 cs.LG cs.CV 新提交 86%

An AI4AI Framework for Visual Token Pruning

用于视觉令牌剪枝的AI4AI框架

Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05063 2026-08-06 cs.CR cs.AI cs.AR 新提交 86%

Hardware Design and Security in the Era of Chiplets and LLMs

小芯片与大语言模型时代的硬件设计与安全

Johann Knechtel, Ozgur Sinanoglu, Paul V. Gratz, Ramesh Karri

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对小芯片与LLM时代的硬件安全问题,分析了小芯片系统及LLM驱动EDA流水线的各类攻击,提出基于2.5D拆分制造与主动中介层的防御方法,还探讨了LLM对硬件安全的推动作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02641 2026-08-05 cs.SE cs.AI 新提交 86%

IR2Solve: Structured Intermediate Representations for Cost-Efficient Optimization Autoformulation

IR2Solve:面向成本高效优化自动建模的结构化中间表示

Penglin Zhu, Linhai Zhang, Jungang Xu, Xinchi Wei, Xiuqi Wu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 IR2Solve以结构化中间表示为核心构建优化自动建模流水线,仅用1次LLM语义调用,在保证目标函数正确性的同时大幅降低推理成本,性能优于Chain-of-Experts和SAC-Opt等系统。

Comments 17 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01847 2026-08-04 cs.AI 新提交 86%

FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling

FOCUS:通过耦合松弛与双粒度缩放实现FP4优化

Xianglong Yan, Hong Liu, Chengzhu Bao, Tianao Zhang, Guanghua Yu, Jianchen Zhu, Yulun Zhang

机构 * Tencent(腾讯)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 FOCUS是一种后训练量化框架,通过耦合松弛与双粒度缩放优化FP4,在不增加推理开销的情况下,于MXFP4和NVFP4格式下实现了LLM的最优FP4精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00924 2026-08-04 cs.SE cs.AI 新提交 86%

RefactorAssist: Agentic Refinement for Reliable Code Refactoring

RefactorAssist:用于可靠代码重构的智能体式优化工具

Jonathan Cordeiro, Shayan Noei, Ying Zou

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM生成代码重构的错误问题,开发了RefactorAssist智能体,通过静态修复结合测试引导的智能体修复,将重构累计通过率提升至94.2%,提高了LLM重构代码的可靠性。

Comments 27 pages, 10 figures, submitting to ACM TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28082 2026-07-31 cs.CL 新提交 86%

GGC: Selective Query Correction for Reliable Text-to-SPARQL Generation

GGC:面向可靠Text-to-SPARQL生成的选择性查询修正

Ziyi Yang, Thanh-Son Nguyen, Tuan Anh Nguyen, Lihui Chen

机构 * Nanyang Technological University(南洋理工大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高性能计算研究所)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对LLM生成Text-to-SPARQL查询不可靠的问题,提出GGC框架,通过选择性修正高风险查询,在MCQA数据集上提升准确率并降低推理开销。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25995 2026-07-29 cs.CR cs.AI 新提交 86%

Does Runtime Topology Context Improve LLM-Generated Kubernetes Security Patches?

运行时拓扑上下文能否改进大语言模型生成的Kubernetes安全补丁?

Farooq Shaikh

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 研究Kubernetes安全补丁问题,引入KuTIE利用实时集群上下文改进大语言模型生成补丁,通过在VulnCare平台试验,发现拓扑上下文可大幅提升拓扑相关补丁正确性,远超仅依赖扫描器上下文。

Comments Accepted at the Workshop on the Use of Large Language Models for Cybersecurity (LLMSec), co-located with ESORICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23204 2026-07-28 cs.RO cs.CL cs.SD 新提交 86%

Low-Latency Turn-Taking via Context-Aware Preface Generation in a Real-World Dialogue Robot

通过真实世界对话机器人中的上下文感知前言生成实现低延迟轮流发言

Yuki Okafuji, Koji Inoue, Yoshiki Ohira

机构 * CyberAgent(CyberAgent公司) The University of Osaka(大阪大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究基于LLM的对话系统响应延迟问题,提出两阶段增量框架,通过意图准备检测器和VAP模型生成并确定传递前言回复时机,经现场实验评估三种情况,揭示了不同方式在延迟上的时间权衡。

Comments 5 pages, 4 figures. Accepted at ICMI LBR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16202 2026-07-21 cs.AI 新提交 86%

Democratizing AI with Small Language Models: Structured Benchmarking and Parameter-Efficient Fine-Tuning for Local Deployment

通过小语言模型实现人工智能民主化:面向本地部署的结构化基准测试和参数高效微调

Daniel Cersosimo

机构 * Binghamton University(宾汉姆顿大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title);分类 cs.AI

AI总结 研究在硬件和治理约束下人工智能民主化问题,通过对九个小语言模型在特定基准测试上控制评估,采用共享参数高效微调管道,得出有序工作流程让部分低于3B的模型可成为结构化小众工作负载本地专家的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07984 2026-07-10 cs.AI 新提交 86%

Agentic Neural Architecture Search

智能体神经架构搜索

Seokhoon Jeong, Mijung Kim, Taehwan Kim

机构 * Artificial Intelligence Graduate School, Ulsan National Institute of Science and Engineering(人工智能研究生院,乌山科学与工程研究院) Department of Computer Science and Engineering, Ulsan National Institute of Science and Engineering(计算机科学与工程系,乌山科学与工程研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探索LLM驱动设计与NAS驱动搜索的分工,提出用LLM生成种子架构并分解为带插槽架构供NAS搜索的机制,在AgentNAS中实例化,在多任务上表现出色,两种搜索机制互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05933 2026-07-08 cs.PF cs.LG 新提交 86%

Energy-Efficient GPU DVFS for Fine-Tuning of SLMs on Resource-constrained Embedded Devices

用于资源受限嵌入式设备上小型语言模型微调的节能GPU动态电压频率缩放

Jurn-Gyu Park, Sanzhar Zholdybayev, Aidar Amangeldi, Ademi Zhanuzakova

机构 * School of Engineering and Digital Sciences, Nazarbayev University(工程与数字科学学院,纳扎尔拜耶夫大学)

专题命中 效率与部署 :SLM(summary_cn,abstract);language model(abstract);small language model(abstract);分类 cs.LG

AI总结 研究资源受限嵌入式设备上SLM微调的节能问题,提出基于机器学习的模型选择方法来选GPU DVFS设置,在NVIDIA Jetson AGX Orin上实验,相比MAXN模式0平均节能13.11%,最高达26.73%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00019 2026-07-02 cs.CY cs.AI 新提交 86%

LLMs in the Real World: Evaluating "AI" in Emergency Contexts

现实世界中的LLM:评估紧急情境下的“AI”

Sara Court, Lara Downing, Micha Elsner

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文呼吁研究社区在向公众传达发现时发挥更大作用,通过LLM在紧急文本-911系统部署案例,识别常见误解并提出建议。

Comments Accepted to ACL Findings 2026 in San Diego

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17059 2026-06-17 cs.DC cs.AI 新提交 86%

Towards Distributed Inference of LLMs on a P2P Network

面向P2P网络的LLM分布式推理

Shabari S Nair, Krishanu Saini

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系)

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 提出一种去中心化的前缀缓存感知路由方案,用于P2P网络中的LLM推理,通过本地基数树和异步反熵更新缓存信息,避免集中协调和KV缓存传输,在低延迟和偏斜前缀分布下提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏