arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1859 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1859 篇

2607.10186 2026-07-14 cs.AR 新提交 89%

FlashAccel: Leveraging High-Bandwidth Flash for High-Throughput LLM Inference

FlashAccel:利用高带宽闪存实现高吞吐量语言模型推理

Xinyu Wang, Yalong Xue, Xiaotian Sun, Xiaoyu Zhang, Chunmeng Dou, Xueqi Li, Xiaoming Chen

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM推理受HBM容量限制问题,提出FlashAccel系统,将HBF集成到基于HBM的GPU中,通过架构支持、特殊数据布局及引入新管理层和编程模型,在100ms延迟约束下,提升了每GPU吞吐量和能源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23969 2026-07-13 cs.DC cs.CR cs.PF 新提交 89%

The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing

序列化桥接:理解与恢复Blackwell GPU机密计算下的LLM服务性能

Hang Yin, Kevin Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文发现Intel TDX加GPU-CC下LLM服务吞吐量下降13-27%的主因是机密VM-GPU桥接的序列化开销,而非GPU计算本身,并通过调度优化恢复高达92%的性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04379 2026-07-07 cs.CR 新提交 89%

Knowledge Base Poisoning Attacks and Defense for Policy-Aware LLM-RAG Framework

用于战场物联网任务控制的策略感知大语言模型检索增强生成(PA-LLM-RAG)框架的知识库中毒攻击与防御

Om Solanki, Lopamudra Praharaj, Deepti Gupta, Maanak Gupta

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 研究针对战场物联网任务控制的PA-LLM-RAG框架的对抗安全。提出查询无关语义检索中毒攻击,能注入规则致大语言模型上下文损坏。还提出CLD-KB防御框架,在检测中毒和知识保存方面性能优异。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01617 2026-07-03 cs.AR 新提交 89%

3DLS: A 3D Logic-Stacked Architecture for Disaggregated LLM Serving

3DLS:一种用于分离式LLM服务的3D逻辑堆叠架构

Jaehun Lee, In-Jun Jung, Joo-Young Kim

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对预填-解码分离与张量并行中KV缓存传输和TP集合共享互连导致的关键路径争用问题,提出3D逻辑堆叠架构3DLS,通过垂直互连分离流量,提升吞吐量达1.49倍,降低端到端延迟60.2%。

Comments Accepted to IEEE Computer Architecture Letters (CAL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00151 2026-07-02 cs.DC 新提交 89%

SmoothAgent: Efficient Long-Horizon LLM-Based Agent Serving with Lookahead Context Engineering

SmoothAgent: 基于前瞻上下文工程的高效长程LLM Agent服务

Zaifeng Pan, Qianxu Wang, Zhengding Hu, Chang Chen, Yue Guan, Yanbo Zhou, Steven Swanson, Yufei Ding

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM Agent中上下文变换导致KV缓存失效和TTFT增加的问题,提出前瞻编程模型和调度器,实现异步上下文预处理,降低TTFT达11.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30980 2026-07-01 cs.HC 新提交 89%

Ethics and Social Responsibility in AI-Assisted Interviewing: An LLM-in-the-Loop Study of AI-Generated Follow-Up Questions

AI辅助访谈中的伦理与社会责任:基于LLM-in-the-loop的AI生成追问研究

He Zhang, Yueyan Liu, Xin Guan, Jie Cai, John M. Carroll

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 通过LLM-in-the-loop Wizard-of-Oz实验,研究AI实时生成追问在访谈中的应用,发现五大伦理问题:有害语言、尊重缺失、参与不平等、责任模糊及隐私风险,并提出设计与治理建议。

Comments This work has been accepted to CHIWORK '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27990 2026-06-29 cs.CR 新提交 89%

AdvancedShelLM: A Stateful Multi-Agent LLM Honeypot for SSH Deception

AdvancedShelLM:一种用于SSH欺骗的有状态多智能体LLM蜜罐

Muris Sladić, Eman Alibalić, Veronica Valeros, Carlos Catania, Sebastian Garcia

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出AdvancedShelLM蜜罐,采用多智能体多LLM架构,通过Manager和Worker两个LLM代理提升命令理解、减少错误响应并增强欺骗性,实现永久文件系统以支持多攻击者同时观察变化文件,评估显示高通过率和有效欺骗。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27665 2026-06-29 cs.SE 新提交 89%

LLM-Assisted Model-Based GUI Testing for Vue.js Web Applications

基于LLM辅助的Vue.js Web应用模型驱动GUI测试

Tao Li, Chenhui Cui, Rubing Huang, Dave Towey, Shikai Guo, Lei Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LLMVue框架,利用大语言模型从Vue.js源码生成页面转换图,实现模型驱动GUI测试,在10个开源项目上验证了高精度和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25426 2026-06-25 cs.PF 新提交 89%

Above the Inner Loop: Exceeding Accelerate at LLM Prefill GEMM on the M1 AMX

在内循环之上:在M1 AMX上超越Accelerate的LLM预填充GEMM

Deyvik Bhan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 通过微基准测试发现M1 AMX的内循环受限于加载-发射,手写内核通过细粒度多线程面板和预打包权重两个部署级杠杆超越Accelerate,在12种LLM预填充GEMM形状上实现1.17倍到2.0倍的加速,且位精确。

Comments 11 pages, 2 figures, 6 tables. Code: https://github.com/dbhan08/inferc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20847 2026-06-23 eess.IV cs.MM 新提交 89%

LLM-Driven Heuristic Frame-Level Quantization Parameter Adaptation for VVenC

基于LLM的启发式帧级量化参数自适应调整用于VVenC

Liqiang He, Yingwen Zhang, Riyu Lu, Meng Wang, Shiqi Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出利用大语言模型自动设计帧级QP分配的率失真优化启发式,通过闭环进化框架迭代生成并评估候选算法,在VVenC上实现优于固定QP和拉格朗日基线的率失真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22968 2026-06-23 cs.AR 新提交 89%

MOCAP: Wafer-Scale-Chip-Oriented Memory-Orchestrated Chunked Pipelining Framework for Prefill-Only LLM Inference

MOCAP:面向晶圆级芯片的面向预填充LLM推理的内存协调分块流水线框架

Zichuan Wang, Huizheng Wang, Yuheng Xiao, Haonan Zuo, Taiquan Wei, Jinyi Deng, Chao Li, Yang Hu, Shouyi Yin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出MOCAP框架,通过内存平衡KV重分配和延迟平衡分块划分,解决晶圆级芯片上长上下文预填充中的内存和延迟不平衡问题,显著降低端到端延迟并提高吞吐量。

Comments 15 pages, 6 figures, accepted by APPT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22560 2026-06-23 cs.CR 新提交 89%

Evidence-Bound Gateway-Path Provenance for Third-Party LLM Inference

第三方LLM推理的证据绑定网关路径溯源

Fei Wang, Zebai Tian

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对第三方LLM网关中路由替换、隐藏回退等不可信问题,提出证据绑定架构,通过受信任执行环境分离控制面与执行面,实现可验证的路径溯源。

Comments 9 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22175 2026-06-23 cs.DC 新提交 89%

StickyInvoc: Rethinking Task Models for High-throughput Workflows in the LLM Era

StickyInvoc:重新思考LLM时代高通量工作流的任务模型

Thanh Son Phung, Douglas Thain

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM推理在高通量工作流中因反复加载模型参数导致的性能瓶颈,提出StickyInvoc任务模型,通过分离状态创建与销毁,将状态持久化复用,实现3.6倍加速。

Comments arXiv admin note: substantial text overlap with arXiv:2510.14024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18851 2026-06-18 eess.SY cs.SY 新提交 89%

From Tokens to Energy Flexibility: Quantization-Enabled Demand Response for Data Centers with LLM Inference Workloads

从令牌到能量灵活性:面向LLM推理工作负载的数据中心量化使能需求响应

Bojun Du, Xiaoyi Fan, Ershun Du, Long Chen, Jianpei Han, Qingchun Hou, Ning Zhang, Chongqing Kang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种量化使能的能量管理框架,通过建立量化-功率模型和两阶段需求响应模型,实现多园区协同优化,降低数据中心运营成本34.3%。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18600 2026-06-18 cs.DC 新提交 89%

ShuntServe: Cost-Efficient LLM Serving on Heterogeneous Spot GPU Clusters

ShuntServe: 异构竞价型GPU集群上的成本高效LLM服务

Seungwoo Jeong, Moohyun Song, Juhyun Park, Kyungyong Lee

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出ShuntServe系统,通过屋顶线模型估计性能和动态规划优化模型放置,在异构竞价型GPU集群上最大化吞吐量,结合输出保留迁移与共享张量存储实现容错,相比基线吞吐量提升1.42倍,成本效率提升31.9%以上。

Comments 18 pages, 16 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17949 2026-06-17 cs.DC 新提交 89%

RouteBalance: Fused Model Routing and Load Balancing for Heterogeneous LLM Serving

RouteBalance: 面向异构LLM服务的融合模型路由与负载均衡

Wei Da, Evangelia Kalyvianaki

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出RouteBalance,通过融合模型路由与负载均衡为异构LLM服务实现质量、延迟和成本的三维联合优化,在13实例28GPU集群上达到最优前沿。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16264 2026-06-16 cs.DC 新提交 89%

Tropical: Enhancing SLO Attainment in Disaggregated LLM Serving via SLO-Aware Multiplexing

Tropical: 通过SLO感知的多路复用提升解聚式LLM服务中的SLO达成率

Jinming Ma, Jiefei Chen, Xiuhong Li, Jiangfei Duan, Haojie Duanmu, Xingcheng Zhang, Chao Yang, Dahua Lin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Tropical系统,通过SLO感知的多路复用策略平衡排队时间和干扰,同时满足预填充和解码阶段的延迟约束,在真实数据集上相比现有系统提升高达2.09倍的请求数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12341 2026-06-11 cs.CR 新提交 89%

OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents

OCELOT:面向隐私保护LLM代理的推理泄露预算

Jin Xie, Songze Li

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11700 2026-06-11 cs.IR 新提交 89%

CompRank: Efficient LLM Reranking via Token-Level Compression and Decoding-Free Scoring

CompRank: 通过令牌级压缩和无解码评分实现高效的LLM重排序

Xuan Lu, Haohang Huang, Yingqi Fan, Junlong Tong, Yuxuan Zhang, Ping Nie, Rui Meng, Xiaoyu Shen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出CompRank框架,通过令牌级压缩和无解码注意力评分减少冗余计算,在BEIR数据集上仅保留10.2%文档令牌即达到接近全令牌的排序性能,并实现4.9-9.5倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11592 2026-06-11 cs.CR 新提交 89%

Defense Against Prompt Inversion Attacks: An Information-Theoretic Approach for LLM Collaborative Inference

对抗提示反转攻击:面向LLM协作推理的信息论方法

Sayedeh Leila Noorbakhsh, Hossein Khalili, Nader Sehatbakhsh

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出信息论防御框架,通过最小化中间激活与输入提示的互信息来学习隐私表示,实现隐私-效用-延迟权衡,攻击成功率降低35%。

Comments Preprint. 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10148 2026-06-10 cs.CR 新提交 89%

RadKey: An LLM-Guided RF Backscatter System for Through-Wall Keystroke Inference

RadKey: 一种基于LLM引导的RF反向散射系统用于穿墙击键推断

Qijun Wang, Chunqi Qian, Huacheng Zeng

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出RadKey系统,利用无源反向散射标签捕获击键振动和声音,通过RF信号远距离穿墙窃听,结合信号处理与LLM在线自适应,实现跨用户、跨键盘的准确击键推断。

Comments Accepted to the 47th IEEE Symposium on Security and Privacy (IEEE S&P), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09182 2026-06-09 cs.SE 新提交 89%

Understanding How Enterprises Adopt the Model Context Protocol for LLM-Driven Software Engineering

理解企业如何采用模型上下文协议进行基于LLM的软件工程

Kehui Chen, Yicheng Sun, Jacky Keung, Zhenyu Mao, Xiaoxue Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过对20名从业者的访谈,研究企业采用模型上下文协议(MCP)的现状,发现MCP支持跨系统协作和任务解耦,但面临生态系统碎片化、协调困难等问题,并提出标准化和低代码等改进需求。

Comments 12pages, preliminary version accepted at the 26th International Conference on Quality, Reliability, and Security (QRS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08891 2026-06-09 cs.AR cs.ET 新提交 89%

PALUTE: Processing-In-Memory Acceleration via Lookup Table for Edge LLM Inference

PALUTE: 基于查找表的处理-内存加速用于边缘LLM推理

Runyang Tian, Yanru Chen, Weihong Xu, Tajana Šimunić Rosing

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出PALUTE,一种基于查找表的3D DRAM处理-内存加速器,通过垂直组织实现高并行度,降低面积开销,在0.16W功耗下达到1264 TPS吞吐量,能效比CHIME提升12.8倍。

Comments ISLPED 2026 IEEE/ACM International Symposium on Low Power Electronics and Design

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26891 2026-07-30 cs.CL 新提交 89%

DIRECT: Direct Decoding for Efficient and Aligned Sequence Labeling with Large Language Models

DIRECT:基于大语言模型的高效对齐序列标注直接解码方法

Yilei Wang, Jiaxin Gan, Kexuan Zhang, Ling Li, Wentao Zhang, Peichao Lai

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 针对现有大语言模型序列标注方法的领域对齐不足与推理效率低问题,提出DIRECT框架,结合训练时优化与推理时校正,在8个数据集上实现性能与效率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20806 2026-07-24 cs.AI 新提交 89%

Profiling Lightweight Large Language Models

轻量级大语言模型剖析

Tomohiro Harada, Enrique Alba, Gabriel Luque

机构 * Graduate School of Science and Engineering, Saitama University(埼玉大学理工学研究科) ITIS, University of Malaga(马拉加大学信息技术与系统研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究轻量级大语言模型在资源受限环境中的情况,提出基于PTME的实验框架,通过硬件级测量联合测量精度、时间、内存和能耗,对一组模型进行测试,发现代理描述符不足,揭示非主导配置,为不同资源下选模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10855 2026-07-14 cs.LG 新提交 89%

Reliability Scaling Laws for Quantized Large Language Models

量化大语言模型的可靠性缩放定律

Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier

机构 * Technical University of Munich(慕尼黑工业大学) Munich Data Science Institute(慕尼黑数据科学研究所) Pruna AI(Pruna人工智能公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 研究量化大语言模型的可靠性缩放定律,通过对其不确定性、校准和鲁棒性进行全面评估,刻画可靠性与模型比特总数的关系,发现4比特量化模型有可靠性峰值,且量化增强了模型对自然输入扰动的鲁棒性。

Comments Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09713 2026-07-14 cs.AI cs.MA cs.RO 新提交 89%

Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction

基于规则对齐的小语言模型和多智能体自我校正的闭环控制

Yuchen Wang, Javal Vyas, Tong Liu, Mehmet Mercangoz

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract);分类 cs.AI

AI总结 研究能否对紧凑型小语言模型再训练用于控制推理并嵌入验证器引导的校正循环,通过组相对策略优化对齐模型,结合多种智能体,在随机热控模拟中取得高准确率和低延迟,支持该架构用于边缘可重构自主控制。

Comments Accepted by IEEE CCTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09104 2026-07-13 cs.CV cs.AI 新提交 89%

Integrating Large Language Models and Graph Convolutional Networks for Semi-Supervised Image Classification

将大语言模型与图卷积网络集成用于半监督图像分类

Camila Piscioneri Magalhães, Lucas Pascotti Valem

机构 * Institute of Mathematics and Computer Science (ICMC)(数学与计算机科学研究所) University of São Paulo (USP)(圣保罗大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对图像分类中图构建难题,该研究将大语言模型与图卷积网络集成,利用视觉语言模型生成文本描述,经大语言模型处理得到语义相似性分数,指导kNN图边修剪,提升了半监督图像分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05055 2026-07-07 cs.AI 新提交 89%

Toward Trustworthy Large Language Model Agents in Healthcare

迈向医疗保健领域值得信赖的大语言模型智能体

Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham, Ammar Mohanna, Ali Chehab

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04562 2026-07-07 cs.AI cs.NE 新提交 89%

Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

用于消除大语言模型认知熵的滚动系数的海维赛德连续性

MY Pitsane, Hope Mogale

机构 * North-West University, RSA(南非北开普大学) University of Pretoria, RSA(南非彼得里亚大学) Mankind Research Labs, Sandton(沙顿人类研究实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究大语言模型输出难检测错误的问题,提出海维赛德连续性的滚动系数框架,将推理重新表述为谓词门控状态转换,结合模型置信度与并行验证信号,防止无效状态传播,降低认知熵。

Comments A First draft

详情

展开后加载摘要…

URL PDF HTML 收藏