arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22210 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22210 篇

2606.12341 2026-06-11 cs.CR 新提交 89%

OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents

OCELOT:面向隐私保护LLM代理的推理泄露预算

Jin Xie, Songze Li

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11700 2026-06-11 cs.IR 新提交 89%

CompRank: Efficient LLM Reranking via Token-Level Compression and Decoding-Free Scoring

CompRank: 通过令牌级压缩和无解码评分实现高效的LLM重排序

Xuan Lu, Haohang Huang, Yingqi Fan, Junlong Tong, Yuxuan Zhang, Ping Nie, Rui Meng, Xiaoyu Shen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出CompRank框架,通过令牌级压缩和无解码注意力评分减少冗余计算,在BEIR数据集上仅保留10.2%文档令牌即达到接近全令牌的排序性能,并实现4.9-9.5倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11592 2026-06-11 cs.CR 新提交 89%

Defense Against Prompt Inversion Attacks: An Information-Theoretic Approach for LLM Collaborative Inference

对抗提示反转攻击:面向LLM协作推理的信息论方法

Sayedeh Leila Noorbakhsh, Hossein Khalili, Nader Sehatbakhsh

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出信息论防御框架,通过最小化中间激活与输入提示的互信息来学习隐私表示,实现隐私-效用-延迟权衡,攻击成功率降低35%。

Comments Preprint. 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13628 2026-06-11 cs.NI 版本更新 89%

Compact LLM Deployment and World Model Assisted Offloading in Mobile Edge Computing

紧凑型大语言模型部署与世界模型辅助的卸载在移动边缘计算中

Ruichen Zhang, Xiaofeng Luo, Jiayi He, Jiawen Kang, Zehui Xiong, Shiwen Mao

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了移动边缘计算网络中紧凑型大语言模型(LLM)部署和世界模型辅助的推断卸载问题,提出了一种边缘紧凑型LLM部署(ECLD)框架,结合结构化剪枝、低比特量化和知识蒸馏来构建可部署于边缘的LLM变种,并通过四个互补指标评估这些模型。基于这些紧凑模型,提出了一个MEC卸载优化问题,旨在最小化长期平均推断延迟,同时满足设备能耗预算和LLM特定的服务质量约束。为了解决未知且时间变化的网络动态问题,开发了一种世界模型-近端策略优化(PPO)算法,该算法在原策略优化算法中加入了学习的递归世界模型,以提供改进的价值目标和短时间想象回放。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10148 2026-06-10 cs.CR 新提交 89%

RadKey: An LLM-Guided RF Backscatter System for Through-Wall Keystroke Inference

RadKey: 一种基于LLM引导的RF反向散射系统用于穿墙击键推断

Qijun Wang, Chunqi Qian, Huacheng Zeng

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出RadKey系统,利用无源反向散射标签捕获击键振动和声音,通过RF信号远距离穿墙窃听,结合信号处理与LLM在线自适应,实现跨用户、跨键盘的准确击键推断。

Comments Accepted to the 47th IEEE Symposium on Security and Privacy (IEEE S&P), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09182 2026-06-09 cs.SE 新提交 89%

Understanding How Enterprises Adopt the Model Context Protocol for LLM-Driven Software Engineering

理解企业如何采用模型上下文协议进行基于LLM的软件工程

Kehui Chen, Yicheng Sun, Jacky Keung, Zhenyu Mao, Xiaoxue Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过对20名从业者的访谈,研究企业采用模型上下文协议(MCP)的现状,发现MCP支持跨系统协作和任务解耦,但面临生态系统碎片化、协调困难等问题,并提出标准化和低代码等改进需求。

Comments 12pages, preliminary version accepted at the 26th International Conference on Quality, Reliability, and Security (QRS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08891 2026-06-09 cs.AR cs.ET 新提交 89%

PALUTE: Processing-In-Memory Acceleration via Lookup Table for Edge LLM Inference

PALUTE: 基于查找表的处理-内存加速用于边缘LLM推理

Runyang Tian, Yanru Chen, Weihong Xu, Tajana Šimunić Rosing

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出PALUTE,一种基于查找表的3D DRAM处理-内存加速器,通过垂直组织实现高并行度,降低面积开销,在0.16W功耗下达到1264 TPS吞吐量,能效比CHIME提升12.8倍。

Comments ISLPED 2026 IEEE/ACM International Symposium on Low Power Electronics and Design

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01751 2026-06-09 cs.PF 89%

SparseX: Efficient Segment-Level KV Cache Sharing for Interleaved LLM Serving

SparseX: 面向交错式LLM服务的高效段级KV缓存共享

Quqing Zhang, Kai Chen, Ning Liao, Zehao Lin, Bo Tang, Feiyu Xiong, Zhiyu Li, Xiaoxing Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对长上下文LLM服务中非前缀重复内容导致的缓存效率低问题,提出SparseX,一种基于稀疏Q索引的段级KV缓存共享方法,通过单次前向传播中的稀疏KV重计算恢复跨段上下文交互,实现无额外模型或预处理的缓存复用。

Comments Corrected author metadata only; no changes to the paper content

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18011 2026-06-09 cs.SI cs.DB 版本更新 89%

Topology-Aware LLM-Driven Social Simulation: A Unified Framework for Efficient and Realistic Agent Dynamics

基于拓扑的LLM驱动社交模拟:一种统一框架用于高效且真实的代理动态

Yuwei Xu, Shulun Zhang, Yingli Zhou, Shipei Zeng, Laks V. S. Lakshmanan, Chenhao Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TopoSim框架,通过整合拓扑结构推理提升社交模拟的效率和真实性,实验显示其在多个框架和数据集上均表现出更优的模拟精度和更低的资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00603 2026-06-08 cs.CY 版本更新 89%

Toward Agentic Governance: What Shapes LLM-Agent Intervention in Public Forums?

走向代理治理:什么决定了LLM代理在公共论坛中的干预?

Luyang Zhang, Yi-Yun Chu, Ramayya Krishnan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 研究LLM代理在公共论坛中干预行为的变化,发现四个部署选择(模型版本、权重开放状态、服务提供商、系统提示策略)独立影响响应率,且开放权重与封闭权重模型在可见挑战上的拒绝倾向存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05933 2026-06-05 cs.DC 89%

Beyond Greedy Chunking: SLO-Aware Sliding-Window Scheduling for LLM Inference

超越贪婪分块:面向LLM推理的SLO感知滑动窗口调度

Yuansheng Chen, Yue Zhang, Xuan Mo, Weigang Wu, Jialun Li

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SlidingServe系统,通过滑动窗口分块、轻量级批次延迟预测和动态规划批次构建,在保证服务质量约束下提升大语言模型在线推理的吞吐量并降低SLO违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05238 2026-06-05 cs.SE 89%

DeployBench: Benchmarking LLM Agents for Research Artifact Deployment

DeployBench: 用于研究工件部署的LLM智能体基准测试

Yuanli Wang, Yaoyao Qian, Yue Zhang, Hanhan Zhou, Jindan Huang, Tianfu Fu, Qiuyang Mang, Huanzhi Mao, Wenhao Chai, Wendong Fan, Liqiang Jing

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出DeployBench基准,包含51个跨领域的研究工件部署任务,评估LLM智能体在环境设置中的表现,发现主要失败原因是智能体过早停止且验证不充分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02994 2026-06-03 cs.CV 89%

Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation

Video-OPD:通过在线策略蒸馏实现多模态大语言模型在时序视频定位中的高效后训练

Jiaze Li, Hao Yin, Haoran Xu, Boshen Xu, Wenhui Tan, Zewen He, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :post-training(title,abstract);large language model(title);language model(title)

AI总结 提出Video-OPD框架,利用在线策略蒸馏和教师验证分歧聚焦课程,以高效后训练多模态大语言模型进行时序视频定位,克服稀疏奖励和高计算开销问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01927 2026-06-02 cs.DC 89%

Scaling LLM Inference Beyond Amdahl`s Limits via Eliminating Non-Scalable Overheads

通过消除不可扩展开销将LLM推理扩展到超越Amdahl极限

Alan Zhao, Cyril Y. He, Wei Xu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM推理中张量并行度增加导致的不可扩展开销问题,提出Albireo系统,通过重叠调度、I/O与计算及序列并行采样来提升最优并行度,从而显著提高吞吐量、降低延迟和能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01387 2026-06-02 cs.DC 89%

Fail-Closed Lowering of Resident KV Claims onto LLM Serving Runtimes

将Resident KV声明降级到LLM服务运行时的故障关闭

Lukas Stepanek

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出一种故障关闭的降级关系,用于将未来KV重用声明映射到LLM服务运行时的原语,通过检查器验证运行时是否满足声明义务。

Comments 24 pages, 2 figures. Public artifact: https://github.com/gustavgauge/resident-kv-lowering-artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16174 2026-06-02 cs.LG cs.AI cs.CL cs.CR 89%

Efficient LLM Moderation with Multi-Layer Latent Prototypes

基于多层潜在原型的高效LLM审核

Maciej Chrabąszcz, Filip Szatkowski, Bartosz Wójcik, Jan Dubiński, Tomasz Trzciński, Sebastian Cygert

机构 * University of Warsaw(华沙大学)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多层原型审核器(MLPM),利用多层中间表示的原型实现轻量、高效且可定制的输入审核,在多个基准上达到最优性能,并可与输出审核结合提升响应安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25098 2026-05-29 cs.AI cs.CL cs.LG 89%

Revisiting the Effectiveness of LLM Pruning for Test-Time Scaling

重新审视LLM剪枝对测试时缩放的有效性

Ocean Monjur, Shahriar Kabir Nahin, Anshuman Chhabra

机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究非结构化剪枝对推理型大语言模型测试时缩放性能的影响,发现其优于结构化剪枝甚至有时超过未剪枝模型,并探讨了层间稀疏分配策略的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28095 2026-05-28 cs.DC 89%

SiDP: Memory-Efficient Data Parallelism for Offline LLM Inference

SiDP:面向离线LLM推理的内存高效数据并行

Alan Zhao, Cyril Y. He

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SiDP,一种将权重视为带宽支持的共享资源的内存高效数据并行范式,通过Weight-as-a-Service和Compute-as-a-Service两种模式,在相同配置下将可用KV容量提升至1.8倍,端到端吞吐量提升至1.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27123 2026-05-27 cs.IR 89%

Rethinking Agentic RAG: Toward LLM-Driven Logical Retrieval Beyond Embeddings

重新思考智能体RAG:迈向超越嵌入的LLM驱动逻辑检索

Yuqi Zeng, Qixiang Deng, Yulei Wan, Ruiquan Jiang, Xiaoqing Zheng, Xuanjing Huang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出一种智能体RAG框架,让LLM通过逻辑表达式控制检索,使用轻量级倒排索引后端,在降低成本和幻觉的同时匹配强基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23389 2026-05-25 cs.DC 89%

AlignedServe: Orchestrating Prefix-aware Batching to Build a High-throughput and Computing-efficient LLM Serving System

AlignedServe:编排前缀感知批处理以构建高吞吐量和计算高效的LLM服务系统

Fengyao Bai, Hongbin Zhang, Zhitao Chen, Jiangsu Du, Zhiguang Chen, Yutong Lu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM服务中解码迭代内的气泡问题,提出基于前缀感知批处理的AlignedServe框架,通过分组相似KV缓存长度的请求、CPU内存维护大量飞行请求、批级调度和GPU间预取KV缓存,显著提升解码吞吐量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18586 2026-05-21 cs.DC 89%

TokenCake: A KV-Cache-centric Serving Framework for LLM-based Multi-Agent Applications

TokenCake: 一种面向基于LLM的多智能体应用的KV缓存中心化服务框架

Zhuohang Bian, Feiyang Wu, Zhuoran Li, Teng Ma, Youwei Zhuo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TokenCake,一种面向基于LLM的多智能体应用的KV缓存中心化服务框架,通过智能体感知设计共同优化调度和内存管理,以解决KV缓存中的空间竞争和时间利用率问题,实验表明其显著降低了端到端延迟并提高了GPU内存利用率。

Comments 14 pages, 17 figures, 3 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19481 2026-05-20 cs.OS 89%

C2CServe: Leveraging NVLink-C2C for Elastic Serverless LLM Serving on MIG

C2CServe: 利用NVLink-C2C实现弹性无服务器LLM服务的MIG

Shutian Luo, Ali Zafar Sadiq, Rui Yang, Mingye Zhang, Haiying Shen, Wei Wang, Yue Cheng

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出C2CServe,一种基于MIG的无服务器LLM服务系统,利用NVLink-C2C实现模型在请求粒度上的切换,减少冷启动延迟并保持高响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19240 2026-05-20 cs.MA 89%

CASPIAN: Online Detection and Attribution of Cascade Attacks in LLM Multi-Agent Systems via Cross-Channel Causal Monitoring

CASPIAN: 通过跨通道因果监控在线检测和归因LLM多智能体系统中的级联攻击

Kavana Venkatesh, Jafar Isbarov, Saad Amin, Murat Kantarcioglu, Jiaming Cui

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出CASPIAN框架,通过跨通道因果监控在线检测和归因LLM多智能体系统中的级联攻击,其核心方法是利用动态因果影响矩阵和晚交互条件转移熵公式,实现对级联行为的统一分析,并在检测准确性和早期级联识别方面优于现有方法。

Comments https://github.com/caspian-detector/caspian

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13189 2026-05-19 cs.HC cs.RO 89%

Gesture First, LLM-Assisted Voice Complement: Exploring Multimodal Robot 'Puppeteer' Teleoperation Via Virtual Counterpart in Augmented Reality

先手势,LLM辅助语音补充:通过增强现实中的虚拟对应物探索多模态机器人'提线人'遥控

Yuchong Zhang, Bastian Orthmann, Shichen Ji, Michael Welle, Jonne Van Haastregt, Danica Kragic

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨了通过增强现实中的虚拟对应物实现多模态机器人遥控的方法,比较了仅手势和结合语音与手势的交互方式在性能和用户体验上的差异,提出设计指南以平衡效率、鲁棒性和用户专业性。

Comments This work is under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15962 2026-05-18 cs.CR 89%

PersonaFingerprint: Measuring Persona Inference on Modern Websites with LLM-Driven Browsing

PersonaFingerprint:基于LLM驱动浏览的现代网站人格推断测量

Chuxu Song, Hao Wang, Richard Martin

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文研究了现代网站中通过加密流量元数据推断用户人格的隐私风险,提出了一种基于LLM驱动的多代理浏览框架,并展示了在混合网站流量中人格推断的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11853 2026-05-15 cs.LG cs.AI cs.CL 89%

GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation

GEAR:通过自蒸馏实现的粒度自适应优势重加权用于LLM智能体

Sijia Li, Yuchen Huang, Zifan Liu, Yanping Li, Jingjing Fu, Li Zhao, Jiang Bian, Ling Zhang, Jun Zhang, Rui Wang

机构 * Hong Kong University of Science and Technology(香港科技大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GEAR通过自蒸馏获取token和片段级信号,实现粒度自适应的优势重加权,提升长时间跨度任务中的智能体性能,实验表明在数学推理和工具使用任务中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13491 2026-05-14 cs.SE 89%

SieveFL: Hierarchical Runtime-Aware Pruning for Scalable LLM-Based Fault Localization

SieveFL:面向可扩展LLM故障定位的分层运行时感知剪枝

Mahdi Farzandway, Fatemeh Ghassemi

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 SieveFL通过分层过滤机制提升LLM故障定位效率,通过预处理过滤减少候选方法数量,提升准确率和排名质量,无需使用前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11733 2026-05-13 cs.CE cs.DC 89%

Position: LLM Inference Should Be Evaluated as Energy-to-Token Production

位置:LLM推理应作为能量到令牌生产进行评估

Xiang Liu, Shimiao Yuan, Zhenheng Tang, Peijie Dong, Kaiyong Zhao, Qiang Wang, Bo Li, Xiaowen Chu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出将LLM推理视为能量到令牌生产,强调在固定质量和性能目标下,约束从理论峰值计算转向实际能源、冷却和效率问题,呼吁报告能耗、绑定约束和效率指标。

Comments https://dominic789654.github.io/energy-to-token/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10440 2026-05-12 cs.CY 89%

TourMart: A Parametric Audit Instrument for Commission Steering in LLM Travel Agents

TourMart: 一种用于LLM旅行代理佣金管理的参数审计工具

Yao Liu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 TourMart通过参数lambda和kappa驱动反事实分析,区分LLM工程故障与真实商业引导,验证代理引导效果,输出合规报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07456 2026-05-12 cs.DC 89%

Agentic AI-Driven UAV Network Deployment: An LLM-Enhanced Exact Potential Game Approach

基于代理AI的无人机网络部署:一种增强型精确势博弈方法

Xin Tang, Xiaohuan Li, Qian Chen, Binhan Liao, Yaqi Zhang, Jianxin Chen, Changyuan Zhao, Junchuan Fan, Junxi Tian

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出基于精确势博弈的无人机网络部署优化框架,结合代理AI与双重空间尺度算法,提升网络连接性与吞吐量,通过LLM自动生成效用权重以增强适应性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏