arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22116 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22116 篇

2605.27435 2026-05-28 cs.AR cs.AI 92%

When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference

当NPU并非总是更快:移动LLM推理的阶段级分析

Pu Li, Jiawen Qi, Qinyu Chen

机构 * Leiden Institute of Advanced Computer Science (LIACS)(莱顿先进计算机科学研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过OPMASK控制管道分解方法,在CPU-NPU异构SoC上对移动LLM推理进行阶段感知的多级基准测试,发现Prefill阶段CPU比NPU快1.6倍,Decode阶段NPU仅提供1.05-1.2倍加速,且NPU卸载增加能耗高达51%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26433 2026-05-27 cs.CL 92%

Vectors Are Not Neutral: Sensitive-Information Inference from Exported LLM Representations in Summarization

向量并非中性:从摘要任务中导出的LLM表示进行敏感信息推断

Weixin Liu, Bowen Qu, Juming Xiong, Congning Ni, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLM摘要系统导出向量中的敏感信息泄露风险,提出SurfaceLoRA微调方法降低特定向量的可恢复性,但未针对的池化向量仍存在风险。

Comments 30 pages, 2 figures; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26118 2026-05-27 cs.DC cs.AI 92%

Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU

Xe-Forge:面向Intel GPU的多阶段LLM驱动的内核优化

Marcin Spoczynski, Daniel Fleischer, Moshe Berchansky, Gabriela Ben-Melech Stan, Shira Guskin, Weilin Xu, Adam Siemieniuk, Alexander Heinecke

机构 * Intel Corporation(英特尔公司)

专题命中 效率与部署 :LLM(title,title_cn);SLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Xe-Forge,一个多阶段LLM流水线,通过Chain-of-Verification-and-Refinement(CoVeR)代理和硬件验证,自动将Triton内核优化为Intel GPU,实现几何平均1.17倍加速,Flash Attention加速2-13.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24598 2026-05-26 cs.AI cs.MA 92%

Hera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM Agents

Hera: 面向设备-云协作LLM智能体的长时程协调学习

Yuxin Zhang, Mengxue Hu, Zheng Lin, Xiaoyi Fan, Fan Xie, Zihan Fang, Jing Yang, Wenjun Zhu, Zhiwen Chen, Chengfei Lv, Zhe Chen

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) The University of Hong Kong(香港大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) New York University(纽约大学) Universiti Malaya(马来亚大学) SpaceAIC Co., Ltd.(SpaceAIC公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Hera,一种步骤级设备-云LLM智能体协调器,通过两阶段训练(模仿学习+强化学习)优化长时程任务的性能-成本帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23929 2026-05-26 cs.AI cs.SE 92%

Toward Reliable Design of LLM-Enabled Agentic Workflows: Optimizing Latency-Reliability-Cost Tradeoffs

面向LLM驱动的智能体工作流的可靠设计:优化延迟-可靠性-成本权衡

Ya-Ting Yang, Quanyan Zhu

机构 * New York University(纽约大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过引入参数化指数可靠性函数建模LLM与非LLM智能体的性能,提出水填充令牌分配策略,并刻画最优工作流可靠性的影子价格,以解决延迟、可靠性和成本之间的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22566 2026-05-22 cs.LG 92%

GraphFlow: A Graph-Based Workflow Management for Efficient LLM-Agent Serving

GraphFlow: 一种基于图的流程管理用于高效的LLM代理服务

Ao Li, Shangpeng Yang, Fahao Chen, Tianheng Xu, Peng Li, Zhou Su

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University, Xi'an, China(西安交通大学计算机科学与工程学院) School of Artificial Intelligence, Shandong University, Jinan, China(山东大学人工智能学院) Shanghai Advanced Research Institute, Chinese Academy of Sciences, Shanghai, China(中国科学院上海先进研究院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于图的流程管理方法GraphFlow,通过统一图结构wGraph动态生成任务特定流程,提高LLM代理服务的效率和性能,实验表明其在多个基准数据集上表现优异,性能提升显著且内存占用减少。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21560 2026-05-22 cs.LG 92%

AutoMCU: Feasibility-First MCU Neural Network Customization via LLM-based Multi-Agent Systems

AutoMCU: 通过基于LLM的多智能体系统实现面向MCU的神经网络定制化

Penglin Dai, Zijie Zhou, Xincao Xu, Junhua Wang, Xiao Wu, Lixin Duan

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳先进研究院,电子科技大学) School of Computer Science and Engineering, Northeastern University(计算机科学与工程学院,东北大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出AutoMCU,一种基于LLM的多智能体系统,用于在MCU约束下实现神经网络的自动化定制化。通过自然语言任务需求和硬件规格,AutoMCU迭代生成结构化架构候选方案,通过供应商工具链反馈过滤不可行设计,在训练前进行筛选,评估可行模型并在受控协议下验证部署可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09472 2026-05-22 cs.DC cs.LG 92%

WarmServe: Enabling One-for-Many GPU Prewarming for Multi-LLM Serving

WarmServe: 为多LLM服务实现一种多GPU预热

Chiheng Lou, Sheng Qi, Rui Kang, Yong Zhang, Chen Sun, Pengcheng Wang, Xuanzhe Liu, Xin Jin

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出WarmServe系统,通过基于工作负载预测的多GPU预热技术,减少LLM服务中的尾部时间到第一个令牌(TTFT)并提高请求吞吐量。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21427 2026-05-21 cs.AI cs.DC 92%

PALS: Power-Aware LLM Serving for Mixture-of-Experts Models

PALS: 为混合专家模型的功率感知LLM服务

Can Hankendi, Rana Shahout, Minlan Yu, Ayse K. Coskun

机构 * Boston University(波士顿大学) Harvard University School of Engineering(哈佛大学工程与应用科学学院) Harvard University(哈佛大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PALS,一种功率感知的LLM服务运行时,通过将GPU功率上限作为可控制的参数与软件参数如批大小联合优化,提升能效并减少在功率限制下的服务质量违规。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21049 2026-05-21 cs.CL 92%

Cross-lingual robustness of LLM-brain alignment and its computational roots

LLM-脑对齐的跨语言鲁棒性及其计算根源

Ni Yang, Rui He, Philipp Homan, Iris Sommer, Davide Staub, Wolfram Hinzen

机构 * Grammar and Cognition Lab, Department of Translation & Language Sciences, Universitat Pompeu Fabra(语言与翻译科学系语法与认知实验室,庞培法华大学) Department of Adult Psychiatry and Psychotherapy, University of Zurich(苏黎世大学成人精神病学与心理治疗系) Neuroscience Center Zurich, University of Zurich and ETH Zurich(苏黎世大学神经科学中心与苏黎世联邦理工学院) Center for Clinical Neuroscience and Cognition and Department of Psychiatry, University of Groningen, University Medical Center Groningen(格罗宁根大学临床神经科学与认知中心及精神病学系,格罗宁根大学医学中心) Scalable Scientific Machine Learning Lab, Imperial College London, Department of Earth Science and Engineering(伦敦帝国理工学院可扩展科学机器学习实验室,地球科学与工程系) Institut Català de Recerca i Estudis Avançats (ICREA), Barcelona, Spain(加泰罗尼亚高级研究与研究机构(ICREA),巴塞罗那,西班牙)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究探讨了大型语言模型与大脑对齐的跨语言鲁棒性,通过多语言全脑编码框架分析了中文、英语和法语在自然故事听觉过程中大脑与LLM的对齐情况,发现其在空间上具有跨语言重叠性,但无法通过预测不确定性或表征几何来解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10726 2026-05-21 cs.CR cs.DC cs.LG 92%

PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems

PrefixWall: 缓解共享LLM系统中的前缀缓存侧信道

Panagiotis Georgios Pennas, Konstantinos Papaioannou, Marco Guarnieri, Thaleia Dimitra Doudali

机构 * IMDEA Software Institute(IMDEA软件研究所) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PrefixWall系统,通过监控缓存重用并选择性隔离前缀,有效缓解多租户LLM服务系统中自动前缀缓存(APC)侧信道带来的安全风险,同时提升缓存利用率和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19604 2026-05-20 cs.AI 92%

Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents

形式技能:用于高效且准确LLM代理的可编程运行时技能

Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

机构 * FairyClaw

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出形式技能,一种用于LLM代理的可编程运行时技能抽象,通过JSON元数据和动作模式、可靠的Python执行器、受钩子控制的控制逻辑、形式技能路由和本地运行时状态,提高代理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19593 2026-05-20 cs.AI cs.DC 92%

Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

迈向多模型LLM调度器:关于卸载和抢占的实证洞察

Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

机构 * Sapienza University of Rome(罗马大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究探讨了不同LLM在不同硬件平台上的行为,重点分析了层卸载和抢占对性能的影响,揭示了卸载和抢占对解码吞吐量的非线性影响以及其在不同模型和硬件平台上的差异,为设计高效的多模型LLM服务系统提供了指导。

Comments The 2026 Mediterranean Artificial Intelligence and Networking Conference (MAIN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17467 2026-05-19 cs.CL 92%

VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems

VerifyMAS: LLM多智能体系统中故障归因的假设验证

Hezhe Qiao, Hanghang Tong, Ee-Peng Lim, Bing Liu, Guansong Pang

机构 * Singapore Management University(新加坡国立管理学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出VerifyMAS框架,通过验证假设的方法对LLM多智能体系统中的故障进行归因,解决了现有方法在全局故障识别和细粒度归因方面的不足,实验表明其在多种模型上均优于现有方法。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07347 2026-05-19 stat.ML cs.LG math.PR 92%

Throughput-Optimal Scheduling Algorithms for LLM Inference and AI Agents

面向LLM推理和AI代理的吞吐量最优调度算法

J. G. Dai, Tianze Deng, Yueying Li, Tianyi Peng

机构 * School of Operations Research and Information Engineering, Cornell University(Cornell大学运筹学与信息工程学院) Operations Management, Booth School of Business, University of Chicago(芝加哥大学博斯商学院运营管理系) Decision, Risk and Operations, Columbia Business School, Columbia University(哥伦比亚大学哥伦比亚商学院决策、风险与运营系)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文从排队论角度研究了LLM推理系统的吞吐量优化问题,证明了工作保持调度算法在DAG和Fork-Join路由拓扑中能实现最大吞吐量,并揭示了批量处理网络中K-FCFS调度的流极限框架,评估了Orca和Sarathi-Serve的吞吐量最优性,同时指出批量大小限制和循环路由拓扑对吞吐量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02161 2026-05-19 cs.LG 92%

LLM-TabLogic: Preserving Inter-Column Logical Relationships in Synthetic Tabular Data via Prompt-Guided Latent Diffusion

LLM-TabLogic: 通过提示引导的潜在扩散模型在合成表格数据中保留列间逻辑关系

Yunbo Long, Liming Xu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出LLM-TabLogic方法,利用大语言模型推理捕捉表格列间的复杂逻辑关系,并通过Score-based Diffusion模型在潜在空间中生成数据,以在不需领域知识的情况下有效保持合成表格数据中的列间关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17359 2026-05-19 cs.CL 92%

Learning Transferable Topology Priors for Multi-Agent LLM Collaboration Across Domains

学习跨领域的多智能体LLM协作可转移拓扑先验

Taolin Zhang, Zijie Zhou, Jiuheng Wan, Tingyuan Hu, Chengyu Wang, Xiaofeng He, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) China University of Petroleum (Beijing)(中国石油大学(北京)) East China Normal University(东华大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TopoPrior框架,通过学习可转移的拓扑先验来提升多智能体LLM在跨领域协作中的效率,减少在线搜索开销并提高可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16786 2026-05-19 cs.LG 92%

Lever: Speculative LLM Inference on Smartphones

Lever:智能手机上的推测LLM推理

Tuowei Wang, Fengzu Li, Yanfan Sun, Wei Gao, Ju Ren

机构 * Tsinghua University(清华大学) Beihang University(北航) University of Pittsburgh(匹兹堡大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Lever系统,通过联合优化推测解码的三个阶段,在智能手机上实现高效的闪存支持的LLM推理,显著降低了推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15051 2026-05-15 cs.LG cs.PF 92%

An Interpretable Latency Model for Speculative Decoding in LLM Serving

为LLM服务中的推测解码开发一个可解释的延迟模型

Linghao Kong, Megan Flynn, Michael Peng, Nir Shavit, Mark Kurtz, Alexandre Marques

机构 * MIT(麻省理工学院) Red Hat AI(红帽人工智能)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一个可解释的延迟模型,用于LLM服务中的推测解码,通过Little定律推断有效批处理大小,并分解预填充、草稿和验证的请求需求,以解释延迟变化及系统配置影响。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02711 2026-05-15 cs.AI 92%

Dynamic Mixed-Precision Routing for Efficient Multi-step LLM Interaction

动态混合精度路由用于高效多步LLM交互

Yuanzhe Li, Jianing Deng, Jingtong Hu, Tianlong Chen, Song Wang, Huanrui Yang

机构 * University of Arizona(亚利桑那大学) University of Pittsburgh(匹兹堡大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Central Florida(佛罗里达中央大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出动态混合精度路由框架,通过自适应选择高精度与低精度LLM,在多步决策中实现准确率与成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14929 2026-05-15 cs.LG cs.AR 92%

A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models

一种面向硬件的、分层的后训练量化方法用于大语言模型

Earl Killian

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 本文提出了一种面向硬件的分层后训练量化方法,通过优化代码本和硬件效率,实现4.5-6位/权重的近无损精度,展示了小原子块与精心选择的精度可替代传统FP8。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13496 2026-05-14 cs.DC cs.LG 92%

MARLIN: Multi-Agent Game-Theoretic Reinforcement Learning for Sustainable LLM Inference in Cloud Datacenters

MARLIN:多智能体博弈强化学习用于云数据中心可持续LLM推理

H. Moore, S. Qi, D. Milojicic, C. Bash, S. Pasricha

机构 * Colorado State University(科罗拉多州立大学) Hewlett Packard Labs(惠普实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出MARLIN框架,通过博弈强化学习优化LLM推理的TTFT、碳排放、用水量和能耗,实现至少18%的TTFT、33%的碳排放、43%的用水量和11%的能耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01621 2026-05-13 cs.DC cs.AI 92%

DWDP: Distributed Weight Data Parallelism for High-Performance LLM Inference on NVL72

DWDP:分布式权重数据并行用于NVL72上的高性能LLM推理

Wanqian Li, Jintao Peng, Zongfei Jing, Tianyu Zhang, Ze Long, Xianjie Qiao, Xiaoming Chen, Dongxu Yang, Kefeng Duan, June Yang

机构 * NVIDIA

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DWDP,一种无需层间同步的分布式权重数据并行策略,通过跨peer GPU卸载MoE权重和按需获取缺失专家,提升LLM推理性能,实测在8K输入和1K输出序列长度下,端到端TPS/GPU提升8.8%。

Comments Technical Report. 17 pages. 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11582 2026-05-13 cs.CL 92%

Efficient LLM-based Advertising via Model Compression and Parallel Verification

通过模型压缩和并行验证实现高效的LLM广告

Wenxin Dong, Chang Gao, Guanghui Yu, Xuewu Jiao, Mingqing Hu, Qiang Fu, Peng Xu, Penghui Wei, Hui Xu, Yue Xing, Shuanglong Li, Lin Liu

机构 * Baidu Inc.(百度公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Efficient Generative Targeting框架,结合自适应分组量化、层适应性分层稀疏化和前缀树并行验证,提升LLM推理效率并保持生成质量,实验显示在真实广告场景中实现显著加速且质量损失可控。

Comments 10 pages, 7 figures, industry paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11581 2026-05-13 cs.CL 92%

Ada-MK: Adaptive MegaKernel Optimization via Automated DAG-based Search for LLM Inference

Ada-MK: 通过基于DAG的自动搜索实现适应性MegaKernel优化以用于LLM推理

Wenxin Dong, Mingqing Hu, Guanghui Yu, Qiang Fu, Peng Xu, Hui Xu, Yue Xing, Xuewu Jiao, Shuanglong Li, Lin Liu

机构 * Baidu Inc.(百度公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Ada-MK,通过基于DAG的自动搜索优化MegaKernel,减少共享内存峰值使用50%,消除运行时分支,提升LLM推理吞吐量和效率。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10124 2026-05-12 cs.NI cs.DC cs.IT cs.LG math.IT 92%

GELATO: Generative Entropy- and Lyapunov-based Adaptive Token Offloading for Device-Edge Speculative LLM Inference

GELATO:生成熵和李雅普诺夫基于的自适应令牌卸载用于设备-边缘推测LLM推理

Zengzipeng Tang, Yuxuan Sun, Wei Chen, Jianwen Ding, Bo Ai

机构 * School of Electronic and Information Engineering, Beijing Jiaotong University, Beijing 100044, China(北京交通大学电子与信息工程学院,北京,100044,中国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出GELATO框架,通过生成熵和李雅普诺夫方法优化设备-边缘协同推测LLM推理中的令牌卸载,提升吞吐量并降低能耗,优于现有方法。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02343 2026-05-12 cs.LG 92%

Toward General and Robust LLM-enhanced Text-attributed Graph Learning

迈向通用且稳健的LLM增强型文本属性图学习

Zihao Zhang, Xunkai Li, Rong-Hua Li, Zhenjun Li, Bing Zhou, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen Institute of Technology(深圳理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出UltraTAG框架,解决LLM与GNN交互中的统一优化问题,并通过UltraTAG-S应对现实中的文本和边稀疏性问题,实验表明其在不同稀疏度下均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08568 2026-05-12 cs.LG 92%

Different Prompts, Different Ranks: Prompt-aware Dynamic Rank Selection for SVD-based LLM Compression

不同提示,不同秩:基于SVD的LLM压缩的提示感知动态秩选择

Hengyi Zhu, Zhendong Mi, Grace Li Zhang, Shaoyi Huang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出PARSE框架,通过提示感知的动态秩选择提升SVD压缩LLM的效率与性能,实现任务准确率提升10%及推理速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20036 2026-05-12 cs.CL cs.SE 92%

ToolScope: Enhancing LLM Agent Tool Use through Tool Merging and Context-Aware Filtering

ToolScope: 通过工具合并和上下文感知过滤增强LLM代理的工具使用

Marianne Menglin Liu, Daniel Garcia, Fjona Parllaku, Vikas Upadhyay, Syed Fahad Allam Shah, Dan Roth

机构 * Oracle AI

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ToolScope通过自动校正的工具合并和上下文感知检索提升LLM代理的工具选择准确性,实验表明在三个顶级LLM和开源基准上提升了8.38%至38.6%的准确率。

Comments ACL Main Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05927 2026-05-11 cs.CL cs.SD eess.AS 92%

Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM

从输入侧最小化模态差距:你的语音大语言模型可以成为具有语调意识的文本大语言模型

Wenqian Cui, Xiao-Hui Li, Daxin Tan, Qiyong Zheng, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies(华为技术)

专题命中 效率与部署 :LLM(title,abstract);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TextPro-SLM,通过改进语音输入使其更接近具有语调意识的文本大语言模型,从而有效减少模态差距,实验表明其在3B和7B规模下表现最佳,且数据效率高。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏