arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1048 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1048 篇

2512.20968 2026-08-11 cs.DC cs.AI 版本更新 70%

Mesh-Attention: A New Communication-Efficient Distributed Attention with Improved Data Locality

Mesh-Attention: 一种新的通信高效分布式注意力机制,具有改进的数据本地性

Sirui Chen, Jingji Chen, Siqi Zhu, Ziheng Jiang, Yanghua Peng, Xuehai Qian

机构 * Tsinghua University(清华大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ByteDance Seed(字节跳动种子)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Mesh-Attention通过改进的数据本地性,提高了分布式注意力的通信效率和可扩展性,实验显示在大规模GPU上实现了显著的加速和通信量减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10903 2026-08-11 cs.AI 版本更新 70%

Multi-Granular Node Pruning for Causal Circuit Discovery

多粒度节点剪枝用于因果电路发现

Muhammad Umair Haider, Hammad Rizwan, Hassan Sajjad, A. B. Siddique

机构 * Department of Computer Science, University of Kentucky, USA(美国肯塔基大学计算机科学系) Department of Computer Science, Dalhousie University, Canada(加拿大达尔豪斯大学计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种节点级剪枝框架,通过可学习掩码和多粒度稀疏惩罚,在单次微调中从大语言模型中高效发现最小因果电路,节点更少且性能相当,内存占用降低5-10倍。

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19969 2026-08-11 cs.AI 版本更新 70%

M$^3$Prune: Hierarchical Communication Graph Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation

M$^3$Prune: 多模态多智能体分层通信图剪枝用于高效多模态多智能体检索增强生成

Weizi Shao, Taolin Zhang, Zijie Zhou, Chen Chen, Chengyu Wang, Xiaofeng He

机构 * East China Normal University(东华大学) Hefei University of Technology(合肥工业大学) China University of Petroleum(中国石油大学) Guangdong university of Finance & Economics(广东财经大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 M$^3$Prune通过分层通信图剪枝提升多模态多智能体检索增强生成的效率和性能。

Comments Critical flaw in Eq.(5)/Alg.1 (Sec 3.2): scoring fails Lipschitz continuity in multi-modal spaces, causing invalid hierarchy. Thus, latency/FLOPs in Tables 2&3 are overestimated & irreproducible. Core defect unfixable by minor update. Withdraw to avoid misleading; will revise theory & experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04904 2026-08-07 cs.CL 版本更新 70%

Strengthening Target-Language Features: SAE-Based Steering for Multilingual Inference

强化目标语言特征:基于SAE的多语言推理引导

Hongsheng Wang, Philipp Koehn

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对多语言大模型性能跨语言差异问题,提出基于SAE的推理时引导方法,通过注入目标语言特征提升模型在XCOPA、XNLI、MGSM等基准上的准确率。

Comments Corrected an author name. No changes to the paper content

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03529 2026-08-06 cs.CL 版本更新 70%

Consensus Measures for Unstructured Biomedical Text Annotations

非结构化生物医学文本标注的一致性度量

Pascal Wullschleger, Christian Kreis, Martin A. Walter, Jennifer Foster, Marc Pouly

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对生物医学非结构化文本标注的一致性量化难题,提出基于自然语言推理的折中度量方案,经实验验证多种语义等价度量的特性及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01867 2026-08-05 cs.CL 版本更新 70%

CRISP: Critical Step Perception for Training Efficient Deep Search Agents

CRISP:用于训练高效深度搜索智能体的关键步骤感知

Haosi Mo, Zihao Yan, Ruiqing Zhang, Zhongli Li, Hexuan Deng, Xuebo Liu, Min Zhang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对深度搜索智能体效率低的问题,提出CRISP框架,通过区分关键与冗余交互优化奖励,在保持准确率的同时,使BrowseComp和HLE-Verified上的交互回合分别减少15.1%和33.2%。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01034 2026-08-05 cs.CL 版本更新 70%

Opt.Gear Technical Report

Opt.Gear技术报告

Juneyoung Park, Youngwook Kwon

专题命中 效率与部署 :language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 Opt.Gear系列含多参数规模模型,采用混合架构优化KV缓存,数据效率高,支持多硬件部署,还推出可在MCU运行的Opt.Gear-1M,为边缘应用提供实用基础。

Comments [OptAI] OptGear Model Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29397 2026-08-05 cs.CL cs.PF 版本更新 70%

Studying quantization trade-offs for efficient inference deployment in machine translation

研究高效机器翻译推理部署中的量化权衡

Jim Zhao, Sohir Maskey, Koen Oostermeijer, Douglas Orr, Teryn Jones

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对EuroLLM和Hy-MT2等5款1.7B至22B的翻译模型,结合文档分块与W4A8/W8A8量化,发现量化效率与翻译质量的权衡还受分块策略影响,且Hy-MT2比EuroLLM更耐量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14010 2026-08-05 cs.CV cs.AI 版本更新 70%

A Deployment-Friendly Foundational Framework for Efficient Computational Pathology

一种适用于部署的高效计算病理学基础框架

Yu Cai, Cheng Jin, Zhengyu Zhang, Jiabo Ma, Fengtao Zhou, Yingxue Xu, Zhengrui Guo, Yihui Wang, Zhengyu Zhang, Ling Liang, Yonghao Tan, Pingcheng Dong, Du Cai, On Ki Tang, Chenglong Zhao, Zhijian Cen, Ying Tan, Xi Wang, Can Yang, Yali Xu, Jing Cui, Zhenhui Li, Ronald Cheong Kin Chan, Yueping Liu, Feng Gao, Xiuming Zhang, Li Liang, Hao Chen, Kwang-Ting Cheng

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Pathology, Nanfang Hospital, School of Basic Medical Sciences, Southern Medical University(病理学系,南芳医院,南方医科大学) Guangdong Province Key Laboratory of Molecular Tumor Pathology(广东省分子肿瘤病理学重点实验室) Jinfeng Laboratory, Chongqing, China(锦峰实验室,重庆,中国) Department of General Surgery (Colorectal Surgery), The Sixth Affiliated Hospital, Sun Yat-sen University(普外科(结直肠外科),中山大学第六附属医院)

专题命中 效率与部署 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 LitePath是一种高效计算病理学基础框架,通过压缩模型和自适应碎片选择器,显著降低计算成本,实现快速、节能的病理图像分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15782 2026-08-04 cs.AI cs.CV 版本更新 70%

Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware Inference

通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉

Pratheswaran Hariharan, Haiping Xu, Donghui Yan

机构 * University of Massachusetts, Dartmouth(马萨诸塞大学达特茅斯分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种检索增强的可靠性感知推理框架,利用外部视觉证据库和多个可靠性指标进行决策门控,在不重训练模型的情况下减少视觉幻觉,将接受预测准确率从85.84%提升至88.88%。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00811 2026-08-04 econ.EM cs.AI 版本更新 70%

Certificates without Electrons? Theory and Evidence on Impacts from AI-Driven Power Demand

没有电子的证书?AI驱动电力需求影响的理论与证据

Dana Golden, Aruna Balasubramanian, Niranjan Balasubramanian

机构 * Department of Economics, Stony Brook University(石溪大学经济系) Department of Computer Science, Stony Brook University(石溪大学计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过博弈论模型和自然实验,研究AI数据中心使用可再生能源证书和购电协议对电网可靠性、电价和排放的影响,发现证书无法解决时序错配问题,而共置储能可有效缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21027 2026-08-04 cs.AI 版本更新 70%

HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question Answering

HypEHR:基于超几何建模的电子健康记录用于高效问答

Yuyu Liu, Sarang Rajendra Patil, Mengjia Xu, Tengfei Ma

机构 * Department of Computer Science, Stony Brook University(石英布大学计算机科学系) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) Department of Biomedical Informatics, Stony Brook University(石英布大学生物医学信息学系)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 HypEHR通过超几何建模将电子健康记录中的代码、就诊和问题嵌入超几何空间,利用几何一致的交叉注意力和类型特定的指针头进行问答,预训练后在两个基准上实现高效问答。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26497 2026-08-03 cs.CL 版本更新 70%

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

哪种RAG范式在规模化场景下表现最优?检索增强生成范式的规模化研究

Pengyu Wang, Benfeng Xu, Shaohan Wang, Mingxuan Du, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(Metastone科技) Information Technology Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京农林科学院信息技术研究中心)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过28个嵌套语料层级的受控研究,对比四类RAG范式的规模化表现,发现BM25综合性能最优,Agent+BM25全规模准确率达69.4,图基RAG存在构建瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25266 2026-08-03 cs.CV cs.LG 版本更新 70%

FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding

FORGE:用于长视频理解的相关几何中的帧正交性

Ghazal Kaviani, Ghassan AlRegib

机构 * Georgia Institute of Technology(佐治亚理工学院) Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP)) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究长视频理解中推理时最大化查询相关信息问题,提出FORGE模型无关方法,通过在预训练嵌入空间引入查询条件几何统一相关性和多样性,实验证明该方法在关键帧选择和问答上有显著提升。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13657 2026-07-31 cs.LG 版本更新 70%

Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation

密集监督,稀疏更新:论策略蒸馏的稀疏性与几何结构

Guo Yu, Wenlin Liu, Yulan Hu, Hao-Xuan Ma, Jun-Peng Jiang, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 效率与部署 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文分析策略蒸馏(OPD)中参数更新的稀疏性和几何特性,发现更新稀疏且集中于小权重坐标,并验证了稀疏子网络的有效性。

Comments Code is available at https://github.com/SydCS/OPD-Param-Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14649 2026-07-31 cs.CL 版本更新 70%

GradMAP: Faster Layer Pruning with Gradient Metric and Projection Compensation

GradMAP: 更快的层剪枝与梯度度量和投影补偿

Hao Liu, Guangyan Li, Wensheng Zhang, Yongqiang Tang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GradMAP通过梯度度量和投影补偿实现更快的层剪枝,提升剪枝效率和性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25852 2026-07-30 cs.CL 版本更新 70%

AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding

AngelSpec:通过推测解码实现现实世界中的高性能推理

Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu

机构 * Tencent Inc.(腾讯公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究旨在通过推测解码实现高性能推理,提出AngelSpec统一训练框架,在训练、架构、推理层面解决异质性问题,其DFly框架提升了接受长度和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23597 2026-07-30 cs.CR cs.CL 版本更新 70%

HiTMS: A High-Throughput Multi-Stream Linguistic Steganography Framework

HiTMS:一个高通量多流语言隐写框架

Ruiyi Yan, Zhongliang Yang, Yugo Murawaki

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 HiTMS针对现有语言隐写术单流方案的局限,提出在多轮交互响应中分配秘密,通过批处理调用提高吞吐量,用自描述框架和密钥派生调度保证可恢复性,实验显示其速度提升且降低隐写分析器AUROC,并发增加时吞吐量持续提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07841 2026-07-28 cs.CL 版本更新 70%

An Efficient and Effective Evaluator for Text2SQL Models on Unseen and Unlabeled Data

面向未见和无标签数据的高效有效文本到SQL评估器

Trinh Pham, Thanh Tam Nguyen, Viet Huynh, Hongzhi Yin, Quoc Viet Hung Nguyen

机构 * Griffith University (Australia)(格里菲斯大学) Edith Cowan University (Australia)(埃德温·科温大学) The University of Queensland (Australia)(昆士兰大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FusionSQL通过分析自身输出模式,在无标签数据上高效评估Text2SQL模型的准确性,提升未见数据的质量检测能力。

Comments Accepted by ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01647 2026-07-27 cs.AI 版本更新 70%

Exploring Robust Multi-Agent Workflows for Environmental Data Management

探索环境数据管理的鲁棒多智能体工作流

Boyuan Guan, Jason Liu, Yanzhao Wu, Kiavash Bahreini

机构 * Florida International University(佛罗里达国际大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出EnviSmart系统,通过知识架构和角色分离的多智能体设计提升环境数据管理的可靠性和效率,验证了多智能体工作流在处理复杂环境数据任务中的优势。

Comments Accepted at PEARC 2026. 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11396 2026-07-24 cs.LG 版本更新 70%

MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization

MuonQ: 通过方向保真优化增强低比特穆子量化

Yupeng Su, Ruijie Zhang, Ziyue Liu, Yequan Zhao, Zheng Zhang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MuonQ通过预量化归一化、结构分解和μ-律扩展量化,实现稳定4比特穆子优化器状态量化,降低内存消耗并保持训练性能。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14372 2026-07-23 cs.AI 版本更新 70%

Content Creation with Spillovers: An Incentive Design Approach

具有溢出效应的竞赛:利用生成式人工智能激励内容创作

Sagi Ohayon, Boaz Taitler, Omer Ben-Porat

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CCS模型,解决GenAI时代内容创作中的溢出效应问题,通过参数化分配机制确保均衡存在,并提供强福利保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07466 2026-07-23 cs.CR cs.LG 版本更新 70%

Trusting What You Cannot See: Auditable Fine-Tuning and Inference for Proprietary AI

信任你无法看到的东西:可审计的微调与推理用于专有AI

Heng Jin, Chaoyu Zhang, Hexuan Yu, Shanghao Shi, Ning Zhang, Y. Thomas Hou, Wenjing Lou

机构 * Virginia Tech(弗吉尼亚理工学院) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 AFTUNE通过可审计和可验证的框架,确保云上微调和推理的计算完整性,实现可信模型服务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26667 2026-07-22 cs.IR cs.AI 版本更新 70%

M-RAG: Semantic Key-Value Indexing for Retrieval-Augmented Generation

M-RAG:使RAG更快、更强和更高效

Xu Sun, Tongkai Xu, Baiheng Xie, Li Huang, Qiang Gao, Kunpeng Zhang

机构 * Southwestern University of Finance and Economics(西南财经大学) Zhida AI, Zhida Technology(智达AI,智达科技) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 M-RAG提出一种无片段检索策略,通过提取结构化元标记提升检索与生成效率,实验证明其在低资源环境下优于传统RAG方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01515 2026-07-22 cs.RO cs.LG 版本更新 70%

RAPT: Model-Predictive Out-of-Distribution Detection and Failure Diagnosis for Sim-to-Real Humanoid Deployment

RAPT:面向真实人类机器人的模型预测异常检测与故障诊断

Humphrey Munn, Brendan Tidd, Peter Bohm, Marcus Gallagher, David Howard

机构 * School of Electrical Engineering and Computer Science, University of Queensland(电气工程与计算机科学学院,昆士兰大学) CSIRO Robotics, Data61(CSIRO机器人,Data61)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 RAPT通过模型预测异常检测和故障诊断技术,提升人形机器人在仿真到现实转移中的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25693 2026-07-21 cs.AI 版本更新 70%

RADD: Retrieval-Augmented Discrete Diffusion for Multi-Modal Knowledge Graph Completion

RADD:基于检索的离散扩散用于多模态知识图谱补全

Guanglin Niu, Bo Li

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出RADD框架,通过分离检索与重排序过程,提升多模态知识图谱补全的性能,实验表明其在多个基准上表现最佳。

Comments 13 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02025 2026-07-21 cs.DB cs.LG 版本更新 70%

Hippasus: Effective and Efficient Automatic Feature Augmentation for Machine Learning Tasks on Relational Data

Hippasus:用于关系数据上机器学习任务的有效且高效的自动特征增强

Serafeim Papadias, Kostas Patroumpas, Dimitrios Skoutas

机构 * Athena Research Center(阿提卡研究中心)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 Hippasus通过结合统计信号和语义推理,高效提升关系数据机器学习任务中的特征增强效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20083 2026-07-21 cs.CR cs.CL 版本更新 70%

DisarmRAG: Stealthy Retriever-Centric Poisoning to Disable Self-Correction in Retrieval-Augmented Generation (Extended Version)

DisarmRAG:以检索器为中心的隐秘中毒攻击,以禁用检索增强生成中的自我纠正(扩展版)

Yanbo Dai, Zhenlan Ji, Zongjie Li, Kuan Li, Shuai Wang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对实际部署中LLMs自我纠正能力削弱RAG攻击效果的问题,提出DisarmRAG这一专注检索器的新型中毒范式,构建含迭代协同优化与对比学习技术的攻击框架,经多模型和基准测试验证其有效性及隐秘性。

Comments This paper is an extended version of our original paper accepted by ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11459 2026-07-21 cs.CL cs.CV 版本更新 70%

Octopus v3: Technical Report for On-device Sub-billion Multimodal AI Agent

章鱼v3:用于设备端低于十亿参数的多模态人工智能代理的技术报告

Wei Chen, Zhiyuan Li

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对多模态人工智能代理将图像数据转化为可行动结果的挑战,引入含功能令牌概念的多模态模型,优化至小于10亿参数,能处理中英文,可在多种边缘设备高效运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09172 2026-07-20 cs.SE cs.AI cs.PF 版本更新 70%

Attention to Detail: Evaluating Energy, Performance, and Accuracy Trade-offs Across vLLM Configurations

关注细节:评估跨vLLM配置的能量、性能和准确性权衡

Nada Zine, Tristan Coignion, Vincenzo Stoico, Clément Quinton, Ivano Malavolta, Romain Rouvoy, Patricia Lago

机构 * Univ. Lille, CNRS, Inria(里尔大学、国家科学研究中心、法国国家信息与自动化研究所) Univ. Bordeaux, CNRS, LaBRI(波尔多大学、国家科学研究中心、LaBRI) Univ. Lille, CNRS, Inria, IUF(里尔大学、国家科学研究中心、法国国家信息与自动化研究所、国际大学联盟)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对vLLM的注意力内核类型、前缀缓存和分块预填充三个配置选项,在多种语言模型和推理任务中进行大规模评估,分析其对能耗、性能和准确性的影响,发现配置选项影响显著且因模型和工作负载而异,模型选择主导全局,配置调整提供局部改进。

Comments Submitted at a conference

详情

展开后加载摘要…

URL PDF HTML 收藏