arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-28 至 2026-04-28 共收录 96 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 96 篇

2604.23263 2026-04-28 cs.CL cs.AI 94%

Small Language Model Helps Resolve Semantic Ambiguity of LLM Prompt

小语言模型帮助解决LLM提示的语义歧义

Zhenzhen Huang, Chaoning Zhang, Fachrina Dewi Puspitasari, Jiaquan Zhang, Yitian Zhou, Shuxu Chen, Yang Yang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Department of Electronic Engineering, Kyung Hee University(庆熙大学电子工程系)

专题命中 效率与部署 :LLM(title,title_cn);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 本文提出通过显式提示消歧机制解决LLM提示的语义歧义问题,利用小语言模型高效计算提升推理性能,实验表明方法在多个基准上提升2.5点,成本仅0.02美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23795 2026-04-28 cs.CR 94%

LLM-CEG: Extending the Classification Error Gauge Framework for Privacy Auditing of Large Language Models

LLM-CEG:扩展分类误差量规框架以进行大型语言模型的隐私审计

Kato Mivule

专题命中 效率与部署 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract)

AI总结 本文将分类误差量规框架扩展至大型语言模型的隐私审计,提出LLM-CEG框架,通过成员推断攻击成功率和模型困惑度作为隐私和效用指标,迭代调整差分隐私参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10666 2026-04-28 cs.CL cs.AI cs.LG 93%

Green Prompting: Characterizing Prompt-driven Energy Costs of LLM Inference

绿色提示:字符化提示驱动的LLM推理能耗

Marta Adamska, Daria Smirnova, Hamid Nasiri, Zhengxin Yu, Peter Garraghan

机构 * School of Computing and communications(计算与通信学院)

专题命中 效率与部署 :LLM(title,title_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 研究通过实验分析不同提示和响应特征对LLM推理能耗的影响,发现任务语义和关键词对能耗有显著影响,提示设计优化可提升推理效率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24636 2026-04-28 cs.SE cs.AI cs.CL 93%

Less Is More: Engineering Challenges of On-Device Small Language Model Integration in a Mobile Application

少即是多:在移动应用中集成设备端小型语言模型的工程挑战

William Oliveira

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn)

AI总结 本文研究了在移动应用中集成设备端小型语言模型(SLMs)的工程挑战,通过案例研究发现,尽管SLMs能提供离线隐私AI体验,但实际应用中需接受'LLM做最少'的约束,提出八条设计指导原则。

Comments 28 pages, 8 tables, 17 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23623 2026-04-28 cs.AI 92%

Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning

Tandem: 大小语言模型协同以实现高效的推理

Zichuan Fu, Xian Wu, Guojing Li, Yejing Wang, Yijun Chen, Zihao Zhao, Yixuan Luo, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Renmin University of China(中国人民大学) Westlake University(西湖大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 Tandem通过结合大语言模型和小语言模型,减少计算成本并提升推理质量,实验表明其在数学推理和代码生成任务中性能优越。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23467 2026-04-28 cs.LG cs.AI cs.AR 92%

Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference

混合JIT-CUDA图优化用于低延迟大语言模型推理

Divakar Kumar Yadav, Tian Zhao

机构 * Department of Computer Science(计算机科学系) University of Wisconsin-Milwaukee(威斯康星大学密尔沃基分校) Milwaukee, WI, USA(美国威斯康星州密尔沃基)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合运行时框架,结合JIT编译与CUDA图执行,以降低启动开销并保持自回归解码的运行时灵活性,通过静态组件和动态组件的分离,有效减少短序列LLM推理的延迟和方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00978 2026-04-28 cs.CL 92%

AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

AWQ:基于激活的权重量化用于LLM压缩与加速

Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Wei-Ming Chen, Wei-Chen Wang, Guangxuan Xiao, Xingyu Dang, Chuang Gan, Song Han

机构 * MIT(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) NVIDIA(英伟达) Tsinghua University(清华大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出AWQ方法,通过识别重要权重通道减少量化误差,实现低比特权重量化,提升LLM的压缩与加速性能,并在多个基准测试中表现优异。

Comments MLSys 2024 Best Paper Award. Code available at: https://github.com/mit-han-lab/llm-awq

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22906 2026-04-28 cs.DC 92%

Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities

大型语言模型的网络边缘推断:原理、技术与机遇

Zhixiong Chen, Bingjie Zhu, Jiangzhou Wang, Hyundong Shin, Arumugam Nallanathan, Dusit Niyato

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文探讨了大型语言模型在边缘网络中的推断挑战,综述了系统架构、模型优化与资源管理等最新进展,旨在提升边缘环境下的LLM性能。

Comments Accepted as a ACM Computing Surveys 2026 paper

Journal ref ACM Computing Surveys, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21829 2026-04-28 cs.CR 91%

Black-Box Skill Stealing Attack from Proprietary LLM Agents: An Empirical Study

从专有LLM代理中黑盒技能窃取攻击:实证研究

Zihan Wang, Rui Zhang, Yu Liu, Chi Liu, Qingchuan Zhao, Hongwei Li, Guowen Xu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文实证研究了针对LLM代理系统的黑盒技能窃取攻击,发现技能窃取比传统提示窃取更具危害性,通过自动化攻击生成框架评估了商业代理平台和LLM,提出防御机制以降低技能泄露风险。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23530 2026-04-28 cs.CL cs.AI 90%

MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings

MTRouter: 带成本意识的多轮LLM路由与历史-模型联合嵌入

Yiqun Zhang, Hao Li, Zihan Wang, Shi Feng, Xiaocui Yang, Daling Wang, Bo Zhang, Lei Bai, Shuyue Hu

机构 * School of Computer Science and Engineering, Northeastern University Shenyang 110819, China(东北大学计算机科学与工程学院,中国沈阳110819) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MTRouter,通过联合历史-模型嵌入和学习轨迹预测器,提升多轮任务的性能-成本平衡,实验显示在ScienceWorld和Humanity's Last Exam上均取得显著成本降低与性能提升。

Comments This work has accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07709 2026-04-28 cs.AI 90%

MAGELLAN: Metacognitive predictions of learning progress guide autotelic LLM agents in large goal spaces

MAGELLAN:元认知预测学习进度指导自主LLM代理在大规模目标空间中学习

Loris Gaven, Thomas Carta, Clément Romac, Cédric Colas, Sylvain Lamprier, Olivier Sigaud, Pierre-Yves Oudeyer

机构 * Department of XXX, University of YYY, Location, Country(XXX部门,YYYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Inria (Flowers), University of Bordeaux, France(Inria(Flowers),波尔多大学,法国) MIT, Computational Cognitive Science Lab, Cambridge, MA, USA(麻省理工学院,计算认知科学实验室,马萨诸塞州剑桥,美国)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 MAGELLAN通过元认知预测学习进度,使LLM代理在大规模目标空间中高效优先目标,提升学习效率和适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23141 2026-04-28 cs.CR cs.AI 90%

UNSEEN: A Cross-Stack LLM Unlearning Defense against AR-LLM Social Engineering Attacks

UNSEEN: 一种跨栈LLM去学习防御对抗AR-LLM社会工程攻击

Tianlong Yu, Yang Yang, Xiao Luo, Lihong Liu, Fudu Xing, Zui Tao, Kailong Wang, Gaoyang Liu, Ting Bi

机构 * Hubei University(湖北大学) University of Southern California(南加州大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对AR-LLM社会工程攻击,提出UNSEEN跨栈防御机制,结合AR访问控制层、基于F-RMU的LLM去学习和运行时代理防护,通过用户研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22939 2026-04-28 cs.CL cs.AI cs.CV cs.IR 90%

Self Knowledge Re-expression: A Fully Local Method for Adapting LLMs to Tasks Using Intrinsic Knowledge

自知重述:一种完全局部的方法,用于通过内在知识适应LLM到任务

Mengyu Wang, Xiaoying Zhi, Zhiyi Li, Robin Schmucker, Shay B. Cohen, Tiejun Ma, Fran Silavong

机构 * The University of Edinburgh(爱丁堡大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SKR方法,通过将LLM的输出从通用token生成转变为高效任务特定表达,提升非生成任务性能,实验显示在信息检索、目标检测和异常检测任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24542 2026-04-28 cs.CR cs.AI cs.CL 89%

Layerwise Convergence Fingerprints for Runtime Misbehavior Detection in Large Language Models

用于大语言模型运行时恶意行为检测的分层收敛指纹

Nay Myat Min, Long H. Pham, Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 本文提出LCF方法,通过分析神经网络层间隐藏状态轨迹来检测运行时恶意行为,无需参考模型或重训练,有效降低攻击成功率并高检测率识别多种威胁。

Comments 34 pages, 5 figures. Code: https://github.com/NayMyatMin/LCF-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07237 2026-04-28 cs.LG cs.AI 88%

GWT: Scalable Optimizer State Compression for Large Language Model Training

GWT: 大规模语言模型训练中的可扩展优化器状态压缩

Ziqing Wen, Ping Luo, Jiahuan Wang, Kun Yuan, Dongsheng Li, Tao Sun

机构 * National Key Laboratory of Parallel and Distributed Computing(并行与分布式计算国家重点实验室) National University of Defense Technology(国防科技大学) Center for Machine Learning Research(机器学习研究中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GWT,一种基于小波变换的优化器状态压缩方法,有效减少内存开销,同时保持模型精度,适用于大规模预训练和任务微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22817 2026-04-28 eess.AS cs.CL cs.LG cs.SD 88%

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions

In-Sync: 语音感知大语言模型在ASR中的适应性改进:基于词级时间戳预测

Xulin Fan, Vishal Sunder, Samuel Thomas, Mark Hasegawa-Johnson, Brian Kingsbury, George Saon

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research(IBM研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过词级时间戳预测提升ASR性能,采用轻量训练策略增强对齐鲁棒性,实验证明在多个数据集上提升了时间戳准确性和整体ASR表现。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23838 2026-04-28 cs.LG 88%

JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training

JigsawRL:构建高效的LLM后训练强化学习流水线

Zhengding Hu, Hehua Ouyang, Chang Chen, Zaifeng Pan, Yue Guan, Zhongkai Yu, Zhen Wang, Steven Swanson, Yufei Ding

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(title,title_cn);post-training(title);分类 cs.LG

AI总结 JigsawRL通过动态资源分配和图调度策略,提升强化学习流水线效率,实现异步和同步任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22768 2026-04-28 cs.CY cs.CL 88%

Secure On-Premise Deployment of Open-Weights Large Language Models in Radiology: An Isolation-First Architecture with Prospective Pilot Evaluation

面向放射学的开放权重大语言模型本地部署安全方案:一种优先隔离的架构及其前瞻性试点评估

Sebastian Nowak, Jann-Frederick Laß, Narine Mesropyan, Babak Salam, Nico Piel, Mohammed Bahaaeldin, Wolfgang Block, Alois Martin Sprinkart, Julian Alexander Luetkens, Benjamin Wulff, Alexander Isaak

机构 * Department of Diagnostic and Interventional Radiology, University Hospital Bonn(诊断与介入放射科,波恩大学医院) Department of Research-IT, University Hospital Bonn(研究-IT部门,波恩大学医院)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出一种优先隔离的架构,用于在放射学领域安全部署开放权重大语言模型,通过严格的网络隔离和权限控制,验证了其在临床实用性和技术可行性上的表现。

Comments 39 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01897 2026-04-28 cs.LG cs.IT math.IT math.OC 88%

MLorc: Momentum Low-rank Compression for Memory Efficient Large Language Model Adaptation

MLorc: 动量低秩压缩用于内存高效的大型语言模型适应

Wei Shen, Zhang Yaxiang, Minhui Huang, Mengfan Xu, Jiawei Zhang, Cong Shen

机构 * University of Virginia(弗吉尼亚大学) National University of Singapore(新加坡国立大学) Meta University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出MLorc方法,通过压缩和重建矩阵参数动量以降低内存消耗,相比LoRA和GaLore在内存效率和训练动态保留方面更优,理论和实验均验证其有效性。

Comments AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23277 2026-04-28 cs.CL cs.AI 88%

From Similarity to Structure: Training-free LLM Context Compression with Hybrid Graph Priors

从相似性到结构:基于混合图先验的训练自由LLM上下文压缩

Yitian Zhou, Chaoning Zhang, Jiaquan Zhang, Zhenzhen Huang, Jinyu Guo, Sung-Ho Bae, Lik-Hang Lee, Caiyan Qin, Yang Yang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Department of Computer Science and Engineering, Kyung Hee University(Kyung Hee大学计算机科学与工程系) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业与系统工程系) School of Robotics and Advanced Manufacture, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区机器人与先进制造学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种无需训练的上下文压缩框架,利用混合图先验选择句子,通过构建稀疏句子图、提取主题骨架并结合可解释评分进行冗余抑制,实验证明在长文档基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13288 2026-04-28 cs.CL 87%

A BERTology View of LLM Orchestrations: Token- and Layer-Selective Probes for Efficient Single-Pass Classification

BERTology视角下的大语言模型编排:基于令牌和层的选择性探针用于高效单次分类

Gonzalo Ariel Meyoyan, Luciano Del Corro

机构 * Departamento de Computación, FCEyN Universidad de Buenos Aires(布宜诺斯艾利斯大学计算机系) ELIAS Lab, Departamento de Ingeniería Universidad de San Andres(圣安德烈斯大学工程系ELIAS实验室)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.CL

AI总结 本文提出基于BERTology方法的LLM编排框架,通过令牌和层选择性探针实现高效单次分类,提升安全性和情感分类性能,同时保持接近服务延迟并避免额外的VRAM和延迟成本。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23950 2026-04-28 cs.CV 87%

LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models

LearnPruner: 重新思考基于注意力的视觉语言模型中令牌修剪

Rinyoichi Takezoe, Yaqian Li, Zihao Bo, Anzhou Hou, Mo Guang, Kaiwen Long

机构 * Li Auto Inc.(利自动公司)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文提出LearnPruner,通过两阶段令牌修剪框架在视觉语言模型中实现高效修剪,保留95%性能的同时减少5.5%视觉令牌使用,提升3.2倍推理速度。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23640 2026-04-28 cs.IR 87%

Prompt-Unknown Promotion Attacks against LLM-based Sequential Recommender Systems

针对基于大语言模型的序列推荐系统的提示未知推广攻击

Yuchuan Zhao, Tong Chen, Junliang Yu, Zongwei Wang, Lizhen Cui, Hongzhi Yin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究提出在攻击者无法获取系统提示和受害者模型的情况下,通过进化优化策略生成有效替代模型,实现对目标物品的推广攻击,实验表明该方法在提升冷门物品曝光方面优于现有方法。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22935 2026-04-28 cs.CR 87%

Secure eFPGA-Enabled Edge LLM Inference: Architectural and Hardware Countermeasures

安全的eFPGA启用边缘LLM推断:架构和硬件防护措施

Voktho Das, M Zafir Sadik Khan, Jafar Vafaei, Kimia Azar, Hadi Kamali

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出一种混合ASIC+eFPGA架构,结合ASIC的效率和eFPGA的灵活性,通过动态运行监控、侧信道缓解和部署后修补等机制,提升边缘LLM推断系统的安全性和抗攻击能力。

Comments This paper will be presented at IEEE VLSI Test Symposium (VTS) 2026 (Special Session)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23711 2026-04-28 cs.CR 86%

Spore: Efficient and Training-Free Privacy Extraction Attack on LLMs via Inference-Time Hybrid Probing

Spore:通过推理时间混合探测实现高效的隐私提取攻击

Yu Cui, Ruiqing Yue, Hang Fu, Sicheng Pan, Zhuoyu Sun, Baohan Huang, Haibin Zhang, Cong Zuo, Licheng Wang

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Spore攻击,通过推理时间混合探测实现对LLM内存的隐私提取,无需训练,适用于黑盒和灰盒环境,具有高效查询和高信息泄露率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24008 2026-04-28 cs.LG 85%

Coverage-Based Calibration for Post-Training Quantization via Weighted Set Cover over Outlier Channels

基于覆盖的后训练量化校准:通过加权覆盖处理异常通道

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(伊阿华州立大学计算机科学系) Department of Civil, Construction & Environmental Engineering, Iowa State University(伊阿华州立大学土木、建设与环境工程系)

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过加权覆盖异常通道来改进后训练量化校准,解决校准样本未能激活异常通道导致的动态范围低估问题,提出 COVERCAL 算法在多种模型和评估中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01579 2026-04-28 cs.CL cs.AI 85%

AdaComp: Extractive Context Compression with Adaptive Predictor for Retrieval-Augmented Large Language Models

AdaComp: 基于自适应预测器的提取式上下文压缩用于检索增强型大语言模型

Qianchi Zhang, Hainan Zhang, Liang Pang, Hongwei Zheng, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) School of Artificial Intelligence, Beihang University(北航人工智能学院) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出AdaComp,一种低开销的提取式上下文压缩方法,通过自适应确定压缩率来平衡RAG的效率与性能,实验表明其在保持性能的同时显著降低了推理成本。

Comments Accepted to KSEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13903 2026-04-28 cs.CR cs.AI cs.DC 84%

CoreGuard: Safeguarding Foundational Capabilities of LLMs Against Model Stealing in Edge Deployment

CoreGuard: 保障边缘部署中大语言模型的基础能力免受模型窃取攻击

Qinfeng Li, Tianyue Luo, Xuhong Zhang, Yangfan Xie, Zhiqiang Shen, Lijun Zhang, Yier Jin, Hao Peng, Xinkui Zhao, Xianwei Zhu, Jianwei Yin

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Washington University in St. Louis(圣路易斯华盛顿大学) University of Science and Technology of China(中国科学技术大学) College of Computer Science and Technology, Zhejiang Normal University(浙江师范大学计算机科学与技术学院) China Electronics Technology Design and Research Institute(中国电子技术设计与研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CoreGuard,一种高效的边缘部署LLM保护方法,通过减少计算和通信开销实现上界安全保护,防止模型窃取和滥用。

Comments Accepted by NeurIPS 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23577 2026-04-28 cs.CL cs.LG 84%

RouteNLP: Closed-Loop LLM Routing with Conformal Cascading and Distillation Co-Optimization

RouteNLP: 带有符合性级联和蒸馏协同优化的闭环大语言模型路由

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 RouteNLP通过闭环框架优化大语言模型在多样化NLP任务中的路由,减少成本并满足任务质量约束,通过级联和蒸馏协同优化实现显著成本降低。

Comments Accepted at ACL 2026 Industry Track. 13 pages, 2 figures, 15 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22681 2026-04-28 cs.CR 83%

CacheTrap: Unveiling a Stealthier Gray-Box Trojan against LLMs

CacheTrap: 揭示一种更隐蔽的灰盒后门攻击 against LLMs

Mohaiminul Al Nahian, Abeer Matar A. Almalky, Gamana Aragonda, Ranyang Zhou, Sabbir Ahmed, Dmitry Ponomarev, Li Yang, Shaahin Angizi, Adnan Siraj Rakin

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CacheTrap,一种针对LLM键值缓存的灰盒后门攻击,通过单比特翻转触发目标行为,无需修改输入或模型权重,实验显示100%攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏