arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22116 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22116 篇

2505.16312 2026-06-23 cs.AI cs.CL 版本更新 92%

EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning

EquivPruner:通过动作剪枝提升基于LLM的搜索效率与质量

Jiawei Liu, Qisi Chen, Jianshu Zhang, Quan Liu, Defu Lian

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) iFLYTEK Research(iFLYTEK研究院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM搜索中语义等价步骤导致的大量冗余消耗,提出EquivPruner方法,通过剪枝等价动作提升效率,并创建数学等价数据集MathEquiv训练轻量检测器,在多种任务中显著减少token消耗并提高准确性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19344 2026-06-19 cs.CL cs.AI 新提交 92%

Exposing the Unsaid: Visualizing Hidden LLM Bias through Stochastic Path Aggregation

揭示未言明之事:通过随机路径聚合可视化隐藏的LLM偏见

Matteo Pelossi, Rita Sevastjanova, Thilo Spinner, Mennatallah El-Assady

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TreeTracer工具,通过系统扰动分析、语法对齐聚合和分类感知节点合并,利用桑基图对比不同语义上下文,揭示LLM中隐藏的代表性和句法偏见。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17489 2026-06-17 cs.LG cs.AI 新提交 92%

Online LLM Selection via Constrained Bandits with Time-Varying Demand

基于时变需求的约束赌博机在线LLM选择

Yin Huang, Qingsong Liu, Jie Xu

机构 * Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系) Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校曼宁信息与计算机科学学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对边缘云推理系统中异构LLM的选择问题,提出一种基于置信界估计和需求预测的在线学习算法,在硬预算和软延迟约束下实现亚线性遗憾和约束违反。

Comments 11 pages, 3 figures with multiple subfigures, 1 table, submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16352 2026-06-16 cs.LG cs.AI 新提交 92%

Communication-Efficient Verifiable Attention for LLM Inference

面向LLM推理的高效通信可验证注意力机制

Ziqun Chen, Ming Wu, Michael Heinrich, Jason Zeng, Huiying Lan, Tianwei Zhang, Rui Tan

机构 * Nanyang Technological University(南洋理工大学) Zero Gravity Labs(零重力实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出VeriAttn,通过将注意力计算卸载到GPU并由TEE验证,结合两阶段流水线和分区策略,显著降低TEE计算和通信开销,实现LLM推理加速。

Comments 19 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24079 2026-06-12 cs.CL cs.AI 版本更新 92%

The Pragmatic Persona: Discovering LLM Persona through Bridging Inference

实用人格:通过桥接推理发现LLM人格

Jisoo Yang, Jongwon Ryu, Minuk Ma, Trung X. Pham, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, 06974, Republic of Korea(Chung-Ang大学人工智能系) Department of Computer Science, University of British Columbia, Vancouver, BC V6T 1Z4, Canada(不列颠哥伦比亚大学计算机科学系) Van Lang University, Ho Chi Minh City, Vietnam(文-lang大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出基于桥接推理的框架,通过构建话语级知识图谱捕捉LLM对话中的隐含语义关联,实现从话语连贯性层面发现稳定人格特征,优于基于频率或风格的基线方法。

Comments 15 pages, 4 figures, accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09080 2026-06-09 cs.LG cs.CL 新提交 92%

Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy

超越FLOPs:基于GEMM中心分类法的LLM剪枝真实推理加速基准测试

Haozhe Hu, Hao Wu, Anhao Zhao, Longwei Ding, Peiran Yin, Yunpu Ma, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东方理工大学(宁波)) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Munich Center for Machine Learning, LMU Munich(慕尼黑大学机器学习慕尼黑中心)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种基于GEMM维度的剪枝方法分类法,通过统一基准框架系统评估不同剪枝方法在加速-质量帕累托前沿上的表现,发现静态深度剪枝在低质量损失下最优,为LLM剪枝加速提供统一视角。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27786 2026-06-09 cs.LG cs.AI 版本更新 92%

Locality-Aware Redundancy Pruning for LLM Depth Compression

面向LLM深度压缩的局部感知冗余剪枝

Vincent-Daniel Yun, Youngrae Kim, Woosang Lim, YoungJin Heo, Minkyu Kim, Sunwoo Lee

机构 * University of Southern California(美国南加州大学) Neural Superintelligence Lab, MODULABS(MODULABS神经超级智能实验室) Seoul National University(首尔国立大学) Inha University(釜山大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LoRP,一种基于表示局部性的无训练单次深度剪枝框架,通过引入表示局部性分数(RLS)来识别和剪除冗余层,在多种LLM上提升了困惑度和下游任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07098 2026-06-08 cs.CL cs.LG 新提交 92%

SigmaScale: LLM Compression with SVD-based Low-Rank Decomposition and Learned Scaling Matrices

SigmaScale: 基于SVD低秩分解和学习缩放矩阵的LLM压缩

Ernests Lavrinovics, Marco Letizia, Roy Janco, Shai Segal, Johannes Bjerva, Maurizio Pierini

机构 * Department of Computer Science, Aalborg University Copenhagen(奥尔堡大学哥本哈根分校计算机科学系) MaLGa-DIBRIS, University of Genoa(热那亚大学MaLGa-DIBRIS) INFN, Sezione di Genova(国家核物理研究所热那亚分部) European Organization for Nuclear Research (CERN)(欧洲核子研究中心) Ceva, Inc.(Ceva公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出SigmaScale方法,通过学习辅助缩放矩阵优化截断SVD的LLM压缩,降低权重矩阵有效秩,在Llama 3.1 8B和Qwen3-8B上达到竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05544 2026-06-05 cs.CL cs.LG 92%

Activation-Informed Pareto-Guided Low-Rank Compression for Efficient LLM/VLM

基于激活信息的帕累托引导低秩压缩用于高效LLM/VLM

Ryan Solgi, Parsa Madinei, Jiayi Tian, Rupak Swaminathan, Jing Liu, Nathan Susanj, Zheng Zhang

机构 * University of California-Santa Barbara(加州大学圣芭芭拉分校) Amazon(亚马逊)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于激活信息的帕累托引导低秩压缩方法,通过理论分析和算法设计,在保持模型精度的同时提升LLM和VLM的压缩效率和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02559 2026-06-02 cs.CL cs.AI 92%

From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

从层到子模块:重新思考基于替换的LLM压缩中的粒度

Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca

机构 * University of Trento(特伦托大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出子模块级别的非连续替换压缩方法SubFit,通过为注意力和前馈子模块分别设计轻量残差旁路,在多种LLM上实现更好的困惑度-准确率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31164 2026-06-01 cs.CL cs.AI 92%

D$^3$: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training

D$^3$: 面向LLM训练的动态有向图约束数据调度

Yuanjian Xu, Jianing Hao, Guang Zhang, Zhong Li

机构 * Microsoft Research(微软研究院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出D$^3$框架,通过动态有向图建模训练单元间的有向影响关系,并求解约束优化问题以确定训练顺序,从而提升LLM预训练和后训练阶段的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08014 2026-05-28 cs.CL cs.AI cs.CY 92%

Mass-Scale Analysis of In-the-Wild Conversations Reveals Complexity Bounds on LLM Jailbreaking

大规模真实对话分析揭示LLM越狱的复杂性界限

Aldan Creo, Raul Castro Fernandez, Manuel Cebrian

机构 * Valencian Research Institute for Artificial Intelligence (VRAIN), Universitat Politècnica de València, Valencia, Spain.(瓦伦西亚人工智能研究 institute,瓦伦西亚理工大学,西班牙瓦伦西亚) Department of Computer Science, The University of Chicago, Chicago, USA(计算机科学系,芝加哥大学,美国芝加哥) Center for Automation and Robotics, Spanish National Research Council, Madrid, Spain(自动化与机器人中心,西班牙国家研究委员会,西班牙马德里)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过分析超过200万条真实对话,发现越狱尝试的复杂性并不显著高于正常对话,且攻击复杂性随时间保持稳定,表明LLM安全演化受人类创造力限制。

Comments Code: https://github.com/ACMCMC/risky-conversations Results: https://huggingface.co/risky-conversations Visualizer: https://huggingface.co/spaces/risky-conversations/Visualizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06843 2026-05-27 cs.CL cs.AI 92%

Self-signals Driven Multi-LLM Debate for Efficient and Accurate Reasoning

自信号驱动的多LLM辩论以实现高效准确的推理

Xuhang Chen, Zhifan Song, Deyi Ji, Shuo Gao, Lanyun Zhu

机构 * University of Cambridge(剑桥大学) Sorbonne Université(索邦大学) University of Science and Technology of China(中国科学技术大学) Beihang University(北航大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种利用模型级置信度和token级语义焦点两种自信号来自适应引导多LLM辩论过程的方法,在提高准确性的同时减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23057 2026-05-25 cs.LG cs.CL cs.PF 92%

ModeSwitch-LLM: A Lightweight Phase-Aware Controller for Cross-Mode LLM Inference on a Single GPU

ModeSwitch-LLM:单GPU上跨模式LLM推理的轻量级阶段感知控制器

Aman Sunesh, Ali Alshehhi, Hivansh Dhakne

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校) New York University(纽约大学) United States(美国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种轻量级请求边界控制器ModeSwitch-LLM,通过基于工作负载特征在FP16、量化、推测解码等推理模式间路由请求,在单GPU上实现平均延迟加速2.10倍、每token能耗降低51.7%,且精度几乎无损。

Comments 10 pages main text, 11 pages including references, 5 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22205 2026-05-22 cs.AI cs.LG 92%

Skill Weaving: Efficient LLM Improvement via Modular Skillpacks

技能编织:通过模块化技能包实现高效的LLM改进

Zhuo Li, Guodong Du, Zesheng Shi, Weiyang Guo, Weijun Yao, Yuan Zhou, Jiabo Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University(香港理工大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Shanghai Jiaotong University(上海交通大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出SkillWeave框架,通过模块化技能包使LLM在固定内存预算下实现领域专业化,通过SkillZip压缩技术实现高效部署,实验表明其在多任务和代理基准上表现优异,速度提升达4倍。

Comments Accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22054 2026-05-22 cs.LG cs.AI 92%

LABO: LLM-Accelerated Bayesian Optimization through Broad Exploration and Selective Experimentation

LABO: 通过广泛探索和选择性实验实现的LLM加速贝叶斯优化

Zhuo Chen, Xinzhe Yuan, Jianshu Zhang, Jinzong Dong, Ruichen Zhou, Yingchun Niu, Tianhang Zhou, Yu Yang Fredrik Liu, Yuqiang Li, Nanyang Ye, Qinying Gu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院) Institute for Advanced Study in Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学研究所) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Automation, Central South University(中南大学自动化学院) College of New Energy and Materials, China University of Petroleum, Beijing(中国石油大学(北京)新能源与材料学院) College of Carbon Neutrality Future Technology, China University of Petroleum, Beijing(中国石油大学(北京)碳中和未来技术学院) DeepVerse PTE. LTD.

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LABO框架,通过结合LLM预测与实验观测,在贝叶斯优化中实现更高效的样本优化,理论分析和实验结果表明其在科学任务中优于现有方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20309 2026-05-20 cs.DC cs.AI cs.LG 92%

SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips

SuperInfer: 面向Superchips的SLO感知旋转调度与内存管理技术

Jiahuan Yu, Mingtao Hu, Zichao Lin, Minjia Zhang

机构 * Supercomputing-System-AI-Lab(超级计算系统人工智能实验室)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对LLM服务中严格延迟SLO与有限GPU内存容量之间的矛盾,SuperInfer提出了一种面向新兴Superchips的高性能LLM推理系统,通过NVLink-C2C实现紧密耦合的GPU-CPU架构,引入SLO感知的旋转调度器RotaSched和优化的旋转引擎DuplexKV,显著提升了TTFT SLO达成率。

Comments Accepted by MLSys '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13217 2026-05-19 cs.CL cs.AI 92%

Sustainability via LLM Right-sizing

通过LLM右尺寸实现可持续性

Jennifer Haase, Finn Klessascheck, Jan Mendling, Sebastian Pokutta

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在现实应用中,小型本地可部署模型是否足够好,通过评估十种LLM在日常职业任务中的表现,提出了一种基于可持续性的评估方法,强调在成本、本地部署和隐私方面的需求。

Comments 21 pages, 2 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13915 2026-05-15 stat.ML cs.AI cs.LG 92%

Multi-Scale Dequant: Eliminating Dequantization Bottleneck via Activation Decomposition for Efficient LLM Inference

多尺度去量化:通过激活分解消除去量化瓶颈以实现高效的LLM推理

Lingchao Zheng, Yuwei Fan, Jun Li, Chengqiu Hu, Qichen Liao, Junyi Fan, Rui Shi, Fangzheng Miao

机构 * Huawei(华为)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多尺度去量化方法,通过分解高精度激活为多个低精度组件,避免权重转换,提升LLM推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05497 2026-05-13 cs.DC cs.AI cs.AR cs.LG 92%

Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference

混沌背后的模式:为高效大规模MoE LLM推理预测数据移动

Zhongkai Yu, Yue Guan, Zihao Yu, Chenyang Zhou, Zhengding Hu, Shuyi Pei, Yangwook Kang, Yufei Ding, Po-An Tsai

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Columbia University(哥伦比亚大学) NVIDIA

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析大规模MoE模型的数据移动模式,提出优化方法,提升大规模LLM推理效率,实现6.6倍平均加速和1.25倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11509 2026-05-13 cs.AI cs.LG cs.MA cs.SY eess.SY 92%

Hierarchical LLM-Driven Control for HAPS-Assisted UAV Networks: Joint Optimization of Flight and Connectivity

分层LLM驱动控制用于HAPS辅助无人机网络:飞行与连接的联合优化

Zijiang Yan, Hao Zhou, Wael Jaafar, Jianhua Pei, Ping Wang, Halim Yanikomeroglu, Hina Tabassum

机构 * Department of Electrical Engineering and Computer Science, York University(约克大学电气工程与计算机科学系) Samsung Research America(三星美国研究院) Department of Software and IT Engineering, École de technologie supérieure (ÉTS), University of Quebec(魁北克大学软件与信息技术工程系,École de technologie supérieure) Non-Terrestrial Networks (Carleton-NTN) Lab and the Department of Systems and Computer Engineering, Carleton University(非地面网络(Carleton-NTN)实验室和系统与计算机工程系,卡尔顿大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在整合陆地和非陆地网络中多无人机系统的联合优化问题,提出基于LLM的分层多速率控制框架,通过高精度仿真平台验证了其在提升运输效率、通信吞吐量和减少碰撞率方面的优势。

Comments Submission for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11232 2026-05-13 cs.AI cs.LG 92%

Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack

重新思考LLMOps用于欺诈和反洗钱:构建合规级LLM服务栈

Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出针对欺诈和反洗钱工作负载的LLMOps栈,通过自托管开源模型提升服务性能,优化吞吐量、降低延迟并提高GPU利用率,展示合规级LLM服务的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05772 2026-05-13 cs.CL cs.LG 92%

Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM

基于聚类的稀疏注意力重映射用于PIM上的高效LLM解码

Zehao Fan, Garrett Gagnon, Zhenyu Liu, Liu Liu

机构 * Electrical, Computer, and Systems Engineering(电气、计算机与系统工程) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STARC方案,通过聚类KV对并映射到PIM银行结构对齐的连续内存区域,减少LLM解码的注意力层延迟和能耗,提升PIM架构下的长上下文推理效率。

Comments Early preprint; peer-reviewed version of record published in ASPLOS '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13830 2026-05-12 cs.CL cs.AI 92%

Users as Annotators: LLM Preference Learning from Comparison Mode

用户作为标注者:从比较模式中学习LLM的偏好

Zhongze Cai, Xiaocheng Li

机构 * Imperial College Business School(帝国理工商业学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过用户日常交互收集偏好数据,利用期望最大化算法估计用户质量因子,提升LLM对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15823 2026-05-05 cs.LG cs.AI 92%

CrispEdit: Low-Curvature Projections for Scalable Non-Destructive LLM Editing

CrispEdit:可扩展的非破坏性LLM编辑中的低曲率投影

Zarif Ikram, Arad Firouzkouhi, Stephen Tu, Mahdi Soltanolkotabi, Paria Rashidinejad

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CrispEdit通过低曲率子空间约束优化,实现LLM编辑中的能力保持,有效降低能力退化,提升编辑效果。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27082 2026-05-01 cs.AI cs.LG cs.SE 92%

When Your LLM Reaches End-of-Life: A Framework for Confident Model Migration in Production Systems

当你的LLM到达生命周期终点时:一种在生产系统中自信模型迁移的框架

Emma Casey, David Roberts, David Sim, Ian Beaver

机构 * Verint Systems Inc(Verint系统公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种框架,用于在底层模型生命周期终点或需替换时迁移生产基于大型语言模型(LLM)的系统。核心贡献是通过贝叶斯统计方法校准自动评估指标与人类判断,即使手动评估数据有限也能实现自信的模型比较。

Comments 12 pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11251 2026-04-21 cs.CR cs.AI cs.LG 92%

CLASP: Training-Free LLM-Assisted Source Code Watermarking via Semantic-Preserving Transformations

CLASP:通过语义保持变换实现无需训练的LLM辅助源代码水印技术

Rui Xu, Jiawei Chen, Weizhi Liu, Zhaoxia Yin, Cong Kong, Xinpeng Zhang

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CLASP提出一种无需训练的LLM辅助源代码水印框架,通过语义保持变换嵌入水印位,实现跨语言的高容量水印插入与提取,提升鲁棒性和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17512 2026-04-21 cs.CL cs.LG 92%

ONTO: A Token-Efficient Columnar Notation for LLM Input Optimization

ONTO:一种高效的列式记法用于LLM输入优化

Harshavardhanan Deekeswar

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 ONTO通过列式记法减少LLM输入的token数量,相比JSON在100到1000条记录间实现46-51%的token减少,并提升推理效率。

Comments 8 pages, 5 tables, 1 figure. Code, benchmarks, and specification at https://github.com/harsh-aranga/onto

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12648 2026-04-15 cs.LG cs.AI 92%

TimeSAF: Towards LLM-Guided Semantic Asynchronous Fusion for Time Series Forecasting

TimeSAF:面向时间序列预测的LLM引导语义异步融合

Fan Zhang, Shiming Fan, Hua Wang

机构 * Shandong Technology and Business University(山东技术与商业大学) Ludong University(鲁东大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TimeSAF框架,通过层级异步融合解决LLM与时间序列语义不匹配问题,采用独立语义融合模块和分阶段语义细化解码器,提升预测性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20492 2026-03-24 cs.LG cs.CL 92%

AE-LLM: Adaptive Efficiency Optimization for Large Language Models

AE-LLM:面向大语言模型的自适应效率优化

Kaito Tanaka, Masato Ito, Yuji Nishimura, Keisuke Matsuda, Aya Nakayama

机构 * SANNO University(SANNO大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出AE-LLM框架,通过自适应选择和组合最优效率技术,提升大语言模型在不同部署场景下的效率,实验显示在15种模型和10种任务中,效率提升达2.8倍,精度保持在基线1.2%以内。

详情

展开后加载摘要…

URL PDF HTML 收藏