arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22116 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22116 篇

2606.02430 2026-06-02 cs.DC cs.AI 90%

Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference

并非所有错误都平等:大型语言模型推理中错误传播的系统研究

Yafan Huang, Sheng Di, Guanpeng Li

机构 * University of Iowa(爱荷华大学) Argonne National Laboratory(阿贡国家实验室) University of Florida(佛罗里达大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究通过提出的LLMFI故障注入框架,系统研究了软错误在大型语言模型推理中的传播机制,揭示了关键脆弱性模式,并提出了四种低开销的软件级可靠性改进方向。

Comments Accepted at ICS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29979 2026-05-29 cs.CR cs.LG 90%

Fingerprinting Inference Systems of Large Language Models

大型语言模型的推理系统指纹识别

Anna Wimbauer, Jonas Möller, Erik Imgrund, Konrad Rieck

机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.LG

AI总结 本文提出一种通过分析LLM的提示-响应行为来识别推理系统组件(如推理引擎、注意力后端和硬件平台)的指纹方法,并论证了防御该指纹识别的根本困难性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06791 2026-05-29 cs.LG cond-mat.dis-nn cond-mat.stat-mech 90%

Rare Event Analysis of Large Language Models

大型语言模型的罕见事件分析

Jake McAllister Dorman, Edward Gillman, Dominic C. Rose, Jamie F. Mair, Juan P. Garrahan

机构 * School of Physics and Astronomy, University of Nottingham(物理与天文学学院,诺丁汉大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一个端到端框架,用于系统分析大型语言模型中的罕见事件,涵盖理论、高效生成策略、概率估计和误差分析,并通过实例展示其应用。

Comments ICML 2026 Oral Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19321 2026-05-20 cs.CR cs.AI 90%

Exploring and Developing a Pre-Model Safeguard with Draft Models

探索和开发预模型安全防护机制

Hongyu Cai, Arjun Arunasalam, Yiming Liang, Antonio Bianchi, Z. Berkay Celik

机构 * Purdue University(普渡大学) Florida International University(佛罗里达国际大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 本文研究了如何通过利用 jailbreak 攻击的可转移性,在目标模型推理前确保提示的安全性,提出了一种新的安全防护设计,减少了预模型防护的误报率,并提供了一种低开销的替代方案。

Journal ref ACM Conference on AI and Agentic Systems (ACM CAIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16480 2026-05-19 q-bio.BM cs.AI 90%

MoleCode unlocks structural intelligence in large language models

MoleCode 解锁大型语言模型中的结构智能

Zhiyuan Yan, Chen Liu, Boxuan Zhao, Kaiqing Lin, Jixiang Zhao, Yimi Wang, Liuzhenghao Lv, Hao Li, Shanzhuo Zhang, Li Yuan, Fanyang Mo

机构 * Peking University Shenzhen Graduage School

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 MoleCode 通过引入图显分子语言,使大型语言模型能直接操作分子结构,提升分子推理、编辑、生成和分析任务的性能,尤其在结构受限场景下表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16298 2026-05-19 cs.CY cs.AI cs.MA 90%

Data-driven and distributed governance of building facilities management using decentralized autonomous organization, digital twin, and large language models

基于去中心化自治组织、数字孪生和大语言模型的建筑设施管理数据驱动与分布式治理

Reachsak Ly, Alireza Shojaei, Xinghua Gao, Philip Agee, Abiola Akanmu

机构 * School of Technology, Eastern Illinois University(东伊利诺伊大学技术学院) Myers-Lawson School of Construction, Virginia Polytechnic Institute and State University(弗吉尼亚理工学院和州立大学迈尔斯-劳森建设学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种融合DAO、数字孪生、大语言模型和区块链的建筑管理分布式治理框架,以提升决策透明度和系统安全性。

Comments 33 pages, 20 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04457 2026-05-18 cs.CL 90%

RapidUn: Influence-Driven Parameter Reweighting for Efficient Large Language Model Unlearning

RapidUn: 基于影响的参数重加权用于高效的大语言模型反学习

Guoshenghui Zhao, Huawei Lin, Weijie Zhao

机构 * Golisano College of Computing and Information Sciences, Rochester Institute of Technology(罗切斯特理工学院戈利萨诺计算机与信息科学学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 RapidUn通过快速估计模块评估每个样本的影响,将这些分数映射为自适应更新权重,指导选择性参数更新,从而在Mistral-7B和Llama-3-8B上实现比全重训练高100倍的效率,并优于Fisher、GA和LoReUn。

Comments Code available at: https://github.com/eyerf/RapidUn

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11859 2026-05-13 cs.RO cs.AI 90%

EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models

EvoNav:基于大语言模型的机器人导航奖励函数进化设计

Zhikai Zhao, Chuanbo Hua, Federico Berto, Zihan Ma, Kanghoon Lee, Jiachen Li, Jinkyoo Park

机构 * KAIST(韩国科学技术院) Radical Numerics UC Riverside(加州大学河滨分校) Omelet AI4CO

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出EvoNav框架,利用大语言模型自动设计机器人导航奖励函数,通过逐步升温-提升流程降低训练成本,实验表明其优于人工设计和现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10401 2026-05-12 cs.AI math.OC 90%

LLM4Branch: Large Language Model for Discovering Efficient Branching Policies of Integer Programs

LLM4Branch:用于发现整数规划高效分支策略的大语言模型

Zhinan Hou, Xingchen Li, Yankai Zhang, Tianxun Li, Keyou You

机构 * Department of Automation, BNRist, Tsinghua University, Beijing, China.(自动化系,BNRist,清华大学,北京,中国)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出LLM4Branch,利用大语言模型自动发现整数规划的高效分支策略,通过程序骨架生成和参数优化,实现CPU基方法的新状态-of-the-art性能。

Comments ICML2026 preprint, camera ready in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09990 2026-05-12 cs.CL 90%

Merlin: Deterministic Byte-Exact Deduplication for Lossless Context Optimization in Large Language Model Inference

Merlin:用于无损上下文优化的大语言模型推理中的确定性字节精确去重

Sietse Schelpe

机构 * Corbenic AI, Inc.(Corbenic AI公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 Merlin通过高效去重和上下文优化提升大语言模型推理效率,减少冗余文本处理瓶颈,实验显示在高冗余数据中减少71%输入,保持数据完整性。

Comments Preprint. Implementation and open-source community version available at: https://github.com/corbenicai/merlin-community - https://doi.org/10.5281/zenodo.20090991

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08626 2026-05-12 eess.SP cs.DC cs.LG cs.MA 90%

Large Language Models over Networks: Collaborative Intelligence under Resource Constraints

网络上的大语言模型:在资源限制下的协作智能

Liangqi Yuan, Wenzhi Fang, Shiqiang Wang, H. Vincent Poor, Christopher G. Brinton

机构 * Purdue University(普渡大学) University of Exeter(埃克塞特大学) Princeton University(普林斯顿大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文探讨了在资源受限环境下,通过设备与云端协同以及多智能体协作提升大语言模型性能的方法,提出了协同推理的两种维度,并讨论了协作学习与开放研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05615 2026-05-11 cs.LG cs.CY 90%

LLMSpace: Carbon Footprint Modeling for Large Language Model Inference on LEO Satellites

LLMSpace:大型语言模型在低地球轨道卫星上的推理碳足迹建模

Lei Jiang, Adrian Ildefonso, Daniel Loveless, Fan Chen

机构 * Indiana University(印第安纳大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出LLMSpace框架,用于建模AI赋能低地球轨道卫星上大型语言模型推理的碳足迹,分析碳足迹、延迟、硬件设计和使用寿命之间的关键权衡。

Comments 12 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22316 2026-05-11 cs.LG 90%

Outlier Smoothing with Closed-Form Rotations for W4A4 Large Language Model Quantization

基于闭式旋转的W4A4大语言模型量化去噪

Jinying Xiao, Bin Ji, Shasha Li, Xiaodong Liu, Ma Jun, Chao Wang, Wei Li, Ye Zhong, Xuan Xie, Nyima Tashi, Jie Yu

机构 * National University of Defense Technology(国防科技大学) Qinghai Normal University(青海师范大学) Tibet University(西藏大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出SingleQuant框架,通过闭式最优旋转平滑激活异常值,提升大语言模型量化性能,实验证明其在多种任务中优于基线方法。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06476 2026-05-08 cs.CL 90%

Towards Emotion Consistency Analysis of Large Language Models in Emotional Conversational Contexts

面向情感一致性分析的大型语言模型在情感对话情境中的研究

Sneha Oram, Ojaswita Bhushan, Pushpak Bhattacharyya

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了大型语言模型在情感对话中生成响应的一致性,通过极端和中等情绪的三个查询测试,发现模型在处理包含错误假设的查询时表现欠佳,尤其在中等情绪内容中更易受虚假信念影响。

Comments Under-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12355 2026-05-08 cs.LG 90%

Tree-Structured Synergy of Large Language Models and Bayesian Optimization for Efficient CASH

树状结构下大语言模型与贝叶斯优化的协同作用:高效CASH问题

Beicheng Xu, Weitong Qian, Lingching Tung, Yupeng Lu, Bin Cui

机构 * School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出LB-MCTS框架,通过树状结构整合大语言模型与贝叶斯优化,解决高维CASH问题中的冷启动问题,实验表明其优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28018 2026-05-01 cs.CE cs.AI 90%

Design Structure Matrix Modularization with Large Language Models

基于大语言模型的Design Structure Matrix模块化设计

Shuo Jiang, Jianxi Luo

机构 * Department of Systems Engineering(系统工程系) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本文提出利用大语言模型进行DSM模块化设计的方法,通过五个案例和三种基础LLM实现近参考质量的结果,在30次迭代内无需专用优化代码。发现领域知识在复杂DSM中会损害性能,提出语义对齐假设以指导LLM在工程设计优化中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27536 2026-05-01 cs.AI 90%

Belief-Guided Inference Control for Large Language Model Services via Verifiable Observations

基于可验证观测的信念引导推理控制:通过可验证观测实现大语言模型服务

Wenhao Yuan, Chenchen Lin, Jian Chen, Jinfeng Xu, Shuo Yang, Edith Cheuk Han Ngai

机构 * The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Veroic框架,通过构建轻量级可验证观测通道,利用聚合的异质质量信号形成信念状态,以实现更优的质量-成本权衡、更强的风险估计和更稳健的长期推理控制。

Comments Accepted by KnowFM@ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26378 2026-04-30 cs.LG 90%

CoQuant: Joint Weight-Activation Subspace Projection for Mixed-Precision LLMs

CoQuant:混合精度LLM的联合权重-激活子空间投影

Zhe Ding, Su Pan, Duowei Pan

机构 * School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) Amazon AGI(亚马逊人工智能)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 CoQuant通过联合建模权重和激活的子空间,提升混合精度LLM的量化效果,在WikiText perplexity和零样本常识推理准确率上优于现有方法。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21238 2026-04-24 cs.CL cs.IR 90%

Unlocking the Power of Large Language Models for Multi-table Entity Matching

解锁大型语言模型在多表实体匹配中的潜力

Yingkai Tang, Taoyu Su, Wenyuan Zhang, Xiaoyang Guo, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出LLM4MEM框架,通过多风格提示增强模块、传递共识嵌入匹配模块和密度感知修剪模块,提升多表实体匹配的准确性和效率,实验表明在六个数据集上F1得分提升5.1%。

Comments Accepted by NLPCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16606 2026-04-21 cs.CR cs.LG 90%

SafeLM: Unified Privacy-Aware Optimization for Trustworthy Federated Large Language Models

SafeLM:面向可信联邦大语言模型的统一隐私意识优化

Noor Islam S. Mohammad, Uluğ Bayazıt

机构 * Istanbul Technical University(伊斯坦布尔技术大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 SafeLM通过整合隐私、安全、虚假信息和对抗鲁棒性四大支柱,提升联邦大语言模型的可信度,实现98%有害内容检测准确率,降低通信开销并提升隐私保护效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16475 2026-04-21 cs.NE cs.AI 90%

Spike-driven Large Language Model

基于脉冲的大型语言模型

Han Xu, Xuerui Qiu, Baiyu Chen, Xinhao Luo, Xingrun Xing, Jiahong Zhang, Bo Lei, Tiejun Huang, Bo Xu, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing 100049, China Brain-Inspired Models Group, Beijing Academy of Artificial Intelligence, Beijing 100862, China School of Future Technology, University of Chinese Academy of Sciences, Beijing 101408, China Zhongguancun Academy, Beijing 100094, China Pengcheng Laboratory, Guangdong 518055, China School of Advanced Inter-disciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China School of Computer Science, Peking University, Beijing 100871, China Key Laboratory of Brain Cognition Spiking Intelligence Lab, Tianqiao \& Chirssy Chen Institute, Shanghai 201203, China

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SDLLM,通过稀疏加法替代密集矩阵乘法,结合gamma-SQP编码和对称量化机制,有效降低脉冲 firing 率并提升性能,实验表明在脉冲基础上实现更高效且准确的大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14156 2026-04-17 cs.CL 90%

Compressed-Sensing-Guided, Inference-Aware Structured Reduction for Large Language Models

基于压缩感知的、推理感知的结构化缩减用于大语言模型

Andrew Kiruluta

机构 * UC Berkeley School of Information(伯克利大学信息学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出一种统一的压缩感知指导框架,用于动态执行大语言模型,通过稀疏恢复估计任务条件和token自适应的支持集,实现高效硬件执行路径,提升推理速度与压缩效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05740 2026-04-16 cs.HC cs.AI 90%

RECOVER: Designing a Large Language Model-based Remote Patient Monitoring System for Postoperative Gastrointestinal Cancer Care

RECOVER:基于大语言模型的术后胃肠癌远程患者监测系统设计

Ziqi Yang, Yuxuan Lu, Jennifer Bagdasarian, Vedant Das Swain, Ritu Agarwal, Collin Campbell, Waddah Al-Refaire, Jehan El-Bayoumi, Guodong Gao, Dakuo Wang, Bingsheng Yao, Nawar Shara

机构 * University of California, Irvine(加州大学尔湾分校) Northeastern University(东北大学) Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学) MedStar Health Research Institute(梅斯塔健康研究院) Creighton University(克里普顿大学) Georgetown University(乔治城大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文设计了基于大语言模型的RECOVER系统,用于术后胃肠癌的远程患者监测,通过临床整合提升术后护理效率,并探讨了AI伦理与未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09726 2026-04-08 cs.CL 90%

Forgetting as a Feature: Cognitive Alignment of Large Language Models

作为特征的遗忘:大型语言模型的认知对齐

Alexandros Christoforos

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究将遗忘视为大型语言模型的认知机制,通过建立基准测试评估时间推理、概念漂移适应和联想回忆,发现模型遗忘率与人类记忆效率的权衡相似,并提出概率记忆提示策略提升长期推理性能。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04651 2026-04-07 cs.AI 90%

Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents

搜索,不要猜测:教小语言模型成为有效的搜索代理

Yizhou Liu, Qi Sun, Yulin Chen, Siyue Zhang, Chen Zhao

机构 * New York University(纽约大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文通过评估复杂多跳推理任务,发现小语言模型(SLMs)虽参数较少,但检索工具使用更少且易产生幻觉。提出轻量级微调方法\policy,使SLMs能可靠检索并生成基于证据的答案,提升Bamboogle和HotpotQA性能17.3和15.3分,达到LLM水平。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04233 2026-04-07 cs.RO cs.CL 90%

Precise Robot Command Understanding Using Grammar-Constrained Large Language Models

利用语法约束大语言模型实现精确的机器人指令理解

Xinyun Huo, Raghav Gnanasambandam, Xinyao Zhang

机构 * Industrial and Manufacturing Engineering, Florida State University(佛罗里达州立大学工业与制造工程系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SLM(abstract)

AI总结 本文提出一种结合语法驱动NLU系统和微调LLM的混合模型,通过两阶段过程确保生成的指令在机器人可读的JSON格式中有效,提升工业人机协作的安全性和效率。

Comments Accepted at ASME MSEC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04013 2026-04-07 cs.CL 90%

RUQuant: Towards Refining Uniform Quantization for Large Language Models

RUQuant: 向大语言模型的均匀量化精修迈进

Han Liu, Haotian Gao, Changya Li, Feng Zhang, Xiaotong Zhang, Wei Wang, Hong Yu

机构 * Dalian University of Technology(大连理工大学) Peking University(北京大学) Macao Polytechnic University(澳门理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本文提出RUQuant方法,通过理论分析和两阶段正交变换,解决激活分布非均匀导致的量化精度下降问题,在不需微调的情况下实现高精度量化。

Comments Accepted to KDD 2026. 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13314 2026-03-17 cs.LG 90%

Linear Predictability of Attention Heads in Large Language Models

大语言模型中注意力头的线性可预测性

Khalid Shaikh, Asmit Kumar Singh, Rebecca Christopher Dsouza, Shikhar Shiromani

机构 * Georgia Institute of Technology(佐治亚理工学院) Santa Clara University(圣克拉拉大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 研究发现预训练Transformer中注意力头激活存在线性结构,通过少量参考头可高精度重建目标头,利用此特性可减少KV缓存并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07419 2026-03-06 cs.LG cs.CV 90%

Revolutionizing Mixed Precision Quantization: Towards Training-free Automatic Proxy Discovery via Large Language Models

颠覆混合精度量化:通过大语言模型实现无训练的自动代理发现

Haidong Kang, Jun Du, Lihong Lin

机构 * School of Computer and Communication Engineering, Northeastern University(东北大学计算机与通信工程学院) School of Software Engineering, Beijing Jiaotong University(北京交通大学软件工程学院) School of Software, Northeastern University(东北大学软件学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

AI总结 本文提出TAP框架,利用大语言模型和进化搜索策略,实现无训练的自动代理发现,提升混合精度量化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04292 2026-03-05 cs.CL 90%

Position: Vector Prompt Interfaces Should Be Exposed to Enable Customization of Large Language Models

位置:应暴露向量提示接口以实现大语言模型的定制

Liangwei Yang, Shiyu Wang, Haolin Chen, Rithesh Murthy, Ming Zhu, Jielin Qiu, Zixiang Chen, Juntao Tan, Jianguo Zhang, Zhiwei Liu, Wenting Zhao, Silvio Savarese, Caiming Xiong, Huan Wang, Shelby Heinecke

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文主张通过暴露向量提示接口实现大语言模型的定制化,指出向量提示微调优于文本提示优化,并强调在现实部署中仅推理的定制需求增加。

详情

展开后加载摘要…

URL PDF HTML 收藏