arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-29 至 2026-06-29 共收录 42 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 42 篇

2601.14264 2026-06-29 cs.CY cs.AI cs.CL cs.HC 版本更新 92%

Psychometric Comparability of LLM-Based Digital Twins

基于LLM的数字孪生的心理测量可比性

Yufei Zhang, Zhihao Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出构念效度框架,评估LLM数字孪生在聚合、项目、网络和决策层面的心理测量可比性,发现其在高聚合准确性和网络结构上接近人类,但在项目级相关、启发式偏差和时变敏感性上存在差异。

Comments Also available as a preprint on OSF Preprints https://osf.io/preprints/psyarxiv/965yg_v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27492 2026-06-29 cs.MA 新提交 91%

QueenBee Planner: Skill-Evolving Communication Topologies for Token-Efficient LLM Multi-Agent Systems

QueenBee Planner:面向Token高效LLM多智能体系统的技能演化通信拓扑

Congjia Tian, Yuhang Yao, Jiaming Cui

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出QueenBee Planner框架,将智能体间通信拓扑视为可检索和自改进的设计技能,通过外部LLM规划器学习生成时间通信DAG,并利用执行轨迹蒸馏出设计规则,在固定工人池下实现通信结构的自我演化,降低消息数、模型调用和token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03243 2026-06-29 cs.LG cs.AI cs.DC cs.PF 版本更新 90%

Ranking Before Serving: Low-Latency LLM Serving via Pairwise Learning-to-Rank

先排序后服务:通过成对学习排序实现低延迟LLM服务

Yiheng Tao, Yihe Zhang, Matthew Dearing, Xin Wang, Yuping Fan, Michael E. Papka, Zhiling Lan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出PARS调度器,通过成对排序预测任务响应长度,近似最短作业优先调度,减少队头阻塞,在vLLM上实现高达15.7倍延迟降低。

Comments 13 pages, 4 figures. Published in ISC High Performance 2026 Research Paper Proceedings (41st International Conference)

Journal ref ISC High Performance 2026 Research Paper Proceedings (41st International Conference), Hamburg, Germany, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27990 2026-06-29 cs.CR 新提交 89%

AdvancedShelLM: A Stateful Multi-Agent LLM Honeypot for SSH Deception

AdvancedShelLM:一种用于SSH欺骗的有状态多智能体LLM蜜罐

Muris Sladić, Eman Alibalić, Veronica Valeros, Carlos Catania, Sebastian Garcia

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出AdvancedShelLM蜜罐,采用多智能体多LLM架构,通过Manager和Worker两个LLM代理提升命令理解、减少错误响应并增强欺骗性,实现永久文件系统以支持多攻击者同时观察变化文件,评估显示高通过率和有效欺骗。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27665 2026-06-29 cs.SE 新提交 89%

LLM-Assisted Model-Based GUI Testing for Vue.js Web Applications

基于LLM辅助的Vue.js Web应用模型驱动GUI测试

Tao Li, Chenhui Cui, Rubing Huang, Dave Towey, Shikai Guo, Lei Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LLMVue框架,利用大语言模型从Vue.js源码生成页面转换图,实现模型驱动GUI测试,在10个开源项目上验证了高精度和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25558 2026-06-29 cs.AI 89%

Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching

超越查询记忆化:基于查询分解和历史匹配的大语言模型路由

Bo Lv, Jingbo Sun

机构 * Tencent Hunyuan(腾讯文言) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出DecoR路由框架,通过查询能力分解和历史日志匹配来避免记忆化陷阱,在保持高准确率的同时降低推理成本。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27785 2026-06-29 cs.CL cs.AI 新提交 89%

Output-Space Allocation Costs for Calibration-Guided LLM Compression: An Empirical Study

校准引导的LLM压缩中输出空间分配成本的实证研究

Qiong Tang, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao

机构 * Analemma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究ROCKET方法中分配成本与输出空间目标对齐对压缩模型保真度的影响,发现存在准确率-困惑度权衡,且成本函数影响随压缩率降低而减弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27457 2026-06-29 cs.PF cs.CL 新提交 89%

Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving

聚类、路由、升级:成本感知的LLM服务级联框架

Yasmin Moslem, Magdalena Kacmajor, Vasudevan Nedumpozhimana, Ammar Abbas, Solmaz Panahi, David Lynch, Zhuangzhuang Nie, Alexandros Agapitos, Aleksandar Milenovic, Hongmeng Song, Yucheng Shi, Yue Pan, Patricia Buffini, John D. Kelleher

机构 * ADAPT Centre, Trinity College Dublin(ADAPT中心,都柏林信任学院) Huawei Research(华为研究)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出两阶段级联框架,通过聚类分配查询到最经济的模型,并利用质量估计升级低质量输出,在保持97-99%准确率的同时降低每输出token时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27743 2026-06-29 cs.IR cs.AI cs.LG 新提交 88%

End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference

端到端动态稀疏性用于资源自适应的大语言模型推理

Yuhang Chen, Jinhao Duan, Ruichen Zhang, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal, Frank Shyu, Luke Simon, Sandeep Pandey, Tianlong Chen, Xi Liu

机构 * Meta AI University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出L2A框架,通过预算条件和输入感知的门控网络,实现层跳过、头剪枝和推理令牌减少的资源自适应推理,在Llama-3-8B和Qwen-3-4B上达到34%层稀疏性且性能损失小于0.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27683 2026-06-29 cs.LG cs.AI 新提交 88%

CBD: API-Only LLM Black-Box Unlearning through Controlled Behavioral Divergence

CBD:通过受控行为差异实现仅API的黑盒大模型遗忘

Zhiqiang Xie, Yijing Lin, Zhipeng Gao, Dong In Kim

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(北京邮电大学网络与交换技术国家重点实验室) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高精尖创新中心) Department of Electronic and Electrical Engineering, Sungkyunkwan University(成均馆大学电子与电气工程系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对仅API黑盒访问下大模型遗忘难题,提出受控行为差异(CBD)框架,利用辅助模型构建保留与遗忘输入的行为差异并路由遗忘提示,通过基于梯度统计的判别基提升相似数据区分度,实现更优的遗忘-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24506 2026-06-29 cs.DC cs.AI cs.LG cs.PF 新提交 88%

CrossPool: Efficient Multi-LLM Serving for Cold MoE Models through KV-Cache and Weight Disaggregation

CrossPool: 通过KV缓存和权重分离实现冷MoE模型的高效多LLM服务

Zhuoren Ye, Tianyu Wo, Dinghao Xue, Mingming Zhang, Yuchen Teng, Chunming Hu, Renyu Yang

机构 * School of Software, Beihang University(北京航空航天大学软件学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对冷MoE模型权重与KV缓存竞争GPU内存的问题,提出CrossPool引擎,将FFN权重和KV缓存分离到不同内存池,结合规划器、虚拟化器和流水线调度器,显著提升内存利用率和长上下文支持,P99 TBT降低达10.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27866 2026-06-29 cs.LG 新提交 85%

FlexMoE: One-for-All Nested Intra-Expert Pruning for MoE Language Models

FlexMoE:面向MoE语言模型的一体化嵌套专家内剪枝方法

Fan Mo, Yuxuan Han, Geng Zhang, Wangbo Zhao, Yang You

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出FlexMoE方法,通过专家通道重要性排序和离散动作学习,将预训练MoE大语言模型转换为嵌套子网络族,支持跨预算部署,在Qwen2-57B-A14B上剪枝50%路由专家参数仍保留约99.8%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14612 2026-06-29 eess.AS cs.AI cs.LG 版本更新 85%

Event-Grounded Question Answering over Long Audio via Structured Retrieval

基于结构化检索的长音频事件问答

Kartik Hegde, Arvind Krishna Sridhar, Naveen Vakada, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies, Inc., India(印度高通技术公司) Qualcomm Technologies, Inc., USA(美国高通技术公司) University of Turku, Finland(芬兰图尔库大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LA-RAG框架,通过音频基础模型将长音频转为带时间戳的事件记录并存入SQL数据库,结合意图感知检索和LLM生成,实现低延迟高精度的长音频问答,在多个基准上提升时间定位F1达11-17%。

Comments Submitted to EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28251 2026-06-29 stat.AP 新提交 85%

Push Puppet Networks: Structured Bayesian Pruning Algorithm for Language Model Compression

推杆网络:用于语言模型压缩的结构化贝叶斯剪枝算法

Robert Kubinec

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 提出推杆网络,一种结构化贝叶斯剪枝算法,通过层次惩罚函数学习门控参数,在不加载完整模型的情况下将网络剪枝至特定大小,在高剪枝率下优于现有方法并实现GPU加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27732 2026-06-29 cs.IR cs.AI cs.LG 新提交 84%

Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation

双焦扩散语言模型:用于并行生成的非对称双向上下文

Yuhang Chen, Xianfeng Wu, Jinhao Duan, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Tianlong Chen

机构 * Meta AI University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出双焦扩散语言模型R2LM,通过非对称双向上下文(因果注意力+反向Mamba)解决双向注意力与KV缓存不兼容问题,实现并行生成中2.4-12.9倍吞吐提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27627 2026-06-29 cs.LG cs.AI 新提交 84%

HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models

HybridCodec:为高效语音语言模型建模离散和连续表示

Artem Ploujnikov, Francesco Verdini, Samir Sadok, Mirco Ravanelli

机构 * Mila, Quebec AI Institute(Mila-魁北克人工智能研究所) Concordia University(康考迪亚大学) Sapienza University of Rome(罗马大学) Inria, Université Grenoble Alpes CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学国家科学研究中心,让·库尔曼实验室)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出HybridCodec,结合时间压缩离散令牌与降维连续残差,通过混合离散-连续焦点调制编解码器和混合Transformer,在离散域自回归推理并辅以非自回归预测和连续残差上采样,相比纯离散方法显著提升说话人特征保留并减少自回归步数。

Comments Accepted

Journal ref InterSpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27550 2026-06-29 cs.CL cs.LG 新提交 84%

EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction

EntMTP:基于熵引导的多令牌预测加速LLM推理

Carrie Chen

机构 * Cornell University(康奈尔大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出EntMTP,一种无需训练的动态树注意力拓扑调度器,根据局部生成熵调整推测深度,在保持生成质量的同时最大化接受令牌吞吐量,相比Hydra和Medusa分别实现1.15倍和1.36倍加速。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27401 2026-06-29 cs.SE cs.CL cs.IR cs.LG 新提交 82%

Recall Before Rerank: Benchmarking Deep Learning Models for Large-Scale Code-to-Code Retrieval

召回再排序:面向大规模代码到代码检索的深度学习模型基准测试

Leonardo Venuta, Francesco Tosoni, Paolo Ferragina

机构 * Sant’Anna School of Advanced Studies(圣安娜高级研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 本文评估了当代深度学习模型在大规模代码到代码搜索引擎中第一阶段召回的有效性、效率和可扩展性,并提出了基于LLM的代码标准化和查询重写方案,以提升低性能模型的精度。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05121 2026-06-29 cs.CL cs.AI 版本更新 82%

Measuring the Redundancy of Decoder Layers in SpeechLLMs

测量语音大语言模型中解码器层的冗余性

Adel Moumen, Guangzhi Sun, Philip C Woodland

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究语音大语言模型解码器层的冗余性,发现7-8B模型仅需60%的解码器层即可保持良好ASR性能,且冗余结构跨语音编码器、任务和语言一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28057 2026-06-29 cs.CL cs.AI cs.LG 新提交 82%

MultiHashFormer: Hash-based Generative Language Models

MultiHashFormer: 基于哈希的生成式语言模型

Huiyin Xue, Atsuki Yamaguchi, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield, United Kingdom(谢菲尔德大学计算机科学学院,英国)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MultiHashFormer框架,通过多哈希签名表示令牌,实现参数高效的因果语言建模,在多个规模上优于标准Transformer。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01442 2026-06-29 cs.AI 版本更新 81%

Agentic Episodic Control

智能体情节控制

Xidong Yang, Wenhao Li, Junjie Sheng, Yun Hua, Haosheng Chen, Chuyun Shen, Xiangfeng Wang

机构 * East China Normal University(华东师范大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Shanghai University of International Business and Economics(上海对外经贸大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出智能体情节控制(AEC),利用大语言模型增强情节强化学习,通过语义增强器和关键状态识别器提升数据效率和泛化能力,在BabyAI-Text环境中实现2-6倍数据效率提升。

Comments Accepted to Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27711 2026-06-29 cs.LG cs.AI stat.CO 新提交 81%

The Simulacrum: Decision-Theoretic Pretraining for Near-Optimal Time-Series Forecasting and Inference

模拟体:面向近乎最优时间序列预测与推断的决策理论预训练

Pablo Montero-Manso, Marcel Scharth

机构 * Google(谷歌)

专题命中 效率与部署 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种通过决策理论预训练学习时间序列估计器的神经网络框架,通过指定生成世界和决策目标,训练网络逼近最优决策规则,在零样本推断中实现近乎最优风险、偏差控制和均匀校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00757 2026-06-29 cs.CV cs.AI 版本更新 79%

IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models

IWP:大型视觉语言模型中的隐式权重剪枝与令牌剪枝

Dong-Jae Lee, Sunghyun Baek, Junmo Kim

机构 * KAIST(韩国科学技术院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出基于注意力对偶形式的无训练令牌剪枝框架,通过度量令牌的信息量和冗余度,结合渐进式分块最大边际相关性选择子集,在保持性能的同时提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10355 2026-06-29 cs.LG 版本更新 77%

TreeLoRA: Efficient Continual Learning via Layer-Wise LoRAs Guided by a Hierarchical Gradient-Similarity Tree

TreeLoRA:通过层级梯度相似性树引导的逐层LoRA实现高效持续学习

Yu-Yang Qian, Yuan-Ze Xu, Zhen-Yu Zhang, Peng Zhao, Zhi-Hua Zhou

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出TreeLoRA方法,利用层级梯度相似性构建逐层适配器,结合bandit技术高效探索任务结构,并通过稀疏梯度更新优化参数,实现大预训练模型的高效持续学习。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28187 2026-06-29 cs.MA 新提交 75%

GBC: Gradient-Based Connections for Optimizing Multi-Agent Systems

GBC:基于梯度的连接优化多智能体系统

Xiaocheng Yang, Abdulrahman Alrabah, Dilek Hakkani-Tür, Gokhan Tur

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出GBC方法,通过将多智能体系统建模为计算图并引入基于梯度的连接权重,实现细粒度归因与优化,提升多智能体性能。

Comments 15 pages, 8 figures, accepted by SIGDIAL 2026 Long Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26872 2026-06-29 cs.LG cs.AI cs.CL 版本更新 75%

The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selection

最强的教师并不总是最好的教师:以学生为中心的答案选择

Zhengyu Hu, Zheyuan Xiao, Linxin Song, Fengqing Jiang, Yuetai Li, Zhihan Xiong, Yue Liu, Junhao Lin, Yao Su, Lijie Hu, Kaize Ding, Teng Xiao, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Southern California(南加州大学) Independent Researcher(独立研究者) National University of Singapore(新加坡国立大学) Microsoft(微软) Google(谷歌) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Northwestern University(西北大学) Allen Institute for AI (AI2)(人工智能研究院(AI2))

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16886 2026-06-29 cs.CL cs.AI cs.LG 版本更新 75%

ReFreeKV: Towards Threshold-Free KV Cache Compression

ReFreeKV: 迈向无阈值的KV缓存压缩

Xuanfan Ni, Liyan Xu, Chenyang Lyu, Longyue Wang, Mo Yu, Lemao Liu, Fandong Meng, Jie Zhou, Piji Li

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对KV缓存压缩中阈值依赖导致性能不稳定的问题,提出无阈值方法ReFreeKV,自适应调整预算分配,在13个数据集上保持全缓存性能。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27791 2026-06-29 cs.CL cs.AI 新提交 73%

NLL-Guided Full-Attention Layer Selection for Training-Free Sliding-Window Adaptation

NLL引导的全注意力层选择用于无训练滑动窗口适配

Qiong Tang, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao

机构 * Analemma

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出NLL引导的无训练层选择方法,通过计算负对数似然退化度量每层重要性,在仅用1/4全注意力层时达到与1/2基线相当的准确率,大幅降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06675 2026-06-29 cs.LG cs.CL cs.IT math.IT 版本更新 73%

RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory

RateQuant: 通过率-失真理论实现最优混合精度KV缓存量化

Fei Zuo, Zikang Zhou, Hao Cong, Xiaoyan Xi, Ho Fai Leung

机构 * BA TechWorks (BMW Group)(BA TechWorks(宝马集团)) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 RateQuant利用率-失真理论优化混合精度KV缓存量化,通过为不同重要性头部分配不同位宽,减少内存瓶颈,提升生成性能。

Comments 18 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27705 2026-06-29 cs.CL 新提交 70%

Mitigating Position Bias in Transformers via Layer-Specific Positional Embedding Scaling

通过层特定位置嵌入缩放缓解Transformer中的位置偏差

Changze Lv, Zhenghua Wang, Yiran Ding, Yixin Wu, Tianlong Li, Zhibo Xu, Muling Wu, Tianyuan Shi, Shizheng Li, Qi Qian, Xuanjing Huang, Xiaoqing Zheng

机构 * Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Key Laboratory of Intelligent Information Processing(上海市智能信息处理重点实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出层特定位置嵌入缩放方法,通过遗传算法优化各层缩放因子,无需微调或增加延迟,有效缓解长上下文中的位置偏差,在关键值检索任务上准确率提升11.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏