ZeroTuning: Unlocking the Initial Token's Power to Enhance Large Language Models Without Training
ZeroTuning: 解锁初始标记的潜力以无需训练的方式提升大语言模型
机构 * University of Pennsylvania(宾夕法尼亚大学) ; AMD(AMD公司) ; Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 长上下文与记忆 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
AI总结 ZeroTuning通过仅调整初始标记的注意力实现无需训练的大语言模型性能提升,适用于多种任务和场景。
Comments ICLR 2026 Accepted Version: proofread, introduction rewritten, additional experiments and appendix material added