Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization
片段作为手臂:多臂老虎机引导的长上下文LLM偏好优化采样
机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) ; Microsoft Research Asia, China(微软亚洲研究院) ; Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系及人工智能研究院)
专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出LongMab框架,利用多臂老虎机策略从长上下文中选择最有信息量的片段,生成高质量多样化的响应,用于直接偏好优化训练,提升长上下文推理能力。
Comments 17 pages