On Softmax Direct Preference Optimization for Recommendation
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI
Comments NeurIPS 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI
Comments NeurIPS 2024
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL
Comments EMNLP 2024; 9 pages, 3 figures
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.AI
Comments 13 pages, 8 figures, The 2024 Conference on Empirical Methods in Natural Language Processing
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL
Comments EMNLP2024, main
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
专题命中 后训练与偏好优化 :language model(title);RLHF(abstract);preference optimization(abstract);分类 cs.LG
Comments COLM 2024
专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract);分类 cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL
Comments Findings of ACL 2024
专题命中 后训练与偏好优化 :language model(title,abstract);prompting(abstract);分类 cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL
Comments published at ICLR 2024
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL
Comments Published at NeurIPS 2023
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL
Comments NeurIPS 2023 camera-ready
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL
Comments Accepted to BabyLM workshop at CoNLL
专题命中 后训练与偏好优化 :post-training(title);large language model(abstract);language model(abstract);分类 cs.CL
Comments Findings of NAACL 2022
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL
Comments accepted by NAACL 2019
离线解释选择中, pairwise 排序优于单动作强化学习:一个实践经验
机构 * Amazon(亚马逊公司)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对工业可解释推荐系统的高成本问题,提出将 LLM 解释生成与选择分离的方案,发现 pairwise 排序方法在离线解释选择中优于单动作强化学习,且构建成本低、延迟小。
Comments This is an extended version of a 3-page paper accepted to the RecSys 2026 Research and Practice Notes track
RL-Index:用于检索索引推理的强化学习
机构 * University of Oregon(俄勒冈大学) ; Adobe Research(Adobe研究)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 提出RL-Index框架,将检索索引推理转化为强化学习问题,通过LLM生成理由增强文档,使用GRPO优化,提升检索和问答性能并降低在线延迟。
Cat-DPO:基于类别的安全对齐
机构 * University of Southern California(南加州大学) ; Northwestern University(西北大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 Cat-DPO通过将安全对齐转化为类别约束优化问题,为每个有害类别设置独立的适应性安全边际,提升整体帮助性和无害性,减少类别间的安全方差和最佳至最差差距。
Comments 23 pages, 6 figures
从轨迹到前缀:通过重放前缀和在线延续复用教师轨迹
机构 * Tianjin University(天津大学) ; Peking University(北京大学) ; Tianjin University of Technology(天津工业大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对小语言模型蒸馏低效问题,提出Prefix-GRPO强化学习框架,将教师轨迹分解,通过重放前缀恢复中间状态并在线延续,统一前缀与延续学习,实验证明其优于蒸馏和标准RL基线,凸显前缀令牌优化的重要性。
大语言模型中跨语言事实一致性的推理时引导
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);prompting(abstract)
AI总结 研究大语言模型跨语言事实不一致问题,评估零样本上下文引导、CAA、DPO四种干预策略,通过实验发现角色提示是最强干预方式,CAA对配置敏感,DPO适配器收益窄且可转移性低,表明跨语言不一致部分是选择问题,简单干预可能更优。
Comments 8 pages (21 in total), 2 figures, 4 tables. Original manuscript for a Guided Research project conducted at the Technical University of Munich, detailing the complete methodology, full data pipeline, and comprehensive experimental results. A related, condensed subset of this work was subsequently adapted and published at the StereACuLT 2026 workshop
幻觉自我博弈:通过进化生成器引导强化检测器
机构 * Simon Fraser University(西蒙 Fraser大学) ; Microsoft(微软) ; University of Illinois at Chicago(伊利诺伊大学芝加哥分校)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 针对高质量标注数据稀缺致识别LLM生成输出中幻觉困难及现有方法局限,提出幻觉自我博弈框架,含检测器和生成器,经多轮训练优化,能在无外部监督下提升小型LLM性能。
Comments Accepted to COLM 2026. Camera-ready version to appear
多任务智能强化学习的熵步长策略优化
机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,南洋理工大学计算与数据科学学院) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究多任务智能强化学习中任务间探索-利用步长不匹配问题,提出熵步长策略优化(EPPO),核心是任务级动态裁剪机制,实验证明EPPO在多任务智能基准上结果优于同类方法。
一层就够了吗?训练单个Transformer层可以匹配全参数RL训练
机构 * University of Minnesota(明尼苏达大学) ; Peking University(北京大学) ; Amazon(亚马逊)
专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 发现RL训练收益高度集中在少数Transformer层,仅训练单层即可恢复大部分全参数RL收益,且高贡献层集中在模型中部。
Active-GRPO:用于分子优化的自适应模仿与自我改进推理
机构 * School of Medicine, Stanford University(斯坦福大学医学院) ; Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) ; Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学普利兹克分子工程学院) ; Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出Active-GRPO方法,通过主动模仿-强化和主动参考机制,在分子优化中自适应平衡模仿与自我改进,显著提升性能。