Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);preference optimization(abstract)
Comments NAACL 2025
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);preference optimization(abstract)
Comments NAACL 2025
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Comments 27 pages, Accepted in AAAI 2025
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Comments 21 pages, 9 figures
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments 5 pages, 4 figures, 1 table
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments Under Review
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Comments Accepted at the NeurIPS 2024 FITML Workshop
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);language model(abstract);RLHF(abstract)
Comments 12 pages, 8 tables, 3 figures; Paper Accepted at EMNLP Findings 2024
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)
Comments Accepted to ACL 2024 main conference
专题命中 后训练与偏好优化 :language agent(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
Comments EMNLP 2023 Main Conference
Journal ref Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments Published at the 19th BEA Workshop co-located with NAACL-2024
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);preference optimization(abstract)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Comments Preprint
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)
Comments 23 pages, 16 figures
增强释义类型生成:基于人工排序数据的DPO和RLHF评估影响
机构 * University of Göttingen(哥廷根大学)
专题命中 后训练与偏好优化 :RLHF(title,title_cn);language model(abstract);preference optimization(abstract);分类 cs.CL
AI总结 本研究利用人工排序的释义类型数据集,结合直接偏好优化(DPO)使模型输出与人类判断对齐,将释义类型生成准确率提升3个百分点,人类偏好评分提升7个百分点,并创建了新的标注数据集以支持更严格的评估。
Comments 21 pages, 11 figures. Master's thesis, University of Goettingen, December 2024. Code: https://github.com/cluebbers/dpo-rlhf-paraphrase-types. Models: https://huggingface.co/collections/cluebbers/enhancing-paraphrase-type-generation-673ca8d75dfe2ce962a48ac0
机构 * UC Berkeley / Meta(伯克利大学/Meta) ; Meta
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,comments);large language model(abstract);language model(abstract)
Comments ACM CCS 2025. Key words: prompt injection defense, LLM security, LLM-integrated applications
专题命中 后训练与偏好优化 :LLM(title,abstract);language model(abstract,comments);large language model(abstract);RLHF(abstract)
Comments 20 pages, 15 figures, NeurIPS 2024 Workshop Socially Responsible Language Modelling Research (SoLaR)
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);SFT(abstract);RLHF(abstract)
Comments ArXiv version For NeurIPS 2023 accepted paper: RRHF: Rank Responses to Align Language Models with Human Feedback
BOUND:在搜索-控制边界处的摘要引导式校正偏好蒸馏
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对大语言模型深度搜索智能体的持续漂移问题,提出BOUND框架,通过摘要引导构建偏好对,用DPO蒸馏偏好,在7个基准上多数数据集和指标优于基线。
Comments 15 pages
《智能体AI的搭车指南:从基础到系统》
机构 * Haggai Roitman
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。
Comments version 1.3
作为频谱更新重组的偏好调整
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过频谱结构研究RLHF及偏好优化,将偏好诱导更新转化为可干预对象,发现更新呈现头-尾组织,头部主导端点偏移,揭示了偏好训练后是结构化更新重组,以及对齐增益和覆盖损失与更新组织方式的关系。
当距离干扰:BT损失中表示距离偏差对奖励模型的影响
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 分析BT损失中表示距离导致的梯度偏差,提出NormBT自适应归一化方案,提升奖励模型在细粒度区分上的性能。
Comments ICML 2026
从自回归到掩码扩散语言模型的后训练中的机制转变
机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) ; Department of Biosystems & Biomaterials Science and Engineering, Seoul National University(首尔国立大学生物系统与生物材料科学与工程系)
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(title);分类 cs.CL、cs.AI、cs.LG
AI总结 通过比较电路分析,发现后训练得到的掩码扩散模型在结构上根据任务保留或重组自回归电路,在语义上从局部专业化转向分布式整合,表明扩散后训练是内部计算的深度重组。