Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
Comments This paper has been accepted by COLM 2024
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
Comments 15 pages, 8 figures, The 31st International Conference on Computational Linguistics (COLING 2025)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
Comments Accepted by NeurIPS 2024. Project page: https://huggingface.co/spaces/TrustSafeAI/GradientCuff-Jailbreak-Defense
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);LLM(abstract);RLHF(abstract)
Comments 27 pages, 4 figures, 5 tables
专题命中 后训练与偏好优化 :RLHF(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)
Comments EMNLP 2024
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
Comments 23 pages, 4 figures
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(title);LLM(abstract);large language model(abstract)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);preference optimization(abstract)
Comments 13 pages, 5 figures, 6 tables
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
Comments 24 pages, 6 figures, 3 tables
专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)
Comments Accepted by ACL2024 findings
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);prompting(abstract)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :SFT(title,abstract);RLHF(title,abstract);large language model(abstract);language model(abstract)
Comments Findings of EMNLP 2023
OptimismBench:语言模型判断中的偏差预测与对齐效应
机构 * Holistic AI(整体人工智能公司) ; University College London(伦敦大学学院)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)
AI总结 本研究推出OptimismBench基准,检测到多数LLM存在乐观方向偏差,且对齐会使模型概率产生偏差,下游流程会默认继承该偏差。
从不一致的人类反馈中实现可靠性感知的大语言模型对齐
专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究如何解决人类反馈强化学习中人类注释不一致问题,提出可靠性引导的偏好优化框架RGPO,通过估计注释者可靠性、推断潜在真实标签及动态调整训练目标,有效减少训练数据不一致性和噪声,性能优于现有基线。
用于直接偏好优化的双难度课程学习
机构 * Tianjin Key Laboratory of Wireless Mobile Communications and Power Transmission(天津无线移动通信与电力传输重点实验室) ; Tianjin Normal University(天津师范大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究针对大语言模型对齐中课程学习依赖一维难度视图的问题,提出将对齐难度重构为二维空间,开发DM-Curri-DPO框架,引入GSP-Curri-DPO分组自定进度学习框架,实验表明该方法提升了数据效率与鲁棒性,为LLM对齐建立新范式。
Comments We found a critical flaw in the prompt complexity metric, which affects the 2D curriculum grid construction and leads to potentially invalid comparisons. Since this undermines our main conclusions, we are withdrawing the paper and will revise the methodology before resubmission
RolloutPipe: 分离式在线策略LLM强化学习中的流水线化Rollout与训练重叠
机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对分离式RLVR系统中rollout与训练阶段空闲问题,提出RolloutPipe框架,通过完整组流水线(CGP)和前沿组调度(FGD)实现训练与rollout重叠,保持在线策略正确性,减少训练等待时间30.7%-42.3%。
Comments 15 pages
Journal ref Proceedings of the 2026 International Conference on Cognitive Computing (ICCC 2026)
NebulaExp-8B:基于全尺度消融研究的经验性后训练流程
机构 * ZTE NebulaL0 Post-Training Team(中兴通讯NebulaL0后训练团队)
专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)
AI总结 提出NebulaExp透明后训练流程,基于Qwen3-8B-base,通过数据清洗、三阶段SFT和GRPO RL优化指令与推理分支,并探索OPD/MOPD替代RL,在8B模型上实现性能提升。
Comments 29 pages, 8 figures
以合适的速度学习:自适应数据调度改进大语言模型强化学习
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Rice University(莱斯大学) ; University of Haifa(海法大学) ; Workato ; University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对LLM强化学习后训练中均匀采样忽视数据语义和策略变化的问题,提出自适应数据调度框架ADS,通过语义聚类和策略边界样本选择实现双层级调度,在三个LLM和七个推理基准上平均准确率提升5.2%。
LLM策略优化的第一性原理推导:从期望奖励到GRPO及其结构扩展
机构 * Nanjing University(南京大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 后训练与偏好优化 :LLM(title,title_cn);language model(abstract);分类 cs.AI
AI总结 本文从第一性原理出发,基于轨迹概率和奖励两个轴,统一分析了从REINFORCE、PPO到GRPO及其变体的LLM策略优化方法,揭示了设计选择背后的原理和复合失败模式。
BayLing-Duplex: 单一自回归LLM的原生全双工语音对话
机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(中国科学院计算技术研究所智能信息处理重点实验室) ; Key Laboratory of AI Safety, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);language model(abstract);分类 cs.CL
AI总结 提出BayLing-Duplex,一种原生全双工语音语言模型,通过单个自回归LLM决定何时听、说和停止,无需外部VAD模块,仅用少量特殊标记实现,在少量微调数据上达到高交互成功率并提升响应质量。
Comments Code: https://github.com/BayLing-Models/BayLing-Duplex
CoRe:一种持续奖励微调的LLM查询重写器,用于大规模视频搜索中的多阶段上下文感知相关性
机构 * TikTok
专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(abstract);分类 cs.CL
AI总结 提出CoRe系统,通过半在线混合偏好优化和乘法奖励比,实现每周重新部署的LLM查询重写器,在多阶段视频搜索中显著降低变更查询率并提升相关性指标。
Comments 12 pages, 3 figures
检测LLM预测中的前瞻偏差
机构 * Department of Finance, CUHK Business School(CUHK商学院金融系)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出统计程序检测大语言模型经济预测中的前瞻偏差,通过日期回忆查询估计前瞻倾向(LAP),并验证LAP与预测交互项在精度回归中的显著性,应用于新闻标题和财报电话会议预测任务。
重新思考LLM强化学习中的散度正则化
机构 * Tencent Hunyuan(腾讯混元) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。
多目标偏好优化:提升生成模型的人类对齐
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);preference optimization(title,abstract);LLM(abstract_cn);post-training(abstract)
AI总结 针对RLHF和偏好优化方法假设单一目标的问题,提出多目标偏好优化框架MOPO,通过约束KL散度最大化主要目标并保障次要目标下限,在合成基准和人类偏好数据上实现帕累托最优策略。
Comments arXiv admin note: text overlap with arXiv:2406.18853 by other authors
打破链条:对LLM对中间结构忠实性的因果分析
机构 * AIRI ; MIPT(莫斯科国立交通大学) ; HSE University(高等经济大学) ; Avito AI Lab(Avito人工智能实验室) ; Skoltech(斯克里普钦科技学院)
专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(abstract);prompting(abstract);分类 cs.AI
AI总结 研究探讨了在模式引导推理(SGR)管道中,LLM对中间结构的忠实性,发现尽管模型在自身中间结构上自洽,但对干预的响应不足,当将最终决策的推导委托给外部工具时,这种不稳定性显著降低。
Comments 20 pages, 4 figures, 7 tables
GREAT: 通过情感感知触发器在RLHF中实现可泛化的后门攻击
机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心)
专题命中 后训练与偏好优化 :RLHF(title,title_cn);prompting(abstract);分类 cs.LG
AI总结 提出GREAT框架,利用情感感知触发器在RLHF中构造自然分布后门,通过潜在空间聚类和多样性提示策略生成愤怒触发器,实现对未见触发器的泛化攻击。