MaFeRw: Query Rewriting with Multi-Aspect Feedbacks for Retrieval-Augmented Large Language Models
专题命中 后训练与偏好优化 :large language model(title);language model(title);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :large language model(title);language model(title);分类 cs.CL
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
前沿模型的成长之痛:当排行榜不再区分以及接下来衡量什么
机构 * Zehen Labs(泽亨实验室)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过分解SWE-bench和GPQA Diamond分数为种群耦合趋势和每版本残差(h场),诊断前沿模型能力之间的协作与权衡,并提供三步诊断法、每实验室测量优先级表及七个可证伪预测。
Comments 13 pages, 5 figures, 4 tables. Companion paper: "Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling." ( https://doi.org/10.48550/arXiv.2605.18838 ). Code: https://github.com/adilamin89/cape-scaling . Dashboard: https://zehenlabs.com/cape/
专题命中 后训练与偏好优化 :language model(abstract,comments);large language model(abstract);SFT(abstract);RLHF(abstract)
Comments Accepted to the Socially Responsible Language Modelling Research (SoLaR) workshop at NeurIPS 2023
结合人类反馈的策略迭代:将后训练强化学习应用于上下文学习
机构 * Vanderbilt University(范德堡大学) ; Vanderbilt University Medical Center(范德堡大学医学中心)
专题命中 后训练与偏好优化 :post-training(title);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出结合人类反馈的策略迭代(PIHF)方法,采用预训练语言模型为基底,经实验使其在罕见疾病诊断相关任务中显著提升了多个执行器的Recall@1指标,验证了其可行性。
Comments PIHF method paper
从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力
机构 * New York University(纽约大学) ; Reflex ; Université de Montréal(蒙特利尔大学) ; Maastricht University(马斯特里赫特大学)
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。
Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026
A-3PO:通过意识滞后的近端策略优化加速异步大语言模型训练
机构 * Huawei Canada(华为加拿大)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 A-3PO通过近似近端策略优化方法,减少大语言模型异步训练中的计算开销,实现1.8倍的加速同时保持性能
ELMER:探索与优化的进化语言模型
机构 * New York University(纽约大学) ; University of Malta(马耳他大学)
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出进化语言模型 ELMER,通过微调 Qwen3-8B 并结合 oDPO 优化,实现自然语言策略搜索与编译,提升进化搜索效率,证明语言可作为可执行程序空间的可引导搜索表示。
Comments Submitted to AAAI Conference 2026, 8 pages, 6 figures, 1 table
RSPO:用于多轮语言模型智能体的奖励交换策略优化
机构 * Tencent YouTu Lab(腾讯优图实验室)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究多轮语言模型智能体训练问题,针对稀疏结果奖励训练收敛慢等问题,提出奖励交换策略优化方法,利用密集过程奖励信息,确保轨迹多样性和目标与真实奖励一致性,提升模型性能。
测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。
使开源文本语言模型水印在合并后仍具耐久性
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 后训练与偏好优化 :LLM(title);post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究如何让开源文本语言模型水印在模型合并后仍具耐久性,提出合并对抗训练算法,该算法能将水印融入模型权重,在保留下游能力的同时优于所有基线,还评估了针对现实合并场景的水印,表明对抗训练可提高水印耐久性。
奖励更好的思维以实现大语言模型偏好对齐
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型偏好对齐问题,提出思维清单奖励(TCR)方法,将偏好对转化为思维清单评估推理轨迹,引入EMA残差公式减少与结果监督重叠,实验证明该方法能提升对齐性能。
Comments under review
强化学习训练后计算资源应投向何处?模型大小、搜索、学习与反馈
机构 * Technische Universität Berlin(柏林工业大学)
专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL、cs.LG
AI总结 研究强化学习训练后计算资源分配问题,引入浮点运算核算框架,通过LoRA适配的Qwen2.5策略发现条件分配前沿,揭示模型选择与训练分配关联及奖励系统对核算影响,提出RACE协议,建议相关论文报告总浮点运算及计算分配方式。
用于样本高效扩散强化学习从人类反馈中学习的选择性时间步加权和基于优势的重放
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Maryland, College Park(马里兰大学帕克分校)
专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG
AI总结 研究如何提高扩散模型中强化学习从人类反馈的效率,提出选择性时间步加权和基于优势的重放两种互补策略,通过强调信息丰富的时间步和轨迹优化,提升反馈效率,样本效率比基线提高6倍。
Comments 19 pages, 18 figures, 4 tables. Submission under review. A shorter, non-archival 4-page abstract version of this work was accepted to CVPR 2026 Workshops (GCV, CVEU)
强化学习后训练构建组合推理策略
专题命中 后训练与偏好优化 :post-training(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 研究强化学习后训练能否组合原始技能成高级策略,通过在可观察环境实验发现,强化学习能解决预训练模型难题,通过分阶段组合机制重组能力,组合过程可复用巩固,与拒绝微调关键差异在选择性,预训练消融表明其对组合策略出现有影响。
Comments 8 pages, 6 figures. Accepted to the 2nd Workshop on Compositional Learning at ICML 2026, Seoul, South Korea
超越期望的安全基于人类反馈的强化学习:用于通用谱风险控制的随机占优
专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG
AI总结 研究基于人类反馈的安全强化学习,提出用一阶随机占优约束取代标量期望成本约束的框架RAD,通过最优传输框架比较成本分布,引入分位数加权FSD约束,实证显示其提升无害性且增强分布外无害性评估的鲁棒性。
更密集 ≠ 更好:持续后训练中同策略自蒸馏的局限性
专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL、cs.LG
AI总结 研究通过自蒸馏策略优化(SDPO)发现,同策略自蒸馏在持续后训练中会加剧遗忘甚至崩溃,而GRPO等强化学习方法更保守地保留先前能力,表明密集自蒸馏并非默认的稳定器。
文本到图像模型强化学习后训练的有限差分流优化
机构 * UC Berkeley(加州大学伯克利分校) ; NVIDIA(英伟达)
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出一种在线强化学习变体,通过采样配对轨迹并将流速度拉向更优图像方向来降低模型更新方差,将整个采样过程视为单一动作,实现更快的收敛和更高的输出质量与提示对齐。
Comments Code available at https://github.com/NVlabs/finite-difference-flow-optimization
机械性地引发语言模型中的潜在行为
机构 * Principles of Intelligence(智能原理研究所) ; Anthropic(Anthropic公司) ; Independent(独立)
专题命中 后训练与偏好优化 :language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出因果扰动引发(CPE)方法,通过无监督方式发现可解释的低秩适配器,以揭示语言模型中的隐藏行为模式,并展示其在数据效率、安全评估和模型对齐方面的优势。
TokenRatio: 通过比率匹配实现原理化的token级偏好优化
机构 * National University of Singapore(新加坡国立大学) ; Institute of Cybernetics and Robotics, Czech Technical University in Prague(捷克布拉格技术大学控制论与机器人研究所)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TBPO方法,通过比率匹配恢复token级偏好最优性,改进对齐质量和训练稳定性,并增加输出多样性。
语言模型中对齐算法的机制分析
机构 * University of Copenhagen(哥本哈根大学) ; Independent(独立研究者) ; IIT Jodhpur(印度理工学院焦特布尔分校) ; NIT Agartala(印度国立理工学院阿加尔塔拉分校) ; Narris
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 本文通过层间线性探针、稀疏自编码器和交叉编码器,系统分析了六种偏好优化方法在语言模型中的内部机制,发现不同目标函数导致不同的表示几何变换,并揭示了行为对齐与内部结构变化的不一致性。
Comments Work in Progress
更好的文学翻译:多维度数据生成与大语言模型训练方法
机构 * Amazon Web Services (AWS)(亚马逊网络服务(AWS)) ; Peking University(北京大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);SFT(abstract);分类 cs.CL、cs.AI
AI总结 提出多维度迭代优化框架,通过专门的大语言模型生成高质量翻译参考和偏好数据,结合监督微调和强化学习(GRPO)提升文学翻译质量,在MetaphorTrans英中文学翻译基准上达到与Claude Sonnet 4.5竞争的性能。
Comments Accepted by ACL 2026 Industry
对齐使语言模型变得规范,而非描述性
机构 * Technion – Israel Institute of Technology(技术离子-以色列理工学院)
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 通过对比120个基础-对齐模型对在超过10,000个真实人类决策中的表现,发现对齐诱导了规范性偏差:在单轮教科书式博弈中提升预测,但在多轮战略博弈中因忽略互惠、报复等描述性动态而损害预测。
通过稀疏后训练实现内在可解释的注意力机制
机构 * MPI-IS(马克斯·普朗克研究所) ; University of Oxford(牛津大学) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 后训练与偏好优化 :post-training(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出一种后训练方法,通过约束损失下的灵活稀疏正则化,在不牺牲性能的前提下将Transformer注意力连接稀疏至约0.4%,从而简化全局电路并提升可解释性。
CodeScaler: 通过奖励模型扩展代码大语言模型的训练和测试时间推理
机构 * LARK, HKUST(GZ)(LARK,香港科技大学(广州)) ; Kuaishou Technology(快手科技) ; UCL(伦敦大学学院) ; UZH(苏黎世联邦理工学院) ; NUS(国立新加坡大学)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出CodeScaler,一种通过奖励模型扩展代码生成模型的训练和测试时间推理的框架,通过精心编纂的偏好数据和语法感知的代码提取,实现了在四个编码基准上比基于执行的RL提升1.55分,在Qwen3-14B-Base上提升4.23分,并在无测试用例的情况下通过合成数据进一步提升14.64分,同时在推理时间减少10倍的延迟,且在代码、通用和推理领域均优于现有奖励模型。
$ξ$-DPO:通过比率奖励边际进行直接偏好优化
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出$ξ$-DPO,通过重新定义奖励形式和优化目标,解决SimPO中超参数联合调优难题,实现更直观的边际解释和稳定训练。
交互式批评-修订训练用于可靠的结构化大语言模型生成
机构 * The George Washington University(乔治华盛顿大学) ; Northeastern University(东北大学) ; United States Military Academy(美国军事学院)
专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出DPA-GRPO方法,通过生成器-验证器游戏中的结构化验证干预,提升结构化决策的准确性与一致性,实验显示其在TaxCalcBench TY24上优于零样本生成和生成器-only RL基线。
超越成对:你的语言模型其实是在优化一个偏好图
机构 * Amazon(亚马逊)
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG
AI总结 本文提出GraphDPO,通过构建偏好图结构优化语言模型,解决传统成对优化在处理多轮次数据时的局限性,提升模型在推理和编程任务中的性能。
采样以保证质量:通过序列蒙特卡洛方法实现无训练奖励引导的大语言模型解码
机构 * LinkedIn
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于概率框架的奖励引导解码方法,通过结合模型转移概率和前缀依赖的奖励势能,改进传统解码方法的序列级质量优化。实验表明,该方法在代码生成和数学推理任务中显著提升性能。
SPG:用于遮蔽扩散语言模型的夹心策略梯度
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; MIT(麻省理工学院) ; USC(南加州大学) ; UCLA(加州大学洛杉矶分校)
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出SPG策略梯度方法,通过同时利用真实对数似然的上下界,解决扩散大语言模型在强化学习中对齐人类偏好或任务奖励的难题,实验显示其在多个任务中表现优异。
Comments ICLR 2026