Reward Collapse in Aligning Large Language Models
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted for publication in the Journal of Data Science (JDS), reference JDS1201
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted for publication in the Journal of Data Science (JDS), reference JDS1201
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2025
专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);prompting(abstract)
Comments Accepted to ACL 2025 (Main)
机构 * Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments full draft v2: 8 pages, 3 figures
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Meta FAIR
专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract);preference optimization(abstract)
Comments ICML 2025 main conference paper. The source code is available at https://github.com/facebookresearch/SelfCite
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at NeurIPS 2024
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract);preference optimization(abstract)
Comments 23 pages
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments 14 pages, 7 figures
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
弥合ECG基础模型性能差距:一种训练后策略
机构 * Department of Information Center, Fuwai Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(信息中心部门,阜外医院,中国医学科学院和北京协和医学院) ; Function Test Center, Fuwai Hospital, National Center for Cardiovascular Diseases, Chinese Academy of Medical Sciences and Peking Union Medical College(功能测试中心,阜外医院,国家心血管疾病中心,中国医学科学院和北京协和医学院) ; Cardiac Arrhythmia Center, Fuwai Hospital, National Center for Cardiovascular Diseases, Chinese Academy of Medical Sciences and Peking Union Medical College(心律失常中心,阜外医院,国家心血管疾病中心,中国医学科学院和北京协和医学院) ; Center for Health Statistics and Information, National Health Commission People’s Republic of China(健康统计与信息中心,中华人民共和国国家卫生健康委员会)
专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种训练后策略,通过提升ECG基础模型的性能,使其在多个任务中表现优于基线微调方法。
Comments A Transformer-based model is used as an example; the proposed post-training strategy may also be applicable to CNN-based models. The manuscript is currently under review
Le Critique:用于大语言模型强化学习的特权值函数
机构 * Mistral AI(米斯特拉尔人工智能公司) ; Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 该研究针对 LLM 强化学习的值函数应用难题,提出特权值函数(PVF)与自适应插值基线 TETHER,在多推理任务中提升了值函数基线性能,表现优于或媲美 GRPO。
基于大语言模型的分层协调控制与感知延续性的策略学习
专题命中 后训练与偏好优化 :LLM(title,summary_cn);prompting(abstract);分类 cs.AI
AI总结 针对复杂工程系统多单元协调难题,提出基于LLM的分层框架,结合感知延续性的GRPO,在多匝道交通控制和VPP能源管理中,性能优于多种对比方法。
Comments 30 pages, 5 figures
自然语言处理:从分词到RLHF的全面实用指南
机构 * KAZAN (VOLGA REGION) FEDERAL UNIVERSITY INSTITUTE OF COMPUTATIONAL MATHEMATICS AND INFORMATION TECHNOLOGIES(卡赞(伏尔加地区)联邦大学计算数学与信息科技学院)
专题命中 后训练与偏好优化 :RLHF(title,title_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文系统指导现代NLP全流程,涵盖分词、向量化、大语言模型微调、检索增强生成及人类反馈强化学习,强调低资源语言处理与开源模型应用。
Comments 136 pages, 12 practical works, preprint. Textbook for senior undergraduates and graduate students. Original contributions on low-resource languages (Tajik, Tatar and other). Companion repository available
StepPO: 面向智能体强化学习的步骤对齐策略优化
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract_cn)
AI总结 提出StepPO,一种步骤级策略优化方法,通过将智能体强化学习从token级MDP重构为步骤级MDP并引入步骤级信用分配,以解决现有算法在智能体决策粒度上的不匹配问题,在多跳问答等任务上优于多种RL算法。
GRASP:用组相对策略优化增强语言模型匿名化器
机构 * UC Santa Barbara(加州大学圣巴巴拉分校) ; UC Los Angeles(加州大学洛杉矶分校)
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);preference optimization(abstract)
AI总结 该研究提出GRASP方法,用组相对策略优化增强设备端小型语言模型匿名化器,在隐私-效用权衡、对抗匿名化防御及运行成本上均优于DPO蒸馏基线。
TACT:面向教学自适应英语辅导的分类对齐后训练
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本研究提出基于人类研究的TACT框架,构建含双分类体系的数据集后,通过特定训练得到TACTutor,在自研基准及盲法研究中表现优于基线,为自适应ESL辅导器开发提供开放基础。
RM-Distiller: 利用生成式大语言模型进行奖励模型蒸馏
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) ; School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 RM-Distiller通过系统利用教师LLM的精炼、评分和生成能力,提升奖励模型蒸馏效果,首次系统性地探索了生成式LLM在奖励建模中的应用。
Comments Accepted to IJCAI-ECAI 2026
噪声偏好标签下无元数据的元重加权直接偏好优化
机构 * Xi’an Jiaotong University(西安交通大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究针对DPO性能依赖偏好数据质量问题,提出双层优化框架、无任务元知识驱动方法及结合中心差分近似与LoRA微调的可扩展训练方案,经实验验证该方法能在不同噪声率下提升训练性能。
Comments 36 pages, including appendices. Revised version with updated theoretical analysis, supplementary material, figures and improved table formatting
从预训练或微调的大语言模型进行无奖励代码对齐:揭示代码生成中的权衡
机构 * York University Canada(加拿大约克大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 本研究通过实证分析,探讨了在代码生成任务中,对预训练或微调后的大语言模型进行无奖励对齐(DPO和BoNBoN)的效果,发现预训练到对齐的路径提升更大,但微调版本基线更高。
Journal ref The ACM International Conference on the Foundations of Software Engineering (FSE) 2026
你的自对弈算法其实是一个对抗性模仿者:通过模仿学习的视角理解LLM自对弈
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Microsoft Research(微软研究院)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文通过将自对弈微调建模为模型与自身参数化的正则化隐式奖励玩家之间的极小极大博弈,统一了自对弈模仿与偏好对齐,并提出了基于χ²散度的新算法,在多种语言模型微调任务上优于现有方法。
Comments 26 pages, 6 tables, 5 figures
回答前先置信:高效LLM不确定性估计的范式转变
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Inc.(华为公司)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出CoCA框架,通过GRPO强化学习联合优化置信度校准与答案准确性,实现回答前输出置信度,提升不确定性估计效率。
让导师角色为LLMs发声:通过偏好优化从对话中学习引导向量
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) ; Eedi
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出使用偏好优化训练引导向量,从人类导师-学生对话中提取导师角色信息,以控制大语言模型的行为,实现多样化的教学风格。
Comments Accepted to ACL 2026 BEA Workshop
因果直接偏好优化用于分布鲁棒的生成式推荐
机构 * Northeastern University, Shenyang, China(东北大学,沈阳,中国) ; Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区,中国)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对直接偏好优化(DPO)在生成式推荐中放大环境混杂因素导致的虚假相关性问题,提出CausalDPO,通过因果不变性学习、后门调整和软聚类环境建模来提升分布外泛化性能。
Comments 22 pages, 3 figures
基于注意力的令牌加权直接偏好优化
机构 * Cornell University(康奈尔大学) ; Vanderbilt University(范德比大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出Token-weighted DPO (TwDPO)方法,利用注意力机制估计令牌权重,在不增加额外训练成本的情况下提升大语言模型与人类偏好对齐的性能。
自回归语言模型实际上是能量模型:对下一个词元预测的预见能力的洞察
机构 * Google DeepMind(谷歌DeepMind)
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);post-training(abstract)
AI总结 本文通过建立自回归模型与能量模型之间的双射,揭示了自回归模型在下一个词元预测范式下具备预见能力,并提供了理论误差界。
MultiPhishGuard: 一种用于钓鱼邮件检测的可解释且自适应的多智能体大语言模型系统
机构 * The University of Auckland(奥克兰大学)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);prompting(abstract);分类 cs.AI
AI总结 提出基于LLM的多智能体框架MultiPhishGuard,通过协调文本、URL、元数据等五个专业智能体并利用PPO动态加权,结合对抗训练提升对新型钓鱼策略的鲁棒性,在公开数据集上达到97.89%准确率。