BRECQ: Pushing the Limit of Post-Training Quantization by Block Reconstruction
专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG
专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG
专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG
Comments 9 pages, 4 figures, 4 tables
专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG
Comments Published as a conference paper at ICML 2020
专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG
Comments Preprint, 9 pages. arXiv admin note: text overlap with arXiv:1906.03509
通过拒绝别名缓解删除(Abliteration)攻击
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型的删除(Abliteration)攻击,提出AMRA权重编辑防御方法,在Llama-3-8B和Gemma-2-9B上有效提升删除后的拒绝能力,同时控制了性能损失。
通过隐式文化对齐奖励建模消除文本到图像评估中的偏差
机构 * National Tsing Hua University(国立清华大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG
AI总结 研究文本到图像评估中文化真实性问题,提出基于轻量级多模态大语言模型构建的隐式文化对齐奖励模型,集成隐式文化探测器与跳跃连接交叉注意力机制,实验证明该模型准确率高、速度快,能为偏好优化管道提供有效信号。
Comments 16 pages, 2 figures, ECCV 2026 Workshop FAILED
长视界终端任务的递归合成
机构 * Tencent HY LLM Frontier(腾讯HY大模型前沿团队) ; University of Georgia(佐治亚大学) ; University of Maryland, College Park(马里兰大学帕克分校) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Minnesota, Twin Cities(明尼苏达大学双城分校) ; Indiana University(印第安纳大学) ; National University of Singapore(新加坡国立大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RST递归合成框架,低成本规模化生成3.7万余个长视界终端任务,经微调或PPO优化后,多款Qwen模型在多个终端基准任务上性能显著提升,且递归过程无明显上限。
GCPO:针对大语言模型的rollout强化学习中子空间几何的诊断与约束
机构 * Shanghai AI Lab(上海人工智能实验室)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 GCPO通过几何约束策略优化方法,诊断rollout强化学习的子空间几何问题,在大语言模型后训练中提升了多任务性能并解决了训练不稳定等问题
Comments 15 pages, 10 figures
强化步骤级推理以实现大语言模型的有效自校正
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; VinUniversity ; Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。
优化策略的学习内容:可恢复性感知的展开干预学习
机构 * University of Notre Dame(圣母大学) ; Amazon, Inc(亚马逊公司)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 针对现有大语言模型后训练中展开分配的局限,本文提出RAIL框架,将干预选择建模为在线上下文博弈问题,可在有限展开预算下提升性能,为生成高质量展开提供原则性方法。
SpecRoll:用于投机强化学习rollout的快慢校验器反馈自适应方法
机构 * VNU University of Engineering and Technology(越南国家大学河内理工大学) ; Viettel AI(越南电信人工智能公司)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 SpecRoll是一种投机强化学习rollout引擎,通过快慢双时间尺度自适应结合相关校验机制,在5个1.5B-14B模型和3个数学推理数据集上,相比普通GRPO和FastGRPO实现了生成与端到端速度的显著提升。
个性化奖励基准:评估与人类对齐的个性化
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出个性化奖励基准,用于评估奖励模型对个性化偏好的建模能力,发现现有模型在个性化任务中表现不佳,且该基准在下游任务中具有更高的预测相关性。
Comments Accepted to COLM 2026. Dataset: https://huggingface.co/datasets/QiyaoMa/Personalized-RewardBench
通过基于方差感知的评分规则奖励与GRPO改进LLMs中心脏医学问答
机构 * School of Electrical and Computer Engineering, University of Oklahoma, Norman, OK, USA(电气与计算机工程学院,俄克拉荷马大学,诺曼,OK,USA) ; Intelligent Neuromorphic and Quantum Understanding for Innovative Research and Engineering (INQUIRE) Laboratory, University of Oklahoma, Norman, OK, USA(创新研究与工程智能神经形态与量子理解实验室,俄克拉荷马大学,诺曼,OK,USA) ; Khiabani Data Science and Analytics Institute, University of Oklahoma, Norman, OK, USA(Khiabani数据科学与分析研究所,俄克拉荷马大学,诺曼,OK,USA) ; Data Institute for Societal Challenges (DISC), University of Oklahoma, Norman, OK, USA(社会挑战数据研究所(DISC),俄克拉荷马大学,诺曼,OK,USA) ; School of Industrial and Systems Engineering, University of Oklahoma, Norman, OK, USA(工业与系统工程学院,俄克拉荷马大学,诺曼,OK,USA) ; Office of Responsible Artificial Intelligence (ORAI), University of Arizona, Tucson, AZ, USA(负责任人工智能办公室(ORAI),亚利桑那大学,图森,AZ,USA)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 提出一种方差感知奖励框架,结合GRPO和RaR-Medicine的评分规则,通过连续分析奖励函数替代离散聚合,提升LLMs在心脏医学问答上的准确率和F1分数。
Comments 27 Pages
对比性弱到强泛化
机构 * ustc(中国科学技术大学) ; nus(新加坡国立大学) ; zgc(中关村学院) ; smu(新加坡管理学院)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对弱到强泛化中弱模型输出噪声和偏差问题,利用隐式奖励与对比解码的联系,提出ConG框架,通过对比解码生成高质量样本,实现可靠能力转移等,经实证验证其有效性和通用性,推动了弱到强泛化及通向通用人工智能。
STAIF:一种用于复杂指令跟随的逐阶段优化方法
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK Research Group(科大讯飞研究院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型遵循复杂指令的挑战,提出STAIF逐阶段优化框架,先通过偏好优化提高软约束敏感度,再用可验证奖励强化学习确保硬约束遵守,构建相关数据集,验证了该方法的设计并展现出领先性能和泛化能力。
Comments 16 pages, 6 figures
DeLIVeR:通过强化知识图谱探索进行基于信息的真实性识别的分解学习
机构 * University of Louisville(路易斯维尔大学) ; Denison University(丹尼森大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型自动事实核查难题,DeLIVeR框架将证据检索设为强化探索任务,利用规划器大语言模型分解声明获问题集遍历知识图谱找证据,经GRPO优化策略,实验表明其显著优于基线,有效弥合推理差距,提供检测路径。
Comments Accepted to 7th International Conference on Deep Learning Theory and Applications (DeLTA 2026)
AIGB-R1:通过分层规划器-执行器优化实现自我进化的生成式自动出价
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Alibaba Group(阿里巴巴集团)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究针对AIGB范式在自动出价中存在的问题,提出AIGB-R1框架,利用大语言模型推理能力,通过分层规划器与执行器模块、经验驱动循环、两阶段训练及新优化方法,经实验验证该框架在自动出价任务中的有效性。
通过监督学习框架实现隐式Actor-Critic耦合的RLVR方法
机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 PACS通过监督学习框架实现隐式Actor-Critic耦合,提升RLVR中奖励信号的稳定性与训练效率。
Comments ICML 2026
模型表达、抑制和抗拒的内容:使用角色向量审计开放权重语言模型
机构 * Emory University(埃默里大学)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究通过大规模系统应用角色向量审计开放权重语言模型,编制特征清单并标记其性质,发现模型默认行为特点,引导在默认外特征效果好,且角色向量可探测行为组织。
RL-Struct:用于大语言模型中可靠结构化输出的轻量级强化学习框架
机构 * School of Information Science and Technology(信息科学与技术学院) ; Hainan Normal University(海南师范大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型输出与结构化需求的差距问题,提出RL-Struct轻量级框架,运用GRPO及分层奖励函数,消除评论家网络,减少显存。在复杂JSON任务中表现出色,实现高准确率和有效性,还呈现新兴课程学习过程,模型可公开获取。
Comments Withdrawn by the authors due to substantial errors in the references, terminology, and experimental reporting, which affect the reliability and reproducibility of the manuscript. The authors are conducting a comprehensive re-evaluation and do not consider the current version suitable for citation
ToolAnchor:锚定反事实上下文以提升智能体工具使用能力
机构 * Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学) ; MIT(麻省理工学院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究针对工具增强大语言模型智能体在工具集扩展时的问题,提出ToolAnchor框架,通过在关键决策点注入反事实锚定上下文打破行为惯性,经教师模型假设、学生展开验证及智能体后训练,提升其在扩展工具集下的性能,为智能体强化学习开辟新路径。
当你只有合成语音时:最好调用GRPO
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究基于大语言模型的ASR在受监管领域因隐私问题受限,转向强化学习,用GRPO方法处理合成语音,相比监督微调,GRPO能大幅降低WER,还分析了GRPO的优势及收益来源,表明合成语音为主时强化学习更优。
Comments Submitted to SLT 2026
用于智能强化学习的单步异步优化
机构 * Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究针对异步强化学习中训练稳定性和离策略挑战,提出单步异步优化(SAO)。核心方法是用单步采样取代分组采样,改进单步策略并引入裁剪策略。主要贡献是SAO训练稳定,性能优于GRPO及其变体,在模拟在线学习中有效且成功部署于模型训练。
理解引导强度
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 研究大语言模型训练后控制中引导强度问题,提出对其首次理论分析,刻画其对相关量的影响并推导规律,揭示非单调效应,还通过11个语言模型实验验证了理论预测。
Comments Accepted for publication at ICML 2026 (50 pages)
重新思考无评论强化学习中的分组
机构 * Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所) ; University of Waterloo(滑铁卢大学) ; The Chinese University of Hong Kong(香港中文大学) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 针对无评论强化学习分组策略的数据低效和同步问题,提出负令牌过滤方法,实现单次 rollout 稳定训练,在推理和代理任务上表现相当或更优。
模型知晓,解码器发现:未来价值引导的粒子力量采样
机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)
专题命中 后训练与偏好优化 :LLM(summary_cn);post-training(abstract);分类 cs.AI、cs.LG
AI总结 本文提出APPS算法,通过块状粒子方法高效定位LLM的多步解,提升推理准确率与运行效率,减少对训练数据的依赖。
理解奖励模型中的有用性与无害性张力
机构 * University of Copenhagen(哥本哈根大学)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.LG
AI总结 通过激活分析和消融实验,发现奖励模型中有用性和无害性目标存在干扰,共享神经元对模型行为影响不成比例,导致对齐张力。
Comments The source code used in this study is publicly available at: https://github.com/EshaanT/RM-alignment\_tension
TD-Grokking:通过训练时分解从零奖励问题中学习
机构 * Ningyuan Xi 1,2(西宁元 1,2) ; Hao Xu 3(许浩 3) ; Hongsheng Xin 3(辛红生 3) ; Ning Miao 1,2, †(苗宁 1,2, †)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 针对强化学习在零奖励问题上无法提供优化信号的问题,提出训练时分解框架TD-Grokking,将难解问题递归分解为可验证子问题,在数学和医疗任务上优于基线方法。
SD-GRPO:面向长格式视觉-语言生成的可验证片段分解
机构 * DEEPNOID Inc.(DEEPNOID公司)
专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出SD-GRPO方法,通过将长格式输出分解为片段并计算逐片段优势,解决GRPO在视觉-语言任务中粗粒度信用分配不足的问题,实验证明其在多种长格式生成任务中优于基线。