Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ACL 2024 Main Conference; Camera Ready
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Code, data, and models are available at https://github.com/dvlab-research/Step-DPO
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NAACL2024 Main Track Long Paper
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)
Comments 19 pages, 5 figures
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 25 pages, 4 figures
超越前缀局部性的混合强化学习回滚调度
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对混合RL回滚调度的异构性问题,提出MISA-T策略,在多基准实验中显著提升回滚吞吐量并降低平均轮次时间,同时维持缓存命中率与工作负载混合比例。
MemHarness:记忆是被重构的,而非被重放的
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对现有记忆增强LLM智能体的逐字重放范式缺陷,提出MemHarness框架,通过GRPO训练实现记忆重构,在ALFWorld、WebShop等任务中性能优于基线,提升了智能体推理与分布外鲁棒性。
Comments 20 pages, 13 figures
Omni-RRM:通过基于自动评分标准的偏好合成推进全模态奖励建模
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学) ; Institute of Artificial Intelligence (TeleAI)(人工智能研究所) ; ShiFang Technology Inc.(ShiFang科技公司)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究针对多模态大语言模型对齐难题,提出全模态基于评分标准的奖励模型Omni-RRM。通过自动评分标准偏好合成构建数据集,用特定训练方案提升奖励辨别力,在多模态基准测试中达最优精度,还能指导选择与迁移,提升模型对齐能力。
Comments ECCV 2026
学习从多文档中擦除私有知识以用于检索增强型大语言模型
机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) ; School of Artificial Intelligence, Beihang University, China(北京航空航天大学人工智能学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究所) ; Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院)
专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL
AI总结 提出Eraser4RAG,通过构建全局知识图谱、划分私有与公共子图并微调Flan-T5重写文档,结合PPO优化,有效擦除用户定义的私有知识,保留公共知识,防御去匿名化攻击。
基于数据的探索:面向人类反馈的在线强化学习
机构 * Center for Advanced Intelligence Project, RIKEN(日本理化学研究所先进智能研究中心) ; Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究生院) ; Northeastern University(东北大学) ; Zhejiang Gongshang University(浙江工商大学)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出数据依赖探索的偏好优化方法(DEPO),利用历史数据构建不确定性奖励,鼓励探索高价值区域,理论证明其数据依赖的遗憾界更紧,实验表明样本效率提升。
涌现对齐
机构 * CIIRC, Czech Technical University in Prague(捷克理工大学CIIRC)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 提出一种在线对齐技术,通过引入良心步骤和基于直接偏好优化的对齐损失,使大语言模型在训练、微调、对抗提示和零样本学习中自我纠正非伦理输出。
Comments Rejected from ICML 2026
多语言情感感知文本摘要:一种用于一致性维护的强化学习方法
机构 * Instituto Politécnico Nacional (IPN), Centro de Investigación en Computación (CIC)(国立理工学院(IPN),计算研究中心(CIC))
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究RLHF摘要中的情感漂移现象,提出基于策略归因框架的情感感知KL正则化方法,在保持摘要质量的同时缓解情感中性化。
人们真正希望从AI中得到什么?偏好多元性映射
机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) ; Meedan
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 通过分析75个国家1500份开放式回答,发现不同人对AI的期望各异,多数价值观仅被少数人要求,且同一词语(如“真实性”)含义分歧,某些能力存在争议,揭示当前RLHF偏好聚合方法的根本缺陷。
Comments Accepted at the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)
测试时的自反生成
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学) ; University of Edinburgh(爱丁堡大学) ; City University of Hong Kong(香港城市大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出SRGen框架,通过动态熵阈值识别高不确定性token并训练校正向量,在测试时进行自反生成以纠正概率分布,提升大模型推理的可靠性。
网格游戏:多个网格在量化大语言模型中的力量
机构 * ISTA ; ETH Zürich(苏黎世联邦理工学院) ; Red Hat AI(红帽人工智能)
专题命中 后训练与偏好优化 :large language model(title);language model(title);post-training(abstract);分类 cs.LG
AI总结 本文研究了通过多个网格提升大语言模型量化效果的方法,提出PO2网格问题并展示其在不同模型中的优势,实验表明自适应网格能提升精度。
Comments Preprint
调度与校准:面向代码LLM的实用导向多任务强化学习
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司)
专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(abstract);分类 cs.AI
AI总结 本文提出ASTOR框架,通过任务实用性驱动的协调机制,提升多任务强化学习在代码LLM中的效果,实验显示其在多个编码任务中优于专用专家和基线方法。
迭代微调大多是自洽的
机构 * University of Chicago(芝加哥大学)
专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);post-training(abstract);preference optimization(abstract);分类 cs.AI
AI总结 研究通过训练一系列模型,每个模型在前代生成的数据上微调,发现traits在SFT和SDF中衰减或保持不变,而DPO中traits放大需持续训练,但重新初始化后消失,表明持续微调可能引发traits放大,限制此阶段可作为防御手段。
大语言模型与人类偏好的统计不可能性与可能性:从康德斯悖论到纳什均衡
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Pennsylvania(宾夕法尼亚大学) ; Princeton University(普林斯顿大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文探讨了对齐大语言模型与人类偏好的统计限制,证明在一般概率偏好模型下,康德斯循环几乎必然存在,从而表明基于奖励的方法无法完全对齐偏好。同时,研究了非奖励方法下LLM采用混合策略的条件,证明在Luce模型下,少数群体偏好得以保留的统计可能性。
Comments Accepted for publication in the Annals of Statistics
Skills-Coach:一种通过无训练GRPO实现的自我进化技能优化器
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; East China Normal University(华东师范大学) ; Zhongguancun Academy(中关村学院) ; Southeast University(东南大学) ; Hainan University(海南大学) ; Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 Skills-Coach通过无训练GRPO框架提升LLM代理技能自我进化能力,包含四个核心模块,通过Skill-X基准测试展示其在多种技能类别中的显著性能提升。
医生贾克尔与 Mr. 海德:大语言模型的两面
机构 * University of Padova(帕多瓦大学) ; Radboud University(拉德博德大学) ; Delft University of Technology(代尔夫特理工大学) ; Örebro University(欧雷布罗大学) ; University of Zagreb Faculty of Electrical Engineering(Zagreb大学电子工程学院) ; University of Bergen(卑尔根大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究通过角色扮演攻击揭示大语言模型的安全漏洞,展示通过伪装复杂人格可获取非法信息,验证了多种模型在2023-2025年间对攻击的脆弱性。
Comments Presented at the Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), Cagliari, Italy, February 09-13, 2026. Published as Paper 35 in CEUR Workshop Proceedings, Vol-4198. Available at: https://ceur-ws.org/Vol-4198/
Journal ref Proc. Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), CEUR-WS.org, Vol-4198, 35, 2026
在代码生成中任意思考
机构 * School of Computer Science, Peking University(1 计算机科学系,北京大学) ; Tongyi Lab, Alibaba Group(2 龙洋实验室,阿里巴巴集团)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出Think-Anywhere机制,使LLM在代码生成过程中可按需调用推理,通过冷启动训练和基于结果的强化学习奖励,实现适应性推理,提升代码生成性能和可解释性。
基于人类反馈的安全强化学习策略梯度对偶方法
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出两种无需奖励模型拟合的Safe RLHF算法,将安全RLHF建模为无限 horizon 折扣约束马尔可夫决策过程,并保证了全局收敛性。