Rethinking the Divergence Regularization in LLM RL
重新思考LLM强化学习中的散度正则化
机构 * Tencent Hunyuan(腾讯混元) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学)
AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。
高校专区
重新思考LLM强化学习中的散度正则化
机构 * Tencent Hunyuan(腾讯混元) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学)
AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。
中性面具:RLHF如何提供浅层对齐而保留大语言模型中的党派结构
机构 * Vanderbilt University(范德堡大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; National Center for Supercomputing Applications(国家超级计算应用中心)
AI总结 研究RLHF对Llama 3.1 8B党派倾向的影响,发现RLHF仅压缩党派信号方差以实现中性输出,而非移除党派结构,且特征级操控可绕过对齐。
PaperMentor:面向Overleaf的AI研究论文写作人本多智能体辅导系统
机构 * CMU(卡内基梅隆大学) ; Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室,多伦多大学与向量研究所) ; EuroSafeAI ; ETHZ(苏黎世联邦理工学院) ; EPFL(洛桑联邦理工学院) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所,德国图宾根)
AI总结 提出PaperMentor,一种在Overleaf中提供内联建议的人本写作助手,通过专家技能库和12个专业智能体提供可操作反馈,用户研究中90.6%建议被认为可操作。
Comments Accepted to the ACL 2026 Demo Track
放大镜:定位和操控大语言模型内的党派方向
机构 * Vanderbilt University(范德比尔特大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 通过线性探针在Llama 3.1 8B Instruct模型的隐藏状态中定位党派政治身份方向,并利用稀疏自编码器分解为可解释特征,因果干预可系统性改变模型输出,证明党派偏见是可定位和操控的几何特征。
超越个体角色:将合成对话对齐到群体层面的行为分布
机构 * Amazon(亚马逊) ; University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University College London(伦敦大学学院)
AI总结 提出GroupPersona框架,通过将参考语料库的行为分布转化为生成控制,使合成对话语料库在群体层面与参考分布对齐,在12个行为属性上Jensen-Shannon散度降低24.4%。
视觉语言模型能否感知传感器所感?一种可扩展的专家引导设计用于从街景评估轮椅可达性
机构 * University of Florida(佛罗里达大学) ; University of South Florida(南佛罗里达大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出专家引导的检索增强框架,利用视觉语言模型从谷歌街景图像识别轮椅可达性障碍,通过GPS轮椅停留行为验证,表明VLM评分与移动摩擦部分一致,但细粒度障碍识别有限。
LEAF: 无需分支的树生长方法用于语音感知大语言模型后训练
机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 针对语音感知大语言模型后训练中GRPO方法粗粒度信用分配问题,提出LEAF方法,通过回溯式树结构学习、高信息量边界选择和跨度级优势分配,在语音问答和翻译任务上超越GRPO。
Comments 15 pages, 3 figures, 11 tables