Rethinking the Divergence Regularization in LLM RL
重新思考LLM强化学习中的散度正则化
机构 * Tencent Hunyuan(腾讯混元) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学)
AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。
高校专区
重新思考LLM强化学习中的散度正则化
机构 * Tencent Hunyuan(腾讯混元) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学)
AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。
Muon 比 Adam 学习更鲁棒和可迁移的特征
机构 * Yale University(耶鲁大学) ; National University of Singapore(新加坡国立大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Academy of Mathematics and Systems Science, CAS(中国科学院数学与系统科学研究院)
AI总结 本文通过鲁棒性和可迁移性视角,证明 Muon 优化器相比 Adam 和 SGD 能学习到更鲁棒、更可迁移的特征,并通过理论分析支持了经验发现。
基于语料库特征扩散的繁体中文家长会自动化个别化教育计划生成
机构 * National University of Singapore(新加坡国立大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 针对繁体中文个别化教育计划(IEP)生成中数据稀缺和隐私限制问题,提出基于语料库特征扩散(CGFD)的低资源微调流程,通过种子选择、特征扩散和语法约束解码(GCD)生成高质量样本,并发现GCD在繁体中文下适得其反,无GCD路径在可靠性和速度上更优。
Comments 12 pages, 5 figures
引入多重语义网络作为跨语言样本中创造性联想知识的多面表示
机构 * CogNosco Lab, Department of Psychology and Cognitive Science, University of Trento(CogNosco实验室,心理学与认知科学系,特伦托大学) ; Department of Science Education, University of Education Upper Austria(科学教育系,上奥地利教育大学) ; Department of Psychology, The Pennsylvania State University(心理学系,宾夕法尼亚州立大学) ; Department of Psychology, National University of Singapore(心理学系,新加坡国立大学)
AI总结 本研究通过从六种认知任务构建的多重语义网络,更全面地建模创造力背后的联想知识,并利用机器学习预测个体创造力得分,证明多重网络比单一任务更有效。
物理引导的序列生成框架用于声学超材料逆向设计
机构 * National University of Singapore(新加坡国立大学) ; UT Austin(德克萨斯大学奥斯汀分校)
AI总结 提出MetaSeq框架,将声学超材料表示为结构化序列,通过序列到序列模型结合物理求解器和强化学习,实现宽带逆向设计,误差降低45%。
基于离散令牌LLM的文本转语音系统的端到端训练
机构 * National University of Singapore(新加坡国立大学)
AI总结 提出统一训练语音分词器、LLM、流匹配模型和奖励模型的端到端框架,通过多任务联合优化提升离散令牌TTS性能,在Seed-TTS-Eval上达到新SOTA。
扩散语言模型中不变性与独立性解码的统一能量
机构 * National University of Singapore(新加坡国立大学) ; Stanford University(斯坦福大学) ; City University of Hong Kong(香港城市大学)
AI总结 针对扩散语言模型并行生成文本时与自回归模型的性能差距,提出统一能量(Uni-E)方法,通过不变能量和独立能量解决模型容量、依赖性和不变性问题,无需采样即可精确计算,并能纠正分布偏移。
激活引导引发突现失调:一项更全面的评估
机构 * Nanyang Technological University(南洋理工大学) ; Sun Yat-sen University(中山大学) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
AI总结 研究激活引导是否引发突现失调,通过扩展评估范围,发现激活引导可导致广泛失调,且比微调产生更连贯的有害响应,并分析了关键因素。
潜在扩散策略:为基于扩散的机器人操作塑造潜在空间
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出两阶段框架LDP,通过CVAE编码器吸收场景理解,在预浓缩的潜在空间中进行流匹配,简化学习并提升多臂协调任务性能。
Real-IKEA:物理保真度是鲁棒操作的前提
机构 * National University of Singapore(新加坡国立大学) ; Peking University(北京大学)
AI总结 针对仿真与现实物理差异导致操作鲁棒性不足的问题,提出Real-IKEA数据集与仿真框架,通过高保真资产和阻力校准配置,使强化学习策略发现优先利用机械优势的鲁棒策略。
GIFT: 基于LLM引导的状态-奖励接口用于金融强化学习
机构 * East China University of Science and Technology(华东理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Southwestern University of Finance and Economics(西南财经大学) ; University of Sydney(悉尼大学) ; City University of Hong Kong(香港城市大学) ; Northeastern University(东北大学) ; The Ohio State University(俄亥俄州立大学) ; National University of Singapore(新加坡国立大学)
AI总结 提出GIFT框架,利用大语言模型引导PPO强化学习中的状态增强和奖励塑造,提升金融交易策略的样本外风险调整收益。
Comments 25 pages, 7 figures. Code and data are available at https://github.com/KAG778/GIFT . Equal contribution: Yanyan Wu and Boyi Zhang. Corresponding author: Youhua Li
通过训练感知的条件扩散模型改进贝叶斯优化
机构 * National University of Singapore(新加坡国立大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出利用条件扩散模型高效近似最优解分布,并开发贝叶斯优化固有的训练策略和基于扩散的模态搜索采集函数,理论保证次优性,实验优于标准基线。
AsyncLane: 扩散语言模型解码中精炼与推进的解耦
机构 * National University of Singapore(新加坡国立大学) ; University of Southampton(南安普顿大学)
AI总结 提出AsyncLane,一种无需训练的解码调度器,通过将生成过程分叉为精炼和推进两个通道,解耦块间依赖,在保持质量的同时显著提升扩散语言模型的解码吞吐量。
自进化科学智能体发现可泛化的物理推理流体控制
机构 * National University of Singapore(新加坡国立大学)
AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。
SAGE: 一种LLM驱动的自我反思智能体框架用于欺诈检测
机构 * National University of Singapore(新加坡国立大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; China Mobile Communications Group(中国移动通信集团有限公司)
AI总结 提出SAGE,首个端到端LLM驱动的多智能体欺诈检测框架,通过数据诊断树和自然语言梯度优化,在五个数据集上平均F1提升40.86%。
PAFO: 个性化奖励建模的帕累托公平优化
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学)
AI总结 针对个性化奖励模型因训练数据偏好不平衡导致对少数用户群体存在偏见的问题,提出PAFO框架,通过帕累托公平优化提升弱势群体性能而不损害其他群体,实验表明能同时提高少数和多数群体准确率并降低不公平性。
TRACER: 面向生成式推荐中概念擦除的令牌重分配
机构 * Stony Brook University(石英布鲁克大学) ; University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) ; Columbia University(哥伦比亚大学) ; Institute of Science and Technology Austria(奥地利科学技术研究院) ; Sapienza University of Rome(罗马大学 sapienza) ; National University of Singapore(新加坡国立大学)
AI总结 针对生成式推荐中概念遗忘与推荐效用冲突的问题,提出基于令牌重分配的概念遗忘框架TRACER,通过将概念相关物品重分配给替代令牌并引入一致性正则化,有效移除目标概念同时保持推荐效用。
DIYHealth Suite:家庭健康管理的数据集、模型与基准
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 针对家庭健康管理中的数据异构、任务多变和缺乏统一基准等问题,提出包含大规模多模态数据集DIYHealth-900K、自适应基础模型DIYHealthGPT(采用混合超低秩适应技术)和首个家庭护理基准DIYHealthBench的综合框架,在11项任务上达到最优性能。
Comments Accepted by ICML 2026