Rethinking the Divergence Regularization in LLM RL
重新思考LLM强化学习中的散度正则化
机构 * Tencent Hunyuan(腾讯混元) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学)
AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。
高校专区
重新思考LLM强化学习中的散度正则化
机构 * Tencent Hunyuan(腾讯混元) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学)
AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。
Muon 比 Adam 学习更鲁棒和可迁移的特征
机构 * Yale University(耶鲁大学) ; National University of Singapore(新加坡国立大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Academy of Mathematics and Systems Science, CAS(中国科学院数学与系统科学研究院)
AI总结 本文通过鲁棒性和可迁移性视角,证明 Muon 优化器相比 Adam 和 SGD 能学习到更鲁棒、更可迁移的特征,并通过理论分析支持了经验发现。
基于语料库特征扩散的繁体中文家长会自动化个别化教育计划生成
机构 * National University of Singapore(新加坡国立大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 针对繁体中文个别化教育计划(IEP)生成中数据稀缺和隐私限制问题,提出基于语料库特征扩散(CGFD)的低资源微调流程,通过种子选择、特征扩散和语法约束解码(GCD)生成高质量样本,并发现GCD在繁体中文下适得其反,无GCD路径在可靠性和速度上更优。
Comments 12 pages, 5 figures
引入多重语义网络作为跨语言样本中创造性联想知识的多面表示
机构 * CogNosco Lab, Department of Psychology and Cognitive Science, University of Trento(CogNosco实验室,心理学与认知科学系,特伦托大学) ; Department of Science Education, University of Education Upper Austria(科学教育系,上奥地利教育大学) ; Department of Psychology, The Pennsylvania State University(心理学系,宾夕法尼亚州立大学) ; Department of Psychology, National University of Singapore(心理学系,新加坡国立大学)
AI总结 本研究通过从六种认知任务构建的多重语义网络,更全面地建模创造力背后的联想知识,并利用机器学习预测个体创造力得分,证明多重网络比单一任务更有效。
物理引导的序列生成框架用于声学超材料逆向设计
机构 * National University of Singapore(新加坡国立大学) ; UT Austin(德克萨斯大学奥斯汀分校)
AI总结 提出MetaSeq框架,将声学超材料表示为结构化序列,通过序列到序列模型结合物理求解器和强化学习,实现宽带逆向设计,误差降低45%。
基于离散令牌LLM的文本转语音系统的端到端训练
机构 * National University of Singapore(新加坡国立大学)
AI总结 提出统一训练语音分词器、LLM、流匹配模型和奖励模型的端到端框架,通过多任务联合优化提升离散令牌TTS性能,在Seed-TTS-Eval上达到新SOTA。
扩散语言模型中不变性与独立性解码的统一能量
机构 * National University of Singapore(新加坡国立大学) ; Stanford University(斯坦福大学) ; City University of Hong Kong(香港城市大学)
AI总结 针对扩散语言模型并行生成文本时与自回归模型的性能差距,提出统一能量(Uni-E)方法,通过不变能量和独立能量解决模型容量、依赖性和不变性问题,无需采样即可精确计算,并能纠正分布偏移。
激活引导引发突现失调:一项更全面的评估
机构 * Nanyang Technological University(南洋理工大学) ; Sun Yat-sen University(中山大学) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
AI总结 研究激活引导是否引发突现失调,通过扩展评估范围,发现激活引导可导致广泛失调,且比微调产生更连贯的有害响应,并分析了关键因素。
潜在扩散策略:为基于扩散的机器人操作塑造潜在空间
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出两阶段框架LDP,通过CVAE编码器吸收场景理解,在预浓缩的潜在空间中进行流匹配,简化学习并提升多臂协调任务性能。
Real-IKEA:物理保真度是鲁棒操作的前提
机构 * National University of Singapore(新加坡国立大学) ; Peking University(北京大学)
AI总结 针对仿真与现实物理差异导致操作鲁棒性不足的问题,提出Real-IKEA数据集与仿真框架,通过高保真资产和阻力校准配置,使强化学习策略发现优先利用机械优势的鲁棒策略。
GIFT: 基于LLM引导的状态-奖励接口用于金融强化学习
机构 * East China University of Science and Technology(华东理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Southwestern University of Finance and Economics(西南财经大学) ; University of Sydney(悉尼大学) ; City University of Hong Kong(香港城市大学) ; Northeastern University(东北大学) ; The Ohio State University(俄亥俄州立大学) ; National University of Singapore(新加坡国立大学)
AI总结 提出GIFT框架,利用大语言模型引导PPO强化学习中的状态增强和奖励塑造,提升金融交易策略的样本外风险调整收益。
Comments 25 pages, 7 figures. Code and data are available at https://github.com/KAG778/GIFT . Equal contribution: Yanyan Wu and Boyi Zhang. Corresponding author: Youhua Li
通过训练感知的条件扩散模型改进贝叶斯优化
机构 * National University of Singapore(新加坡国立大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 提出利用条件扩散模型高效近似最优解分布,并开发贝叶斯优化固有的训练策略和基于扩散的模态搜索采集函数,理论保证次优性,实验优于标准基线。
AsyncLane: 扩散语言模型解码中精炼与推进的解耦
机构 * National University of Singapore(新加坡国立大学) ; University of Southampton(南安普顿大学)
AI总结 提出AsyncLane,一种无需训练的解码调度器,通过将生成过程分叉为精炼和推进两个通道,解耦块间依赖,在保持质量的同时显著提升扩散语言模型的解码吞吐量。
自进化科学智能体发现可泛化的物理推理流体控制
机构 * National University of Singapore(新加坡国立大学)
AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。
SAGE: 一种LLM驱动的自我反思智能体框架用于欺诈检测
机构 * National University of Singapore(新加坡国立大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; China Mobile Communications Group(中国移动通信集团有限公司)
AI总结 提出SAGE,首个端到端LLM驱动的多智能体欺诈检测框架,通过数据诊断树和自然语言梯度优化,在五个数据集上平均F1提升40.86%。
PAFO: 个性化奖励建模的帕累托公平优化
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学)
AI总结 针对个性化奖励模型因训练数据偏好不平衡导致对少数用户群体存在偏见的问题,提出PAFO框架,通过帕累托公平优化提升弱势群体性能而不损害其他群体,实验表明能同时提高少数和多数群体准确率并降低不公平性。
TRACER: 面向生成式推荐中概念擦除的令牌重分配
机构 * Stony Brook University(石英布鲁克大学) ; University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) ; Columbia University(哥伦比亚大学) ; Institute of Science and Technology Austria(奥地利科学技术研究院) ; Sapienza University of Rome(罗马大学 sapienza) ; National University of Singapore(新加坡国立大学)
AI总结 针对生成式推荐中概念遗忘与推荐效用冲突的问题,提出基于令牌重分配的概念遗忘框架TRACER,通过将概念相关物品重分配给替代令牌并引入一致性正则化,有效移除目标概念同时保持推荐效用。
DIYHealth Suite:家庭健康管理的数据集、模型与基准
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 针对家庭健康管理中的数据异构、任务多变和缺乏统一基准等问题,提出包含大规模多模态数据集DIYHealth-900K、自适应基础模型DIYHealthGPT(采用混合超低秩适应技术)和首个家庭护理基准DIYHealthBench的综合框架,在11项任务上达到最优性能。
Comments Accepted by ICML 2026
ThinkBooster: 一种用于LLM推理无缝测试时扩展的统一框架
机构 * MBZUAI ; ETH Zürich(苏黎世联邦理工学院) ; Imperial College London(伦敦帝国理工学院) ; NUS(国立大学新加坡) ; Accenture(埃森哲) ; Innopolis University(因诺普里斯大学) ; Independent Researcher(独立研究者)
AI总结 提出ThinkBooster框架,通过模块化库、联合评估基准和可部署代理服务,实现LLM推理的测试时计算扩展,在数学和编码任务上验证了性能-计算权衡。
STaR-Quant:扩散大语言模型的状态-时间一致训练后量化
机构 * School of Artificial Intelligence, Beijing Normal University, Beijing, China(北京师范大学人工智能学院) ; Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) ; Centre for Frontier AI Research, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局前沿人工智能研究中心)
AI总结 针对扩散大语言模型低比特量化中的状态相关激活差异和时间误差累积问题,提出STaR-Quant框架,通过状态引导激活变换和时间注意力补偿实现高效量化。
MIRAGE: 具有隐式推理和生成世界模型的移动智能体
机构 * Beihang University(北京航空航天大学) ; Northwestern Polytechnical University(西北工业大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; National University of Singapore(新加坡国立大学) ; Peking University(北京大学)
AI总结 提出MIRAGE框架,通过从显式推理轨迹学习连续潜在表示,使移动智能体能够内部推理并预测未来屏幕状态,在减少生成token的同时提升执行效率。
通过机器学习加速可分负载处理:大规模工作负载的实用框架
机构 * Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学)
AI总结 提出首个机器学习框架,使用前馈神经网络预测单级树网络架构中的最优处理时间,实现97-99%准确率和1-5%平均绝对百分比误差,推理时间小于1毫秒,相比传统方法加速10-100倍。
FingerEye:通过连续视觉-触觉感知学习灵巧操作
机构 * National University of Singapore(新加坡国立大学) ; RoboScience(机器人科学) ; Huazhong University of Science and Technology(华中科技大学) ; South China University of Technology(华南理工大学)
AI总结 FingerEye通过连续视觉-触觉感知提升机器人灵巧操作,结合视觉和触觉反馈,在模拟和现实环境中使腕部策略的成功率提升超30个百分点。
IGenBench:文本到信息图生成可靠性基准测试
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) ; UESTC ; University of Virginia(弗吉尼亚大学) ; HKUST(GZ)(香港科技大学(广州)) ; Cornell University(康奈尔大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
AI总结 提出IGENBENCH基准,包含30种信息图类型和600个测试用例,通过多模态大语言模型分解为10类原子问题评估10种T2I模型,发现数据完整性等维度是普遍瓶颈。
SAD-Flower:用于安全、可接受和动态一致规划的流匹配
机构 * TUM School of Computation, Information and Technology, Technical University of Munich, Munich, Germany.(慕尼黑技术大学计算、信息与技术学院) ; Munich Institute of Robotics(慕尼黑机器人与智能机构研究所) ; Munich Data Science Institute (MDSI)(慕尼黑数据科学研究所) ; National University of Singapore(新加坡国立大学) ; National Taiwan University (NTU)(国立台湾大学) ; NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立台湾大学人工智能研究中心) ; University of Utah(犹他大学) ; Beijing Institute of Technology(北京理工大学) ; McGill University(麦吉尔大学)
AI总结 提出SAD-Flower框架,通过虚拟控制输入增强流匹配,利用非线性控制理论提供状态约束、动作约束和动态一致性的形式化保证,无需重新训练即可在测试时满足未见约束。
Audio-FLAN:面向语音、音乐和声音的统一音频理解与生成的指令跟随数据集
机构 * The Hong Kong University of Science(香港科学与技术大学) ; Inner Mongolia University(内蒙古大学) ; Beihang University(北京航空航天大学) ; Queen Mary University of London(伦敦玛丽女王大学) ; The Chinese University of Hong Kong(香港中文大学) ; National University of Singapore(新加坡国立大学) ; University of Surrey(萨里大学) ; University of Rochester(罗切斯特大学) ; Independent Researcher(独立研究者)
AI总结 提出Audio-FLAN数据集,包含80种任务和1亿实例,支持统一音频理解与生成的零样本学习。