Policy Improvement Reinforcement Learning
策略改进强化学习
机构 * Beihang University(北航) ; Peking University(北京大学)
AI总结 提出策略改进强化学习(PIRL)框架,通过最大化跨迭代的累积策略改进来替代替代奖励最大化,并基于此设计策略改进策略优化(PIPO)算法,实现闭环优化,在数学推理基准上提升稳定性和性能。
高校专区
策略改进强化学习
机构 * Beihang University(北航) ; Peking University(北京大学)
AI总结 提出策略改进强化学习(PIRL)框架,通过最大化跨迭代的累积策略改进来替代替代奖励最大化,并基于此设计策略改进策略优化(PIPO)算法,实现闭环优化,在数学推理基准上提升稳定性和性能。
调谐反向蒸馏:使用跨模态调谐器增强多模态工业异常检测
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; Key Laboratory of Intelligent Bionic Unmanned Systems, Ministry of Education(教育部智能仿生无人系统重点实验室) ; School of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能学院) ; School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)
AI总结 本文针对多模态工业异常检测问题,提出基于多分支设计的调谐反向蒸馏方法,通过为各模态设独立分支及设计跨模态调谐器,增强模态交互,能更精细检测异常,实验验证其在多模态异常检测和定位上达最优性能。
Comments Accepted by TMM