Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
多目标与混合奖励强化学习 via 奖励去相关策略优化
机构 * Meituan, China(美团,中国)
AI总结 本文提出RDPO方法,通过量化归一化和马氏白化处理,解决多任务和混合奖励环境中的奖励分布不均和相关性问题,提升模型在指令遵循和写作质量上的表现。
大厂专区
多目标与混合奖励强化学习 via 奖励去相关策略优化
机构 * Meituan, China(美团,中国)
AI总结 本文提出RDPO方法,通过量化归一化和马氏白化处理,解决多任务和混合奖励环境中的奖励分布不均和相关性问题,提升模型在指令遵循和写作质量上的表现。
TouchAnything: 一个用于从第一人称视频中估计双臂触觉的数据库和框架
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) ; Meituan Academy of Robotics(美团机器人研究院) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
AI总结 本文提出EgoTouch数据库和TouchAnything框架,通过多视角视频数据提升双臂触觉估计性能,实验表明结合腕部视角可提升接触和体积IoU指标。
MAP:一种用于长周期交互代理推理的先映射再行动范式
机构 * University of Science and Technology of China(中国科学技术大学) ; Meituan(美团) ; Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Tianjin University(天津大学)
AI总结 本文提出MAP范式,通过先构建环境认知再执行任务,解决交互代理中环境感知延迟问题,实验显示在多个基准测试中表现优异。
非对称在线策略蒸馏:在令牌层面弥合利用与模仿
机构 * Huazhong University of Science and Technology(华中科技大学) ; Peking University(北京大学) ; Meituan(美团)
AI总结 本文提出非对称在线策略蒸馏,通过局部散度最小化改进传统策略蒸馏,提升数学推理任务表现,实现更稳定的策略熵和持续工具使用能力。