PRISM: Parallel Reward Integration with Symmetry for MORL
PRISM: 基于对称性的并行奖励整合用于多目标强化学习
机构 * University of Edinburgh(爱丁堡大学) ; Meta Superintelligence Labs(Meta超智能实验室)
AI总结 PRISM通过引入基于对称性的并行奖励整合算法,解决多目标强化学习中稀疏奖励与密集奖励之间的样本效率问题,提升Pareto覆盖和分布平衡。
高校专区
PRISM: 基于对称性的并行奖励整合用于多目标强化学习
机构 * University of Edinburgh(爱丁堡大学) ; Meta Superintelligence Labs(Meta超智能实验室)
AI总结 PRISM通过引入基于对称性的并行奖励整合算法,解决多目标强化学习中稀疏奖励与密集奖励之间的样本效率问题,提升Pareto覆盖和分布平衡。
神经-HSS:分层半分离神经PDE求解器
机构 * Gran Sasso Science Institute, L'Aquila, Italy.(格兰萨索科学研究所) ; University of Edinburgh, UK.(爱丁堡大学)
AI总结 Neural-HSS通过分层半分离矩阵结构高效求解PDEs,展示在低数据条件下优于基线方法的性能。
通过减法思考:基于置信度的对比解码用于大语言模型推理
机构 * Peking University, Beijing, China(北京大学) ; University of Edinburgh, Edinburgh, UK(爱丁堡大学)
AI总结 通过置信度驱动的对比解码方法提升大语言模型推理可靠性,减少输出长度并提高准确性。
分析用于表格事实验证的LLM指令优化
机构 * University of Edinburgh(爱丁堡大学)
AI总结 本文研究了指令优化在表格事实验证中的应用,发现MiPROv2在CoT中表现最佳,SIMBA在ReAct中效果显著,且CoT在小模型中仍有效。