SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling
SP3O:无需奖励建模的分段偏好强化学习
机构 * University of Michigan(密歇根大学)
AI总结 SP3O是一种无需奖励建模的新型PbRL算法,利用分段级偏好反馈,通过PPO型损失函数优化策略,在机器人控制和LLM微调等长视界任务中性能优于现有算法。
高校专区
SP3O:无需奖励建模的分段偏好强化学习
机构 * University of Michigan(密歇根大学)
AI总结 SP3O是一种无需奖励建模的新型PbRL算法,利用分段级偏好反馈,通过PPO型损失函数优化策略,在机器人控制和LLM微调等长视界任务中性能优于现有算法。
GeoID-PINN:考虑地理耦合的可识别性感知区域流行病推断方法
机构 * University of Michigan(密歇根大学)
AI总结 本研究提出GeoID-PINN,一种结合地理耦合与正则化的物理信息神经网络,用于区域流行病SIRD动力学推断,在模拟数据与路易斯安那州64个县COVID-19数据上均提升了预测准确性。
Comments 11 pages, 3 figures. Accepted at the 8th epiDAMIK ACM SIGKDD Workshop on Data-driven Decision Making for Public and Population Health (epiDAMIK @ KDD 2026)