SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling
SP3O:无需奖励建模的分段偏好强化学习
机构 * University of Michigan(密歇根大学)
AI总结 SP3O是一种无需奖励建模的新型PbRL算法,利用分段级偏好反馈,通过PPO型损失函数优化策略,在机器人控制和LLM微调等长视界任务中性能优于现有算法。
高校专区
SP3O:无需奖励建模的分段偏好强化学习
机构 * University of Michigan(密歇根大学)
AI总结 SP3O是一种无需奖励建模的新型PbRL算法,利用分段级偏好反馈,通过PPO型损失函数优化策略,在机器人控制和LLM微调等长视界任务中性能优于现有算法。
GeoID-PINN:考虑地理耦合的可识别性感知区域流行病推断方法
机构 * University of Michigan(密歇根大学)
AI总结 本研究提出GeoID-PINN,一种结合地理耦合与正则化的物理信息神经网络,用于区域流行病SIRD动力学推断,在模拟数据与路易斯安那州64个县COVID-19数据上均提升了预测准确性。
Comments 11 pages, 3 figures. Accepted at the 8th epiDAMIK ACM SIGKDD Workshop on Data-driven Decision Making for Public and Population Health (epiDAMIK @ KDD 2026)
通过固定基空间中的系数映射学习算子
机构 * Department of Mathematics(数学系) ; University of Michigan(密歇根大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Algorithms of Machine Learning and Autonomous Driving Research Lab(机器学习与自动驾驶算法研究实验室) ; HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究机构)
AI总结 FB-C2CNet通过固定基空间中的系数映射学习算子,有效降低计算复杂度并提升训练效率。