From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning
从先验到专家:通过分布收缩强化学习微调实现高效技能掌握
机构 * Stanford University(斯坦福大学)
AI总结 提出DICE-RL框架,将强化学习作为分布收缩算子,通过在线反馈放大高成功行为,将预训练行为先验微调为高性能专家策略,实现稳定、样本高效的复杂操作技能掌握。
高校专区
从先验到专家:通过分布收缩强化学习微调实现高效技能掌握
机构 * Stanford University(斯坦福大学)
AI总结 提出DICE-RL框架,将强化学习作为分布收缩算子,通过在线反馈放大高成功行为,将预训练行为先验微调为高性能专家策略,实现稳定、样本高效的复杂操作技能掌握。
比较错觉的梯度强度由贝叶斯推断解释
机构 * Stanford University(斯坦福大学)
AI总结 本研究通过贝叶斯噪声信道模型,结合统计语言模型与人类行为数据,定量预测比较错觉的强度梯度,并解释代词与完整名词短语主语差异的新效应。
Comments 52 pages, 7 figures
Sheet Music Benchmark: 标准化光学乐谱识别评估
机构 * Pattern Recognition and Artificial Intelligence Group, University of Alicante, Spain(西班牙阿利坎特大学模式识别与人工智能组) ; Self-employed(自雇人士) ; Center for Computer Research in Music and Acoustics, Stanford University, USA(美国斯坦福大学音乐与声学计算机研究中心) ; Instituto Superior de Enseñanzas Artísticas de la Comunidad Valenciana, Spain(西班牙瓦伦西亚自治区高等艺术教育研究所)
AI总结 提出Sheet Music Benchmark (SMB)数据集和OMR标准化编辑距离(OMR-NED)指标,用于标准化光学乐谱识别(OMR)评估,涵盖多种音乐纹理和细粒度错误分析。
Comments Accepted at the 26th International Society for Music Information Retrieval Conference (ISMIR)