arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Edinburgh(爱丁堡大学)

2026-08-03 至 2026-08-03 共收录 2
2607.28638 2026-08-03 cs.CL cs.LG 新提交

Learning Stateful Predictive Knowledge From Experience

从经验中学习有状态的预测知识

Yan Song, Xidong Feng, Bo Liu, Xinyu Cui, Haotian Fu, Zichen Liu, Mengyue Yang, Cheng Deng, Jian Zhao, Jun Wang

机构 * University College London(伦敦大学学院) National University of Singapore(新加坡国立大学) Chinese Academy of Sciences(中国科学院) Brown University(布朗大学) University of Bristol(布里斯托尔大学) University of Edinburgh(爱丁堡大学) Zhongguancun Academy(中关村科学院) The Yangtze River Delta(长三角)

AI总结 该研究针对LLM智能体现有轨迹级反思学习的缺陷,提出SKL方法,通过两种算法训练智能体学习有状态预测知识,在多任务上性能优于现有范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11711 2026-08-03 cs.LG stat.ML 版本更新

Reinforced sequential Monte Carlo for amortised sampling

强化序贯蒙特卡洛用于摊销采样

Sanghyeok Choi, Sarthak Mittal, Víctor Elvira, Jinkyoo Park, Esmeralda S. Whitammer

机构 * University of Edinburgh Mila -- Qu\'ebec AI Institute CIFAR Fellow

AI总结 本文提出一种摊销方法与粒子方法相结合的采样框架,通过最大熵强化学习训练序贯蒙特卡洛采样器,并利用离线策略学习提高目标分布探索效率,在合成多模态目标和丙氨酸二肽构象玻尔兹曼分布上验证了改进的近似精度与训练稳定性。

Comments ICML 2026. Code: https://github.com/hyeok9855/ReinforcedSMC

详情

展开后加载摘要…

URL PDF HTML 收藏