arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

2026-07-21 至 2026-07-21 共收录 5
2607.17201 2026-07-21 stat.ML cs.LG 新提交

Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning

在线强化学习中的非渐近最优策略识别保证

Joseph Lazzaro, Alessio Russo, Aldo Pacchiano

机构 * Imperial College London(伦敦帝国学院) Boston University(波士顿大学) Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)

AI总结 研究在线表格强化学习中的最优策略识别问题,通过为导航与停止(NaS)算法提供非渐近样本复杂度保证,揭示其样本复杂度不仅依赖特征时间,还与MDP连通性等有关,填补了相关空白。

Comments 64 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17213 2026-07-21 cs.RO 新提交

Retriever: Composing Closed-Loop Asynchronous Robot Programs

Retriever:组合闭环异步机器人程序

Linfeng Zhao, Haojie Huang, Jiayuan Mao, Weiyu Liu, Mykel Kochenderfer, Lawson L. S. Wong

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Northeastern University(东北大学)

AI总结 研究构建长期运行机器人智能体的闭环管道问题,提出Retriever,它涵盖异步决策模型等整个堆栈,将智能体表示为有状态因果流函数图,编译到支持多后端的运行时,可系统调试和确定性重放,通过案例研究等进行评估。

Comments Project website: http://retriever.systems; Package open-source website: http://openretriever.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16354 2026-07-21 cs.LG cs.AI 新提交

A Predict-then-Correct Loop Based on Few-Shot Continuous Contextual Bandit for Demand Forecasting

基于少样本连续上下文博弈的预测-校正循环用于需求预测

Zhiwei Lei, Benedict Jun Ma, Ilya Jackson

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究针对零售需求预测难题,提出预测-校正框架,运用少样本连续上下文博弈校正策略等,经实验在多需求模式下显著降低误差、提高RMSE并降低库存成本,证明在线预测校正能连接离线需求学习与实时零售决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16232 2026-07-21 cs.LG cs.AI cs.CL cs.HC 新提交

From Weights to Words: Expressing and Editing Preference Model Inferences in Natural Language

从权重到文字:用自然语言表达和编辑偏好模型推理

Zachary Wojtowicz, Ayush Nayak, Jacob Andreas

机构 * MIT(麻省理工学院)

AI总结 该研究针对统计学习算法推断人类偏好的挑战,提出‘从权重到文字’方法,输入选择问题数据集,自动发现偏好维度,解决欠定和不透明问题,经多领域展示及人体实验验证,能提高偏好模型预测准确性,获参与者认可。

Comments 42 pages, 22 figures, 14 tables; main text 11 pages, remainder appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16210 2026-07-21 cs.AI 新提交

A Survey on the Verification of Reinforcement Learning Policies

强化学习策略验证的综述

Luca Marzari, Ezio Bartocci, Enrico Marchesini

机构 * TU Wien(维也纳工业大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 综述强化学习策略验证,引入分类法沿验证范式、时间范围和保证强度三个轴阐明现有方法关系,统一理论基础,明确假设局限,确定新兴方向,为RL验证提供统一视角。

Comments Accepted at the 35th International Joint Conference on Artificial Intelligence (IJCAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏