Provably Safe, Yet Scalable Reinforcement Learning
可证明安全且可扩展的强化学习
机构 * MIT(麻省理工学院)
AI总结 提出PS2-RL框架,通过两阶段架构(学习备份策略隐式构造控制不变集,再通过可微投影层训练RL策略)实现可证明安全且可扩展的强化学习,在高达10维状态空间中保持性能与安全性。
高校专区
可证明安全且可扩展的强化学习
机构 * MIT(麻省理工学院)
AI总结 提出PS2-RL框架,通过两阶段架构(学习备份策略隐式构造控制不变集,再通过可微投影层训练RL策略)实现可证明安全且可扩展的强化学习,在高达10维状态空间中保持性能与安全性。
Every Eval Ever:AI评估结果的统一模式与社区仓库
机构 * Technical University Munich(慕尼黑工业大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Weizenbaum Institute(魏岑鲍姆研究所) ; Zuse Institute Berlin(柏林祖泽研究所) ; Evidence Prime ; Trustible ; Kitware ; ETH Zurich(苏黎世联邦理工学院) ; StickFlux Labs ; Stanford University(斯坦福大学) ; Northeastern University(东北大学) ; IBM Research(IBM研究院) ; Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学) ; Cisco(思科) ; University of Notre Dame(圣母大学) ; Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; University of Oxford(牛津大学) ; Ohio University(俄亥俄大学) ; Writer ; TCS Research(塔塔咨询服务研究院) ; Oxford University Press(牛津大学出版社) ; Queen Mary University of London(伦敦玛丽女王大学) ; Technical University Berlin(柏林工业大学) ; University of Delaware(特拉华大学) ; Cinemo ; Johns Hopkins University(约翰霍普金斯大学) ; University of Copenhagen(哥本哈根大学) ; ELLIS(欧洲学习与智能系统实验室) ; Iowa State University(爱荷华州立大学) ; Meta FAIR ; University of Montreal(蒙特利尔大学) ; Mila Quebec AI Institute(Mila魁北克人工智能研究所) ; EleutherAI ; Yale University(耶鲁大学) ; Hugging Face ; University of Edinburgh(爱丁堡大学) ; Harvard University(哈佛大学) ; ETH AI Center(ETH人工智能中心) ; MIT(麻省理工学院) ; MIT-IBM Watson Lab(MIT-IBM沃森实验室)
AI总结 针对AI评估结果格式不统一、难以比较的问题,提出首个共享模式与社区众包仓库,通过标准化表示、自动转换器和社区数据库实现跨评估框架的统一。
无碰撞运动规划的半定松弛
机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电气工程与计算机科学系)
AI总结 研究点机器人通过球形障碍物的无碰撞运动规划,提出半定松弛方法,理论分析其紧性并利用对称性降低计算复杂度,比直接非线性规划快10-100倍。
时间回溯搜索:测试时生成式视频推理
机构 * Northeastern University(东北大学) ; Independent Researcher(独立研究者) ; Harvard & Kempner(哈佛大学与肯普纳研究所) ; MIT(麻省理工学院)
AI总结 提出时间回溯搜索(TBS),通过将搜索空间转移到时间轴,在扩散过程中定位失败点并回溯重启,显著提升视频模型在测试时的推理能力。
AGORA: 审议与治理门能否吸收公交规划中的参与偏差?
机构 * Department of Civil and Environmental Engineering and Laboratory for Information & Decision Systems, Massachusetts Institute of Technology(土木与环境工程系和信息与决策系统实验室,麻省理工学院) ; Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院)
AI总结 提出AGORA框架,通过固定网络、需求和求解器,系统变化会议组成、结构化审议和治理门,发现审议是参与影响结果的关键机制,治理门可压缩跨剖面方差,将参与偏差从不可控输入重构为过程设计问题。
XRDiff: 使用扩散模型从粉末X射线衍射数据进行晶体结构预测
机构 * Department of Materials Science and Engineering, MIT(材料科学与工程系,麻省理工学院) ; Department of Nuclear Science and Engineering, MIT(核科学与工程系,麻省理工学院) ; FAIR, Meta(FAIR,Meta)
AI总结 提出XRDiff扩散模型,从粉末X射线衍射数据恢复晶体结构,在模拟基准上实现强结构恢复率,并采用基于峰值的编码提升对实验数据的泛化能力。