Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients
超越负回滚:仅正回滚的策略优化
机构 * University of Washington(华盛顿大学)
AI总结 本文提出POPO框架,通过仅使用在线正回滚进行学习,避免负回滚,并通过siamese网络和相似性惩罚提升稳定性,实验证明其在数学基准测试中性能优于GRPO。
高校专区
超越负回滚:仅正回滚的策略优化
机构 * University of Washington(华盛顿大学)
AI总结 本文提出POPO框架,通过仅使用在线正回滚进行学习,避免负回滚,并通过siamese网络和相似性惩罚提升稳定性,实验证明其在数学基准测试中性能优于GRPO。
在线贝叶斯校准在渐进和突发系统变化下的应用
机构 * Department of Industrial and Systems Engineering(工业与系统工程系) ; University of Washington(华盛顿大学) ; Seattle, WA 98195(华盛顿州西雅图98195)
AI总结 本文提出BRPC框架,用于处理流数据中的系统渐进变化和突发变化,通过分离校准参数更新和偏差更新,提升校准精度和鲁棒性。
矩阵值乐观主义是矩阵值增强:加法混合设计用于约束优化
机构 * University of Washington(华盛顿大学)
AI总结 本文提出加法混合设计方法,通过矩阵值修正提升约束优化性能,揭示了增广拉格朗日与乐观对偶方法的等价性,并在非线性等式约束问题中验证了其有效性。
VibeServe: 人工智能代理能否构建定制化的LLM服务系统?
机构 * University of Washington(华盛顿大学)
AI总结 本文提出VibeServe,一种通过多代理循环自动合成定制化LLM服务系统的框架,在标准部署中与vLLM竞争,在非标准场景中表现更优。
预测与规范性人工智能:优化野火扑救
机构 * Michael G. Foster School of Business and Paul G. Allen School of Computer Science & Engineering, University of Washington(迈克尔·G·福斯特商学院和保罗·G·阿伦计算机科学与工程学院,华盛顿大学)
AI总结 本文提出一种预测与规范性AI方法,联合优化扑救队伍分配与野火扑救,通过整数优化模型和双侧列生成算法提升扑救效率,减少火灾面积。
MARVL:通过视觉-语言模型实现机器人操作的多阶段引导
机构 * School of Intelligent Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) ; National Key Laboratory for Novel Software Technology, School of Artificial Intelligence, Nanjing University, China(南京大学新型软件技术国家实验室,人工智能学院) ; School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) ; MACS Lab, University of Washington(华盛顿大学MACS实验室)
AI总结 本文提出MARVL,通过视觉-语言模型实现机器人操作的多阶段引导,解决传统密集奖励函数设计中的问题,提升样本效率和鲁棒性。
弱到强的泛化几乎是不可避免的(在线性模型中)
机构 * University of Washington(华盛顿大学)
AI总结 研究显示在线性逻辑回归中,在轻微的数据分布假设下,弱到强泛化现象几乎不可避免,挑战了传统理论中关于模型容量不匹配是关键机制的观点。
AeroJEPA:学习语义潜在表示以实现可扩展的3D气动场建模
机构 * Universidad Politécnica de Madrid(马德里理工大学) ; University of Michigan(密歇根大学) ; Universitat Politècnica de València(瓦伦西亚理工大学) ; Purdue University(普渡大学) ; Caltech(加州理工学院) ; University of Washington(华盛顿大学)
AI总结 AeroJEPA通过联合嵌入预测架构,在高保真度和大规模场景中实现可扩展的3D气动场建模,通过语义组织潜在空间提升建模效率与设计意义。
ViTok-v2:将原生分辨率自编码器扩展到50亿参数
机构 * University of Texas, Austin(德克萨斯大学奥斯汀分校) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; Spellbrush ; Meta Superintelligence Labs(Meta超智能实验室) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 ViTok-v2通过NaFlex实现跨分辨率和宽高比泛化,引入新的DINOv3感知损失,提升重建性能并稳定训练,达到当前最佳水平。
超越语义相似性:通过直接语料交互重新思考代理搜索的检索
机构 * Texas A&M University(德克萨斯A&M大学) ; University of Waterloo(滑铁卢大学) ; UC San Diego(圣地亚哥大学) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Verdent AI ; Lambda
AI总结 本文提出直接语料交互(DCI)方法,通过通用终端工具直接搜索原始语料,无需嵌入模型或检索接口,有效提升代理搜索性能。
逐字采样你的语言模型
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能算法研究所)
AI总结 本文提出一种方法,将自回归语言模型转换为字符或字节级模型,解决提示边界问题,统一不同分词器的语言模型词汇。
Comments 28 pages, 9 figures