arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-07-03 至 2026-07-03 共收录 5
2607.02490 2026-07-03 cs.CL cs.CV 新提交

Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

基于强化学习的视觉语言模型视觉接地自反思

Liyan Tang, Fangcong Yin, Greg Durrett

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学)

AI总结 提出VRRL框架,通过随机掩码轨迹前缀和缓冲回滚机制,增强视觉语言模型在分布外场景下的视觉接地自反思能力,显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02150 2026-07-03 cs.DS cs.LG 新提交

Tight Lower Bounds for the Multi-Secretary Problem via Bellman Certificates

通过贝尔曼证书的多秘书问题紧下界

Jiawei Zhang

机构 * Stern School of Business, New York University(纽约大学斯特恩商学院)

AI总结 针对多秘书问题中带间隙支撑的有界密度分布,证明最优遗憾至少为(\log T)^2,与现有上界匹配,并引入贝尔曼证书框架用于下界构造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01525 2026-07-03 math.OC cs.LG cs.MA math.PR 新提交

Mean Field Reinforcement Learning

平均场强化学习

René Carmona, Mathieu Laurière

机构 * Department of Operations Research and Financial Engineering & Program in Applied and Computational Mathematics, Princeton NJ 08544, USA(普林斯顿大学运筹学与金融工程系及应用与计算数学项目) Shanghai Frontiers Science Center of Artificial Intelligence and Deep Learning(上海人工智能与深度学习前沿科学中心;纽约大学上海数学科学研究院(NYU-ECNU);纽约大学上海) NYU-ECNU Institute of Mathematical Sciences at NYU Shanghai NYU Shanghai, 567 West Yangsi Road, Shanghai, 200126, People’s Republic of China

AI总结 通过平均场交互和共同噪声的大群体随机控制视角,介绍平均场强化学习,建立代表性智能体学习问题的概率、数学和控制理论框架,并分析表格Q学习和策略梯度方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04265 2026-07-03 math.OC cs.LG cs.NA math.NA 版本更新

Nonlocal Mean Field Schrödinger Bridge with Learned Interactions

具有学习相互作用的非局部平均场薛定谔桥

Daisuke Inoue, Dante Kalise, Mathieu Laurière

机构 * Department of Mathematics, Imperial College London(伦敦帝国学院数学系) Shanghai Frontiers Science Center of Artificial Intelligence and Deep Learning(上海前沿人工智能与深度学习科学中心) NYU-ECNU Institute of Mathematical Sciences, NYU Shanghai(纽约大学上海数学科学研究所)

AI总结 本文提出一种使用神经网络代理近似非局部相互作用的平均场薛定谔桥方法,将推理时的每步计算成本从二次降低到线性,并推导了代理误差传播的稳定性界限。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02196 2026-07-03 cs.AI cs.LG math.ST stat.ML stat.TH 版本更新

Conformal Policy Control

符合性策略控制

Drew Prinster, Clara Fannjiang, Ji Won Park, Kyunghyun Cho, Anqi Liu, Suchi Saria, Samuel Stanton

机构 * Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。

Comments International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏