arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-07-03 至 2026-07-03 共收录 3
2607.02490 2026-07-03 cs.CL cs.CV 新提交

Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

基于强化学习的视觉语言模型视觉接地自反思

Liyan Tang, Fangcong Yin, Greg Durrett

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学)

AI总结 提出VRRL框架,通过随机掩码轨迹前缀和缓冲回滚机制,增强视觉语言模型在分布外场景下的视觉接地自反思能力,显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02150 2026-07-03 cs.DS cs.LG 新提交

Tight Lower Bounds for the Multi-Secretary Problem via Bellman Certificates

通过贝尔曼证书的多秘书问题紧下界

Jiawei Zhang

机构 * Stern School of Business, New York University(纽约大学斯特恩商学院)

AI总结 针对多秘书问题中带间隙支撑的有界密度分布,证明最优遗憾至少为(\log T)^2,与现有上界匹配,并引入贝尔曼证书框架用于下界构造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01525 2026-07-03 math.OC cs.LG cs.MA math.PR 新提交

Mean Field Reinforcement Learning

平均场强化学习

René Carmona, Mathieu Laurière

机构 * Department of Operations Research and Financial Engineering & Program in Applied and Computational Mathematics, Princeton NJ 08544, USA(普林斯顿大学运筹学与金融工程系及应用与计算数学项目) Shanghai Frontiers Science Center of Artificial Intelligence and Deep Learning(上海人工智能与深度学习前沿科学中心;纽约大学上海数学科学研究院(NYU-ECNU);纽约大学上海) NYU-ECNU Institute of Mathematical Sciences at NYU Shanghai NYU Shanghai, 567 West Yangsi Road, Shanghai, 200126, People’s Republic of China

AI总结 通过平均场交互和共同噪声的大群体随机控制视角,介绍平均场强化学习,建立代表性智能体学习问题的概率、数学和控制理论框架,并分析表格Q学习和策略梯度方法。

详情

展开后加载摘要…

URL PDF HTML 收藏