arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-06-03 至 2026-06-03 共收录 11
2606.03962 2026-06-03 cs.LG cs.AI

Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning

利用奖励不确定性在强化学习中诱导多样化行为

Anthony GX-Chen, Ankit Anand, Gheorghe Comanici, Zaheer Abbas, Eser Aygün, David Smalling, Shibl Mourad, Doina Precup, André Barreto, Mark Rowland

机构 * New York University(纽约大学) Google DeepMind(谷歌DeepMind)

AI总结 针对传统强化学习缺乏多样性的问题,提出将奖励函数替换为奖励分布,通过非线性集合目标自然产生可控的多样化行为,并推导出梯度估计器,实验证明其鲁棒性和理论优势。

Comments Core contributors: Anthony GX-Chen, Ankit Anand, Gheorghe Comanici, André Barreto, Mark Rowland

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03920 2026-06-03 cs.CV

Benchmarking Visual State Tracking in Multimodal Video Understanding

多模态视频理解中的视觉状态追踪基准测试

Sihyun Yu, Nanye Ma, Pinzhi Huang, Hyunseok Lee, Shusheng Yang, June Suk Choi, Ellis Brown, Oscar Michel, Boyang Zheng, Jinwoo Shin, Saining Xie

机构 * New York University(纽约大学) KAIST(韩国科学技术院)

AI总结 提出VSTAT基准,通过需要连续感知和整合整个视频流的问题评估多模态大语言模型的视觉状态追踪能力,发现当前模型远低于人类表现,失败主要源于视觉感知而非文本推理。

Comments Website: https://vision-x-nyu.github.io/vstat-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03657 2026-06-03 cs.AI

Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition

诊断大语言模型工具使用中的知识缺口:面向新API获取的智能体基准

Jinnuo Liu, Yue Peng, Jinhan Niu, Hongyi Wen

机构 * NYU Shanghai(纽约大学上海分校)

AI总结 提出 NovelAPIBench 基准,通过动态发现新API、分解知识包并生成可执行任务,诊断模型在API使用中的六类错误,发现检索与参数调优互补。

Comments 37 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03428 2026-06-03 cs.NE cs.AI cs.LG

PrimeSVT: An Automated Memory-aware Pruning Framework with Prioritized Compression Policy for Spiking Vision Transformers

PrimeSVT: 一种具有优先压缩策略的自动化内存感知剪枝框架用于脉冲视觉Transformer

Rachmad Vidya Wicaksana Putra, Achyuta Muthuvelan, Alberto Marchisio, Muhammad Shafique

机构 * eBRAIN Lab, Division of Engineering, New York University (NYU) Abu Dhabi(eBRAIN实验室,工程系,纽约大学(NYU)阿布扎克分校) New York University (NYU) Abu Dhabi, United Arab Emirates (UAE)(纽约大学(NYU)阿布扎克分校,阿拉伯联合酋长国(UAE))

AI总结 提出PrimeSVT框架,通过自动化结构化剪枝和优先压缩策略,在满足精度和内存约束下压缩脉冲视觉Transformer,实现内存节省26.68%且精度损失小于3%。

Comments 8 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03257 2026-06-03 cs.NE cs.AI cs.LG

PSViT: A Methodology for Structurally Pruning Spiking Vision Transformers

PSViT:一种结构剪枝脉冲视觉Transformer的方法

Rachmad Vidya Wicaksana Putra, Achyuta Muthuvelan, Alberto Marchisio, Muhammad Shafique

机构 * eBRAIN Lab, Division of Engineering, New York University (NYU) Abu Dhabi(eBRAIN实验室,工程系,纽约大学(NYU)阿布扎赫德分校) New York University (NYU) Abu Dhabi, United Arab Emirates (UAE)(纽约大学(NYU)阿布扎赫德分校,阿拉伯联合酋长国(UAE))

AI总结 提出PSViT方法,通过结构化剪枝(均匀通道滤波器和基于敏感性的细粒度剪枝)压缩脉冲视觉Transformer,在ImageNet-1K上实现22.4%内存节省且精度损失小于3%。

Comments 8 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03198 2026-06-03 cs.CL cs.AI

AI Rater Discrimination Depends on Scoring Protocol in Complex Clinical Decision-Making

AI评分歧视取决于复杂临床决策中的评分协议

Sangwon Baek, Kyu Yeon Hur, Kyunga Kim

机构 * Asclep Korea Inc.(Asclep韩国公司) Center for Data Science, New York University(纽约大学数据科学中心) Division of Endocrinology and Metabolism, Department of Medicine, Samsung Medical Center, Sungkyunkwan University School of Medicine(成均馆大学医学院内分泌与代谢科,三星医疗中心) Biomedical Statistics Center, Samsung Medical Center(三星医疗中心生物医学统计中心) Department of Digital Health, SAIHST(SAIHST数字健康科) Department of Data Convergence & Future Medicine, Sungkyunkwan University(成均馆大学数据融合与未来医学科)

AI总结 通过因子研究,发现基于评分标准的协议能放大AI评分者区分能力,而无评分标准协议则抑制这种区分,支持在临床AI评估中使用评分标准锚定。

Comments 11 pages, 4 main figures, 8 supplementary figures, 9 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01849 2026-06-03 cs.LG cs.CL cs.CR

ContinuousBench: Can Differentially Private Synthetic Text Improve Capabilities?

ContinuousBench: 差分隐私合成文本能否提升能力?

Peihan Liu, Lucas Rosenblatt, Weiwei Kong, Natalia Ponomareva, Gautam Kamath, Rachel Cummings, Roxana Geambasu, Yu Gan, Lillian Tsai, Alex Bie

机构 * Columbia University(哥伦比亚大学) NYU(纽约大学) Google Research(谷歌研究) University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) Google(谷歌)

AI总结 提出ContinuousBench基准,通过持续更新的数据集评估差分隐私合成文本能否传递原始语料库中的新知识,实验表明非隐私合成能有效转移知识,而最先进的DP合成方法即使在高隐私预算下也基本失败。

Comments For datasets, see https://huggingface.co/ContinuousBench; for the evaluation harness, see https://github.com/plau666/ContinuousBenchEval; for an accompanying blog post, see https://peihanliu.com/posts/continuousbench.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00188 2026-06-03 cs.GR cs.CV cs.LG

PaintBench: Deterministic Evaluation of Precise Visual Editing

PaintBench: 精确视觉编辑的确定性评估

Kai Xu, Ellis Brown, Shrikar Madhu, Rob Fergus, He He, Saining Xie

机构 * New York University(纽约大学)

AI总结 提出PaintBench基准,通过程序化生成20种基本视觉编辑操作,实现确定性像素级评估,发现当前模型性能低(最高mIoU 17.1%),并揭示任务分解和场景变化的影响。

Comments Project Page: https://paintbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16064 2026-06-03 cs.GT cs.AI econ.TH

Misspecified Estimate-then-Optimize Leads to Supra-Competitive Prices

错误指定的估计-优化导致超竞争价格

Jackie Baek, Vivek F. Farias, Farrell Wu

机构 * Stern School of Business, New York University(纽约大学斯特恩商学院) Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究在多家公司市场中,使用错误指定的需求模型(忽略竞争对手价格)的短视估计-优化定价规则如何导致价格收敛至高于纳什均衡的超竞争水平,并通过流体极限常微分方程分析刻画收敛条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06219 2026-06-03 cs.RO cs.AI

Coupled Local and Global World Models for Efficient First Order RL

耦合局部与全局世界模型的高效一阶强化学习

Joseph Amigo, Rooholla Khorrambakht, Nicolas Mansard, Ludovic Righetti

机构 * Machines in Motion Laboratory, New York University, USA(纽约大学运动机器实验室) LAAS-CNRS, Université de Toulouse, CNRS, Toulouse, France(图卢兹大学LAAS-CNRS中心) Artificial and Natural Intelligence Toulouse Institute, Toulouse, France(图卢兹人工智能与自然智能研究所)

AI总结 提出一种通过解耦一阶梯度方法在数据驱动的世界模型内训练策略的方法,结合局部和全局世界模型实现高效梯度计算,在Push-T任务和四足机器人操作任务中显著优于PPO。

Comments Project website: https://coupled-global-local-wm-rl.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18428 2026-06-03 cs.LG cs.AI cs.CV

Weighted Risk Invariance: Domain Generalization under Invariant Feature Shift

加权风险不变性:不变特征偏移下的领域泛化

Gina Wong, Joshua Gleason, Rama Chellappa, Yoav Wald, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Maryland, College Park(马里兰大学学院公园分校) New York University(纽约大学) Center for Data Science(数据科学中心)

AI总结 针对不变协变量偏移下现有不变学习方法性能不佳的问题,提出加权风险不变性(WRI)框架,通过环境间损失的不变性并加权训练样本,在理论上保证学习到不变模型,并在实验中优于先前方法。

Journal ref TMLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏