arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-04-13 至 2026-04-13 共收录 10
2604.09531 2026-04-13 cs.CV cs.AI cs.CL

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

VisionFoundry: 通过合成图像教授VLMs的视觉感知

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

AI总结 本文提出VisionFoundry,通过任务关键词生成合成数据,提升VLMs在空间理解和视角识别等视觉感知任务上的性能,构建了包含10k图像-问题-答案三元组的VQA数据集,并在多个基准测试中取得显著提升。

Comments Project Page: https://zlab-princeton.github.io/VisionFoundry/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09114 2026-04-13 cs.CV cs.LG

FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval

FIRE-CIR:细粒度复合时尚图像检索中的精细推理

François Gardères, Camille-Sovanneary Gauthier, Jean Ponce, Shizhe Chen

机构 * Louis Vuitton(路易威登) Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所, 巴黎高等师范学院, 法国国家科学研究中心, 巴黎文理研究大学) Courant Institute of Mathematical Sciences and Center for Data Science, New York University(纽约大学库朗数学科学研究所与数据科学中心)

AI总结 FIRE-CIR通过问题驱动的视觉推理提升时尚图像检索的可解释性和准确性,通过生成属性聚焦的视觉问题并验证参考与候选图像中的证据,实现更精确的检索结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08804 2026-04-13 stat.ML cs.LG stat.ME

Policy-Aware Design of Large-Scale Factorial Experiments

面向政策的大规模因子实验设计

Xin Wen, Xi Chen, Will Wei Sun, Yichen Zhang

机构 * Stern School of Business, New York University(纽约大学斯特恩商学院) Daniels School of Business, Purdue University(普渡大学丹尼尔斯商学院)

AI总结 本文研究如何在有限预算下设计大规模因子实验,通过两阶段方法集中重叠实验,利用低秩张量建模预期结果,提升组合产品设计的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08781 2026-04-13 eess.IV cs.AI cs.CV eess.SP physics.med-ph

PSIRNet: Deep Learning-based Free-breathing Rapid Acquisition Late Enhancement Imaging

PSIRNet:基于深度学习的自由呼吸快速获取晚期增强成像

Arda Atalik, Hui Xue, Rhodri H. Davies, Thomas A. Treibel, Daniel K. Sodickson, Michael S. Hansen, Peter Kellman

机构 * Health Futures, Microsoft Research(微软研究院健康未来) Center for Data Science, New York University(纽约大学数据科学中心) Center for Advanced Imaging Innovation and Research (CAI2R), Department of Radiology, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院放射学系高级成像创新与研究中心) Bernard and Irene Schwartz Center for Biomedical Imaging, Department of Radiology, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院放射学系伯纳德和艾琳·施瓦茨生物医学成像中心) Institute of Cardiovascular Science, University College London(伦敦大学学院心血管科学研究所) Barts Heart Centre, Barts Health NHS Trust(巴茨健康NHS信托巴茨心脏中心)

AI总结 本文提出PSIRNet深度学习方法,通过单次呼吸获取两心跳数据生成诊断级自由呼吸PSIR晚期增强成像,相比传统需多次运动校正信号平均的方法,将扫描时间减少8-24倍。

Comments 25 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08706 2026-04-13 cs.LG

Efficient RL Training for LLMs with Experience Replay

为大语言模型高效训练的体验回放

Charles Arnal, Vivien Cabannes, Taco Cohen, Julia Kempe, Remi Munos

机构 * FAIR at Meta(Meta FAIR) NYU Courant Institute and CDS(纽约大学库朗数学科学研究所与数据科学中心)

AI总结 本文研究了大语言模型训练中体验回放的优化设计,通过平衡陈旧性方差、样本多样性与生成成本,证明了严格策略采样在生成成本高时效果不佳,实验表明合理设计的回放缓冲器能显著降低推理计算成本而不影响模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08661 2026-04-13 quant-ph cond-mat.dis-nn cs.LG physics.comp-ph

Geometry-Induced Long-Range Correlations in Recurrent Neural Network Quantum States

递归神经网络量子态中的几何诱导长程相关性

Asif Bin Ayub, Amine Mohamed Aboussalah, Mohamed Hibat-Allah

机构 * University of Waterloo(滑铁卢大学) Perimeter Institute for Theoretical Physics(圆周理论物理研究所) NYU Tandon School of Engineering(纽约大学坦登工程学院) Vector Institute(向量研究所)

AI总结 本文提出稀疏递归神经网络波函数,通过扩张连接引入长程归纳偏差,实现O(N log N)的前向传递规模,展示其在1D transverse-field Ising模型中恢复幂律相关性的能力。

Comments 16 pages, 4 figures, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08643 2026-04-13 cs.LG cs.CY cs.GT cs.SI

Creator Incentives in Recommender Systems: A Cooperative Game-Theoretic Approach for Stable and Fair Collaboration in Multi-Agent Bandits

推荐系统中的创作者激励:一种基于合作博弈的稳定且公平的多智能体老虎机方法

Ramakrishnan Krishnamurthy, Arpit Agarwal, Lakshminarayanan Subramanian, Maximilian Nickel

机构 * Courant Institute, New York University(纽约大学库朗数学研究所) Indian Institute of Technology Bombay(印度理工学院孟买分校) FAIR, Meta AI(Meta AI 基础人工智能研究团队)

AI总结 本文提出基于合作博弈的多智能体老虎机模型,分析推荐系统中创作者激励问题,证明在同质智能体下博弈凸性,提出基于 regrets 的支付规则,实验显示支付与Shapley公平性的一致性与差异。

Comments Accepted in AISTATS 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04072 2026-04-13 cs.CL cs.AI

SkillFactory: Self-Distillation For Learning Cognitive Behaviors

SkillFactory:用于学习认知行为的自我蒸馏

Zayne Sprague, Jack Lu, Manya Wadhwa, Sedrick Keh, Mengye Ren, Greg Durrett

机构 * New York University(纽约大学) Toyota Research Institute(丰田研究所)

AI总结 SkillFactory通过监督微调阶段学习认知技能,为强化学习奠定基础,提升模型在复杂任务中的泛化能力与鲁棒性。

Comments Published at ICLR 2026; code at https://github.com/Zayne-sprague/SkillFactory

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02826 2026-04-13 cs.LG cs.AI

From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity

从导航到细化:通过Oracle速度揭示基于流的扩散模型的两阶段本质

Haoming Liu, Jinnuo Liu, Yanhao Li, Liuyang Bai, Yunkai Ji, Yuanhe Guo, Shenji Wan, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) New York University(纽约大学)

AI总结 本文通过分析基于流的扩散模型的边际速度场,揭示其两阶段训练目标,解释了模型在早期阶段的全局布局生成和后期阶段的细节记忆行为,为模型设计和算法改进提供了指导。

Comments Accepted to CVPR 2026 (Findings track); 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20638 2026-04-13 cs.SD cs.CV cs.MM eess.AS

Music Audio-Visual Question Answering Requires Specialized Multimodal Designs

音乐音频视觉问答需要专门的多模态设计

Wenhao You, Xingjian Diao, Wenjun Huang, Chunhui Zhang, Keyi Kong, Weiyi Wu, Chiyu Ma, Zhongyu Ouyang, Tingxuan Wu, Ming Cheng, Soroush Vosoughi, Jiang Gui

机构 * University of Waterloo(滑铁卢大学) Dartmouth College(达特茅斯学院) UC Irvine(加州大学尔湾分校) New York University(纽约大学)

AI总结 本文探讨了音乐音频视觉问答任务中多模态设计的必要性,指出需专门的输入处理、空间时间架构和音乐特定建模策略以应对连续密集的音频视觉内容和复杂时间动态。

Comments Accepted to Annual Meeting of the Association for Computational Linguistics (ACL 2026). The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏