arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-05-12 至 2026-05-12 共收录 11
2605.10642 2026-05-12 cs.LG cond-mat.stat-mech

Composing diffusion priors with explicit physical context via generative Gibbs sampling

通过生成性Gibbs采样结合显式物理上下文组成扩散先验

Weizhou Wang, Jonathan Weare, Aaron R. Dinner

机构 * Department of Chemistry(化学系) Courant Institute of Mathematical Sciences(数学科学学院) University of Chicago(芝加哥大学) New York University(纽约大学)

AI总结 本文提出GG-PA框架,通过生成性Gibbs采样结合显式物理上下文,实现扩散先验与物理上下文的联合分布推断,验证了在有限扩散时间下精确性,并通过实验展示其在双井系统、ϕ⁴晶格模型和原子肽系统中的有效性。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10286 2026-05-12 cs.AI

AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks

AgentRx: 一种针对多模态临床预测任务的LLM代理基准研究

Baraa Al Jorf, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校)

AI总结 本文研究了LLM代理在多模态临床预测任务中的表现,发现单代理框架在处理多模态数据和校准方面优于多代理系统,强调了改进多代理协作的重要性。

Comments Accepted at the AHLI Conference on Health, Inference, and Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10229 2026-05-12 cs.CV cs.CY

VPD-100K: Towards Generalizable and Fine-grained Visual Privacy Protection

VPD-100K: 向通用化和细粒度的视觉隐私保护迈进

Xiaobin Hu, Enpu Zuo, Lanping Hu, Kaiwen Yang, Dianshu Liao, Tianyi Zhang, Bo Yin, Yinsi Zhou, Shidong Pan, Xiaoyu Sun

机构 * National University of Singapore(新加坡国立大学) Australian National University(澳大利亚国立大学) New York University(纽约大学) The University of New South Wales(新南威尔士大学)

AI总结 本文提出VPD-100K数据集,用于通用隐私检测,包含10万张图像和33个细粒度类别,设计了频率增强轻量模块以提升隐私检测效果。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09970 2026-05-12 cs.CL

CREATE: Testing LLMs for Associative Creativity

CREATE:测试大型语言模型的联想创造力

Manya Wadhwa, Tiasa Singha Roy, Harvey Lederman, Junyi Jessy Li, Greg Durrett

机构 * New York University(纽约大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 CREATE基准测试评估模型的创造性联想能力,要求生成高特异性和多样性的概念连接路径,展现模型在复杂搜索空间中的创造力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10034 2026-05-12 cs.RO

Beyond Self-Play and Scale: A Behavior Benchmark for Generalization in Autonomous Driving

超越自我博弈与规模:面向自动驾驶泛化的行为基准

Aron Distelzweig, Faris Janjoš, Andreas Look, Anna Rothenhäusler, Daniel Jost, Oliver Scheel, Raghu Rajan, Daphne Cornelisse, Eugene Vinitsky, Joschka Boedecker

机构 * University of Freiburg(弗赖堡大学) Bosch Center for Artificial Intelligence(博世人工智能中心) Coburg University of Applied Sciences(科堡应用科学大学) New York University(纽约大学)

AI总结 本文提出BehaviorBench,通过评估、复杂性和行为多样性三个维度,解决自动驾驶大规模强化学习政策在标准化评估中的性能问题,并提出混合规划器提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09900 2026-05-12 cs.AI cs.CL cs.CV

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

为视觉语言模型解开 Gordian 结:图式结理作为一项难题基准

Hao Liu, Jicheng Liu

机构 * Department of Psychology(心理学系) New York University(纽约大学) Department of Computer Science(计算机科学系) University of Southern California(南加州大学)

AI总结 本文提出 KnotBench 基准,通过 858,318 张图像与 Regina 签名验证,评估 VLMs 在结图识别、预测和跨模态接地任务中的能力,发现模型在结操作模拟上存在显著不足。

Comments 41 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09666 2026-05-12 cs.CV cs.AI

Rethinking Evaluation of Multiple Sclerosis (MS) Lesion Segmentation Models

重新思考多发性硬化症(MS)病灶分割模型的评估

Abdul Basit, Ashir Rashid, Muhammad Abdullah Hanif, Muhammad Shafique

机构 * eBRAIN Lab, Division of Engineering, New York University (NYU) Abu Dhabi(eBRAIN实验室,工程学院,纽约大学(纽约大学阿布扎克分校))

AI总结 本文重新审视MS病灶分割模型的评估方法,提出问题指纹分析以量化模型在实际医疗场景中的性能,分析现有模型在两个公开数据集上的表现。

Comments 8 pages, 5 figures, Accepted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04988 2026-05-12 cs.LG

Adaptive Memory Momentum via a Model-Based Framework for Deep Learning Optimization

基于模型的自适应记忆动量框架用于深度学习优化

Kristi Topollai, Anna Choromanska

机构 * New York University(纽约大学)

AI总结 本文提出一种自适应动量机制,通过动态调整动量系数提升深度学习优化性能,适用于多种学习任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16131 2026-05-12 cs.LG cs.NE math.SP

A Spectral Approach for Learning Spatiotemporal Neural Differential Equations

一种用于学习时空神经微分方程的谱方法

Mingtao Xia, Xiangting Li, Qijing Shen, Tom Chou

机构 * Courant Institute of Mathematical Sciences, New York University, New York, NY 10012, USA(数学科学学院,纽约大学,纽约,NY 10012,美国) Department of Computational Medicine, UCLA, Los Angeles, CA 90095, USA(计算医学系,洛杉矶大学,洛杉矶,CA 90095,美国) Nuffield Department of Medicine, Oxford University, Oxford OX2 6HW, UK(医学系,牛津大学,牛津 OX2 6HW,英国)

AI总结 本文提出一种基于神经ODE的谱方法,用于学习包含长程非局部空间相互作用的时空微分方程,无需空间离散化,适用于无界域。

Comments 21 pages, 5 figures

Journal ref Journal of Applied Mathematics and Computing, Volume 70, 4395-4421, (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20829 2026-05-12 cs.LG cs.AI cs.CL

Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning

通过失败前缀条件训练饱和问题的推理模型

Minwu Kim, Safal Shrestha, Anubhav Shrestha, Keith Ross

机构 * New York University Abu Dhabi(纽约大学阿布扎赫分校)

AI总结 本文提出失败前缀条件方法,通过引导探索失败易发的推理状态,解锁饱和问题中的学习信号,提升模型恢复能力,实现性能提升并增强鲁棒性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08412 2026-05-12 cs.CV

SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding

SYNCR: 一个具有合成接地的跨视频推理基准

Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy, Farshad Khorrami

机构 * New York University(纽约大学)

AI总结 SYNCR通过合成数据评估多视频推理能力,发现现有模型在物理空间推理上表现不足,参数扩展和训练后优化能提升时间对齐能力,但无法可靠解决细粒度物理跟踪和全局空间合成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏