arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-05-22 至 2026-05-22 共收录 13
2605.22645 2026-05-22 cs.AI

AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters

AtelierEval: 人类与LLM作为文本到图像提示器的代理评估

Hanjun Luo, Zhimu Huang, Sylvia Chung, Yiran Wang, Yingbin Jin, Jialin Li, Jiang Li, Xinfeng Li, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出AtelierEval,首个统一基准,通过360个专家设计的任务量化提示能力,引入技能基于的记忆增强代理评估器,实现与人类专家的高相关性,验证了提示器在图像增强方向的优越性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22612 2026-05-22 cs.CY cs.AI cs.LG

Healthcare LLM Benchmarks Are Only as Good as Their Explicit Assumptions

医疗LLM基准测试的可靠性仅取决于其显式假设

Naveen Raman, Santiago Cortes-Gomez, Mateo Dulce Rubio, Fei Fang, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

AI总结 本文提出医疗LLM基准测试的评估-部署差距源于隐式假设,而非基准设计问题,并通过BenchmarkCards和分阶段评估方法来解决这一问题。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22471 2026-05-22 cs.LG

Lost in Tokenization: Fundamental Trade-offs in Graph Tokenization for Transformers

迷失在标记化中:图标记化在Transformer中的基本权衡

Maya Bechler-Speicher, Gilad Yehudai, Gil Harari, Clayton Sanford, Amir Globerson, Joan Bruna

机构 * Courant Institute of Mathematical Sciences, New York University(纽约大学数学科学学院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Google Research(谷歌研究) Tel-Aviv University(特拉维夫大学)

AI总结 本文研究了图标记化在Transformer中的基本权衡,探讨了不同标记化方法对模型表达能力的影响,并通过实验验证了不同任务对不同结构视图的偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22120 2026-05-22 eess.AS cs.SD

Effective User-defined Keyword Spotting with Dual-stage Matching, Multi-modal Enrollment, and Continual Adaptation

高效的用户定义关键词侦测:双阶段匹配、多模态注册与持续适应

Zhiqi Ai, Han Cheng, Shiyi Mu, Xinnuo Li, Yongjin Zhou, Shugong Xu

机构 * New York University(纽约大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

AI总结 本文提出DMA-KWS框架,通过双阶段匹配、多模态注册和持续适应方法,解决用户定义关键词侦测中的混淆词区分、说话人发音不一致和高数据成本问题,实验表明其在LibriPhrase Hard子集上达到97.85%的AUC和6.13%的EER,性能领先。

Comments 14 pages, 13 figures, 12 tables. Accepted by TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04111 2026-05-22 cs.SE cs.AI cs.HC

CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding

CentaurEval: 评估人机协同在编程中的价值

Hanjun Luo, Chiming Ni, Jiaheng Wen, Zhimu Huang, Yiran Wang, Bingduo Liao, Sylvia Chung, Yingbin Jin, Xinfeng Li, Wenyuan Xu, XiaoFeng Wang, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出CentaurEval基准测试,用于评估人机协同在编程中的价值。该基准测试通过协作必要问题模板,结合人类推理和AI效率,展示了人机协作在编程任务中的显著优势。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22010 2026-05-22 stat.ML cs.LG

Uniform-in-Time Weak Propagation-of-Chaos in Shallow Neural Networks

浅层神经网络中关于时间的弱传播混沌性

Margalit Glasgow, Joan Bruna

机构 * Massachusetts Institute of Technology(麻省理工学院) Courant Institute School of Mathematics, Computing and Data Science(Courant研究所数学、计算与数据科学学院) New York University(纽约大学)

AI总结 本文研究了在特征学习模式下使用梯度下降训练的一层神经网络,将有限宽度网络的输出与无限宽度网络的输出联系起来,并通过均场动力学来研究其长期行为。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21834 2026-05-22 cs.LG

On-Policy Consistency Training Improves LLM Safety with Minimal Capability Degradation

基于策略的一致性训练通过最小能力退化提升大语言模型安全性

Andy Han, Kristina Fujimoto, Avidan Shah, Kiet Nguyen, Kai Xu, Chen Yueh-Han, Ilia Sucholutsky, Rico Angell

机构 * New York University(纽约大学)

AI总结 本文提出基于策略的一致性训练(OPCT)方法,通过模型自身响应对比性提示来提升大语言模型的安全性,实验表明OPCT在抑制顺从性、防止越狱和增强安全意识方面优于传统监督微调(SFT),同时避免了SFT导致的能力退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21803 2026-05-22 cs.LG

Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws

相同架构,不同容量:优化器诱导的谱缩放定律

Nandan Kumar Jha, Brandon Reagen

机构 * New York University(纽约大学)

AI总结 研究探讨了优化器如何影响Transformer架构的谱缩放定律,发现相同架构使用不同优化器时,谱容量的缩放行为存在显著差异,提出了优化器与架构协同设计的重要性。

Comments 31 pages, 10 figures, 30 tables. Project page: https://optimizer-scaling-laws.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21800 2026-05-22 cs.LG cs.RO

stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation

stable-worldmodel: 一个用于可重复世界建模研究和评估的平台

Lucas Maes, Quentin Le Lidec, Luiz Facury, Nassim Massaudi, Ayush Chaurasia, Francesco Capuano, Richard Gao, Taj Gillin, Dan Haramati, Damien Scieur, Yann LeCun, Randall Balestriero

机构 * Mila & Université de Montréal(Mila与蒙特利尔大学) New York University(纽约大学) Universidade Federal de Minas Gerais(巴西联邦大学矿务学院) Independent Researcher(独立研究者) LanceDB University of Oxford(牛津大学) Brown University(布朗大学)

AI总结 本文提出stable-worldmodel平台,旨在解决世界建模研究中代码库、数据管道和评估协议碎片化的问题,通过提供高性能的数据层、现代世界模型基线和规划求解器的实现,以及扩展的环境和任务,实现标准化和可重复的世界建模研究和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21778 2026-05-22 cs.AI

What Counts as AI Sycophancy? A Taxonomy and Expert Survey of a Fragmented Construct

什么是AI阿谀奉承?对一个碎片化概念的分类和专家调查

Meryl Ye, Lujain Ibrahim, Jessica Y. Bo, Myra Cheng, Ida Mattsson, Daniel Vennemeyer, Robert Kraut, Steve Rathje

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) University of Toronto(多伦多大学) Stanford University(斯坦福大学) University of Cincinnati(克里夫兰医学中心大学) New York University(纽约大学)

AI总结 本文通过文献综述和专家调查,揭示了AI阿谀奉承行为的分类和测量挑战,提出了一种统一的分类体系以促进对这一问题的理解和应对。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21680 2026-05-22 cs.RO

Flying Together: Human-Guided Immersive Shared Control for Aerial Robot Teams in Unknown Environments

Flying Together: Human-Guided Immersive Shared Control for Aerial Robot Teams in Unknown Environments

Lou De Bel-Air, Luca Morando, Ruitao Chen, Keru Wang, Benjamin Jarvis, Charbel Toumieh, Yang Zhou, Ken Perlin, Dario Floreano, Giuseppe Loianno

机构 * New York University(纽约大学) Ecole Polytechnique Federale de Lausanne(洛桑联邦理工学院) University of California Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种基于虚拟现实的共享控制框架,用于在约束和未知环境中操作无人机团队,通过实时用户引导探索,提升在无结构环境中的自主导航能力。核心方法是一种基于用户引导的运动原语规划器,结合阻抗控制器,使操作员能够灵活影响团队行为并引导无人机前往自主规划器可能忽略的感兴趣区域。

Comments Accepted at IEEE International Conference in Robotics and Automation, Vienna 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16169 2026-05-22 cs.LG cs.CL

Discrete Stochastic Localization for Non-autoregressive Generation

非自回归生成的离散随机定位

Yunshu Wu, Jiayi Cheng, Longxuan Yu, Partha Thakuria, Rob Brekelmans, Evangelos E. Papalexakis, Greg Ver Steeg

机构 * University of California Riverside(加州大学河滨分校) New York University(纽约大学)

AI总结 本文提出了一种名为离散随机定位(DSL)的连续状态框架,通过单位球体令牌嵌入实现最优去噪,从而在离散序列生成中提升分布忠实度,并展示了其在OpenWebText上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21821 2026-05-22 cs.AI

PHYSICS: Benchmarking Foundation Models on University-Level Physics Problem Solving

PHYSICS:在大学物理问题求解中基准测试基础模型

Kaiyue Feng, Yilun Zhao, Yixin Liu, Tianyu Yang, Chen Zhao, John Sous, Arman Cohan

机构 * Yale University(耶鲁大学) New York University(纽约大学) Notre Dame University(诺特丹大学)

AI总结 本文提出PHYSICS基准测试,用于评估大学水平物理问题求解能力,包含1297个专家标注的问题,涵盖六个核心领域,并通过自动化评估系统揭示了领先基础模型的显著局限性。

Journal ref Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏