arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

共收录 1612
2605.30232 2026-05-29 cs.LG cs.CL

How's it going? Reinforcement learning in language models recruits a functional welfare axis

进展如何?语言模型中的强化学习招募了一个功能性福利轴

Andy Q Han, David J. Chalmers, Pavel Izmailov

机构 * New York University(纽约大学)

AI总结 本文通过迷宫环境实验,发现强化学习会招募语言模型中预先存在的功能性福利表征(即对系统目标达成程度的估计),从而广泛影响模型行为,且该表征在训练前已存在。

Comments 81 pages, 43 figures, 32 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29955 2026-05-29 cs.AI

Formalizing Mathematics at Scale

大规模形式化数学

Ahmad Rammal, Niket Patel, Fabian Gloeckle, Amaury Hayat, Julia Kempe, Remi Munos, Charles Arnal, Vivien Cabannes

机构 * FAIR at Meta(Meta的FAIR) New York University(纽约大学) Korea Institute for Advanced Study(韩国高级研究院)

AI总结 提出多智能体系统AutoformBot,利用LLM和形式化验证工具,自动将非正式教材翻译为Lean 4可验证代码,构建了包含超过45,000个声明和50万行代码的Atlas形式化库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29631 2026-05-29 cs.CL cs.AI

Predicting Causal Effects from Natural Language Queries using Structured Representations

使用结构化表示从自然语言查询预测因果效应

Giuliano Martinelli, Piriyakorn Piriyatamwong, Abelardo Carlos Martinez Lorenzo, Jasmin Baier, Riccardo Orlando, Satvik Garg, Sharif Kazemi, Linxi Wang, Arianna Legovini, Samuel Fraiberger

机构 * The World Bank Group(世界银行集团) University of Oxford(牛津大学) New York University(纽约大学)

AI总结 针对从自然语言查询预测因果效应的问题,提出Query2Effect基准和两步框架,通过生成结构化表示再预测效应大小,微调使绝对误差降低27%-71%。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27078 2026-05-29 cs.LG cs.AI

Two Speeds of Learning: A Representation-Readout Decomposition of Grokking and Double Descent

两种学习速度:Grokking 和双下降的表征-读出分解

Chi-Ning Chou, Oscar Uzdelewicz, Neng-Chun Chiu, Yao-Yuan Yang, SueYeon Chung

机构 * Center for Computational Neuroscience(计算神经科学中心) Flatiron Institute(Flatiron研究所) Department of Physics(物理系) Harvard University(哈佛大学) Kempner Institute(Kempner研究所) New York University(纽约大学)

AI总结 通过将学习动态分解为编码器中的表征学习和最终分类器中的读出校准两个竞争过程,解释了 grokking 和 epoch-wise 双下降现象,并提供了诊断虚假泛化的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19011 2026-05-29 cs.LG cs.RO

Accelerating trajectory optimization with Sobolev-trained diffusion policies

基于Sobolev训练的扩散策略加速轨迹优化

Théotime Le Hellard, Franki Nguimatsia Tiofack, Quentin Le Lidec, Justin Carpentier

机构 * Inria - Département d’Informatique de l’École normale supérieure, PSL Research University(法国国家科学研究中心-巴黎高等师范学院计算机系,PSL研究大学) Courant Institute, New York University(纽约大学Courant研究所)

AI总结 针对梯度型轨迹优化求解器,提出利用Sobolev学习训练扩散策略以提供初始猜测,通过利用轨迹和反馈增益的一阶损失避免复合误差,实现求解时间减少2至20倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01456 2026-05-29 cs.LG cs.CV

Rectified LpJEPA: Joint-Embedding Predictive Architectures with Sparse and Maximum-Entropy Representations

Rectified LpJEPA:具有稀疏和最大熵表示的联合嵌入预测架构

Yilun Kuang, Yash Dagade, Tim G. J. Rudner, Randall Balestriero, Yann LeCun

机构 * New York University(纽约大学) Duke University(杜克大学) University of Toronto(多伦多大学) Brown University(布朗大学)

AI总结 提出Rectified Distribution Matching Regularization (RDMReg)损失,通过将表示对齐到Rectified Generalized Gaussian分布,实现稀疏且最大熵的表示,从而改进联合嵌入预测架构(JEPA)的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29194 2026-05-29 cs.LG cs.AI cs.NA math.NA

Stochastic Lifting for Generating Trajectories of Stochastic Physical Systems

随机提升:生成随机物理系统轨迹

Jules Berman, Tobias Blickhan, Benjamin Peherstorfer

机构 * Courant Institute of Mathematical Sciences, New York University, New York, NY 10012, USA(Courant数学科学研究所,纽约大学,纽约,NY 10012,USA)

AI总结 提出随机提升方法,通过为每个状态转换附加独立高维随机标签并学习从当前状态和标签到下一状态的映射,以生成多样化的随机物理系统轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08567 2026-05-29 cs.MA cs.CL

ValueFlow: Measuring the Propagation of Value Perturbations in Multi-Agent LLM Systems

ValueFlow: 多智能体大语言模型中价值扰动的传播度量

Jinnuo Liu, Chuke Liu, Hua Shen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心)

AI总结 提出ValueFlow框架,通过56维价值数据集和LLM-as-a-judge协议,将价值漂移分解为智能体级响应行为与系统级结构效应,揭示价值对齐是系统级属性。

Comments Preprint. Under review. 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01058 2026-05-29 cs.LG cs.AI cs.CL

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

好的SFT优化SFT,更好的SFT为强化学习做准备

Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University (Shanghai)(纽约大学(上海))

AI总结 针对当前SFT-RL流程中离线SFT数据分布与在线RL策略分布不匹配的问题,提出基于策略评估的离线学习损失重加权方法PEAR,通过重要性采样重加权SFT损失,提升后续RL训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08194 2026-05-29 cs.LG stat.ML

Prescribe-then-Select: Adaptive Policy Selection for Contextual Stochastic Optimization

先规定后选择:面向情境随机优化的自适应策略选择

Caio de Prospero Iglesias, Kimberly Villalobos Carballo, Dimitris Bertsimas

机构 * Sloan School of Management(斯隆管理学院) Massachusetts Institute of Technology(麻省理工学院) Tandon School of Engineering(坦多工程学院) New York University(纽约大学)

AI总结 针对情境随机优化中候选策略在协变量空间表现异质的问题,提出Prescribe-then-Select模块化框架,通过构建可行策略库并基于最优策略树集成学习元策略实现数据驱动的自适应选择,在单阶段报童和两阶段运输规划问题中优于单一最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28678 2026-05-28 cs.AI

DREAM-R: Multimodal Speculative Reasoning with RL-Based Refined Drafting, Precise Verification, and Fully Parallel Execution

DREAM-R: 基于强化学习的精炼草稿、精确验证与完全并行执行的多模态推测推理

Yunhai Hu, Zining Liu, Xiangyang Yin, Tianhua Xia, Bo Bao, Eric Sather, Vithursan Thangarasa, Sai Qian Zhang

机构 * New York University(纽约大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出DREAM-R框架,通过强化学习优化草稿生成、阈值验证机制和完全并行执行,加速多模态模型的推理密集型任务,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28585 2026-05-28 cs.LG

Outer-Momentum Restarting in High-Dimensional Two-Phase Optimization

高维两阶段优化中的外动量重启

Kristi Topollai, Allan Ma, Tolga Dimlioglu, Sui Jiet Tay, Anna Choromanska

机构 * New York University(纽约大学)

AI总结 本文研究在分布式优化中周期性重启外动量以控制外存效应,通过理论分析、玩具实验和语言模型预训练验证其能扩大稳定范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28467 2026-05-28 cs.LG

Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training

通过激活一致性训练缓解针对推理模型的自适应攻击

Avidan Shah, Jannik Brinkmann, Rico Angell

机构 * New York University(纽约大学) Technical University Clausthal(克劳斯塔尔技术大学)

AI总结 提出激活一致性训练(ACT)方法,通过监督内部表示来防御针对推理模型的对抗性越狱和提示注入攻击,实验表明ACT在自适应攻击下保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28129 2026-05-28 cs.AI

Do Clinical Models Change Treatment Decisions?

临床模型是否会改变治疗决策?

Dongkyu Cho, Miao Zhang, Rumi Chunara

机构 * New York University(纽约大学)

AI总结 本研究提出ClinPivot基准,通过生物医学关系和变化的患者情境评估临床基础模型在治疗决策中的适应性,发现强医学QA能力不能可靠预测决策表现。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27739 2026-05-28 cs.LG cs.AI

Worker Disagreement Reveals Sharp Directions in Local SGD

工作者分歧揭示局部SGD中的尖锐方向

Tolga Dimlioglu, Kristi Topollai, Anna Choromanska

机构 * New York University(纽约大学)

AI总结 本文通过理论分析和实验证明,局部SGD中的工作者平均间隙协方差能够捕捉Hessian矩阵的尖锐方向,从而提供一种廉价的无Hessian估计方法。

Comments 5 pages main body, 18 pages appendix - Accepted to HiLD 2026, ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27668 2026-05-28 cs.LG cs.AI cs.CL

Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting

将LLM与人类不确定性对齐:用于LLM预测的Beta-Bernoulli校准器

Hui Dai, Ryan Teehan, Parsa Torabian, Mengye Ren

机构 * Agentic Learning AI Lab(代理学习AI实验室) New York University(纽约大学) The University of Chicago(芝加哥大学) Chronologies AI

AI总结 提出Beta-Bernoulli校准器(BBC),通过结合二元结果和人类预测信号,将初始点估计转换为事件似然分布,实现校准和不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08938 2026-05-28 cs.LG

Reevaluating Policy Gradient Methods for Imperfect-Information Games

重新评估不完美信息博弈的策略梯度方法

Max Rudolph, Nathan Lichtle, Sobhan Mohammadpour, Alexandre Bayen, J. Zico Kolter, Amy Zhang, Gabriele Farina, Eugene Vinitsky, Samuel Sokota

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学) NYU Tandon School of Engineering(纽约大学坦顿工程学院)

AI总结 通过实现五种大型博弈的精确可剥削性计算,对比发现基于虚构博弈、双预言机和反事实遗憾最小化的深度强化学习算法未能超越通用策略梯度方法(如PPO)。

Comments International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08846 2026-05-28 cs.CY cs.CL cs.SD eess.AS

Addressing Pitfalls in Auditing Practices of Automatic Speech Recognition Technologies: A Case Study of People with Aphasia

自动语音识别技术审计实践中的陷阱:以失语症患者为例

Katelyn Xiaoying Mei, Anna Seo Gyeong Choi, Hilke Schellmann, Mona Sloane, Allison Koenecke

机构 * University of Washington(华盛顿大学) Cornell University(康奈尔大学) New York University(纽约大学) University of Virginia(弗吉尼亚大学)

AI总结 本文识别了标准ASR审计中的三个常见陷阱,并提出了一个整体审计框架,通过失语症患者的案例研究发现ASR系统对其表现更差。

Comments Published at the Proceedings of The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26379 2026-05-27 stat.ML cs.LG

When Does LeJEPA Learn a World Model?

LeJEPA 何时学习世界模型?

David Klindt, Yann LeCun, Randall Balestriero

机构 * Cold Spring Harbor Laboratory(冷泉港实验室) New York University(纽约大学) Brown University(布朗大学)

AI总结 本文证明 LeJEPA(对齐加高斯正则化)在潜变量服从平稳加性噪声演化的世界中能够线性恢复潜变量(线性可识别性),并指出高斯分布是唯一保证该性质的潜分布,同时验证了近似可识别性和最优规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26285 2026-05-27 cs.LG cs.NA math.NA

Two-Parameter Flows for Learning Population Dynamics of Physical Systems

用于学习物理系统群体动力学的双参数流

Paul Schwerdtner, Tobias Blickhan, Benjamin Peherstorfer

机构 * Courant Institute of Mathematical Sciences, New York University, 251 Mercer Street, New York, NY 10012, USA(数学科学学院,纽约大学,251 Mercer Street,纽约,NY 10012,美国)

AI总结 提出双参数流方法,通过从基础分布到每个边际的采样时间传输学习高维概率密度动力学,并利用耦合合成轨迹回归提取物理时间速度,无需轨迹信息即可处理旋转等非梯度动力学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05141 2026-05-27 cs.CL

To model human linguistic prediction, make LLMs less superhuman

为了模拟人类语言预测,让大语言模型不那么超人类

Byung-Doh Oh, Tal Linzen

机构 * Division of Linguistics and Multilingual Studies, Nanyang Technological University, Singapore(南洋理工大学语言学与多语言研究系,新加坡) Department of Linguistics, New York University, New York, USA(纽约大学语言学系,纽约,美国) Center for Data Science, New York University, New York, USA(纽约大学数据科学中心,纽约,美国)

AI总结 本文指出大语言模型因超人类预测能力而无法解释人类阅读行为,主张通过模拟人类记忆来改进模型,并提出新实验方向。

Comments Accepted to Trends in Cognitive Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26097 2026-05-26 cs.LG

Forgetting in Language Models: Capacity, Optimization, and Self-Generated Replay

语言模型中的遗忘:容量、优化与自生成回放

Martin Marek, Dongkyu Cho, Shikai Qiu, Rumi Chunara, Pavel Izmailov, Andrew Gordon Wilson

机构 * New York University(纽约大学)

AI总结 本文研究了语言模型中的遗忘问题,发现自生成样本可作为有效的回放数据几乎消除遗忘,并揭示了容量限制和低学习率对遗忘的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26087 2026-05-26 stat.ML cs.LG

DiscoverPhysics: Benchmarking LLMs for Out-of-the-Box Scientific Thinking

DiscoverPhysics: 基准测试LLMs的即用型科学思维

Matt L. Wiemann, Lindsay M. Smith, Peter Melchior, Siddharth Mishra-Sharma, Andrew Gordon Wilson, Pavel Izmailov, Carolina Cuesta-Lázaro

机构 * Princeton University(普林斯顿大学) Boston University(波士顿大学) New York University(纽约大学) Flatiron Institute(Flatiron研究所) Institute for Advanced Studies(高级研究研究所)

AI总结 提出DiscoverPhysics交互式基准,通过让LLM代理探索物理定律偏离现实的模拟世界,评估其设计实验、修正假设和发现物理规律的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25888 2026-05-26 cs.LG math.OC

Optimal and Order-optimal Gated Priority-based Greedy Policies for Two-layer Multi-item Order Fulfillment

两层多物品订单履约的最优和阶最优门控优先级贪婪策略

Xi Chen, Yuze Chen, Ziyi Chen, Yuan Zhou

机构 * Leonard N. Stern School of Business, New York University(纽约大学 Leonard N. Stern 商学院) Qiuzhen College, Tsinghua University(清华大学邱泽学院) Yau Mathematical Sciences Center & Department of Mathematical Sciences, Tsinghua University(清华大学姚数学科学中心及数学科学系)

AI总结 针对电商在两层分销网络中实时履约决策问题,提出门控优先级贪婪策略,证明其竞争比最优性,并通过数值实验验证性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25790 2026-05-26 cs.RO

HoLoArm: Deformable Arms for Collision-Tolerant Quadrotor Flight

HoLoArm: 用于碰撞容忍四旋翼飞行的可变形臂

Quang Ngoc Pham, Jonas Eschmann, Yang Zhou, Alejandro Ojeda Olarte, Giuseppe Loianno, Van Anh Ho

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术研究所) University of California Berkeley(加州大学伯克利分校) New York University(纽约大学)

AI总结 受蜻蜓翅膀结脉结构启发,提出具有柔性臂的四旋翼HoLoArm,结合强化学习控制策略实现被动变形与快速恢复,在高达7.6 m/s碰撞速度下保持稳定飞行。

Comments 8 pages, 15 figures, 1 table, Accepted at the IEEE Robotics and Automation Letters (RA-L) and the IEEE International Conference on Robotics and Automation (ICRA), 2026

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 3, pp. 3582-3589, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25680 2026-05-26 cs.CL cs.AI

Simulating Human Memory with Language Models

用语言模型模拟人类记忆

Qihan Wang, Nicholas Tomlin, Michael Hu, Brian Dillon, Tal Linzen

机构 * NYU(纽约大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 本研究通过心理学经典记忆实验对比语言模型与人类记忆,发现未经调优的模型记忆优于人类,但通过提示策略和压缩器可使模型遗忘方式更接近人类,从而在下游教育任务中成为更有效的用户模拟器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14759 2026-05-26 cs.LG

Crys-JEPA: Accelerating Crystal Discovery via Embedding Screening and Generative Refinement

Crys-JEPA:通过嵌入筛选和生成精炼加速晶体发现

Nian Liu, Nikita Kazeev, Stephen Gregory Dale, Artem Maevskiy, Yuwei Zeng, Ryoji Kubo, Pengru Huang, Thomas Laurent, Yann LeCun, Kostya S. Novoselov, Xavier Bresson

机构 * National University of Singapore(国立新加坡大学) Loyola Marymount University(洛约拉玛丽蒙特大学) New York University(纽约大学) AMI

AI总结 提出Crys-JEPA联合嵌入预测架构,通过能量感知的潜在空间和筛选-精炼流程,解决晶体生成中稳定性和新颖性的冲突,在MP-20和Alex-MP-20数据集上V.S.U.N.指标分别提升53.8%和72.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02215 2026-05-26 stat.ML cs.LG cs.NA math.NA

Hybrid least squares for learning functions from highly noisy data

混合最小二乘法:从高噪声数据中学习函数

Ben Adcock, Bernhard Hientzsch, Akil Narayan, Yiming Xu

机构 * Department of Mathematics, Simon Fraser University(Simon Fraser大学数学系) Courant Institute of Mathematical Sciences, New York University(纽约大学Courant数学科学研究所) Scientific Computing and Imaging Institute, University of Utah(犹他大学科学计算与成像研究所) Department of Mathematics, University of Kentucky(肯塔基大学数学系)

AI总结 针对高噪声数据下的最小二乘函数逼近问题,提出结合Christoffel采样与最优实验设计的混合方法,在样本点生成和噪声平滑方面实现最优性,提升计算效率和样本复杂度,并扩展到凸性约束和自适应随机子空间场景。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10906 2026-05-26 cs.AI

PCGRLLM: Large Language Model-Driven Reward Design for Procedural Content Generation Reinforcement Learning

PCGRLLM:面向程序化内容生成强化学习的大语言模型驱动奖励设计

In-Chang Baek, Sung-Hyun Kim, Sam Earle, Zehua Jiang, Jin-Ha Noh, Julian Togelius, Kyung-Joong Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院) New York University(纽约大学) Corresponding author(通讯作者)

AI总结 提出PCGRLLM架构,利用大语言模型和反馈机制生成奖励函数,在二维环境中实现故事到奖励的生成,性能接近人类水平。

Comments 14 pages, 8 figures, Acccepted to Transactions on Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25250 2026-05-26 cs.AI

LipoAgent: Coordinating Fine-Tuned LLM Agents for Safer Lipid Design

LipoAgent: 协调微调的大语言模型智能体以实现更安全的脂质设计

Leshu Li, An Lu, Haiyu Wang, Zhibin Feng, Conghui Duan, Qing Bao, Zongmin Zhao, Sai Qian Zhang

机构 * New York University(纽约大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

AI总结 提出LipoAgent,一种安全感知的多智能体大语言模型框架,通过条件预测目标强制毒性作为效率预测的前提,并结合多智能体验证,在mRNA转染效率预测上平均相对提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏