arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-04-21 至 2026-04-21 共收录 20
2604.18574 2026-04-21 cs.LG cs.AI

When Can LLMs Learn to Reason with Weak Supervision?

大语言模型何时能通过弱监督学习推理?

Salman Rahman, Jingyan Shen, Anna Mordvina, Hamid Palangi, Saadia Gabriel, Pavel Izmailov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) New York University(纽约大学) Google(谷歌)

AI总结 研究探讨了在弱监督下大语言模型推理能力的提升条件,发现训练奖励饱和动态决定泛化能力,通过分离预训练和微调发现显式推理轨迹的监督微调是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24562 2026-04-21 cs.LG

Scaling Recurrence-aware Foundation Models for Clinical Records via Next-Visit Prediction

通过下一步预测扩展临床记录的复发意识基础模型

Haresh Rengaraj Rajamohan, Xiang Gao, Weicheng Zhu, Shih-Lun Huang, Long Chen, Gabe Schulman, Huizhen Jin, Shengduo Li, Yixuan Wang, Huidi Yang, Kyunghyun Cho, Cem M. Deniz, Narges Razavian

机构 * Center for Data Science(数据科学中心) New York University(纽约大学) Department of Radiology(放射科) NYU Grossman School of Medicine(NYU Grossman医学院) Center for Biomedical Imaging(生物医学成像中心) Department of Population Health(人群健康部)

AI总结 本文提出RAVEN模型,通过复发意识的下一步预测策略,改进序列EHR数据生成,解决重复事件对性能指标的干扰问题,并展示模型在不同数据规模下的扩展行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16120 2026-04-21 cs.CL

Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users

语言模型不知道你想要什么:评估深度研究中个性化需求需要真实用户

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eunsol Choi, Jordan Lee Boyd-Graber, Aakanksha Naik

机构 * University of Maryland(马里兰大学) Allen Institute for Artificial Intelligence(人工智能研究院) New York University(纽约大学)

AI总结 本文提出MyScholarQA系统,通过用户兴趣分析、个性化查询响应和报告生成,评估深度研究中个性化需求,发现LLM评估存在不足,需真实用户参与以实现有效个性化。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06221 2026-04-21 cs.CL

BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks

BenchMarker:一种受教育启发的工具包,用于突出多项选择基准测试中的缺陷

Nishant Balepur, Bhavya Rajasekaran, Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Scale AI George Mason University(乔治·梅森大学)

AI总结 本文提出BenchMarker工具,利用LLM检测多项选择基准测试中的三项常见缺陷,通过人工标注和审计12个基准测试,发现自动和众包数据中存在大量缺陷,且修复方法可能引入新问题,影响NLP评估质量。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07761 2026-04-21 cs.CL

Test-Time Reasoners Are Strategic Multiple-Choice Test-Takers

测试时推理器是战略性的多选题答题者

Nishant Balepur, Atrey Desai, Rachel Rudinger

机构 * University of Maryland(马里兰大学) New York University(纽约大学)

AI总结 本文研究了测试时推理器在多选题回答中的策略性表现,发现其在全输入和仅选项输入下均能提升准确性,挑战了部分输入成功总是缺陷的观点。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21722 2026-04-21 cs.LG cs.AI stat.ML

Saddle-To-Saddle Dynamics in Deep ReLU Networks: Low-Rank Bias in the First Saddle Escape

Ioannis Bantzis, James B. Simon, Arthur Jacot

机构 * EPFL Lausanne(日内瓦联邦理工学院拉沃斯分校) UC Berkeley(伯克利大学) Courant Institute, NYU(纽约大学Courant研究所)

Comments Accepted at ICLR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17568 2026-04-21 cs.LG math.ST stat.ML stat.TH

Diverse Dictionary Learning

多样字典学习

Yujia Zheng, Zijian Li, Shunxing Fan, Andrew Gordon Wilson, Kun Zhang

机构 * CMU(卡内基梅隆大学) MBZUAI(马克斯·普朗克人工智能研究所) NYU(纽约大学)

AI总结 本文提出多样字典学习问题,探讨在无法完全辨识的情况下,如何通过集合运算恢复潜在变量的结构,并展示其在合成和真实数据中的有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29068 2026-04-21 cs.LG cs.AR

ARCS: Autoregressive Circuit Synthesis with Topology-Aware Graph Attention and Spec Conditioning

ARCS:具有拓扑感知图注意力和规格条件的自回归电路合成

Tushar Dhananjay Pathak

机构 * New York University(纽约大学)

AI总结 ARCS通过结合图变分自编码器和流匹配模型,实现快速生成高精度模拟电路,其在拓扑和组件值上达到99.9%的模拟有效性,效率比传统方法提升40倍。

Comments 10 pages, 6 figures, 11 tables. Code available at https://github.com/tusharpathaknyu/ARCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21257 2026-04-21 cs.CL

MoCo: A One-Stop Shop for Model Collaboration Research

MoCo:模型协作研究的一站式解决方案

Shangbin Feng, Yuyang Bai, Ziyuan Yang, Yike Wang, Zhaoxuan Tan, Jiajie Yan, Zhenyu Lei, Wenxuan Ding, Weijia Shi, Haojin Wang, Zhenting Qi, Yuru Jiang, Heng Wang, Chengsong Huang, Yu Fei, Jihan Yao, Yilun Du, Luke Zettlemoyer, Yejin Choi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) University of Notre Dame(诺特大学) University of Virginia(弗吉尼亚大学) New York University(纽约大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of California Irvine(加州大学尔湾分校) Stanford University(斯坦福大学)

AI总结 本文提出MoCo库,提供26种模型协作方法及25个评估数据集,验证协作策略在多数场景下优于非协作模型,分析协作系统的有效性及未来研究方向。

Comments Moco is available at https://github.com/BunsenFeng/model_collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16857 2026-04-21 cs.CV cs.RO

BOP-ASK: Object-Interaction Reasoning for Vision-Language Models

BOP-ASK:面向视觉-语言模型的对象交互推理

Vineet Bhat, Sungsu Kim, Valts Blukis, Greg Heinrich, Prashanth Krishnamurthy, Ramesh Karri, Stan Birchfield, Farshad Khorrami, Jonathan Tremblay

机构 * New York University(纽约大学) NVIDIA(英伟达)

AI总结 本文提出BOP-ASK数据集,用于训练和评估视觉-语言模型的对象交互推理能力,包含15万张图像和3300万对问题答案,涵盖六个任务,验证了模型在复杂环境中的空间推理能力。

Comments Accepted at CVPR 2026. Code, Datasets & Benchmark available at https://bop-ask.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12622 2026-04-21 cs.LG cs.AI math.OC

DR-SAC: Distributionally Robust Soft Actor-Critic for Reinforcement Learning under Uncertainty

DR-SAC:在不确定环境下用于强化学习的分布鲁棒软Actor-Critic

Mingxuan Cui, Duo Zhou, Yuxuan Han, Grani A. Hanasusanto, Qiong Wang, Huan Zhang, Zhengyuan Zhou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University(纽约大学)

AI总结 本文提出DR-SAC,首个基于Actor-Critic的分布鲁棒强化学习算法,用于连续动作空间的离线学习。通过最大化熵正则化奖励,对抗最坏可能的转移模型,在KL散度约束的不确定性集内实现收敛保证,并结合生成建模方法估计未知的名义转移模型。

Comments 31 Pages. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05075 2026-04-21 cs.LG cs.NA math.NA stat.ML

Discrepancies are Virtue: Weak-to-Strong Generalization through Lens of Intrinsic Dimension

差异是美德:通过内在维度视角实现弱到强的泛化

Yijun Dong, Yicheng Li, Yunai Li, Jason D. Lee, Qi Lei

机构 * New York University(纽约大学) Shanghai Jiaotong University(上海交通大学) Princeton University(普林斯顿大学)

AI总结 通过内在低维空间视角分析弱到强泛化,揭示强弱模型差异对泛化误差的正向影响,实验验证了在回归、视觉和NLP任务中的有效性。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17102 2026-04-21 cs.AR cs.AI

Configuration Over Selection: Hyperparameter Sensitivity Exceeds Model Differences in Open-Source LLMs for RTL Generation

配置胜过选择:在开源LLM用于RTL生成中,超参数敏感性超过模型差异

Minghao Shao, Zeng Wang, Weimin Fu, Xiaolong Guo, Johann Knechtel, Ozgur Sinanoglu, Ramesh Karri, Muhammad Shafique

机构 * NYU Tandon School of Engineering(纽约大学坦顿工程学院) NYU Abu Dhabi(纽约大学阿布扎比分校) Kansas State University(堪萨斯州立大学)

AI总结 研究通过对比26个开源LLM在VerilogEval和RTLLM上的表现,发现超参数配置对RTL生成效果影响显著,优于模型选择,揭示了配置优化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17089 2026-04-21 cs.LG

Tree of Concepts: Interpretable Continual Learners in Non-Stationary Clinical Domains

概念树:非平稳临床领域中的可解释持续学习者

Dongkyu Cho, Xiyue Li, Samrachana Adhikari, Rumi Chunara

机构 * Computer Science Department(计算机科学系) New York University(纽约大学) Department of Population Health(人口健康部) NYU Grossman School of Medicine(NYU Grossman医学院) School of Global Public Health(全球公共卫生学院)

AI总结 本文提出Tree of Concepts框架,通过浅层决策树定义固定规则概念接口,并训练概念瓶颈模型预测概念,实现持续学习中的可解释性和稳定性平衡。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16841 2026-04-21 cs.CV cs.LG

When Earth Foundation Models Meet Diffusion: An Application to Land Surface Temperature Super-Resolution

当地球基础模型遇见扩散:一种用于地表温度超分辨率的应用

Yiheng Chen, Zihui Ma, Peishi Jiang, Yilong Dai, Qikai Hu, Xinyue Ye, Lingyao Li, Rita Sousa, Runlong Yu

机构 * University of Alabama(阿拉巴马大学) Emory University(埃默里大学) University of Michigan(密歇根大学) University of South Florida(佛罗里达州立大学) New York University(纽约大学)

AI总结 本文提出EFDiff框架,利用地球基础模型指导扩散模型进行极端空间退化下的超分辨率重建,通过交叉注意力机制提升细尺度重建效果,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16734 2026-04-21 cs.CV cs.AI

Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines

降低现代多模态大语言模型流水线的峰值内存使用

Junwan Kim, Hyunkyung Bae

机构 * New York University(纽约大学)

AI总结 本文提出一种顺序输入压缩机制,在预填充阶段通过结构感知的键值缓存压缩,降低多模态大语言模型的峰值内存使用,同时保持生成性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16697 2026-04-21 cs.CR cs.LG

Surgical Repair of Insecure Code Generation in LLMs

对LLMs中不安全代码生成的外科修复

Gustavo Sandoval, Brendan Dolan-Gavitt, Siddharth Garg

机构 * Tandon School of Engineering(坦顿工程学院) New York University(纽约大学)

AI总结 研究揭示LLMs生成不安全代码并非知识缺失,而是格式可靠性缺口问题,通过机制分析发现安全表示在最终层被格式合规需求压制,采用针对性修正向量可将不安全生成降低74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16401 2026-04-21 cs.IR cs.AI

GraphRAG-Router: Learning Cost-Efficient Routing over GraphRAGs and LLMs with Reinforcement Learning

GraphRAG-Router: 通过强化学习学习高效的图RAGs和LLM路由

Dongzhe Fan, Chuanhao Ji, Zimu Wang, Tong Chen, Qiaoyu Tan

机构 * Department of Computer Science, New York University (Shanghai)(纽约大学(上海)计算机科学系) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系)

AI总结 本文提出GraphRAG-Router,通过分层路由策略协调异构图RAGs和生成LLM,通过强化学习优化生成分配,降低大模型使用成本并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16343 2026-04-21 cs.HC cs.AI

Elder-Sim: A Psychometrically Validated Platform for Personality-Stable Elderly Digital Twins

Elder-Sim:一种经过心理测量学验证的用于构建性格稳定的老年人数字孪生平台

Jiaqing Wang, Zhongfang Yang, Xingyuan Zhu, Zong'an Huang, Hao Wang, Li Tian, Ying Cao, Xiaomin Qu, Xiang Qi, Bei Wu, Zheng Zhu

机构 * Yulin AI-Enhanced HealthCare Lab(云林人工智能增强医疗实验室) School of Nursing, Fudan University(复旦大学护理学院) School of Nursing, Medical College of Soochow University(苏州大学医学院护理学院) School of Nursing, Dali University(大理大学护理学院) Department of Advanced Interdisciplinary Studies, The University of Tokyo(东京大学先进跨学科研究部) The First Affiliated Hospital of Soochow University(苏州大学第一附属医院) Department of Nursing, The First Affiliated Hospital, Jiangxi Medical College, Nanchang University(江西医学院护理部,南昌大学第一附属医院) School of Social Development, East China University of Political Science and Law(中国政法大学社会发展学院) Rory Meyers College of Nursing, New York University(纽约大学 Rory Meyers 护理学院) New York University Shanghai(纽约大学上海校区)

AI总结 本文提出Elder-Sim平台,通过心理测量学验证方法构建性格稳定的老年人数字孪生代理,利用认知概念化图和LoRA微调提升性格一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15923 2026-04-21 cs.LG

A Unification of Discrete, Gaussian, and Simplicial Diffusion

离散、高斯和单纯扩散的统一

Nuria Alina Chandra, Yucen Lily Li, Alan N. Amin, Alex Ali, Joshua Rollins, Sebastian W. Ober, Aniruddh Raghu, Andrew Gordon Wilson

机构 * New York University(纽约大学) CUNY(纽约大学) BigHat Biosciences(BigHat 生物科技)

AI总结 本文通过构建基于Wright-Fisher种群遗传模型的统一框架,将离散、高斯和单纯扩散视为不同参数化形式,实现了三种扩散方法的统一,并展示了在不同领域中训练单一模型的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏