When Can LLMs Learn to Reason with Weak Supervision?
大语言模型何时能通过弱监督学习推理?
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; New York University(纽约大学) ; Google(谷歌)
AI总结 研究探讨了在弱监督下大语言模型推理能力的提升条件,发现训练奖励饱和动态决定泛化能力,通过分离预训练和微调发现显式推理轨迹的监督微调是关键。
高校专区
大语言模型何时能通过弱监督学习推理?
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; New York University(纽约大学) ; Google(谷歌)
AI总结 研究探讨了在弱监督下大语言模型推理能力的提升条件,发现训练奖励饱和动态决定泛化能力,通过分离预训练和微调发现显式推理轨迹的监督微调是关键。
通过下一步预测扩展临床记录的复发意识基础模型
机构 * Center for Data Science(数据科学中心) ; New York University(纽约大学) ; Department of Radiology(放射科) ; NYU Grossman School of Medicine(NYU Grossman医学院) ; Center for Biomedical Imaging(生物医学成像中心) ; Department of Population Health(人群健康部)
AI总结 本文提出RAVEN模型,通过复发意识的下一步预测策略,改进序列EHR数据生成,解决重复事件对性能指标的干扰问题,并展示模型在不同数据规模下的扩展行为。
语言模型不知道你想要什么:评估深度研究中个性化需求需要真实用户
机构 * University of Maryland(马里兰大学) ; Allen Institute for Artificial Intelligence(人工智能研究院) ; New York University(纽约大学)
AI总结 本文提出MyScholarQA系统,通过用户兴趣分析、个性化查询响应和报告生成,评估深度研究中个性化需求,发现LLM评估存在不足,需真实用户参与以实现有效个性化。
Comments ACL 2026
BenchMarker:一种受教育启发的工具包,用于突出多项选择基准测试中的缺陷
机构 * University of Maryland(马里兰大学) ; New York University(纽约大学) ; Scale AI ; George Mason University(乔治·梅森大学)
AI总结 本文提出BenchMarker工具,利用LLM检测多项选择基准测试中的三项常见缺陷,通过人工标注和审计12个基准测试,发现自动和众包数据中存在大量缺陷,且修复方法可能引入新问题,影响NLP评估质量。
Comments ACL 2026
测试时推理器是战略性的多选题答题者
机构 * University of Maryland(马里兰大学) ; New York University(纽约大学)
AI总结 本文研究了测试时推理器在多选题回答中的策略性表现,发现其在全输入和仅选项输入下均能提升准确性,挑战了部分输入成功总是缺陷的观点。
Comments ACL 2026
机构 * EPFL Lausanne(日内瓦联邦理工学院拉沃斯分校) ; UC Berkeley(伯克利大学) ; Courant Institute, NYU(纽约大学Courant研究所)
Comments Accepted at ICLR 2026. Camera-ready version
多样字典学习
机构 * CMU(卡内基梅隆大学) ; MBZUAI(马克斯·普朗克人工智能研究所) ; NYU(纽约大学)
AI总结 本文提出多样字典学习问题,探讨在无法完全辨识的情况下,如何通过集合运算恢复潜在变量的结构,并展示其在合成和真实数据中的有效性。
Comments ICLR 2026
ARCS:具有拓扑感知图注意力和规格条件的自回归电路合成
机构 * New York University(纽约大学)
AI总结 ARCS通过结合图变分自编码器和流匹配模型,实现快速生成高精度模拟电路,其在拓扑和组件值上达到99.9%的模拟有效性,效率比传统方法提升40倍。
Comments 10 pages, 6 figures, 11 tables. Code available at https://github.com/tusharpathaknyu/ARCS
MoCo:模型协作研究的一站式解决方案
机构 * University of Washington(华盛顿大学) ; University of Notre Dame(诺特大学) ; University of Virginia(弗吉尼亚大学) ; New York University(纽约大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Harvard University(哈佛大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; University of California Irvine(加州大学尔湾分校) ; Stanford University(斯坦福大学)
AI总结 本文提出MoCo库,提供26种模型协作方法及25个评估数据集,验证协作策略在多数场景下优于非协作模型,分析协作系统的有效性及未来研究方向。
Comments Moco is available at https://github.com/BunsenFeng/model_collaboration
BOP-ASK:面向视觉-语言模型的对象交互推理
机构 * New York University(纽约大学) ; NVIDIA(英伟达)
AI总结 本文提出BOP-ASK数据集,用于训练和评估视觉-语言模型的对象交互推理能力,包含15万张图像和3300万对问题答案,涵盖六个任务,验证了模型在复杂环境中的空间推理能力。
Comments Accepted at CVPR 2026. Code, Datasets & Benchmark available at https://bop-ask.github.io/
DR-SAC:在不确定环境下用于强化学习的分布鲁棒软Actor-Critic
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; New York University(纽约大学)
AI总结 本文提出DR-SAC,首个基于Actor-Critic的分布鲁棒强化学习算法,用于连续动作空间的离线学习。通过最大化熵正则化奖励,对抗最坏可能的转移模型,在KL散度约束的不确定性集内实现收敛保证,并结合生成建模方法估计未知的名义转移模型。
Comments 31 Pages. Accepted to ICLR 2026
差异是美德:通过内在维度视角实现弱到强的泛化
机构 * New York University(纽约大学) ; Shanghai Jiaotong University(上海交通大学) ; Princeton University(普林斯顿大学)
AI总结 通过内在低维空间视角分析弱到强泛化,揭示强弱模型差异对泛化误差的正向影响,实验验证了在回归、视觉和NLP任务中的有效性。
Comments ICML 2025
配置胜过选择:在开源LLM用于RTL生成中,超参数敏感性超过模型差异
机构 * NYU Tandon School of Engineering(纽约大学坦顿工程学院) ; NYU Abu Dhabi(纽约大学阿布扎比分校) ; Kansas State University(堪萨斯州立大学)
AI总结 研究通过对比26个开源LLM在VerilogEval和RTLLM上的表现,发现超参数配置对RTL生成效果影响显著,优于模型选择,揭示了配置优化的重要性。
概念树:非平稳临床领域中的可解释持续学习者
机构 * Computer Science Department(计算机科学系) ; New York University(纽约大学) ; Department of Population Health(人口健康部) ; NYU Grossman School of Medicine(NYU Grossman医学院) ; School of Global Public Health(全球公共卫生学院)
AI总结 本文提出Tree of Concepts框架,通过浅层决策树定义固定规则概念接口,并训练概念瓶颈模型预测概念,实现持续学习中的可解释性和稳定性平衡。
Comments 17 pages, 2 figures
当地球基础模型遇见扩散:一种用于地表温度超分辨率的应用
机构 * University of Alabama(阿拉巴马大学) ; Emory University(埃默里大学) ; University of Michigan(密歇根大学) ; University of South Florida(佛罗里达州立大学) ; New York University(纽约大学)
AI总结 本文提出EFDiff框架,利用地球基础模型指导扩散模型进行极端空间退化下的超分辨率重建,通过交叉注意力机制提升细尺度重建效果,优于基线方法。
降低现代多模态大语言模型流水线的峰值内存使用
机构 * New York University(纽约大学)
AI总结 本文提出一种顺序输入压缩机制,在预填充阶段通过结构感知的键值缓存压缩,降低多模态大语言模型的峰值内存使用,同时保持生成性能。
Comments ACL 2026
对LLMs中不安全代码生成的外科修复
机构 * Tandon School of Engineering(坦顿工程学院) ; New York University(纽约大学)
AI总结 研究揭示LLMs生成不安全代码并非知识缺失,而是格式可靠性缺口问题,通过机制分析发现安全表示在最终层被格式合规需求压制,采用针对性修正向量可将不安全生成降低74%。
GraphRAG-Router: 通过强化学习学习高效的图RAGs和LLM路由
机构 * Department of Computer Science, New York University (Shanghai)(纽约大学(上海)计算机科学系) ; Department of Computer Science, University of Liverpool(利物浦大学计算机科学系)
AI总结 本文提出GraphRAG-Router,通过分层路由策略协调异构图RAGs和生成LLM,通过强化学习优化生成分配,降低大模型使用成本并提升泛化能力。
Elder-Sim:一种经过心理测量学验证的用于构建性格稳定的老年人数字孪生平台
机构 * Yulin AI-Enhanced HealthCare Lab(云林人工智能增强医疗实验室) ; School of Nursing, Fudan University(复旦大学护理学院) ; School of Nursing, Medical College of Soochow University(苏州大学医学院护理学院) ; School of Nursing, Dali University(大理大学护理学院) ; Department of Advanced Interdisciplinary Studies, The University of Tokyo(东京大学先进跨学科研究部) ; The First Affiliated Hospital of Soochow University(苏州大学第一附属医院) ; Department of Nursing, The First Affiliated Hospital, Jiangxi Medical College, Nanchang University(江西医学院护理部,南昌大学第一附属医院) ; School of Social Development, East China University of Political Science and Law(中国政法大学社会发展学院) ; Rory Meyers College of Nursing, New York University(纽约大学 Rory Meyers 护理学院) ; New York University Shanghai(纽约大学上海校区)
AI总结 本文提出Elder-Sim平台,通过心理测量学验证方法构建性格稳定的老年人数字孪生代理,利用认知概念化图和LoRA微调提升性格一致性。
离散、高斯和单纯扩散的统一
机构 * New York University(纽约大学) ; CUNY(纽约大学) ; BigHat Biosciences(BigHat 生物科技)
AI总结 本文通过构建基于Wright-Fisher种群遗传模型的统一框架,将离散、高斯和单纯扩散视为不同参数化形式,实现了三种扩散方法的统一,并展示了在不同领域中训练单一模型的可行性。