Selecting Decision-Relevant Concepts in Reinforcement Learning
强化学习中决策相关概念的选择
机构 * Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学)
AI总结 本文提出决策相关选择算法,通过状态抽象视角自动选择决策相关的概念,提升强化学习策略的可解释性和性能。
Comments 16 pages, 13 figures
高校专区
强化学习中决策相关概念的选择
机构 * Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学)
AI总结 本文提出决策相关选择算法,通过状态抽象视角自动选择决策相关的概念,提升强化学习策略的可解释性和性能。
Comments 16 pages, 13 figures
搜索,不要猜测:教小语言模型成为有效的搜索代理
机构 * New York University(纽约大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Nanyang Technological University(南洋理工大学)
AI总结 本文通过评估复杂多跳推理任务,发现小语言模型(SLMs)虽参数较少,但检索工具使用更少且易产生幻觉。提出轻量级微调方法\policy,使SLMs能可靠检索并生成基于证据的答案,提升Bamboogle和HotpotQA性能17.3和15.3分,达到LLM水平。
Comments 13 pages, 5 figures
多轮医学诊断基准测试:Hold、Lure 和 Self-Correction
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; New York University(纽约大学) ; The University of Texas Southwestern Medical Center(德克萨斯大学西南医学中心) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文通过MINT基准测试揭示了大语言模型在多轮证据积累中的行为模式,发现提前回答、自我修正和强诱因影响诊断决策,提出延迟提问和保留关键证据可提升诊断准确性。
RESCORE:基于大语言模型的控制系统研究论文仿真恢复
机构 * New York University(纽约大学) ; Tandon School of Engineering(坦登工程学院)
AI总结 本文提出RESCORE框架,通过迭代执行反馈和视觉比较提升论文仿真恢复精度,实现40.7%的仿真恢复率,比单次生成方法更高效,节省验证时间与成本。
Comments This work has been submitted to the IEEE for possible publication
联邦迁移学习与差分隐私
机构 * School of Mathematics, University of Birmingham(伯明翰大学数学学院) ; Department of Statistics, Columbia University(哥伦比亚大学统计系) ; Department of Biostatistics, School of Global Public Health, New York University(纽约大学全球公共卫生学院生物统计系) ; Department of Statistics, University of Warwick(华威大学统计系)
AI总结 本文提出联邦差分隐私框架,解决分布式数据异质性和隐私保护问题,通过多源数据信息提升目标数据集学习效果,分析隐私模型的统计问题及最小最大率。
Comments 101 pages, 7 figures
扩散路径对齐用于长程运动生成与领域转换
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Institute of Information Systems, Universität Liechtenstein(列支敦士登大学信息系统研究所) ; Department of Computer Science, New York University(纽约大学计算机科学系) ; MRC Biostatistics Unit, University of Cambridge(剑桥大学MRC生物统计单元)
AI总结 本文提出基于扩散的优化框架,通过控制能量目标实现运动领域间流畅过渡,提升长程人类运动生成的连贯性与准确性。
人工智能与系统性风险:金融市场中表现性预测、算法从众与认知依赖的统一模型
机构 * New York University(纽约大学)
AI总结 本文提出一个统一模型,研究人工智能在金融市场中通过表现性预测、算法从众和认知依赖三个相互强化渠道生成系统性风险,揭示了AI渗透率增加对系统性风险的超线性放大效应。
NeuroSymb-MRG:基于主动不确定性最小化的可微推断推理用于放射科报告生成
机构 * University of Macau(澳门大学) ; Tsinghua University(清华大学) ; Fudan University(复旦大学) ; Peking University(北京大学) ; The First People’s Hospital of Foshan(佛山市第一人民医院) ; Capital Medical University(首都医科大学) ; Rutgers Cancer Institute, NJ, USA(罗格斯癌症研究所(美国新泽西州);纽约大学朗格尼健康中心(美国纽约州)) ; and NYU Langone Health, NY, USA(Techno国际新城(印度加尔各答)) ; Techno International New Town, Kolkata, India
AI总结 本文提出NeuroSymb-MRG框架,结合神经符号推断与主动不确定性最小化,生成结构化且临床可靠的报告。通过图像特征到概率临床概念的映射,构建可微推理链,并通过检索和约束语言模型编辑优化文本输出。
Comments 12 pages, 1 figure
面向概念的标记解释方法用于向量量化生成模型
机构 * School of Computing, University of Georgia(佐治亚大学计算学院) ; Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) ; Department of Computer Science, New York University(纽约大学计算机科学系)
AI总结 本文提出CORTEX方法,通过分析标记重要性及代码本来解释VQGMs生成过程,提升模型透明度并应用于图像编辑和特征检测。
Comments 17 pages, 7 figures
Journal ref In Proceedings of the 42nd International Conference on Machine Learning (ICML), PMLR 267:71034-71050, 2025
链式帧:通过帧感知推理推进多模态大语言模型的视频理解
机构 * New York University(纽约大学) ; EPFL(瑞士联邦理工学院洛桑分校)
AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026