Discrete Diffusion Models Exploit Asymmetry to Solve Lookahead Planning Tasks
离散扩散模型利用不对称性解决前瞻规划任务
机构 * Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; New York University(纽约大学)
AI总结 离散扩散模型通过反向生成机制在无需复杂遍历机制的情况下解决前瞻规划任务,相比自回归模型更高效。
高校专区
离散扩散模型利用不对称性解决前瞻规划任务
机构 * Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; New York University(纽约大学)
AI总结 离散扩散模型通过反向生成机制在无需复杂遍历机制的情况下解决前瞻规划任务,相比自回归模型更高效。
部分软匹配距离用于神经表征比较的局部单元对应
机构 * Department of Cognitive Science University of California, San Diego(认知科学系加州大学圣地亚哥分校) ; Center for Neural Science, New York University(纽约大学神经科学中心) ; Center for Computational Neuroscience, Flatiron Institute(Flatiron研究所计算神经科学中心) ; Department of Cognitive Science Department of Computer Science and Engineering University of California, San Diego(认知科学系计算机科学与工程系加州大学圣地亚哥分校)
AI总结 本文提出部分软匹配距离,通过允许部分神经元未匹配,提高了神经表征比较的鲁棒性和效率。
理解经验性反学习与组合可解释性
机构 * Middlebury College(中大西洋学院) ; New York University(纽约大学) ; MIT(麻省理工学院) ; Red Hat(红帽公司)
AI总结 本文通过组合可解释性框架研究经验性反学习中知识的持续存在机制,揭示反学习方法在移除目标概念知识方面的有效性及知识恢复的可能性。
面向角色的语言模型:用于组织中的安全且上下文化的访问控制
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Nazarbayev University(纳扎尔拜耶夫大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; New York University Abu Dhabi(纽约大学阿布扎克分校)
AI总结 本文提出面向角色的语言模型,通过三种策略实现基于组织角色的安全访问控制,并通过实验验证其在不同组织结构下的性能和鲁棒性。
Comments AACL 2025 - Main
要训练一个好的模型,需要一个好的模型:通用高斯先验用于优化的大型语言模型
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Electrical and Computer Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) ; Computer Science, New York University Shanghai(纽约大学上海分校计算机科学系)
AI总结 本文提出基于广义高斯分布的初始化和训练方法,通过减少冗余和通信开销,提升大型语言模型的训练效率和性能。
基于集成学习和SHAP的可解释信用违约预测
机构 * New York University(纽约大学) ; Independent Researcher(独立研究者) ; University of Michigan(密歇根大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文提出基于集成学习和SHAP的信用违约预测方法,通过评估多种模型性能,发现集成学习在处理复杂非线性关系和数据不平衡方面表现优异,SHAP分析揭示外部信用评分变量对模型决策的主导作用,提升模型可解释性与实用性。
通过解耦的直通估计器改进离散优化
机构 * College of Design and Engineering, National University of Singapore, Singapore(设计与工程学院,新加坡国立大学) ; Google Deepmind, California, USA(DeepMind,美国加州) ; New York University, USA(纽约大学)
AI总结 本文提出了解耦直通估计器,通过分别控制前向传递和反向传递的温度参数,提高了离散优化的性能。
DP-RFT: 通过差分隐私强化微调学习生成合成文本
机构 * New York University(纽约大学) ; Microsoft(微软) ; University of Southern California(南加州大学)
AI总结 DP-RFT通过差分隐私强化微调方法,在不直接接触隐私数据的情况下生成高质量合成文本。