Prior-Agnostic Incentive-Compatible Exploration
先验无关的激励相容探索
机构 * Department of Computer and Information Sciences, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学)
AI总结 本文提出了一种在动态环境中实现激励相容探索的算法,通过交换遗憾界限使代理在近似贝叶斯纳什均衡中忠实遵循预测,解决了代理冲突先验信念的问题。
高校专区
先验无关的激励相容探索
机构 * Department of Computer and Information Sciences, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学)
AI总结 本文提出了一种在动态环境中实现激励相容探索的算法,通过交换遗憾界限使代理在近似贝叶斯纳什均衡中忠实遵循预测,解决了代理冲突先验信念的问题。
LD-MoLE: 可学习动态路由用于LoRA专家混合
机构 * University of Connecticut(康涅狄格大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of California San Diego(圣地亚哥大学)
AI总结 LD-MoLE通过可学习动态路由机制实现自适应的token依赖和层间专家分配,提升大型语言模型在下游任务中的性能。
Comments International Conference on Learning Representations (ICLR 2026)