Physics-Aware Video Instance Removal Benchmark
具有物理意识的视频实例移除基准
机构 * Tohoku University(东北大学) ; University of Washington(华盛顿大学) ; Texas A&M University(德克萨斯农工大学)
AI总结 本文提出PVIR基准,通过95个高质量视频评估实例移除的物理一致性,测试四种方法在指令遵循、渲染质量和编辑排他性方面的表现,揭示复杂物理交互的挑战。
高校专区
具有物理意识的视频实例移除基准
机构 * Tohoku University(东北大学) ; University of Washington(华盛顿大学) ; Texas A&M University(德克萨斯农工大学)
AI总结 本文提出PVIR基准,通过95个高质量视频评估实例移除的物理一致性,测试四种方法在指令遵循、渲染质量和编辑排他性方面的表现,揭示复杂物理交互的挑战。
表层之下:研究LLMs在使用隐喻沟通中的能力
机构 * Google DeepMind(谷歌DeepMind) ; University of Washington(华盛顿大学)
AI总结 本文研究语言模型是否能利用隐喻进行沟通,并引入四个新评估套件。发现前沿模型倾向于过于直白的沟通,但在某些情况下能通过共同基础减少直白线索,但难以推断隐含的共同基础。
DeepSearch: 通过蒙特卡洛树搜索克服强化学习中的瓶颈问题
机构 * Stanford University(斯坦福大学) ; University of Tokyo(东京大学) ; RIKEN AIP(日本理化学研究所革新智能研究中心) ; UC Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; Amazon AWS(亚马逊云科技)
AI总结 DeepSearch通过将蒙特卡洛树搜索整合到强化学习中,解决探索不足的问题,提升数学推理能力,实验显示其在推理任务中达到62.95%的准确率,且效率显著高于传统方法。