Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs
宽视角闭合:多模态大语言模型中的表征-行动鸿沟
机构 * Nanyang Technological University(南洋理工大学) ; LMMs-Lab Team(多模态大模型实验室团队) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 研究发现多模态大语言模型在感知与行动之间存在鸿沟,通过IMAVB基准测试揭示模型在处理冲突信息时的不足,提出PGLA方法提升拒绝行为。