SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models
SafetyALFRED:评估多模态大语言模型的安全意识规划
机构 * University of Michigan(密歇根大学) ; Boise State University(博伊西州立大学)
AI总结 本文提出SafetyALFRED,基于ALFRED基准测试,引入六类厨房真实世界危险,评估多模态大语言模型在安全意识规划中的表现,发现静态QA评估不足,需转向强调具身环境中的纠正行动的基准。
Comments Work accepted at ACL 2026 Findings