VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
VS-Bench:评估多智能体环境中视觉语言模型的战略能力
机构 * EE, Tsinghua University(清华大学电子工程系) ; SIGS, Tsinghua University(清华大学深圳国际研究生院) ; Li Auto Inc.(理想汽车) ; IIIS, Tsinghua University(清华大学交叉信息研究院)
AI总结 VS-Bench是首个评估多智能体环境中视觉语言模型战略能力的多模态基准,涵盖合作、竞争和混合动机交互,通过感知、推理和决策三个维度评估15种领先模型,揭示当前模型在推理和决策上的显著差距。
Comments Published at CVPR 2026 (Oral)