FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
FriendBench:人类与多模态大语言模型的二元熟悉度推理基准
机构 * Fluid Concepts Research(流体概念研究机构)
专题命中 其他VLM :multimodal large language model(title);分类 cs.CV、cs.AI
AI总结 该研究推出FriendBench基准,通过20秒二元破冰对话片段推断两人熟悉度,对比7家公司26个模型与人类的表现,发现模型与人类准确率无统计差异但先验倾向不同,且仅人类能从可见行为中获益,同时发布了相关资源。
Comments 15 pages, 3 figures