Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?
社会视听问答的推理:我们处于什么阶段?
机构 * Inria(法国国家信息与自动化研究所) ; Univ. Grenoble Alpes(格勒诺布尔大学) ; CNRS(法国国家科学研究中心) ; University of Twente(特文特大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn)
AI总结 本文针对社会视听问答研究,发现IntentBench存在高噪声,Vanilla SFT基线性能优于现有推理方法,仅用文本模态即可实现与视频相当的性能,并发布了IntentBench-Prime等资源。
Comments Accepted at HCMIW ECCV workshop. Code available here: https://github.com/koenv759/VanillaSFT