GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction
GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所) ; Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司) ; Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司) ; School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) ; Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)
专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 提出GRACE框架,通过提取时间有序的主谓宾三元组和视觉实体裁剪,增强视频MLLM对细粒度情感线索的提取与推理,在Pitts数据集上提升Qwen2.5-VL和Qwen3-VL性能。
Comments 13 pages, 5 figures