GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models
GraphVerse:面向多模态大语言模型的综合性视觉图推理基准
Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan
机构
*
New York University(纽约大学)
;
Sensetime Research(商汤科技研究院)
;
Tsinghua University(清华大学)
;
New York University Shanghai(上海纽约大学)
;
University of Georgia(佐治亚大学)
;
The Hong Kong Polytechnic University(香港理工大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV
I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning
我在视频中寻找你:面向以人为中心的视频推理的身份条件查询
Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang
机构
*
Beijing Jiaotong University(北京交通大学)
;
HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团)
;
MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
机构
*
Alibaba Group(阿里巴巴集团)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
University of Alberta(阿尔伯塔大学)
;
Zhejiang University(浙江大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.AI
FedVAR: Prototype-Aligned Federated Framework for Video Anomaly Recognition
FedVAR:用于视频异常识别的原型对齐联邦框架
Ghani Haider, Majid Kundroo, Boyun Eom, Dong Hwan Park, Chen Chen, Taehong Kim
机构
*
Chungbuk National University(忠北国立大学)
;
Electronics and Telecommunications Research Institute (ETRI)(电子通信研究院)
;
University of Central Florida(中佛罗里达大学)
机构
*
Peng Cheng Laboratory(鹏城实验室)
;
Southern University of Science and Technology(南方科技大学)
;
Innovation Investment Research Institute(创新投资研究院)
;
Soochow University(苏州大学)