Stitch and Tell: A Structured Multimodal Data Augmentation Method for Spatial Understanding
拼接与讲述:一种结构化多模态数据增强方法用于空间理解
Hang Yin, Xiaomin He, PeiWen Yuan, Yiwei Li, Jiayi Shi, Wenxiao Fan, Shaoxiong Feng, Kan Li
机构
*
School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院)
;
School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)
;
Xiaohongshu Inc(小红书公司)
GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models
GraphVerse:面向多模态大语言模型的综合性视觉图推理基准
Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan
机构
*
New York University(纽约大学)
;
Sensetime Research(商汤科技研究院)
;
Tsinghua University(清华大学)
;
New York University Shanghai(上海纽约大学)
;
University of Georgia(佐治亚大学)
;
The Hong Kong Polytechnic University(香港理工大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV
I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning
我在视频中寻找你:面向以人为中心的视频推理的身份条件查询
Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang
机构
*
Beijing Jiaotong University(北京交通大学)
;
HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团)
;
MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
机构
*
Alibaba Group(阿里巴巴集团)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
University of Alberta(阿尔伯塔大学)
;
Zhejiang University(浙江大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.AI
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Westlake University(西湖大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)
CommentsAccepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/
FedVAR: Prototype-Aligned Federated Framework for Video Anomaly Recognition
FedVAR:用于视频异常识别的原型对齐联邦框架
Ghani Haider, Majid Kundroo, Boyun Eom, Dong Hwan Park, Chen Chen, Taehong Kim
机构
*
Chungbuk National University(忠北国立大学)
;
Electronics and Telecommunications Research Institute (ETRI)(电子通信研究院)
;
University of Central Florida(中佛罗里达大学)