Watch, Remember, Reason: Human-View Video Understanding with MLLMs
Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解
Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang
机构
*
School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院)
;
Wuhan University(武汉大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
CASIA(中国科学院自动化研究所)
;
University of Tokyo(东京大学)
;
University of Liverpool(利物浦大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
UC Merced(加州大学默塞德分校)
专题命中
视觉推理
:MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
The Chinese University of Hong Kong Shanghai AI Laboratory(香港中文大学上海人工智能实验室)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai Innovation Institute(上海创新研究院)
专题命中
视觉推理
:VLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract_cn)
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
Seg-Agent: 无训练语言引导分割的测试时多模态推理
Chao Hao, Jun Xu, Ji Du, Shuo Ye, Ziyue Qiao, Xiaodong Cun, Guangcong Wang, Xubin Zheng, Zitong Yu
机构
*
School of Computing and Information Technology(计算与信息科技学院)
;
Great Bay University(大湾大学)
;
Hangzhou International Innovation Institute(杭州国际创新研究院)
;
Beihang University(北航大学)
;
Department of Computing(计算系)
;
The Hong Kong Polytechnic University(香港理工大学)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)
Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models
Almieyar-Oryx-BloomBench:一个用于视觉语言模型认知知情评估的双语多模态基准
Mohammad Mahdi Abootorabi, Omid Ghahroodi, Anas Madkoor, Marzia Nouri, Doratossadat Dastgheib, Mohamed Hefeeda, Ehsaneddin Asgari
机构
*
University of British Columbia(不列颠哥伦比亚大学)
;
Zuse School(Zuse学校)
;
Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)
;
Hamad Bin Khalifa University(哈马德·本·哈利法大学)
André G. Viveiros, Nuno Gonçalves, André F. T. Martins, Matthias Lindemann
机构
*
Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院)
;
Instituto de Telecomunicações(电信研究所)
;
TransPerfect(TransPerfect公司)
;
Carnegie Mellon University(卡内基梅隆大学)
Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
Shijie Lian, Changti Wu, Laurence Tianruo Yang, Hang Yuan, Bin Yu, Lei Zhang, Kai Chen
机构
*
Huazhong University of Science and Technology(华中科技大学)
;
Zhongguancun Academy(中关村学院)
;
East China Normal University(华东师范大学)
;
Zhengzhou University(郑州大学)
;
Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
专题命中
视觉推理
:vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG