DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs
Jiahe Zhao, Rongkun Zheng, Yi Wang, Helin Wang, Hengshuang Zhao
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
The University of Hong Kong(香港大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai Innovation Institute(上海创新研究院)
;
Fudan University(复旦大学)
专题命中
VLM训练与架构
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
FACap: A Large-scale Fashion Dataset for Fine-grained Composed Image Retrieval
François Gardères, Shizhe Chen, Camille-Sovanneary Gauthier, Jean Ponce
机构
*
Inria, \'Ecole normale sup\'erieure, CNRS, PSL Research University
;
Courant Institute of Mathematical Sciences
;
Center for Data Science, New York University
机构
*
State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学)
;
Department of Mathematics and Theories, Peng Cheng Laboratory(数学与理论部,鹏城实验室)
;
Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)
;
Pervasive Communications Center, Purple Mountain Laboratories(感知计算中心,紫金山实验室)
;
College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
专题命中
VLM训练与架构
:multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?
Stephanie Käs, Anton Burenko, Louis Markert, Onur Alp Culha, Dennis Mack, Timm Linder, Bastian Leibe
机构
*
Chair for Computer Vision, RWTH Aachen University(计算机视觉教研室,亚琛RWTH大学)
;
Robert Bosch GmbH, Corporate Research & Bosch Center for AI(博世公司,博世企业研究院及博世人工智能中心)
专题命中
VLM训练与架构
:vision language model(abstract);VLM(abstract);分类 cs.CV
Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs
Haoyuan Li, Yanpeng Zhou, Yufei Gao, Tao Tang, Jianhua Han, Yujie Yuan, Dave Zhenyu Chen, Jiawang Bian, Hang Xu, Xiaodan Liang
机构
*
Shenzhen campus of Sun Yat-sen University(中山大学深圳校区)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
MBZUAI
;
Peng Cheng Laboratory(鹏城实验室)
;
Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)
Enhancing Multimodal Continual Instruction Tuning with BranchLoRA
Duzhen Zhang, Yong Ren, Zhong-Zhi Li, Yahan Yu, Jiahua Dong, Chenxing Li, Zhilong Ji, Jinfeng Bai
机构
*
Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Kyoto University(京都大学)
;
Tencent AI Lab(腾讯AI实验室)
;
Tomorrow Advancing Life(明天生命科技)
专题命中
VLM训练与架构
:multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs
Hongliang Li, Jiaxin Zhang, Wenhui Liao, Dezhi Peng, Kai Ding, Lianwen Jin
机构
*
South China University of Technology(华南理工大学)
;
Intsig Information Co., Ltd.(Intsig信息有限公司)
;
INTSIG-SCUT Joint Lab on Document Analysis and Recognition(INTSIG-SCUT文档分析与识别联合实验室)
专题命中
VLM训练与架构
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构
*
PowerChina Huadong Engineering Corporation Limited(国家电力投资集团华东工程公司)
;
Hangzhou Dianzi University(杭州电子科技大学)
;
The University of Manchester(曼彻斯特大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
;
Zhejiang University(浙江大学)
机构
*
State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)
;
School of Intelligence Science and Technology(智能科学与技术学院)
;
State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
;
XMU(厦门大学)
;
HKU(香港大学)
;
PKU(北京大学)
;
CUHK(香港中文大学)
;
ECNU(华东师范大学)
;
CASIA(中国科学院自动化研究所)