EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
EmbodiedMidtrain: 通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距
Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong
机构
*
Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)
;
Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究部及博世人工智能中心(BCAI))
3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models
由多模态大语言模型视觉先验引导的3D烟雾场景重建
Xinye Zheng, Fei Wang, Yiqi Nie, Kun Li, Junjie Chen, Jiaqi Zhao, Yanyan Wei, Zhiliang Wu
机构
*
Hefei University of Technology(合肥工业大学)
;
Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
;
Anhui University(安徽大学)
;
United Arab Emirates University(阿联酋大学)
;
Nanyang Technological University(南洋理工大学)
专题命中
幻觉与鲁棒性
:multimodal large language model(title);分类 cs.CV
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
AdaMMS: 为异构多模态大语言模型设计的模型融合方法
Yiyang Du, Xiaochen Wang, Chi Chen, Jiabo Ye, Yiru Wang, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Zhifang Sui, Maosong Sun, Yang Liu
机构
*
Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学)
;
Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)
;
State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学)
;
School of Software Microelectronics, Peking University(软件微电子学院,北京大学)
;
Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团)
;
Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)
;
Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国)
;
ModelTC Open Source Organization, Beijing, China(ModelTC开源组织,北京,中国)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);分类 cs.CV
CLIP-SVD: Efficient and Interpretable Vision-Language Adaptation via Singular Values
CLIP-SVD:通过奇异值实现高效且可解释的视觉-语言适应
Taha Koleilat, Hassan Rivaz, Yiming Xiao
机构
*
Department of Electrical & Computer Engineering, Concordia University(康科迪亚大学电气与计算机工程系)
;
Department of Computer Science & Software Engineering, Concordia University(康科迪亚大学计算机科学与软件工程系)
机构
*
Zhejiang University(浙江大学)
;
Peking University(北京大学)
;
Megvii(科大讯飞)
;
Om AI Research(Om人工智能研究院)
;
Binjiang Research Institute of Zhejiang University(浙江大学滨江研究院)
专题命中
其他VLM
:visual language model(abstract);分类 cs.CV