GeoWorld-VLM: Geometry from World Models for Vision-Language Models
GeoWorld-VLM:从世界模型中获取几何结构用于视觉-语言模型
Renjie Gu, Kaichen Zhou, Yan Luo, Mengyu Wang
机构
*
Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室)
;
Kempner Institute for the Study of Natural and Artificial Intelligence(凯普纳自然与人工智能研究 institute)
;
Harvard University(哈佛大学)
Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality
跨模态掩码组合概念建模以增强视觉-语言组合性
Wei Li, Zhen Huang, Xinmei Tian
机构
*
MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部脑启发智能感知与认知重点实验室)
;
Independent Researcher(独立研究员)
专题命中
VLM训练与架构
:vision-language model(abstract);VLM(abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
CausalMoE: A Billion-Scale Multimodal Foundation Model for Granger Causal Discovery with Pattern-Routed Heterogeneous Experts
CausalMoE:基于模式路由异构专家的十亿规模多模态基础模型用于格兰杰因果发现
Bo Liu, Di Dai, Jingwei Liu, Jiarui Jin, Xiaocheng Fang, Guangkun Nie, Hongyan Li, Shenda Hong
机构
*
State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室)
;
National Institute of Health Data Science, and Institute for Artificial Intelligence, Peking University(北京大学健康医疗大数据国家研究院、人工智能研究院)
机构
*
University of Central Florida(中央佛罗里达大学)
;
BITS Pilani(比特斯理工学院)
;
Ho Chi Minh City University of Science(胡志明市科学大学)
;
Amazon GenAI Project(亚马逊生成人工智能项目)
机构
*
Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学)
;
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
;
State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学)
;
Department of Automation, Tsinghua University(自动化系,清华大学)
专题命中
VLM训练与架构
:vision language model(abstract);分类 cs.CV