Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?
Shuo Liu, Di Yao, Yan Lin, Gao Cong, Jingping Bi
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
Department of Computer Science, Aalborg University(奥胡斯大学计算机科学系)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs
Sheng Zhang, Yanbo Xu, Naoto Usuyama, Hanwen Xu, Jaspreet Bagga, Robert Tinn, Sam Preston, Rajesh Rao, Mu Wei, Naveen Valluri, Cliff Wong, Andrea Tupini, Yu Wang, Matt Mazzola, Swadheen Shukla, Lars Liden, Jianfeng Gao, Angela Crabtree, Brian Piening, Carlo Bifulco, Matthew P. Lungren, Tristan Naumann, Sheng Wang, Hoifung Poon
专题命中
图文多模态
:multimodal(title,abstract);image-text(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL
VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence
VLT:用于工业智能的视觉-语言-时间序列多模态基础模型
Haiteng Wang, Jingheng Yan, Xiaokang Wang, Lei Ren
机构
*
School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)
;
Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
;
State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室)
;
School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)
专题命中
图文多模态
:multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract);分类 cs.AI
机构
*
Hubei Key Laboratory of Transportation Internet of Things, Wuhan University of Technology(武汉理工大学交通物联网湖北省重点实验室)
;
State Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理全国重点实验室)
Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks
多模态推理的红队测试:通过跨模态纠缠攻击劫持视觉-语言模型
Yu Yan, Sheng Sun, Shengjia Cheng, Teli Liu, Mingfeng Li, Min Liu
机构
*
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
People’s Public Security University of China(中国人民公安大学)
From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models
从结构到协同:多模态大语言模型中视觉-语言感知范式演进综述
Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv
机构
*
School of Computer Science, Sichuan University(四川大学计算机学院)
;
School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(北京大学深圳研究生院电子与计算机工程学院)
;
Institute of Artificial Intelligence (TeleAI), China Telecom and Northwestern Polytechnical University(中国电信与西北工业大学人工智能研究院(TeleAI))