机构
*
Taizhou Institute of Science and Technology, Nanjing University of Science and Technology(泰州科技学院、南京理工大学)
;
Department of Intelligence Science, Xi’an Jiaotong-Liverpool University(智能科学系,西安交通大学利物浦大学)
;
School of Computer Science and Technology, Soochow University(计算机科学与技术学院,苏州大学)
;
Department of Statistical Sciences, University of Toronto(统计科学系,多伦多大学)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Conceptualizing Embeddings: Sparse Disentanglement for Vision-Language Models
将嵌入概念化:面向视觉-语言模型的稀疏解缠
Piotr Kubaty, Patryk Marszałek, Łukasz Struski, Adam Wróbel, Jacek Tabor, Marek Śmieja
机构
*
Faculty of Mathematics and Computer Science, Jagiellonian University(雅盖隆大学数学与计算机科学学院)
;
Doctoral School of Exact and Natural Sciences, Jagiellonian University(雅盖隆大学精确与自然科学博士学校)
;
Centre for Credible AI, Warsaw University of Technology(华沙技术大学可信人工智能中心)
机构
*
MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室,人工智能研究院,上海交通大学)
;
vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);分类 cs.CV、cs.LG
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
超越跨模态对齐:测量和利用模态差距在视觉-语言模型中
Hanqi Yan, Xiangxiang Cui, Lu Yin, Jindong Gu, Paul Pu Liang, Yulan He, Yifei Wang
机构
*
King’s College London(伦敦国王学院)
;
University of Surrey(萨里大学)
;
University of Oxford(牛津大学)
;
MIT CSAIL(麻省理工学院CSAIL实验室)
;
The Alan Turing Institute(阿兰·图灵研究院)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
ST-Prune:面向自动驾驶的视觉-语言模型中无训练的时空令牌修剪
Lin Sha, Haiyun Guo, Tao Wang, Cong Zhang, Min Huang, Jinqiao Wang, Qinghai Miao
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Carizon
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
Anthropogenic Regional Adaptation in Multimodal Vision-Language Model
人为区域适应于多模态视觉-语言模型
Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand Patel, Amit Agarwal, Manuel Antonio Rufino, Carlos Rafael Catalan, Muhammad Reza Qorib, Vicky Feliren, Holy Lovenia, Aye Hninn Khine, Frederikus Hudi, David Anugraha, Alham Fikri Aji, Romrawin Chumpu, Viet-Thanh Pham, Minghan Wang, Mohamed Fazli Imam, Ruochen Zhang, Joseph Marvin Imperial, Khumaisa Nur'aini, Do Xuan Long, Musa Izzanardi Wijanarko, Joel Ruben Antony Moniz, Patrick Amadeus Irawan, Hanif Muhammad Zhafran, Isaiah Flores, Salsabila Zahirah Pranida, Jun Kevin, Jostin Jerico Rosal, Patricia Nicole Monderin, Kun Kerdthaisong, Ahmad Mustafid, My Chiffon Nguyen, Natchapon Jongwiriyanurak, Siva Worajitwannakul, Haochen Li, Adrian Xuan Wei Lim, Bin Wang, Muhammad Ravi Shulthan Habibi, Lynnette Hui Xian Ng, Mithil Bangera, Yeshil Bangera, Priyaranjan Pattnayak, Dun Li Chan, Sherissa Caren Djuniwar, Cho Chan Myei Oo, Hee Ming Shan
机构
*
Cohere
;
SEACrowd
;
AI Singapore
;
Universiti Teknologi PETRONAS
;
Oracle
;
Carnegie Mellon University(卡内基梅隆大学)
;
Monash University, Indonesia(莫纳什大学(印尼))
;
King Mongkut’s University of Technology Thonburi(泰国孔敬大学)
;
Nara Institute of Science and Technology(奈良科学技術大學)
;
Stanford University(斯坦福大学)
;
MBZUAI
;
National University of Singapore(新加坡国立大学)
;
Monash University, Australia(莫纳什大学(澳大利亚))
;
Brown University(布朗大学)
;
University of Bath(巴斯大学)
;
Mila - Quebec AI Institute(蒙特利尔AI研究所)
;
Institut Teknologi Bandung(Bandung 工程技术大学)
;
Ateneo de Manila University(马尼拉亚特内奥大学)
;
Universitas Pelita Harapan(Pelita Harapan 大学)
;
Seoul National University of Science and Technology(首尔科学技术大学)
;
Thammasat University(泰国 Thammasat 大学)
;
Independent(独立)
;
University College London(伦敦大学学院)
;
Nanyang Technological University(南洋理工大学)
;
MiroMind AI
;
University of Indonesia(印度尼西亚大学)
;
University of New Haven(纽黑文大学)
;
INTI International University and Colleges(INTI 国际大学和学院)
;
Binus University(Binus 大学)
;
National University Philippines(菲律宾国家大学)
;
ThoughtFull
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
ForestPrune: 通过时空森林建模实现视频多模态大语言模型的高比率视觉令牌压缩
Shaobo Ju, Baiyang Song, Tao Chen, Jiapeng Zhang, Qiong Wu, Chao Chang, HuaiXi Wang, Yiyi Zhou, Rongrong Ji
机构
*
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)
;
National University of Defense Technology(国防科技大学)
专题命中
VLM训练与架构
:multimodal large language model(title);LLaVA(abstract);分类 cs.CV、cs.AI
A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models
基于补丁的跨视图正则化框架用于多模态大语言模型中的后门防御
Tianmeng Fang, Yong Wang, Zetai Kong, Zengzhen Su, Jun Wang, Chengjin Yu, Wei Wang
机构
*
Singapore Management University(新加坡管理大学)
;
China University of Mining and Technology(中国矿业大学)
;
The University of Melbourne(墨尔本大学)
;
Anhui University(安徽大学)
;
Xi’an Jiaotong University(西安交通大学)
;
Sun Yat-sen University(中山大学)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);分类 cs.CV、cs.LG
机构
*
The Open University of China(中国开放大学)
;
Engineering Research Center of Integration and Application of Digital Learning Technology, Ministry of Education(数字化学习技术集成与应用教育部工程研究中心)
;
OUC-online(国开在线)
专题命中
VLM训练与架构
:vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI