Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance
通过格罗莫夫-瓦瑟斯坦距离重新思考VLM中的模型选择
Muyang Li, Yucheng Liu, Jianbo Ma, Elliot Osborne, Bo Han, Tongliang Liu
机构
*
Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学)
;
Dolby Laboratories(杜比实验室)
;
TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体)
Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression
消息而非令牌:用于忠实VLM压缩的基础核心集
Long Qian, Jiaqi Wei, Bingke Zhu, Yingying Chen, Jinqiao Wang
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Wuhan AI Research(武汉人工智能研究院)
;
Cardiff University(卡迪夫大学)
专题命中
VLM训练与架构
:VLM(title,title_cn);vision language model(abstract);分类 cs.CV
MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion
MGDT:具有关系自适应专家混合的MLLM引导扩散变压器用于多模态知识图谱补全
Xu Hou, Meiyu Liang, Wei Huang, Yawen Li, Zhe Xue, Wu Liu, Guanhua Ye, Lei Shi, Kangkang Lu
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Zhejiang University(浙江大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Communication University of China(中国传媒大学)
专题命中
VLM训练与架构
:MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI
TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference
TOPS:通过构建令牌最优保留集实现高效多模态大语言模型推理的第一性原理视觉令牌剪枝
Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Nanyang Technological University(南洋理工大学)
;
Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)
专题命中
VLM训练与架构
:MLLM(title,abstract);LLaVA(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI
Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design
Design-MLLM:一种用于可验证且美观的室内设计的强化对齐框架
Yuxuan Yang, Xiaotong Mao, Jingyao Wang
机构
*
National Jiangsu University of Finance(江苏财经大学)
;
University of Lorraine(洛林大学)
;
Institute of Electronics and Information Technology, Chinese Academy of Sciences(中国科学院电子信息技术研究所)
;
Tsinghua University(清华大学)
专题命中
VLM训练与架构
:MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.LG
TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning
TCAP: 面向MLLM微调中无监督后门检测的三组件注意力分析
Mingzu Liu, Hao Fang, Runmin Cong
机构
*
School of Control Science and Engineering, Shandong University, Jinan, China(控制科学与工程学院,山东大学,济南,中国)
;
Key Laboratory of Industrial Intelligent Systems, Shandong Province, China(山东省工业智能系统重点实验室,中国)
专题命中
VLM训练与架构
:MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI
机构
*
East China Normal University(华东师范大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Northwest A&F University(西北农林科技大学)
;
Tencent Youtu Lab(腾讯优图实验室)
;
Xiamen University(厦门大学)
专题命中
VLM训练与架构
:LLaVA(title,abstract);multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
Hongyu Li, Jinyu Chen, Ziyu Wei, Shaofei Huang, Tianrui Hui, Jialin Gao, Xiaoming Wei, Si Liu
机构
*
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
;
School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
Meituan(美团)
专题命中
VLM训练与架构
:LLaVA(title,abstract);multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract)