GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution
Fengxiang Wang, Mingshuo Chen, Yueying Li, Di Wang, Haotian Wang, Zonghao Guo, Zefan Wang, Boqi Shan, Long Lan, Yulin Wang, Hongzhen Wang, Wenjing Yang, Bo Du, Jing Zhang
机构
*
College of Computer Science and Technology, National University of Defense Technology, China(中国国防科技大学计算机科学与技术学院)
;
Beijing University of Posts and Telecommunications, China(北京邮电大学)
;
School of Computer Science, Wuhan University, China(武汉大学计算机学院)
;
Zhongguancun Academy, China(中关村学院)
;
Tsinghua University, China(清华大学)
;
Beihang University, China(北航大学)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV
Vision-Centric Activation and Coordination for Multimodal Large Language Models
Yunnan Wang, Fan Lu, Kecheng Zheng, Ziyuan Huang, Ziqiang Li, Wenjun Zeng, Xin Jin
机构
*
MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(人工智能MoE实验室,上海交通大学)
;
Ant Group(蚂蚁集团)
;
Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究所,东部技术研究所,宁波)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
机构
*
Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
;
College of AI, Tsinghua University(清华大学人工智能学院)
;
Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
机构
*
National University of Singapore(新加坡国立大学)
;
University of Toronto(多伦多大学)
;
Peking University(北京大学)
;
Sichuan University(四川大学)
;
Zhejiang University(浙江大学)
Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector
Sifan Li, Hongkai Chen, Yujun Cai, Qingwen Ye, Liyang Chen, Junsong Yuan, Yiwei Wang
机构
*
University of California, Merced(加州大学梅尔德分校)
;
vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)
;
University of Queensland(昆士兰大学)
;
UCLA(加州大学洛杉矶分校)
;
University at Buffalo(布法罗大学)
专题命中
VLM训练与架构
:vision language model(title,abstract);LLaVA(abstract);分类 cs.CV
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
Changyao Tian, Hao Li, Gen Luo, Xizhou Zhu, Weijie Su, Hanming Deng, Jinguo Zhu, Jie Shao, Ziran Zhu, Yunpeng Liu, Lewei Lu, Wenhai Wang, Hongsheng Li, Jifeng Dai
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)
;
Tsinghua University(清华大学)
;
Sensetime Research(商汤科技研究院)
;
Nanjing University(南京大学)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
Tsinghua University(清华大学)
;
InspireOmni AI
;
Alibaba Group(阿里巴巴集团)
;
Case Western Reserve University(凯斯西储大学)
专题命中
VLM训练与架构
:VLM(title,abstract);vision language model(abstract);分类 cs.CV
No Tokens Wasted: Leveraging Long Context in Biomedical Vision-Language Models
Min Woo Sun, Alejandro Lozano, Javier Gamazo Tejero, Vishwesh Nath, Xiao Xiao Sun, James Burgess, Yuhui Zhang, Kun Yuan, Robert Tibshirani, Sean Huver, Serena Yeung-Levy
GeoDANO: Geometric VLM with Domain Agnostic Vision Encoder
Seunghyuk Cho, Zhenyue Qin, Yang Liu, Youngbin Choi, Seungbeom Lee, Dongwoo Kim
机构
*
Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)
;
Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系)
;
Australian National University(澳大利亚国立大学)
Benchmarking Vision-Language and Multimodal Large Language Models in Zero-shot and Few-shot Scenarios: A study on Christian Iconography
Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza
机构
*
Gianmarco Spinaci Department of Classical Philology and Italian Studies, University of Bologna, Italy Villa i Tatti, The Harvard University Center for Italian Renaissance Studies, Florence, Italy(Gianmarco Spinaci 文艺复兴研究系,博洛尼亚大学,意大利 塔蒂别墅,哈佛大学意大利文艺复兴研究中心,佛罗伦萨,意大利)
;
Lukas Klic Villa i Tatti, The Harvard University Center for Italian Renaissance Studies, Florence, Italy(Lukas Klic 塔蒂别墅,哈佛大学意大利文艺复兴研究中心,佛罗伦萨,意大利)
;
Giovanni Colavizza Department of Classical Philology and Italian Studies, University of Bologna, Italy Department of Communication, University of Copenhagen, Denmark(Giovanni Colavizza 文艺复兴研究系,博洛尼亚大学,意大利 传播系,哥本哈根大学,丹麦)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);vision language model(abstract);分类 cs.CV
IntuiTF: MLLM-Guided Transfer Function Optimization for Direct Volume Rendering
Yiyao Wang, Bo Pan, Ke Wang, Han Liu, Jinyuan Mao, Yuxin Liu, Minfeng Zhu, Xiuqi Huang, Weifeng Chen, Bo Zhang, Wei Chen
机构
*
State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室)
;
Laboratory of Art and Archaeology Image (Zhejiang University), Ministry of Education, China(浙江大学艺术与考古图像实验室(教育部,中国))
;
Zhejiang University of Finance&Economics(浙江财经大学)
;
Zhejiang University(浙江大学)
专题命中
VLM训练与架构
:MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV