Visual Instruction Bottleneck Tuning
机构 * Department of Computer Sciences, University of Wisconsin–Madison(计算机科学系,威斯康星大学麦迪逊分校)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments NeurIPS 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Department of Computer Sciences, University of Wisconsin–Madison(计算机科学系,威斯康星大学麦迪逊分校)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments NeurIPS 2025
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * University of Central Florida(中央佛罗里达大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Columbia University(哥伦比亚大学) ; Amazon Research(亚马逊研究) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments 14 pages, 4 figures
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; Beihang University(北航大学) ; Knowin
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; Agency for Science, Technology and Research, Singapore(新加坡科技研究局) ; Indian Institute of Technology Delhi(印度理工学院德里分校) ; Alibaba DAMO Academy(阿里巴巴达摩院) ; Microsoft Research Asia(微软亚洲研究院) ; Shanghai University of Finance and Economics(上海财经大学) ; Inner Mongolia University(内蒙古大学) ; Kyoto University(京都大学) ; Jiangxi Normal University(江西师范大学) ; Korea University(韩国大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.AI
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Bilibili Inc.(哔哩哔哩公司)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * University of Southern California(美国南加州大学) ; Emory University(埃默里大学)
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV
机构 * Intelligent Game and Decision Lab(智能游戏与决策实验室)
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
Comments IEEE Submission
机构 * Columbia University(哥伦比亚大学)
专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
Comments Updated results with larger dataset experiments and expanded discussion
机构 * Australian National University ; Sydney AI Centre, The University of Sydney ; Curtin University ; University of \'OBuda
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV
Comments ICML 2025 Camera Ready
机构 * DIENS, École Normale Supérieure of Paris, Paris, France(巴黎高等师范学院DIENS) ; Université Paris Cité, LIPADE, F-75006 Paris, France(巴黎大学) ; Be-ys Research, Paris, France(Be-ys研究所)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted at Workshop on Machine Learning in Document Analysis and Recognition (ICDAR WML 2025), Wuhan, China
机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) ; College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) ; School of Computer Science and Technology and Ministry of Education Key Lab For Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院和教育部智能网络与网络安全重点实验室) ; School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学院和教育部智能网络与网络安全重点实验室) ; Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(琶洲实验室(黄埔),广州,广东,中国)
专题命中 视觉问答 :vision-language model(abstract);MLLM(abstract);分类 cs.CV
机构 * University of Bristol(布里斯托大学) ; Brown University(布朗大学) ; South China University of Technology(华南理工大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted by conference EMNLP2025
机构 * Laboratory of Intelligent Collaborative Computing University of Electronic Science and Technology of China(智能协同计算实验室 电子科技大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; Chengdu Technological University(成都理工大学) ; University of Copenhagen(哥本哈根大学)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Cultural Analysis, Cultural Visual Understanding, Cultural Image Transcreation. Accepted by EMNLP 2025 (Oral)
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Shanghai Jiao Tong University(上海交通大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Li Auto Inc. ; the School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
机构 * MBZUAI(穆罕默德·本·拉希德智能研究院)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted at WiNLP, 2025
机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) ; The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) ; National University of Singapore(新加坡国立大学) ; CVTE ; Sun Yat-sen University(孙中山大学) ; Department of Diagnostic Radiology, The University of Hong Kong(香港大学放射科) ; Imaging and Interventional Radiology, Faculty of Medicine, The Chinese University of Hong Kong(香港中文大学医学院影像与介入放射科) ; School of Computer Science, Peking University(北京大学计算机科学系)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments 40 pages, 26 figures, 9 tables
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Zhejiang Sci-Tech University(浙江科技学院)
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV
机构 * University of Southern California(南加州大学)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments To be published in Explainable Computer Vision: Quo Vadis? workshop at ICCV'25
机构 * Georgia Institute of Technology Atlanta, GA, USA(佐治亚理工学院)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
机构 * The Hong Kong University of Science
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.AI
Comments Accepted to CIKM 2025
机构 * Shiv Nadar University Chennai(施瓦斯纳大学钦奈)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
机构 * Brown University(布朗大学) ; Samsung Electronics(三星电子)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Zeyu Xu(作者) ; Junkang Zhang(作者) ; Qiang Wang(作者) ; Yi Liu(作者)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * National Taiwan University of Science and Technology(台湾科技大学) ; University of London(伦敦大学) ; National Taiwan University(台湾大学)
专题命中 视觉问答 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.AI