arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2406.12742 2024-06-19 cs.CV cs.AI cs.CL 67%

Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning

Bingchen Zhao, Yongshuo Zong, Letian Zhang, Timothy Hospedales

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments First three authors contributed equally. Dataset: https://huggingface.co/datasets/VLLMs/MIRB

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11069 2024-06-18 cs.CV cs.AI cs.CL 67%

WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences

Yujie Lu, Dongfu Jiang, Wenhu Chen, William Yang Wang, Yejin Choi, Bill Yuchen Lin

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments link: https://hf.co/spaces/WildVision/vision-arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03071 2024-06-06 cs.CV cs.AI cs.MM 67%

Exploiting LMM-based knowledge for image classification tasks

Maria Tzelepi, Vasileios Mezaris

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted for publication, 25th Int. Conf. on Engineering Applications of Neural Networks (EANN/EAAAI 2024), Corfu, Greece, June 2024. This is the "submitted manuscript"

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18258 2024-05-29 cs.CV cs.AI cs.CL 67%

Text-only Synthesis for Image Captioning

Qing Zhou, Junlin Huang, Qiang Li, Junyu Gao, Qi Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01879 2024-05-16 cs.CV cs.AI cs.CL 67%

Revisiting the Role of Language Priors in Vision-Language Models

Zhiqiu Lin, Xinyue Chen, Deepak Pathak, Pengchuan Zhang, Deva Ramanan

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Published at ICML 2024. Website: https://linzhiqiu.github.io/papers/visual_gpt_score/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01345 2024-05-16 cs.CV cs.AI cs.CL cs.LG 67%

Skip \n: A Simple Method to Reduce Hallucination in Large Vision-Language Models

Zongbo Han, Zechen Bai, Haiyang Mei, Qianli Xu, Changqing Zhang, Mike Zheng Shou

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07661 2024-05-08 cs.CV cs.CL cs.LG cs.MM 67%

CLIP as RNN: Segment Countless Visual Concepts without Training Endeavor

Shuyang Sun, Runjia Li, Philip Torr, Xiuye Gu, Siyang Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.MM

Comments To appear in CVPR 2024. Project page: https://torrvision.com/clip_as_rnn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09690 2024-04-16 cs.CV cs.AI cs.CL cs.LG 67%

Harnessing GPT-4V(ision) for Insurance: A Preliminary Exploration

Chenwei Lin, Hanjia Lyu, Jiebo Luo, Xian Xu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19837 2024-04-12 cs.LG cs.AI cs.CL cs.CV cs.LO 67%

Concept-based Analysis of Neural Networks via Vision-Language Models

Ravi Mangal, Nina Narodytska, Divya Gopinath, Boyue Caroline Hu, Anirban Roy, Susmit Jha, Corina Pasareanu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02904 2024-04-04 cs.CV cs.AI cs.CL cs.LG 67%

ALOHa: A New Measure for Hallucination in Captioning Models

Suzanne Petryk, David M. Chan, Anish Kachinthaya, Haodi Zou, John Canny, Joseph E. Gonzalez, Trevor Darrell

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments To appear at NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17128 2024-04-04 cs.CV cs.AI cs.CL cs.LG 67%

OSCaR: Object State Captioning and State Change Representation

Nguyen Nguyen, Jing Bi, Ali Vosoughi, Yapeng Tian, Pooyan Fazli, Chenliang Xu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07839 2024-03-13 cs.CV cs.AI cs.MM 67%

MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error Metric

Haokun Lin, Haoli Bai, Zhili Liu, Lu Hou, Muyi Sun, Linqi Song, Ying Wei, Zhenan Sun

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments 18 pages, 8 figures, Published in CVPR2024

Journal ref In Proc. IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02325 2024-03-05 cs.CV cs.AI cs.CL cs.LG 67%

Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training

David Wan, Jaemin Cho, Elias Stengel-Eskin, Mohit Bansal

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Project website: https://contrastive-region-guidance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12728 2024-03-05 cs.CV cs.AI cs.CL cs.IR cs.LG 67%

Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering

Junnan Dong, Qinggang Zhang, Huachi Zhou, Daochen Zha, Pai Zheng, Xiao Huang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 8 pages,3 figures and 1 page appendix; The processed graphs and codes will be avalibale

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17221 2024-01-31 cs.CV cs.AI cs.CL cs.LG 67%

MouSi: Poly-Visual-Expert Vision-Language Models

Xiaoran Fan, Tao Ji, Changhao Jiang, Shuo Li, Senjie Jin, Sirui Song, Junke Wang, Boyang Hong, Lu Chen, Guodong Zheng, Ming Zhang, Caishuang Huang, Rui Zheng, Zhiheng Xi, Yuhao Zhou, Shihan Dou, Junjie Ye, Hang Yan, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang, Zuxuan Wu, Yu-Gang Jiang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02998 2024-01-29 cs.CV cs.AI cs.CL cs.LG 67%

ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language Models

Yi-Lin Sung, Jaehong Yoon, Mohit Bansal

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ICLR 2024 (project page: https://ecoflap.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04498 2023-12-19 cs.CV cs.AI cs.CL 67%

NExT-Chat: An LMM for Chat, Detection and Segmentation

Ao Zhang, Yuan Yao, Wei Ji, Zhiyuan Liu, Tat-Seng Chua

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Technical Report (https://next-chatv.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03818 2023-12-15 cs.CV cs.AI cs.CL cs.LG 67%

Alpha-CLIP: A CLIP Model Focusing on Wherever You Want

Zeyi Sun, Ye Fang, Tong Wu, Pan Zhang, Yuhang Zang, Shu Kong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments project page: https://aleafy.github.io/alpha-clip code: https://github.com/SunzeY/AlphaCLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08485 2023-12-14 cs.CV cs.AI cs.CL cs.LG 67%

Visual Instruction Tuning

Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments NeurIPS 2023 Oral; project page: https://llava-vl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04837 2023-12-13 cs.AI cs.CL cs.CV 67%

Localized Symbolic Knowledge Distillation for Visual Commonsense Models

Jae Sung Park, Jack Hessel, Khyathi Raghavi Chandu, Paul Pu Liang, Ximing Lu, Peter West, Youngjae Yu, Qiuyuan Huang, Jianfeng Gao, Ali Farhadi, Yejin Choi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Neurips 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10933 2023-11-21 cs.AI cs.CL cs.CV cs.HC 67%

Representing visual classification as a linear combination of words

Shobhit Agarwal, Yevgeniy R. Semenov, William Lotter

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments To be published in the Proceedings of the 3rd Machine Learning for Health symposium, Proceedings of Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17718 2023-11-17 cs.CV cs.AI cs.CL 67%

FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions

Noam Rotstein, David Bensaid, Shaked Brody, Roy Ganz, Ron Kimmel

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16934 2023-10-31 cs.CV cs.CL cs.CR cs.LG cs.MM 67%

On Evaluating Adversarial Robustness of Large Vision-Language Models

Yunqing Zhao, Tianyu Pang, Chao Du, Xiao Yang, Chongxuan Li, Ngai-Man Cheung, Min Lin

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10355 2023-10-27 cs.CV cs.CL cs.MM 67%

Evaluating Object Hallucination in Large Vision-Language Models

Yifan Li, Yifan Du, Kun Zhou, Jinpeng Wang, Wayne Xin Zhao, Ji-Rong Wen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

Comments Accepted to EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14179 2023-08-29 cs.CL cs.AI cs.CV 67%

Towards Vision-Language Mechanistic Interpretability: A Causal Tracing Tool for BLIP

Vedant Palit, Rohan Pandey, Aryaman Arora, Paul Pu Liang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Final version for 5th Workshop on Closing the Loop Between Vision and Language (CLVL) @ ICCV 2023. 4 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01788 2023-07-25 cs.CL cs.AI cs.CV 67%

Vision Meets Definitions: Unsupervised Visual Word Sense Disambiguation Incorporating Gloss Information

Sunjae Kwon, Rishabh Garodia, Minhwa Lee, Zhichao Yang, Hong Yu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ACL 2023, https://aclanthology.org/2023.acl-long.88

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00228 2023-06-02 cs.CV cs.AI cs.CL 67%

Using Visual Cropping to Enhance Fine-Detail Question Answering of BLIP-Family Models

Jiarui Zhang, Mahyar Khayatkhoei, Prateek Chhikara, Filip Ilievski

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 16 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17811 2023-04-04 cs.CV cs.AI cs.CL 67%

Zero-shot Referring Image Segmentation with Global-Local Context Features

Seonghoon Yu, Paul Hongsuck Seo, Jeany Son

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10276 2023-03-17 cs.CV cs.AI cs.CL 67%

See Your Heart: Psychological states Interpretation through Visual Creations

Likun Yang, Xiaokun Feng, Xiaotang Chen, Shiyu Zhang, Kaiqi Huang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07240 2023-03-14 cs.CV cs.CL cs.LG cs.MM 67%

PMC-CLIP: Contrastive Language-Image Pre-training using Biomedical Documents

Weixiong Lin, Ziheng Zhao, Xiaoman Zhang, Chaoyi Wu, Ya Zhang, Yanfeng Wang, Weidi Xie

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.MM

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏