arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2404.09941 2024-04-16 cs.CV cs.AI 62%

Evolving Interpretable Visual Classifiers with Large Language Models

Mia Chiquier, Utkarsh Mall, Carl Vondrick

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08937 2024-04-16 cs.CV cs.AI cs.LG 62%

ChimpVLM: Ethogram-Enhanced Chimpanzee Behaviour Recognition

Otto Brookes, Majid Mirmehdi, Hjalmar Kuhl, Tilo Burghardt

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00825 2024-04-11 cs.CV cs.AI 62%

SocialCounterfactuals: Probing and Mitigating Intersectional Social Biases in Vision-Language Models with Counterfactual Examples

Phillip Howard, Avinash Madasu, Tiep Le, Gustavo Lujan Moreno, Anahita Bhiwandiwalla, Vasudev Lal

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR 2024. arXiv admin note: text overlap with arXiv:2310.02988

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06212 2024-04-10 cs.CV cs.AI cs.LG 62%

OmniFusion Technical Report

Elizaveta Goncharova, Anton Razzhigaev, Matvey Mikhalchuk, Maxim Kurkin, Irina Abdullaeva, Matvey Skripkin, Ivan Oseledets, Denis Dimitrov, Andrey Kuznetsov

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 17 pages, 4 figures, 9 tables, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09915 2024-04-08 cs.CV cs.MM 62%

Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning

Zijie Song, Zhenzhen Hu, Yuanen Zhou, Ye Zhao, Richang Hong, Meng Wang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01745 2024-04-03 cs.CV cs.AI 62%

Unleash the Potential of CLIP for Video Highlight Detection

Donghoon Han, Seunghyeon Seo, Eunhwan Park, Seong-Uk Nam, Nojun Kwak

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17343 2024-04-01 cs.CV cs.CL cs.LG 62%

Residual-based Language Models are Free Boosters for Biomedical Imaging

Zhixin Lai, Jing Wu, Suiyao Chen, Yucheng Zhou, Naira Hovakimyan

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18260 2024-03-28 cs.CV cs.CL 62%

Toward Interactive Regional Understanding in Vision-Large Language Models

Jungbeom Lee, Sanghyuk Chun, Sangdoo Yun

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments NAACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14149 2024-03-27 cs.CV cs.AI 62%

TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification

Qinying Liu, Wei Wu, Kecheng Zheng, Zhan Tong, Jiawei Liu, Yu Liu, Wei Chen, Zilei Wang, Yujun Shen

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13614 2024-03-26 cs.CV cs.AI 62%

HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction Data

Qifan Yu, Juncheng Li, Longhui Wei, Liang Pang, Wentao Ye, Bosheng Qin, Siliang Tang, Qi Tian, Yueting Zhuang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16226 2024-03-22 cs.CV cs.CL cs.LG 62%

TiC-CLIP: Continual Training of CLIP Models

Saurabh Garg, Mehrdad Farajtabar, Hadi Pouransari, Raviteja Vemulapalli, Sachin Mehta, Oncel Tuzel, Vaishaal Shankar, Fartash Faghri

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11317 2024-03-19 cs.CL cs.CV 62%

Few-Shot VQA with Frozen LLMs: A Tale of Two Approaches

Igor Sterner, Weizhe Lin, Jinghong Chen, Bill Byrne

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07699 2024-03-15 cs.CV cs.AI cs.LG 62%

VeCLIP: Improving CLIP Training via Visual-enriched Captions

Zhengfeng Lai, Haotian Zhang, Bowen Zhang, Wentao Wu, Haoping Bai, Aleksei Timofeev, Xianzhi Du, Zhe Gan, Jiulong Shan, Chen-Nee Chuah, Yinfei Yang, Meng Cao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments CV/ML

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06072 2024-03-15 cs.CV cs.AI 62%

Actional Atomic-Concept Learning for Demystifying Vision-Language Navigation

Bingqian Lin, Yi Zhu, Xiaodan Liang, Liang Lin, Jianzhuang Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13096 2024-03-12 cs.CV cs.AI cs.LG 62%

Language-Driven Anchors for Zero-Shot Adversarial Robustness

Xiao Li, Wei Zhang, Yining Liu, Zhanhao Hu, Bo Zhang, Xiaolin Hu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14779 2024-03-04 cs.CV cs.CL cs.LG 62%

Alt-Text with Context: Improving Accessibility for Images on Twitter

Nikita Srivatsan, Sofia Samaniego, Omar Florez, Taylor Berg-Kirkpatrick

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14162 2024-02-23 cs.CV cs.AI 62%

On Large Visual Language Models for Medical Imaging Analysis: An Empirical Study

Minh-Hao Van, Prateek Verma, Xintao Wu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.04558 2024-02-23 cs.CV cs.CL 62%

Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing

Shruthi Bannur, Stephanie Hyland, Qianchu Liu, Fernando Pérez-García, Maximilian Ilse, Daniel C. Castro, Benedikt Boecking, Harshita Sharma, Kenza Bouzid, Anja Thieme, Anton Schwaighofer, Maria Wetscherek, Matthew P. Lungren, Aditya Nori, Javier Alvarez-Valle, Ozan Oktay

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments To appear in CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00967 2024-02-21 cs.RO cs.AI cs.CL 62%

Vision-Language Interpreter for Robot Task Planning

Keisuke Shirai, Cristian C. Beltran-Hernandez, Masashi Hamaya, Atsushi Hashimoto, Shohei Tanaka, Kento Kawaharazuka, Kazutoshi Tanaka, Yoshitaka Ushiku, Shinsuke Mori

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments ICRA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11690 2024-02-20 cs.CL cs.CV 62%

Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning

Zhiyang Xu, Chao Feng, Rulin Shao, Trevor Ashby, Ying Shen, Di Jin, Yu Cheng, Qifan Wang, Lifu Huang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments 8 Pages, visual instruction tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11574 2024-02-20 cs.CV cs.CL 62%

Visual In-Context Learning for Large Vision-Language Models

Yucheng Zhou, Xiang Li, Qianning Wang, Jianbing Shen

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12714 2024-02-06 cs.CV cs.AI 62%

VIGC: Visual Instruction Generation and Correction

Bin Wang, Fan Wu, Xiao Han, Jiahui Peng, Huaping Zhong, Pan Zhang, Xiaoyi Dong, Weijia Li, Wei Li, Jiaqi Wang, Conghui He

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2024, Project Website: https://opendatalab.github.io/VIGC, Code and Pretrained Model: https://github.com/opendatalab/VIGC

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17107 2024-02-06 cs.CV cs.CL 62%

LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding

Yanzhe Zhang, Ruiyi Zhang, Jiuxiang Gu, Yufan Zhou, Nedim Lipka, Diyi Yang, Tong Sun

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14232 2024-02-02 cs.CV cs.AI 62%

Parrot Captions Teach CLIP to Spot Text

Yiqi Lin, Conghui He, Alex Jinpeng Wang, Bin Wang, Weijia Li, Mike Zheng Shou

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments project page: https://linyq17.github.io/CLIP-Parrot-Bias/. Add more analysis and ablation studies. Update Figure 3 with a more precise metric

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12665 2024-01-30 cs.CV cs.AI 62%

ClipSAM: CLIP and SAM Collaboration for Zero-Shot Anomaly Segmentation

Shengze Li, Jianjian Cao, Peng Ye, Yuhan Ding, Chongjun Tu, Tao Chen

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 17 pages,17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11337 2024-01-23 cs.CV cs.AI 62%

Prompting Large Vision-Language Models for Compositional Reasoning

Timothy Ossowski, Ming Jiang, Junjie Hu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02506 2024-01-22 cs.LG cs.AI cs.CV 62%

Prismer: A Vision-Language Model with Multi-Task Experts

Shikun Liu, Linxi Fan, Edward Johns, Zhiding Yu, Chaowei Xiao, Anima Anandkumar

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Published at TMLR 2024. Project Page: https://shikun.io/projects/prismer Code: https://github.com/NVlabs/prismer

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09763 2024-01-19 cs.CV cs.AI 62%

CLIP Model for Images to Textual Prompts Based on Top-k Neighbors

Xin Zhang, Xin Zhang, YeMing Cai, Tianzhi Jia

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments CLIP model, KNN, image-to-prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01179 2024-01-03 cs.CV cs.AI cs.LG 62%

Freeze the backbones: A Parameter-Efficient Contrastive Approach to Robust Medical Vision-Language Pre-training

Jiuming Qin, Che Liu, Sibo Cheng, Yike Guo, Rossella Arcucci

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06166 2024-01-01 cs.CV cs.AI 62%

Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning

Gengyuan Zhang, Yurui Zhang, Kerui Zhang, Volker Tresp

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted to WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏