arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2502.11427 2025-02-18 cs.CL cs.CV 62%

Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models

Zikang Liu, Kun Zhou, Wayne Xin Zhao, Dawei Gao, Yaliang Li, Ji-Rong Wen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19483 2025-02-18 cs.CV cs.CL 62%

MedCLIP-SAMv2: Towards Universal Text-Driven Medical Image Segmentation

Taha Koleilat, Hojat Asgariandehkordi, Hassan Rivaz, Yiming Xiao

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02385 2025-02-13 cs.CV cs.CL 62%

Guiding Medical Vision-Language Models with Explicit Visual Prompts: Framework Design and Comprehensive Exploration of Prompt Variations

Kangyu Zhu, Ziyuan Qin, Huahui Yi, Zekun Jiang, Qicheng Lao, Shaoting Zhang, Kang Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted to NAACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20971 2025-02-13 cs.CV cs.AI cs.LG 62%

BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks

Yunhan Zhao, Xiang Zheng, Lin Luo, Yige Li, Xingjun Ma, Yu-Gang Jiang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Journal ref ICLR 2025, BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks. In Proceedings of the International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05660 2025-02-11 cs.CV cs.CL 62%

Evaluating Vision-Language Models for Emotion Recognition

Sree Bhattacharyya, James Z. Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted to NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14975 2025-02-11 cs.CV cs.AI 62%

Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation

Jihyo Kim, Seulbi Lee, Sangheum Hwang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted at ICLR 2025. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14179 2025-02-11 cs.CL cs.CV 62%

MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems

Zifeng Zhu, Mengzhao Jia, Zhihan Zhang, Lang Li, Meng Jiang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments NAACL 2025, 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04263 2025-02-07 cs.CV cs.AI cs.LG 62%

Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion

Marco Mistretta, Alberto Baldrati, Lorenzo Agnolucci, Marco Bertini, Andrew D. Bagdanov

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted for publication at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01487 2025-02-06 cs.CV cs.CL 62%

What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning

Yifan Du, Hangyu Guo, Kun Zhou, Wayne Xin Zhao, Jinpeng Wang, Chuyuan Wang, Mingchen Cai, Ruihua Song, Ji-Rong Wen

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by COLING2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01785 2025-02-05 cs.CV cs.AI 62%

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis

Basit Alawode, Iyyakutti Iyappan Ganapathi, Sajid Javed, Naoufel Werghi, Mohammed Bennamoun, Arif Mahmood

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01707 2025-02-05 cs.CV cs.AI 62%

CLIP-DQA: Blindly Evaluating Dehazed Images from Global and Local Perspectives Using CLIP

Yirui Zeng, Jun Fu, Hadi Amirpour, Huasheng Wang, Guanghui Yue, Hantao Liu, Ying Chen, Wei Zhou

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted by ISCAS 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00528 2025-02-04 cs.CV cs.CL 62%

Vision-Language Modeling in PET/CT for Visual Grounding of Positive Findings

Zachary Huemann, Samuel Church, Joshua D. Warner, Daniel Tran, Xin Tie, Alan B McMillan, Junjie Hu, Steve Y. Cho, Meghan Lubner, Tyler J. Bradshaw

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19086 2025-02-03 cs.CV cs.AI 62%

Fairness Analysis of CLIP-Based Foundation Models for X-Ray Image Classification

Xiangyu Sun, Xiaoguang Zou, Yuanquan Wu, Guotai Wang, Shaoting Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments This paper has been accepted for presentation at the 2025 IEEE International Symposium on Biomedical Imaging (ISBI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16300 2025-01-28 cs.CV cs.AI 62%

Large Models in Dialogue for Active Perception and Anomaly Detection

Tzoulio Chamiti, Nikolaos Passalis, Anastasios Tefas

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to International Conference of Pattern Recognition (ICPR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15046 2025-01-28 cs.CV cs.AI cs.LG 62%

Evaluating Hallucination in Large Vision-Language Models based on Context-Aware Object Similarities

Shounak Datta, Dhanasekar Sundararaman

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14818 2025-01-28 cs.CV cs.AI cs.LG 62%

Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models

Zhiqi Li, Guo Chen, Shilong Liu, Shihao Wang, Vibashan VS, Yishen Ji, Shiyi Lan, Hao Zhang, Yilin Zhao, Subhashree Radhakrishnan, Nadine Chang, Karan Sapra, Amala Sanjay Deshmukh, Tuomas Rintamaki, Matthieu Le, Ilia Karmanov, Lukas Voegtle, Philipp Fischer, De-An Huang, Timo Roman, Tong Lu, Jose M. Alvarez, Bryan Catanzaro, Jan Kautz, Andrew Tao, Guilin Liu, Zhiding Yu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14276 2025-01-27 cs.CV cs.AI 62%

Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models

Yuxuan Liang, Xu Li, Xiaolei Chen, Haotian Chen, Yi Zheng, Chenghang Lai, Bin Li, Xiangyang Xue

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 10 figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14051 2025-01-27 cs.CV cs.AI cs.LG 62%

Revisiting CLIP: Efficient Alignment of 3D MRI and Tabular Data using Domain-Specific Foundation Models

Jakob Krogh Petersen, Valdemar Licht, Mads Nielsen, Asbjørn Munk

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 2 figures. To be published in ISBI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13893 2025-01-24 cs.CV cs.AI cs.LG 62%

Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning

Zuyao You, Junke Wang, Lingyu Kong, Bo He, Zuxuan Wu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12418 2025-01-23 cs.CV cs.AI 62%

ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models

Jingwei Yi, Junhao Yin, Ju Xu, Peng Bao, Yongliang Wang, Wei Fan, Hao Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16772 2025-01-23 cs.CV cs.CL cs.LG 62%

VisMin: Visual Minimal-Change Understanding

Rabiul Awal, Saba Ahmadi, Le Zhang, Aishwarya Agrawal

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted at NeurIPS 2024. Project URL at https://vismin.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04884 2025-01-22 cs.CV cs.AI 62%

Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models

Dehong Kong, Siyuan Liang, Xiaopeng Zhu, Yuansheng Zhong, Wenqi Ren

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments accepted by Visual Intelligence

Journal ref Visual Intelligence, 2024, Vol 2, article no.17

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10775 2025-01-22 cs.CV cs.AI 62%

MedFILIP: Medical Fine-grained Language-Image Pre-training

Xinjie Liang, Xiangyu Li, Fanding Li, Jie Jiang, Qing Dong, Wei Wang, Kuanquan Wang, Suyu Dong, Gongning Luo, Shuo Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 5 figures, IEEE Journal of Biomedical and Health Informatics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00376 2025-01-15 cs.CV cs.AI cs.LG 62%

Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model

Huan Ma, Yan Zhu, Changqing Zhang, Peilin Zhao, Baoyuan Wu, Long-Kai Huang, Qinghua Hu, Bingzhe Wu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03939 2025-01-14 cs.CV cs.MM 62%

Visual question answering: from early developments to recent advances -- a survey

Ngoc Dung Huynh, Mohamed Reda Bouadjenek, Sunil Aryal, Imran Razzak, Hakim Hacid

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments 20 papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14948 2025-01-14 cs.LG cs.AI cs.CV 62%

Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective

Sahil Verma, Gantavya Bhatt, Avi Schwarzschild, Soumye Singhal, Arnav Mohanty Das, Chirag Shah, John P Dickerson, Pin-Yu Chen, Jeff Bilmes

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted at TMLR (https://openreview.net/forum?id=Conma3qnaT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11025 2025-01-13 cs.CV cs.AI 62%

From Simple to Professional: A Combinatorial Controllable Image Captioning Agent

Xinran Wang, Muxi Diao, Baoteng Li, Haiwen Zhang, Kongming Liang, Zhanyu Ma

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments A technical report. Project: https://github.com/xin-ran-w/CapAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12953 2025-01-13 cs.CV cs.AI 62%

JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images

Zhecan Wang, Junzhang Liu, Chia-Wei Tang, Hani Alomari, Anushka Sivakumar, Rui Sun, Wenhao Li, Md. Atabuzzaman, Hammad Ayyubi, Haoxuan You, Alvi Ishmam, Kai-Wei Chang, Shih-Fu Chang, Chris Thomas

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05452 2025-01-10 cs.CV cs.CL 62%

ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding

Xingyu Fu, Minqian Liu, Zhengyuan Yang, John Corring, Yijuan Lu, Jianwei Yang, Dan Roth, Dinei Florencio, Cha Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Project link: https://zeyofu.github.io/ReFocus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05910 2025-01-10 cs.CV cs.AI cs.RO 62%

Enhancing Vision-Language Models with Scene Graphs for Traffic Accident Understanding

Aaron Lohner, Francesco Compagno, Jonathan Francis, Alessandro Oltramari

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Won the 'Best Paper Runner-up Award' at the 2024 IEEE International Automated Vehicle Validation Conference (IAVVC 2024). Also accepted at the 1st Workshop on Semantic Reasoning and Goal Understanding in Robotics, at the Robotics Science and Systems Conference (RSS SemRob 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏