arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2503.03854 2025-06-02 cs.CL 70%

Vision-Language Models Struggle to Align Entities across Modalities

Iñigo Alonso, Gorka Azkune, Ander Salaberria, Jeremy Barnes, Oier Lopez de Lacalle

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学) HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克国家大学HiTZ中心)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL

Comments Accepted Findings ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21317 2025-05-28 cs.LG cs.AI 70%

A Cross Modal Knowledge Distillation & Data Augmentation Recipe for Improving Transcriptomics Representations through Morphological Features

Ihab Bendidi, Yassir El Mesbahi, Alisandra K. Denton, Karush Suri, Kian Kenyon-Dean, Auguste Genovesio, Emmanuel Noutahi

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

Comments ICML 2025 Main Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19406 2025-05-27 cs.AI 70%

Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model

Tianle Li, Jihai Zhang, Yongming Rao, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Hunyuan Research(腾讯文言研究院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12359 2025-05-20 cs.LG cs.CV 70%

STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference

Yichen Guo, Hanze Li, Zonghao Zhang, Jinhao You, Kai Tang, Xiande Huang

机构 * De Artificial Intelligence Lab(人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03153 2025-05-07 cs.CV 70%

Robust Fairness Vision-Language Learning for Medical Image Analysis

Sparsh Bansal, Mingyang Wu, Xin Wang, Shu Hu

机构 * Purdue University(普渡大学) University at Albany, State University of New York(纽约州立大学阿尔巴尼分校)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07577 2025-05-06 cs.CV 70%

3D Vision-Language Gaussian Splatting

Qucheng Peng, Benjamin Planche, Zhongpai Gao, Meng Zheng, Anwesa Choudhuri, Terrence Chen, Chen Chen, Ziyan Wu

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,佛罗里达大学)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted at ICLR 2025. Main paper + supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20343 2025-04-30 cs.CV 70%

MicarVLMoE: A Modern Gated Cross-Aligned Vision-Language Mixture of Experts Model for Medical Image Captioning and Report Generation

Amaan Izhar, Nurul Japar, Norisma Idris, Ting Dang

机构 * Faculty of Computer Science and Information Technology, Universiti Malaya(马来亚大学计算机科学与信息学院) School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算机与信息学院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by IJCNN 2025, 8 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16420 2025-04-24 cs.IR cs.AI 70%

A Survey of Foundation Model-Powered Recommender Systems: From Feature-Based, Generative to Agentic Paradigms

Chengkai Huang, Hongtao Huang, Tong Yu, Kaige Xie, Junda Wu, Shuai Zhang, Julian Mcauley, Dietmar Jannach, Lina Yao

机构 * School of Computer Science and Engineering, The University of New South Wales(计算机科学与工程学院,新南威尔士大学) Adobe Research(Adobe研究) School of Computer Science, Georgia Institute of Technology(计算机科学学院,佐治亚理工学院) University of California, San Diego(加州大学圣地亚哥分校) ETH Zurich(苏黎世联邦理工学院) University of Klagenfurt(克雷格弗特大学) The University of New South Wales and CSIRO’s Data61(新南威尔士大学和CSIRO的数据61)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10727 2025-04-16 cs.CV 70%

Foundation Models for Remote Sensing: An Analysis of MLLMs for Object Localization

Darryl Hannan, John Cooper, Dylan White, Timothy Doster, Henry Kvinge, Yijing Watkins

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments 26 pages, CVPR MORSE Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10465 2025-04-15 cs.CV 70%

Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding

Tao Zhang, Xiangtai Li, Zilong Huang, Yanwei Li, Weixian Lei, Xueqing Deng, Shihao Chen, Shunping Ji, Jiashi Feng

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14911 2025-04-15 cs.CV 70%

Derm1M: A Million-scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology

Siyuan Yan, Ming Hu, Yiwen Jiang, Xieji Li, Hao Fei, Philipp Tschandl, Harald Kittler, Zongyuan Ge

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Our dataset and code will be publicly available at https://github.com/SiyuanYan1/Derm1M

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06863 2025-04-10 cs.CV 70%

MovSAM: A Single-image Moving Object Segmentation Framework Based on Deep Thinking

Chang Nie, Yiqing Xu, Guangming Wang, Zhe Liu, Yanzi Miao, Hesheng Wang

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03254 2025-04-07 cs.CV 70%

SARLANG-1M: A Benchmark for Vision-Language Modeling in SAR Image Understanding

Yimin Wei, Aoran Xiao, Yexian Ren, Yuting Zhu, Hongruixuan Chen, Junshi Xia, Naoto Yokoya

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02823 2025-04-04 cs.CV eess.IV 70%

STING-BEE: Towards Vision-Language Model for Real-World X-ray Baggage Security Inspection

Divya Velayudhan, Abdelfatah Ahmed, Mohamad Alansari, Neha Gour, Abderaouf Behouch, Taimur Hassan, Syed Talal Wasim, Nabil Maalej, Muzammal Naseer, Juergen Gall, Mohammed Bennamoun, Ernesto Damiani, Naoufel Werghi

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20662 2025-03-27 cs.CV cs.LG eess.IV 70%

AutoRad-Lung: A Radiomic-Guided Prompting Autoregressive Vision-Language Model for Lung Nodule Malignancy Prediction

Sadaf Khademi, Mehran Shabanpour, Reza Taleei, Anastasia Oikonomou, Arash Mohammadi

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07353 2025-03-27 cs.CV 70%

CLIP in Medical Imaging: A Survey

Zihao Zhao, Yuxiao Liu, Han Wu, Mei Wang, Yonghao Li, Sheng Wang, Lin Teng, Disheng Liu, Zhiming Cui, Qian Wang, Dinggang Shen

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Project page available at https://github.com/zhaozh10/Awesome-CLIP-in-Medical-Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18407 2025-03-26 cs.CV 70%

VTD-CLIP: Video-to-Text Discretization via Prompting CLIP

Wencheng Zhu, Yuexin Wang, Hongxuan Li, Pengfei Zhu, Qinghua Hu

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12769 2025-03-18 cs.CV 70%

ViSpeak: Visual Instruction Feedback in Streaming Videos

Shenghao Fu, Qize Yang, Yuan-Ming Li, Yi-Xing Peng, Kun-Yu Lin, Xihan Wei, Jian-Fang Hu, Xiaohua Xie, Wei-Shi Zheng

专题命中 图文多模态 :multi-modal(abstract);omni-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10779 2025-03-17 cs.CV 70%

The Power of One: A Single Example is All it Takes for Segmentation in VLMs

Mir Rayat Imtiaz Hossain, Mennatullah Siam, Leonid Sigal, James J. Little

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14529 2025-03-14 cs.CV 70%

AnomalyDINO: Boosting Patch-based Few-shot Anomaly Detection with DINOv2

Simon Damm, Mike Laszkiewicz, Johannes Lederer, Asja Fischer

专题命中 图文多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

Comments Accepted at WACV 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08007 2025-03-12 cs.RO cs.AI 70%

MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models

Han Zhao, Wenxuan Song, Donglin Wang, Xinyang Tong, Pengxiang Ding, Xuelian Cheng, Zongyuan Ge

专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.AI

Comments Accepted by ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02199 2025-03-05 cs.CV cs.AI cs.CL cs.LG cs.MM 70%

Words or Vision: Do Vision-Language Models Have Blind Faith in Text?

Ailin Deng, Tri Cao, Zhirui Chen, Bryan Hooi

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08168 2025-03-05 cs.CL 70%

SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation

Zhiming Ma, Xiayang Xiao, Sihao Dong, Peidong Wang, HaiPeng Wang, Qingyun Pan

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01106 2025-03-04 cs.CV 70%

SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding

Jian Chen, Ruiyi Zhang, Yufan Zhou, Tong Yu, Franck Dernoncourt, Jiuxiang Gu, Ryan A. Rossi, Changyou Chen, Tong Sun

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20698 2025-03-03 cs.CV 70%

Towards General Visual-Linguistic Face Forgery Detection(V2)

Ke Sun, Shen Chen, Taiping Yao, Ziyin Zhou, Jiayi Ji, Xiaoshuai Sun, Chia-Wen Lin, Rongrong Ji

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments 8 pages, 5 figures, Accpet by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15979 2025-02-25 cs.IR cs.CV 70%

Visual Zero-Shot E-Commerce Product Attribute Value Extraction

Jiaying Gong, Ming Cheng, Hongda Shen, Pierre-Yves Vandenbussche, Janet Jenq, Hoda Eldardiry

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 10 pages, 4 figures, accepted for publication in NAACL 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16065 2025-02-12 cs.CV 70%

CILP-FGDI: Exploiting Vision-Language Model for Generalizable Person Re-Identification

Huazhong Zhao, Lei Qi, Xin Geng

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by IEEE TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02589 2025-02-05 cs.CV 70%

COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation

Xueqing Deng, Qihang Yu, Ali Athar, Chenglin Yang, Linjie Yang, Xiaojie Jin, Xiaohui Shen, Liang-Chieh Chen

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

Comments project website: https://xdeng7.github.io/coconut.github.io/coconut_pancap.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17586 2025-01-31 cs.CV cs.LG 70%

Boosting Weak Positives for Text Based Person Search

Akshay Modi, Ashhar Aziz, Nilanjana Chatterjee, A V Subramanyam

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15558 2025-01-28 cs.CV 70%

Ocean-OCR: Towards General OCR Application via a Vision-Language Model

Song Chen, Xinyu Guo, Yadong Li, Tao Zhang, Mingan Lin, Dongdong Kuang, Youwei Zhang, Lingfeng Ming, Fengyu Zhang, Yuran Wang, Jianhua Xu, Zenan Zhou, Weipeng Chen

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏