arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5048 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5048 篇

2410.20109 2025-03-24 cs.CV cs.AI cs.MM 73%

GiVE: Guiding Visual Encoder to Perceive Overlooked Information

Junjie Li, Jianghong Ma, Xiaofeng Zhang, Yuhang Li, Jianyang Shi

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments This paper was accepted by ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12927 2025-03-20 cs.CV cs.AI 73%

MMLNB: Multi-Modal Learning for Neuroblastoma Subtyping Classification Assisted with Textual Description Generation

Huangwei Chen, Yifei Chen, Zhenyu Yan, Mingyang Ding, Chenlei Li, Zhu Zhu, Feiwei Qin

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12446 2025-03-18 cs.CV cs.AI 73%

BREEN: Bridge Data-Efficient Encoder-Free Multimodal Learning with Learnable Queries

Tianle Li, Yongming Rao, Winston Hu, Yu Cheng

专题命中 VLM训练与架构 :InternVL(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10582 2025-03-18 cs.CV cs.AI cs.CL 73%

VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search

Yiming Jia, Jiachen Li, Xiang Yue, Bo Li, Ping Nie, Kai Zou, Wenhu Chen

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05609 2025-03-17 cs.CV cs.LG 73%

A Two-Step Concept-Based Approach for Enhanced Interpretability and Trust in Skin Lesion Diagnosis

Cristiano Patrício, Luís F. Teixeira, João C. Neves

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Published in the Computational and Structural Biotechnology Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05977 2025-03-11 cs.CV cs.AI 73%

Is Your Video Language Model a Reliable Judge?

Ming Liu, Wensheng Zhang

专题命中 VLM训练与架构 :VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04858 2025-03-10 cs.CV cs.AI 73%

SHAPE : Self-Improved Visual Preference Alignment by Iteratively Generating Holistic Winner

Kejia Chen, Jiawen Zhang, Jiacong Hu, Jiazhen Yang, Jian Lou, Zunlei Feng, Mingli Song

专题命中 VLM训练与架构 :visual language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05316 2025-03-06 cs.LG cs.AI cs.CE q-bio.BM 73%

Aligning Large Language Models and Geometric Deep Models for Protein Representation

Dong Shu, Bingbing Duan, Kai Guo, Kaixiong Zhou, Jiliang Tang, Mengnan Du

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00619 2025-03-04 cs.IR cs.AI cs.LG 73%

PinLanding: Content-First Keyword Landing Page Generation via Multi-Modal AI for Web-Scale Discovery

Faye Zhang, Jasmine Wan, Qianyu Cheng, Jinfeng Rao

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19672 2025-02-28 cs.CV cs.LG 73%

Improving Adversarial Transferability in MLLMs via Dynamic Vision-Language Alignment Attack

Chenhe Gu, Jindong Gu, Andong Hua, Yao Qin

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

Comments arXiv admin note: text overlap with arXiv:2403.09766

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14113 2025-02-21 cs.CV cs.AI 73%

Object-centric Binding in Contrastive Language-Image Pretraining

Rim Assouel, Pietro Astolfi, Florian Bordes, Michal Drozdzal, Adriana Romero-Soriano

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14460 2025-02-11 cs.CL cs.AI cs.LG 73%

LLaSA: Large Language and Structured Data Assistant

Yao Xu, Shizhu He, Jiabei Chen, Zeng Xiangrong, Bingning Wang, Guang Liu, Jun Zhao, Kang Liu

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.AI、cs.LG

Comments NAACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04371 2025-02-10 cs.AI cs.CL cs.LG 73%

PerPO: Perceptual Preference Optimization via Discriminative Rewarding

Zining Zhu, Liang Zhao, Kangheng Lin, Jinze Yang, En Yu, Chenglong Liu, Haoran Wei, Jianjian Sun, Zheng Ge, Xiangyu Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06655 2025-01-14 cs.LG cs.CV 73%

Personalized Preference Fine-tuning of Diffusion Models

Meihua Dang, Anikait Singh, Linqi Zhou, Stefano Ermon, Jiaming Song

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03287 2025-01-08 cs.RO cs.CV cs.LG 73%

OpenLKA: an open dataset of lane keeping assist from market autonomous vehicles

Yuhang Wang, Abdulaziz Alhuraish, Shengming Yuan, Shuyi Wang, Hao Zhou

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08565 2024-12-30 cs.AI cs.CL cs.CV 73%

Baichuan-Omni Technical Report

Yadong Li, Haoze Sun, Mingan Lin, Tianpeng Li, Guosheng Dong, Tao Zhang, Bowen Ding, Wei Song, Zhenglin Cheng, Yuqi Huo, Song Chen, Xu Li, Da Pan, Shusen Zhang, Xin Wu, Zheng Liang, Jun Liu, Tao Zhang, Keer Lu, Yaqi Zhao, Yanjun Shen, Fan Yang, Kaicheng Yu, Tao Lin, Jianhua Xu, Zenan Zhou, Weipeng Chen

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17637 2024-12-24 cs.CV cs.AI 73%

SCBench: A Sports Commentary Benchmark for Video LLMs

Kuangzhi Ge, Lingjun Chen, Kevin Zhang, Yulin Luo, Tianyu Shi, Liaoyuan Fan, Xiang Li, Guanqun Wang, Shanghang Zhang

专题命中 VLM训练与架构 :LLaVA(abstract);InternVL(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07278 2024-12-03 cs.CV cs.AI 73%

PAR: Prompt-Aware Token Reduction Method for Efficient Large Multimodal Models

Yingen Liu, Fan Wu, Ruihui Li, Zhuo Tang, Kenli Li

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 5 figures,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07461 2024-11-13 cs.CV cs.AI 73%

BLIP3-KALE: Knowledge Augmented Large-Scale Dense Captions

Anas Awadalla, Le Xue, Manli Shu, An Yan, Jun Wang, Senthil Purushwalkam, Sheng Shen, Hannah Lee, Oscar Lo, Jae Sung Park, Etash Guha, Silvio Savarese, Ludwig Schmidt, Yejin Choi, Caiming Xiong, Ran Xu

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09729 2024-11-13 cs.CV cs.AI 73%

MIRAGE: Multimodal Identification and Recognition of Annotations in Indian General Prescriptions

Tavish Mankash, V. S. Chaithanya Kota, Anish De, Praveen Prakash, Kshitij Jadhav

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 5 pages, 9 figures, 3 tables, submitted to ISBI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04420 2024-11-08 cs.CV cs.LG 73%

BendVLM: Test-Time Debiasing of Vision-Language Embeddings

Walter Gerych, Haoran Zhang, Kimia Hamidieh, Eileen Pan, Maanas Sharma, Thomas Hartvigsen, Marzyeh Ghassemi

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04251 2024-11-01 cs.CV cs.AI cs.CL 73%

Who Evaluates the Evaluations? Objectively Scoring Text-to-Image Prompt Coherence Metrics with T2IScoreScore (TS2)

Michael Saxon, Fatima Jahara, Mahsa Khoshnoodi, Yujie Lu, Aditya Sharma, William Yang Wang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2024 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19008 2024-10-28 eess.IV cs.AI cs.CV 73%

Teach Multimodal LLMs to Comprehend Electrocardiographic Images

Ruoqi Liu, Yuelin Bai, Xiang Yue, Ping Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08588 2024-10-14 eess.IV cs.AI cs.CV 73%

ViT3D Alignment of LLaMA3: 3D Medical Image Report Generation

Siyou Li, Beining Xu, Yihao Luo, Dong Nie, Le Zhang

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12184 2024-09-19 cs.LG cs.AI 73%

Democratizing MLLMs in Healthcare: TinyLLaVA-Med for Efficient Healthcare Diagnostics in Resource-Constrained Settings

Aya El Mir, Lukelo Thadei Luoga, Boyuan Chen, Muhammad Abdullah Hanif, Muhammad Shafique

专题命中 VLM训练与架构 :LLaVA(abstract);MLLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12150 2024-09-19 cs.IR cs.AI cs.LG 73%

Decoding Style: Efficient Fine-Tuning of LLMs for Image-Guided Outfit Recommendation with Preference

Najmeh Forouzandehmehr, Nima Farrokhsiar, Ramin Giahi, Evren Korpeoglu, Kannan Achan

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments CIKM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14007 2024-09-19 cs.CV cs.AI 73%

Multi-modal Relation Distillation for Unified 3D Representation Learning

Huiqun Wang, Yiping Bao, Panwang Pan, Zeming Li, Xiao Liu, Ruijie Yang, Di Huang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06610 2024-08-14 cs.CV cs.CL cs.LG 73%

CROME: Cross-Modal Adapters for Efficient Multimodal LLM

Sayna Ebrahimi, Sercan O. Arik, Tejas Nama, Tomas Pfister

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02604 2024-08-05 cs.AI cs.CL cs.LG eess.IV 73%

D-Rax: Domain-specific Radiologic assistant leveraging multi-modal data and eXpert model predictions

Hareem Nisar, Syed Muhammad Anwar, Zhifan Jiang, Abhijeet Parida, Ramon Sanchez-Jacob, Vishwesh Nath, Holger R. Roth, Marius George Linguraru

专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.AI、cs.LG

Comments accepted to the MICCAI 2024 Second International Workshop on Foundation Models for General Medical AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07202 2024-07-19 cs.CV cs.AI cs.CL 73%

UMBRAE: Unified Multimodal Brain Decoding

Weihao Xia, Raoul de Charette, Cengiz Öztireli, Jing-Hao Xue

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments ECCV 2024. Project: https://weihaox.github.io/UMBRAE

详情

展开后加载摘要…

URL PDF HTML 收藏