arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2503.23130 2025-04-07 cs.CV cs.CL cs.RO 62%

Can DeepSeek Reason Like a Surgeon? An Empirical Evaluation for Vision-Language Understanding in Robotic-Assisted Surgery

Boyi Ma, Yanguang Zhao, Jie Wang, Guankun Wang, Kun Yuan, Tong Chen, Long Bai, Hongliang Ren

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09437 2025-04-02 cs.LG cs.AI cs.CL 62%

MTL-LoRA: Low-Rank Adaptation for Multi-Task Learning

Yaming Yang, Dilxat Muhtar, Yelong Shen, Yuefeng Zhan, Jianfeng Liu, Yujing Wang, Hao Sun, Denvy Deng, Feng Sun, Qi Zhang, Weizhu Chen, Yunhai Tong

专题命中 图文多模态 :image-text(abstract);分类 cs.CL、cs.AI

Comments 12 Pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14536 2025-03-31 eess.IV cs.AI cs.CV cs.LG 62%

Advancing Chronic Tuberculosis Diagnostics Using Vision-Language Models: A Multi modal Framework for Precision Analysis

Praveen Shastry, Sowmya Chowdary Muthulur, Naveen Kumarasami, Anandakumar D, Mounigasri M, Keerthana R, Kishore Prasath Venkatesh, Bargava Subramanian, Kalyan Sivasailam, Revathi Ezhumalai, Abitha Marimuthu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 10 pages , 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03314 2025-03-28 cs.CV cs.CL cs.DB 62%

BACON: Improving Clarity of Image Captions via Bag-of-Concept Graphs

Zhantao Yang, Ruili Feng, Keyu Yan, Huangji Wang, Zhicai Wang, Shangwen Zhu, Han Zhang, Jie Xiao, Pingyu Wu, Kai Zhu, Jixuan Chen, Chen-Wei Xie, Yue Yang, Hongyang Zhang, Yu Liu, Fan Cheng

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20271 2025-03-27 cs.CV cs.CL 62%

ViLBench: A Suite for Vision-Language Process Reward Modeling

Haoqin Tu, Weitao Feng, Hardy Chen, Hui Liu, Xianfeng Tang, Cihang Xie

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19707 2025-03-26 cs.CV cs.CL 62%

Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models

Ilias Stogiannidis, Steven McDonagh, Sotirios A. Tsaftaris

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments 8 main pages, 4 pages Appendix, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19510 2025-03-26 cs.RO cs.AI cs.CV 62%

RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation

Sheng Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19186 2025-03-26 cs.CV cs.CL cs.LG 62%

MetaToken: Detecting Hallucination in Image Descriptions by Meta Classification

Laura Fieback, Jakob Spiegelberg, Hanno Gottschalk

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17712 2025-03-25 cs.CV cs.AI 62%

Multi-modality Anomaly Segmentation on the Road

Heng Gao, Zhuolin He, Shoumeng Qiu, Xiangyang Xue, Jian Pu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15342 2025-03-20 cs.CV cs.AI 62%

TruthLens:A Training-Free Paradigm for DeepFake Detection

Ritabrata Chakraborty, Rajatsubhra Chakraborty, Ali Khaleghi Rahimian, Thomas MacDougall

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14672 2025-03-20 cs.CV cs.AI 62%

FiVL: A Framework for Improved Vision-Language Alignment through the Lens of Training, Evaluation and Explainability

Estelle Aflalo, Gabriela Ben Melech Stan, Tiep Le, Man Luo, Shachar Rosenman, Sayak Paul, Shao-Yen Tseng, Vasudev Lal

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11761 2025-03-20 cs.CV cs.AI 62%

SlideChat: A Large Vision-Language Assistant for Whole-Slide Pathology Image Understanding

Ying Chen, Guoan Wang, Yuanfeng Ji, Yanjun Li, Jin Ye, Tianbin Li, Ming Hu, Rongshan Yu, Yu Qiao, Junjun He

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13805 2025-03-19 cs.CV cs.LG cs.MM 62%

Text-Guided Image Invariant Feature Learning for Robust Image Watermarking

Muhammad Ahtesham, Xin Zhong

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19488 2025-03-18 cs.CV cs.AI cs.LG 62%

Interleaved-Modal Chain-of-Thought

Jun Gao, Yongqi Li, Ziqiang Cao, Wenjie Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments CVPR 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02032 2025-03-18 cs.CV cs.AI 62%

Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models

Fushuo Huo, Wenchao Xu, Zhong Zhang, Haozhao Wang, Zhicheng Chen, Peilin Zhao

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10948 2025-03-18 cs.CV cs.AI cs.RO eess.IV 62%

Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery

Guankun Wang, Long Bai, Wan Jun Nah, Jie Wang, Zhaoxi Zhang, Zhen Chen, Jinlin Wu, Mobarakol Islam, Hongbin Liu, Hongliang Ren

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments The manuscript is accepted by ICLR 2025 FM-Wild Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11360 2025-03-17 cs.CV cs.AI cs.LG 62%

PARIC: Probabilistic Attention Regularization for Language Guided Image Classification from Pre-trained Vison Language Models

Mayank Nautiyal, Stela Arranz Gheorghe, Kristiana Stefa, Li Ju, Ida-Maria Sintorn, Prashant Singh

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06287 2025-03-11 cs.CV cs.AI 62%

Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding

Seil Kang, Jinyeong Kim, Junhyeok Kim, Seong Jae Hwang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18176 2025-03-04 cs.CV cs.AI 62%

CLIPure: Purification in Latent Space via CLIP for Adversarially Robust Zero-Shot Classification

Mingkun Zhang, Keping Bi, Wei Chen, Jiafeng Guo, Xueqi Cheng

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15744 2025-03-04 cs.CV cs.AI 62%

Unleashing the Potential of Vision-Language Pre-Training for 3D Zero-Shot Lesion Segmentation via Mask-Attribute Alignment

Yankai Jiang, Wenhui Lei, Xiaofan Zhang, Shaoting Zhang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted as ICLR 2025 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06912 2025-03-04 cs.CV cs.AI cs.LG 62%

Compositional Entailment Learning for Hyperbolic Vision-Language Models

Avik Pal, Max van Spengler, Guido Maria D'Amely di Melendugno, Alessandro Flaborea, Fabio Galasso, Pascal Mettes

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted as oral paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18842 2025-03-03 cs.RO cs.AI cs.CV 62%

Attention-Guided Integration of CLIP and SAM for Precise Object Masking in Robotic Manipulation

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Domae Yukiyasu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06723 2025-02-28 cs.CV cs.AI cs.LG 62%

Graph-Based Captioning: Enhancing Visual Descriptions by Interconnecting Region Captions

Yu-Guan Hsieh, Cheng-Yu Hsieh, Shih-Ying Yeh, Louis Béthune, Hadi Pour Ansari, Pavan Kumar Anasosalu Vasu, Chun-Liang Li, Ranjay Krishna, Oncel Tuzel, Marco Cuturi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 59 pages, 42 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18512 2025-02-27 cs.CV cs.AI 62%

FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression

Jianjian Li, Junquan Fan, Feng Tang, Gang Huang, Shitao Zhu, Songlin Liu, Nian Xie, Wulong Liu, Yong Liao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments 20 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15739 2025-02-26 cs.LG cs.CV cs.MM 62%

Detecting Content Rating Violations in Android Applications: A Vision-Language Approach

D. Denipitiyage, B. Silva, S. Seneviratne, A. Seneviratne, S. Chawla

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13523 2025-02-26 cs.CV cs.AI 62%

Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?

Che Liu, Zhongwei Wan, Haozhe Wang, Yinda Chen, Talha Qaiser, Chen Jin, Fariba Yousefi, Nikolay Burlutskiy, Rossella Arcucci

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14786 2025-02-21 cs.CV cs.AI 62%

SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features

Michael Tschannen, Alexey Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Alabdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, Olivier Hénaff, Jeremiah Harmsen, Andreas Steiner, Xiaohua Zhai

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Model checkpoints are available at https://github.com/google-research/big_vision/tree/main/big_vision/configs/proj/image_text/README_siglip2.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14504 2025-02-21 cs.CV cs.AI 62%

PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models

Yu Meng, Kaiyuan Li, Chenran Huang, Chen Gao, Xinlei Chen, Yong Li, Xiaoping Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13095 2025-02-19 cs.CV cs.CL cs.LG 62%

Understanding and Rectifying Safety Perception Distortion in VLMs

Xiaohan Zou, Jian Kang, George Kesidis, Lu Lin

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12948 2025-02-19 cs.CV cs.AI 62%

Fake It Till You Make It: Using Synthetic Data and Domain Knowledge for Improved Text-Based Learning for LGE Detection

Athira J Jacob, Puneet Sharma, Daniel Rueckert

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Poster at Workshop on Large Language Models and Generative AI for Health at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏