arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2501.04579 2025-01-09 cs.CV cs.MM 62%

Unified Coding for Both Human Perception and Generalized Machine Analytics with CLIP Supervision

Kangsheng Yin, Quan Liu, Xuelin Shen, Yulin He, Wenhan Yang, Shiqi Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments 9 pages, 10 figures, publised to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03151 2025-01-07 cs.AI cs.CV cs.LG 62%

Large language models for artificial general intelligence (AGI): A survey of foundational principles and approaches

Alhassan Mumuni, Fuseini Mumuni

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01989 2025-01-07 cs.CV cs.AI 62%

CRRG-CLIP: Automatic Generation of Chest Radiology Reports and Classification of Chest Radiographs

Jianfei Xu, Thanet Markchom, Huizhi Liang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01983 2025-01-07 cs.CV cs.AI 62%

ECG-guided individual identification via PPG

Riling Wei, Hanjie Chen, Kelu Yao, Chuanguang Yang, Jun Wang, Chao Li

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICASSP 2025. Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03658 2025-01-07 cs.CL cs.MM 62%

Sentiment-enhanced Graph-based Sarcasm Explanation in Dialogue

Kun Ouyang, Liqiang Jing, Xuemeng Song, Meng Liu, Yupeng Hu, Liqiang Nie

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.MM

Comments This paper got accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20715 2024-12-31 cs.MM cs.CL 62%

ChartAdapter: Large Vision-Language Model for Chart Summarization

Peixin Xu, Yujuan Ding, Wenqi Fan

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07638 2024-12-31 cs.CV cs.AI 62%

Tuning Vision-Language Models with Candidate Labels by Prompt Alignment

Zhifang Zhang, Yuwei Niu, Xin Liu, Beibei Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19155 2024-12-30 cs.CV cs.CL 62%

Referencing Where to Focus: Improving VisualGrounding with Referential Query

Yabing Wang, Zhuotao Tian, Qingpei Guo, Zheng Qin, Sanping Zhou, Ming Yang, Le Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by NIPS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18917 2024-12-30 cs.CV cs.AI cs.LG 62%

Open-Vocabulary Panoptic Segmentation Using BERT Pre-Training of Vision-Language Multiway Transformer Model

Yi-Chia Chen, Wei-Hua Li, Chu-Song Chen

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments ICIP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10945 2024-12-30 cs.CV cs.AI 62%

HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models

Kazi Hasan Ibn Arif, JinYi Yoon, Dimitrios S. Nikolopoulos, Hans Vandierendonck, Deepu John, Bo Ji

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted in AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08125 2024-12-20 cs.CV cs.CL cs.LG 62%

Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models

Quang-Hung Le, Long Hoang Dang, Ngan Le, Truyen Tran, Thao Minh Le

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10522 2024-12-19 cs.LG cs.AI cs.CL 62%

Humor in AI: Massive Scale Crowd-Sourced Preferences and Benchmarks for Cartoon Captioning

Jifan Zhang, Lalit Jain, Yang Guo, Jiayi Chen, Kuan Lok Zhou, Siddharth Suresh, Andrew Wagenmaker, Scott Sievert, Timothy Rogers, Kevin Jamieson, Robert Mankoff, Robert Nowak

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11663 2024-12-17 cs.CV cs.MM 62%

LMM-Regularized CLIP Embeddings for Image Classification

Maria Tzelepi, Vasileios Mezaris

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Accepted for publication, 26th Int. Symp. on Multimedia (IEEE ISM 2024), Tokyo, Japan, Dec. 2024. This is the authors' "accepted version"

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13804 2024-12-17 cs.CV cs.CL cs.LG 62%

Learning from Synthetic Data for Visual Grounding

Ruozhen He, Ziyan Yang, Paola Cascante-Bonilla, Alexander C. Berg, Vicente Ordonez

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Project Page: https://catherine-r-he.github.io/SynGround/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08271 2024-12-12 cs.CV cs.AI 62%

Position-aware Guided Point Cloud Completion with CLIP Model

Feng Zhou, Qi Zhang, Ju Dai, Lei Li, Qing Fan, Junliang Xing

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08111 2024-12-12 cs.CV cs.CL cs.LG 62%

Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models

Sri Harsha Dumpala, David Arps, Sageev Oore, Laura Kallmeyer, Hassan Sajjad

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14785 2024-12-10 cs.CL cs.CV 62%

Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models

Patrick Amadeus Irawan, Genta Indra Winata, Samuel Cahyawijaya, Ayu Purwarianti

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05893 2024-12-10 cs.CV cs.AI 62%

doScenes: An Autonomous Driving Dataset with Natural Language Instruction for Human Interaction and Vision-Language Navigation

Parthib Roy, Srinivasa Perisetla, Shashank Shriram, Harsha Krishnaswamy, Aryan Keskar, Ross Greer

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05876 2024-12-10 cs.CV cs.AI 62%

MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training

Xuefeng Ni, Linshan Wu, Jiaxin Zhuang, Qiong Wang, Mingxiang Wu, Varut Vardhanabhuti, Lihai Zhang, Hanyu Gao, Hao Chen

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16740 2024-12-09 cs.CV cs.AI 62%

Document Haystacks: Vision-Language Reasoning Over Piles of 1000+ Documents

Jun Chen, Dannong Xu, Junjie Fei, Chun-Mei Feng, Mohamed Elhoseiny

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments the correct arxiv version

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04652 2024-12-09 cs.CV cs.AI 62%

Cross-Self KV Cache Pruning for Efficient Vision-Language Inference

Xiaohuan Pei, Tao Huang, Chang Xu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00174 2024-12-03 cs.CV cs.AI cs.LG 62%

SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous Characters

Jianping Jiang, Weiye Xiao, Zhengyu Lin, Huaizhong Zhang, Tianxiang Ren, Yang Gao, Zhiqian Lin, Zhongang Cai, Lei Yang, Ziwei Liu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19103 2024-12-02 cs.CV cs.CL 62%

VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models

Jeongho Ju, Daeyoung Kim, SunYoung Park, Youngjune Kim

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments 24 pages, 15 figures, 4 tables. Model weights at https://huggingface.co/NCSOFT/VARCO-VISION-14B. Benchmarks released at NCSOFT's HuggingFace repositories (K-MMBench, K-SEED, K-MMStar, K-DTCBench, K-LLaVA-W). VARCO-VISION is an open-source Korean-English VLM with OCR, grounding, and referring capabilities

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18038 2024-11-28 cs.CV cs.AI 62%

VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis

Donggoo Kang, Dasol Jeong, Hyunmin Lee, Sangwoo Park, Hasil Park, Sunkyu Kwon, Yeongjoon Kim, Joonki Paik

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17491 2024-11-27 cs.CV cs.AI 62%

What's in the Image? A Deep-Dive into the Vision of Vision Language Models

Omri Kaduri, Shai Bagon, Tali Dekel

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14164 2024-11-22 cs.CV cs.AI 62%

FoPru: Focal Pruning for Efficient Large Vision-Language Models

Lei Jiang, Weizhe Huang, Tongxuan Liu, Yuting Zeng, Jing Li, Lechao Cheng, Xiaohua Xu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19774 2024-11-21 cs.CV cs.AI cs.LG math.PR stat.CO 62%

Copula-Linked Parallel ICA: A Method for Coupling Structural and Functional MRI brain Networks

Oktay Agcaoglu, Rogers F. Silva, Deniz Alacam, Sergey Plis, Tulay Adali, Vince Calhoun

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 25 pages, 10 figures, journal article

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13576 2024-11-21 cs.CV cs.AI 62%

Region Prompt Tuning: Fine-grained Scene Text Detection Utilizing Region Text Prompt

Xingtao Lin, Heqian Qiu, Lanxiao Wang, Ruihang Wang, Linfeng Xu, Hongliang Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10888 2024-11-19 eess.IV cs.AI cs.CV 62%

MpoxVLM: A Vision-Language Model for Diagnosing Skin Lesions from Mpox Virus Infection

Xu Cao, Wenqian Ye, Kenny Moise, Megan Coffee

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ML4H 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10414 2024-11-18 cs.CV cs.CL 62%

Llama Guard 3 Vision: Safeguarding Human-AI Image Understanding Conversations

Jianfeng Chi, Ujjwal Karn, Hongyuan Zhan, Eric Smith, Javier Rando, Yiming Zhang, Kate Plawiak, Zacharie Delpierre Coudert, Kartikeya Upasani, Mahesh Pasupuleti

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏