arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3450 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3450 篇

2405.09848 2024-05-17 cs.CL cs.AI 81%

Enhancing Semantics in Multimodal Chain of Thought via Soft Negative Sampling

Guangmin Zheng, Jin Wang, Xiaobing Zhou, Xuejie Zhang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17122 2024-04-29 cs.CL cs.AI 81%

2M-NER: Contrastive Learning for Multilingual and Multimodal NER with Language and Modal Fusion

Dongsheng Wang, Xiaoqin Feng, Zeming Liu, Chuan Wang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15516 2024-04-25 cs.CV cs.AI 81%

Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image Retrieval

Young Kyun Jang, Donghyun Kim, Zihang Meng, Dat Huynh, Ser-Nam Lim

专题命中 跨模态检索 :multi-modal(title);image-text(abstract);分类 cs.CV、cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12720 2024-04-22 cs.CV cs.CL 81%

PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering

Yihao Ding, Kaixuan Ren, Jiabin Huang, Siwen Luo, Soyeon Caren Han

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted by IJCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10234 2024-04-17 cs.AI cs.CV cs.IR 81%

Compressible and Searchable: AI-native Multi-Modal Retrieval System with Learned Image Compression

Jixiang Luo

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09290 2024-03-15 cs.CV cs.AI cs.LG 81%

SELECTOR: Heterogeneous graph network with convolutional masked autoencoder for multimodal robust prediction of cancer survival

Liangrui Pan, Yijun Peng, Yan Li, Xiang Wang, Wenjuan Liu, Liwen Xu, Qingchun Liang, Shaoliang Peng

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted on Computers in Biology and Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18262 2024-02-29 cs.CL cs.CV 81%

Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding

Hongshen Xu, Lu Chen, Zihan Zhao, Da Ma, Ruisheng Cao, Zichen Zhu, Kai Yu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07742 2024-02-13 cs.CL cs.CV 81%

Asking Multimodal Clarifying Questions in Mixed-Initiative Conversational Search

Yifei Yuan, Clemencia Siro, Mohammad Aliannejadi, Maarten de Rijke, Wai Lam

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted to WWW24

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01748 2024-02-08 cs.NI cs.AI cs.CL cs.LG 81%

Large Multi-Modal Models (LMMs) as Universal Foundation Models for AI-Native Wireless Systems

Shengzhe Xu, Christo Kurisummoottil Thomas, Omar Hashash, Nikhil Muralidhar, Walid Saad, Naren Ramakrishnan

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16347 2024-01-30 cs.CV cs.LG cs.MM 81%

Cross-Modal Coordination Across a Diverse Set of Input Modalities

Jorge Sánchez, Rodrigo Laguna

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10201 2024-01-17 cs.MM cs.AI 81%

CARAT: Contrastive Feature Reconstruction and Aggregation for Multi-Modal Multi-Label Emotion Recognition

Cheng Peng, Ke Chen, Lidan Shou, Gang Chen

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10493 2023-12-20 cs.CL cs.MM 81%

Debiasing Multimodal Sarcasm Detection with Contrastive Learning

Mengzhao Jia, Can Xie, Liqiang Jing

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01202 2023-11-03 cs.CV cs.AI 81%

Cross-Modal Information-Guided Network using Contrastive Learning for Point Cloud Registration

Yifan Xie, Jihua Zhu, Shiqi Li, Pengcheng Shi

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, accepted by RAL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20071 2023-11-01 cs.AI cs.LG cs.MM 81%

FOCAL: Contrastive Learning for Multimodal Time-Series Sensing Signals in Factorized Orthogonal Latent Space

Shengzhong Liu, Tomoyoshi Kimura, Dongxin Liu, Ruijie Wang, Jinyang Li, Suhas Diggavi, Mani Srivastava, Tarek Abdelzaher

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI、cs.MM

Comments Code available at: [github](https://github.com/tomoyoshki/focal)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17133 2023-10-31 cs.CL cs.CV 81%

Fine-grained Late-interaction Multi-modal Retrieval for Retrieval Augmented Visual Question Answering

Weizhe Lin, Jinghong Chen, Jingbiao Mei, Alexandru Coca, Bill Byrne

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL

Comments To appear at NeurIPS 2023. This is the camera-ready version. We fixed some numbers and added more experiments to address reviewers' comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17216 2023-10-16 cs.CL cs.CV cs.LG 81%

Generating Images with Multimodal Language Models

Jing Yu Koh, Daniel Fried, Ruslan Salakhutdinov

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments NeurIPS 2023. Project page: http://jykoh.com/gill

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04992 2023-09-19 cs.CL cs.AI 81%

AspectMMKG: A Multi-modal Knowledge Graph with Aspect-aware Entities

Jingdan Zhang, Jiaan Wang, Xiaodan Wang, Zhixu Li, Yanghua Xiao

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by CIKM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15469 2023-08-30 cs.CV cs.AI 81%

Multimodal Contrastive Learning and Tabular Attention for Automated Alzheimer's Disease Prediction

Weichen Huang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.07567 2023-08-21 cs.CV cs.MM 81%

CoVLR: Coordinating Cross-Modal Consistency and Intra-Modal Structure for Vision-Language Retrieval

Yang Yang, Zhongtian Fu, Xiangyu Wu, Wenjie Li

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

Comments I apologize for my operational mistake, which has resulted in the absence of a revised version of the manuscript. Furthermore, I am concerned that the submission process of this paper may potentially lead to conflicts. Therefore, I kindly request the withdrawal of the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04343 2023-08-09 cs.CV cs.IR cs.MM 81%

Unifying Two-Stream Encoders with Transformers for Cross-Modal Retrieval

Yi Bin, Haoxuan Li, Yahui Xu, Xing Xu, Yang Yang, Heng Tao Shen

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

Comments Accepted at ACM Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08632 2023-08-08 cs.CL cs.CV 81%

Enhancing Multi-modal and Multi-hop Question Answering via Structured Knowledge and Unified Retrieval-Generation

Qian Yang, Qian Chen, Wen Wang, Baotian Hu, Min Zhang

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted by ACM Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05942 2023-07-13 cs.RO cs.CL cs.CV 81%

Prototypical Contrastive Transfer Learning for Multimodal Language Understanding

Seitaro Otsuki, Shintaro Ishikawa, Komei Sugiura

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted for presentation at IROS23

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05314 2023-07-12 cs.CV cs.AI 81%

Masked Vision and Language Pre-training with Unimodal and Multimodal Contrastive Losses for Medical Visual Question Answering

Pengfei Li, Gang Liu, Jinlong He, Zixu Zhao, Shenjun Zhong

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments accepted by MICCAI2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17675 2023-07-03 cs.CV cs.AI 81%

Multimodal Prompt Retrieval for Generative Visual Question Answering

Timothy Ossowski, Junjie Hu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16478 2023-06-30 cs.IR cs.CL cs.CV 81%

Pre-Training Multi-Modal Dense Retrievers for Outside-Knowledge Visual Question Answering

Alireza Salemi, Mahta Rafiee, Hamed Zamani

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10079 2023-06-21 cs.CV cs.AI 81%

M3PT: A Multi-Modal Model for POI Tagging

Jingsong Yang, Guanzhou Han, Deqing Yang, Jingping Liu, Yanghua Xiao, Xiang Xu, Baohua Wu, Shenghua Ni

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by KDD 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.04647 2023-06-21 cs.CV cs.CL 81%

EXIF as Language: Learning Cross-Modal Associations Between Images and Camera Metadata

Chenhao Zheng, Ayush Shrivastava, Andrew Owens

专题命中 跨模态检索 :cross-modal(title);multimodal(abstract);分类 cs.CV、cs.CL

Comments CVPR 2023 (Highlight). Project link: http://hellomuffin.github.io/exif-as-language

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02549 2023-06-14 cs.CL cs.CV cs.LG 81%

FormNetV2: Multimodal Graph Contrastive Learning for Form Document Information Extraction

Chen-Yu Lee, Chun-Liang Li, Hao Zhang, Timothy Dozat, Vincent Perot, Guolong Su, Xiang Zhang, Kihyuk Sohn, Nikolai Glushnev, Renshen Wang, Joshua Ainslie, Shangbang Long, Siyang Qin, Yasuhisa Fujii, Nan Hua, Tomas Pfister

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted to ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12561 2023-06-07 cs.CV cs.CL cs.LG 81%

Retrieval-Augmented Multimodal Language Modeling

Michihiro Yasunaga, Armen Aghajanyan, Weijia Shi, Rich James, Jure Leskovec, Percy Liang, Mike Lewis, Luke Zettlemoyer, Wen-tau Yih

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Published at ICML 2023. Blog post available at https://cs.stanford.edu/~myasu/blog/racm3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01004 2023-06-05 cs.CL cs.AI 81%

AoM: Detecting Aspect-oriented Information for Multimodal Aspect-Based Sentiment Analysis

Ru Zhou, Wenya Guo, Xumeng Liu, Shenglong Yu, Ying Zhang, Xiaojie Yuan

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Findings of ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏