arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9087 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9087 篇

2401.13649 2024-06-07 cs.LG cs.CL cs.CV 84%

VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks

Jing Yu Koh, Robert Lo, Lawrence Jang, Vikram Duvvur, Ming Chong Lim, Po-Yu Huang, Graham Neubig, Shuyan Zhou, Ruslan Salakhutdinov, Daniel Fried

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted to ACL 2024. 24 pages. Project page: https://jykoh.com/vwa

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09619 2024-04-16 cs.CV cs.AI 84%

UNIAA: A Unified Multi-modal Image Aesthetic Assessment Baseline and Benchmark

Zhaokun Zhou, Qiulin Wang, Bin Lin, Yiwei Su, Rui Chen, Xin Tao, Amin Zheng, Li Yuan, Pengfei Wan, Di Zhang

专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09204 2024-04-16 cs.CV cs.AI 84%

TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models

Ya-Qi Yu, Minghui Liao, Jihao Wu, Yongxin Liao, Xiaoyu Zheng, Wei Zeng

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10564 2024-04-15 cs.CL cs.AI cs.LG 84%

Re-evaluating the Need for Multimodal Signals in Unsupervised Grammar Induction

Boyi Li, Rodolfo Corona, Karttikeya Mangalam, Catherine Chen, Daniel Flaherty, Serge Belongie, Kilian Q. Weinberger, Jitendra Malik, Trevor Darrell, Dan Klein

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI

Comments NAACL Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05719 2024-04-09 cs.CV cs.CL cs.HC 84%

Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs

Keen You, Haotian Zhang, Eldon Schoop, Floris Weers, Amanda Swearngin, Jeffrey Nichols, Yinfei Yang, Zhe Gan

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08730 2024-04-04 cs.CL cs.CV 84%

Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization

Renjie Pi, Tianyang Han, Wei Xiong, Jipeng Zhang, Runtao Liu, Rui Pan, Tong Zhang

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04119 2024-04-01 cs.CV cs.CL 84%

DialogCC: An Automated Pipeline for Creating High-Quality Multi-Modal Dialogue Dataset

Young-Jun Lee, Byungsoo Ko, Han-Gyu Kim, Jonghwan Hyeon, Ho-Jin Choi

专题命中 多模态评测 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

Comments NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12831 2024-03-22 cs.MM cs.CV 84%

M3FAS: An Accurate and Robust MultiModal Mobile Face Anti-Spoofing System

Chenqi Kong, Kexin Zheng, Yibing Liu, Shiqi Wang, Anderson Rocha, Haoliang Li

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14840 2024-02-26 cs.CL cs.AI stat.AP 84%

RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning

Congyun Jin, Ming Zhang, Xiaowei Ma, Li Yujiao, Yingbo Wang, Yabo Jia, Yuliang Du, Tao Sun, Haowen Wang, Cong Fan, Jinjie Gu, Chenfei Chi, Xiangguo Lv, Fangzhou Li, Wei Xue, Yiran Huang

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);image-text(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05301 2024-02-13 cs.CV cs.AI cs.LG 84%

BIKED++: A Multimodal Dataset of 1.4 Million Bicycle Image and Parametric CAD Designs

Lyle Regenwetter, Yazan Abu Obaideh, Amin Heyrani Nobari, Faez Ahmed

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16033 2024-02-13 cs.CV cs.CL 84%

Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs

Jiarui Zhang, Mahyar Khayatkhoei, Prateek Chhikara, Filip Ilievski

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

Comments 20 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05138 2024-02-09 cs.AI cs.CL 84%

SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark

Zhenwen Liang, Kehan Guo, Gang Liu, Taicheng Guo, Yujun Zhou, Tianyu Yang, Jiajun Jiao, Renjie Pi, Jipeng Zhang, Xiangliang Zhang

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08825 2024-01-18 cs.LG cs.CL cs.CV 84%

AiGen-FoodReview: A Multimodal Dataset of Machine-Generated Restaurant Reviews and Images on Social Media

Alessandro Gambetti, Qiwei Han

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18248 2024-01-10 cs.MM cs.CL 84%

mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model

Anwen Hu, Yaya Shi, Haiyang Xu, Jiabo Ye, Qinghao Ye, Ming Yan, Chenliang Li, Qi Qian, Ji Zhang, Fei Huang

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.MM

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13335 2023-12-27 cs.CV cs.MM 84%

Multi-modal Large Language Model Enhanced Pseudo 3D Perception Framework for Visual Commonsense Reasoning

Jian Zhu, Hanli Wang, Miaojing Shi

专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.04023 2023-11-29 cs.CL cs.AI 84%

A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity

Yejin Bang, Samuel Cahyawijaya, Nayeon Lee, Wenliang Dai, Dan Su, Bryan Wilie, Holy Lovenia, Ziwei Ji, Tiezheng Yu, Willy Chung, Quyet V. Do, Yan Xu, Pascale Fung

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI

Comments 45 pages, AACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03860 2023-11-09 cs.CV cs.AI 84%

CCMB: A Large-scale Chinese Cross-modal Benchmark

Chunyu Xie, Heng Cai, Jincheng Li, Fanjing Kong, Xiaoyu Wu, Jianfei Song, Henrique Morimitsu, Lin Yao, Dexin Wang, Xiangzheng Zhang, Dawei Leng, Baochang Zhang, Xiangyang Ji, Yafeng Deng

专题命中 多模态评测 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

Journal ref Proceedings of the 31st ACM International Conference on Multimedia (ACM MM), 2023, Pages 4219-4227

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17133 2023-10-27 cs.CL cs.AI 84%

Incorporating Probing Signals into Multimodal Machine Translation via Visual Question-Answering Pairs

Yuxin Zuo, Bei Li, Chuanhao Lv, Tong Zheng, Tong Xiao, Jingbo Zhu

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments Findings of EMNLP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14133 2023-10-19 cs.CV cs.MM 84%

VERITE: A Robust Benchmark for Multimodal Misinformation Detection Accounting for Unimodal Bias

Stefanos-Iordanis Papadopoulos, Christos Koutlis, Symeon Papadopoulos, Panagiotis C. Petrantonakis

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.06496 2023-10-10 cs.MM cs.SD eess.AS 84%

CCOM-HuQin: an Annotated Multimodal Chinese Fiddle Performance Dataset

Yu Zhang, Ziya Zhou, Xiaobing Li, Feng Yu, Maosong Sun

专题命中 多模态评测 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM、eess.AS

Comments 15 pages, 11 figures

Journal ref Transactions of the International Society for Music Information Retrieval, 2023, 6(1), 60-74

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10369 2023-10-10 cs.CV cs.MM 84%

Blind Multimodal Quality Assessment of Low-light Images

Miaohui Wang, Zhuowei Xu, Mai Xu, Weisi Lin

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.MM

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10755 2023-09-18 cs.CL cs.CV 84%

WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models

Conghui He, Zhenjiang Jin, Chao Xu, Jiantao Qiu, Bin Wang, Wei Li, Hang Yan, Jiaqi Wang, Dahua Lin

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16474 2023-09-01 cs.CL cs.AI 84%

Enhancing Subtask Performance of Multi-modal Large Language Model

Yongqiang Zhao, Zhenyu Li, Feng Zhang, Xinhai Xu, Donghong Liu

专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07891 2023-08-16 cs.CV cs.CL 84%

Link-Context Learning for Multimodal LLMs

Yan Tai, Weichen Fan, Zhao Zhang, Feng Zhu, Rui Zhao, Ziwei Liu

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11719 2023-05-26 cs.CV cs.CL 84%

Information Screening whilst Exploiting! Multimodal Relation Extraction with Feature Denoising and Multimodal Topic Modeling

Shengqiong Wu, Hao Fei, Yixin Cao, Lidong Bing, Tat-Seng Chua

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.07791 2023-03-14 cs.CV cs.AI 84%

UAMD-Net: A Unified Adaptive Multimodal Neural Network for Dense Depth Completion

Guancheng Chen, Junli Lin, Huabiao Qin

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 4 figures

Journal ref IEEE Transactions on Circuits and Systems for Video Technology, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.01913 2023-02-21 cs.CV cs.CL cs.IR 84%

WIT: Wikipedia-based Image Text Dataset for Multimodal Multilingual Machine Learning

Krishna Srinivasan, Karthik Raman, Jiecao Chen, Michael Bendersky, Marc Najork

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.07439 2023-01-18 cs.CV cs.AI 84%

ReDFeat: Recoupling Detection and Description for Multimodal Feature Learning

Yuxin Deng, Jiayi Ma

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00847 2022-12-05 cs.CV cs.AI 84%

Weakly Supervised Annotations for Multi-modal Greeting Cards Dataset

Sidra Hanif, Longin Jan Latecki

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted for poster presentation at Pretrain@WACV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.07098 2022-09-16 cs.CV cs.CL 84%

Multi-Modal Masked Autoencoders for Medical Vision-and-Language Pre-Training

Zhihong Chen, Yuhao Du, Jinpeng Hu, Yang Liu, Guanbin Li, Xiang Wan, Tsung-Hui Chang

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Comments Natural Language Processing. 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏