arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9119 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9119 篇

2311.14656 2024-01-17 cs.CV cs.AI 81%

Charting New Territories: Exploring the Geographic and Geospatial Capabilities of Multimodal LLMs

Jonathan Roberts, Timo Lüddecke, Rehan Sheikh, Kai Han, Samuel Albanie

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments V3: Fixed typo in Fig.1; V2: Minor formatting changes and added missing subfigure captions

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18341 2024-01-17 cs.CL cs.AI 81%

CXR-LLAVA: a multimodal large language model for interpreting chest X-ray images

Seowoo Lee, Jiwon Youn, Hyungjin Kim, Mansu Kim, Soon Ho Yoon

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06807 2024-01-17 cs.CL cs.AI 81%

An EcoSage Assistant: Towards Building A Multimodal Plant Care Dialogue Assistant

Mohit Tomar, Abhisek Tiwari, Tulika Saha, Prince Jha, Sriparna Saha

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09832 2024-01-12 cs.CL cs.AI 81%

Task Selection and Assignment for Multi-modal Multi-task Dialogue Act Classification with Non-stationary Multi-armed Bandits

Xiangheng He, Junjie Chen, Björn W. Schuller

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01227 2024-01-11 cs.CV cs.AI 81%

IdentiFace : A VGG Based Multimodal Facial Biometric System

Mahmoud Rabea, Hanya Ahmed, Sohaila Mahmoud, Nourhan Sayed

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 12 pages, 22 figures and 9 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15218 2024-01-05 cs.LG cs.AI cs.CV 81%

Multi-modal Machine Learning for Vehicle Rating Predictions Using Image, Text, and Parametric Data

Hanqi Su, Binyang Song, Faez Ahmed

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

Comments The paper submitted to IDETC/CIE2023, the International Design Engineering Technical Conferences & Computers and Information in Engineering Conference, has been accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01596 2024-01-04 cs.AI cs.CL 81%

MedSumm: A Multimodal Approach to Summarizing Code-Mixed Hindi-English Clinical Queries

Akash Ghosh, Arkadeep Acharya, Prince Jha, Aniket Gaudgaul, Rajdeep Majumdar, Sriparna Saha, Aman Chadha, Raghav Jain, Setu Sinha, Shivani Agarwal

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments ECIR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16023 2023-12-27 cs.CL cs.MM 81%

DocMSU: A Comprehensive Benchmark for Document-level Multimodal Sarcasm Understanding

Hang Du, Guoshun Nan, Sicheng Zhang, Binzhu Xie, Junrui Xu, Hehe Fan, Qimei Cui, Xiaofeng Tao, Xudong Jiang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13503 2023-12-22 cs.CV cs.AI 81%

InfoVisDial: An Informative Visual Dialogue Dataset by Bridging Large Multimodal and Language Models

Bingbing Wen, Zhengyuan Yang, Jianfeng Wang, Zhe Gan, Bill Howe, Lijuan Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09501 2023-12-18 cs.CV cs.AI 81%

EDA: Evolving and Distinct Anchors for Multimodal Motion Prediction

Longzhong Lin, Xuewu Lin, Tianwei Lin, Lichao Huang, Rong Xiong, Yue Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Thirty-Eighth AAAI Conference on Artificial Intelligence (AAAI2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07814 2023-12-14 cs.CV cs.AI 81%

A Foundational Multimodal Vision Language AI Assistant for Human Pathology

Ming Y. Lu, Bowen Chen, Drew F. K. Williamson, Richard J. Chen, Kenji Ikamura, Georg Gerber, Ivy Liang, Long Phi Le, Tong Ding, Anil V Parwani, Faisal Mahmood

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04087 2023-12-08 cs.CV cs.AI 81%

VRPTEST: Evaluating Visual Referring Prompting in Large Multimodal Models

Zongjie Li, Chaozheng Wang, Chaowei Liu, Pingchuan Ma, Daoyuan Wu, Shuai Wang, Cuiyun Gao

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17435 2023-11-30 cs.CV cs.AI 81%

MM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning

Chaoyi Zhang, Kevin Lin, Zhengyuan Yang, Jianfeng Wang, Linjie Li, Chung-Ching Lin, Zicheng Liu, Lijuan Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Project page at https://mm-narrator.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12829 2023-11-23 cs.CV cs.AI 81%

Intelligent Knee Sleeves: A Real-time Multimodal Dataset for 3D Lower Body Motion Estimation Using Smart Textile

Wenwen Zhang, Arvin Tashakori, Zenan Jiang, Amir Servati, Harishkumar Narayana, Saeid Soltanian, Rou Yi Yeap, Meng Han Ma, Lauren Toy, Peyman Servati

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by Thirty-seventh Conference on Neural Information Processing Systems (Neurips) D&B Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10798 2023-11-21 cs.LG cs.AI cs.CV eess.IV 81%

INSPECT: A Multimodal Dataset for Pulmonary Embolism Diagnosis and Prognosis

Shih-Cheng Huang, Zepeng Huo, Ethan Steinberg, Chia-Chun Chiang, Matthew P. Lungren, Curtis P. Langlotz, Serena Yeung, Nigam H. Shah, Jason A. Fries

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04216 2023-11-21 cs.CV cs.MM 81%

MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos

Jielin Qiu, Jiacheng Zhu, William Han, Aditesh Kumar, Karthik Mittal, Claire Jin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Ding Zhao, Bo Li, Lijuan Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

Comments Project website: https://mmsum-dataset.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05179 2023-11-13 cs.CL cs.CV 81%

M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models

Wenxuan Zhang, Sharifah Mahani Aljunied, Chang Gao, Yew Ken Chia, Lidong Bing

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments NeurIPS 2023 (Datasets and Benchmarks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04926 2023-11-10 cs.CL cs.AI 81%

More Robots are Coming: Large Multimodal Models (ChatGPT) can Solve Visually Diverse Images of Parsons Problems

Irene Hou, Owen Man, Sophie Mettille, Sebastian Gutierrez, Kenneth Angelikas, Stephen MacNeil

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06597 2023-11-09 cs.CV cs.AI cs.LG cs.RO 81%

Rank2Tell: A Multimodal Driving Dataset for Joint Importance Ranking and Reasoning

Enna Sachdeva, Nakul Agarwal, Suhas Chundi, Sean Roelofs, Jiachen Li, Mykel Kochenderfer, Chiho Choi, Behzad Dariush

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19109 2023-11-08 cs.CV cs.AI 81%

Dynamic Task and Weight Prioritization Curriculum Learning for Multimodal Imagery

Huseyin Fuat Alsan, Taner Arsan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06775 2023-11-07 cs.LG cs.AI cs.CL cs.SI 81%

A Novel Site-Agnostic Multimodal Deep Learning Model to Identify Pro-Eating Disorder Content on Social Media

Jonathan Feldman

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13786 2023-11-01 cs.CV cs.AI cs.LG 81%

Perception Test: A Diagnostic Benchmark for Multimodal Video Models

Viorica Pătrăucean, Lucas Smaira, Ankush Gupta, Adrià Recasens Continente, Larisa Markeeva, Dylan Banarse, Skanda Koppula, Joseph Heyward, Mateusz Malinowski, Yi Yang, Carl Doersch, Tatiana Matejovicova, Yury Sulsky, Antoine Miech, Alex Frechette, Hanna Klimczak, Raphael Koster, Junlin Zhang, Stephanie Winkler, Yusuf Aytar, Simon Osindero, Dima Damen, Andrew Zisserman, João Carreira

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 37th Conference on Neural Information Processing Systems (NeurIPS 2023) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18046 2023-10-30 cs.CL cs.CV 81%

ViCLEVR: A Visual Reasoning Dataset and Hybrid Multimodal Fusion Model for Visual Question Answering in Vietnamese

Khiem Vinh Tran, Hao Phu Phan, Kiet Van Nguyen, Ngan Luu Thuy Nguyen

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments A pre-print version and submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14605 2023-10-24 cs.CL cs.MM 81%

M2DF: Multi-grained Multi-curriculum Denoising Framework for Multimodal Aspect-based Sentiment Analysis

Fei Zhao, Chunhui Li, Zhen Wu, Yawen Ouyang, Jianbing Zhang, Xinyu Dai

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM

Comments Accepted by EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11465 2023-10-19 cs.LG cs.AI cs.CL 81%

BaitBuster-Bangla: A Comprehensive Dataset for Clickbait Detection in Bangla with Multi-Feature and Multi-Modal Analysis

Abdullah Al Imran, Md Sakib Hossain Shovon, M. F. Mridha

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10967 2023-10-18 cs.CL cs.AI cs.HC 81%

EXMODD: An EXplanatory Multimodal Open-Domain Dialogue dataset

Hang Yin, Pinren Lu, Ziang Li, Bin Sun, Kan Li

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.06487 2023-10-17 cs.CV cs.AI 81%

Evaluating Explainable AI on a Multi-Modal Medical Imaging Task: Can Existing Algorithms Fulfill Clinical Requirements?

Weina Jin, Xiaoxiao Li, Ghassan Hamarneh

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

Comments AAAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09036 2023-10-16 cs.CL cs.MM 81%

MM-BigBench: Evaluating Multimodal Models on Multimodal Content Comprehension Tasks

Xiaocui Yang, Wenfang Wu, Shi Feng, Ming Wang, Daling Wang, Yang Li, Qi Sun, Yifei Zhang, Xiaoming Fu, Soujanya Poria

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM

Comments Underview

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16772 2023-10-10 cs.CV cs.AI cs.RO 81%

XVO: Generalized Visual Odometry via Cross-Modal Self-Training

Lei Lai, Zhongkai Shangguan, Jimuyang Zhang, Eshed Ohn-Bar

专题命中 多模态评测 :cross-modal(title);multi-modal(abstract);分类 cs.CV、cs.AI

Comments ICCV 2023, Paris https://genxvo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00845 2023-10-03 cs.CL cs.AI 81%

Application of frozen large-scale models to multimodal task-oriented dialogue

Tatsuki Kawamoto, Takuma Suzuki, Ko Miyama, Takumi Meguro, Tomohiro Takagi

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏