arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4728 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4728 篇

2101.01169 2022-01-20 cs.CV cs.AI cs.LG 62%

Transformers in Vision: A Survey

Salman Khan, Muzammal Naseer, Munawar Hayat, Syed Waqas Zamir, Fahad Shahbaz Khan, Mubarak Shah

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 30 pages (Accepted in ACM Computing Surveys December 2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.04872 2021-12-16 cs.CV cs.MM 62%

Negative Sample Matters: A Renaissance of Metric Learning for Temporal Grounding

Zhenzhi Wang, Limin Wang, Tao Wu, Tianhao Li, Gangshan Wu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

Comments AAAI 2022 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.05717 2021-12-02 cs.CV cs.CL 62%

Relation-aware Video Reading Comprehension for Temporal Language Grounding

Jialin Gao, Xin Sun, Mengmeng Xu, Xi Zhou, Bernard Ghanem

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by EMNLP-21

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.06643 2021-11-15 cs.SD cs.CV cs.LG eess.AS 62%

Fully Automatic Page Turning on Real Scores

Florian Henkel, Stephanie Schwaiger, Gerhard Widmer

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、eess.AS

Comments ISMIR 2021 Late Breaking/Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.04321 2021-11-09 cs.CV cs.CL 62%

Towards Debiasing Temporal Sentence Grounding in Video

Hao Zhang, Aixin Sun, Wei Jing, Joey Tianyi Zhou

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments 13 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.03819 2021-11-09 cs.CV cs.MM 62%

Will You Ever Become Popular? Learning to Predict Virality of Dance Clips

Jiahao Wang, Yunhong Wang, Nina Weng, Tianrui Chai, Annan Li, Faxi Zhang, Sansi Yu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by TOMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.15957 2021-11-01 cs.CV cs.CL 62%

Visual Keyword Spotting with Attention

K R Prajwal, Liliane Momeni, Triantafyllos Afouras, Andrew Zisserman

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Appears in: British Machine Vision Conference 2021 (BMVC 2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.01466 2021-10-29 cs.CL cs.MM 62%

GraphTMT: Unsupervised Graph-based Topic Modeling from Video Transcripts

Lukas Stappen, Jason Thies, Gerhard Hagerer, Björn W. Schuller, Georg Groh

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.MM

Comments JT and LS contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.11188 2021-10-19 cs.SD cs.CV eess.AS 62%

AttendAffectNet: Self-Attention based Networks for Predicting Affective Responses from Movies

Ha Thi Phuong Thao, Balamurali B. T., Dorien Herremans, Gemma Roig

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

Comments 8 pages, 6 figures

Journal ref Proceedings of the International Conference on Pattern Recognition (ICPR2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.07137 2021-10-15 cs.CV cs.CL 62%

A CLIP-Enhanced Method for Video-Language Understanding

Guohao Li, Feng He, Zhifan Feng

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments 3 pages, 1 figure, 2 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.06161 2021-10-13 cs.CV cs.AI 62%

Sign Language Recognition via Skeleton-Aware Multi-Model Ensemble

Songyao Jiang, Bin Sun, Lichen Wang, Yue Bai, Kunpeng Li, Yun Fu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.08858 2021-10-12 cs.AI cs.CL cs.LG 62%

Grounding Spatio-Temporal Language with Transformers

Tristan Karch, Laetitia Teodorescu, Katja Hofmann, Clément Moulin-Frier, Pierre-Yves Oudeyer

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Contains main article and supplementaries

Journal ref Neurips 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.14131 2021-09-30 cs.CV cs.CL 62%

Contrastive Video-Language Segmentation

Chen Liang, Yawei Luo, Yu Wu, Yi Yang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.12776 2021-09-28 cs.CV cs.MM 62%

Joint Multimedia Event Extraction from Video and Article

Brian Chen, Xudong Lin, Christopher Thomas, Manling Li, Shoya Yoshida, Lovish Chum, Heng Ji, Shih-Fu Chang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments To be presented at EMNLP 2021 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.06400 2021-09-15 cs.CV cs.CL 62%

Progressively Guide to Attend: An Iterative Alignment Framework for Temporal Sentence Grounding

Daizong Liu, Xiaoye Qu, Pan Zhou

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted as a long paper in the main conference of EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.02747 2021-09-10 cs.CV cs.CL 62%

WhyAct: Identifying Action Reasons in Lifestyle Vlogs

Oana Ignat, Santiago Castro, Hanwen Miao, Weiji Li, Rada Mihalcea

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted at EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.00829 2021-09-03 cs.CV cs.AI cs.LG 62%

SlowFast Rolling-Unrolling LSTMs for Action Anticipation in Egocentric Videos

Nada Osman, Guglielmo Camporese, Pasquale Coscia, Lamberto Ballan

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to EPIC@ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.11945 2021-08-27 cs.RO cs.CL cs.CV 62%

SASRA: Semantically-aware Spatio-temporal Reasoning Agent for Vision-and-Language Navigation in Continuous Environments

Muhammad Zubair Irshad, Niluthpol Chowdhury Mithun, Zachary Seymour, Han-Pang Chiu, Supun Samarasekera, Rakesh Kumar

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.08633 2021-08-20 cs.CV cs.MM 62%

Spatio-Temporal Interaction Graph Parsing Networks for Human-Object Interaction Recognition

Ning Wang, Guangming Zhu, Liang Zhang, Peiyi Shen, Hongsheng Li, Cong Hua

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments ACM MM Oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.05158 2021-08-12 cs.CV cs.AI 62%

Mounting Video Metadata on Transformer-based Language Model for Open-ended Video Question Answering

Donggeon Lee, Seongho Choi, Youwon Jang, Byoung-Tak Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.03543 2021-08-10 cs.CV cs.AI 62%

Spatio-Temporal Attention Mechanism and Knowledge Distillation for Lip Reading

Shahd Elashmawy, Marian Ramsis, Hesham M. Eraqi, Farah Eldeshnawy, Hadeel Mabrouk, Omar Abugabal, Nourhan Sakr

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02365 2021-08-06 cs.CV cs.CL 62%

Hybrid Reasoning Network for Video-based Commonsense Captioning

Weijiang Yu, Jian Liang, Lei Ji, Lu Li, Yuejian Fang, Nong Xiao, Nan Duan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.01619 2021-06-30 cs.CV cs.AI cs.LG cs.RO 62%

Relational Graph Learning on Visual and Kinematics Embeddings for Accurate Gesture Recognition in Robotic Surgery

Yonghao Long, Jie Ying Wu, Bo Lu, Yueming Jin, Mathias Unberath, Yun-Hui Liu, Pheng Ann Heng, Qi Dou

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted for ICRA 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.10446 2021-06-22 cs.CV cs.AI 62%

Attend What You Need: Motion-Appearance Synergistic Networks for Video Question Answering

Ahjeong Seo, Gi-Cheon Kang, Joonhan Park, Byoung-Tak Zhang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments ACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.09756 2021-06-21 cs.LG cs.AI cs.CV stat.ML 62%

PyKale: Knowledge-Aware Machine Learning from Multiple Sources in Python

Haiping Lu, Xianyuan Liu, Robert Turner, Peizhen Bai, Raivo E Koot, Shuo Zhou, Mustafa Chasmai, Lawrence Schobs

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments This library is available at https://github.com/pykale/pykale

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.06160 2021-05-17 cs.CV cs.AI 62%

Relation-aware Hierarchical Attention Framework for Video Question Answering

Fangtao Li, Ting Bai, Chenyu Cao, Zihe Liu, Chenghao Yan, Bin Wu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 9 pages, This paper is accepted by ICMR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.04369 2021-05-05 cs.CV cs.CL 62%

Video-aided Unsupervised Grammar Induction

Songyang Zhang, Linfeng Song, Lifeng Jin, Kun Xu, Dong Yu, Jiebo Luo

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments This paper is accepted by NAACL'21

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.09427 2021-02-22 cs.CL cs.AI 62%

Towards Natural Language Question Answering over Earth Observation Linked Data using Attention-based Neural Machine Translation

Abhishek V. Potnis, Rajat C. Shinde, Surya S. Durbha

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted at IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.05381 2021-02-19 cs.CV cs.IR cs.MM 62%

Dual Encoding for Video Retrieval by Text

Jianfeng Dong, Xirong Li, Chaoxi Xu, Xun Yang, Gang Yang, Xun Wang, Meng Wang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence. Code and data will be available at https://github.com/danieljf24/hybrid_space. Conference version: arXiv:1809.06181

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.02639 2021-01-21 cs.CV cs.IR cs.LG cs.MM 62%

Rethinking movie genre classification with fine-grained semantic clustering

Edward Fish, Jon Weinbren, Andrew Gilbert

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏