arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4728 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4728 篇

2101.02458 2021-01-08 cs.CV cs.AI 62%

Associated Spatio-Temporal Capsule Network for Gait Recognition

Aite Zhao, Junyu Dong, Jianbo Li, Lin Qi, Huiyu Zhou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.10285 2020-12-21 cs.CV cs.CL 62%

Trying Bilinear Pooling in Video-QA

Thomas Winterbottom, Sarah Xiao, Alistair McLean, Noura Al Moubayed

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 16 Pages, 8 Figures, 4 Tables, +Supp Mats

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.07536 2020-12-15 cs.CL cs.CV 62%

Movie Summarization via Sparse Graph Construction

Pinelopi Papalampidi, Frank Keller, Mirella Lapata

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted at AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.12143 2020-11-25 cs.CV cs.AI cs.LG 62%

Deep learning for video game genre classification

Yuhang Jiang, Lukun Zheng

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 21 pages, 6 figures, 3 tables. arXiv admin note: substantial text overlap with arXiv:2011.07658

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.11400 2020-11-24 cs.AI cs.CL q-bio.NC 62%

Language guided machine action

Feng Qi

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.14701 2020-11-09 cs.LG cs.CL cs.CV 62%

Scaling Laws for Autoregressive Generative Modeling

Tom Henighan, Jared Kaplan, Mor Katz, Mark Chen, Christopher Hesse, Jacob Jackson, Heewoo Jun, Tom B. Brown, Prafulla Dhariwal, Scott Gray, Chris Hallacy, Benjamin Mann, Alec Radford, Aditya Ramesh, Nick Ryder, Daniel M. Ziegler, John Schulman, Dario Amodei, Sam McCandlish

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 20+17 pages, 33 figures; added appendix with additional language results

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.16073 2020-11-02 cs.CV cs.LG cs.MM eess.IV 62%

CNN based Multistage Gated Average Fusion (MGAF) for Human Action Recognition Using Depth and Inertial Sensors

Zeeshan Ahmad, Naimul khan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments arXiv admin note: text overlap with arXiv:1910.11482

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.03626 2020-07-08 cs.CL cs.CV cs.LG stat.ML 62%

What Gives the Answer Away? Question Answering Bias Analysis on Video QA Datasets

Jianing Yang, Yuying Zhu, Yongxin Wang, Ruitao Yi, Amir Zadeh, Louis-Philippe Morency

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.15319 2020-06-30 cs.CL cs.CV cs.LG 62%

Video-Grounded Dialogues with Pretrained Generation Language Models

Hung Le, Steven C. H. Hoi

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.CL

Comments Accepted at ACL 2020 (Short Paper)

Journal ref Association for Computational Linguistics (2020) 5842-5848

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.13931 2020-06-16 cs.CL cs.CV 62%

Span-based Localizing Network for Natural Language Video Localization

Hao Zhang, Aixin Sun, Wei Jing, Joey Tianyi Zhou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments To appear at ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.09183 2020-05-20 cs.CV cs.CL cs.IR 62%

Retrieving and Highlighting Action with Spatiotemporal Reference

Seito Kasai, Yuchi Ishikawa, Masaki Hayashi, Yoshimitsu Aoki, Kensho Hara, Hirokatsu Kataoka

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted to ICIP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.09418 2020-05-15 cs.MM cs.CV 62%

Video Storytelling: Textual Summaries for Events

Junnan Li, Yongkang Wong, Qi Zhao, Mohan S. Kankanhalli

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Published in IEEE Transactions on Multimedia

Journal ref J. Li, Y. Wong, Q. Zhao and M. S. Kankanhalli, "Video Storytelling: Textual Summaries for Events," in IEEE Transactions on Multimedia, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.10606 2020-03-25 cs.CV cs.CL 62%

Video Object Grounding using Semantic Roles in Language Description

Arka Sadhu, Kan Chen, Ram Nevatia

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments CVPR20 camera-ready including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.02265 2020-02-07 cs.CV cs.CL cs.LG stat.ML 62%

Zero-Shot Activity Recognition with Videos

Evin Pinar Ornek

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments This is a research report done during master's studies

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.01108 2019-12-02 cs.CV cs.CL 62%

Language2Pose: Natural Language Grounded Pose Forecasting

Chaitanya Ahuja, Louis-Philippe Morency

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.06693 2019-10-16 cs.CV cs.LG eess.AS 62%

Seeing and Hearing Egocentric Actions: How Much Can We Learn?

Alejandro Cartas, Jordi Luque, Petia Radeva, Carlos Segura, Mariella Dimiccoli

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、eess.AS

Comments Accepted for the Fifth International Workshop on Egocentric Perception, Interaction and Computing (EPIC) at the International Conference on Computer Vision (ICCV) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.11023 2019-09-25 cs.CV cs.LG cs.MM 62%

Posture and sequence recognition for Bharatanatyam dance performances using machine learning approach

Tanwi Mallick, Partha Pratim Das, Arun Kumar Majumdar

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.01766 2019-09-13 cs.CV cs.AI 62%

VideoBERT: A Joint Model for Video and Language Representation Learning

Chen Sun, Austin Myers, Carl Vondrick, Kevin Murphy, Cordelia Schmid

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments ICCV 2019 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.12059 2019-04-30 cs.CV cs.AI cs.CR cs.DC 62%

ARCHANGEL: Tamper-proofing Video Archives using Temporal Content Hashes on the Blockchain

Tu Bui, Daniel Cooper, John Collomosse, Mark Bell, Alex Green, John Sheridan, Jez Higgins, Arindra Das, Jared Keller, Olivier Thereaux, Alan Brown

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR Blockchain Workshop 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.02354 2019-04-10 cs.MM cs.CV cs.SI 62%

MMED: A Multi-domain and Multi-modality Event Dataset

Zhenguo Yang, Zehang Lin, Min Cheng, Qing Li, Wenyin Liu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.02884 2019-01-11 cs.LG cs.AI cs.CV cs.HC stat.ML 62%

Deep Learning for Human Affect Recognition: Insights and New Developments

Philipp V. Rouast, Marc T. P. Adam, Raymond Chiong

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments To be published in IEEE Transactions on Affective Computing. 20 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.02257 2018-06-01 stat.ML cs.AI cs.CV cs.LG cs.NE 62%

Driver Action Prediction Using Deep (Bidirectional) Recurrent Neural Network

Oluwatobi Olabiyi, Eric Martinson, Vijay Chintalapudi, Rui Guo

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments ITSC'17

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.09345 2018-03-19 cs.CV cs.CL 62%

A Read-Write Memory Network for Movie Story Understanding

Seil Na, Sangho Lee, Jisung Kim, Gunhee Kim

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments accepted paper at ICCV 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.01336 2017-08-07 cs.CV cs.CL 62%

MemexQA: Visual Memex Question Answering

Lu Jiang, Junwei Liang, Liangliang Cao, Yannis Kalantidis, Sachin Farfade, Alexander Hauptmann

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments https://memexqa.cs.cmu.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.01600 2016-11-23 cs.CV cs.HC cs.MM 62%

AVEC 2016 - Depression, Mood, and Emotion Recognition Workshop and Challenge

Michel Valstar, Jonathan Gratch, Bjorn Schuller, Fabien Ringeval, Denis Lalanne, Mercedes Torres Torres, Stefan Scherer, Guiota Stratou, Roddy Cowie, Maja Pantic

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments Proceedings of the 6th International Workshop on Audio/Visual Emotion Challenge, AVEC'16, co-located with the 24th ACM International Conference on Multimedia, MM 2016, pages 3-10, Amsterdam, The Netherlands, October 2016. ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.08088 2016-04-28 cs.MM cs.CV 62%

Detecting Violence in Video using Subclasses

Xirong Li, Yujia Huo, Jieping Xu, Qin Jin

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1509.06086 2015-11-12 cs.CV cs.MM 62%

Fusing Multi-Stream Deep Networks for Video Classification

Zuxuan Wu, Yu-Gang Jiang, Xi Wang, Hao Ye, Xiangyang Xue, Jun Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.02492 2015-11-10 cs.CV cs.MM 62%

VideoStory Embeddings Recognize Events when Examples are Scarce

Amirhossein Habibian, Thomas Mensink, Cees G. M. Snoek

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1308.3225 2013-12-30 cs.MM cs.CV cs.IR 62%

An interactive engine for multilingual video browsing using semantic content

M. Ben Halima, M. Hamroun, S. Ben Moussa, A. M. Alimi

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.MM

Comments 4 pages, IGS 2013 Conference; IGS 2013

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04670 2025-11-07 cs.CV 61%

Cambrian-S: Towards Spatial Supersensing in Video

Shusheng Yang, Jihan Yang, Pinzhi Huang, Ellis Brown, Zihao Yang, Yue Yu, Shengbang Tong, Zihan Zheng, Yifan Xu, Muhan Wang, Daohan Lu, Rob Fergus, Yann LeCun, Li Fei-Fei, Saining Xie

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV;MLLM(comments)

Comments Website: https://cambrian-mllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏