arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4728 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4728 篇

2401.09019 2024-01-18 eess.IV cs.AI cs.CV cs.MM 67%

Change Detection Between Optical Remote Sensing Imagery and Map Data via Segment Anything Model (SAM)

Hongruixuan Chen, Jian Song, Naoto Yokoya

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08720 2023-12-15 cs.AI cs.CV cs.MM 67%

Panel Transitions for Genre Analysis in Visual Narratives

Yi-Chun Chen, Arnav Jhala

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16318 2023-12-13 cs.CV cs.AI cs.MM 67%

Referred by Multi-Modality: A Unified Temporal Transformer for Video Object Segmentation

Shilin Yan, Renrui Zhang, Ziyu Guo, Wenchao Chen, Wei Zhang, Hongyang Li, Yu Qiao, Hao Dong, Zhongjiang He, Peng Gao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by AAAI 2024. Code is released at https://github.com/OpenGVLab/MUTR

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12866 2023-11-23 cs.CV cs.AI cs.CL cs.LG 67%

Modular Blended Attention Network for Video Question Answering

Mingjie Zhou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments I will not add others' names since this work has not been published

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12159 2023-11-22 cs.CV cs.AI cs.IR cs.LG cs.MM 67%

Conditional Modeling Based Automatic Video Summarization

Jia-Hong Huang, Chao-Han Huck Yang, Pin-Yu Chen, Min-Hung Chen, Marcel Worring

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments This work has been submitted to the IEEE for possible publication. arXiv admin note: substantial text overlap with arXiv:2305.00455

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05318 2023-09-07 cs.CV cs.AI cs.LG cs.MM 67%

Generative Action Description Prompts for Skeleton-based Action Recognition

Wangmeng Xiang, Chao Li, Yuxuan Zhou, Biao Wang, Lei Zhang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by ICCV23

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02124 2023-09-06 cs.LG eess.SP 67%

Exploiting Spatial-temporal Data for Sleep Stage Classification via Hypergraph Learning

Yuze Liu, Ziming Zhao, Tiehua Zhang, Kang Wang, Xin Chen, Xiaowei Huang, Jun Yin, Zhishu Shen

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15413 2023-07-31 cs.MM cs.AI cs.CL 67%

Improving Social Media Popularity Prediction with Multiple Post Dependencies

Zhizhen Zhang, Xiaohui Xie, Mengyu Yang, Ye Tian, Yong Jiang, Yong Cui

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06708 2023-04-14 cs.CV cs.AI cs.CL 67%

Verbs in Action: Improving verb understanding in video-language models

Liliane Momeni, Mathilde Caron, Arsha Nagrani, Andrew Zisserman, Cordelia Schmid

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.14115 2023-03-22 cs.CV cs.AI cs.CL cs.LG 67%

Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning

Antoine Yang, Arsha Nagrani, Paul Hongsuck Seo, Antoine Miech, Jordi Pont-Tuset, Ivan Laptev, Josef Sivic, Cordelia Schmid

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments CVPR 2023 Camera-Ready; Project Webpage: https://antoyang.github.io/vid2seq.html ; 18 pages; 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07919 2023-02-17 cs.CV cs.AI cs.MM 67%

COVID-VTS: Fact Extraction and Verification on Short Video Platforms

Fuxiao Liu, Yaser Yacoob, Abhinav Shrivastava

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments 11 pages, 5 figures, accepted to EACL2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.11388 2022-12-06 cs.CV cs.AI cs.MM 67%

LGDN: Language-Guided Denoising Network for Video-Language Modeling

Haoyu Lu, Mingyu Ding, Nanyi Fei, Yuqi Huo, Zhiwu Lu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by NeurIPS2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03382 2022-10-10 cs.CV cs.AI cs.MM 67%

Temporal Feature Alignment in Contrastive Self-Supervised Learning for Human Activity Recognition

Bulat Khaertdinov, Stylianos Asteriadis

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted to IJCB 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01191 2022-10-05 cs.CV cs.AI cs.CL cs.LG 67%

Extending Compositional Attention Networks for Social Reasoning in Videos

Christina Sartzetaki, Georgios Paraskevopoulos, Alexandros Potamianos

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Journal ref Proc. Interspeech 2022, 1116-1120

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.06252 2022-08-31 cs.RO cs.AI cs.CL cs.CV 67%

What Matters in Language Conditioned Robotic Imitation Learning over Unstructured Data

Oier Mees, Lukas Hermann, Wolfram Burgard

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted for publication at IEEE Robotics and Automation Letters (RAL). Codebase and trained models available at http://hulc.cs.uni-freiburg.de

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.05739 2022-07-19 cs.CV cs.AI cs.CL cs.HC cs.MA 67%

Learning to Retrieve Videos by Asking Questions

Avinash Madasu, Junier Oliva, Gedas Bertasius

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Journal ref ACM Multimedia 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01720 2022-06-06 cs.CV cs.AI cs.CL cs.LG 67%

Revisiting the "Video" in Video-Language Understanding

Shyamal Buch, Cristóbal Eyzaguirre, Adrien Gaidon, Jiajun Wu, Li Fei-Fei, Juan Carlos Niebles

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments CVPR 2022 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.06197 2022-04-18 cs.CV cs.AI cs.MM 67%

Video as Conditional Graph Hierarchy for Multi-Granular Question Answering

Junbin Xiao, Angela Yao, Zhiyuan Liu, Yicong Li, Wei Ji, Tat-Seng Chua

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments AAAI'22 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.09168 2022-03-04 cs.CV cs.AI cs.MM 67%

Reading-strategy Inspired Visual Representation Learning for Text-to-Video Retrieval

Jianfeng Dong, Yabing Wang, Xianke Chen, Xiaoye Qu, Xirong Li, Yuan He, Xun Wang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology. Code is available at https://github.com/LiJiaBei-7/rivrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.11547 2021-12-23 cs.CV cs.AI cs.LG cs.MM 67%

Decompose the Sounds and Pixels, Recompose the Events

Varshanth R. Rao, Md Ibrahim Khalil, Haoda Li, Peng Dai, Juwei Lu

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted at AAAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.05049 2021-06-03 cs.CV cs.AI cs.MM 67%

Human-centric Spatio-Temporal Video Grounding With Visual Transformers

Zongheng Tang, Yue Liao, Si Liu, Guanbin Li, Xiaojie Jin, Hongxu Jiang, Qian Yu, Dong Xu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accept at TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.12091 2020-11-25 cs.CV cs.AI cs.LG cs.MM 67%

SEA: Sentence Encoder Assembly for Video Retrieval by Textual Queries

Xirong Li, Fangming Zhou, Chaoxi Xu, Jiaqi Ji, Gang Yang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments accepted for publication as a REGULAR paper in the IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.00597 2020-11-03 cs.CV cs.AI cs.CL cs.LG 67%

COOT: Cooperative Hierarchical Transformer for Video-Text Representation Learning

Simon Ging, Mohammadreza Zolfaghari, Hamed Pirsiavash, Thomas Brox

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 27 pages, 5 figures, 19 tables. To be published in the 34th conference on Neural Information Processing Systems (NeurIPS 2020). The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.07999 2020-10-19 cs.CL cs.AI cs.CV 67%

What is More Likely to Happen Next? Video-and-Language Future Event Prediction

Jie Lei, Licheng Yu, Tamara L. Berg, Mohit Bansal

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments EMNLP 2020 (17 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.00544 2020-08-04 cs.CL cs.AI cs.CV cs.LG 67%

Video Question Answering on Screencast Tutorials

Wentian Zhao, Seokhwan Kim, Ning Xu, Hailin Jin

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.11668 2020-07-24 cs.CL cs.AI cs.CV cs.RO 67%

Analogical Reasoning for Visually Grounded Language Acquisition

Bo Wu, Haoyu Qin, Alireza Zareian, Carl Vondrick, Shih-Fu Chang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.11618 2020-03-27 cs.CV cs.AI cs.CL 67%

VIOLIN: A Large-Scale Dataset for Video-and-Language Inference

Jingzhou Liu, Wenhu Chen, Yu Cheng, Zhe Gan, Licheng Yu, Yiming Yang, Jingjing Liu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to CVPR2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.04560 2018-10-18 cs.CL cs.AI cs.CV 67%

Game-Based Video-Context Dialogue

Ramakanth Pasunuru, Mohit Bansal

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments EMNLP 2018 (14 pages) (fixed Table5 typo in v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.01665 2018-07-27 cs.CV cs.MM cs.SD eess.AS 67%

Learning to Separate Object Sounds by Watching Unlabeled Video

Ruohan Gao, Rogerio Feris, Kristen Grauman

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Published in ECCV 2018; Project Page: http://vision.cs.utexas.edu/projects/separating_object_sounds/

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.08079 2016-04-06 cs.CV cs.AI cs.CL 67%

Do You See What I Mean? Visual Resolution of Linguistic Ambiguities

Yevgeni Berzak, Andrei Barbu, Daniel Harari, Boris Katz, Shimon Ullman

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments EMNLP 2015

Journal ref Conference on Empirical Methods in Natural Language Processing (EMNLP), 2015, pages 1477--1487

详情

展开后加载摘要…

URL PDF HTML 收藏