arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4726 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4726 篇

2311.06217 2024-07-08 cs.LG cs.AI cs.CL cs.CV cs.MM 70%

MultiIoT: Benchmarking Machine Learning for the Internet of Things

Shentong Mo, Louis-Philippe Morency, Russ Salakhutdinov, Paul Pu Liang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08085 2024-07-02 cs.CV 70%

Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams

Haoji Zhang, Yiqin Wang, Yansong Tang, Yong Liu, Jiashi Feng, Jifeng Dai, Xiaojie Jin

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04842 2024-06-10 cs.CV 70%

3rd Place Solution for MeViS Track in CVPR 2024 PVUW workshop: Motion Expression guided Video Segmentation

Feiyu Pan, Hao Fang, Xiankai Lu

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01791 2024-06-05 cs.CV 70%

Hybrid-Learning Video Moment Retrieval across Multi-Domain Labels

Weitong Cai, Jiabo Huang, Shaogang Gong

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by BMVC2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15960 2024-05-28 cs.HC cs.AI 70%

Human-Centered Automation

Carlos Toxtli

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.AI

Comments 12 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07202 2024-05-14 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 70%

Unified Video-Language Pre-training with Synchronized Audio

Shentong Mo, Haofan Wang, Huaxia Li, Xu Tang

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14687 2024-04-24 cs.MM cs.AI cs.CL cs.CV 70%

Pegasus-v1 Technical Report

Raehyuk Jung, Hyojun Go, Jaehyuk Yi, Jiho Jang, Daniel Kim, Jay Suh, Aiden Lee, Cooper Han, Jae Lee, Jeff Kim, Jin-Young Kim, Junwan Kim, Kyle Park, Lucas Lee, Mars Ha, Minjoon Seo, Abraham Jo, Ed Park, Hassan Kianinejad, SJ Kim, Tony Moon, Wade Jeong, Andrei Popescu, Esther Kim, EK Yoon, Genie Heo, Henry Choi, Jenna Kang, Kevin Han, Noah Seo, Sunny Nguyen, Ryan Won, Yeonhoo Park, Anthony Giuliani, Dave Chung, Hans Yoon, James Le, Jenny Ahn, June Lee, Maninder Saini, Meredith Sanders, Soyoung Lee, Sue Kim, Travis Couture

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04192 2024-04-02 cs.CV cs.AI cs.CL cs.MM 70%

Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models

Wei Han, Hui Chen, Min-Yen Kan, Soujanya Poria

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 13 pages, 7 figures, accepted to Findings of NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13678 2024-03-21 cs.CV 70%

AUD-TGN: Advancing Action Unit Detection with Temporal Convolution and GPT-2 in Wild Audiovisual Contexts

Jun Yu, Zerui Zhang, Zhihong Wei, Gongpeng Zhao, Zhongpeng Cai, Yongqi Wang, Guochen Xie, Jichao Zhu, Wangyuan Zhu

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07432 2024-03-13 cs.CV 70%

Bring Event into RGB and LiDAR: Hierarchical Visual-Motion Fusion for Scene Flow

Hanyu Zhou, Yi Chang, Zhiwei Shi, Luxin Yan

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16058 2024-03-12 cs.CV 70%

Unmasked Teacher: Towards Training-Efficient Video Foundation Models

Kunchang Li, Yali Wang, Yizhuo Li, Yi Wang, Yinan He, Limin Wang, Yu Qiao

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15071 2024-01-30 cs.CV 70%

From GPT-4 to Gemini and Beyond: Assessing the Landscape of MLLMs on Generalizability, Trustworthiness and Causality through Four Modalities

Chaochao Lu, Chen Qian, Guodong Zheng, Hongxing Fan, Hongzhi Gao, Jie Zhang, Jing Shao, Jingyi Deng, Jinlan Fu, Kexin Huang, Kunchang Li, Lijun Li, Limin Wang, Lu Sheng, Meiqi Chen, Ming Zhang, Qibing Ren, Sirui Chen, Tao Gui, Wanli Ouyang, Yali Wang, Yan Teng, Yaru Wang, Yi Wang, Yinan He, Yingchun Wang, Yixu Wang, Yongting Zhang, Yu Qiao, Yujiong Shen, Yurong Mou, Yuxi Chen, Zaibin Zhang, Zhelun Shi, Zhenfei Yin, Zhipin Wang

专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10254 2024-01-22 cs.CV cs.LG 70%

Beyond the Frame: Single and mutilple video summarization method with user-defined length

Vahid Ahmadi Kalkhorani, Qingquan Zhang, Guanqun Song, Ting Zhu

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01244 2024-01-03 cs.CV 70%

Temporal Adaptive RGBT Tracking with Modality Prompt

Hongyu Wang, Xiaotao Liu, Yifan Li, Meng Sun, Dian Yuan, Jing Liu

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17859 2023-12-08 cs.CV 70%

MapFormer: Boosting Change Detection by Using Pre-change Information

Maximilian Bernhard, Niklas Strauß, Matthias Schubert

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments accepted at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02226 2023-12-06 cs.CV 70%

Generating Action-conditioned Prompts for Open-vocabulary Video Action Recognition

Chengyou Jia, Minnan Luo, Xiaojun Chang, Zhuohang Dang, Mingfei Han, Mengmeng Wang, Guang Dai, Sizhe Dang, Jingdong Wang

专题命中 视频多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18445 2023-12-01 cs.CV 70%

VTimeLLM: Empower LLM to Grasp Video Moments

Bin Huang, Xin Wang, Hong Chen, Zihan Song, Wenwu Zhu

专题命中 视频多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17267 2023-11-30 cs.CV 70%

E-ViLM: Efficient Video-Language Model via Masked Video Modeling with Semantic Vector-Quantized Tokenizer

Jacob Zhiyuan Fang, Skyler Zheng, Vasu Sharma, Robinson Piramuthu

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.10238 2023-10-10 cs.CV 70%

VLANet: Video-Language Alignment Network for Weakly-Supervised Video Moment Retrieval

Minuk Ma, Sunjae Yoon, Junyeong Kim, Youngjoon Lee, Sunghun Kang, Chang D. Yoo

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 16 pages, 6 figures, European Conference on Computer Vision, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00536 2023-09-19 cs.CV 70%

Bidirectional Correlation-Driven Inter-Frame Interaction Transformer for Referring Video Object Segmentation

Meng Lan, Fu Rong, Zuchao Li, Wei Yu, Lefei Zhang

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03990 2023-07-11 cs.CV 70%

FTFDNet: Learning to Detect Talking Face Video Manipulation with Tri-Modality Interaction

Ganglai Wang, Peng Zhang, Junwen Xiong, Feihan Yang, Wei Huang, Yufei Zha

专题命中 视频多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2203.05178

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11732 2023-06-21 cs.CV 70%

Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models

Junting Pan, Ziyi Lin, Yuying Ge, Xiatian Zhu, Renrui Zhang, Yi Wang, Yu Qiao, Hongsheng Li

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17011 2023-05-29 cs.CV 70%

SOC: Semantic-Assisted Object Cluster for Referring Video Object Segmentation

Zhuoyan Luo, Yicheng Xiao, Yong Liu, Shuyan Li, Yitong Wang, Yansong Tang, Xiu Li, Yujiu Yang

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13167 2023-05-23 cs.CV 70%

VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending

Xingjian He, Sihan Chen, Fan Ma, Zhicheng Huang, Xiaojie Jin, Zikang Liu, Dongmei Fu, Yi Yang, Jing Liu, Jiashi Feng

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04824 2023-05-09 cs.CL 70%

Learning Summary-Worthy Visual Representation for Abstractive Summarization in Video

Zenan Xu, Xiaojun Meng, Yasheng Wang, Qinliang Su, Zexuan Qiu, Xin Jiang, Qun Liu

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL

Comments Accepted by IJCAI-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.08071 2023-04-26 cs.CV cs.AI cs.CL cs.MM 70%

Temporal Sentence Grounding in Videos: A Survey and Future Directions

Hao Zhang, Aixin Sun, Wei Jing, Joey Tianyi Zhou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12444 2023-02-27 cs.CV cs.AI cs.CL cs.MM 70%

Weakly-Supervised Temporal Article Grounding

Long Chen, Yulei Niu, Brian Chen, Xudong Lin, Guangxing Han, Christopher Thomas, Hammad Ayyubi, Heng Ji, Shih-Fu Chang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments EMNLP 2022, https://github.com/zjuchenlong/WSAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10813 2023-02-22 cs.CV 70%

Tracking Objects and Activities with Attention for Temporal Sentence Grounding

Zeyu Xiong, Daizong Liu, Pan Zhou, Jiahao Zhu

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments accepted by ICASSP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13163 2022-12-29 cs.CV 70%

MRTNet: Multi-Resolution Temporal Network for Video Sentence Grounding

Wei Ji, Long Chen, Yinwei Wei, Yiming Wu, Tat-Seng Chua

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10936 2022-12-05 cs.CV cs.AI cs.CL cs.CR cs.MM 70%

Watch Those Words: Video Falsification Detection Using Word-Conditioned Facial Motion

Shruti Agarwal, Liwen Hu, Evonne Ng, Trevor Darrell, Hao Li, Anna Rohrbach

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted in WACV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏