arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4728 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4728 篇

2407.15023 2024-09-18 cs.CV cs.AI cs.NI 62%

ViT LoS V2X: Vision Transformers for Environment-aware LoS Blockage Prediction for 6G Vehicular Networks

Ghazi Gharsallah, Georges Kaddoum

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02261 2024-09-05 cs.CV cs.AI 62%

Action-Based ADHD Diagnosis in Video

Yichun Li, Yuxing Yang, Syed Nohsen Naqvi

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 31st European Symposium on Artificial Neural Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00997 2024-09-04 cs.CV cs.AI 62%

RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation

Yonglin Li, Jing Zhang, Xiao Teng, Long Lan, Xinwang Liu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16272 2024-08-30 cs.CV cs.AI 62%

Beyond Uncertainty: Evidential Deep Learning for Robust Video Temporal Grounding

Kaijing Ma, Haojian Huang, Jin Chen, Haodong Chen, Pengliang Ji, Xianghao Zang, Han Fang, Chao Ban, Hao Sun, Mulin Chen, Xuelong Li

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Ongoing work: 28pages, 19 figures, 7 tables. Code is available at: https://kaijing.space/SRAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12972 2024-08-30 cs.CV cs.AI cs.LG eess.IV 62%

On the Efficacy of Text-Based Input Modalities for Action Anticipation

Apoorva Beedu, Harish Haresamudram, Karan Samel, Irfan Essa

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01669 2024-08-20 cs.CV cs.MM 62%

SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses

Chaolei Tan, Zihang Lin, Junfu Pu, Zhongang Qi, Wei-Yi Pei, Zhi Qu, Yexin Wang, Ying Shan, Wei-Shi Zheng, Jian-Fang Hu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Accepted to ACM MM 2024. Project page: https://synopground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05060 2024-08-12 cs.CV cs.AI 62%

DeVAn: Dense Video Annotation for Video-Language Models

Tingkai Liu, Yunzhe Tao, Haogeng Liu, Qihang Fan, Ding Zhou, Huaibo Huang, Ran He, Hongxia Yang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Published in 62nd ACL (2024) Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08389 2024-08-09 cs.CV cs.MM 62%

Edit As You Wish: Video Caption Editing with Multi-grained User Control

Linli Yao, Yuanmeng Zhang, Ziheng Wang, Xinglin Hou, Tiezheng Ge, Yuning Jiang, Xu Sun, Qin Jin

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00768 2024-08-05 cs.CV cs.AI 62%

Comparing Optical Flow and Deep Learning to Enable Computationally Efficient Traffic Event Detection with Space-Filling Curves

Tayssir Bouraffa, Elias Kjellberg Carlson, Erik Wessman, Ali Nouri, Pierre Lamart, Christian Berger

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 27th IEEE International Conference on Intelligent Transportation Systems (IEEE ITSC 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15754 2024-07-23 cs.CV cs.CL cs.LG 62%

LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding

Haoning Wu, Dongxu Li, Bei Chen, Junnan Li

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02411 2024-07-04 cs.CV cs.CR cs.MM 62%

Video Watermarking: Safeguarding Your Video from (Unauthorized) Annotations by Video-based LLMs

Jinmin Li, Kuofeng Gao, Yang Bai, Jingyun Zhang, Shu-Tao Xia

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments arXiv admin note: substantial text overlap with arXiv:2403.13507

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19255 2024-06-28 cs.CV cs.CL 62%

Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment

Hao Fei, Shengqiong Wu, Meishan Zhang, Min Zhang, Tat-Seng Chua, Shuicheng Yan

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by IEEE TPAMI 2024

Journal ref [J].IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14105 2024-06-25 cs.CV cs.AI 62%

Unified and Dynamic Graph for Temporal Character Grouping in Long Videos

Xiujun Shu, Wei Wen, Liangsheng Xu, Ruizhi Qiao, Taian Guo, Hanjun Li, Bei Gan, Xiao Wang, Xing Sun

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13809 2024-06-21 cs.MM cs.CV cs.IR 62%

Towards Holistic Language-video Representation: the language model-enhanced MSR-Video to Text Dataset

Yuchen Yang, Yingxuan Duan

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10923 2024-06-18 cs.CV cs.CL cs.LG 62%

Investigating Video Reasoning Capability of Large Language Models with Tropes in Movies

Hung-Ting Su, Chun-Tong Chao, Ya-Ching Hsu, Xudong Lin, Yulei Niu, Hung-Yi Lee, Winston H. Hsu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Project page: https://ander1119.github.io/TiM

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09646 2024-06-17 cs.CV cs.AI 62%

A Survey of Video Datasets for Grounded Event Understanding

Kate Sanders, Benjamin Van Durme

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02962 2024-06-06 cs.CL cs.AI cs.IR 62%

Docs2KG: Unified Knowledge Graph Construction from Heterogeneous Documents Assisted by Large Language Models

Qiang Sun, Yuanyi Luo, Wenxiao Zhang, Sirui Li, Jichunyang Li, Kai Niu, Xiangrui Kong, Wei Liu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01256 2024-06-04 cs.CV cs.AI 62%

Augmented Commonsense Knowledge for Remote Object Grounding

Bahram Mohammadi, Yicong Hong, Yuankai Qi, Qi Wu, Shirui Pan, Javen Qinfeng Shi

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13611 2024-06-04 cs.CV cs.CL 62%

Video sentence grounding with temporally global textual knowledge

Cai Chen, Runzhong Zhang, Jianjun Gao, Kejun Wu, Kim-Hui Yap, Yi Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12540 2024-05-22 cs.CV cs.MM 62%

Context-Enhanced Video Moment Retrieval with Large Language Models

Weijia Liu, Bo Miao, Jiuxin Cao, Xuelin Zhu, Bo Liu, Mehwish Nasim, Ajmal Mian

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07759 2024-05-21 cs.MM cs.AI cs.NI eess.IV 62%

MADRL-Based Rate Adaptation for 360° Video Streaming with Multi-Viewpoint Prediction

Haopeng Wang, Zijian Long, Haiwei Dong, Abdulmotaleb El Saddik

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI、cs.MM

Comments Accepted by IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18174 2024-04-30 cs.CV cs.AI 62%

Mamba-FETrack: Frame-Event Tracking via State Space Model

Ju Huang, Shiao Wang, Shuai Wang, Zhe Wu, Xiao Wang, Bo Jiang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments In Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15719 2024-04-26 cs.CV cs.AI 62%

HDBN: A Novel Hybrid Dual-branch Network for Robust Skeleton-based Action Recognition

Jinfu Liu, Baiqiao Yin, Jiaying Lin, Jiajun Wen, Yue Li, Mengyuan Liu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12782 2024-04-22 cs.CV cs.AI 62%

Sentiment-oriented Transformer-based Variational Autoencoder Network for Live Video Commenting

Fengyi Fu, Shancheng Fang, Weidong Chen, Zhendong Mao

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 27 pages, 10 figures, ACM Transactions on Multimedia Computing, Communications and Applications, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09055 2024-04-16 cs.CV cs.AI 62%

Comment-aided Video-Language Alignment via Contrastive Pre-training for Short-form Video Humor Detection

Yang Liu, Tongfei Shen, Dong Zhang, Qingying Sun, Shoushan Li, Guodong Zhou

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICMR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19046 2024-03-29 cs.CV cs.AI 62%

LITA: Language Instructed Temporal-Localization Assistant

De-An Huang, Shijia Liao, Subhashree Radhakrishnan, Hongxu Yin, Pavlo Molchanov, Zhiding Yu, Jan Kautz

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.04132 2024-03-26 q-bio.NC cs.AI cs.CV cs.RO 62%

A Number Sense as an Emergent Property of the Manipulating Brain

Neehar Kondapaneni, Pietro Perona

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 16 pages, 5 figures, 15 supplemental figures

Journal ref Scientific reports, 14(6858) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14870 2024-03-25 cs.CV cs.CL cs.LG 62%

VidLA: Video-Language Alignment at Scale

Mamshad Nayeem Rizve, Fan Fei, Jayakrishnan Unnikrishnan, Son Tran, Benjamin Z. Yao, Belinda Zeng, Mubarak Shah, Trishul Chilimbi

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10900 2024-03-19 cs.CV cs.AI 62%

MotionGPT: Finetuned LLMs Are General-Purpose Motion Generators

Yaqi Zhang, Di Huang, Bin Liu, Shixiang Tang, Yan Lu, Lu Chen, Lei Bai, Qi Chu, Nenghai Yu, Wanli Ouyang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 18 pages, 8 figures, accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07944 2024-03-14 cs.CV cs.AI 62%

WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs

Deshun Yang, Luhui Hu, Yu Tian, Zihao Li, Chris Kelly, Bang Yang, Cindy Yang, Yuexian Zou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏