arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4728 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4728 篇

2307.12545 2024-02-29 cs.CV cs.AI 62%

Towards Video Anomaly Retrieval from Video Anomaly Detection: New Benchmarks and Model

Peng Wu, Jing Liu, Xiangteng He, Yuxin Peng, Peng Wang, Yanning Zhang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments This work has been accepted to the IEEE TIP. Copyright has been transferred

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12079 2024-02-20 cs.CV cs.CL 62%

LVCHAT: Facilitating Long Video Comprehension

Yu Wang, Zeyuan Zhang, Julian McAuley, Zexue He

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 17 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03413 2024-02-07 cs.MM cs.CV eess.IV 62%

Perceptual Video Quality Assessment: A Survey

Xiongkuo Min, Huiyu Duan, Wei Sun, Yucheng Zhu, Guangtao Zhai

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17343 2024-02-01 cs.CV cs.AI 62%

YTCommentQA: Video Question Answerability in Instructional Videos

Saelyne Yang, Sunghyun Park, Yunseok Jang, Moontae Lee

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17151 2024-01-31 cs.MM cs.CV 62%

An Open Software Suite for Event-Based Video

Andrew C. Freeman

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14856 2024-01-29 cs.CV cs.AI 62%

Memory-Inspired Temporal Prompt Interaction for Text-Image Classification

Xinyao Yu, Hao Sun, Ziwei Niu, Rui Qin, Zhenjia Bai, Yen-Wei Chen, Lanfen Lin

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00496 2024-01-25 cs.CV cs.AI cs.LG 62%

SAR-RARP50: Segmentation of surgical instrumentation and Action Recognition on Robot-Assisted Radical Prostatectomy Challenge

Dimitrios Psychogyios, Emanuele Colleoni, Beatrice Van Amsterdam, Chih-Yang Li, Shu-Yu Huang, Yuchong Li, Fucang Jia, Baosheng Zou, Guotai Wang, Yang Liu, Maxence Boels, Jiayu Huo, Rachel Sparks, Prokar Dasgupta, Alejandro Granados, Sebastien Ourselin, Mengya Xu, An Wang, Yanan Wu, Long Bai, Hongliang Ren, Atsushi Yamada, Yuriko Harai, Yuto Ishikawa, Kazuyuki Hayashi, Jente Simoens, Pieter DeBacker, Francesco Cisternino, Gabriele Furnari, Alex Mottrie, Federica Ferraguti, Satoshi Kondo, Satoshi Kasai, Kousuke Hirasawa, Soohee Kim, Seung Hyun Lee, Kyu Eun Lee, Hyoun-Joong Kong, Kui Fu, Chao Li, Shan An, Stefanie Krell, Sebastian Bodenstedt, Nicolas Ayobi, Alejandra Perez, Santiago Rodriguez, Juanita Puentes, Pablo Arbelaez, Omid Mohareri, Danail Stoyanov

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01852 2024-01-23 cs.CV cs.AI 62%

LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment

Bin Zhu, Bin Lin, Munan Ning, Yang Yan, Jiaxi Cui, HongFa Wang, Yatian Pang, Wenhao Jiang, Junwu Zhang, Zongwei Li, Wancai Zhang, Zhifeng Li, Wei Liu, Li Yuan

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17212 2024-01-19 cs.CV cs.AI 62%

Affective Video Content Analysis: Decade Review and New Perspectives

Junxiao Xue, Jie Wang, Xuecheng Wu, Qian Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11650 2024-01-10 cs.IR cs.CV cs.MM 62%

VKIE: The Application of Key Information Extraction on Video Text

Siyu An, Ye Liu, Haoyuan Peng, Di Yin

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03901 2024-01-09 cs.CV cs.CL 62%

STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering

Yueqian Wang, Yuxuan Wang, Kai Chen, Dongyan Zhao

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments To appear in AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11467 2024-01-04 cs.CV cs.AI 62%

SkateboardAI: The Coolest Video Action Recognition for Skateboarding

Hanxiao Chen

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments The original first-author work has been accepted and presented by CVPR 2022 WiCV Workshop (This is the long-version paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16933 2023-12-29 cs.CV cs.AI 62%

EvPlug: Learn a Plug-and-Play Module for Event and Image Fusion

Jianping Jiang, Xinyu Zhou, Peiqi Duan, Boxin Shi

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07207 2023-12-21 cs.CV cs.CL 62%

Beyond Grounding: Extracting Fine-Grained Event Hierarchies Across Modalities

Hammad A. Ayyubi, Christopher Thomas, Lovish Chum, Rahul Lokesh, Long Chen, Yulei Niu, Xudong Lin, Xuande Feng, Jaywon Koo, Sounak Ray, Shih-Fu Chang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09627 2023-12-18 cs.CV cs.IR cs.LG cs.MM 62%

TF-CLIP: Learning Text-free CLIP for Video-based Person Re-Identification

Chenyang Yu, Xuehu Liu, Yingquan Wang, Pingping Zhang, Huchuan Lu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

Comments This work is accepted by AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13859 2023-12-18 cs.CL cs.CV 62%

Not all Fake News is Written: A Dataset and Analysis of Misleading Video Headlines

Yoo Yeon Sung, Jordan Boyd-Graber, Naeemul Hassan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments EMNLP 2023 Main Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13435 2023-12-14 cs.CV cs.AI 62%

PG-Video-LLaVA: Pixel Grounding Large Video-Language Models

Shehan Munasinghe, Rusiru Thushara, Muhammad Maaz, Hanoona Abdul Rasheed, Salman Khan, Mubarak Shah, Fahad Khan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06330 2023-12-12 cs.CV cs.AI cs.RO eess.IV 62%

Navigating Open Set Scenarios for Skeleton-based Action Recognition

Kunyu Peng, Cheng Yin, Junwei Zheng, Ruiping Liu, David Schneider, Jiaming Zhang, Kailun Yang, M. Saquib Sarfraz, Rainer Stiefelhagen, Alina Roitberg

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to AAAI 2024. The benchmark, code, and models will be released at https://github.com/KPeng9510/OS-SAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12919 2023-12-05 cs.CV cs.AI 62%

SPOT! Revisiting Video-Language Models for Event Understanding

Gengyuan Zhang, Jinhe Bi, Jindong Gu, Yanyu Chen, Volker Tresp

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13925 2023-12-05 cs.CV cs.AI 62%

Towards Surveillance Video-and-Language Understanding: New Dataset, Baselines, and Challenges

Tongtong Yuan, Xuange Zhang, Kun Liu, Bo Liu, Chen Chen, Jian Jin, Zhenzhen Jiao

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18241 2023-12-01 cs.CV cs.AI 62%

LLVMs4Protest: Harnessing the Power of Large Language and Vision Models for Deciphering Protests in the News

Yongjun Zhang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04512 2023-11-09 cs.CV cs.AI 62%

FFINet: Future Feedback Interaction Network for Motion Forecasting

Miao Kang, Shengqi Wang, Sanping Zhou, Ke Ye, Jingjing Jiang, Nanning Zheng

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02863 2023-11-07 cs.CV cs.AI 62%

Temporal Shift -- Multi-Objective Loss Function for Improved Anomaly Fall Detection

Stefan Denkovski, Shehroz S. Khan, Alex Mihailidis

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01233 2023-11-03 cs.CV cs.AI 62%

Long Story Short: a Summarize-then-Search Method for Long Video Question Answering

Jiwan Chung, Youngjae Yu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Published in BMVC 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16402 2023-10-26 cs.CV cs.CL 62%

Video Referring Expression Comprehension via Transformer with Content-conditioned Query

Ji Jiang, Meng Cao, Tengtao Song, Long Chen, Yi Wang, Yuexian Zou

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted to ACM International Conference on Multimedia Workshop (ACM MM), 2023. arXiv admin note: substantial text overlap with arXiv:2210.02953

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10683 2023-10-24 cs.CV cs.CL 62%

Paxion: Patching Action Knowledge in Video-Language Foundation Models

Zhenhailong Wang, Ansel Blume, Sha Li, Genglin Liu, Jaemin Cho, Zineng Tang, Mohit Bansal, Heng Ji

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments NeurIPS 2023 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05765 2023-10-10 cs.CL cs.CV 62%

Information-Theoretic Text Hallucination Reduction for Video-grounded Dialogue

Sunjae Yoon, Eunseop Yoon, Hee Suk Yoon, Junyeong Kim, Chang D. Yoo

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments 12 pages, Accepted in EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05423 2023-09-27 cs.CV cs.CL 62%

Learning to Locate Visual Answer in Video Corpus Using Question

Bin Li, Yixuan Weng, Bin Sun, Shutao Li

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.03335 2023-09-19 cs.CL cs.AI cs.IR cs.LG 62%

DeepKE: A Deep Learning Based Knowledge Extraction Toolkit for Knowledge Base Population

Ningyu Zhang, Xin Xu, Liankuan Tao, Haiyang Yu, Hongbin Ye, Shuofei Qiao, Xin Xie, Xiang Chen, Zhoubo Li, Lei Li, Xiaozhuan Liang, Yunzhi Yao, Shumin Deng, Peng Wang, Wen Zhang, Zhenru Zhang, Chuanqi Tan, Qiang Chen, Feiyu Xiong, Fei Huang, Guozhou Zheng, Huajun Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2022 System Demonstrations and the project website is http://deepke.zjukg.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09179 2023-08-29 cs.CV cs.AI 62%

Pretrained Language Models as Visual Planners for Human Assistance

Dhruvesh Patel, Hamid Eghbalzadeh, Nitin Kamra, Michael Louis Iuzzolino, Unnat Jain, Ruta Desai

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏