arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2404.02257 2024-04-08 cs.CV 57%

SnAG: Scalable and Accurate Video Grounding

Fangzhou Mu, Sicheng Mo, Yin Li

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Code available at https://github.com/fmu2/snag_release

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08046 2024-04-08 cs.CV 57%

Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding

Peng Jin, Ryuichi Takanobu, Wancai Zhang, Xiaochun Cao, Li Yuan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by CVPR 2024 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02345 2024-04-04 cs.CV 57%

GaitSTR: Gait Recognition with Sequential Two-stream Refinement

Wanrong Zheng, Haidong Zhu, Zhaoheng Zheng, Ram Nevatia

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01945 2024-04-03 cs.CV 57%

Event-assisted Low-Light Video Object Segmentation

Hebei Li, Jin Wang, Jiahui Yuan, Yue Li, Wenming Weng, Yansong Peng, Yueyi Zhang, Zhiwei Xiong, Xiaoyan Sun

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01571 2024-04-03 cs.CV cs.RO 57%

Leveraging YOLO-World and GPT-4V LMMs for Zero-Shot Person Detection and Action Recognition in Drone Imagery

Christian Limberg, Artur Gonçalves, Bastien Rigault, Helmut Prendinger

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09648 2024-04-03 cs.CL 57%

Event Causality Is Key to Computational Story Understanding

Yidan Sun, Qin Chao, Boyang Li

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04948 2024-04-03 cs.LG cs.CL 57%

TEMPO: Prompt-based Generative Pre-trained Transformer for Time Series Forecasting

Defu Cao, Furong Jia, Sercan O Arik, Tomas Pfister, Yixiang Zheng, Wen Ye, Yan Liu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL

Comments Accepted by ICLR 2024. Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01014 2024-04-02 cs.CV 57%

Harnessing Large Language Models for Training-free Video Anomaly Detection

Luca Zanella, Willi Menapace, Massimiliano Mancini, Yiming Wang, Elisa Ricci

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments CVPR 2024. Project website at https://lucazanella.github.io/lavad/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00983 2024-04-02 cs.LG cs.AI 57%

Continual Learning for Smart City: A Survey

Li Yang, Zhipeng Luo, Shiming Zhang, Fei Teng, Tianrui Li

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments Preprint. Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19975 2024-04-01 cs.CV 57%

Context-Aware Integration of Language and Visual References for Natural Language Tracking

Yanyan Shao, Shuting He, Qi Ye, Yuchao Feng, Wenhan Luo, Jiming Chen

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15851 2024-04-01 cs.CV 57%

Single-Model and Any-Modality for Video Object Tracking

Zongwei Wu, Jilai Zheng, Xiangxuan Ren, Florin-Alexandru Vasluianu, Chao Ma, Danda Pani Paudel, Luc Van Gool, Radu Timofte

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02560 2024-04-01 cs.CV 57%

VicTR: Video-conditioned Text Representations for Activity Recognition

Kumara Kahatapitiya, Anurag Arnab, Arsha Nagrani, Michael S. Ryoo

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

Comments To appear at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14449 2024-04-01 cs.RO cs.MM 57%

Bringing Robots Home: The Rise of AI Robots in Consumer Electronics

Haiwei Dong, Yang Liu, Ted Chu, Abdulmotaleb El Saddik

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

Comments Accepted by IEEE Consumer Electronics Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17693 2024-03-27 cs.HC cs.AI 57%

ExpressEdit: Video Editing with Natural Language and Sketching

Bekzat Tilekbay, Saelyne Yang, Michal Lewkowicz, Alex Suryapranata, Juho Kim

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments 22 pages, 5 figures, to be published in ACM IUI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.05997 2024-03-26 cs.CV 57%

Exploiting Auxiliary Caption for Video Grounding

Hongxiang Li, Meng Cao, Xuxin Cheng, Zhihong Zhu, Yaowei Li, Yuexian Zou

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13261 2024-03-22 cs.CV 57%

Self-Supervised Class-Agnostic Motion Prediction with Spatial and Temporal Consistency Regularizations

Kewei Wang, Yizheng Wu, Jun Cen, Zhiyu Pan, Xingyi Li, Zhe Wang, Zhiguo Cao, Guosheng Lin

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12534 2024-03-20 cs.CV 57%

ExACT: Language-guided Conceptual Reasoning and Uncertainty Estimation for Event-based Action Recognition and More

Jiazhou Zhou, Xu Zheng, Yuanhuiyi Lyu, Lin Wang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06977 2024-03-13 cs.CV 57%

VideoMamba: State Space Model for Efficient Video Understanding

Kunchang Li, Xinhao Li, Yi Wang, Yinan He, Yali Wang, Limin Wang, Yu Qiao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments 19 Pages, 7 Figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11918 2024-03-07 cs.CV 57%

PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation

Liuyi Wang, Chengju Liu, Zongtao He, Shu Li, Qingqing Yan, Huiyi Chen, Qijun Chen

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments 15 pages, 11 figures

Journal ref [J]. Engineering Applications of Artificial Intelligence, 2024, 128: 107487

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01411 2024-03-05 cs.CL 57%

OVEL: Large Language Model as Memory Manager for Online Video Entity Linking

Haiquan Zhao, Xuwu Wang, Shisong Chen, Zhixu Li, Xin Zheng, Yanghua Xiao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19405 2024-03-05 cs.CV 57%

Navigating Hallucinations for Reasoning of Unintentional Activities

Shresth Grover, Vibhav Vineet, Yogesh S Rawat

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18751 2024-03-01 cs.LG cs.CV 57%

Multi-Sensor and Multi-temporal High-Throughput Phenotyping for Monitoring and Early Detection of Water-Limiting Stress in Soybean

Sarah E. Jones, Timilehin Ayanlade, Benjamin Fallen, Talukder Z. Jubery, Arti Singh, Baskar Ganapathysubramanian, Soumik Sarkar, Asheesh K. Singh

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13888 2024-02-29 cs.CV 57%

Knowledge Guided Entity-aware Video Captioning and A Basketball Benchmark

Zeyu Xi, Ge Shi, Xuefen Li, Junchi Yan, Zun Li, Lifang Wu, Zilin Liu, Liang Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17171 2024-02-28 cs.CV 57%

LiveHPS: LiDAR-based Scene-level Human Pose and Shape Estimation in Free Environment

Yiming Ren, Xiao Han, Chengfeng Zhao, Jingya Wang, Lan Xu, Jingyi Yu, Yuexin Ma

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16230 2024-02-27 cs.LG cs.AI 57%

GARNN: An Interpretable Graph Attentive Recurrent Neural Network for Predicting Blood Glucose Levels via Multivariate Time Series

Chengzhe Piao, Taiyu Zhu, Stephanie E Baldeweg, Paul Taylor, Pantelis Georgiou, Jiahao Sun, Jun Wang, Kezhi Li

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.03151 2024-02-20 cs.CV 57%

Full-Duplex Strategy for Video Object Segmentation

Ge-Peng Ji, Deng-Ping Fan, Keren Fu, Zhe Wu, Jianbing Shen, Ling Shao

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted at ICCV-2021 (Journal Submission). Project Page: http://dpfan.net/FSNet/

Journal ref Comp. Visual Media 9, 155-175 (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06806 2024-02-15 cs.HC cs.MM 57%

Anchorage: Visual Analysis of Satisfaction in Customer Service Videos via Anchor Events

Kam Kwai Wong, Xingbo Wang, Yong Wang, Jianben He, Rong Zhang, Huamin Qu

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

Comments 13 pages. A preprint version of a publication at IEEE Transactions on Visualization and Computer Graphics (TVCG), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05737 2024-02-13 cs.RO cs.CV cs.LG 57%

Follow Anything: Open-set detection, tracking, and following in real-time

Alaa Maalouf, Ninad Jadhav, Krishna Murthy Jatavallabhula, Makram Chahine, Daniel M. Vogt, Robert J. Wood, Antonio Torralba, Daniela Rus

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Project webpage: https://github.com/alaamaalouf/FollowAnything Explainer video: https://www.youtube.com/watch?v=6Mgt3EPytrw

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03241 2024-02-06 cs.CV cs.LG 57%

FROSTER: Frozen CLIP Is A Strong Teacher for Open-Vocabulary Action Recognition

Xiaohu Huang, Hao Zhou, Kun Yao, Kai Han

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17217 2024-02-01 cs.HC cs.CV 57%

GazeGPT: Augmenting Human Capabilities using Gaze-contingent Contextual AI for Smart Eyewear

Robert Konrad, Nitish Padmanaban, J. Gabriel Buckmaster, Kevin C. Boyle, Gordon Wetzstein

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Project video: https://youtu.be/AuDFHHTK_m8

详情

展开后加载摘要…

URL PDF HTML 收藏