arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2408.06840 2024-08-15 cs.CV 57%

Dynamic and Compressive Adaptation of Transformers From Images to Videos

Guozhen Zhang, Jingyu Liu, Shengming Cao, Xiaotong Zhao, Kevin Zhao, Kai Ma, Limin Wang

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09805 2024-08-15 cs.CV cs.LG 57%

On the Utility of 3D Hand Poses for Action Recognition

Md Salman Shamil, Dibyadip Chatterjee, Fadime Sener, Shugao Ma, Angela Yao

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments ECCV 2024; https://s-shamil.github.io/HandFormer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05729 2024-08-13 cs.CV 57%

A Training-Free Framework for Video License Plate Tracking and Recognition with Only One-Shot

Haoxuan Ding, Qi Wang, Junyu Gao, Qiang Li

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.09804 2024-08-13 cs.CV 57%

Weighted Bayesian Gaussian Mixture Model for Roadside LiDAR Object Detection

Tianya Zhang, Yi Ge, Peter J. Jin

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments in IEEE Transactions on Intelligent Transportation Systems (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14883 2024-08-13 eess.SY cs.AI cs.NE cs.SY 57%

Inferring Ingrained Remote Information in AC Power Flows Using Neuromorphic Modality Regime

Xiaoguang Diao, Yubo Song, Subham Sahoo

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments The manuscript has been accepted for publication in the Proceedings of 2024 IEEE International Conference on Communications, Control, and Computing Technologies for Smart Grids (SmartGridComm 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03913 2024-08-08 cs.CV cs.LG 57%

AdapMTL: Adaptive Pruning Framework for Multitask Learning Model

Mingcan Xiang, Steven Jiaxun Tang, Qizheng Yang, Hui Guan, Tongping Liu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 13 pages, 9 figures, Published at ACM Multimedia (ACM MM) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03097 2024-08-07 cs.CV 57%

Prototype Learning for Micro-gesture Classification

Guoliang Chen, Fei Wang, Kun Li, Zhiliang Wu, Hehe Fan, Yi Yang, Meng Wang, Dan Guo

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments 1st Place in Micro-gesture Classification in MiGA at IJCAI-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09975 2024-08-07 cs.CV cs.RO eess.IV 57%

Skeleton-Based Human Action Recognition with Noisy Labels

Yi Xu, Kunyu Peng, Di Wen, Ruiping Liu, Junwei Zheng, Yufan Chen, Jiaming Zhang, Alina Roitberg, Kailun Yang, Rainer Stiefelhagen

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted to IROS 2024. The source code for this study is accessible at https://github.com/xuyizdby/NoiseEraSAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01370 2024-08-05 cs.CV cs.RO 57%

EVIT: Event-based Visual-Inertial Tracking in Semi-Dense Maps Using Windowed Nonlinear Optimization

Runze Yuan, Tao Liu, Zijia Dai, Yi-Fan Zuo, Laurent Kneip

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments 8 pages, 5 figures, 3 tables, International Conference on Intelligent Robots and Systems 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11857 2024-08-05 cs.CV cs.NE 57%

Accurate and Efficient Event-based Semantic Segmentation Using Adaptive Spiking Encoder-Decoder Network

Rui Zhang, Luziwei Leng, Kaiwei Che, Hu Zhang, Jie Cheng, Qinghai Guo, Jiangxing Liao, Ran Cheng

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted for publication in IEEE Transactions on Neural Networks and Learning Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00969 2024-08-05 cs.CV 57%

Visible-Thermal Multiple Object Tracking: Large-scale Video Dataset and Progressive Fusion Approach

Yabin Zhu, Qianwu Wang, Chenglong Li, Jin Tang, Zhixiang Huang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19456 2024-07-31 cs.MM 57%

An Inverse Partial Optimal Transport Framework for Music-guided Movie Trailer Generation

Yutong Wang, Sidan Zhu, Hongteng Xu, Dixin Luo

专题命中 视频多模态 :multi-modal(abstract);分类 cs.MM

Comments acmmm2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19528 2024-07-31 cs.HC cs.AI cs.CY 57%

Harnessing LLMs for Automated Video Content Analysis: An Exploratory Workflow of Short Videos on Depression

Jiaying Lizzy Liu, Yunlong Wang, Yao Lyu, Yiheng Su, Shuo Niu, Xuhai Orson Xu, Yan Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments 7 pages, 2 figures, accepted by CSCW 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11677 2024-07-25 cs.CV 57%

Video-Language Alignment via Spatio-Temporal Graph Transformer

Shi-Xue Zhang, Hongfa Wang, Xiaobin Zhu, Weibo Gu, Tianjin Zhang, Chun Yang, Wei Liu, Xu-Cheng Yin

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15295 2024-07-23 cs.CV cs.SE 57%

VideoGameBunny: Towards vision assistants for video games

Mohammad Reza Taesiri, Cor-Paul Bezemer

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14146 2024-07-22 cs.MM 57%

Fine-grained Knowledge Graph-driven Video-Language Learning for Action Recognition

Rui Zhang, Yafen Lu, Pengli Ji, Junxiao Xue, Xiaoran Yan

专题命中 视频多模态 :multi-modal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11325 2024-07-17 cs.CV 57%

VISA: Reasoning Video Object Segmentation via Large Language Models

Cilin Yan, Haochen Wang, Shilin Yan, Xiaolong Jiang, Yao Hu, Guoliang Kang, Weidi Xie, Efstratios Gavves

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09751 2024-07-16 cs.CV 57%

TASeg: Temporal Aggregation Network for LiDAR Semantic Segmentation

Xiaopei Wu, Yuenan Hou, Xiaoshui Huang, Binbin Lin, Tong He, Xinge Zhu, Yuexin Ma, Boxi Wu, Haifeng Liu, Deng Cai, Wanli Ouyang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09521 2024-07-16 cs.CV cs.NE 57%

Apprenticeship-Inspired Elegance: Synergistic Knowledge Distillation Empowers Spiking Neural Networks for Efficient Single-Eye Emotion Recognition

Yang Wang, Haiyang Mei, Qirui Bao, Ziqi Wei, Mike Zheng Shou, Haizhou Li, Bo Dong, Xin Yang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by IJCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07478 2024-07-11 cs.CV 57%

EA-VTR: Event-Aware Video-Text Retrieval

Zongyang Ma, Ziqi Zhang, Yuxin Chen, Zhongang Qi, Chunfeng Yuan, Bing Li, Yingmin Luo, Xu Li, Xiaojuan Qi, Ying Shan, Weiming Hu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07074 2024-07-11 cs.RO cs.CV cs.SC 57%

Hyperion -- A fast, versatile symbolic Gaussian Belief Propagation framework for Continuous-Time SLAM

David Hug, Ignacio Alzugaray, Margarita Chli

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments To be published in ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05518 2024-07-09 cs.CV 57%

Addressing single object tracking in satellite imagery through prompt-engineered solutions

Athena Psalta, Vasileios Tsironis, Andreas El Saer, Konstantinos Karantzalos

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted at the 2024 IEEE International Geoscience and Remote Sensing Symposium (IGARSS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08835 2024-07-08 cs.CV 57%

Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding

WonJun Moon, Sangeek Hyun, SuBeen Lee, Jae-Pil Heo

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments 29 pages, 15 figures, 14 tables, Code is available at https://github.com/wjun0830/CGDETR

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12636 2024-07-03 cs.CL 57%

StyleDubber: Towards Multi-Scale Style Learning for Movie Dubbing

Gaoxiang Cong, Yuankai Qi, Liang Li, Amin Beheshti, Zhedong Zhang, Anton van den Hengel, Ming-Hsuan Yang, Chenggang Yan, Qingming Huang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16852 2024-07-02 cs.CV 57%

Long Context Transfer from Language to Vision

Peiyuan Zhang, Kaichen Zhang, Bo Li, Guangtao Zeng, Jingkang Yang, Yuanhan Zhang, Ziyue Wang, Haoran Tan, Chunyuan Li, Ziwei Liu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Code, demo, and models are available at https://github.com/EvolvingLMMs-Lab/LongVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17309 2024-06-26 cs.CV 57%

Zero-Shot Long-Form Video Understanding through Screenplay

Yongliang Wu, Bozheng Li, Jiawang Cao, Wenbo Zhu, Yi Lu, Weiheng Chi, Chuyun Xie, Haolin Zheng, Ziyue Su, Jay Wu, Xu Yang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Highest Score Award to the CVPR'2024 LOVEU Track 1 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16338 2024-06-25 cs.CV 57%

VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models

Yuxuan Wang, Yueqian Wang, Dongyan Zhao, Cihang Xie, Zilong Zheng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14877 2024-06-24 cs.CL 57%

Sports Intelligence: Assessing the Sports Understanding Capabilities of Language Models through Question Answering from Text to Video

Zhengbang Yang, Haotian Xia, Jingxi Li, Zezhi Chen, Zhuangdi Zhu, Weining Shen

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11816 2024-06-18 cs.CV 57%

VideoLLM-online: Online Video Large Language Model for Streaming Video

Joya Chen, Zhaoyang Lv, Shiwei Wu, Kevin Qinghong Lin, Chenan Song, Difei Gao, Jia-Wei Liu, Ziteng Gao, Dongxing Mao, Mike Zheng Shou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2024. This arxiv version is upgraded with Llama-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11815 2024-06-18 cs.RO cs.CV cs.LG 57%

LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning

Dantong Niu, Yuvan Sharma, Giscard Biamby, Jerome Quenum, Yutong Bai, Baifeng Shi, Trevor Darrell, Roei Herzig

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏