arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4721 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4721 篇

2208.11346 2024-12-10 cs.CV 79%

ICANet: A Method of Short Video Emotion Recognition Driven by Multimodal Data

Xuecheng Wu, Mengmeng Tian, Lanhang Zhai

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05423 2024-12-10 cs.CV 79%

MTSA-SNN: A Multi-modal Time Series Analysis Model Based on Spiking Neural Network

Chengzhi Liu, Zheng Tao, Zihong Luo, Chenghao Liu

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

Comments 6 pages, 6 figures, published to International Conference on Computer Supported Cooperative Work in Design

Journal ref International Conference on Pattern Recognition 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00754 2024-11-22 cs.CV cs.LG 79%

Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model

Benlin Liu, Yuhao Dong, Yiqin Wang, Zixian Ma, Yansong Tang, Luming Tang, Yongming Rao, Wei-Chiu Ma, Ranjay Krishna

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments project page: https://coarse-correspondence.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01601 2024-11-20 cs.DC cs.AI cs.LG 79%

Backpropagation-Free Multi-modal On-Device Model Adaptation via Cloud-Device Collaboration

Wei Ji, Li Li, Zheqi Lv, Wenqiao Zhang, Mengze Li, Zhen Wan, Wenqiang Lei, Roger Zimmermann

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20092 2024-11-19 cs.CV 79%

Efficient Large Multi-modal Models via Visual Context Compression

Jieneng Chen, Luoxin Ye, Ju He, Zhao-Yang Wang, Daniel Khashabi, Alan Yuille

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

Comments NeurIPS 2024 Camera Ready; Code is available at https://github.com/Beckschen/LLaVolta

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03761 2024-10-31 cs.CV 79%

MMSummary: Multimodal Summary Generation for Fetal Ultrasound Video

Xiaoqing Guo, Qianhui Men, J. Alison Noble

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19606 2024-10-28 cs.CV cs.RO 79%

Multi-modal Motion Prediction using Temporal Ensembling with Learning-based Aggregation

Kai-Yin Hong, Chieh-Chih Wang, Wen-Chieh Lin

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

Comments IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2024), accepted by IROS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15581 2024-10-22 cs.CV cs.LG 79%

Multimodal Learning for Embryo Viability Prediction in Clinical IVF

Junsik Kim, Zhiyi Shi, Davin Jeong, Johannes Knittel, Helen Y. Yang, Yonghyun Song, Wanhua Li, Yicong Li, Dalit Ben-Yosef, Daniel Needleman, Hanspeter Pfister

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments Accepted to MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15497 2024-10-22 cs.CL 79%

RoMemes: A multimodal meme corpus for the Romanian language

Vasile Păiş, Sara Niţă, Alexandru-Iulius Jerpelea, Luca Pană, Eric Curea

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

Comments 12 pages, 7 tables, 1 figure, submitted to The 19th International Conference on Linguistic Resources and Tools for Natural Language Processing (ConsILR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13437 2024-10-18 cs.CV 79%

Temporal-Enhanced Multimodal Transformer for Referring Multi-Object Tracking and Segmentation

Changcheng Xiao, Qiong Cao, Yujie Zhong, Xiang Zhang, Tao Wang, Canqun Yang, Long Lan

专题命中 视频多模态 :multimodal(title);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11228 2024-10-16 cs.CV 79%

TEOcc: Radar-camera Multi-modal Occupancy Prediction via Temporal Enhancement

Zhiwei Lin, Hongbo Jin, Yongtao Wang, Yufei Wei, Nan Dong

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted by ECAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09377 2024-10-15 cs.CV 79%

GEM-VPC: A dual Graph-Enhanced Multimodal integration for Video Paragraph Captioning

Eileen Wang, Caren Han, Josiah Poon

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01532 2024-10-07 cs.CV 79%

MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition

Jiazheng Xing, Chao Xu, Mengmeng Wang, Guang Dai, Baigui Sun, Yong Liu, Jingdong Wang, Jian Zhao

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05811 2024-10-02 cs.CV 79%

MapsTP: HD Map Images Based Multimodal Trajectory Prediction for Automated Vehicles

Sushil Sharma, Arindam Das, Ganesh Sistu, Mark Halton, Ciarán Eising

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments This paper is a preprint of a paper submitted to the 26th Irish Machine Vision and Image Processing Conference (IMVIP 2024). If accepted, the copy of record will be available at IET Digital Library

Journal ref Proceedings of the Irish Machine Vision and Image Processing Conference 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19342 2024-10-01 cs.CV 79%

X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation

Pinxue Guo, Wanyun Li, Hao Huang, Lingyi Hong, Xinyu Zhou, Zhaoyu Chen, Jinglun Li, Kaixun Jiang, Wei Zhang, Wenqiang Zhang

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

Comments ACMMM'2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19228 2024-10-01 cs.CV 79%

GS-EVT: Cross-Modal Event Camera Tracking based on Gaussian Splatting

Tao Liu, Runze Yuan, Yi'ang Ju, Xun Xu, Jiaqi Yang, Xiangting Meng, Xavier Lagorce, Laurent Kneip

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12778 2024-09-24 cs.CV 79%

EventDance++: Language-guided Unsupervised Source-free Cross-modal Adaptation for Event-based Object Recognition

Xu Zheng, Lin Wang

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2403.14082

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13591 2024-09-23 cs.CV cs.GR 79%

Portrait Video Editing Empowered by Multimodal Generative Priors

Xuan Gao, Haiyao Xiao, Chenglai Zhong, Shimin Hu, Yudong Guo, Juyong Zhang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments Accepted by SIGGRAPH Asia 2024. Project Page: https://ustc3dv.github.io/PortraitGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12927 2024-09-23 cs.CV 79%

Textualized and Feature-based Models for Compound Multimodal Emotion Recognition in the Wild

Nicolas Richet, Soufiane Belharbi, Haseeb Aslam, Meike Emilie Schadt, Manuela González-González, Gustave Cortal, Alessandro Lameiras Koerich, Marco Pedersoli, Alain Finkel, Simon Bacon, Eric Granger

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments 14 pages, 3 figures, ECCVw 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11182 2024-09-18 cs.CV 79%

Video Token Sparsification for Efficient Multimodal LLMs in Autonomous Driving

Yunsheng Ma, Amr Abdelraouf, Rohit Gupta, Ziran Wang, Kyungtae Han

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11286 2024-08-23 cs.CV 79%

Video Emotion Open-vocabulary Recognition Based on Multimodal Large Language Model

Mengying Ge, Dongkai Tang, Mingyang Li

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01165 2024-08-13 cs.CL 79%

LITE: Modeling Environmental Ecosystems with Multimodal Large Language Models

Haoran Li, Junqi Liu, Zexian Wang, Shiyuan Luo, Xiaowei Jia, Huaxiu Yao

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

Comments COLM camera-ready version. Code is released at https://github.com/hrlics/LITE

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16123 2024-07-24 cs.LG cs.AI 79%

Towards Effective Fusion and Forecasting of Multimodal Spatio-temporal Data for Smart Mobility

Chenxing Wang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13137 2024-07-19 cs.CV 79%

OE-BevSeg: An Object Informed and Environment Aware Multimodal Framework for Bird's-eye-view Vehicle Semantic Segmentation

Jian Sun, Yuqi Dai, Chi-Man Vong, Qing Xu, Shengbo Eben Li, Jianqiang Wang, Lei He, Keqiang Li

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12798 2024-07-19 cs.CV 79%

Multi-Granularity and Multi-modal Feature Interaction Approach for Text Video Retrieval

Wenjun Li, Shudong Wang, Dong Zhao, Shenghui Xu, Zhaoming Pan, Zhimin Zhang

专题命中 视频多模态 :multi-modal(title);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19917 2024-07-17 cs.CV 79%

Multimodal Cross-Domain Few-Shot Learning for Egocentric Action Recognition

Masashi Hatano, Ryo Hachiuma, Ryo Fujii, Hideo Saito

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments Accepted at ECCV'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11481 2024-07-16 cs.CV 79%

VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding

Yue Fan, Xiaojian Ma, Rujie Wu, Yuntao Du, Jiaqi Li, Zhi Gao, Qing Li

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments ECCV-24; Project page: videoagent.github.io; First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07775 2024-07-15 cs.RO cs.AI 79%

Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs

Hao-Tien Lewis Chiang, Zhuo Xu, Zipeng Fu, Mithun George Jacob, Tingnan Zhang, Tsang-Wei Edward Lee, Wenhao Yu, Connor Schenck, David Rendleman, Dhruv Shah, Fei Xia, Jasmine Hsu, Jonathan Hoech, Pete Florence, Sean Kirmani, Sumeet Singh, Vikas Sindhwani, Carolina Parada, Chelsea Finn, Peng Xu, Sergey Levine, Jie Tan

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05419 2024-07-09 cs.CV cs.IR 79%

Multimodal Language Models for Domain-Specific Procedural Video Summarization

Nafisa Hussain

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02218 2024-07-08 cs.CV 79%

Multi-Modal Video Dialog State Tracking in the Wild

Adnen Abdessaied, Lei Shi, Andreas Bulling

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏