arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2406.11333 2024-06-18 cs.CV 57%

Hallucination Mitigation Prompts Long-term Video Understanding

Yiwei Sun, Zhihang Liu, Chuanbin Liu, Bowei Pu, Zhihan Zhang, Hongtao Xie

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09418 2024-06-14 cs.CV 57%

VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding

Muhammad Maaz, Hanoona Rasheed, Salman Khan, Fahad Khan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05424 2024-06-11 cs.CV 57%

Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models

Muhammad Maaz, Hanoona Rasheed, Salman Khan, Fahad Shahbaz Khan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments ACL 2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01891 2024-06-11 cs.CV cs.RO eess.IV eess.SP 57%

DH-PTAM: A Deep Hybrid Stereo Events-Frames Parallel Tracking And Mapping System

Abanob Soliman, Fabien Bonardi, Désiré Sidibé, Samia Bouchafa

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted for publication in the IEEE Transactions on Intelligent Vehicles

Journal ref Vol.0, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04979 2024-06-10 cs.CV 57%

Semantic Segmentation on VSPW Dataset through Masked Video Consistency

Chen Liang, Qiang Guo, Chongkai Yu, Chengjing Wu, Ting Liu, Luoqi Liu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04632 2024-06-10 cs.MM 57%

StreamOptix: A Cross-layer Adaptive Video Delivery Scheme

Mufan Liu, Le Yang, Yifan Wang, Yiling Xu, Ye-Kui Wang, Yunfeng Guan

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

Comments under review in Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16990 2024-05-30 cs.CV 57%

What, when, and where? -- Self-Supervised Spatio-Temporal Grounding in Untrimmed Multi-Action Videos from Narrated Instructions

Brian Chen, Nina Shvetsova, Andrew Rouditchenko, Daniel Kondermann, Samuel Thomas, Shih-Fu Chang, Rogerio Feris, James Glass, Hilde Kuehne

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments To be presented at CVPR 2024. Project page: https://brian7685.github.io/STG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08204 2024-05-29 cs.CV cs.LG 57%

STELLA: Continual Audio-Video Pre-training with Spatio-Temporal Localized Alignment

Jaewoo Lee, Jaehong Yoon, Wonjae Kim, Yunji Kim, Sung Ju Hwang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16645 2024-05-28 cs.CV 57%

Diffusion4D: Fast Spatial-temporal Consistent 4D Generation via Video Diffusion Models

Hanwen Liang, Yuyang Yin, Dejia Xu, Hanxue Liang, Zhangyang Wang, Konstantinos N. Plataniotis, Yao Zhao, Yunchao Wei

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Project page: https://vita-group.github.io/Diffusion4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15683 2024-05-24 cs.CV 57%

End-to-End Streaming Video Temporal Action Segmentation with Reinforce Learning

Jinrong Zhang, Wujun Wen, Shenglan Liu, Yunheng Li, Qifeng Li, Lin Feng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments submit to TNNLS

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15482 2024-05-22 cs.CV 57%

Salient Object Detection in RGB-D Videos

Ao Mou, Yukang Lu, Jiahao He, Dingyao Min, Keren Fu, Qijun Zhao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments IEEE TIP (under major revision)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11487 2024-05-21 cs.CV 57%

"Previously on ..." From Recaps to Story Summarization

Aditya Kumar Singh, Dhruv Srivastava, Makarand Tapaswi

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2024; Project page: https://katha-ai.github.io/projects/recap-story-summ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11463 2024-05-15 cs.CV 57%

Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph Grounding

Chaolei Tan, Jianhuang Lai, Wei-Shi Zheng, Jian-Fang Hu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. v2: fix a typo in figure 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06944 2024-05-14 cs.CV 57%

Learning Monocular Depth from Focus with Event Focal Stack

Chenxu Jiang, Mingyuan Lin, Chi Zhang, Zhenghai Wang, Lei Yu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06918 2024-05-14 cs.CV 57%

Super-Resolving Blurry Images with Events

Chi Zhang, Mingyuan Lin, Xiang Zhang, Chenxu Jiang, Lei Yu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15881 2024-05-14 cs.CV 57%

Attention-aware Social Graph Transformer Networks for Stochastic Trajectory Prediction

Yao Liu, Binghao Li, Xianzhi Wang, Claude Sammut, Lina Yao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments 14 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05861 2024-05-10 cs.RO cs.AI cs.LG 57%

ExACT: An End-to-End Autonomous Excavator System Using Action Chunking With Transformers

Liangliang Chen, Shiyu Jin, Haoyu Wang, Liangjun Zhang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments ICRA Workshop 2024: 3rd Workshop on Future of Construction: Lifelong Learning Robots in Changing Construction Sites

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05488 2024-05-10 cs.CV physics.med-ph 57%

Advancing Head and Neck Cancer Survival Prediction via Multi-Label Learning and Deep Model Interpretation

Meixu Chen, Kai Wang, Jing Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments 10 pages, 4 figures, 2 tables, 2 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05259 2024-05-09 cs.CV cs.RO 57%

OpenESS: Event-based Semantic Scene Understanding with Open Vocabularies

Lingdong Kong, Youquan Liu, Lai Xing Ng, Benoit R. Cottereau, Wei Tsang Ooi

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

Comments CVPR 2024 (Highlight); 26 pages, 12 figures, 11 tables; Code at https://github.com/ldkong1205/OpenESS

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04841 2024-05-09 cs.LG cs.AI 57%

xMTrans: Temporal Attentive Cross-Modality Fusion Transformer for Long-Term Traffic Prediction

Huy Quang Ung, Hao Niu, Minh-Son Dao, Shinya Wada, Atsunori Minamikawa

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments Accepted at MDM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04180 2024-05-08 cs.LG cs.CV 57%

Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models

Zhixuan Chu, Lei Zhang, Yichen Sun, Siqiao Xue, Zhibo Wang, Zhan Qin, Kui Ren

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2306.08302, arXiv:2403.05131 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18156 2024-04-30 cs.CV 57%

Event-based Video Frame Interpolation with Edge Guided Motion Refinement

Yuhan Liu, Yongjian Deng, Hao Chen, Bochen Xie, Youfu Li, Zhen Yang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17176 2024-04-29 cs.CV 57%

MovieChat+: Question-aware Sparse Memory for Long Video Question Answering

Enxin Song, Wenhao Chai, Tian Ye, Jenq-Neng Hwang, Xi Li, Gaoang Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16037 2024-04-26 cs.CV cs.LG physics.ao-ph 57%

VN-Net: Vision-Numerical Fusion Graph Convolutional Network for Sparse Spatio-Temporal Meteorological Forecasting

Yutong Xiong, Xun Zhu, Ming Wu, Weiqing Li, Fanbin Mo, Chuang Zhang, Bin Zhang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14573 2024-04-24 cs.MM 57%

Tile-Weighted Rate-Distortion Optimized Packet Scheduling for 360$^\circ$ VR Video Streaming

Haopeng Wang, Haiwei Dong, Abdulmotaleb El Saddik

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

Comments Accepted by IEEE Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13576 2024-04-24 cs.CV cs.IR 57%

Improving Video Corpus Moment Retrieval with Partial Relevance Enhancement

Danyang Hou, Liang Pang, Huawei Shen, Xueqi Cheng

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments camera-ready version of ACM ICMR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12192 2024-04-19 cs.CV 57%

Aligning Actions and Walking to LLM-Generated Textual Descriptions

Radu Chivereanu, Adrian Cosma, Andy Catruna, Razvan Rughinis, Emilian Radoi

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted at 2nd Workshop on Learning with Few or without Annotated Face, Body and Gesture Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11554 2024-04-18 cs.CV 57%

Predicting Long-horizon Futures by Conditioning on Geometry and Time

Tarasha Khurana, Deva Ramanan

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Project page: http://www.cs.cmu.edu/~tkhurana/depthforecasting/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06173 2024-04-10 cs.CV 57%

Improving Interpretable Embeddings for Ad-hoc Video Search with Generative Captions and Multi-word Concept Bank

Jiaxin Wu, Chong-Wah Ngo, Wing-Kwong Chan

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted in ICMR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13358 2024-04-10 cs.RO cs.CV cs.LG 57%

GeRM: A Generalist Robotic Model with Mixture-of-experts for Quadruped Robot

Wenxuan Song, Han Zhao, Pengxiang Ding, Can Cui, Shangke Lyu, Yaning Fan, Donglin Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏