arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2503.01201 2025-03-04 cs.CV 57%

Parameter-free Video Segmentation for Vision and Language Understanding

Louis Mahon, Mirella Lapata

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20063 2025-03-04 cs.CV 57%

Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs

Zicheng Zhang, Ziheng Jia, Haoning Wu, Chunyi Li, Zijian Chen, Yingjie Zhou, Wei Sun, Xiaohong Liu, Xiongkuo Min, Weisi Lin, Guangtao Zhai

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12275 2025-03-04 cs.CV 57%

VoCo-LLaMA: Towards Vision Compression with Large Language Models

Xubing Ye, Yukang Gan, Xiaoke Huang, Yixiao Ge, Yansong Tang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08870 2025-03-04 cs.CV 57%

Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens

Fan Ma, Xiaojie Jin, Heng Wang, Yuchen Xian, Jiashi Feng, Yi Yang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17800 2025-03-04 q-bio.QM cs.SD eess.AS 57%

Fish Tracking, Counting, and Behaviour Analysis in Digital Aquaculture: A Comprehensive Survey

Meng Cui, Xubo Liu, Haohe Liu, Jinzheng Zhao, Daoliang Li, Wenwu Wang

专题命中 视频多模态 :multimodal(abstract);分类 eess.AS

Journal ref Reviews in Aquaculture, 17(1), e13001 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20480 2025-03-03 cs.CV cs.HC 57%

VideoA11y: Method and Dataset for Accessible Video Description

Chaoyu Li, Sid Padmanabhuni, Maryam Cheema, Hasti Seifi, Pooyan Fazli

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments ACM CHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20249 2025-02-28 cs.CV 57%

Enhancing 3D Gaze Estimation in the Wild using Weak Supervision with Gaze Following Labels

Pierre Vuillecard, Jean-Marc Odobez

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19630 2025-02-28 cs.CV 57%

Ev-3DOD: Pushing the Temporal Boundaries of 3D Object Detection with Event Cameras

Hoonhee Cho, Jae-young Kang, Youngho Kim, Kuk-Jin Yoon

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19520 2025-02-28 cs.CV cs.LG 57%

Ego-VPA: Egocentric Video Understanding with Parameter-efficient Adaptation

Tz-Ying Wu, Kyle Min, Subarna Tripathi, Nuno Vasconcelos

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted to WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18151 2025-02-26 cs.RO cs.AI 57%

A Real-time Spatio-Temporal Trajectory Planner for Autonomous Vehicles with Semantic Graph Optimization

Shan He, Yalong Ma, Tao Song, Yongzhi Jiang, Xinkai Wu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments This work has been accepted for publication in IEEE Robotics and Automation Letters (RA-L). The final published version is available in IEEE Xplore (DOI: 10.1109/LRA.2024.3504239)

Journal ref IEEE Robotics and Automation Letters, vol. 10, no. 1, pp. 72-79, Jan. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14066 2025-02-25 cs.CV cs.IR 57%

SHE-Net: Syntax-Hierarchy-Enhanced Text-Video Retrieval

Xuzheng Yu, Chen Jiang, Xingning Dong, Tian Gan, Ming Yang, Qingpei Guo

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15457 2025-02-24 cs.CV 57%

Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs

Gengyuan Zhang, Mingcong Ding, Tong Liu, Yao Zhang, Volker Tresp

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Short paper (5 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09638 2025-02-24 cs.MM 57%

Multi-view Hypergraph-based Contrastive Learning Model for Cold-Start Micro-video Recommendation

Sisuo Lyu, Xiuze Zhou, Xuming Hu

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.00884 2025-02-21 eess.SP cs.AI cs.LG 57%

Infant movement classification through pressure distribution analysis

Tomas Kulvicius, Dajie Zhang, Karin Nielsen-Saines, Sven Bölte, Marc Kraft, Christa Einspieler, Luise Poustka, Florentin Wörgötter, Peter B Marschik

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Journal ref Communications Medicine, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12975 2025-02-19 cs.CV 57%

Instance-Level Moving Object Segmentation from a Single Image with Events

Zhexiong Wan, Bin Fan, Le Hui, Yuchao Dai, Gim Hee Lee

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11896 2025-02-18 cs.LG cs.AI 57%

CAMEL: Continuous Action Masking Enabled by Large Language Models for Reinforcement Learning

Yanxiao Zhao, Yangge Qian, Jingyang Shan, Xiaolin Qin

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments Accepted at RLDM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11468 2025-02-18 cs.CV 57%

Semantically Robust Unsupervised Image Translation for Paired Remote Sensing Images

Sheng Fang, Kaiyu Li, Zhe Li, Jianli Zhao, Xingli Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10841 2025-02-18 cs.CV 57%

SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers

Di Qiu, Zhengcong Fei, Rui Wang, Jialin Bai, Changqian Yu, Mingyuan Fan, Guibin Chen, Xiang Wen

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10813 2025-02-18 cs.CV 57%

Transformer-Driven Modeling of Variable Frequency Features for Classifying Student Engagement in Online Learning

Sandeep Mandia, Kuldeep Singh, Rajendra Mitharwal, Faisel Mushtaq, Dimpal Janu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 22 pages, 5 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07811 2025-02-13 cs.CV 57%

CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders

Shihab Aaqil Ahamed, Malitha Gunawardhana, Liel David, Michael Sidorov, Daniel Harari, Muhammad Haris Khan

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06428 2025-02-12 cs.CV 57%

CoS: Chain-of-Shot Prompting for Long Video Understanding

Jian Hu, Zixu Cheng, Chenyang Si, Wei Li, Shaogang Gong

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments A training-free test-time optimisation approach for long video understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05777 2025-02-11 cs.LG cs.AI 57%

Predictive Crash Analytics for Traffic Safety using Deep Learning

Karthik Sivakoti

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17550 2025-02-11 cs.CV 57%

Action Recognition Using Temporal Shift Module and Ensemble Learning

Anh-Kiet Duong, Petra Gomez-Krämer

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments ICPR2024, MMVPR, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02692 2025-02-06 cs.RO cs.CV cs.LG 57%

Intelligent Sensing-to-Action for Robust Autonomy at the Edge: Opportunities and Challenges

Amit Ranjan Trivedi, Sina Tayebati, Hemant Kumawat, Nastaran Darabi, Divake Kumar, Adarsh Kumar Kosta, Yeshwanth Venkatesha, Dinithi Jayasuriya, Nethmi Jayasinghe, Priyadarshini Panda, Saibal Mukhopadhyay, Kaushik Roy

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01784 2025-02-05 cs.RO cs.CV 57%

VILP: Imitation Learning with Latent Video Planning

Zhengtong Xu, Qiang Qiu, Yu She

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13708 2025-02-04 cs.CV 57%

JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts

Taein Son, Soo Won Seo, Jisong Kim, Seok Hwan Lee, Jun Won Choi

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted to AAAI Conference on Artificial Intelligence 2025, 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00397 2025-02-04 cs.CV 57%

Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues

Rohit Girmaji, Siddharth Jain, Bhav Beri, Sarthak Bansal, Vineet Gandhi

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV

Comments Accepted at 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15111 2025-01-28 cs.CV 57%

HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding

Jiaxing Zhao, Qize Yang, Yixing Peng, Detao Bai, Shimin Yao, Boyuan Sun, Xiang Chen, Shenghao Fu, Weixuan chen, Xihan Wei, Liefeng Bo

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13829 2025-01-24 cs.CV 57%

MV-GMN: State Space Model for Multi-View Action Recognition

Yuhui Lin, Jiaxuan Lu, Yue Yong, Jiahao Zhang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03616 2025-01-22 cs.CV 57%

BTMTrack: Robust RGB-T Tracking via Dual-template Bridging and Temporal-Modal Candidate Elimination

Zhongxuan Zhang, Bi Zeng, Xinyu Ni, Yimin Du

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏