arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2412.01820 2025-03-25 cs.CV 57%

Towards Universal Soccer Video Understanding

Jiayuan Rao, Haoning Wu, Hao Jiang, Ya Zhang, Yanfeng Wang, Weidi Xie

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments CVPR 2025; Project Page: https://jyrao.github.io/UniSoccer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14401 2025-03-25 cs.CV cs.LG 57%

Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding

Yiming Zhang, Zhuokai Zhao, Zhaorun Chen, Zenghui Ding, Xianjun Yang, Yining Sun

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Code is available at https://github.com/Jam1ezhang/DYTO

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17752 2025-03-25 cs.CV 57%

HiLoTs: High-Low Temporal Sensitive Representation Learning for Semi-Supervised LiDAR Segmentation in Autonomous Driving

R. D. Lin, Pengcheng Weng, Yinqiao Wang, Han Ding, Jinsong Han, Fei Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08326 2025-03-25 cs.CV 57%

Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks

Miran Heo, Min-Hung Chen, De-An Huang, Sifei Liu, Subhashree Radhakrishnan, Seon Joo Kim, Yu-Chiang Frank Wang, Ryo Hachiuma

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2025, Project page: https://miranheo.github.io/omni-rgpt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16451 2025-03-24 cs.HC cs.AI cs.RO 57%

Think-Then-React: Towards Unconstrained Human Action-to-Reaction Generation

Wenhui Tan, Boyuan Li, Chuhao Jin, Wenbing Huang, Xiting Wang, Ruihua Song

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15807 2025-03-21 cs.AI 57%

Video-VoT-R1: An efficient video inference model integrating image packing and AoE architecture

Cheng Li, Jiexiong Liu, Yixuan Chen, Yanqin Jia

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13724 2025-03-19 cs.CV 57%

Towards Scalable Modeling of Compressed Videos for Efficient Action Recognition

Shristi Das Biswas, Efstathia Soufleri, Arani Roy, Kaushik Roy

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11223 2025-03-19 cs.CV 57%

Efficient Transfer Learning for Video-language Foundation Models

Haoxing Chen, Zizheng Huang, Yan Hong, Yanshuo Wang, Zhongcai Lyu, Zhuoer Xu, Jun Lan, Zhangxuan Gu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12332 2025-03-18 cs.CV 57%

VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining

Yunze Liu, Peiran Wu, Cheng Liang, Junxiao Shen, Limin Wang, Li Yi

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14500 2025-03-18 cs.CV 57%

ViLLa: Video Reasoning Segmentation with Large Language Model

Rongkun Zheng, Lu Qi, Xi Chen, Yi Wang, Kun Wang, Yu Qiao, Hengshuang Zhao

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 15 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11392 2025-03-17 cs.CV 57%

Watch and Learn: Leveraging Expert Knowledge and Language for Surgical Video Understanding

David Gastager, Ghazal Ghazaei, Constantin Patsch

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 14 pages main manuscript with 3 figures; 6 pages supplementary material with 3 figures. To be presented at International Conference on Information Processing in Computer-Assisted Interventions (IPCAI 2025). To be published in International Journal of Computer Assisted Radiology and Surgery (IJCARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06171 2025-03-17 cs.CV 57%

Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity

Huaxin Zhang, Xiaohao Xu, Xiang Wang, Jialong Zuo, Xiaonan Huang, Changxin Gao, Shanjun Zhang, Li Yu, Nong Sang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09590 2025-03-14 cs.CV 57%

BIMBA: Selective-Scan Compression for Long-Range Video Question Answering

Md Mohaiminul Islam, Tushar Nagarajan, Huiyu Wang, Gedas Bertasius, Lorenzo Torresani

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09416 2025-03-13 cs.CV 57%

OpenVidVRD: Open-Vocabulary Video Visual Relation Detection via Prompt-Driven Semantic Space Alignment

Qi Liu, Weiying Xue, Yuxiao Wang, Zhenao Wei

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08689 2025-03-12 cs.CV 57%

QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension

Yongdong Luo, Wang Chen, Xiawu Zheng, Weizhong Huang, Shukang Yin, Haojia Lin, Chaoyou Fu, Jinfa Huang, Jiayi Ji, Jiebo Luo, Rongrong Ji

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Project page: https://github.com/MAC-AutoML/QuoTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08576 2025-03-12 cs.CV 57%

RAG-Adapter: A Plug-and-Play RAG-enhanced Framework for Long Video Understanding

Xichen Tan, Yunfan Ye, Yuanjing Luo, Qian Wan, Fang Liu, Zhiping Cai

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments 37 pages, 36 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08548 2025-03-12 cs.RO cs.CV 57%

TLA: Tactile-Language-Action Model for Contact-Rich Manipulation

Peng Hao, Chaofan Zhang, Dingzhe Li, Xiaoge Cao, Xiaoshuai Hao, Shaowei Cui, Shuo Wang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06992 2025-03-12 cs.CV 57%

Bridge Frame and Event: Common Spatiotemporal Fusion for High-Dynamic Scene Optical Flow

Hanyu Zhou, Haonan Wang, Haoyue Liu, Yuxing Duan, Yi Chang, Luxin Yan

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13778 2025-03-12 cs.HC cs.CL 57%

Explainable XR: Understanding User Behaviors of XR Environments using LLM-assisted Analytics Framework

Yoonsang Kim, Zainab Aamir, Mithilesh Singh, Saeed Boorboor, Klaus Mueller, Arie E. Kaufman

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

Comments 11 pages, 8 figures. This is the author's version of the article that has been accepted for publication in IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06934 2025-03-11 cs.CV 57%

LLaFEA: Frame-Event Complementary Fusion for Fine-Grained Spatiotemporal Understanding in LMMs

Hanyu Zhou, Gim Hee Lee

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11418 2025-03-11 cs.AI cs.LG 57%

TimeCAP: Learning to Contextualize, Augment, and Predict Time Series Events with Large Language Model Agents

Geon Lee, Wenchao Yu, Kijung Shin, Wei Cheng, Haifeng Chen

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07249 2025-03-11 cs.CV cs.IR 57%

Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach

Zechen Bai, Tianjun Xiao, Tong He, Pichao Wang, Zheng Zhang, Thomas Brox, Mike Zheng Shou

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04446 2025-03-07 cs.SI cs.MM 57%

SMTPD: A New Benchmark for Temporal Prediction of Social Media Popularity

Yijie Xu, Bolun Zheng, Wei Zhu, Hangjia Pan, Yuchen Yao, Ning Xu, Anan Liu, Quan Zhang, Chenggang Yan

专题命中 视频多模态 :multi-modal(abstract);分类 cs.MM

Comments accept by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04078 2025-03-07 cs.CV 57%

Spatial-Temporal Perception with Causal Inference for Naturalistic Driving Action Recognition

Qing Chang, Wei Dai, Zhihao Shuai, Limin Yu, Yutao Yue

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03663 2025-03-07 cs.CV 57%

LION-FS: Fast & Slow Video-Language Thinker as Online Video Assistant

Wei Li, Bing Hu, Rui Shao, Leyang Shen, Liqiang Nie

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accept to CVPR 2025, Project page: https://github.com/JiuTian-VL/LION-FS

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01193 2025-03-06 cs.CV 57%

Near-infrared Image Deblurring and Event Denoising with Synergistic Neuromorphic Imaging

Chao Qu, Shuo Zhu, Yuhang Wang, Zongze Wu, Xiaoyu Chen, Edmund Y. Lam, Jing Han

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02752 2025-03-05 cs.RO cs.CV 57%

Deep Learning-Enhanced Visual Monitoring in Hazardous Underwater Environments with a Swarm of Micro-Robots

Shuang Chen, Yifeng He, Barry Lennox, Farshad Arvin, Amir Atapour-Abarghouei

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01725 2025-03-05 cs.CV 57%

HarmonySet: A Comprehensive Dataset for Understanding Video-Music Semantic Alignment and Temporal Synchronization

Zitang Zhou, Ke Mei, Yu Lu, Tianyi Wang, Fengyun Rao

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted at CVPR 2025. Project page: https://harmonyset.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14801 2025-03-05 cs.CV 57%

AVD2: Accident Video Diffusion for Accident Video Description

Cheng Li, Keyuan Zhou, Tong Liu, Yu Wang, Mingqiao Zhuang, Huan-ang Gao, Bu Jin, Hao Zhao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments ICRA 2025, Project Page: https://an-answer-tree.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01416 2025-03-04 cs.CV 57%

Learning to Generate Long-term Future Narrations Describing Activities of Daily Living

Ramanathan Rajendiran, Debaditya Roy, Basura Fernando

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏