arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2411.18968 2025-04-29 cs.CV cs.LG 57%

Perception of Visual Content: Differences Between Humans and Foundation Models

Nardiena A. Pratama, Shaoyang Fan, Gianluca Demartini

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments 12 pages (including references), 5 figures, 5 tables, and a paper/ethics checklist. Camera-Ready Copy for ICWSM 2025. This version uses the same results as the previously posted revise-and-resubmit version. Changes are mostly formatting adjustments

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14856 2025-04-29 cs.CV cs.HC cs.LG 57%

Accessible, At-Home Detection of Parkinson's Disease via Multi-task Video Analysis

Md Saiful Islam, Tariq Adnan, Jan Freyberg, Sangwu Lee, Abdelrahman Abdelkader, Meghan Pawlik, Cathe Schwartz, Karen Jaffe, Ruth B. Schneider, E Ray Dorsey, Ehsan Hoque

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08585 2025-04-25 cs.CV 57%

HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding

Shehreen Azad, Vibhav Vineet, Yogesh Singh Rawat

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Microsoft Research(微软研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16471 2025-04-24 cs.CV 57%

RGB-D Video Object Segmentation via Enhanced Multi-store Feature Memory

Boyue Xu, Ruichao Hou, Tongwei Ren, Gangshan Wu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16304 2025-04-24 cs.CV 57%

MetaHarm: Harmful YouTube Video Dataset Annotated by Domain Experts, GPT-4-Turbo, and Crowdworkers

Wonjeong Jo, Magdalena Wojcieszak

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13915 2025-04-22 cs.CV 57%

Memory-efficient Streaming VideoLLMs for Real-time Procedural Video Understanding

Dibyadip Chatterjee, Edoardo Remelli, Yale Song, Bugra Tekin, Abhay Mittal, Bharat Bhatnagar, Necati Cihan Camgöz, Shreyas Hampali, Eric Sauser, Shugao Ma, Angela Yao, Fadime Sener

机构 * Meta Reality Labs(Meta现实实验室) FAIR, Meta(Meta人工智能研究机构) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 13 pages, 5 figures; https://dibschat.github.io/ProVideLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00584 2025-04-18 cs.CV cs.LG 57%

Online Video Understanding: OVBench and VideoChat-Online

Zhenpeng Huang, Xinhao Li, Jiaqi Li, Jing Wang, Xiangyu Zeng, Cheng Liang, Tao Wu, Xi Chen, Liang Li, Limin Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2025 Camera Ready Version. Project Page: https://videochat-online.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12264 2025-04-17 cs.CV 57%

Towards Learning to Complete Anything in Lidar

Ayca Takmaz, Cristiano Saltori, Neehar Peri, Tim Meinhardt, Riccardo de Lutio, Laura Leal-Taixé, Aljoša Ošep

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05810 2025-04-16 cs.CV 57%

PaMi-VDPO: Mitigating Video Hallucinations by Prompt-Aware Multi-Instance Video Preference Learning

Xinpeng Ding, Kui Zhang, Jianhua Han, Lanqing Hong, Hang Xu, Xiaomeng Li

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09641 2025-04-15 cs.CV 57%

TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning

Xingjian Zhang, Siwei Wen, Wenjun Wu, Lei Huang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20384 2025-04-15 cs.RO cs.AI 57%

MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation

Rongyu Zhang, Menghang Dong, Yuan Zhang, Liang Heng, Xiaowei Chi, Gaole Dai, Li Du, Yuan Du, Shanghang Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11093 2025-04-15 cs.CV 57%

Text-Promptable Propagation for Referring Medical Image Sequence Segmentation

Runtian Yuan, Mohan Chen, Jilan Xu, Ling Zhou, Qingqiu Li, Yuejie Zhang, Rui Feng, Tao Zhang, Shang Gao

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.08714 2025-04-15 cs.CV 57%

Selective Query-guided Debiasing for Video Corpus Moment Retrieval

Sunjae Yoon, Ji Woo Hong, Eunseop Yoon, Dahyun Kim, Junyeong Kim, Hee Suk Yoon, Chang D. Yoo

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments 16 pages, 6 figures, Accepted in ECCV 2022

Journal ref In European Conference on Computer Vision (pp. 185-200). Springer, Cham (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14174 2025-04-14 cs.CV 57%

Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding

Jingjing Hu, Dan Guo, Kun Li, Zhan Si, Xun Yang, Xiaojun Chang, Meng Wang

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted to IEEE TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06581 2025-04-08 cs.NI cs.CV cs.LG 57%

A Survey on Video Analytics in Cloud-Edge-Terminal Collaborative Systems

Linxiao Gong, Hao Yang, Gaoyun Fang, Bobo Ju, Juncen Guo, Xiaoguang Zhu, Xiping Hu, Yan Wang, Peng Sun, Azzedine Boukerche

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07298 2025-04-02 cs.CV 57%

ALLVB: All-in-One Long Video Understanding Benchmark

Xichen Tan, Yuanjing Luo, Yunfan Ye, Fang Liu, Zhiping Cai

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18565 2025-04-02 cs.CR cs.AI cs.HC 57%

BounTCHA: A CAPTCHA Utilizing Boundary Identification in Guided Generative AI-extended Videos

Lehao Lin, Ke Wang, Maha Abdallah, Wei Cai

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments 22 pages, 15 figures; references added, typos corrected, new keyword "guided" added, new experimental data and related results updated; new keyword "Generative AI" added for clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23881 2025-04-01 cs.CV 57%

ExScene: Free-View 3D Scene Reconstruction with Gaussian Splatting from a Single Image

Tianyi Gong, Boyan Li, Yifei Zhong, Fangxin Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23050 2025-04-01 cs.LG cs.CV 57%

Prediction of 30-day hospital readmission with clinical notes and EHR information

Tiago Almeida, Plinio Moreno, Catarina Barata

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08646 2025-04-01 cs.CV 57%

StreamChat: Chatting with Streaming Video

Jihao Liu, Zhiding Yu, Shiyi Lan, Shihao Wang, Rongyao Fang, Jan Kautz, Hongsheng Li, Jose M. Alvare

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18042 2025-04-01 cs.CV 57%

HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation

Trong-Thuan Nguyen, Pha Nguyen, Jackson Cothren, Alper Yilmaz, Khoa Luu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20776 2025-03-31 cs.CV 57%

Feature4X: Bridging Any Monocular Video to 4D Agentic AI with Versatile Gaussian Feature Fields

Shijie Zhou, Hui Ren, Yijia Weng, Shuwang Zhang, Zhen Wang, Dejia Xu, Zhiwen Fan, Suya You, Zhangyang Wang, Leonidas Guibas, Achuta Kadambi

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20540 2025-03-27 cs.CV 57%

Beyond Intermediate States: Explaining Visual Redundancy through Language

Dingchen Yang, Bowen Cao, Anran Zhang, Weibo Gu, Winston Hu, Guang Chen

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20315 2025-03-27 cs.CV 57%

SpikeDerain: Unveiling Clear Videos from Rainy Sequences Using Color Spike Streams

Hanwen Liang, Xian Zhong, Wenxuan Liu, Yajing Zheng, Wenxin Huang, Zhaofei Yu, Tiejun Huang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20268 2025-03-27 cs.CV 57%

EGVD: Event-Guided Video Diffusion Model for Physically Realistic Large-Motion Frame Interpolation

Ziran Zhang, Xiaohui Li, Yihao Liu, Yujin Wang, Yueting Chen, Tianfan Xue, Shi Guo

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05186 2025-03-27 cs.CV 57%

Narrating the Video: Boosting Text-Video Retrieval via Comprehensive Utilization of Frame-Level Captions

Chan Hur, Jeong-hun Hong, Dong-hun Lee, Dabin Kang, Semin Myeong, Sang-hyo Park, Hyeyoung Park

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10122 2025-03-27 cs.CV 57%

MuseTalk: Real-Time High-Fidelity Video Dubbing via Spatio-Temporal Sampling

Yue Zhang, Zhizhou Zhong, Minhao Liu, Zhaokang Chen, Bin Wu, Yubin Zeng, Chao Zhan, Yingjie He, Junxin Huang, Wenjiang Zhou

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09390 2025-03-27 cs.CV cs.LG 57%

LLAVIDAL: A Large LAnguage VIsion Model for Daily Activities of Living

Dominick Reilly, Rajatsubhra Chakraborty, Arkaprava Sinha, Manish Kumar Govind, Pu Wang, Francois Bremond, Le Xue, Srijan Das

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17646 2025-03-26 cs.CV 57%

SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video Segmentation

Claudia Cuttano, Gabriele Trivigno, Gabriele Rosi, Carlo Masone, Giuseppe Averta

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://claudiacuttano.github.io/SAMWISE

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15973 2025-03-26 cs.CV 57%

STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding

Zichen Liu, Kunlun Xu, Bing Su, Xu Zou, Yuxin Peng, Jiahuan Zhou

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏