arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2501.08453 2025-01-16 cs.CV cs.LG 57%

Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models

Weichen Fan, Chenyang Si, Junhao Song, Zhenyu Yang, Yinan He, Long Zhuo, Ziqi Huang, Ziyue Dong, Jingwen He, Dongwei Pan, Yi Wang, Yuming Jiang, Yaohui Wang, Peng Gao, Xinyuan Chen, Hengjie Li, Dahua Lin, Yu Qiao, Ziwei Liu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12190 2025-01-14 cs.LG cs.AI cs.RO 57%

iMoT: Inertial Motion Transformer for Inertial Navigation

Son Minh Nguyen, Linh Duy Tran, Duc Viet Le, Paul J. M Havinga

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

Comments Accepted as technical research paper in 39th AAAI Conference on Artificial Intelligence, 2025 (AAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19714 2025-01-14 cs.NI cs.CV cs.DC cs.LG 57%

The Streetscape Application Services Stack (SASS): Towards a Distributed Sensing Architecture for Urban Applications

Navid Salami Pargoo, Mahshid Ghasemi, Shuren Xia, Mehmet Kerem Turkcan, Taqiya Ehsan, Chengbo Zang, Yuan Sun, Javad Ghaderi, Gil Zussman, Zoran Kostic, Jorge Ortiz

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04586 2025-01-10 cs.CV 57%

Identity-Preserving Video Dubbing Using Motion Warping

Runzhen Liu, Qinjie Lin, Yunfei Liu, Lijian Lin, Ye Zhu, Yu Li, Chuhua Xian, Fa-Ting Hong

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV

Comments v2, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13190 2025-01-09 cs.CV 57%

MotionBridge: Dynamic Video Inbetweening with Flexible Controls

Maham Tanveer, Yang Zhou, Simon Niklaus, Ali Mahdavi Amiri, Hao Zhang, Krishna Kumar Singh, Nanxuan Zhao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Project website: [https://motionbridge.github.io/]

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11876 2025-01-08 q-bio.QM cs.AI cs.LG 57%

From Glucose Patterns to Health Outcomes: A Generalizable Foundation Model for Continuous Glucose Monitor Data Analysis

Guy Lutsker, Gal Sapir, Smadar Shilo, Jordi Merino, Anastasia Godneva, Jerry R Greenfield, Dorit Samocha-Bonet, Raja Dhir, Francisco Gude, Shie Mannor, Eli Meirom, Gal Chechik, Hagai Rossman, Eran Segal

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.08455 2025-01-07 cs.CV 57%

Dense Video Captioning Using Unsupervised Semantic Information

Valter Estevam, Rayson Laroca, Helio Pedrini, David Menotti

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Published at Journal of Visual Communication and Image Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01677 2025-01-06 cs.CV 57%

PG-SAG: Parallel Gaussian Splatting for Fine-Grained Large-Scale Urban Buildings Reconstruction via Semantic-Aware Grouping

Tengfei Wang, Xin Wang, Yongmao Hou, Yiwei Xu, Wendi Zhang, Zongqian Zhan

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01333 2025-01-03 cs.MM cs.IR cs.SI 57%

On the Robustness of Cover Version Identification Models: A Study Using Cover Versions from YouTube

Simon Hachmeier, Robert Jäschke

专题命中 视频多模态 :multi-modal(abstract);分类 cs.MM

Comments accepted for presentation at iConference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20742 2024-12-31 cs.CV 57%

UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models

Yujie Li, Wenjia Xu, Guangzuo Li, Zijian Yu, Zhiwei Wei, Jiuniu Wang, Mugen Peng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14040 2024-12-31 cs.MM 57%

Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline

Dingyi Yang, Chunru Zhan, Ziheng Wang, Biao Wang, Tiezheng Ge, Bo Zheng, Qin Jin

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

Comments 15 pages, 13 figures

Journal ref https://aclanthology.org/2024.acl-long.513/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19304 2024-12-30 cs.CV 57%

Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries

Roberto Amoroso, Gengyuan Zhang, Rajat Koner, Lorenzo Baraldi, Rita Cucchiara, Volker Tresp

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13231 2024-12-25 cs.RO cs.AI cs.LG 57%

C2F-TP: A Coarse-to-Fine Denoising Framework for Uncertainty-Aware Trajectory Prediction

Zichen Wang, Hao Miao, Senzhang Wang, Renzhi Wang, Jianxin Wang, Jian Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16876 2024-12-24 cs.CV 57%

MAGIC++: Efficient and Resilient Modality-Agnostic Semantic Segmentation via Hierarchical Modality Selection

Xu Zheng, Yuanhuiyi Lyu, Lutao Jiang, Jiazhou Zhou, Lin Wang, Xuming Hu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03890 2024-12-24 cs.CV cs.HC 57%

MVTN: A Multiscale Video Transformer Network for Hand Gesture Recognition

Mallika Garg, Debashis Ghosh, Pyari Mohan Pradhan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Journal ref Eccv 2024 workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16117 2024-12-23 cs.CV 57%

PruneVid: Visual Token Pruning for Efficient Video Large Language Models

Xiaohu Huang, Hao Zhou, Kai Han

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Efficient Video Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00441 2024-12-19 cs.AI eess.IV 57%

ReXplain: Translating Radiology into Patient-Friendly Video Reports

Luyang Luo, Jenanan Vairavamurthy, Xiaoman Zhang, Abhinav Kumar, Ramon R. Ter-Oganesyan, Stuart T. Schroff, Dan Shilo, Rydhwana Hossain, Mike Moritz, Pranav Rajpurkar

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments 12 pages. The project page is https://www.rajpurkarlab.hms.harvard.edu/rexplain

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12087 2024-12-17 cs.CV 57%

Instruction-based Image Manipulation by Watching How Things Move

Mingdeng Cao, Xuaner Zhang, Yinqiang Zheng, Zhihao Xia

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Project page: https://ljzycmd.github.io/projects/InstructMove/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12075 2024-12-17 cs.CV 57%

CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding

Guo Chen, Yicheng Liu, Yifei Huang, Yuping He, Baoqi Pei, Jilan Xu, Yali Wang, Tong Lu, Limin Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11056 2024-12-17 cs.CV 57%

Overview of TREC 2024 Medical Video Question Answering (MedVidQA) Track

Deepak Gupta, Dina Demner-Fushman

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10720 2024-12-17 cs.CV 57%

Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives

Ji-jun Park, Soo-joon Choi

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09907 2024-12-17 cs.CV 57%

IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs

Sosuke Yamao, Natsuki Miyahara, Yuki Harazono, Shun Takeuchi

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments The first and second authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09439 2024-12-13 cs.CV 57%

Towards Robust and Fair Vision Learning in Open-World Environments

Thanh-Dat Truong

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments PhD Dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07704 2024-12-11 cs.CV 57%

GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning

Yicheng Wang, Zhikang Zhang, Jue Wang, David Fan, Zhenlin Xu, Linda Liu, Xiang Hao, Vimal Bhat, Xinyu Li

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14485 2024-12-11 cs.CV 57%

Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding

Yan Shu, Zheng Liu, Peitian Zhang, Minghao Qin, Junjie Zhou, Zhengyang Liang, Tiejun Huang, Bo Zhao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04966 2024-12-11 cs.CV 57%

NewMove: Customizing text-to-video models with novel motions

Joanna Materzynska, Josef Sivic, Eli Shechtman, Antonio Torralba, Richard Zhang, Bryan Russell

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Project page: this website https://joaanna.github.io/customizing_motion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05134 2024-12-09 cs.CV cs.LG 57%

How to Squeeze An Explanation Out of Your Model

Tiago Roxo, Joana C. Costa, Pedro R. M. Inácio, Hugo Proença

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03567 2024-12-05 cs.CV 57%

Streaming Detection of Queried Event Start

Cristobal Eyzaguirre, Eric Tang, Shyamal Buch, Adrien Gaidon, Jiajun Wu, Juan Carlos Niebles

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02805 2024-12-05 cs.CV 57%

STORM: Strategic Orchestration of Modalities for Rare Event Classification

Payal Kamboj, Ayan Banerjee, Sandeep K. S. Gupta

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted in IEEE Asilomar Conference on Signals, Systems, and Computers, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01245 2024-12-03 cs.LG cs.AI 57%

Revisiting Generative Policies: A Simpler Reinforcement Learning Algorithmic Perspective

Jinouwen Zhang, Rongkun Xue, Yazhe Niu, Yun Chen, Jing Yang, Hongsheng Li, Yu Liu

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏