arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4728 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4728 篇

2503.12964 2025-03-18 cs.CV cs.AI cs.LG 62%

Training Video Foundation Models with NVIDIA NeMo

Zeeshan Patel, Ethan He, Parth Mannan, Xiaowei Ren, Ryan Wolf, Niket Agarwal, Jacob Huffman, Zhuoyao Wang, Carl Wang, Jack Chang, Yan Bai, Tommy Huang, Linnan Wang, Sahil Jain, Shanmugam Ramasamy, Joseph Jennings, Ekaterina Sirazitdinova, Oleg Sudakov, Mingyuan Ma, Bobby Chen, Forrest Lin, Hao Wang, Vasanth Rao Naik Sabavat, Sriharsha Niverty, Rong Ou, Pallab Bhattacharya, David Page, Nima Tajbakhsh, Ashwath Aithal

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10625 2025-03-14 cs.CV cs.AI 62%

LHM: Large Animatable Human Reconstruction Model from a Single Image in Seconds

Lingteng Qiu, Xiaodong Gu, Peihao Li, Qi Zuo, Weichao Shen, Junfei Zhang, Kejie Qiu, Weihao Yuan, Guanying Chen, Zilong Dong, Liefeng Bo

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://lingtengqiu.github.io/LHM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10075 2025-03-14 cs.CV cs.AI 62%

HecVL: Hierarchical Video-Language Pretraining for Zero-shot Surgical Phase Recognition

Kun Yuan, Vinkle Srivastav, Nassir Navab, Nicolas Padoy

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by MICCAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11584 2025-03-14 cs.RO cs.AI cs.CV 62%

DeformPAM: Data-Efficient Learning for Long-horizon Deformable Object Manipulation via Preference-based Action Alignment

Wendi Chen, Han Xue, Fangyuan Zhou, Yuan Fang, Cewu Lu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICRA 2025. Project page: https://deform-pam.robotflow.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07860 2025-03-12 cs.CV cs.AI cs.LG 62%

Video Action Differencing

James Burgess, Xiaohan Wang, Yuhui Zhang, Anita Rau, Alejandro Lozano, Lisa Dunlap, Trevor Darrell, Serena Yeung-Levy

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments ICLR 2025 (International Conference on Learning Representations) Project page: http://jmhb0.github.io/viddiff Benchmark: https://huggingface.co/datasets/jmhb/VidDiffBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00054 2025-03-04 cs.CV cs.AI cs.LG 62%

Deciphering the complaint aspects: Towards an aspect-based complaint identification model with video complaint dataset in finance

Sarmistha Das, Basha Mujavarsheik, R E Zera Lyngkhoi, Sriparna Saha, Alka Maurya

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21271 2025-03-03 cs.CV cs.AI cs.LG 62%

Adaptive Keyframe Sampling for Long Video Understanding

Xi Tang, Jihao Qiu, Lingxi Xie, Yunjie Tian, Jianbin Jiao, Qixiang Ye

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19026 2025-02-27 eess.IV cs.AI cs.CV 62%

InternVQA: Advancing Compressed Video Quality Assessment with Distilling Large Foundation Model

Fengbin Guan, Zihao Yu, Yiting Lu, Xin Li, Zhibo Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ISCAS 2025(Lecture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16602 2025-02-25 cs.CV cs.AI 62%

VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs

Yiming Yang, Yangyang Guo, Hui Lu, Yan Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13845 2025-02-25 cs.CV cs.AI cs.LG 62%

Do Language Models Understand Time?

Xi Ding, Lei Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted for publication in the Companion Proceedings of the ACM Web Conference (WWW Companion 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12081 2025-02-18 cs.CV cs.CL 62%

Unhackable Temporal Rewarding for Scalable Video MLLMs

En Yu, Kangheng Lin, Liang Zhao, Yana Wei, Zining Zhu, Haoran Wei, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Jingyu Wang, Wenbing Tao

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV、cs.CL

Comments Accepted by ICLR2025. Project Page: https://ahnsun.github.io/UTR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11168 2025-02-18 cs.CV cs.AI 62%

Knowing Your Target: Target-Aware Transformer Makes Better Spatio-Temporal Video Grounding

Xin Gu, Yaojie Shen, Chenxi Luo, Tiejian Luo, Yan Huang, Yuewei Lin, Heng Fan, Libo Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18538 2025-02-12 cs.CV cs.AI eess.IV 62%

VideoQA-SC: Adaptive Semantic Communication for Video Question Answering

Jiangyuan Guo, Wei Chen, Yuxuan Sun, Jialong Xu, Bo Ai

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11619 2025-02-11 cs.CV cs.CL 62%

MultiVENT 2.0: A Massive Multilingual Benchmark for Event-Centric Video Retrieval

Reno Kriz, Kate Sanders, David Etter, Kenton Murray, Cameron Carpenter, Kelly Van Ochten, Hannah Recknor, Jimena Guallar-Blasco, Alexander Martin, Ronald Colaianni, Nolan King, Eugene Yang, Benjamin Van Durme

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17643 2025-01-30 cs.CL cs.AI 62%

Tonguescape: Exploring Language Models Understanding of Vowel Articulation

Haruki Sakajo, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11775 2025-01-28 cs.CV cs.AI 62%

Task Me Anything

Jieyu Zhang, Weikai Huang, Zixian Ma, Oscar Michel, Dong He, Tanmay Gupta, Wei-Chiu Ma, Ali Farhadi, Aniruddha Kembhavi, Ranjay Krishna

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2024 Track on Datasets and Benchmarks. Website: https://www.task-me-anything.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13976 2025-01-27 cs.CL cs.AI cs.CY cs.SI 62%

Towards Safer Social Media Platforms: Scalable and Performant Few-Shot Harmful Content Moderation Using Large Language Models

Akash Bonagiri, Lucen Li, Rajvardhan Oak, Zeerak Babar, Magdalena Wojcieszak, Anshuman Chhabra

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments This paper is in submission and under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13536 2025-01-24 cs.CV cs.CL 62%

ReasVQA: Advancing VideoQA with Imperfect Reasoning Process

Jianxin Liang, Xiaojun Meng, Huishuai Zhang, Yueqian Wang, Jiansheng Wei, Dongyan Zhao

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted to main conference at NAACL 2025; 8 pages;

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13468 2025-01-24 cs.CV cs.AI 62%

Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge

Haomiao Xiong, Zongxin Yang, Jiazuo Yu, Yunzhi Zhuge, Lu Zhang, Jiawen Zhu, Huchuan Lu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICLR 2025. Code is available at https://github.com/hmxiong/StreamChat

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09582 2025-01-22 cs.LG cs.AI cs.CV 62%

Neptune: The Long Orbit to Benchmarking Long Video Understanding

Arsha Nagrani, Mingda Zhang, Ramin Mehran, Rachel Hornung, Nitesh Bharadwaj Gundavarapu, Nilpa Jha, Austin Myers, Xingyi Zhou, Boqing Gong, Cordelia Schmid, Mikhail Sirotenko, Yukun Zhu, Tobias Weyand

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07978 2025-01-15 cs.CV cs.AI 62%

Facial Dynamics in Video: Instruction Tuning for Improved Facial Expression Perception and Contextual Awareness

Jiaxing Zhao, Boyuan Sun, Xiang Chen, Xihan Wei

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08195 2025-01-14 cs.AI cs.CL cs.MA 62%

A Text-to-Game Engine for UGC-Based Role-Playing Games

Lei Zhang, Xuezheng Peng, Shuyi Yang, Feiyang Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20064 2024-12-31 cs.CV cs.AI cs.NE 62%

VELoRA: A Low-Rank Adaptation Approach for Efficient RGB-Event based Recognition

Lan Chen, Haoxiang Yang, Pengpeng Shao, Haoyu Song, Xiao Wang, Zhicheng Zhao, Yaowei Wang, Yonghong Tian

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments In Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17238 2024-12-24 cs.CV cs.MM 62%

Modality-Aware Shot Relating and Comparing for Video Scene Detection

Jiawei Tan, Hongxing Wang, Kang Dang, Jiaxin Li, Zhilong Ou

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07024 2024-12-20 cs.CV cs.AI 62%

Exploring Scalability of Self-Training for Open-Vocabulary Temporal Action Localization

Jeongseok Hyun, Su Ho Han, Hyolim Kang, Joon-Young Lee, Seon Joo Kim

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13454 2024-12-19 cs.CV cs.AI 62%

Pre-training a Density-Aware Pose Transformer for Robust LiDAR-based 3D Human Pose Estimation

Xiaoqi An, Lin Zhao, Chen Gong, Jun Li, Jian Yang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06618 2024-12-17 cs.CV cs.IR cs.MM 62%

Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval

Jian Xiao, Zhenzhen Hu, Jia Li, Richang Hong

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09991 2024-12-16 cs.CV cs.AI 62%

Visual Object Tracking across Diverse Data Modalities: A Review

Mengmeng Wang, Teli Ma, Shuo Xin, Xiaojun Hou, Jiazheng Xing, Guang Dai, Jingdong Wang, Yong Liu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10188 2024-12-16 cs.CV cs.CL 62%

LongVILA: Scaling Long-Context Visual Language Models for Long Videos

Yukang Chen, Fuzhao Xue, Dacheng Li, Qinghao Hu, Ligeng Zhu, Xiuyu Li, Yunhao Fang, Haotian Tang, Shang Yang, Zhijian Liu, Ethan He, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Linxi Fan, Yuke Zhu, Yao Lu, Song Han

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Code and models are available at https://github.com/NVlabs/VILA/tree/main/longvila

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09627 2024-12-13 cs.CV cs.AI cs.LG 62%

Doe-1: Closed-Loop Autonomous Driving with Large World Model

Wenzhao Zheng, Zetian Xia, Yuanhui Huang, Sicheng Zuo, Jie Zhou, Jiwen Lu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Code is available at: https://github.com/wzzheng/Doe

详情

展开后加载摘要…

URL PDF HTML 收藏