arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2504.08771 2025-09-23 cs.IR cs.AI 57%

Generate the browsing process for short-video recommendation

Chao Feng, Yanze Zhang, Chenghao Zhang

机构 * Kuaishou Technology(快手科技)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15448 2025-09-22 cs.LG cs.AI cs.NE stat.ML 57%

Hierarchical Self-Attention: Generalizing Neural Attention Mechanics to Multi-Scale Problems

Saeed Amizadeh, Sara Abdali, Yinheng Li, Kazuhito Koishida

机构 * Microsoft Redmond, WA 98052(微软红mond分校)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments In The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12741 2025-09-17 cs.RO cs.AI cs.LG 57%

Force-Modulated Visual Policy for Robot-Assisted Dressing with Arm Motions

Alexis Yihong Hao, Yufei Wang, Navin Sriram Ravie, Bharath Hegde, David Held, Zackory Erickson

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院Madras分校工程设计系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11796 2025-09-16 cs.CV 57%

FineQuest: Adaptive Knowledge-Assisted Sports Video Understanding via Agent-of-Thoughts Reasoning

Haodong Chen, Haojian Huang, XinXiang Yin, Dian Shao

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) The University of Hong Kong(香港大学) School of Software, Northwestern Polytechnical University(软件学院,西北工业大学) Unmanned System Research Institute, Northwestern Polytechnical University(无人系统研究院,西北工业大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09804 2025-09-15 cs.CL 57%

Pragmatic Frames Evoked by Gestures: A FrameNet Brasil Approach to Multimodality in Turn Organization

Helen de Andrade Abreu, Tiago Timponi Torrent, Ely Edison da Silva Matos

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

Comments Paper submitted to Language Sciences Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09584 2025-09-12 cs.CV cs.RO 57%

Visual Grounding from Event Cameras

Lingdong Kong, Dongyue Lu, Ao Liang, Rong Li, Yuhao Dong, Tianshuai Hu, Lai Xing Ng, Wei Tsang Ooi, Benoit R. Cottereau

机构 * NUS(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) NTU(南洋理工大学) HKUST(香港科技大学) I 2 R, A*STAR(新加坡科技研究局) IPAL, CNRS(法国国家科学研究中心IPAL) CerCo, CNRS(法国国家科学研究中心CerCo)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Abstract Paper (Non-Archival) @ ICCV 2025 NeVi Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09263 2025-09-12 cs.CV 57%

DATE: Dynamic Absolute Time Enhancement for Long Video Understanding

Chao Yuan, Yang Yang, Yehui Yang, Zach Cheng

机构 * Beihang University(北京航空航天大学) Dcar, ByteDance(字节跳动Dcar部门) Qfin Holdings,Inc(Qfin控股公司) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08354 2025-09-11 cs.RO cs.AI 57%

Grasp Like Humans: Learning Generalizable Multi-Fingered Grasping from Human Proprioceptive Sensorimotor Integration

Ce Guo, Xieyuanli Chen, Zhiwen Zeng, Zirui Guo, Yihong Li, Haoran Xiao, Dewen Hu, Huimin Lu

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments 20 pages, 19 figures, accepted by IEEE Transactions on Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16013 2025-09-10 cs.RO cs.CV 57%

GraspCoT: Integrating Physical Property Reasoning for 6-DoF Grasping under Flexible Language Instructions

Xiaomeng Chu, Jiajun Deng, Guoliang You, Wei Liu, Xingchen Li, Jianmin Ji, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) The University of Adelaide(阿德莱德大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06023 2025-09-09 cs.CV 57%

DVLO4D: Deep Visual-Lidar Odometry with Sparse Spatial-temporal Fusion

Mengmeng Liu, Michael Ying Yang, Jiuming Liu, Yunpeng Zhang, Jiangtao Li, Sander Oude Elberink, George Vosselman, Hao Cheng

机构 * University of Twente(特文特大学) University of Bath(巴斯大学) Shanghai Jiao Tong University(上海交通大学) PhiGent Robotics(PhiGent机器人)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01563 2025-09-09 cs.CV 57%

Kwai Keye-VL 1.5 Technical Report

Biao Yang, Bin Wen, Boyang Ding, Changyi Liu, Chenglong Chu, Chengru Song, Chongling Rao, Chuan Yi, Da Li, Dunju Zang, Fan Yang, Guorui Zhou, Guowang Zhang, Han Shen, Hao Peng, Haojie Ding, Hao Wang, Haonan Fan, Hengrui Ju, Jiaming Huang, Jiangxia Cao, Jiankang Chen, Jingyun Hua, Kaibing Chen, Kaiyu Jiang, Kaiyu Tang, Kun Gai, Muhao Wei, Qiang Wang, Ruitao Wang, Sen Na, Shengnan Zhang, Siyang Mao, Sui Huang, Tianke Zhang, Tingting Gao, Wei Chen, Wei Yuan, Xiangyu Wu, Xiao Hu, Xingyu Lu, Yi-Fan Zhang, Yiping Yang, Yulong Chen, Zeyi Lu, Zhenhua Wu, Zhixin Ling, Zhuoran Yang, Ziming Li, Di Xu, Haixuan Gao, Hang Li, Jing Wang, Lejian Ren, Qigen Hu, Qianqian Wang, Shiyao Wang, Xinchen Luo, Yan Li, Yuhang Hu, Zixing Zhang

机构 * Keye Team, Kuaishou Group(快手集团Keye团队)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Github page: https://github.com/Kwai-Keye/Keye

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09423 2025-09-09 cs.RO cs.CV 57%

Efficient Alignment of Unconditioned Action Prior for Language-conditioned Pick and Place in Clutter

Kechun Xu, Xunlong Xia, Kaixuan Wang, Yifei Yang, Yunxuan Mao, Bing Deng, Jieping Ye, Rong Xiong, Yue Wang

机构 * Zhejiang University and Alibaba Cloud(浙江大学和阿里云) Alibaba Cloud(阿里云) Zhejiang University(浙江大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by T-ASE and CoRL25 GenPriors Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15298 2025-09-08 cs.CV 57%

TPA: Temporal Prompt Alignment for Fetal Congenital Heart Defect Classification

Darya Taratynova, Alya Almsouti, Beknur Kalmakhanbet, Numan Saeed, Mohammad Yaqub

机构 * Department of Machine Learning Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) Abu Dhabi, UAE(机器学习系,Mohamed bin Zayed人工智能大学(MBZUAI),阿布扎比,阿联酋) Department of Computer Vision Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) Abu Dhabi, UAE(计算机视觉系,Mohamed bin Zayed人工智能大学(MBZUAI),阿布扎比,阿联酋)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.03496 2025-09-08 cs.HC cs.AI 57%

Evaluating Temporal Patterns in Applied Infant Affect Recognition

Allen Chang, Lauren Klein, Marcelo R. Rosales, Weiyang Deng, Beth A. Smith, Maja J. Matarić

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments 8 pages, 6 figures, 10th International Conference on Affective Computing and Intelligent Interaction (ACII 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18724 2025-09-08 cs.CL 57%

Large Language Models with Temporal Reasoning for Longitudinal Clinical Summarization and Prediction

Maya Kruse, Shiyue Hu, Nicholas Derby, Yifu Wu, Samantha Stonbraker, Bingsheng Yao, Dakuo Wang, Elizabeth Goldberg, Yanjun Gao

机构 * University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医学校园) University of Colorado Boulder(科罗拉多大学波德分校) Northeastern University(东北大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04117 2025-09-05 cs.CV 57%

DVS-PedX: Synthetic-and-Real Event-Based Pedestrian Dataset

Mustafa Sakhai, Kaung Sithu, Min Khant Soe Oke, Maciej Wielgosz

机构 * Faculty of Computer Science, Electronics and Telecommunications(计算机科学与电子技术学院) AGH University of Science and Technology(AGH科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 12 pages, 8 figures, 3 tables; dataset descriptor paper introducing DVS-PedX (synthetic-and-real event-based pedestrian dataset with baselines) External URL: https://doi.org/10.5281/zenodo.17030898

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16834 2025-09-03 cs.LG cs.AI physics.ao-ph 57%

Improving Significant Wave Height Prediction Using Chronos Models

Yilin Zhai, Hongyuan Shi, Chao Zhan, Qing Wang, Zaijin You, Nan Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments arXiv admin note: text overlap with arXiv:2403.07815 by other authors

Journal ref Ocean Engineering, Volume 341, Part 2, 1 December 2025, Article 122502

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21070 2025-08-29 cs.CV cs.LG 57%

Dress&Dance: Dress up and Dance as You Like It - Technical Preview

Jun-Kun Chen, Aayush Bansal, Minh Phuoc Vo, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) SpreeAI

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Project Page: https://immortalco.github.io/DressAndDance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19639 2025-08-28 cs.MM 57%

FakeSV-VLM: Taming VLM for Detecting Fake Short-Video News via Progressive Mixture-Of-Experts Adapter

Junxi Wang, Yaxiong Wang, Lechao Cheng, Zhun Zhong

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18922 2025-08-27 cs.LG cs.AI 57%

HierCVAE: Hierarchical Attention-Driven Conditional Variational Autoencoders for Multi-Scale Temporal Modeling

Yao Wu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18904 2025-08-27 cs.CV 57%

Event-Enriched Image Analysis Grand Challenge at ACM Multimedia 2025

Thien-Phuc Tran, Minh-Quang Nguyen, Minh-Triet Tran, Tam V. Nguyen, Trong-Le Do, Duy-Nam Ly, Viet-Tham Huynh, Khanh-Duy Le, Mai-Khiem Tran, Trung-Nghia Le

机构 * University of Science(科学大学) University of Dayton(代顿大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17442 2025-08-26 cs.CV 57%

Multi-Level LVLM Guidance for Untrimmed Video Action Recognition

Liyang Peng, Sihan Zhu, Yunjie Guo

机构 * Kunming University of Science and Technology(昆明理工大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16287 2025-08-26 cs.CV 57%

Beyond Label Semantics: Language-Guided Action Anatomy for Few-shot Action Recognition

Zefeng Qian, Xincheng Yao, Yifei Huang, Chongyang Zhang, Jiangyong Ying, Hong Sun

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室) The University of Tokyo(东京大学) Shanghai AI Laboratory(上海人工智能实验室) E-surfing Vision Technology Co., Ltd(亿欧视觉科技有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15885 2025-08-26 cs.AI 57%

VLASCD: A Visual Language Action Model for Simultaneous Chatting and Decision Making

Zuojin Tang, Bin Hu, Chenyang Zhao, De Ma, Gang Pan, Bin Liu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Home Robotics Lab, E-surfing Digital Life Technology Co., Ltd., China Telecom(E-surfing数字生活技术有限公司) Zhejiang Lab(浙江实验室) Trinity College Dublin(都柏林大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments Accepted by EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16648 2025-08-26 cs.LG cs.AI physics.flu-dyn 57%

LatentFlow: Cross-Frequency Experimental Flow Reconstruction from Sparse Pressure via Latent Mapping

Junle Liu, Chang Liu, Yanyu Ke, Qiuxiang Huang, Jiachen Zhao, Wenliang Chen, K. T. Tse, Gang Hu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

Comments The paper is submitted to IAAI26. Total 9 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16126 2025-08-25 cs.IR cs.AI 57%

Spacetime-GR: A Spacetime-Aware Generative Model for Large Scale Online POI Recommendation

Haitao Lin, Zhen Yang, Jiawei Xue, Ziji Zhang, Luzhu Wang, Yikun Gu, Yao Xu, Xin Li

机构 * AMAP, Alibaba Group(阿里集团AMAP)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15903 2025-08-25 cs.CV 57%

VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos

Kaining Li, Shuwei He, Zihan Xu

机构 * Xidian University(西电大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11988 2025-08-22 cs.CV 57%

Exploring Spatial-Temporal Dynamics in Event-based Facial Micro-Expression Analysis

Nicolas Mastropasqua, Ignacio Bugueno-Cordova, Rodrigo Verschae, Daniel Acevedo, Pablo Negri, Maria E. Buemi

机构 * Universidad de Buenos Aires, Facultad de Ciencias Exactas y Naturales(布宜诺斯艾利斯大学,精确科学与自然学院) Institute of Engineering Sciences, Universidad de O’Higgins(工程科学研究所,奥希金斯大学) CONICET-UBA, Instituto de Ciencias de la Computacion (ICC)(CONICET-UBA,计算科学研究所) L3S Research Center, Leibniz Universität Hannover(L3S研究中心,汉诺威莱布尼茨大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW); 2nd Workshop on Neuromorphic Vision (NeVi)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15036 2025-08-22 cs.CR cs.AI 57%

MoEcho: Exploiting Side-Channel Attacks to Compromise User Privacy in Mixture-of-Experts LLMs

Ruyi Ding, Tianhong Xu, Xinyi Shen, Aidong Adam Ding, Yunsi Fei

机构 * Louisiana State University(路易斯安那州立大学) Northeastern University(东北大学) Yale University(耶鲁大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments This paper will appear in CCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14609 2025-08-21 cs.CV 57%

AnchorSync: Global Consistency Optimization for Long Video Editing

Zichi Liu, Yinggui Wang, Tao Wei, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute Shanghai Jiao Tong University Shanghai China(人工智能联合实验室,人工智能研究院,上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments ACM MM 2025; Code is released at https://github.com/VISION-SJTU/AnchorSync

详情

展开后加载摘要…

URL PDF HTML 收藏