arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2506.01725 2025-06-03 cs.CV 57%

VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking

Desen Meng, Rui Huang, Zhilin Dai, Xinhao Li, Yifan Xu, Jun Zhang, Zhenpeng Huang, Meng Zhang, Lingshu Zhang, Yi Liu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Honor Device Co., Ltd(荣誉设备有限公司)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00993 2025-06-03 cs.CV 57%

FlexSelect: Flexible Token Selection for Efficient Long Video Understanding

Yunzhu Zhang, Yu Lu, Tianyi Wang, Fengyun Rao, Yi Yang, Linchao Zhu

机构 * The College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) WeChat Vision, Tencent Inc(腾讯公司微信视觉团队)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00830 2025-06-03 cs.CV 57%

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers

Zhengcong Fei, Hao Jiang, Di Qiu, Baoxuan Gu, Youqiang Zhang, Jiahua Wang, Jialin Bai, Debang Li, Mingyuan Fan, Guibin Chen, Yahui Zhou

机构 * Kunlun Inc.(昆仑公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24411 2025-06-02 cs.CV 57%

PCIE_Pose Solution for EgoExo4D Pose and Proficiency Estimation Challenge

Feng Chen, Kanokphan Lertniphonphan, Qiancheng Yan, Xiaohui Fan, Jun Xie, Tao Zhang, Zhepeng Wang

机构 * Lenovo Research(联想研究院) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24158 2025-06-02 cs.CV 57%

Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders

Bo Fang, Wenhao Wu, Qiangqiang Wu, Yuxin Song, Antoni B. Chan

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Baidu Inc.(百度公司) University of Sydney(悉尼大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23504 2025-05-30 cs.CV 57%

VAU-R1: Advancing Video Anomaly Understanding via Reinforcement Fine-Tuning

Liyun Zhu, Qixiang Chen, Xi Shen, Xiaodong Cun

机构 * Australian National University(澳大利亚国立大学) GVC Lab, Great Bay University(大湾大学GVC实验室) Intellindust AI Lab(Intellindust AI实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01792 2025-05-30 cs.CV 57%

UniViTAR: Unified Vision Transformer with Native Resolution

Limeng Qiao, Yiyang Gan, Bairui Wang, Jie Qin, Shuang Xu, Siqi Yang, Lin Ma

机构 * Meituan Project(美团项目)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12833 2025-05-29 cs.CV 57%

FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering

Zheng Cheng, Rendong Wang, Zhicheng Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11496 2025-05-28 cs.CV 57%

Cognitive Disentanglement for Referring Multi-Object Tracking

Shaofeng Liang, Runwei Guan, Wangwang Lian, Daizong Liu, Xiaolou Sun, Dongming Wu, Yutao Yue, Weiping Ding, Hui Xiong

机构 * Qingdao Institute of Software, College of Computer Science and Technology, China University of Petroleum (East China)(青岛软件研究所,计算机科学与技术学院,中国石油大学(华东)) Thrust of AI, Hong Kong University of Science and Technology (GuangZhou)(人工智能研究组,香港科学与技术大学(广州)) Shandong Key Laboratory of Intelligent Oil & Gas Industrial Software(山东省智能油气工业软件重点实验室) Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) School of Automation, Southeast University(自动化学院,东南大学) School of Computer Science, Beijing Institute of Technology(计算机科学学院,北京理工大学) School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学) Thrust of Intelligent Transportation, Hong Kong University of Science and Technology (GuangZhou)(智能交通研究组,香港科学与技术大学(广州)) Department of Electrical Engineering and Electronics, University of Liverpool(电子工程与电子学院,利物浦大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20920 2025-05-28 cs.CV 57%

HuMoCon: Concept Discovery for Human Motion Understanding

Qihang Fang, Chengcheng Tang, Bugra Tekin, Shugao Ma, Yanchao Yang

机构 * The University of Hong Kong(香港大学) Meta

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments 18 pages, 10 figures

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20350 2025-05-28 cs.LG cs.AI 57%

Decision Flow Policy Optimization

Jifeng Hu, Sili Huang, Siyuan Guo, Zhaogeng Liu, Li Shen, Lichao Sun, Hechang Chen, Yi Chang, Dacheng Tao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16083 2025-05-26 cs.CV cs.LG 57%

MMInference: Accelerating Pre-filling for Long-Context VLMs via Modality-Aware Permutation Sparse Attention

Yucheng Li, Huiqiang Jiang, Chengruidong Zhang, Qianhui Wu, Xufang Luo, Surin Ahn, Amir H. Abdi, Dongsheng Li, Jianfeng Gao, Yuqing Yang, Lili Qiu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12545 2025-05-22 cs.CL 57%

Towards Reliable and Interpretable Traffic Crash Pattern Prediction and Safety Interventions Using Customized Large Language Models

Yang Zhao, Pu Wang, Yibo Zhao, Hongru Du, Hao Frank Yang

机构 * Center for Systems Science and Engineering(系统科学与工程中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL

Comments Last revised 13 Feb 2025. Under review in Nature portfolio

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01805 2025-05-22 cs.CV 57%

SpaceR: Reinforcing MLLMs in Video Spatial Reasoning

Kun Ouyang, Yuanxin Liu, Haoning Wu, Yi Liu, Hao Zhou, Jie Zhou, Fandong Meng, Xu Sun

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) Nanyang Technological University(南洋理工大学) WeChat AI, Tencent Inc., China(微信AI,腾讯公司,中国)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14640 2025-05-21 cs.CV 57%

VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation

Wentao Ma, Weiming Ren, Yiming Jia, Zhuofeng Li, Ping Nie, Ge Zhang, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) Vector Institute(向量研究所) Shanghai University(上海大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Dataset: https://huggingface.co/datasets/TIGER-Lab/VideoEval-Pro, Project Webpage: https://tiger-ai-lab.github.io/VideoEval-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12826 2025-05-20 cs.CV 57%

Mitigating Hallucination in VideoLLMs via Temporal-Aware Activation Engineering

Jianfeng Cai, Wengang Zhou, Zongmeng Zhang, Jiale Hong, Nianji Zhan, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Merchants Union Consumer Finance Company Limited

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04258 2025-05-19 cs.RO cs.CV 57%

RGB-Event Fusion with Self-Attention for Collision Prediction

Pietro Bonazzi, Christian Vogt, Michael Jost, Haotong Qin, Lyes Khacef, Federico Paredes-Valles, Michele Magno

机构 * ETH Zürich(苏黎世联邦理工学院) Sony Semiconductor Solutions Europe, Sony Europe B.V.(索尼半导体欧洲解决方案,索尼欧洲有限公司)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2504.10400

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10359 2025-05-16 cs.RO cs.CV 57%

NVSPolicy: Adaptive Novel-View Synthesis for Generalizable Language-Conditioned Policy Learning

Le Shi, Yifei Shi, Xin Xu, Tenglong Liu, Junhua Xi, Chengyuan Chen

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08581 2025-05-14 cs.CV eess.IV q-bio.TO 57%

ReSurgSAM2: Referring Segment Anything in Surgical Video via Credible Long-term Tracking

Haofeng Liu, Mingqi Gao, Xuxiao Luo, Ziyue Wang, Guanyi Qin, Junde Wu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学) University of Oxford(牛津大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Early accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06856 2025-05-13 cs.AI cs.RO 57%

Beyond Patterns: Harnessing Causal Logic for Autonomous Driving Trajectory Prediction

Bonan Wang, Haicheng Liao, Chengyue Wang, Bin Rao, Yanchen Guan, Guyang Yu, Jiaxun Zhang, Songning Lai, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Journal ref IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06492 2025-05-13 cs.AI 57%

SmartPilot: A Multiagent CoPilot for Adaptive and Intelligent Manufacturing

Chathurangi Shyalika, Renjith Prasad, Alaa Al Ghazo, Darssan Eswaramoorthi, Harleen Kaur, Sara Shree Muthuselvam, Amit Sheth

机构 * Artificial Intelligence Institute University of South Carolina(人工智能研究所南卡罗来纳大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments 8 pages, 8 figures, 4 tables, IEEE Conference on Artificial Intelligence (IEEE CAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20223 2025-05-13 cs.CV 57%

GTransPDM: A Graph-embedded Transformer with Positional Decoupling for Pedestrian Crossing Intention Prediction

Chen Xie, Ciyun Lin, Xiaoyu Zheng, Bowen Gong, Antonio M. López

机构 * Department of Traffic Information and Control Engineering, Jilin University(交通信息与控制工程系,吉林大学) BIT-Barcelona Innovative Transportation Research Group, Civil Engineering School, UPC Barcelona Tech(巴塞罗那创新交通研究组,土木工程学院,UPC巴塞罗那技术学院) Computer Vision Center (CVC), Computer Science Department, Universitat Autònoma de Barcelona (UAB)(计算机视觉中心(CVC),计算机科学系,巴塞罗那自治大学(UAB))

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments IEEE SPL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03093 2025-05-09 cs.CV 57%

Expanding Event Modality Applications through a Robust CLIP-Based Encoder

Sungheon Jeong, Hanning Chen, Sanggeon Yun, Suhyeon Cho, Wenjun Huang, Xiangjian Liu, Mohsen Imani

机构 * University of California, Irvine(加州大学伊万斯分校) Pusan National University(釜山国立大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03769 2025-05-08 cs.SI cs.AI cs.IR 57%

The Influence of Text Variation on User Engagement in Cross-Platform Content Sharing

Yibo Hu, Yiqiao Jin, Meng Ye, Ajay Divakaran, Srijan Kumar

机构 * Georgia Institute of Technology(佐治亚理工学院) SRI International(SRI国际)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00681 2025-05-02 cs.LG cs.CV 57%

MINERVA: Evaluating Complex Video Reasoning

Arsha Nagrani, Sachit Menon, Ahmet Iscen, Shyamal Buch, Ramin Mehran, Nilpa Jha, Anja Hauth, Yukun Zhu, Carl Vondrick, Mikhail Sirotenko, Cordelia Schmid, Tobias Weyand

机构 * Google DeepMind(谷歌DeepMind) Columbia University(哥伦比亚大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21853 2025-05-01 cs.CV 57%

A Survey of Interactive Generative Video

Jiwen Yu, Yiran Qin, Haoxuan Che, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Hao Chen, Xihui Liu

机构 * The University of Hong Kong, Pok Fu Lam, Hong Kong(香港大学) Kuaishou Technology, Shenzhen, China(快手科技) The Hong Kong University of Science and Technology (HKUST), Hong Kong(香港科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20091 2025-05-01 cs.CV cs.MA 57%

VideoMultiAgents: A Multi-Agent Framework for Video Question Answering

Noriyuki Kugo, Xiang Li, Zixin Li, Ashish Gupta, Arpandeep Khatua, Nidhish Jain, Chaitanya Patel, Yuta Kyuragi, Yasunori Ishii, Masamoto Tanabiki, Kazuki Kozuka, Ehsan Adeli

机构 * Panasonic Connect Co., Ltd.(松下电器(中国)有限公司) Stanford University(斯坦福大学) Panasonic R&D Company of America(松下美国研发公司) Panasonic Holdings Corporation(松下控股公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19828 2025-04-29 cs.CV 57%

HOIGaze: Gaze Estimation During Hand-Object Interactions in Extended Reality Exploiting Eye-Hand-Head Coordination

Zhiming Hu, Daniel Haeufle, Syn Schmitt, Andreas Bulling

机构 * University of Stuttgart Germany(斯图加特大学) University of Tuebingen Germany(图宾根大学) The Center for Bionic Intelligence Tuebingen Stuttgart Germany(图宾根-斯图加特生物智能中心)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted at SIGGRAPH 2025, link: https://zhiminghu.net/hu25_hoigaze.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18478 2025-04-29 cs.CV 57%

Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding

Xiangrui Liu, Yan Shu, Zheng Liu, Ao Li, Yang Tian, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Trento(特伦多大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10195 2025-04-29 cs.CV cs.NE q-bio.NC 57%

ST-FlowNet: An Efficient Spiking Neural Network for Event-Based Optical Flow Estimation

Hongze Sun, Jun Wang, Wuque Cai, Duo Chen, Qianqian Liao, Jiayi He, Yan Cui, Dezhong Yao, Daqing Guo

机构 * Clinical Hospital of Chengdu Brain Science Institute(成都脑科学研究院临床医院) MOE Key Lab for NeuroInformation(教育部神经信息关键实验室) China-Cuba Belt and Road Joint Laboratory on Neurotechnology and Brain-Apparatus Communication(中 cuba 带路神经技术与脑-装置通信联合实验室) School of Life Science and Technology, University of Electronic Science and Technology of China(电子科技大学生命科学与技术学院) School of Artificial Intelligence, Chongqing University of Education(重庆教育学院人工智能学院) Sichuan Academy of Medical Sciences and Sichuan Provincial People’s Hospital(四川省医学科学院和四川省人民医院) Research Unit of NeuroInformation (2019RU035), Chinese Academy of Medical Sciences(神经信息研究单位(2019RU035),中国医学科学院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments 13 pages, 6 figures, 6 tables; This work has been submitted to Neural Networks for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏