arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4699 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4699 篇

2507.14632 2026-06-17 cs.CV 版本更新 91%

BusterX++: Towards Unified Cross-Modal AI-Generated Content Detection and Explanation with MLLM

BusterX++: 迈向基于MLLM的统一跨模态AI生成内容检测与解释

Haiquan Wen, Tianxiao Li, Zhenglin Huang, Yiwei He, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学)

专题命中 视频多模态 :MLLM(title,title_cn);cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出统一多模态大模型BusterX++,通过纯强化学习策略实现图像与视频伪造检测的跨模态能力迁移,性能超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18558 2026-06-29 cs.CV cs.AI 版本更新 91%

HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

HiMu: 面向长视频问答的分层多模态帧选择

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学INSIGHT实验室,以色列) Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学,以色列)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 提出HiMu框架,通过文本LLM将查询分解为层次逻辑树,由视觉和音频专家处理原子谓词,经模糊逻辑算子组合生成连续帧满意度曲线,在16帧预算下达到帧选择方法的最优精度,并作为即插即用模块提升多种MLLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20818 2026-05-21 cs.CV 91%

OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

Yisen Feng, Leigang Qu, Haoyu Zhang, Qiaohui Chu, Meng Liu, Xuemeng Song, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) National University of Singapore(新加坡国立大学) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学) Southern University of Science and Technology(南方科技大学)

专题命中 视频多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于多模态大语言模型(MLLM)的重排序框架,用于解决Ego4D事件记忆挑战2026中的自然语言查询和目标步 tracks,通过结合现有定位模型OSGNet的候选片段和MLLM的视频-语言推理能力,提升时间片段的定位精度。

Comments Champion solution for the Natural Language Queries and GoalStep tracks of the Ego4D Challenge at the CVPR EgoVis Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10819 2026-06-10 cs.CV cs.AI 新提交 90%

Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

Earth-OneVision:将遥感多模态大语言模型扩展到更多传感器模态和任务

Miaoxin Cai, Guanqun Wang, Wei Zhang, Guangyao Zhou, Yin Zhuang, Tong Zhang, Hao Wang, He Chen, Jun Li

机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing (SBIIP), Beijing Institute of Technology(北京理工大学空间智能信息处理国家重点实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) Key Laboratory of Technology in Geo-Spatial Information Processing and Application System, Chinese Academy of Sciences(中国科学院地理空间信息处理与应用系统技术重点实验室) Advanced Research Institute of Multidisciplinary Sciences, Beijing Institute of Technology(北京理工大学前沿交叉科学研究院) School of Mechatronical Engineering, Beijing Institute of Technology(北京理工大学机电学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) School of Electronics, Peking University(北京大学电子学院) School of Computer Science and Hubei Key Laboratory of Intelligent Geo-Information Processing(华中科技大学计算机科学与技术学院&湖北省智能地理信息处理重点实验室)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出Earth-OneVision,一个2B参数的RS-MLLM,通过全粒度视觉语言对齐、空间语言同构序列化和渐进式跨模态适应机制,统一六种传感器模态和九类任务,在多个基准上达到或超越4B-72B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26104 2026-05-26 cs.CV 90%

EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding

EVIDENT: 通过实体锚定的视觉证据路由MLLM适配用于跨域视频时间定位

Geo Ahn, Jiwook Han, Youngrae Kim, Joonseok Lee, Jinwoo Choi

机构 * Kyung Hee University(庆尚大学) University of Southern California(南加州大学) Seoul National University(首尔国立大学)

专题命中 视频多模态 :MLLM(title,title_cn);分类 cs.CV

AI总结 针对视频时间定位中域迁移导致性能下降的问题,提出EVIDENT框架,通过实体瓶颈适配器、实体绑定蒸馏损失和实体到证据门控机制,利用预训练MLLM的实体注意力实现参数高效的跨域鲁棒时间定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.02662 2022-01-06 cs.CV 89%

Deep Semantic Multimodal Hashing Network for Scalable Image-Text and Video-Text Retrievals

Lu Jin, Zechao Li, Jinhui Tang

专题命中 视频多模态 :multimodal(title,abstract);image-text(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03727 2025-10-07 cs.AI cs.CL cs.CV cs.LG 89%

Bridging the Gap Between Multimodal Foundation Models and World Models

Xuehai He

机构 * Computer Science and Engineering University of California, Santa Cruz(计算机科学与工程大学加州大学圣克ruz分校)

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04751 2025-09-08 cs.IR cs.LG 89%

Multimodal Foundation Model-Driven User Interest Modeling and Behavior Analysis on Short Video Platforms

Yushang Zhao, Yike Peng, Li Zhang, Qianyi Sun, Zhihui Zhang, Yingying Zhuang

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23266 2025-08-26 cs.CV cs.AI cs.CL 89%

TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models

Ziyao Shangguan, Chuhan Li, Yuxuan Ding, Yanan Zheng, Yilun Zhao, Tesca Fitzgerald, Arman Cohan

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18716 2026-07-22 cs.CV 新提交 89%

Continual Video-MLLM Adaptation over Evolving Domains

在不断演变的领域上进行连续视频 - MLLM 适应

Rui Cheng, Meixing Shi, Yuxiang Cai, Jingcai Guo, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

专题命中 视频多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 研究视频多模态大语言模型对不断演变领域的适应问题,提出分布感知专家路由框架 DAER,通过保持领域隔离的轻量级专家、引入多种路由和优化机制,在域增量基准上评估,结果优于现有方法。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18217 2026-07-22 cs.CV 版本更新 89%

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement

HOMIE:通过多模态智能增强实现以人为对象的视频个性化

Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV

AI总结 研究以人为对象的视频个性化问题,提出HOMIE框架,统一处理主体间和主体内输入设置。通过更好的MLLM集成策略、自注意力中的全局多模态引导及模态参考嵌入,在多任务中达最优性能。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15689 2026-07-20 cs.CV 新提交 89%

Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors

基于注意力的MLLM选择器在测试时对长视频进行高效帧选择

Yilin Wang, Xiangxi Zheng, Dongxing Mao, Linjie Li, Zhengyuan Yang, Ping Yu, Rui Yan, Yuan Yao, Alex Jinpeng Wang

机构 * ZJU(浙江大学) NJU(南京大学) CSU(中南大学) Microsoft(微软公司) NJUST(南京理工大学)

专题命中 视频多模态 :MLLM(title,title_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究利用MLLMs中验证选择提取层的跨模态注意力构建无训练的DAFS帧选择器,通过查询条件聚合提取帧级证据,将候选池大小和每帧令牌预算联合分配问题用动态规划解决,在Video-MME上表现出色,且无需重新训练即可跨多种模型和任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07850 2026-01-14 cs.MM cs.CV 88%

MLLM-VADStory: Domain Knowledge-Driven Multimodal LLMs for Video Ad Storyline Insights

MLLM-VADStory: 基于领域知识的多模态大语言模型用于视频广告剧情洞察

Jasmine Yang, Poppy Zhang, Shawndra Hill

机构 * Meta

专题命中 视频多模态 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CV、cs.MM

AI总结 MLLM-VADStory通过领域知识引导多模态大语言模型,系统量化和生成视频广告剧情洞察,提升视频广告创意效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09086 2024-09-17 cs.LG cs.AI cs.CV cs.DC cs.PF 88%

Inf-MLLM: Efficient Streaming Inference of Multimodal Large Language Models on a Single GPU

Zhenyu Ning, Jieru Zhao, Qihao Jin, Wenchao Ding, Minyi Guo

专题命中 视频多模态 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13954 2022-08-31 cs.CV cs.SD eess.AS 88%

Video-based Cross-modal Auxiliary Network for Multimodal Sentiment Analysis

Rongfei Chen, Wenju Zhou, Yang Li, Huiyu Zhou

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12322 2026-07-13 cs.CV 版本更新 88%

Zero-shot 3D General Obstacle Detection via Multimodal Foundation Models and Geometry

通过多模态基础模型和几何进行零样本3D通用障碍物检测

Tamás Matuszka, Péter Hajas, Dávid Szeghy

机构 * aiMotive

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV

AI总结 针对自动驾驶中通用障碍物检测难题,提出结合多模态基础模型与几何推理的免训练零样本方法,能精准定位达100米,借基础模型先验提升召回率,还可实现可扩展自动标注。

Comments Accepted to CVPR 2026 AUTOPILOT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29425 2026-05-29 cs.AI 88%

ReasonLight: A Multimodal Foundation Model-Enhanced Reinforcement Learning Framework for Zero-Shot Traffic Signal Control

ReasonLight: 一种多模态基础模型增强的强化学习框架用于零样本交通信号控制

Aoyu Pang, Maonan Wang, Yuejiao Xie, Chung Shue Chen, Zhiwei Yang, Man-On Pun

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong, Hong Kong(香港中文大学机械与自动化工程系) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室) Nokia Bell Labs, Paris-Saclay, France(法国巴黎萨克雷诺基贝尔实验室)

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.AI

AI总结 提出ReasonLight框架,通过多模态基础模型增强强化学习,利用路侧传感器和摄像头数据实现零样本适应罕见交通事件,显著降低紧急车辆等待时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00209 2026-02-03 cs.MM 88%

Divide and Conquer: Multimodal Video Deepfake Detection via Cross-Modal Fusion and Localization

分而治之:通过跨模态融合与定位实现多模态视频深度伪造检测

Qingcao Li, Miao He, Liang Yi, Qing Wen, Yitao Zhang, Hongshuo Jin, Peng Cheng, Zhongjie Ba, Li Lu, Kui Ren

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(title);audio-visual(abstract);分类 cs.MM

AI总结 本文提出一种通过跨模态融合与定位实现多模态视频深度伪造检测的系统,通过音频和视觉模块的融合提升检测鲁棒性。

Comments The 3rd Place, IJCAI 2025 Workshop on Deepfake Detection, Localization, and Interpretability

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00696 2025-11-10 cs.LG cs.AI 88%

CTPD: Cross-Modal Temporal Pattern Discovery for Enhanced Multimodal Electronic Health Records Analysis

Fuying Wang, Feng Wu, Yihan Tang, Lequan Yu

机构 * Department of Statistics and Actuarial Science, School of Computing and Data Science, The University of Hong Kong(统计与精算学系,计算与数据科学学院,香港大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19406 2024-12-30 cs.CV 88%

MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios

Jiaqi Fan, Jianhua Wu, Jincheng Gao, Jianhao Yu, Yafei Wang, Hongqing Chu, Bingzhao Gao

专题命中 视频多模态 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12628 2024-12-19 cs.CV 88%

Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration

Ziheng Zhou, Jinxing Zhou, Wei Qian, Shengeng Tang, Xiaojun Chang, Dan Guo

专题命中 视频多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV

Comments Accepted by AAAI 2025. Project page: https://github.com/zzhhfut/CCNet-AAAI2025. Jinxing Zhou and Dan Guo are the corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00103 2024-12-03 cs.RO cs.AI cs.LG 88%

MLLM-Search: A Zero-Shot Approach to Finding People using Multimodal Large Language Models

Angus Fung, Aaron Hao Tan, Haitong Wang, Beno Benhabib, Goldie Nejat

专题命中 视频多模态 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.12374 2022-07-13 cs.CV 88%

MM-Pyramid: Multimodal Pyramid Attentional Network for Audio-Visual Event Localization and Video Parsing

Jiashuo Yu, Ying Cheng, Rui-Wei Zhao, Rui Feng, Yuejie Zhang

专题命中 视频多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV

Comments ACM MM 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.03501 2020-06-09 cs.CV cs.LG 88%

Cross-modal Learning for Multi-modal Video Categorization

Palash Goyal, Saurabh Sahu, Shalini Ghosh, Chul Lee

专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18552 2025-07-25 cs.CV cs.AI 88%

VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding

Baoyao Yang, Wanyun Li, Dixin Chen, Junxiang Chen, Wenbin Yao, Haifeng Lin

机构 * Guangdong University of Technology(广东工业大学) Wechat, Tencent(微信、腾讯)

专题命中 视频多模态 :omni-modal(title,abstract);multi-modal(abstract);MLLM(abstract);cross-modal(abstract)

Comments 7 pages; 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07433 2026-06-08 cs.CV cs.AI cs.MM 新提交 88%

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解

Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) CASIA(中国科学院自动化研究所) University of Tokyo(东京大学) University of Liverpool(利物浦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) UC Merced(加州大学默塞德分校)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出人类视角下视频理解的三个功能能力(观看、记忆、推理),构建统一框架分析视频MLLM的感知、记忆、推理和预测,并总结挑战、方法、应用及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25678 2026-03-03 cs.LG 88%

Massively Multimodal Foundation Models: A Framework for Capturing Interactions with Specialized Mixture-of-Experts

大规模多模态基础模型:一种捕捉交互的专用专家混合框架

Xing Han, Hsing-Huan Chung, Joydeep Ghosh, Paul Pu Liang, Suchi Saria

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title);cross-modal(abstract)

AI总结 本文提出了一种大规模多模态基础模型框架,通过量化模态间的时间依赖性,改进混合专家路由机制,提升跨模态交互处理能力。

Comments Published at International Conference on Learning Representations (ICLR) 2026 as a conference paper. 28 pages, 16 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04073 2026-01-08 cs.CV cs.AI cs.CL 88%

Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts

在跨模态冲突下分析大型多模态模型的推理一致性

Zhihao Zhu, Jiafeng Liang, Shixin Jiang, Jinlan Fu, Ming Liu, Guanglu Sun, See-Kiong Ng, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出逻辑图扰动协议,通过主动视觉上下文细化方法,解决大型多模态模型在跨模态冲突下的推理一致性问题,提升推理鲁棒性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06334 2025-12-09 cs.IR 88%

Enhanced Multimodal Video Retrieval System: Integrating Query Expansion and Cross-modal Temporal Event Retrieval

增强多模态视频检索系统:整合查询扩展与跨模态时间事件检索

Van-Thinh Vo, Minh-Khoi Nguyen, Minh-Huy Tran, Anh-Quan Nguyen-Tran, Duy-Tan Nguyen, Khanh-Loi Nguyen, Anh-Minh Phan

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(title,abstract)

AI总结 本文提出了一种增强多模态视频检索系统,通过整合查询扩展和跨模态时间事件检索,提升检索精度和效率。

Comments 11 pages, 6 figures, SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22897 2026-07-03 cs.AI cs.CL cs.CV cs.LG cs.MM 版本更新 87%

OmniGAIA: Towards Native Omni-Modal AI Agents

OmniGAIA:迈向原生全模态AI代理

Xiaoxi Li, Wenxiang Jiao, Jiarui Jin, Haoxuan Li, Hao Wang, Shijian Wang, Guanting Dong, Jiajie Jin, Yinuo Wang, Yuan Lu, Ji-Rong Wen, Zhicheng Dou, Zhouchen Lin

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) Peking University(北京大学) Southeast University(东南大学) Tsinghua University(清华大学)

专题命中 视频多模态 :omni-modal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出OmniGAIA基准和OmniAtlas代理,通过全模态事件图和后见引导树探索策略,实现跨视频、音频和图像的深度推理与工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏