mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video
专题命中 视频多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
Journal ref ICML2023
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
Journal ref ICML2023
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);multi-modal(abstract)
专题命中 视频多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NAACL 2018
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments This paper introduces a structurally innovative and mathematically rigorous framework for multimodal tactical reasoning, offering a significant advance in causal inference and graph-based threat recognition under noisy conditions
专题命中 视频多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM
Comments 1st place in ACM Multimedia Multimodal Video Ads Tagging Competition (2021 Tencent Advertising Algorithm Competition)
无训练不确定性引导的复杂视觉任务多模态大语言模型
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Helmholtz Munich(海德堡-慕尼黑亥姆霍兹研究中心) ; Google(谷歌) ; LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工大学 LTCI 实验室)
专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 提出无需训练的框架,利用MLLM内在不确定性主动引导,通过响应不确定性评分候选视觉输入,使模型自主聚焦关键信息,在视觉搜索、长视频理解等任务中达到与微调系统相当的性能。
GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所) ; Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司) ; Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司) ; School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) ; Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)
专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 提出GRACE框架,通过提取时间有序的主谓宾三元组和视觉实体裁剪,增强视频MLLM对细粒度情感线索的提取与推理,在Pitts数据集上提升Qwen2.5-VL和Qwen3-VL性能。
Comments 13 pages, 5 figures
Place-it-R1: 解锁多模态大语言模型在视频物体插入中的环境感知推理潜力
机构 * HKUST(香港科技大学) ; Tencent Video(腾讯视频) ; Peking University(北京大学)
专题命中 视频多模态 :MLLM(title,abstract);分类 cs.CV、cs.AI
AI总结 Place-it-R1通过多模态大语言模型的环境感知推理能力,实现物理一致的视频物体插入,提供两种模式以平衡保真度与合理性。
HyperClaim:用于视频虚假信息检测的细粒度跨模态超图推理
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM
AI总结 HyperClaim是一种用于视频虚假信息检测的判别式时间超图框架,通过细粒度跨模态超图推理,在FactGuard协议下的三个数据集上准确率优于基线方法。
Comments 13 pages, including supplementary material
用于视频级矛盾心理和犹豫识别的交互流知识引导多模态推理
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究视频级矛盾心理和犹豫识别难题,提出PRISM-AH框架,通过冻结编码器、轻量级流模型处理多模态冲突,经窗口级注释监督、知识引导大语言模型推理,在测试中取得较好宏观F1,验证推理增益可转移。
Comments 14 Pages, 1 Figure, Ambivalence/Hesitancy (AH) Video Recognition Challenge, ECCV 2026
HAS:用于多模态大语言模型视频摘要的高亮引导注意力转向
机构 * Tufts University(塔夫茨大学)
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 针对视频摘要,提出HAS方法,通过全局找连续帧级高亮分布并作为注意力转向向量,让多模态大语言模型在推理时更关注高亮帧,避免丢失信息,在多种基准测试中性能出色。
原生主动感知作为全模态理解的推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)
专题命中 视频多模态 :omni-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL
AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。
Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent
基于事件的多模态自我运动估计中学习表征的几何结构研究
机构 * Politecnico di Milano(米兰理工大学)
专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究基于事件的多模态自我运动估计中多模态网络的几何结构,通过跨模态注意力架构融合多模态信号并训练,分析潜在空间几何和注意力动态,揭示相关特性,架起分析估计理论与数据驱动融合的桥梁。
Comments 5 pages, 3 figures, to be published in SPAICE 2026
MorphoQuant: 面向全模态大语言模型的模态感知量化
机构 * institutetext: MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models Yue Wu Changyuan Wang Zixuan Wang Shilin Ma Yansong Tang(机构文本:MorphoQuant:多模态大语言模型的模态感知量化 Yue Wu 王昌元 王梓轩 马世林 唐彦松)
专题命中 视频多模态 :omni-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出MorphoQuant框架,通过分布感知偏差补偿和形态导向量化函数优化,解决全模态大语言模型在4比特后训练量化中的分布异质性和异常值问题,实现精度与效率的优异平衡。
DeepIPCv3: 面向突发行人穿越避让的事件感知多模态传感器融合
机构 * Department of Computer Science and Electronics, Universitas Gadjah Mada(计算机科学与电子系,加雅马达大学) ; Department of Computer Science and Engineering, Toyohashi University of Technology(计算机科学与工程系,东福士大学)
专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出DeepIPCv3框架,通过Transformer交叉模态注意力融合LiDAR点云与DVS事件流,实现突发行人穿越场景下的高反应性避让,在自定义多模态数据集上达到最优轨迹与控制精度。
面向仇恨视频检测的推理感知多模态融合
机构 * Multimodal Intelligence Lab(多模态智能实验室) ; Department of Computer Science(计算机科学系) ; University of Exeter(埃克塞特大学) ; School of Computer Science(计算机科学学院) ; University of Leeds(利兹大学) ; School of Computer Science and Informatics(计算机科学与信息学学院) ; University of Liverpool(利物浦大学) ; University of Birmingham(伯明翰大学) ; Machine Intelligence + x Group(机器智能+X小组)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出推理感知多模态融合框架,通过局部-全局上下文融合和语义交叉注意力实现多模态交互,并引入对抗推理生成互补语义视角,在仇恨视频检测中提升Macro-F1和召回率3%和7%。
Comments Accepted at Transactions on Machine Learning Research (TMLR)
CmIVTP:面向海事智能的基于跨模态交互的船舶轨迹预测
机构 * Department of Logistics and Maritime Studies, the Hong Kong Polytechnic University(物流及海运研究系,香港理工大学) ; Research Centre for ESG Advancement (RCESGA), the Hong Kong Polytechnic University(ESG进步研究中心(RCESGA),香港理工大学) ; School of Navigation, Wuhan University of Technology(航海学院,武汉理工大学)
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对单一数据源局限导致船舶轨迹预测不准的问题,提出跨模态交互框架CmIVTP,融合AIS和CCTV数据,利用目标感知场景编码器和跨模态交互Transformer实现高精度预测。
$M^3-Verse$: 大型多模态模型的“找不同”挑战
机构 * Zhejiang University, China(浙江大学) ; Shanghai AI Lab, China(上海人工智能实验室) ; Hangzhou Normal University, China(杭州师范大学)
专题命中 视频多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出 $M^3-Verse$ 基准,通过多视角视频对评估 LMM 在一致空间中对物体动态变化的理解能力,并验证了现有模型的局限性。
CAM-VFD: 跨注意力多模态视频伪造检测
机构 * Computer Engineering Department, College of Engineering and Technology, Arab Academy for Science, Technology and Maritime Transport(计算机工程系,工程与技术学院,阿拉伯科学、技术与海运交通学院)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 针对深度伪造技术和视频编辑工具快速发展带来的挑战,本文提出CAM-VFD框架,通过跨模态矛盾建模实现多模态视频伪造检测,实验表明其在两个生成视频基准测试中表现出色,具有良好的鲁棒性。
基于多模态大语言模型的遥感活动检测的时空感知
机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) ; Prime Solutions Group Inc(Prime Solutions Group公司) ; Intelligence Advanced Research Projects Activity(智能高级研究计划局)
专题命中 视频多模态 :multimodal(title);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文提出SMART-HC-VQA数据集,用于人类活动的时空分析,通过多模态大语言模型训练框架实现遥感活动的检测与推理。
Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI
MMEdge: 通过流水线传感和编码加速设备端多模态推理
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 MMEdge提出一种基于流水线传感和编码的设备端多模态推理框架,通过细粒度传感和编码单元实现增量计算,结合轻量级时间聚合模块和自适应配置优化器,降低延迟并保持高精度。
Comments Code available at: https://github.com/HKUST-MINSys-Lab/MMEdge. Accepted by SenSys 2026
基于段落式MLLM框架的细致情绪识别:利用Qwen3-Omni进行AH检测
机构 * Qwen3-Omni
专题命中 视频多模态 :MLLM(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出基于段落式MLLM框架的细致情绪识别方法,利用Qwen3-Omni模型在AH检测中实现85.1%的准确率,验证了多模态大语言模型在捕捉复杂情绪冲突中的优势。
Comments 5 pages, 1 figures
无需真实异常:MLLM赋能的零样本视频异常检测
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Northwestern Polytechnical University(西北工业大学)
专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出LAVIDA框架,利用多模态大语言模型和异常暴露采样器,解决视频异常检测中数据稀少和语义理解不足的问题,实现零样本下的帧级和像素级异常检测最优性能。
Comments Accepted by CVPR 2026
通过双向交叉注意力和时间建模的多模态情感识别
机构 * Kookmin University(韩国釜山大学)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出多模态情感识别框架,结合时间建模、音频学习和跨模态融合,提升野外视频中情绪识别的鲁棒性。
Comments 7 pages
DeepSport: 一种基于代理强化学习的多模态大语言模型,用于通过主动推理实现综合体育视频理解
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Rice University(Rice大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of California, Irvine(加州大学 Irvine分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 DeepSport通过代理强化学习实现多运动视频理解,首次端到端训练多任务模型,显著提升性能与泛化能力。
直击核心:一种无需训练的多模态摘要方法 via 事件链
机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) ; School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) ; School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 无需训练的多模态摘要方法CoE通过事件链和层次事件图实现跨模态整合与时间推理,提升摘要质量与领域适应性。
Comments Accepted to CVPR 2026
Vid-LLM:一种基于视频的紧凑型3D多模态大语言模型,具有重建-推理协同效应
机构 * School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) ; Hubei Luojia Laboratory(湖北珞珈实验室) ; School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院)
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 Vid-LLM通过基于视频的紧凑型3D多模态大语言模型,实现了重建与推理的协同效应,提升了三维场景理解的性能和泛化能力。
Artic: 面向AI的实时通信用于多模态大语言模型视频助手
机构 * Peking University(北京大学)
专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM
AI总结 Artic提出了一种面向AI的实时通信框架,通过自适应比特率、上下文感知流式传输和退化视频理解基准提升多模态大语言模型视频助手的准确性和降低延迟。
MTBench: 一种多模态时间序列基准,用于时间推理和问答
机构 * Yale University, New Haven, CT, USA(耶鲁大学) ; McGill University, Montreal, QC, Canada(麦吉尔大学) ; University of Texas Rio Grande Valley, TX, USA(德克萨斯大学里奥格兰德谷分校)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 MTBench是一种多模态时间序列基准,用于评估大型语言模型在金融和天气领域的时间推理和问答能力。
Comments 18 pages
LEMON:大型语言模型在教学视频中的时间多模态理解表现如何?
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 LEMON是一个针对教学视频的多模态理解评估基准,旨在评估大型语言模型在时间推理和跨模态整合方面的表现,揭示其在复杂教育内容中的性能差距。