arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4699 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4699 篇

2302.00402 2023-05-12 cs.CV cs.CL cs.MM 85%

mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video

Haiyang Xu, Qinghao Ye, Ming Yan, Yaya Shi, Jiabo Ye, Yuanhong Xu, Chenliang Li, Bin Bi, Qi Qian, Wei Wang, Guohai Xu, Ji Zhang, Songfang Huang, Fei Huang, Jingren Zhou

专题命中 视频多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM

Journal ref ICML2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05243 2022-10-12 cs.IR 85%

Cross-modal Search Method of Technology Video based on Adversarial Learning and Feature Fusion

Xiangbin Liu, Junping Du, Meiyu Liang, Ang Li

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.05448 2018-04-17 cs.CL cs.AI cs.CV 85%

Watch, Listen, and Describe: Globally and Locally Aligned Cross-Modal Attentions for Video Captioning

Xin Wang, Yuan-Fang Wang, William Yang Wang

专题命中 视频多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments NAACL 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21100 2025-07-30 cs.CY cs.AI cs.CV 84%

A Tactical Behaviour Recognition Framework Based on Causal Multimodal Reasoning: A Study on Covert Audio-Video Analysis Combining GAN Structure Enhancement and Phonetic Accent Modelling

Wei Meng

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments This paper introduces a structurally innovative and mathematically rigorous framework for multimodal tactical reasoning, offering a significant advance in causal inference and graph-based threat recognition under noisy conditions

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.00679 2021-08-03 cs.CV cs.MM 84%

Multimodal Feature Fusion for Video Advertisements Tagging Via Stacking Ensemble

Qingsong Zhou, Hai Liang, Zhimin Lin, Kele Xu

专题命中 视频多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM

Comments 1st place in ACM Multimedia Multimodal Video Ads Tagging Competition (2021 Tencent Advertising Algorithm Competition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00705 2026-06-29 cs.CV 版本更新 84%

Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs

无训练不确定性引导的复杂视觉任务多模态大语言模型

Sanghwan Kim, Rui Xiao, Stephan Alaniz, Yongqin Xian, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍兹研究中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工大学 LTCI 实验室)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出无需训练的框架,利用MLLM内在不确定性主动引导,通过响应不确定性评分候选视觉输入,使模型自主聚焦关键信息,在视觉搜索、长视频理解等任务中达到与微调系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16198 2026-06-16 cs.CV 新提交 84%

GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction

GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测

Ruoxuan Yang, Tieyuan Chen, Xiaofeng Huang, Haibing Yin, Jun Wang, Xiping Chen, Jun Yin, Xuesong Gao, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Hangzhou Dianzi University(杭州电子科技大学) The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所) Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司) Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司) School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出GRACE框架,通过提取时间有序的主谓宾三元组和视觉实体裁剪,增强视频MLLM对细粒度情感线索的提取与推理,在Pitts数据集上提升Qwen2.5-VL和Qwen3-VL性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06140 2026-08-06 cs.CV cs.AI 版本更新 84%

Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion

Place-it-R1: 解锁多模态大语言模型在视频物体插入中的环境感知推理潜力

Bohai Gu, Taiyi Wu, Dazhao Du, Jian Liu, Shuai Yang, Xiaotong Zhao, Alan Zhao, Song Guo

机构 * HKUST(香港科技大学) Tencent Video(腾讯视频) Peking University(北京大学)

专题命中 视频多模态 :MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 Place-it-R1通过多模态大语言模型的环境感知推理能力,实现物理一致的视频物体插入,提供两种模式以平衡保真度与合理性。

Comments https://nevsnev.github.io/Place-it-R1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28375 2026-07-31 cs.AI cs.MM 新提交 84%

HyperClaim: Fine-Grained Cross-Modal Hypergraph Reasoning for Video Misinformation Detection

HyperClaim:用于视频虚假信息检测的细粒度跨模态超图推理

Xiangbo Wang, Jiasheng Zhang, Xingtong Yu, Luoqiang Lei, Delvin Ce Zhang

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM

AI总结 HyperClaim是一种用于视频虚假信息检测的判别式时间超图框架,通过细粒度跨模态超图推理,在FactGuard协议下的三个数据集上准确率优于基线方法。

Comments 13 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25961 2026-07-30 cs.CV cs.AI 版本更新 84%

Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition

用于视频级矛盾心理和犹豫识别的交互流知识引导多模态推理

Podakanti Satyajith Chary, Barath Parthiban, Pranesh Velmurugan, Adeeba Khan, Nagarajan Ganapathy

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究视频级矛盾心理和犹豫识别难题,提出PRISM-AH框架,通过冻结编码器、轻量级流模型处理多模态冲突,经窗口级注释监督、知识引导大语言模型推理,在测试中取得较好宏观F1,验证推理增益可转移。

Comments 14 Pages, 1 Figure, Ambivalence/Hesitancy (AH) Video Recognition Challenge, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17994 2026-07-21 cs.CV cs.AI 新提交 84%

HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization

HAS:用于多模态大语言模型视频摘要的高亮引导注意力转向

Rui Chu, Yingjie Lao

机构 * Tufts University(塔夫茨大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 针对视频摘要,提出HAS方法,通过全局找连续帧级高亮分布并作为注意力转向向量,让多模态大语言模型在推理时更关注高亮帧,避免丢失信息,在多种基准测试中性能出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19341 2026-07-21 cs.CV cs.CL cs.SD 版本更新 84%

Native Active Perception as Reasoning for Omni-Modal Understanding

原生主动感知作为全模态理解的推理

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

专题命中 视频多模态 :omni-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。

Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15794 2026-07-20 cs.CV cs.AI 新提交 84%

On the Geometry of Learned Representations in Event-Based Multi-Modal Egomotion Estimation

基于事件的多模态自我运动估计中学习表征的几何结构研究

Stefano Silvestrini, Michele Ceresoli

机构 * Politecnico di Milano(米兰理工大学)

专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究基于事件的多模态自我运动估计中多模态网络的几何结构,通过跨模态注意力架构融合多模态信号并训练,分析潜在空间几何和注意力动态,揭示相关特性,架起分析估计理论与数据驱动融合的桥梁。

Comments 5 pages, 3 figures, to be published in SPAICE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04349 2026-06-08 cs.CV cs.AI 版本更新 84%

MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models

MorphoQuant: 面向全模态大语言模型的模态感知量化

Yue Wu, Changyuan Wang, Zixuan Wang, Shilin Ma, Yansong Tang

机构 * institutetext: MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models Yue Wu Changyuan Wang Zixuan Wang Shilin Ma Yansong Tang(机构文本:MorphoQuant:多模态大语言模型的模态感知量化 Yue Wu 王昌元 王梓轩 马世林 唐彦松)

专题命中 视频多模态 :omni-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出MorphoQuant框架,通过分布感知偏差补偿和形态导向量化函数优化,解决全模态大语言模型在4比特后训练量化中的分布异质性和异常值问题,实现精度与效率的优异平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01277 2026-06-02 cs.RO cs.AI cs.CV cs.SY eess.IV eess.SY 84%

DeepIPCv3: Event-Aware Multi-Modal Sensor Fusion for Sudden Pedestrian Crossing Avoidance

DeepIPCv3: 面向突发行人穿越避让的事件感知多模态传感器融合

Oskar Natan, Andi Dharmawan, Aufaclav Zatu Kusuma Frisky, Jazi Eko Istiyanto, Jun Miura

机构 * Department of Computer Science and Electronics, Universitas Gadjah Mada(计算机科学与电子系,加雅马达大学) Department of Computer Science and Engineering, Toyohashi University of Technology(计算机科学与工程系,东福士大学)

专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出DeepIPCv3框架,通过Transformer交叉模态注意力融合LiDAR点云与DVS事件流,实现突发行人穿越场景下的高反应性避让,在自定义多模态数据集上达到最优轨迹与控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02743 2026-06-01 cs.CV cs.AI 84%

Reasoning-Aware Multimodal Fusion for Hateful Video Detection

面向仇恨视频检测的推理感知多模态融合

Shuonan Yang, Tailin Chen, Jiangbei Yue, Guangliang Cheng, Jianbo Jiao, Zeyu Fu

机构 * Multimodal Intelligence Lab(多模态智能实验室) Department of Computer Science(计算机科学系) University of Exeter(埃克塞特大学) School of Computer Science(计算机科学学院) University of Leeds(利兹大学) School of Computer Science and Informatics(计算机科学与信息学学院) University of Liverpool(利物浦大学) University of Birmingham(伯明翰大学) Machine Intelligence + x Group(机器智能+X小组)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出推理感知多模态融合框架,通过局部-全局上下文融合和语义交叉注意力实现多模态交互,并引入对抗推理生成互补语义视角,在仇恨视频检测中提升Macro-F1和召回率3%和7%。

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26524 2026-05-27 cs.CV cs.AI 84%

CmIVTP: Cross-modal Interaction-based Vessel Trajectory Prediction for Maritime Intelligence

CmIVTP:面向海事智能的基于跨模态交互的船舶轨迹预测

Yuxu Lu, Dong Yang, Xiaoyu Li, Mengwei Bao, Congcong Zhao

机构 * Department of Logistics and Maritime Studies, the Hong Kong Polytechnic University(物流及海运研究系,香港理工大学) Research Centre for ESG Advancement (RCESGA), the Hong Kong Polytechnic University(ESG进步研究中心(RCESGA),香港理工大学) School of Navigation, Wuhan University of Technology(航海学院,武汉理工大学)

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对单一数据源局限导致船舶轨迹预测不准的问题,提出跨模态交互框架CmIVTP,融合AIS和CCTV数据,利用目标感知场景编码器和跨模态交互Transformer实现高精度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18735 2026-05-26 cs.CV cs.AI 84%

$M^3-Verse$: A "Spot the Difference" Challenge for Large Multimodal Models

$M^3-Verse$: 大型多模态模型的“找不同”挑战

Kewei Wei, Bocheng Hu, Jie Cao, Xiaohan Chen, Zhengxi Lu, Wubing Xia, Weili Xu, Jiaao Wu, Junchen He, Mingyu Jia, Ciyun Zhao, Ye Sun, Yizhi Li, Zhonghan Zhao, Jian Zhang, Gaoang Wang

机构 * Zhejiang University, China(浙江大学) Shanghai AI Lab, China(上海人工智能实验室) Hangzhou Normal University, China(杭州师范大学)

专题命中 视频多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出 $M^3-Verse$ 基准,通过多视角视频对评估 LMM 在一致空间中对物体动态变化的理解能力,并验证了现有模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17133 2026-05-19 cs.CV cs.AI 84%

CAM-VFD: Cross-Attention Multimodal Video Forgery Detection

CAM-VFD: 跨注意力多模态视频伪造检测

Hoda Osama Elkhodary, Sherin Mostafa Youssef, Marwa Elshenawy, Dalia Sobhy

机构 * Computer Engineering Department, College of Engineering and Technology, Arab Academy for Science, Technology and Maritime Transport(计算机工程系,工程与技术学院,阿拉伯科学、技术与海运交通学院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对深度伪造技术和视频编辑工具快速发展带来的挑战,本文提出CAM-VFD框架,通过跨模态矛盾建模实现多模态视频伪造检测,实验表明其在两个生成视频基准测试中表现出色,具有良好的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10739 2026-05-12 eess.IV cs.AI cs.CV 84%

Geospatial-Temporal Sensemaking of Remote Sensing Activity Detections with Multimodal Large Language Model

基于多模态大语言模型的遥感活动检测的时空感知

David F. Ramirez, Tim Overman, Kristen Jaskie, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group Inc(Prime Solutions Group公司) Intelligence Advanced Research Projects Activity(智能高级研究计划局)

专题命中 视频多模态 :multimodal(title);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出SMART-HC-VQA数据集,用于人类活动的时空分析,通过多模态大语言模型训练框架实现遥感活动的检测与推理。

Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25327 2026-03-31 cs.CV cs.AI cs.LG 84%

MMEdge: Accelerating On-device Multimodal Inference via Pipelined Sensing and Encoding

MMEdge: 通过流水线传感和编码加速设备端多模态推理

Runxi Huang, Mingxuan Yu, Mingyu Tsoi, Xiaomin Ouyang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MMEdge提出一种基于流水线传感和编码的设备端多模态推理框架,通过细粒度传感和编码单元实现增量计算,结合轻量级时间聚合模块和自适应配置优化器,降低延迟并保持高精度。

Comments Code available at: https://github.com/HKUST-MINSys-Lab/MMEdge. Accepted by SenSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13406 2026-03-24 cs.CV cs.AI 84%

Nuanced Emotion Recognition Based on a Segment-based MLLM Framework Leveraging Qwen3-Omni for AH Detection

基于段落式MLLM框架的细致情绪识别:利用Qwen3-Omni进行AH检测

Liang Tang, Hongda Li, Jiayu Zhang, Long Chen, Shuxian Li, Siqi Pei, Tiaonan Duan, Yuhao Cheng

机构 * Qwen3-Omni

专题命中 视频多模态 :MLLM(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于段落式MLLM框架的细致情绪识别方法,利用Qwen3-Omni模型在AH检测中实现85.1%的准确率,验证了多模态大语言模型在捕捉复杂情绪冲突中的优势。

Comments 5 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19248 2026-03-24 cs.CV cs.AI 84%

No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection

无需真实异常:MLLM赋能的零样本视频异常检测

Zunkai Dai, Ke Li, Jiajia Liu, Jie Yang, Yuanyuan Qiao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Northwestern Polytechnical University(西北工业大学)

专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LAVIDA框架,利用多模态大语言模型和异常暴露采样器,解决视频异常检测中数据稀少和语义理解不足的问题,实现零样本下的帧级和像素级异常检测最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11971 2026-03-19 cs.CV cs.AI 84%

Multimodal Emotion Recognition via Bi-directional Cross-Attention and Temporal Modeling

通过双向交叉注意力和时间建模的多模态情感识别

Junhyeong Byeon, Jeongyeol Kim, Sejoon Lim

机构 * Kookmin University(韩国釜山大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态情感识别框架,结合时间建模、音频学习和跨模态融合,提升野外视频中情绪识别的鲁棒性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12908 2026-03-13 cs.CV cs.AI 84%

DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning

DeepSport: 一种基于代理强化学习的多模态大语言模型,用于通过主动推理实现综合体育视频理解

Junbo Zou, Haotian Xia, Zhen Ye, Shengjie Zhang, Christopher Lai, Vicente Ordonez, Weining Shen, Hanjie Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Rice University(Rice大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Irvine(加州大学 Irvine分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 DeepSport通过代理强化学习实现多运动视频理解,首次端到端训练多任务模型,显著提升性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06213 2026-03-09 cs.CV cs.AI 84%

Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events

直击核心:一种无需训练的多模态摘要方法 via 事件链

Xiaoxing You, Qiang Huang, Lingyu Li, Xiaojun Chang, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 无需训练的多模态摘要方法CoE通过事件链和层次事件图实现跨模态整合与时间推理,提升摘要质量与领域适应性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24385 2026-03-03 cs.CV cs.AI 84%

Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy

Vid-LLM:一种基于视频的紧凑型3D多模态大语言模型,具有重建-推理协同效应

Haijier Chen, Bo Xu, Shoujian Zhang, Haoze Liu, Jiaxuan Lin, Jingrong Wang

机构 * School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) Hubei Luojia Laboratory(湖北珞珈实验室) School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Vid-LLM通过基于视频的紧凑型3D多模态大语言模型,实现了重建与推理的协同效应,提升了三维场景理解的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12641 2026-02-16 cs.NI cs.AI cs.HC cs.MM 84%

Artic: AI-oriented Real-time Communication for MLLM Video Assistant

Artic: 面向AI的实时通信用于多模态大语言模型视频助手

Jiangkai Wu, Zhiyuan Ren, Junquan Zhong, Liming Liu, Xinggong Zhang

机构 * Peking University(北京大学)

专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM

AI总结 Artic提出了一种面向AI的实时通信框架,通过自适应比特率、上下文感知流式传输和退化视频理解基准提升多模态大语言模型视频助手的准确性和降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16858 2026-02-12 cs.CL cs.AI 84%

MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering

MTBench: 一种多模态时间序列基准,用于时间推理和问答

Jialin Chen, Aosong Feng, Ziyu Zhao, Juan Garza, Gaukhar Nurbek, Cheng Qin, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying

机构 * Yale University, New Haven, CT, USA(耶鲁大学) McGill University, Montreal, QC, Canada(麦吉尔大学) University of Texas Rio Grande Valley, TX, USA(德克萨斯大学里奥格兰德谷分校)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 MTBench是一种多模态时间序列基准,用于评估大型语言模型在金融和天气领域的时间推理和问答能力。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20705 2026-01-29 cs.CV cs.AI 84%

LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?

LEMON:大型语言模型在教学视频中的时间多模态理解表现如何?

Zhuang Yu, Lei Shen, Jing Zhao, Shiliang Sun

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 LEMON是一个针对教学视频的多模态理解评估基准,旨在评估大型语言模型在时间推理和跨模态整合方面的表现,揭示其在复杂教育内容中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏