arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4703 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4703 篇

2603.04727 2026-05-19 cs.CV cs.AI 81%

Are Multimodal LLMs Ready for Surveillance? A Reality Check on Zero-Shot Anomaly Detection in the Wild

多模态大语言模型是否准备好用于监控?对零样本异常检测在现实中的检验

Shanle Yao, Armin Danesh Pazho, Narges Rashvand, Hamed Tabkhi

机构 * Electrical and Computer Engineering Department(电气与计算机工程系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型在现实中的零样本异常检测性能,发现其存在保守偏差,通过特定指令可以提升F1分数,但召回率仍是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09395 2026-05-19 cs.AI cs.LG cs.MA cs.MM 81%

Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning

通过定制代理推理增强VLMs在少样本多模态时间序列分类中的能力

Lin Li, Jiawei Huang, Qihao Quan, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Wenjie Feng, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米公司) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 本文提出MarsTSC框架,通过自演化知识库和代理推理提升少样本多模态时间序列分类性能,实验表明其在六个VLM基础上均优于传统和基础模型基线。

Comments 18 pages, 12 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10732 2026-05-12 cs.CV cs.AI 81%

iPay: Integrated Payment Action Recognition via Multimodal Networks and Adaptive Spatial Prior Learning

iPay: 通过多模态网络和自适应空间先验学习实现集成支付动作识别

Kaicong Huang, Weiheng Oh, Thomas Guggisberg, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Capital District Transportation Authority(卡特里奇交通局)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出iPay框架,结合多模态混合专家架构和自适应空间先验学习,提升公共交通车内支付动作识别的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10106 2026-05-12 cs.CV cs.AI 81%

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

ViSRA:一种基于视频的空间推理代理用于多模态大语言模型

Tingshu Mou, Jiabo He, Renying Wang, Ce Liu, Hao Yang, Tiehua Zhang, Jingjing Chen, Xingjun Ma

机构 * Fudan University(复旦大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Tongji University(同济大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 ViSRA从无训练视角出发,提出一种人类对齐的视频空间推理代理框架,通过显式空间信息探索多模态大语言模型的空间推理机制,实现模块化和可扩展的空间推理,提升3D理解能力并减少训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09693 2026-05-12 cs.CV cs.AI cs.LG 81%

Do multimodal models imagine electric sheep?

多模态模型是否想象出电羊?

Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes, Philipp Krähenbühl, Vladlen Koltun

机构 * Apple(苹果公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究发现多模态模型在解决空间谜题时会形成心理图像,通过微调Qwen3.5 VLM解决多种视觉推理任务,发现动作序列预测能提升解谜准确率,尤其在需要空间推理的任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07151 2026-05-11 cs.CV cs.AI 81%

DPG-CD: Depth-Prior-Guided Cross-Modal Joint 2D-3D Change Detection

DPG-CD: 基于深度先验的跨模态联合2D-3D变化检测

Luqi Zhang, Zhen Dong, Bisheng Yang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出DPG-CD框架,通过引入深度先验和多阶段跨时序跨模态融合,有效解决影像与DSM间模态差异导致的3D变化检测难题,提升2D语义和3D高度变化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00630 2026-05-04 cs.CV cs.MM eess.IV 81%

CMTA: Leveraging Cross-Modal Temporal Artifacts for Generalizable AI-Generated Video Detection

CMTA:利用跨模态时间特征进行通用的AI生成视频检测

Hang Wang, Chao Shen, Chenhao Lin, Minghui Yang, Lei Zhang, Cong Wang

机构 * Xi’an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) Guangdong OPPO Mobile Communications Co., Ltd.(广东OPPO移动通信有限公司) City University of Hong Kong(香港城市大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出CMTA框架,通过联合跨模态嵌入和多粒度时间建模,识别AI生成视频中的跨模态时间特征,验证了其在四个大规模数据集上的新状态和跨生成器泛化能力。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07584 2026-04-29 cs.CV cs.AI 81%

Multimodal Contextualized Support for Enhancing Video Retrieval System

多模态上下文支持用于增强视频检索系统

Quoc-Bao Nguyen-Le, Thanh-Huy Le-Nguyen

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态视频检索系统,通过整合多帧信息提取更高层次的抽象信息,提升视频检索的准确性与深度。

Comments This paper has been withdrawn by the author. After further review, the author believes that the current version does not meet the desired standards and plans to revise the work before any potential resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18570 2026-04-23 cs.LG cs.AI cs.CL 81%

A multimodal and temporal foundation model for virtual patient representations at healthcare system scale

面向医疗系统规模的多模态与时间基础模型:虚拟患者表示

Andrew Zhang, Tong Ding, Sophia J. Wagner, Caiwei Tian, Ming Y. Lu, Rowland Pettit, Joshua E. Lewis, Alexandre Misrahi, Dandan Mo, Long Phi Le, Faisal Mahmood

机构 * Department of Pathology, Mass General Brigham, Harvard Medical School(病理学系,马萨诸塞州总医院与哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(癌症计划,哈佛-麻省理工Broad研究所) Data Science Program, Dana-Farber Cancer Institute(数据科学计划,达纳-法伯癌症研究所) Health Sciences and Technology, Harvard-MIT(健康科学与技术,哈佛-麻省理工) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛约翰·A·保罗森工程与应用科学学院,哈佛大学) Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(电气工程与计算机科学,麻省理工学院(MIT)) School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(计算机与通信科学学院,EPFL,瑞士洛桑)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Apollo模型,整合多模态和时间信息,构建虚拟患者表示,用于预测疾病风险、治疗反应等,展示其在医疗计算中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10417 2026-04-23 cs.CV cs.AI cs.LG 81%

Combo-Gait: Unified Transformer Framework for Multi-Modal Gait Recognition and Attribute Analysis

Combo-Gait:多模态和多任务框架用于多模态步态识别与属性分析

Zhao-Yang Wang, Zhimin Shao, Anirudh Nanduri, Basudha Pal, Laura McDaniel, Jieneng Chen, Rama Chellappa

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Maryland(马里兰大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出结合2D时间轮廓与3D SMPL特征的多模态框架,实现步态识别与年龄、BMI、性别等属性估计,通过统一Transformer融合多模态特征,提升鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19217 2026-04-22 cs.CV cs.AI 81%

Attention-based Multi-modal Deep Learning Model of Spatio-temporal Crop Yield Prediction with Satellite, Soil and Climate Data

基于注意力机制的多模态深度学习模型:融合卫星、土壤和气候数据的时空作物产量预测

Gopal Krishna Shyam, Ila Chandrakar

机构 * Presidency University, Bengaluru, India(班加罗尔大学) University of Europe for Applied Sciences, Berlin(欧洲应用科学大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出ABMMDLF模型,结合多年的卫星影像、高分辨率气象时间序列和初始土壤属性,通过卷积神经网络提取空间特征和时间注意力机制适应性加权关键物候期,实现高精度时空作物产量预测,R²达0.89。

Comments 6 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16748 2026-04-21 cs.CV cs.AI 81%

TriTS: Time Series Forecasting from a Multimodal Perspective

TriTS:从多模态视角进行时间序列预测

Xiang Ao

机构 * School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院)

专题命中 视频多模态 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 TriTS从多模态视角提出新的跨模态解耦框架,通过时间、频率和2D视觉空间投影,结合周期感知重塑策略和视觉Mamba,实现高效的时间序列预测,实验表明其在多个基准数据集上达到SOTA性能。

Comments 9 pages, 3 figures. Accepted by the A2A-MML Workshop in conjunction with CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16734 2026-04-21 cs.CV cs.AI 81%

Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines

降低现代多模态大语言模型流水线的峰值内存使用

Junwan Kim, Hyunkyung Bae

机构 * New York University(纽约大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种顺序输入压缩机制,在预填充阶段通过结构感知的键值缓存压缩,降低多模态大语言模型的峰值内存使用,同时保持生成性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15377 2026-04-20 cs.LG cs.CV cs.MM 81%

M3R: Localized Rainfall Nowcasting with Meteorology-Informed MultiModal Attention

M3R:基于气象信息的多模态注意力的局部降雨现在预测

Sanjeev Panta, Rhett M Morvant, Xu Yuan, Li Chen, Nian-Feng Tzeng

机构 * University of Louisiana at Lafayette, Lafayette, LA, USA(路易斯安那州立大学拉斐特分校) University of Delaware, Newark, DE, USA(德克萨斯大学达勒姆分校)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 M3R结合NEXRAD雷达图像与气象站数据,通过多模态注意力机制提升降雨预测精度与效率,实现更准确的降雨现在预测。

Comments Accepted at IEEE International Conference on Multimedia and Expo (ICME) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08719 2026-04-13 cs.CV cs.AI cs.RO 81%

LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving

LMGenDrive: 联合多模态理解与生成世界建模以实现端到端驾驶

Hao Shao, Letian Wang, Yang Zhou, Yuxuan Hu, Zhuofan Zong, Steven L. Waslander, Wei Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LMGenDrive框架,结合LLM多模态理解与生成世界模型,提升自动驾驶的闭环性能,通过视频预测和控制信号生成,增强时空场景建模和指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03302 2026-04-07 cs.CV cs.AI 81%

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

超越静态视觉:场景动态场解锁多模态大语言模型中的直观物理理解

Nanxi Li, Xiang Wang, Yuanjie Chen, Haode Zhang, Hong Li, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨多模态大语言模型在物理理解上的不足,提出Scene Dynamic Field方法提升对连续物体动态的理解能力,实现20.7%的改进并展现良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06763 2026-04-03 cs.CV cs.AI 81%

SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding

SafePLUG: 通过像素级洞察和时间锚定赋能多模态大语言模型以理解交通事故

Zihao Sheng, Zilin Huang, Yansong Qu, Jiancong Chen, Yuhao Luo, Yen-Jung Chen, Yue Leng, Sikai Chen

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Google(谷歌)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SafePLUG框架,通过像素级理解和时间锚定提升多模态大语言模型在交通事故分析中的能力,引入新数据集并实现区域问答、像素分割、时间事件定位等任务的高性能表现。

Comments The code, dataset, and model checkpoints will be made publicly available at: https://zihaosheng.github.io/SafePLUG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01002 2026-04-02 cs.CV cs.AI cs.LG 81%

Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding

基于证据的关键帧采样用于基于MLLM的长视频理解

Yiheng Wang, Lichen Zhu, Yueqian Lin, Yudong Liu, Jingyang Zhang, Hai "Helen" Li, Yiran Chen

机构 * Duke University(杜克大学) Independent Researcher(独立研究员)

专题命中 视频多模态 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于信息瓶颈理论的证据驱动关键帧采样框架,通过最大化选帧与查询的条件互信息,提升长视频理解性能,实验表明在严格token预算下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00994 2026-04-02 cs.CL cs.AI cs.SI 81%

Multimodal Analysis of State-Funded News Coverage of the Israel-Hamas War on YouTube Shorts

对以色列-哈马斯战争中YouTube Shorts上国家资助新闻报道的多模态分析

Daniel Miehling, Sandra Kuebler

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多模态管道,结合自动转录、基于方面的情感分析和语义场景分类,分析国家资助机构对以色列-哈马斯战争的短视频报道,发现不同来源和时间的情感表达差异及视觉线索的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29252 2026-04-01 cs.CV cs.AI 81%

Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

通过视觉记忆机制扩展多模态大语言模型的长视频理解

Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08415 2026-03-25 cs.CV cs.AI 81%

Cross-Modal Transferable Image-to-Video Attack on Video Quality Metrics

跨模态可迁移的图像到视频攻击视频质量度量

Georgii Gotin, Ekaterina Shumitskaya, Anastasia Antsiferova, Dmitriy Vatolin

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息与系统研究所在可信人工智能研究中心) MSU Institute for Artificial Intelligence(莫斯科大学人工智能研究所) Laboratory of Innovative Technologies for Processing Video Content(视频内容处理创新技术实验室)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出IC2VQA方法,通过跨模态攻击探索现代视频质量度量模型的漏洞,利用CLIP模块提升对抗扰动的可迁移性,实验显示在三种黑盒视频质量度量模型上攻击成功率高。

Comments Accepted for VISAPP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18118 2026-03-20 cs.CV cs.AI cs.LG 81%

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

Insight-V++: 向多模态大语言模型实现高级长链视觉推理迈进

Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

机构 * S-Lab(S实验室) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Insight-V++框架,通过多代理视觉推理系统提升多模态大语言模型的长链视觉推理能力,采用ST-GRPO和J-GRPO算法增强空间时间推理和评估鲁棒性,实验显示在图像和视频推理任务中性能显著提升。

Comments arXiv admin note: text overlap with arXiv:2411.14432

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13353 2026-03-18 cs.CV cs.AI 81%

VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding

VideoITG: 多模态视频理解中的指导性时间定位

Shihao Wang, Guo Chen, De-an Huang, Zhiqi Li, Minghan Li, Guilin Liu, Jose M. Alvarez, Lei Zhang, Zhiding Yu

机构 * The Hong Kong Polytechnic Univ(香港理工大学) Nanjing Univ(南京大学) NVIDIA(NVIDIA公司) Harvard Univ(哈佛大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 VideoITG通过设计VidThinker流水线,自动生成指令条件化描述,检索相关视频片段并选择关键帧,提升多模态视频理解任务的性能。

Comments Accepted by CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12848 2026-03-16 cs.CV cs.AI 81%

Team LEYA in 10th ABAW Competition: Multimodal Ambivalence/Hesitancy Recognition Approach

团队LEYA在第10届ABAW竞赛中的多模态矛盾/犹豫识别方法

Elena Ryumina, Alexandr Axyonov, Dmitry Sysoev, Timur Abdulkadirov, Kirill Almetov, Yulia Morozova, Dmitry Ryumin

机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences(俄罗斯科学院圣彼得堡联邦科研中心) HSE University(俄罗斯高等经济学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种多模态方法用于视频级矛盾/犹豫识别,结合场景、面部、音频和文本四种模态,通过融合模型提升识别性能,实验显示多模态融合优于单一模态方法。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10729 2026-03-11 cs.CV cs.AI 81%

EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering

EgoCross:多模态大语言模型跨领域眼动视频问答基准测试

Yanjun Li, Yuqian Fu, Tianwen Qian, Qi'ao Xu, Silong Dai, Danda Pani Paudel, Luc Van Gool, Xiaoling Wang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 EgoCross提出一个跨领域眼动视频问答基准,评估多模态大语言模型在不同领域中的泛化能力,揭示现有模型在非日常领域任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03597 2026-03-10 cs.SD cs.AI eess.AS 81%

Multimodal Laryngoscopic Video Analysis for Assisted Diagnosis of Vocal Fold Paralysis

多模态喉镜视频分析用于辅助声带麻痹诊断

Yucong Zhang, Xin Zou, Jinshan Yang, Wenjun Chen, Juan Liu, Faya Liang, Ming Li

机构 * School of Computer Science(计算机科学学院) Suzhou Municipal Key Laboratory of Multimodal Intelligent Systems(多模态智能系统苏州市重点实验室) Sun Yat-sen Memorial Hospital of Sun Yat-sen University(中山大学孙逸仙纪念医院) School of Artificial Intelligent(人工智能学院) Department of Otorhinolaryngology(耳鼻喉科部门)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出多模态喉镜视频分析系统,结合音频和视频数据自动提取关键片段,用于辅助诊断声带麻痹。

Comments Accepted by Computer Speech and Language

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02655 2026-03-04 cs.CL cs.AI 81%

Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches

基于多模态大语言模型的实时游戏视频解说生成:暂停感知解码方法

Anum Afzal, Yuki Saito, Hiroya Takamura, Katsuhito Sudoh, Shinnosuke Takamichi, Graham Neubig, Florian Matthes, Tatsuya Ishigaki

机构 * School of CIT, Technical University of Munich(慕尼黑技术大学计算机信息学院) National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出两种基于提示的解码方法,利用多模态大语言模型实现实时游戏视频解说生成,通过动态间隔调整提升时间相关性与内容准确性。

Comments Accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15455 2026-03-02 cs.MM cs.AI 81%

M3TR: Temporal Retrieval Enhanced Multi-Modal Micro-video Popularity Prediction

M3TR: 增强型多模态微视频流行度预测框架

Jiacheng Lu, Weijian Wang, Mingyuan Xiao, Yang Hua, Tao Song, Jiaru Zhang, Bo Peng, Cheng Hua, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Queen's University Belfast(女王大学贝尔法斯特分校) Purdue University(普渡大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM

AI总结 M3TR通过结合精细时序建模与新颖的时序感知检索过程,提升微视频流行度预测的准确性与长期预测能力。

Comments 14 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10551 2026-02-17 cs.CV cs.AI 81%

C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning

C^2ROPE: 3D 大多模态模型推理中的因果连续旋转位置编码

Guanting Ye, Qiyan Zhao, Wenhao Yu, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Ka-Veng Yuen

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Department of Automation, Shanghai Jiaotong University(上海交通大学自动化系) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, USTC(中国科学技术大学计算机科学与技术学院) School of Artificial Intelligence and Data Science, USTC(中国科学技术大学人工智能与数据科学学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 C^2ROPE通过引入空间-时间连续位置编码和切比雪夫因果掩码,解决3D多模态模型中视觉特征连续性和因果关系建模问题。

Comments Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04641 2026-02-17 cs.CV cs.AI cs.LG 81%

Simulating the Real World: A Unified Survey of Multimodal Generative Models

模拟现实世界:多模态生成模型的统一综述

Yuqi Hu, Longguang Wang, Xian Liu, Ling-Hao Chen, Yuwei Guo, Yukai Shi, Ce Liu, Anyi Rao, Zeyu Wang, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能前沿技术研究所,香港科学与技术大学(广州)) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR(计算机科学与工程系,香港科学与技术大学香港特别行政区) MMLab, The Hong Kong University of Science and Technology(多模态实验室,香港科学与技术大学) School of Electronics and Communication Engineering, Shenzhen Campus of Sun Yat-sen University(电子与通信工程学院,中山大学深圳校区) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学,香港,中国) Tsinghua University, Guangdong, China(清华大学,广东,中国) Bosch (China) Investment Co., Ltd., Shanghai, China(博世(中国)投资有限公司,上海,中国)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文首次系统性地统一研究了2D、视频、3D和4D生成,为多模态生成模型和现实世界模拟提供了统一框架的综述。

Comments Repository for the related papers at https://github.com/ALEEEHU/World-Simulator

详情

展开后加载摘要…

URL PDF HTML 收藏