arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-12 至 2026-05-12 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 18 篇

2605.10739 2026-05-12 eess.IV cs.AI cs.CV 84%

Geospatial-Temporal Sensemaking of Remote Sensing Activity Detections with Multimodal Large Language Model

基于多模态大语言模型的遥感活动检测的时空感知

David F. Ramirez, Tim Overman, Kristen Jaskie, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group Inc(Prime Solutions Group公司) Intelligence Advanced Research Projects Activity(智能高级研究计划局)

专题命中 视频多模态 :multimodal(title);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出SMART-HC-VQA数据集,用于人类活动的时空分析,通过多模态大语言模型训练框架实现遥感活动的检测与推理。

Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10732 2026-05-12 cs.CV cs.AI 81%

iPay: Integrated Payment Action Recognition via Multimodal Networks and Adaptive Spatial Prior Learning

iPay: 通过多模态网络和自适应空间先验学习实现集成支付动作识别

Kaicong Huang, Weiheng Oh, Thomas Guggisberg, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Capital District Transportation Authority(卡特里奇交通局)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出iPay框架,结合多模态混合专家架构和自适应空间先验学习,提升公共交通车内支付动作识别的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10106 2026-05-12 cs.CV cs.AI 81%

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

ViSRA:一种基于视频的空间推理代理用于多模态大语言模型

Tingshu Mou, Jiabo He, Renying Wang, Ce Liu, Hao Yang, Tiehua Zhang, Jingjing Chen, Xingjun Ma

机构 * Fudan University(复旦大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Tongji University(同济大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 ViSRA从无训练视角出发,提出一种人类对齐的视频空间推理代理框架,通过显式空间信息探索多模态大语言模型的空间推理机制,实现模块化和可扩展的空间推理,提升3D理解能力并减少训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09693 2026-05-12 cs.CV cs.AI cs.LG 81%

Do multimodal models imagine electric sheep?

多模态模型是否想象出电羊?

Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes, Philipp Krähenbühl, Vladlen Koltun

机构 * Apple(苹果公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究发现多模态模型在解决空间谜题时会形成心理图像,通过微调Qwen3.5 VLM解决多种视觉推理任务,发现动作序列预测能提升解谜准确率,尤其在需要空间推理的任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09343 2026-05-12 cs.AI 79%

SKG-VLA: Scene Knowledge Graph Priors for Structured Scene Semantics and Multimodal Reasoning for Decision Making

SKG-VLA:用于结构化场景语义和决策制定多模态推理的场景知识图谱先验

Zeyu Li, Lei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 SKG-VLA通过构建场景知识图谱,提升多模态投诉决策的推理能力与准确性,采用三阶段训练策略注入结构化场景先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03276 2026-05-12 cs.CV 79%

VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

VEBench: 多模态大模型在真实世界视频编辑中的基准测试

Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) CRCV, University of Central Florida(中央佛罗里达大学CRCV)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 VEBench通过高质量视频和人工验证问题对多模态大模型在视频编辑中的知识理解和操作推理能力进行评估,揭示当前模型与人类水平间的显著差距。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04750 2026-05-12 cs.LG 78%

PA-RNet: Perturbation-Aware Residual Network for Robust Multimodal Time Series Forecasting

PA-RNet:一种针对鲁棒多模态时间序列预测的扰动感知残差网络

Enqiang Zhu, Zhenbin Deng, Shengzhi Wang, Yi-Kun Tang, Chanjuan Liu

机构 * Institute of Computing Technology, Guangzhou University(广州大学计算机技术学院) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 PA-RNet通过扰动感知机制优化多模态特征,提升时间序列预测的鲁棒性,实验表明其在不同领域均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10386 2026-05-12 cs.AI 77%

GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic

GuardAD: 通过马尔可夫安全逻辑保障自动驾驶MLLMs

Tianyuan Zhang, Peng Yue, Zihao Peng, Jiangfan Liu, Zonghao Ying, Jiakai Wang, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 GuardAD通过马尔可夫逻辑形式化提升自动驾驶MLLMs的安全性,减少事故率并提升任务性能,经实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10228 2026-05-12 cs.MM 77%

FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries

FLARE:全模态长视频音频视觉检索基准测试与用户模拟查询

Qijie You, Hao Liang, Mingrui Chen, Bohan Zeng, Meiyi Qiang, Zhenhao Wong, Wentao Zhang

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.MM

AI总结 FLARE基准测试通过全模态长视频和用户模拟查询,评估视频检索在多模态大语言模型中的表现,揭示用户查询对模型行为的影响及音频语言对齐的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09449 2026-05-12 cs.CV 77%

SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs

SpaceMind++:迈向空间感知认知地图的视频多模态大语言模型

Bo Gu, Zhikang Zhang, Zizhuang Wei, Zhenyuan Chen, Lingyun Li, Zhuoyi Song

机构 * Fudan University(复旦大学) Huawei(华为) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 SpaceMind++通过构建体素化认知地图,实现空间一致性的视觉推理,提升视频多模态大语言模型在3D环境中的表现。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06673 2026-05-12 cs.CV 77%

Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding

基于检测器的视频大语言模型用于高效的时空定位

Shida Gao, Feng Xue, Xiangfeng Wang, Anlong Ming, Zhaowen Lin, Haiyang Zhang, Teng Long, Nicu Sebe, Yihua Shao, Haozhe Wang, Wei Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Trento(特伦特大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology(香港科技大学) ZTE Corporation(中兴通讯)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出DEViL模型,通过将密集空间定位任务转移给训练良好的检测器,提升视频时空定位的效率与性能,实现43.1%的m_vIoU和14.33 FPS的高效表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08271 2026-05-12 cs.CV cs.AI 73%

Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning

跨模态、跨时间:结构化记忆用于超长代理视频推理

Jiazheng Li, Chi-Hao Wu, Yunze Liu, Kaize Ding, Jundong Li, Chuxu Zhang

机构 * University of Connecticut(康涅狄格大学) Northwestern University(西北大学) University of Virginia(弗吉尼亚大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MAGIC-Video框架,通过多模态记忆图和交织叙事链,实现超长视频的跨模态检索与长时序推理,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08158 2026-05-12 cs.CV cs.AI 62%

HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding

HY-Himmel技术报告:分层交错多流运动编码用于长视频理解

Haopeng Jin, Hongzhu Yi, Wenlong Zhao, Jinwen Luo, Shani Ye, Zhenyu Guan, Shiquan Dong, Tiankun Yang, Tao Yu

机构 * Tencent(腾讯) University of Chinese Academy of Sciences(中国科学院大学) Beijing Forestry University(北京林业大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 HY-Himmel通过分层视频语言框架解决长视频理解中多模态语言模型的三个瓶颈问题,采用轻量级压缩域三流适配器编码密集帧,提升运动感知能力,实验证明其在Video-MME上性能优于32帧基准。

Comments 59 pages, 42 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09310 2026-05-12 cs.AI q-fin.PM 57%

Beyond ESG Scores: Learning Dynamic Constraints for Sequential Portfolio Optimization

超越ESG评分:为序列投资组合优化学习动态约束

Xin Li, Yan Ke, Longbing Cao

机构 * Macquarie University(麦考瑞大学) The University of Queensland(昆士兰大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出MACF和MACF-X方法,通过动态证据输入和三头分解,减少尾部ESG预算压力并保持竞争力,改进了序列投资组合优化中的ESG约束处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01824 2026-05-12 cs.CV 57%

STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering

STRIVE:结构化时空探索用于视频问答的强化学习

Emad Bahrami, Olga Zatsarynna, Parth Pathak, Sunando Sengupta, Juergen Gall, Mohsen Fayyaz

机构 * University of Bonn(波恩大学) Microsoft(微软) Meta Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 STRIVE通过构建多时空变体和联合归一化提升视频问答的奖励信号,采用重要性感知采样机制增强策略更新稳定性,实验表明在多个大模型上提升了视频推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13434 2026-05-12 cs.LG cs.AI 57%

EventTSF: Event-Aware Non-Stationary Time Series Forecasting

EventTSF: 基于事件的非平稳时间序列预测

Yunfeng Ge, Ming Jin, Yiji Zhao, Hongyan Li, Bo Du, Chang Xu, Shirui Pan

机构 * Griffith University, Australia(澳大利亚格里菲斯大学) Xidian University, China(西安电子科技大学) Yunnan University, China(云南大学) Microsoft Research Asia, China(微软亚洲研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出EventTSF框架,通过分步扩散整合时间序列与文本事件,解决非平稳时间序列预测中的多模态交互问题,实验显示在7个数据集上优于12个基线模型。

Comments Accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08685 2026-05-12 cs.LG cs.AI 57%

Event Fields: Learning Latent Event Structure for Waveform Foundation Models

事件场:学习隐式事件结构用于波形基础模型

Li Na, Yuanyun Zhang, Shi Li

机构 * University of Science and Technology of China(中国科学技术大学) Columbia University(哥伦比亚大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种新的波形基础模型,通过将生理时间序列建模为隐式事件过程的实现,而非传统序列表示。该方法通过自监督学习框架,促使波形的随机分割和时间频率投影之间的一致性,提升模型对信号扰动的鲁棒性并保持事件层面的组织结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08625 2026-05-12 cs.LG cs.AI 57%

Reasoning-Aware Training for Time Series Forecasting

面向时间序列预测的推理感知训练

Md Atik Ahamed, Mihir Parmar, Palash Goyal, Chun-Liang Li, Qiang Cheng, Tomas Pfister, Jinsung Yoon

机构 * Google(谷歌) University of Kentucky(肯塔基大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出STRIDE框架,通过将LLM推理注入到时间序列基础模型的连续嵌入空间中,提升数值预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏