arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4726 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4726 篇

1904.02570 2019-04-05 eess.SP 78%

Can multimodal sensing detect and localize transient events?

Kasthuri Jayarajah, Vigneshwaran Subbaraju, Noel Athaide, Lakmal Meegahapola, Andrew Tan, Archan Misra

专题命中 视频多模态 :multimodal(title,abstract)

Journal ref SPIE Defense+Security 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.05566 2019-02-18 cs.IR 78%

Interest-Related Item Similarity Model Based on Multimodal Data for Top-N Recommendation

Junmei Lv, Bin Song, Jie Guo, Xiaojiang Du, Mohsen Guizani

专题命中 视频多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.01117 2019-02-05 cs.HC cs.RO 78%

Exploring Temporal Dependencies in Multimodal Referring Expressions with Mixed Reality

Elena Sibirtseva, Ali Ghadirzadeh, Iolanda Leite, Mårten Björkman, Danica Kragic

专题命中 视频多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.08093 2019-01-25 q-bio.NC 78%

Decoding multimodal behavior using time differences of MEG events

Ohad Felsenstein, Idan Tal, Michal Ben-Shachar, Moshe Abeles, Gal Chechik

专题命中 视频多模态 :multimodal(title,abstract)

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10027 2018-12-03 cs.CY 78%

Multimodal Classification of Stressful Environments in Visually Impaired Mobility Using EEG and Peripheral Biosignals

Charalampos Saitis, Kyriaki Kalimeri

专题命中 视频多模态 :multimodal(title,abstract)

Comments IEEE Transactions on Affective Computing 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.09452 2018-06-22 cs.HC 78%

Multi-modal Approach for Affective Computing

Siddharth Siddharth, Tzyy-Ping Jung, Terrence J. Sejnowski

专题命中 视频多模态 :multi-modal(title,abstract)

Comments Published in IEEE 40th International Engineering in Medicine and Biology Conference (EMBC) 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.08947 2018-03-28 stat.AP cs.IT math.IT 78%

Sequential Event Detection Using Multimodal Data in Nonstationary Environments

Taposh Banerjee, Gene Whipps, Prudhvi Gurram, Vahid Tarokh

专题命中 视频多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.09232 2018-01-30 physics.med-ph stat.AP 78%

Multimodal Functional and Structural Brain Connectivity Analysis in Autism: A Preliminary Integrated Approach with EEG, fMRI and DTI

Bogdan Alexandru Cociu, Saptarshi Das, Lucia Billeci, Wasifa Jamal, Koushik Maharatna, Sara Calderoni, Antonio Narzisi, Filippo Muratori

专题命中 视频多模态 :multimodal(title,abstract)

Comments 14 pages, 14 figures, IEEE Transactions on Cognitive and Developmental Systems, 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.10479 2017-11-27 cs.RO cs.LG 78%

Multi-Modal Imitation Learning from Unstructured Demonstrations using Generative Adversarial Nets

Karol Hausman, Yevgen Chebotar, Stefan Schaal, Gaurav Sukhatme, Joseph Lim

专题命中 视频多模态 :multi-modal(title,abstract)

Comments Paper accepted to NIPS 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.06039 2017-09-19 cs.RO 78%

Why did the Robot Cross the Road? - Learning from Multi-Modal Sensor Data for Autonomous Road Crossing

Noha Radwan, Wera Winterhalter, Christian Dornhege, Wolfram Burgard

专题命中 视频多模态 :multi-modal(title,abstract)

Comments Video: https://www.youtube.com/watch?v=N1IhHHkUzYg Dataset: http://www2.informatik.uni-freiburg.de/~radwann/freiburg_street_crossing_dataset.html

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.05616 2017-03-17 cs.HC 78%

Multimodal Language Specification for Human Adaptive Mechatronics

Fernando Ferri, Arianna D'Ulizia, Patrizia Grifoni

专题命中 视频多模态 :multimodal(title,abstract)

Comments 11 pages, 4 figures

Journal ref Journal of Next Generation Information Technology (JNIT), Volume 3, Number 1, November 2012

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.08492 2016-11-28 cs.HC 78%

A Multimodal Approach to Estimating Vigilance Using EEG and Forehead EOG

Wei-Long Zheng, Bao-Liang Lu

专题命中 视频多模态 :multimodal(title,abstract)

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.01209 2016-10-06 cs.CY 78%

Towards Air Quality Estimation Using Collected Multimodal Environmental Data

Anastasia Moumtzidou, Symeon Papadopoulos, Stefanos Vrochidis, Ioannis Kompatsiaris, Konstantinos Kourtidis, George Hloupis, Ilias Stavrakas, Konstantina Papachristopoulou, Christodoulos Keratidis

专题命中 视频多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1601.00306 2016-05-17 stat.AP cs.SI 78%

Multimodal Event Detection in Twitter Hashtag Networks

Yasin Yilmaz, Alfred Hero

专题命中 视频多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1410.4620 2016-02-26 q-bio.QM 78%

Integrated multimodal network approach to PET and MRI based on multidimensional persistent homology

Hyekyoung Lee, Hyejin Kang, Moo K. Chung, Seonhee Lim, Bung-Nyun Kim, Dong Soo Lee

专题命中 视频多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.04364 2016-02-16 cs.LG 78%

Look, Listen and Learn - A Multimodal LSTM for Speaker Identification

Jimmy Ren, Yongtao Hu, Yu-Wing Tai, Chuan Wang, Li Xu, Wenxiu Sun, Qiong Yan

专题命中 视频多模态 :multimodal(title,abstract)

Comments The 30th AAAI Conference on Artificial Intelligence (AAAI-16)

详情

展开后加载摘要…

URL PDF HTML 收藏
1411.1274 2014-11-06 physics.soc-ph 78%

Anatomy and efficiency of urban multimodal mobility

Riccardo Gallotti, Marc Barthelemy

专题命中 视频多模态 :multimodal(title,abstract)

Comments 9 pages, 7 figures +supplementary information (9 pages and 9 figures)

Journal ref Scientific Reports 4:6911 (2014)

详情

展开后加载摘要…

URL PDF HTML 收藏
1311.6425 2013-11-26 math.OC cs.LG stat.ML 78%

Robust Multimodal Graph Matching: Sparse Coding Meets Graph Matching

Marcelo Fiori, Pablo Sprechmann, Joshua Vogelstein, Pablo Musé, Guillermo Sapiro

专题命中 视频多模态 :multimodal(title,abstract)

Comments NIPS 2013

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19075 2026-05-20 cs.CV cs.AI 77%

CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering

CRAFT: 基于批评的自适应关键帧目标定位用于多模态视频问答

Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi, Pengyu Yan, Akhil Gorugantu, David Doermann

机构 * University at Buffalo(布法罗大学) New York University(纽约大学)

专题命中 视频多模态 :multimodal(title,comments);分类 cs.CV、cs.AI

AI总结 该研究提出CRAFT方法,通过动态关键帧选择、每视频ASR与多语言回退以及混合批评循环,迭代验证和修复声明,最终实现多模态视频问答的准确证据聚合。

Comments Accepted at ACL 2026 Multimodal Augmented Generation via MultimodAl Retrieval Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01737 2026-07-03 cs.CV 新提交 77%

ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA

ReQuest:基于重新思考的问题感知帧选择用于长视频问答

Minkuk Kim, Suyong Yun, Young Tae Kim, Jinyoung Moon, Jinwoo Choi, Seong Tae Kim

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出ReQuest,一种不确定性驱动的、问题自适应的关键帧选择方法,通过轻量级选择器、重新思考路由和不确定性引导的NMS,在固定token预算下提升长视频问答准确率。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27999 2026-06-29 cs.CV 新提交 77%

HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

HumanMoveVQA:视频多模态大语言模型能否推理视频中的人类运动?

Pulkit Gera, Faegheh Sardari, Asmar Nadeem, Valentina Bono, Padraig Boulton, Adrian Hilton, Armin Mustafa

机构 * CVSSP, University of Surrey, Guildford, UK(萨里大学视觉、语音与信号处理中心,英国吉尔福德) Tesco, UK(乐购,英国)

专题命中 视频多模态 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV

AI总结 提出HumanMoveVQA基准,通过世界坐标系下的3D运动轨迹生成问答对,评估视频MLLM在全局轨迹和方向推理上的能力,发现现有模型存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18441 2026-06-18 cs.CV 新提交 77%

Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs

推理即交集:视频多模态大语言模型中视觉焦点的一致性帧对齐

Chengwen Liu, Zhe Huang, Jisheng Dang, Hong Peng, Qi Tian, Tat-Seng Chua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) Cloud and AI BU, Huawei(华为云与AI业务部) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出无时间标注的过程级奖励框架CF-GRPO,通过视频内在线索构建一致性帧先验,并利用一致性帧奖励优化模型帧使用与先验的对齐,提升视频推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10651 2026-06-10 cs.CV 新提交 77%

Kwai Keye-VL-2.0 Technical Report

Kwai Keye-VL-2.0 技术报告

Kwai Keye Team, Bin Wen, Changyi Liu, Chengru Song, Chongling Rao, Guowang Zhang, Han Li, Haonan Fan, Hengrui Ju, Jiankang Chen, Jiapeng Chen, Jiawei Yuan, Kaixuan Yang, Kaiyu Jiang, Kun Gai, Lingzhi Zhou, Na Nie, Sen Na, Tianke Zhang, Tingting Gao, Xuanyu Zheng, Yulong Chen, Fan Yang, Haixuan Gao, Lele Yang, Mingqiao Liu, Muxi Diao, Qi Zhang, Qile Su, Wei Chen, Wentao Hong, Xingyu Lu, Yancheng Long, Yankai Yang, Yingxin Li, Yiyang Fan, Yu Xia, Yuzhe Chen, Ziliang Lai, Chuan Yi, Haonan Jia, Tianming Liang, Weixin Xu, Xiaoxiao Ma, Yang Tian, Yufei Han, Feng Han, Hang Li, Jing Wang, Jinghui Jia, Junmin Chen, Junyu Shi, Ruilin Zhang

机构 * Kuaishou Group(快手集团)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出开源MoE多模态基础模型Keye-VL-2.0,首次将DeepSeek稀疏注意力适配到GQA架构,支持无损256K上下文处理,并通过跨模态多教师策略蒸馏和上下文/视频强化学习解决多任务对齐中的灾难性遗忘,在长视频理解和智能体任务上达到同类最优。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25621 2026-05-26 cs.CV 77%

StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering

StreamOV: 通过证据引导记忆与响应触发的流式全视频理解

Ming Xie, Zizheng Huang, Xudong Tan, Chao Wang, Xiangyu Zeng, Wenxiao Wu, Tao Chen, Limin Wang, Yanwei Fu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV

AI总结 提出StreamOV框架,利用多模态证据引导的长短期记忆和隐状态驱动的触发机制,实现流式全视频理解中的在线推理与主动响应,并在新基准SOVBench上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11208 2026-05-19 cs.CV 77%

Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation

Hi-GaTA:用于外科视频报告生成的分层门控时间聚合适配器

Kedi Sun, Chaohui Dang, Yue Feng, James Glasbey, Theodoros N. Arvanitis, Le Zhang

机构 * School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学工程学院) School of Computer Science, University of Birmingham, Birmingham, UK(英国伯明翰大学计算机科学学院) Department of Applied Health Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学应用健康科学系)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出Hi-GaTA框架,通过时间聚合压缩长视频序列生成LLM兼容的视觉前缀令牌,结合预训练的外科专用视频编码器和LoRA微调,实现高质量外科报告生成。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17555 2026-05-14 cs.CV 77%

GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking

GraphThinker: 通过事件图思维强化时间感知的视频推理

Zixu Cheng, Da Li, Jian Hu, Yuhang Zang, Ziquan Liu, Shaogang Gong, Wei Li

机构 * Queen Mary University of London(伦敦玛丽女王大学) Samsung AI Centre Cambridge(剑桥三星人工智能中心) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出GraphThinker,通过构建结构化事件表示并强化视觉 grounding,减少视频推理中的时间幻觉。在RexTime和VidHalluc数据集上取得显著提升。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05922 2026-05-13 cs.CV 77%

Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling

思考,然后评分:视频奖励建模中的解耦推理与评分

Yuan Wang, Ouxiang Li, Yulong Xu, Borui Liao, Jiajun Liang, Jinghan Li, Meng Wang, Xintao Wang, Pengfei Wan, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出DeScore模型,通过解耦推理与评分机制提升视频奖励建模的泛化能力,结合冷启动和强化学习优化,实现更稳定的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10386 2026-05-12 cs.AI 77%

GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic

GuardAD: 通过马尔可夫安全逻辑保障自动驾驶MLLMs

Tianyuan Zhang, Peng Yue, Zihao Peng, Jiangfan Liu, Zonghao Ying, Jiakai Wang, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 GuardAD通过马尔可夫逻辑形式化提升自动驾驶MLLMs的安全性,减少事故率并提升任务性能,经实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10228 2026-05-12 cs.MM 77%

FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries

FLARE:全模态长视频音频视觉检索基准测试与用户模拟查询

Qijie You, Hao Liang, Mingrui Chen, Bohan Zeng, Meiyi Qiang, Zhenhao Wong, Wentao Zhang

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.MM

AI总结 FLARE基准测试通过全模态长视频和用户模拟查询,评估视频检索在多模态大语言模型中的表现,揭示用户查询对模型行为的影响及音频语言对齐的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09449 2026-05-12 cs.CV 77%

SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs

SpaceMind++:迈向空间感知认知地图的视频多模态大语言模型

Bo Gu, Zhikang Zhang, Zizhuang Wei, Zhenyuan Chen, Lingyun Li, Zhuoyi Song

机构 * Fudan University(复旦大学) Huawei(华为) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 SpaceMind++通过构建体素化认知地图,实现空间一致性的视觉推理,提升视频多模态大语言模型在3D环境中的表现。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏