arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-31 至 2026-03-31 共收录 19 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 19 篇

2603.28696 2026-03-31 cs.CV cs.AI 86%

AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding

AdaptToken: 基于熵的自适应令牌选择用于多模态大语言模型长视频理解

Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) EPFL(瑞士联邦理工学院洛桑) ETH Zurich(苏黎世联邦理工学院)

专题命中 视频多模态 :MLLM(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 AdaptToken通过利用模型自不确定性实现全局控制信号,提升多模态大语言模型对长视频的理解能力,通过熵信号分配令牌预算并支持提前停止,提升准确率并减少推理时间。

Comments Project page: https://haozheqi.github.io/adapt-token

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25327 2026-03-31 cs.CV cs.AI cs.LG 84%

MMEdge: Accelerating On-device Multimodal Inference via Pipelined Sensing and Encoding

MMEdge: 通过流水线传感和编码加速设备端多模态推理

Runxi Huang, Mingxuan Yu, Mingyu Tsoi, Xiaomin Ouyang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MMEdge提出一种基于流水线传感和编码的设备端多模态推理框架,通过细粒度传感和编码单元实现增量计算,结合轻量级时间聚合模块和自适应配置优化器,降低延迟并保持高精度。

Comments Code available at: https://github.com/HKUST-MINSys-Lab/MMEdge. Accepted by SenSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27558 2026-03-31 cs.CV 83%

Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models

通过事件流学习在极端光照下视觉感知

Baoheng Zhang, Jiahui Liu, Gui Zhao, Weizhou Zhang, Yixuan Ma, Jun Jiang, Yingxian Chen, Wilton W. T. Fok, Xiaojuan Qi, Hayden Kwok-Hay So

机构 * The University of Hong Kong(香港大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Event-MLLM,通过动态融合事件流与RGB帧进行全光视觉推理,引入光照指示器和光照校正损失,解决极端光照下多模态大语言模型的感知与推理问题。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27690 2026-03-31 cs.CV 79%

Customized Visual Storytelling with Unified Multimodal LLMs

基于统一多模态大语言模型的定制化视觉叙事

Wei-Hua Li, Cheng Sun, Chu-Song Chen

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出VstoryGen框架,整合文本描述与角色背景参考,实现定制化故事生成。通过参数高效提示微调电影数据,增强电影多样性。建立两个新基准测试,评估多模态叙事的连贯性、文本-视觉对齐和镜头类型控制。

Comments Paper accepted to the CVPR 2026 Workshop on Generative AI for Storytelling (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27531 2026-03-31 cs.CV 79%

OmniColor: A Unified Framework for Multi-modal Lineart Colorization

OmniColor: 一种多模态线稿上色的统一框架

Xulu Zhang, Haoqian Du, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 OmniColor提出一种统一框架,通过空间对齐和语义参考信号分类,提升线稿上色的可控性、视觉质量和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26699 2026-03-31 eess.SP cs.CV cs.LG 79%

EMPD: An Event-based Multimodal Physiological Dataset for Remote Pulse Wave Detection

EMPD:基于事件的多模态生理数据集用于远程脉波检测

Qian Feng, Pengfei Li, Rongshan Gao, Jiale Xu, Rui Gong, Yidi Li

机构 * College of Computer Science and Technology, Taiyuan University of Technology(太原理工大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 EMPD数据集通过事件相机和临床级脉氧仪采集多模态数据,用于提升非接触式生理监测算法的鲁棒性,支持高时间精度的脉波检测。

Comments 12 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24975 2026-03-31 cs.IR 78%

Unbiased Multimodal Reranking for Long-Tail Short-Video Search

长尾短视频搜索的无偏多模态重排序

Wenyi Xu, Feiran Zhu, Songyang Li, Renzhe Zhou, Chao Zhang, Chenglei Dai, Yuren Mao, Yunjun Gao, Yi Zhang

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出基于LLM的多模态重排序框架,通过多阶段训练提升长尾查询内容质量,实验显示在AUC、NDCG@K和用户偏好判断等指标上优于基线方法,线上A/B测试验证了其在用户体验和消费指标上的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16997 2026-03-31 cs.CV cs.LG cs.RO 74%

Resolving Spatio-Temporal Entanglement in Video Prediction via Multi-Modal Attention

通过多模态注意力解决视频预测中的时空纠缠

Shreyam Gupta, P. Agrawal, Priyam Gupta

机构 * Indian Institute of Technology (BHU), Varanasi(印度理工学院(巴纳拉斯印度教大学),瓦拉纳西) University of Colorado, Boulder(科罗拉多大学博尔德分校) Erasmus+, Intelligent Field Robotic Systems (IFRoS), University of Girona(伊拉斯谟+,智能现场机器人系统(IFRoS),赫罗纳大学)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV

AI总结 本文提出MAUCell架构,结合GAN与层级处理策略及三种注意力机制,解决RNN在长时间序列中的局限,提升视频预测的时空一致性与实时性。

Comments 11 pages, 3 figures, 5 tables, and 3 Algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12360 2026-03-31 cs.CV cs.CL 62%

VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding

VideoARM:基于分层记忆的代理推理用于长视频理解

Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 VideoARM通过自适应代理推理和分层记忆结构,有效降低长视频理解的token消耗,优于现有方法DVD。

Comments Accepted to CVPR 2026, code available at https://milvlg.github.io/videoarm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21086 2026-03-31 cs.CV cs.AI 62%

Efficient Mixture-of-Expert for Video-based Driver State and Physiological Multi-task Estimation in Conditional Autonomous Driving

高效多专家模型用于基于视频的驾驶员状态和生理多任务估计在条件自动驾驶中

Jiyao Wang, Xiao Yang, Zhenyu Wang, Ximeng Wei, Ange Wang, Dengbo He, Kaishun Wu

机构 * the Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Hong Kong(香港大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VDMoE模型,通过RGB视频和远程PPG数据监测驾驶员状态,优化多专家框架以提升多模态输入下的检测效率与准确性,通过新数据集验证其在条件自动驾驶中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26727 2026-03-31 cs.CV cs.AI 62%

The Nonverbal Gap: Toward Affective Computer Vision for Safer and More Equitable Online Dating

非语言鸿沟:迈向更安全和公平的在线约会情感计算

Ratna Kandala, Niva Manchanda, Akshata Kishore Moharir

机构 * University of Kansas(堪萨斯大学) University of Maryland(马里兰大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨在线约会中非语言信息缺失的问题,提出以公平性为核心的研究议程,涵盖实时不适检测、互动不对称建模、知情同意互动设计及长期互动总结等能力领域,强调需建立公平评估体系和设备端处理架构以提升安全性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27913 2026-03-31 cs.CV 57%

Spatial Orthogonal Refinement for Robust RGB-Event Visual Object Tracking

空间正交细化用于鲁棒的RGB-事件视觉目标跟踪

Dexing Huang, Shiao Wang, Fan Zhang, Xiao Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SOR-Track框架,通过空间正交细化方法改进RGB-事件融合跟踪,在高速运动和低光条件下提升鲁棒性。

Comments Joint International Conference on Automation-Intelligence-Safety and International Symposium on Autonomous Systems 2026 (ICAIS and ISAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27866 2026-03-31 cs.CV 57%

Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning

Wan-R1: 可验证强化学习用于视频推理

Ming Liu, Yunbei Zhang, Shilong Liu, Liwen Wang, Wensheng Zhang

机构 * Iowa State University(爱荷华州立大学) Tulane University(杜兰大学) Princeton University(普林斯顿大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出可验证奖励设计以提升视频推理的泛化能力,通过改进GRPO算法在流基视频模型中训练,验证奖励在复杂迷宫和机器人导航任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21742 2026-03-31 cs.CV 57%

VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues

VRR-QA:超越显性提示的视频视觉关系推理

Sirnam Swetha, Rohit Gupta, Parth Parag Kulkarni, David G Shatwell, Jeffrey A Chan Santiago, Nyle Siddiqui, Joseph Fioresi, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida, USA(美国中佛罗里达大学人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VRR-QA通过精心 curated 的创意视频数据集,评估视频问答模型在隐含关系推理上的表现,揭示现有模型对显性视觉线索的依赖及隐含推理的难度。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27184 2026-03-31 cs.CV 57%

Incentivizing Temporal-Awareness in Egocentric Video Understanding Models

激励时间感知的自体视频理解模型

Zhiyang Xu, Tian Qin, Bowen Jin, Zhengfeng Lai, Meng Cao, Lifu Huang, Peng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) Apple(苹果公司) Harvard University(哈佛大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) UC Davis(加州大学戴维斯分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TGPO算法,通过强化学习提升多模态大语言模型在自体视频理解中的时间感知能力,实验表明其在时间接地和因果连贯性方面优于现有方法。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27103 2026-03-31 cs.CV 57%

LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model

通过分层全局-局部骨架-语言模型增强动作识别

Ruosi Wang, Fangwei Zuo, Lei Li, Zhaoqiang Xia

机构 * Northwestern Polytechnical University(西北工业大学) Shandong University of Finance and Economics(山东财经大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出HocSLM模型,通过分层全局-局部网络和大视觉-语言模型融合骨架与文本信息,提升动作识别的语义表达和跨模态理解能力,实验表明在三个主流数据集上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13846 2026-03-31 cs.HC cs.AI 57%

Is Seeing Believing? Evaluating Human Sensitivity to Synthetic Video

看见就是相信吗?评估人类对合成视频的敏感性

David Wegmann, Emil Stevnsborg, Søren Knudsen, Luca Rossi, Aske Mottelson

机构 * IT University of Copenhagen(哥本哈根信息技术大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文通过三项研究探讨人类对合成视频中视觉和听觉扭曲的感知,发现视频扭曲和深度伪造瑕疵会降低可信度,为深入理解合成视频的认知处理提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12533 2026-03-31 cs.CV 57%

Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering

你看到我指向的是什么?基于手势的 egocentric 视频问答

Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出 EgoPointVQA 数据集和基准,结合 Hand Intent Tokens 提升手势引导的 egocentric 问答性能,HINT-14B 在多个任务上超越现有最佳模型。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03100 2026-03-31 cs.CV 57%

AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video

AVATAR:通过视频进行视觉、听觉和推理的强化学习

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 AVATAR通过离线训练架构和时间优势塑造策略解决多模态长时视频推理中的数据效率、消失优势和信用分配问题,实现跨多个基准测试的优越性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏