arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4703 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4703 篇

2607.26769 2026-07-30 cs.CV cs.AI 新提交 81%

See2Think: Do Multimodal Models Really Use Intermediate Visual States?

See2Think:多模态模型是否真正利用中间视觉状态?

Siyu Yan, Zhuoran Yan, Haiying Xu, Panhao Zhou, Jingyu Chen, Chenhao Ji, Shuo Cao, Yongheng Zhang, Haoze Liu, Siyu Zhang, Xiwen Gu, Yihao Liu, Alex Jinpeng Wang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出See2Think评估框架,通过See2ThinkBench和VAoT测试多模态模型对中间视觉状态的依赖,发现视觉推理具模型与环境依赖性,准确渲染是瓶颈,受损反馈会使模型准确率降超10个百分点。

Comments 10 pages, 5 figures, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22729 2026-07-28 cs.CV cs.CL 新提交 81%

Open Your Model's Eyes: Video and Context-Aware Multimodal Backchannel Prediction

睁开模型之眼:视频与上下文感知的多模态反馈预测

Min-Jae Kim, Jun-Yeong Moon, Mujeen Sung, Gyeong-Moon Park

机构 * Korea University(韩国大学) Kyung Hee University(庆熙大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究视频与上下文感知的多模态反馈预测问题,提出CAMA - BC框架,利用多层多模态对齐,分上下文对齐和反馈对齐两阶段,显著优于现有方法及简单多模态基线,尤其在识别复杂反馈上效果突出。

Comments 18 pages, Accepted at ACL 2026

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, pp. 3738-3755, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18080 2026-07-28 cs.CV cs.AI 版本更新 81%

Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection

稀疏证据就足够了:用于多模态视频错误信息检测的智能证据搜索

Haochen Zhao, Yongxiu Xu, Xinkui Lin, Dong Xie, Jiarui Lu, Yuqi Qian, Yubin Wang, Hongbo Xu, Gaopeng Gou

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究多模态视频错误信息检测,提出SIEVE框架,通过智能体探索多模态证据构建证据包,由验证器判断真实性。智能体经特殊训练,实验表明该框架性能优于基线,能提供可检查证据线索,提升检测透明度与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14702 2026-07-22 cs.CV cs.AI 版本更新 81%

Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach

第十一届ABAW竞赛中的团队RAS:多模态矛盾情绪识别方法

Elena Ryumina, Maxim Markitantov, Alexandr Axyonov, Fedor Shchetinin, Timur Abdulkadirov, Dmitry Ryumin, Alexey Karpov

机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences (SPC RAS)(俄罗斯科学院圣彼得堡联邦研究中心) HSE University(圣彼得堡高等经济学院) ITMO University(圣彼得堡国立信息技术机械与光学大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对第十一届ABAW竞赛的视频级矛盾情绪和犹豫情绪识别,提出以文本为中心的多模态方法,用文本残差融合模型结合多种特征,实验表明该方法能有效提高识别性能,无需大型模型集成。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17366 2026-07-21 cs.MM cs.CL cs.HC eess.SP 新提交 81%

EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation

EII-SCL:利用情感惯性进行对话中的多模态情感识别

Zilong Huang, Kong Aik Lee, Chong-Xin Gan, Zezhong Jin, Ruichen Zuo, Man-Wai Mak

机构 * Electronic Engineering,\ Hong Kong Polytechnic University, Hong Kong SAR, China

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM

AI总结 研究对话中的多模态情感识别问题,提出情感惯性引导监督对比学习模块EII-SCL,通过构建受惯性影响样本为对比目标提供信息,利用情感惯性先验,无需额外数据,与现有模型无缝集成,实验证明该方法优于现有方法。

Comments Accept by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16322 2026-07-21 cs.CV cs.AI 新提交 81%

GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs

GMoT:用于基于多模态大语言模型的细粒度微手势视频推理的门控运动感知令牌化

Taorui Wang, Wei Xia, Hui Ma, Zijia Song, Jiayu Zhang, Zeheng Wang, Yong Xu, Zitong Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对微手势识别中运动易被掩盖及MLLMs处理运动学困难的问题,提出GMoT模块,通过空间加权池等提取运动线索并融合,引入渐进奖励引导策略优化范式,在多数据集上表现出色,还提出BRG召回及跨域转移协议。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09759 2026-07-15 cs.CV cs.AI 版本更新 81%

ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams

ReflectWorld-MM:一种面向实体的开放式视频流多媒体存储系统

Xiaokang Ma, Yifan Sun, Zhihong Jin, Jie Gu, Yudong Luo, Shenyi Shao, Chu Tang, Jingmin Chen, Li Pu

机构 * Rightly Robotics(Rightly机器人公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文针对开放式视频流存储问题,提出面向实体的多媒体存储系统ReflectWorld-MM,由感知前端、分层长期记忆和实际应用实现三部分构成,在六个相关基准测试中取得最佳准确率,优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11839 2026-07-14 cs.CV cs.AI 新提交 81%

LoRA-Based Cascaded Multimodal Fusion for Action Recognition in Medical Training Environments

基于LoRA的级联多模态融合在医学训练环境中的动作识别

Divya Mereddy, Jeevan Beedareddy

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究面向医疗训练环境的动作识别,提出基于LoRA的级联多模态融合框架,结合特定模态适应与顺序融合,无需重新训练组件,在两个数据集上评估,结果显示该策略优于单模态模型且性能有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09417 2026-07-13 cs.CV cs.AI 新提交 81%

SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition

SVF-CR:用于多模态矛盾心理和犹豫识别的同步视觉-面部交叉细化

Hyein Park, Namho Kim, Junhwa Kim

机构 * Konyang University(公州大学) Korean Broadcasting System (KBS)(韩国广播公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究多模态矛盾心理和犹豫识别,提出SVF-CR框架,通过提取视频和面部令牌,经多种注意力机制细化,构建视觉-面部证据并融合文本、声学特征,实验证明该框架提升了公共宏F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07091 2026-07-09 cs.CV cs.AI 新提交 81%

AT-Attn: Temporal-Aware Cross-Attention for Longitudinal Multimodal Alzheimer's Disease Diagnosis

AT-Attn:用于纵向多模态阿尔茨海默病诊断的时间感知交叉注意力机制

Xinyue Du, Yibo Liu, Zhenglei Zhou, Xuancheng Yao, Weimin Zhong, Qiuhui Chen

机构 * Xinyue Du1, Yibo Liu2, Zhenglei Zhou3, Xuancheng Yao2, Weimin Zhong1, Qiuhui Chen14(未知)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对纵向AD诊断中多模态信息整合难题,提出AT-Attn框架,结合多种技术整合MRI与临床信息,在患者级五折交叉验证中,该模型多项指标优于单模态和简单融合基线,为AD诊断提供临床相关补充信息。

Comments Submitted to IEEE BIBM 2026. 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26772 2026-07-09 cs.CV cs.AI cs.CY 版本更新 81%

From Content to Audience: A Multimodal Annotation Framework for Broadcast Television Analytics

从内容到受众:一种多模态注释框架用于广播电视分析

Paolo Cupini, Francesco Pierri

机构 * Dipartimento di Elettronica, Informazione e Bioingegneria, Politecnico di Milano, Italy(意大利米兰理工大学电子、信息与生物工程系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种多模态注释框架,用于广播电视内容分析,通过构建特定领域的基准测试,评估不同管道架构在广播新闻中的表现,展示了框架在受众分析中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02680 2026-07-07 cs.CV cs.AI 新提交 81%

K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

K9-Bench:在以犬类为中心的视频上评估多模态大语言模型

Khush Attarde, Yusuf Ali, Megha Thukral, Divye Bhutani, Thomas Ploetz, Zsolt Kira

机构 * Ogmen Robotics Inc.(Ogmen机器人公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 介绍K9-Bench基准,通过约5000个问答对测试多模态大语言模型对犬类动作和互动理解。提出数据生成管道创建数据集,发现前沿模型在犬类任务上零样本性能有限,还提供通用数据集构建管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03329 2026-07-07 cs.CV cs.AI cs.LG cs.SD 版本更新 81%

AViS-Mamba: Adaptive Visual Steering of Audio State-Space Dynamics for Violence Detection

CoLoRSMamba:基于条件LoRA的Mamba用于监督多模态暴力检测

Damith Chamalke Senadeera, Dimitrios Kollias, Gregory Slabaugh

机构 * Digital Environmental Research Institute(数字环境研究所) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoLoRSMamba,通过CLS引导的条件LoRA将VideoMamba与AudioMamba耦合,实现场景感知的音频动态,提升多模态暴力检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00271 2026-07-02 cs.CV cs.AI cs.RO 版本更新 81%

REALM: An RGB- and Event-Aligned Latent Manifold for Cross-Modal Perception

REALM:一种RGB和事件对齐的潜在流形用于跨模态感知

Vincenzo Polizzi, David B. Lindell, Jonathan Kelly

机构 * University of Toronto, Robotics Institute(多伦多大学机器人研究所) University of Toronto, Department of Computer Science(多伦多大学计算机科学系)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 REALM通过将事件表示投影到预训练的RGB基础模型潜在空间,实现跨模态感知,利用LoRA技术解锁冻结RGB主干的几何和语义先验,实现零样本应用复杂解码器。

Comments Accepted to the European Conference on Computer Vision (ECCV), Malmö, SE, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29900 2026-06-30 cs.CV cs.AI 81%

LLM-based Multimodal Personality Recognition via Facial Action Unit-Text Semantic Fusion

基于面部动作单元-文本语义融合的LLM多模态人格识别

Tianyi Zhang, Wei Shan, Yuan Zong, Tianhua Qi, Wenming Zheng

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出一种基于大语言模型的面部动作单元与文本语义融合框架,通过将AU序列转化为可解释文本描述并与受访者文本回答融合,实现异步视频面试中的人格识别,在AVI-6基准上取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29023 2026-06-30 cs.CV cs.AI 81%

Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification

基于二级跟踪和强化学习验证的多模态大模型高效时空定位

Tianshu Zhang, Yan Wang, Ji Qi, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出一种从帧级到秒级跟踪的流水线,结合跨秒平滑、链式思维轨迹合成和强化学习优化,在长视频中实现高效且准确的时空定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28514 2026-06-30 cs.AI cs.CL 81%

GPTNT: Benchmarking Real-Time Collaboration Between Multimodal Agents on Keep Talking And Nobody Explodes

GPTNT:在《保持通话,无人爆炸》中基准测试多模态智能体之间的实时协作

Amit Parekh, Sabrina McCallum, Kareem Al-Hasan, Malvina Nikandrou, Alessandro Suglia, Ioannis Konstas

机构 * Heriot-Watt University(赫瑞-沃德大学) University of Edinburgh(爱丁堡大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出GPTNT基准,基于合作游戏《保持通话,无人爆炸》测试多模态智能体在实时、信息不对称条件下的协作能力,发现当前最先进系统无法在实时中拆除任何炸弹。

Comments Project website and code at https://gptnt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03401 2026-06-29 cs.HC cs.AI cs.CV 版本更新 81%

Can LLMs Reason About Attention? Towards Zero-Shot Analysis of Multimodal Classroom Behavior

LLMs能否进行注意力推理?多模态课堂行为的零样本分析

Nolan Platt, Sehrish Nizamani, Alp Tural, Elif Tural, Saad Nizamani, Andrew Katz, Yoonje Lee, Nada Basit

机构 * Virginia Tech(弗吉尼亚理工大学) University of Virginia(弗吉尼亚大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个隐私保护的分析流程,利用OpenPose和Gaze-LLE提取学生注意力信息,并通过QwQ-32B-Reasoning进行零样本分析,探讨LLMs在多模态行为理解中的潜力与局限。

Comments 8 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23581 2026-06-23 cs.DC cs.AI cs.CV 新提交 81%

Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse

Kamera: 统一的位置无关多模态KV缓存,用于免训练复用

Bole Ma, Jan Eitzinger, Harald Koestler, Gerhard Wellein

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Kamera,一种免训练的位置无关KV缓存复用方法,通过低秩条件补丁修复跨块绑定丢失,在MM-NIAH和文档QA上恢复完整精度,显著降低多模态代理的重计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22699 2026-06-23 cs.CV cs.MM 新提交 81%

Catching Lies Without Sending the Video: Privacy-Preserving Multimodal Deception Detection

无需发送视频即可识谎:隐私保护的多模态欺骗检测

Nikita Sharma, Pranav Sara, Karan Singla

机构 * University of California, San Diego(加州大学圣迭戈分校) Case Western Reserve University, Ohio(凯斯西储大学) WhissleAI, USA(WhissleAI(美国))

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 提出Whissle方法,通过设备端提取文本、情感、行为等紧凑摘要,在无需传输原始视频的情况下实现与云端模型相当的欺骗检测性能(AUC 0.741),并揭示先前75%准确率存在说话者泄露问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22043 2026-06-23 cs.AI cs.CV cs.LG 新提交 81%

When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR

视频语言模型何时停止观看?多模态RLVR中视觉捷径的形成与逆转受奖励强度控制

Zekun Xu

机构 * Zekun Xu(徐泽坤)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究多模态强化学习中视觉捷径的形成与逆转机制,发现惩罚强度可控制其出现和消除,且存在关键干预窗口。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02561 2026-06-23 cs.CV cs.AI 版本更新 81%

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法

Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Silva

机构 * Stanford University(斯坦福大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Microsoft(微软公司)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。

Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)

Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19965 2026-06-19 cs.CV cs.AI 新提交 81%

ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

ROSE:多模态模型中感知到行动差距的基准测试

Yihao Wang, Zijian He, Jie Ren, Keze Wang

机构 * Sun Yat-sen University(中山大学) Shaanxi Normal University(陕西师范大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出ROSE基准,通过固定视觉场景并变化区域约束与符号输出,测试多模态大模型在不同上下文中将相同视觉证据转化为所需行动的能力,发现模型性能下降高达44.5个百分点,揭示感知到行动的瓶颈。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13289 2026-06-12 cs.CV cs.AI 新提交 81%

HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

HYDRA-X: 具有整体视觉分词器的原生统一多模态模型

Guozhen Zhang, Xuerui Qiu, Yutao Cui, Tianhui Song, Changlin Li, Junzhe Li, Tao Huang, Xiao Zhang, Yang Li, Jianbing Wu, Miles Yang, Zhao Zhong, Liefeng Bo, Limin Wang

机构 * Nanjing University(南京大学) CASIA(中国科学院自动化研究所) Tencent Hunyuan(腾讯混元) Zhongguancun Academy(中关村学院) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出HYDRA-X,首个在单一ViT中统一图像和视频分词的原生统一多模态模型,通过因果时间注意力和分层时间压缩实现高效重建,并利用轻量化解压缩器注入语义,显著提升编辑一致性和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11209 2026-06-11 cs.CL cs.AI cs.LG 新提交 81%

ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

ProcessThinker: 通过基于展开的过程奖励增强多模态大语言模型推理

Jingpei Wu, Xiao Han, Weixiang Shen, Boer Zhang, Zifeng Ding, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Harvard University(哈佛大学) University of Cambridge(剑桥大学) Mina AI Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠人工智能卓越学校(relAI))

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出ProcessThinker,一种无需显式过程奖励模型的后训练方法,通过步骤标记格式和基于展开的过程奖励,为多步推理提供密集的步骤级奖励,提升多模态推理一致性。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06872 2026-06-08 cs.CV cs.AI 新提交 81%

EgoPressDiff: Multimodal Video Diffusion for Egocentric UV-Domain Hand-Pressure Estimation

EgoPressDiff: 用于自我中心UV域手部压力估计的多模态视频扩散模型

Yuan Zeng, Zilue Gao, Yujia Shi, Zongqing Lu, Wenming Yang, QingMin Liao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出EgoPressDiff,一种条件视频扩散框架,通过多模态条件策略(手部姿态、3D网格顶点和深度信息)从视觉输入生成UV压力图,解决了现有方法中的量化误差和时间不一致问题,在EgoPressure数据集上实现SOTA,Volumetric IoU相对提升34%以上。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22574 2026-06-08 cs.CV cs.AI 版本更新 81%

Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models

增强视频表示中的时空语义残差以缓解视频大型多模态模型中的幻觉

Yuansheng Gao, Jinman Zhao, Tong Zhang, Xingguo Xu, Wenbin Xing, Han Bao, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) University of Toronto(多伦多大学) Dalian University of Technology(大连理工大学) Sun Yat-sen University(中山大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出ViSSRes方法,通过轻量级MLP网络学习视频表示的残差,从时空和语义一致性优化,在推理时仅需单次前向传播,有效降低幻觉率并提升视频理解性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01615 2026-06-02 cs.CV cs.MM 81%

Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval

图灵模式用于多媒体:反应-扩散多模态融合用于语言引导的视频时刻检索

Xiang Fang, Wanlong Fang, Wei Ji, Tat-Seng Chua

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出基于反应-扩散过程的多模态融合框架RDMF,通过模拟生物模式形成机制实现视频与文本的动态对齐,用于视频时刻检索与高亮检测。

Comments Published in ACM MM 2025. Address some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26680 2026-05-27 cs.CV cs.AI 81%

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding

DynFrame: 自适应推理驱动的多模态框架与动态帧增强用于复杂视频理解

Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Haobing Tang, Le Zhang, Hao Jiang, Pipei Huang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出DynFrame框架,通过将时间窗口和采样密度作为原生token进行单步检索,并引入分段解耦GRPO优化,解决了视频多模态大模型中采样密度不可学习及检索与回答优化耦合的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07570 2026-05-20 q-bio.NC cs.AI cs.CV cs.LG 81%

How does longer temporal context enhance multimodal narrative video processing in the brain?

更长的时间上下文如何增强大脑对多模态叙事视频的处理?

Prachi Jindal, Anant Khandelwal, Manish Gupta, Bapi S. Raju, Subba Reddy Oota, Tanmoy Chakraborty

机构 * Technische Universität Berlin(柏林技术大学) Microsoft Research(微软研究院) IIT Delhi(德里理工学院) Microsoft(微软) IIIT-Hyderabad(海得拉巴理工学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究探讨了视频片段时长和叙事任务提示如何影响自然电影观看过程中大脑模型对多模态大语言模型(MLLMs)的对齐情况,发现增加片段持续时间显著提高了大脑对齐程度,而单模态视频模型则无明显提升。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏