arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 317 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 317 篇

2606.10819 2026-06-10 cs.CV cs.AI 新提交 90%

Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

Earth-OneVision:将遥感多模态大语言模型扩展到更多传感器模态和任务

Miaoxin Cai, Guanqun Wang, Wei Zhang, Guangyao Zhou, Yin Zhuang, Tong Zhang, Hao Wang, He Chen, Jun Li

机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing (SBIIP), Beijing Institute of Technology(北京理工大学空间智能信息处理国家重点实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) Key Laboratory of Technology in Geo-Spatial Information Processing and Application System, Chinese Academy of Sciences(中国科学院地理空间信息处理与应用系统技术重点实验室) Advanced Research Institute of Multidisciplinary Sciences, Beijing Institute of Technology(北京理工大学前沿交叉科学研究院) School of Mechatronical Engineering, Beijing Institute of Technology(北京理工大学机电学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) School of Electronics, Peking University(北京大学电子学院) School of Computer Science and Hubei Key Laboratory of Intelligent Geo-Information Processing(华中科技大学计算机科学与技术学院&湖北省智能地理信息处理重点实验室)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出Earth-OneVision,一个2B参数的RS-MLLM,通过全粒度视觉语言对齐、空间语言同构序列化和渐进式跨模态适应机制,统一六种传感器模态和九类任务,在多个基准上达到或超越4B-72B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18716 2026-07-22 cs.CV 新提交 89%

Continual Video-MLLM Adaptation over Evolving Domains

在不断演变的领域上进行连续视频 - MLLM 适应

Rui Cheng, Meixing Shi, Yuxiang Cai, Jingcai Guo, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

专题命中 视频多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 研究视频多模态大语言模型对不断演变领域的适应问题,提出分布感知专家路由框架 DAER,通过保持领域隔离的轻量级专家、引入多种路由和优化机制,在域增量基准上评估,结果优于现有方法。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15689 2026-07-20 cs.CV 新提交 89%

Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors

基于注意力的MLLM选择器在测试时对长视频进行高效帧选择

Yilin Wang, Xiangxi Zheng, Dongxing Mao, Linjie Li, Zhengyuan Yang, Ping Yu, Rui Yan, Yuan Yao, Alex Jinpeng Wang

机构 * ZJU(浙江大学) NJU(南京大学) CSU(中南大学) Microsoft(微软公司) NJUST(南京理工大学)

专题命中 视频多模态 :MLLM(title,title_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究利用MLLMs中验证选择提取层的跨模态注意力构建无训练的DAFS帧选择器,通过查询条件聚合提取帧级证据,将候选池大小和每帧令牌预算联合分配问题用动态规划解决,在Video-MME上表现出色,且无需重新训练即可跨多种模型和任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07433 2026-06-08 cs.CV cs.AI cs.MM 新提交 88%

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解

Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) CASIA(中国科学院自动化研究所) University of Tokyo(东京大学) University of Liverpool(利物浦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) UC Merced(加州大学默塞德分校)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出人类视角下视频理解的三个功能能力(观看、记忆、推理),构建统一框架分析视频MLLM的感知、记忆、推理和预测,并总结挑战、方法、应用及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02963 2026-07-07 cs.CV cs.AI cs.MM 新提交 87%

Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

用于全模态密集视频字幕的并行自回归解码

Wenzheng Zeng, Siyi Jiao, Chen Gao, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :omni-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究密集视频字幕生成,提出并行自回归框架,利用事件间弱局部依赖重组因果依赖图,引入全局规划和事件分解并行解码机制,提升效率与字幕性能。

Comments ECCV 2026. Project website: https://github.com/showlab/PadCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07541 2026-06-09 cs.HC cs.AI cs.CV cs.CY cs.MM 新提交 87%

Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

多模态大语言模型作为视频研究中的合成参与者:一项评估

Prabal Shrestha, Bohan Jiang, Haoning Xue, Huan Liu, Xinyi Zhou

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.MM

AI总结 本研究评估多模态大语言模型在视频感知任务中模拟人类主观评分的表现,发现模型存在偏差且与人类一致性有限。

Comments Accepted to SocialLLM @ ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13024 2026-06-12 cs.LG cs.AI 新提交 86%

CausalMoE: A Billion-Scale Multimodal Foundation Model for Granger Causal Discovery with Pattern-Routed Heterogeneous Experts

CausalMoE:基于模式路由异构专家的十亿规模多模态基础模型用于格兰杰因果发现

Bo Liu, Di Dai, Jingwei Liu, Jiarui Jin, Xiaocheng Fang, Guangkun Nie, Hongyan Li, Shenda Hong

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) National Institute of Health Data Science, and Institute for Artificial Intelligence, Peking University(北京大学健康医疗大数据国家研究院、人工智能研究院)

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.AI

AI总结 提出CausalMoE,一种十亿规模多模态格兰杰因果基础模型,通过模式路由混合异构专家解耦动态机制,结合因果自注意力与LLM/VLM先验,实现稀疏因果图恢复,在监督和少样本场景中达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16560 2026-07-21 cs.AI cs.CV cs.LG cs.MM 新提交 85%

From Modalities to Propositions: A Language-Centric Framework for Multimodal Intelligence

从模态到命题:多模态智能的语言中心框架

Nadine Chang, Maying Shen, Shizhe Diao, Jialiang Wang, Jingde Chen, Thomas Breuel, Pavlo Molchanov, Rafid Mahmood, Jose M. Alvarez

机构 * NVIDIA(英伟达) University of Ottawa(渥太华大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 该研究提出多模态数据语言表示框架,将观察结果表示为原子命题,通过全局语义码本统一为共享词汇表,置于可解释空间,实现跨模态理解等,还在自动驾驶等数据上进行了展示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16198 2026-06-16 cs.CV 新提交 84%

GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction

GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测

Ruoxuan Yang, Tieyuan Chen, Xiaofeng Huang, Haibing Yin, Jun Wang, Xiping Chen, Jun Yin, Xuesong Gao, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Hangzhou Dianzi University(杭州电子科技大学) The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所) Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司) Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司) School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出GRACE框架,通过提取时间有序的主谓宾三元组和视觉实体裁剪,增强视频MLLM对细粒度情感线索的提取与推理,在Pitts数据集上提升Qwen2.5-VL和Qwen3-VL性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28375 2026-07-31 cs.AI cs.MM 新提交 84%

HyperClaim: Fine-Grained Cross-Modal Hypergraph Reasoning for Video Misinformation Detection

HyperClaim:用于视频虚假信息检测的细粒度跨模态超图推理

Xiangbo Wang, Jiasheng Zhang, Xingtong Yu, Luoqiang Lei, Delvin Ce Zhang

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM

AI总结 HyperClaim是一种用于视频虚假信息检测的判别式时间超图框架,通过细粒度跨模态超图推理,在FactGuard协议下的三个数据集上准确率优于基线方法。

Comments 13 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17994 2026-07-21 cs.CV cs.AI 新提交 84%

HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization

HAS:用于多模态大语言模型视频摘要的高亮引导注意力转向

Rui Chu, Yingjie Lao

机构 * Tufts University(塔夫茨大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 针对视频摘要,提出HAS方法,通过全局找连续帧级高亮分布并作为注意力转向向量,让多模态大语言模型在推理时更关注高亮帧,避免丢失信息,在多种基准测试中性能出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15794 2026-07-20 cs.CV cs.AI 新提交 84%

On the Geometry of Learned Representations in Event-Based Multi-Modal Egomotion Estimation

基于事件的多模态自我运动估计中学习表征的几何结构研究

Stefano Silvestrini, Michele Ceresoli

机构 * Politecnico di Milano(米兰理工大学)

专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究基于事件的多模态自我运动估计中多模态网络的几何结构,通过跨模态注意力架构融合多模态信号并训练,分析潜在空间几何和注意力动态,揭示相关特性,架起分析估计理论与数据驱动融合的桥梁。

Comments 5 pages, 3 figures, to be published in SPAICE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02324 2026-08-04 cs.CV 新提交 83%

Implicit Neural Representations for Multimodal Longitudinal Image Imputation and Interpolation

用于多模态纵向图像插补与插值的隐式神经表示

Sina Wendrich, Lukas Förner, Zoe Reinke, Kartikay Tehlan, Ansgar Berlis, Michael Frühwald, Matthias Wagner, Thomas Wendler

机构 * University Hospital Augsburg(奥格斯堡大学医院) University of Augsburg(奥格斯堡大学) Technical University of Munich(慕尼黑工业大学) Bavarian Cancer Research Center (BZKF)(巴伐利亚癌症研究中心) Swabian Children’s Cancer Center(施瓦本儿童癌症中心)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 该研究针对临床纵向MRI数据缺失等问题,提出条件隐式神经表示模型,经儿科脑肿瘤数据验证,可显著改进插值效果,置信度估计可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20981 2026-07-24 cs.AI 新提交 83%

Beyond Independent Optimization: Compression, MoE Routing, and Quantization Interactions in Multimodal Edge Intelligence

超越独立优化:多模态边缘智能中的压缩、混合专家路由和量化交互

Jay Gor, Karm Dave, Akshita Abrol, Rajesh Gupta, Sudeep Tanwar, Zhengkui Wang

机构 * Nirma University(尼玛大学) Singapore Institute of Technology(新加坡理工学院) Marwadi University(马尔瓦迪大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究多模态边缘智能中高效推理受多种因素限制,回顾相关模型进展,指出技术间相互影响不能独立优化,介绍关键设计权衡,引入视频MoE模型诊断方法,强调多方面开放研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17712 2026-07-21 cs.AI 新提交 83%

Learning to Detect Cross-Modal Negation: An Analysis of Latent Representations and an Attention-Based Solution

学习检测跨模态否定:潜在表示分析与基于注意力的解决方案

Ali AbuSaleh, Leon Hammerla, Alexander Mehler

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 研究跨模态否定检测难题,提出新型跨模态注意力架构,分析发现文本与视觉否定的不对称性,结合自监督视频表示推进时间否定建模,为多模态系统学习语义对齐表示提供新方法。

Comments This manuscript is an accepted version of the article (published at ICNLP2026). Published in IEEE Xplore, DOI:10.1109/ICNLP69856.2026.11527861 document: https://ieeexplore.ieee.org/abstract/document/11527861

Journal ref 2026 8th International Conference on Natural Language Processing (ICNLP), Xi'an, China, 2026, pp. 613-622

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05971 2026-07-08 cs.MM cs.SD 新提交 83%

Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking

通过语义检索和时间重排实现多模态视频到音乐推荐

Seungheon Doh, Minhee Lee, Sangmoon Lee, Ben Sangbae Chon, Juhan Nam

机构 * Graduate School of Culture Technology, KAIST(韩国釜山科学技术大学文化科技研究生院) Gaudio Lab, Inc(Gaudio实验室)

专题命中 视频多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM

AI总结 提出用于视频到音乐推荐的两阶段框架VTMR,第一阶段通过全局嵌入检索语义兼容候选,第二阶段关注时间序列重排。实验显示该框架能提升推荐效果,人类偏好研究表明其在总体偏好上与商业基线相当,音乐质量优于生成基线。

Comments Accepted for publication at The Machine Learning for Audio workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01667 2026-07-03 cs.CV 新提交 83%

Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

增强视听视频字幕的时间与跨模态对齐

Chen Zhao, Jiajun Ma, Qilong Huang, Tiehan Fan, Hongyu Li, Zhuoliang Kang, Xiaoming Wei, Jian Yang, Ying Tai

机构 * Nanjing University, State Key Laboratory for Novel Software Technology(南京大学,计算机软件新技术国家重点实验室) Meituan(美团)

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出TCA-Captioner框架,通过观察-检查-纠正迭代策略和密集交互数据集,解决视听字幕中的模态分离与时间不一致问题,实现精准的视听绑定与因果动态建模。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11683 2026-06-11 cs.CV cs.AI 新提交 82%

Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning

推理,再推理:跨视角重访提升空间推理

Chaofan Ma, Zhenjie Mao, Yuhuan Yang, Fanqin Zeng, Yue Shi, Yingjie Zhou, Xiaofeng Cao, Jiangchao Yao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 提出ReRe框架,通过生成互补新视角视频让MLLM先推理再验证,无需训练即可显著提升空间推理性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03151 2026-08-05 cs.CR cs.HC 新提交 82%

AirKey: Multimodal Acoustic-Assisted WiFi Sensing for Zero-Training Robust PIN Inference

AirKey:用于零训练鲁棒PIN推断的多模态声学辅助WiFi感知

BaiChuan Wu, Bin Liu, Xiang Zhang, Zhi Liu, Jie Zhang, Chao Liu, Huan Yan, Meng Li, Fusang Zhang

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 AirKey是一种多模态感知框架,通过利用IEEE 802.11机制和声学信号辅助WiFi感知,实现零训练鲁棒PIN推断,准确率超现有单模态方案4倍,可在6次尝试内恢复设备解锁PIN,凸显智能界面的隐私漏洞。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11792 2026-06-12 cs.CV cs.AI cs.CL 新提交 82%

MultiToP: Learning to Patch Visual Tokens to Mitigate Hallucinations in Video Large Multimodal Models

MultiToP:学习修补视觉令牌以减轻视频大型多模态模型中的幻觉

Yuansheng Gao, Wenbin Xing, Jiahao Yuan, Kaiwen Zhou, Han Bao, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) Sun Yat-sen University(中山大学) East China Normal University(华东师范大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出MultiToP框架,通过轻量级视觉令牌修补器动态替换不可靠视觉令牌,结合信息引导排名校准和稀疏正则化,在不修改原模型情况下减少视频多模态模型幻觉,显著提升F1分数和问答准确率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05780 2026-08-07 cs.CV 新提交 81%

Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding

用于高效长视频理解的证据驱动型动态视觉选择器

Bo Zhang, Wenxin Wang, Feng Chen, Zhihao Zhang, Zixuan Wang, Changsheng Li, Yinjie Lei

专题命中 视频多模态 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出基于目标MLLM内部注意力证据的动态视觉选择框架EviSelect,通过GRPO优化的随机策略实现高效长视频理解,在三个基准上性能更优,视觉token减少约50%、端到端加速3.9倍。

Comments Project Page: https://zhangbo135.github.io/EviSelect/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13558 2026-08-14 cs.AI cs.CL 新提交 81%

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

OmniScientist:一种全模态全学科的AI科学家

Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 视频多模态 :omni-modal(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出全模态AI科学家OmniScientist,通过端到端全模态流水线处理多学科异构原始证据,在36个真实案例中完成从原始数据到手稿的全流程,性能优于仅用预计算特征的系统,为通用AI科学家提供可行方案。

Comments 30 pages, 13 figures, 19 tables. Project page: https://omni-scientist.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03979 2026-08-05 cs.CV cs.AI 新提交 81%

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

Video-DeepResearch:迈向新一代多模态深度研究智能体

Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究提出Video-DR智能体框架,通过解耦感知-探索流水线与分阶段工具解锁解决现有多模态模型的模态偏差和知识泄漏问题,构建基准并在视频问答任务上取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01827 2026-08-04 cs.CV cs.AI 新提交 81%

DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents

DeepVoyager-VL:为长视野多模态智能体激励视觉在环搜索

Huanyao Zhang, Jiepeng Zhou, Runhao Zhao, Yanzhe Shan, Jiaoyang Chen, Bowen Zhou, Bo Li, Fang Wang, Jialong Wu, Zhengwei Tao, Lang Mei, Xiaohan Yu, Liyan Liu, Chong Chen, Wentao Zhang

机构 * PKU(北京大学) HKUST(GZ)(香港科技大学(广州)) NUDT(中国人民解放军国防科技大学) OUC(中国海洋大学) HITSZ(哈尔滨工业大学(深圳)) Huawei Cloud BU(华为云业务部)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对现有多模态深度搜索忽视视觉中间推理作用的局限,提出DeepVoyager-VL框架,构建多模态事件图合成数据,设计智能体框架实现主动视觉获取,经10个基准实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26769 2026-07-30 cs.CV cs.AI 新提交 81%

See2Think: Do Multimodal Models Really Use Intermediate Visual States?

See2Think:多模态模型是否真正利用中间视觉状态?

Siyu Yan, Zhuoran Yan, Haiying Xu, Panhao Zhou, Jingyu Chen, Chenhao Ji, Shuo Cao, Yongheng Zhang, Haoze Liu, Siyu Zhang, Xiwen Gu, Yihao Liu, Alex Jinpeng Wang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出See2Think评估框架,通过See2ThinkBench和VAoT测试多模态模型对中间视觉状态的依赖,发现视觉推理具模型与环境依赖性,准确渲染是瓶颈,受损反馈会使模型准确率降超10个百分点。

Comments 10 pages, 5 figures, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22729 2026-07-28 cs.CV cs.CL 新提交 81%

Open Your Model's Eyes: Video and Context-Aware Multimodal Backchannel Prediction

睁开模型之眼:视频与上下文感知的多模态反馈预测

Min-Jae Kim, Jun-Yeong Moon, Mujeen Sung, Gyeong-Moon Park

机构 * Korea University(韩国大学) Kyung Hee University(庆熙大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究视频与上下文感知的多模态反馈预测问题,提出CAMA - BC框架,利用多层多模态对齐,分上下文对齐和反馈对齐两阶段,显著优于现有方法及简单多模态基线,尤其在识别复杂反馈上效果突出。

Comments 18 pages, Accepted at ACL 2026

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, pp. 3738-3755, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17366 2026-07-21 cs.MM cs.CL cs.HC eess.SP 新提交 81%

EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation

EII-SCL:利用情感惯性进行对话中的多模态情感识别

Zilong Huang, Kong Aik Lee, Chong-Xin Gan, Zezhong Jin, Ruichen Zuo, Man-Wai Mak

机构 * Electronic Engineering,\ Hong Kong Polytechnic University, Hong Kong SAR, China

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM

AI总结 研究对话中的多模态情感识别问题,提出情感惯性引导监督对比学习模块EII-SCL,通过构建受惯性影响样本为对比目标提供信息,利用情感惯性先验,无需额外数据,与现有模型无缝集成,实验证明该方法优于现有方法。

Comments Accept by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16322 2026-07-21 cs.CV cs.AI 新提交 81%

GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs

GMoT:用于基于多模态大语言模型的细粒度微手势视频推理的门控运动感知令牌化

Taorui Wang, Wei Xia, Hui Ma, Zijia Song, Jiayu Zhang, Zeheng Wang, Yong Xu, Zitong Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对微手势识别中运动易被掩盖及MLLMs处理运动学困难的问题,提出GMoT模块,通过空间加权池等提取运动线索并融合,引入渐进奖励引导策略优化范式,在多数据集上表现出色,还提出BRG召回及跨域转移协议。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11839 2026-07-14 cs.CV cs.AI 新提交 81%

LoRA-Based Cascaded Multimodal Fusion for Action Recognition in Medical Training Environments

基于LoRA的级联多模态融合在医学训练环境中的动作识别

Divya Mereddy, Jeevan Beedareddy

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究面向医疗训练环境的动作识别,提出基于LoRA的级联多模态融合框架,结合特定模态适应与顺序融合,无需重新训练组件,在两个数据集上评估,结果显示该策略优于单模态模型且性能有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09417 2026-07-13 cs.CV cs.AI 新提交 81%

SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition

SVF-CR:用于多模态矛盾心理和犹豫识别的同步视觉-面部交叉细化

Hyein Park, Namho Kim, Junhwa Kim

机构 * Konyang University(公州大学) Korean Broadcasting System (KBS)(韩国广播公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究多模态矛盾心理和犹豫识别,提出SVF-CR框架,通过提取视频和面部令牌,经多种注意力机制细化,构建视觉-面部证据并融合文本、声学特征,实验证明该框架提升了公共宏F1。

详情

展开后加载摘要…

URL PDF HTML 收藏