arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-21 至 2026-07-21 共收录 135 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 15 篇

2607.17806 2026-07-21 cs.AI 新提交 86%

PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model

PGN:基于盘古多模态基础模型的视觉语言导航系统的设计与实现

Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao

机构 * University of Electronic Science and Technology of China(电子科技大学) School of Information and Communication Engineering(信息与通信工程学院)

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.AI

AI总结 研究基于盘古多模态基础模型设计实现视觉语言导航系统PGN,训练分两阶段,先对齐视觉与语言编码器,再使模型适应专家轨迹,结合多种计算方式,在特定评估下取得一定指标,量化了离线专家动作对齐情况。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17499 2026-07-21 cs.AI 新提交 85%

Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation

派利淘-多模态搜索:构建原生电子商务多模态搜索基础

Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝及天猫集团)

专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对电子商务多模态搜索问题,提出派利淘-多模态搜索基础模型,通过混合语义ID、两阶段持续预训练策略和混合推理后训练管道,在淘宝派利淘平台实现显著改进,提升了商品交易总额和交易量。

Comments Technical Report: Pailitao-MMSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00037 2026-07-21 cs.CV cs.AI cs.RO 版本更新 84%

RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations

针对多模态扰动的视觉-语言-动作模型的鲁棒性

Jianing Guo, Zhenhong Wu, Chang Tu, Yiyao Ma, Xiangqi Kong, Zhiqian Liu, Jiaming Ji, Shuning Zhang, Yuanpei Chen, Kai Chen, Qi Dou, Yaodong Yang, Xianglong Liu, Huijie Zhao, Weifeng Lv, Simin Li

专题命中 图文多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出RobustVLA,通过多模态鲁棒优化提升视觉-语言-动作模型在多种扰动下的鲁棒性,实验表明其在性能和推理速度上均优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16442 2026-07-21 cs.CV cs.CL cs.CR 新提交 81%

One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models

一种模态遗忘一切:增强视觉语言模型中的跨模态遗忘

Sudharshan Balaji, Yili Ren, Guangjing Wang, Yimin Chen, Ning Wang

机构 * University of South Florida(南佛罗里达大学) University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究视觉语言模型中跨模态遗忘转移问题,通过对三种架构研究发现其不对称不完整。提出CrossInf策略,聚焦关键transformer块遗忘,减少转移差距,提升鲁棒性,经人工评估验证,还用CKA分析浅层遗忘。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16243 2026-07-21 cs.LG cs.AI 新提交 79%

RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants

RobustMAD:评估用于可部署异常检测助手的多模态小语言模型的现实世界鲁棒性

Anushiya Arunan, Xin Li, Yan Qin, U-Xuan Tan, Nhu Khue Vuong, Xiaoli Li, Chau Yuen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Nanyang Technological University(南洋理工大学) Chongqing University(重庆大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态小语言模型现场部署的鲁棒性评估问题,开发RobustMAD基准测试,通过多种开放式查询评估模型,发现最佳模型虽有潜力但仍存差距及三种失败模式,为下一代多模态工业检测助手设计提供指导。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026 at https://openreview.net/forum?id=skrA9UYNIZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16841 2026-07-21 cs.CV cs.MM 新提交 73%

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉

Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Road Transport Development Center(上海市道路运输发展中心) Hunan Institute of Advanced Technology(湖南先进技术研究院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17693 2026-07-21 cs.CV 新提交 70%

Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation

用于无训练测试时医学图像分割的内存支持协同适应

Lingrui Li, Nan Pu, Dong Zhao, Wenjing Li, Andrew P French, Zhun Zhong, Xin Chen

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计支柱)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 研究针对医学图像分割中测试时适应的挑战,提出内存支持协同适应(MSSA)框架,不更新模型参数,通过构建在线内存、文本引导语义先验及跨图像结构对齐实现稳健适应,实验证明其优于现有方法。

Comments 18 pages, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03117 2026-07-21 cs.CV 版本更新 70%

Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models

揭示物理世界语义漏洞:用于红外视觉语言模型的通用对抗性补丁

Chengyin Hu, Yuxian Dong, Yikun Guo, Xiang Chen, Qike Zhang, Junqi Wu, Jiahuan Long, Jiujiang Guo, Yiwei Wei, Tingsong Jiang, Wen Yao

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出通用曲网格补丁框架UCGP,用于揭示红外视觉语言模型的语义鲁棒性漏洞,通过扰动视觉表征空间以削弱跨模态语义对齐,验证了其在多种架构和数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16303 2026-07-21 cs.CV cs.AI 新提交 62%

Med-OPD: Improving Medical Vision-Language Models via Evidence-Aware On-Policy Distillation

Med-OPD:通过证据感知策略蒸馏改进医学视觉语言模型

Yunhang Qian, Jiaquan Yu, Jiawei Liu, Meng Wang, Hongwei Bran Li, Xiaobin Hu

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对医学视觉语言模型依赖语言先验而非视觉证据推理的问题,提出Med-OPD框架,引入医学证据优势信号,在令牌和轨迹级别重新分配蒸馏信号,实验证明该方法能加强模型对关键视觉证据的依赖,提升多模态医学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17559 2026-07-21 cs.RO cs.AI cs.ET cs.LG 新提交 57%

COLIP-2: Olfaction-Vision-Language Embeddings

COLIP-2:嗅觉-视觉-语言嵌入

Kordel Kade France

机构 * Scentience

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 COLIP-2模型构建多模态嵌入空间,将嗅觉与视觉、语言结合,通过训练使机器人能定位香气来源。因缺乏相关大规模数据集,需新方法和数据集。文中展示其内部测试结果并优化,该模型有望用于多模态领域。

Comments Model Card

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16819 2026-07-21 cs.AI 新提交 57%

FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images

FUSAR-R1:一种用于合成孔径雷达图像智能解释的大规模推理模型

Yi Yang, Xiaokun Zhang, Yuxuan Li, Ruyi Zhang, Xinpeng Zhou, Haipeng Wang

机构 * Fudan University(复旦大学) Key Laboratory for Information Science of Electromagnetic Waves (MoE)(电磁波信息科学教育部重点实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对SAR图像智能解释问题,提出FUSAR-R1模型。通过模拟专家解释构建思维链推理数据指导指令学习,赋予基本推理能力,再用强化学习策略优化输出。该模型在多种SAR解释任务中表现优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16327 2026-07-21 cs.CV 新提交 57%

Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation

用于文本引导医学图像分割的定位注入视觉语言语义融合

Songyue Han, Mingye Zou, Shuchang Ye, Lei Bi, Mingyuan Meng

机构 * Air Force Engineering University(空军工程大学) Harbin Institute of Technology(哈尔滨工业大学) University of Sydney(悉尼大学) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 研究针对文本引导医学图像分割,提出LoG框架,通过联合执行多尺度目标定位任务,实现三级定位注入语义融合,在三个基准数据集实验中表现出色,优于现有医学图像分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06491 2026-07-21 cs.RO cs.AI 版本更新 57%

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

TempoVLA: 学习速度可控的视觉-语言-动作策略

Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

机构 * RUC(中国人民大学) FDU(福建大学) UNC(北卡罗来纳大学教堂山分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出TempoVLA,通过可变速度轨迹增强和速度条件机制,实现机器人操作中速度的双向灵活控制,并支持动态速度调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01167 2026-07-21 cs.AI 57%

Do All Individual Layers Help? An Empirical Study of Task-Interfering Layers in Vision-Language Models

所有个体层都有帮助吗?视觉-语言模型中任务干扰层的实证研究

Zhiming Liu, Yujie Wei, Lei Feng, Xiu Su, Xiaobo Xia, Weili Guan, Zeke Xie, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Southeast University(东南大学) Central South University(中南大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州))

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究通过层干预发现部分层阻碍下游任务,提出任务自适应层剔除方法提升性能,揭示预训练VLM的意外模块化特性。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 9597-9607

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02924 2026-07-21 cs.CL 版本更新 57%

AutoNeural: Co-Designing Vision-Language Models for NPU Inference

AutoNeural:为 NPU 推理协同设计视觉语言模型

Wei Chen, Liangmin Wu, Yunhai Hu, Zhiyuan Li, Zhiyuan Cheng, Yicheng Qian, Lingyue Zhu, Zhipeng Hu, Luoyi Liang, Qiang Tang, Zhen Liu, Han Yang

机构 * Nexa AI Geely Auto

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

AI总结 研究针对 NPU 推理的视觉语言模型硬件与模型不匹配问题,提出 AutoNeural 架构,用深度可分离卷积骨干替换 ViT 编码器,结合状态空间模型与 Transformer 层,提升效率,降低量化误差与延迟,验证了在实际应用中的实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 7 篇

2607.16980 2026-07-21 eess.SP cs.SD 新提交 82%

Efficient Audio-Visual Event Recognition via Knowledge Distillation and Dynamic INT8 Quantization of a Hybrid Cross-Attention Network

通过混合交叉注意力网络的知识蒸馏和动态 INT8 量化实现高效视听事件识别

Parinaz Binandeh Dehaghani, Danilo Pena, A. Pedro Aguiar

机构 * University of Porto, Porto, Portugal(葡萄牙波尔图大学) ResoSight, Montreal, Canada(ResoSight公司)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)

AI总结 研究针对视听事件识别模型在边缘设备部署的难题,提出结合架构压缩、知识蒸馏和动态 INT8 量化的框架。构建教师与学生模型,经知识蒸馏训练学生模型,再用动态量化减小模型大小。实验表明该框架有效平衡准确率与效率,利于在资源受限平台部署。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18528 2026-07-21 cs.LG cs.SD 版本更新 82%

Audio-Visual Continual Test-Time Adaptation without Forgetting

音频视觉持续测试时间适应无需遗忘

Sarthak Kumar Maharana, Akshay Mehra, Bhavya Ramakrishna, Yunhui Guo, Guan-Ming Su

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract)

AI总结 本文提出AVReCAP方法,在测试时无需源数据即可提升模型性能,通过动态检索最佳融合层参数减少灾难性遗忘。

Comments ECCV 2026 & ICML 2026 Workshop Continual Adaptation at Scale: Towards Sustainable AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03920 2026-07-21 cs.RO 版本更新 78%

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

LH-AVLN:长距离视听语言导航基准测试

Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学)

专题命中 音频语音多模态 :audio-visual(title,abstract)

AI总结 介绍长距离视听语言导航基准LH-AVLN,结合多目标任务执行等。提出免训练参考智能体PAG-Nav,可维护语义地图并规划。实验表明现有智能体完成任务有困难,PAG-Nav提供更强诊断基线。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17576 2026-07-21 cs.CV 版本更新 74%

LoGSAM: Parameter-Efficient Cross-Modal Grounding for MRI Segmentation

LoGSAM: 用于MRI分割的参数高效跨模态接地

Mohammad Robaitul Islam Bhuiyan, Sheethal Bhat, Melika Qahqaie, Andreas Maier, Tri-Thien Nguyen, Paula Andrea Pérez-Toro, Tomás Arias-Vergara

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität, Erlangen, Germany(德国埃朗根-纽伦堡大学模式识别实验室) Siemens Healthineers, Erlangen, Germany(德国埃朗根西门子医疗)

专题命中 音频语音多模态 :cross-modal(title);分类 cs.CV

AI总结 LoGSAM通过将放射科医生的语音转录为文本提示,利用预训练基础模型实现MRI肿瘤的高效分割,采用LoRA微调提升领域适应性,达到80.32%的Dice分数。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17773 2026-07-21 cs.MM 新提交 70%

FillGauss: Fine-Grained Filling-Aware Impact Sound Generation for 3D Gaussian Splatting

FillGauss:用于3D高斯点云的细粒度填充感知撞击声生成

Chen Yang, Ganye Wen, Bin Huang, Jiayi Lyu, Zehai Niu, Linlin Shen, Jinbao Wang

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.MM

AI总结 研究针对多模态AI中从视觉合成撞击声的挑战,提出细粒度填充感知撞击声生成任务。基于FillImpact数据集,构建FillGauss框架,融合多种要素实现位置、撞击物及填充感知音频生成,达物理基础跨模态音频生成新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17079 2026-07-21 eess.AS 新提交 57%

SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations

SALMONN-2:利用自监督表示提升通用听力能力

Xiaoyu Yang, Xuenan Xu, Wenyi Yu, Siyin Wang, Changli Tang, Terumi Chiba, Siyuan Hou, Ziyang Zhang, Wen Wu, Baoxiang Li, Guangzhi Sun, Chao Zhang, Philip Woodland

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 研究探索自监督学习音频表示能否为音频大语言模型提供基础,提出基于统一SSL编码器的SALMONN-2,用多层特征融合适配器,还探索多模态上下文学习。实验表明通用SSL编码器性能良好,SALMONN-2达先进水平,且特定训练可获多模态上下文学习能力。

Comments Disclaimer: This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17812 2026-07-21 cs.CL 新提交 57%

ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

ESCUCHA:用于异构声学条件的西班牙语语音基准测试

Fernando López, Ana Ayala, Guillermo Segovia, Fernando Ibáñez, Ana Martínez, Pablo Gómez, Jordi Luque

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现实声学条件下西班牙语语音理解受关注少的问题,引入ESCUCHA基准测试,含1000个人工挑选与音频配对的问题,强调推理与语言多样性,涵盖多类问题,测试发现先进模型与人类存在性能差距。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 17 篇

2607.16560 2026-07-21 cs.AI cs.CV cs.LG cs.MM 新提交 85%

From Modalities to Propositions: A Language-Centric Framework for Multimodal Intelligence

从模态到命题:多模态智能的语言中心框架

Nadine Chang, Maying Shen, Shizhe Diao, Jialiang Wang, Jingde Chen, Thomas Breuel, Pavlo Molchanov, Rafid Mahmood, Jose M. Alvarez

机构 * NVIDIA(英伟达) University of Ottawa(渥太华大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 该研究提出多模态数据语言表示框架,将观察结果表示为原子命题,通过全局语义码本统一为共享词汇表,置于可解释空间,实现跨模态理解等,还在自动驾驶等数据上进行了展示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17994 2026-07-21 cs.CV cs.AI 新提交 84%

HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization

HAS:用于多模态大语言模型视频摘要的高亮引导注意力转向

Rui Chu, Yingjie Lao

机构 * Tufts University(塔夫茨大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 针对视频摘要,提出HAS方法,通过全局找连续帧级高亮分布并作为注意力转向向量,让多模态大语言模型在推理时更关注高亮帧,避免丢失信息,在多种基准测试中性能出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19341 2026-07-21 cs.CV cs.CL cs.SD 版本更新 84%

Native Active Perception as Reasoning for Omni-Modal Understanding

原生主动感知作为全模态理解的推理

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

专题命中 视频多模态 :omni-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。

Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17712 2026-07-21 cs.AI 新提交 83%

Learning to Detect Cross-Modal Negation: An Analysis of Latent Representations and an Attention-Based Solution

学习检测跨模态否定:潜在表示分析与基于注意力的解决方案

Ali AbuSaleh, Leon Hammerla, Alexander Mehler

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 研究跨模态否定检测难题,提出新型跨模态注意力架构,分析发现文本与视觉否定的不对称性,结合自监督视频表示推进时间否定建模,为多模态系统学习语义对齐表示提供新方法。

Comments This manuscript is an accepted version of the article (published at ICNLP2026). Published in IEEE Xplore, DOI:10.1109/ICNLP69856.2026.11527861 document: https://ieeexplore.ieee.org/abstract/document/11527861

Journal ref 2026 8th International Conference on Natural Language Processing (ICNLP), Xi'an, China, 2026, pp. 613-622

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17366 2026-07-21 cs.MM cs.CL cs.HC eess.SP 新提交 81%

EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation

EII-SCL:利用情感惯性进行对话中的多模态情感识别

Zilong Huang, Kong Aik Lee, Chong-Xin Gan, Zezhong Jin, Ruichen Zuo, Man-Wai Mak

机构 * Electronic Engineering,\ Hong Kong Polytechnic University, Hong Kong SAR, China

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM

AI总结 研究对话中的多模态情感识别问题,提出情感惯性引导监督对比学习模块EII-SCL,通过构建受惯性影响样本为对比目标提供信息,利用情感惯性先验,无需额外数据,与现有模型无缝集成,实验证明该方法优于现有方法。

Comments Accept by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16322 2026-07-21 cs.CV cs.AI 新提交 81%

GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs

GMoT:用于基于多模态大语言模型的细粒度微手势视频推理的门控运动感知令牌化

Taorui Wang, Wei Xia, Hui Ma, Zijia Song, Jiayu Zhang, Zeheng Wang, Yong Xu, Zitong Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对微手势识别中运动易被掩盖及MLLMs处理运动学困难的问题,提出GMoT模块,通过空间加权池等提取运动线索并融合,引入渐进奖励引导策略优化范式,在多数据集上表现出色,还提出BRG召回及跨域转移协议。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17669 2026-07-21 cs.CV 新提交 79%

Attention from Above: A Multimodal Model for Drone-Based Object Localization

自上而下的注意力:一种基于无人机的目标定位多模态模型

Hyun-Ki Jung

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对无人机目标检测,本文基于YOLO-World框架,用A2C2f层替换C2f层,引入注意力机制和并行处理结构,提升小目标检测性能,在VisDrone数据集实验中各项指标显著优于原模型,提供了高精度检测方案。

Comments Preprint. Accepted for publication in the International Journal of Interactive Mobile Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17423 2026-07-21 cs.CV 新提交 79%

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

TimeLens2:使用多模态大语言模型进行通用视频时间定位

Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究通用视频时间定位问题,TimeLens2将时间证据视为区间集,通过多种策略构建多跨度监督,其时间瓦瑟斯坦奖励等方法提供反馈,在多个基准测试中表现出色,不同变体均有性能提升。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏