SCoCCA: Multi-modal Sparse Concept Decomposition via Canonical Correlation Analysis
SCoCCA: 通过典型相关分析进行多模态稀疏概念分解
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出SCoCCA,通过典型相关分析实现多模态稀疏概念分解,提升跨模态对齐与可解释性,实现概念发现的最优性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
SCoCCA: 通过典型相关分析进行多模态稀疏概念分解
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出SCoCCA,通过典型相关分析实现多模态稀疏概念分解,提升跨模态对齐与可解释性,实现概念发现的最优性能。
通过最优部分传输学习图像-文本匹配
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract)
AI总结 本文提出OMIT网络,利用最优传输理论和跨模态移动距离,高效计算图像与文本片段相似性,通过部分匹配消除冗余对齐,验证了其在Flickr30K和MS-COCO数据集上的优越性能。
Comments accepted by ICASSP2025
增强推理的多模态链式推理
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出RED方法,通过KL约束奖励最大化提升多模态链式推理的准确性和忠实度,实验表明其在多个基准和模型上显著优于传统方法。
Comments Accepted to CVPR 2026 (Main); Code is available at https://github.com/yshinya6/red/
SAM-R1:通过强化学习利用SAM进行多模态分割的奖励反馈
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出SAM-R1框架,通过整合任务特定的细粒度奖励与定制优化目标,提升多模态模型在图像理解任务中的细粒度推理与分割对齐能力,仅用3k训练样本即在多个基准上取得优异表现。
Comments Accepted to NeurIPS 2025
GraphVLM:多模态图学习的视觉语言模型基准测试
机构 * NYU Shanghai(纽约大学上海分校) ; New York University(纽约大学) ; Rice University(休斯顿大学) ; East China Normal University(华东师范大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 GraphVLM通过三种范式评估视觉语言模型在多模态图学习中的能力,发现VLM-as-Predictor在性能上表现最佳,展示了其在多模态图学习中的潜力。
Comments CVPR 2026
CAMD:面向多模态大语言模型高效推理的覆盖感知多模态解码
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 本文提出CAMD,通过动态分配计算资源提升多模态大语言模型的推理效率与可靠性,解决解码方法在易例和难例间的计算不匹配问题。
深入探讨基于视觉-语言表示的谱聚类
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出基于预训练视觉语言模型的神经切线核谱聚类方法,通过跨模态对齐提升图像聚类性能,实验表明在16个基准数据集上显著优于现有方法。
Comments ICLR26
双鸟归一投影:通过推理时特征投影在LVLMs中调和安全与效用
机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) ; Mobilint
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文探讨了安全与效用在LVLMs中的对抗性,提出通过推理时投影消除模态偏差方向以提升安全性和效用。
VisualLeakBench: 对大型视觉-语言模型在PII泄露和社会工程中的脆弱性进行审计
机构 * Northeastern University(东北大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Boston University(波士顿大学) ; New York University(纽约大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VisualLeakBench,通过合成对抗图像评估LVLMs对OCR注入和PII泄露的鲁棒性,揭示了Claude~4在PII识别上的高风险及防御策略的模板依赖性。
注意源无关跨域少样本学习中的判别性陷阱
机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) ; National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文研究源无关跨域少样本学习中增强视觉模态判别性会抑制VLM性能的现象,提出通过扰动视觉学习以引导跨模态对齐的方法,实验显示在多种设置和数据集上取得新状态-of-the-art结果。
Comments CVPR 2026
Penguin-VL:探索基于大语言模型的视觉编码器的效率极限
机构 * Tencent AI Lab(腾讯AI实验室)
专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV
AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。
Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL
DAIT: 从视觉-语言模型到轻量分类器的适应性中间教师知识蒸馏
机构 * School of Computer and Electronic Information, Nanjing Normal University, Nanjing, China(南京师范大学计算机与电子信息学院) ; Medical Artificial Intelligence Lab, Westlake University(西湖大学医学人工智能实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出DAIT方法,通过引入可训练的中间教师模型,从冻结的视觉-语言模型中适应性地蒸馏出任务对齐的知识,提升细粒度视觉分类性能。
AnoleVLA:基于深度状态空间模型的轻量级视觉-语言-动作模型用于移动操作
机构 * Keio University(keio大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出AnoleVLA,一种轻量级视觉-语言-动作模型,通过深度状态空间模型高效处理多模态序列,提升移动操作的效率与安全性。
MMSpec:用于视觉-语言模型的推测解码基准测试
机构 * University of Michigan(密歇根大学) ; The Ohio State University(俄亥俄州立大学) ; Independent(独立) ; Indiana University(印第安纳大学) ; The University of Hong Kong(香港大学) ; Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; LMSYS Org(LMSYS组织)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出MMSpec基准,评估视觉-语言模型中的推测解码方法,发现文本模型在多模态场景下表现下降,视觉意识在大批次中更关键,且吞吐量提升不等于延迟降低,提出ViSkip方法实现最佳性能。
BackdoorIDS: 预训练视觉编码器的零样本后门检测
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 BackdoorIDS通过分析输入在逐步遮蔽过程中的嵌入序列变化,利用密度聚类检测后门攻击,实现对预训练视觉编码器的零样本后门检测,优于现有防御方法。
Comments 17 pages, 10 figures, 6 tables
LAMB:基于LLM的音频描述通过Cauchy-Schwarz散度弥合模态间隙
专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI
AI总结 本文提出LAMB框架,通过Cauchy-Schwarz散度弥合音频与文本嵌入空间的模态差距,设计Two-Stream Adapter和Token Guide提升LLM解码器推理能力,在AudioCaps上取得最佳性能。
Comments 5 pages, 2 figures; Accepted to ICASSP 2026
CLIP是否理想?不。我们能否修复它?是的!
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文分析了CLIP潜在空间的几何局限性,提出DCSM方法以解决其根本问题,提升了CLIP-like模型在多个基准上的性能。
Comments ICCV 2025
UAVBench 和 UAVIT-1M:用于低空无人机视觉-语言理解的LLM基准测试与增强
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出UAVBench和UAVIT-1M,用于评估和提升LLM在低空无人机视觉-语言任务中的能力,通过大规模数据集和基准测试揭示开源LLM在低空视觉内容生成上的不足,并通过微调提升性能。
多粒度视觉-语言对齐用于领域泛化的人员重识别
专题命中 图文多模态 :MLLM(abstract);分类 cs.CV
AI总结 本文提出基于CLIP的多粒度视觉-语言对齐框架,通过引入多粒度提示和自适应掩码模块提升领域泛化人员重识别性能。
DCP-CLIP:一种面向开放词汇语义分割的粗到细框架
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出DCP-CLIP框架,通过动态生成文本特征和显式建模双交互,解决开放词汇语义分割中的跨模态通信不足和计算成本高的问题,提升分割精度和效率。
Comments 13 pages, 7 figures
基于视觉-语言的专家报告用于绘画认证和缺陷检测
机构 * organization= Khalifa University of Science ; Technology, Department of Aerospace Engineering , city= Abu Dhabi , country= United Arab Emirates ; organization= National Research Tomsk Polytechnic University , country= Russia ; organization= Academy of Fine Arts of Naples , city= Naples , country= Italy ; organization= Academy of Fine Arts of Sassari , city= Sassari , country= Italy ; organization= Department of Industrial ; Economics (DIIIE), University of L’Aquila , city= L'Aquila I-67100 , country= Italy ; organization= Advanced Research ; Innovation Center (ARIC), Khalifa University of Science \& Technology , city= Abu Dhabi , country= UAE
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出一种自动化的热成像-视觉-语言模型框架,用于绘画认证和缺陷检测,通过多模态分析与结构化文本报告生成,提高评估的可解释性和一致性。
Comments Submitted to Journal of Cultural Heritage
CHIPS: 通过曲率感知的混合影响数据选择实现高效的CLIP适应
专题命中 图文多模态 :image-text(abstract)
AI总结 本文提出CHIPS方法,通过曲率感知和混合影响数据选择,实现高效的CLIP垂直领域适应,在医疗和通用领域基准中均表现出色。
Comments Accepted by CVPR 2026
H2R: 一种从视频中为机器人预训练的人到机器人的数据增强
专题命中 图文多模态 :image-text(abstract)
AI总结 H2R通过将人类视角视频转换为机器人视角数据,弥合人机视觉差距,提升机器人预训练效果,实验显示在模拟和现实场景中均显著提升性能。