Continual Vision-Language Representation Learning with Off-Diagonal Information
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Journal ref ICML 2023
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Journal ref ICML 2023
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments 12 pages, 10 figures
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Code and models are available at https://github.com/ZrrSkywalker/LLaMA-Adapter
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CL
Comments To be presented at EACL2021
视觉会撒谎,一致性说话:在视觉-语言模型中解耦空间注意力与可靠性
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; Algoverse AI Research(Algoverse AI研究) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 图文多模态 :multimodal(abstract,comments);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出VLM可靠性探针(VRP),通过结构注意力指标和生成动态分析,发现空间注意力与准确性几乎无关(R≈0.001),而自一致性是可靠性的主要预测因子(R=0.429),揭示了视觉特征与最终生成之间的符号脱离现象。
Comments 16 pages. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence. Code: https://github.com/itsloganmann/VLM-Reliability-Probe
DeltaPrompts: 逃离多模态蒸馏中的零delta陷阱
机构 * NVIDIA Research(NVIDIA研究院)
专题命中 图文多模态 :multimodal(title);分类 cs.CL、cs.AI
AI总结 本文提出DeltaPrompts,通过量化教师与学生之间的答案分歧(Δ)来生成高分歧的推理问题,从而解决传统蒸馏中因零delta提示导致的学习信号不足问题,实验表明DeltaPrompts在多个场景下显著提升了模型性能。
用于开放世界目标检测的多模态语义概率目标性
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 研究开放世界目标检测问题,提出MSPO轻量级语义校准框架,通过融合已知类别语言语义与视觉目标性来校准预测,在实验中改进了PROB基线,提升了主要指标及PASCAL VOC最终mAP,证明已知类别语义可有效校准概率目标性。
Comments 16 pages, 3 figures, 4 tables
实现24小时农业机器人技术:用于夜间视觉导航的无监督日夜跨模态图像翻译
机构 * LaSER Lab, Kennesaw State University(激光实验室,肯尼索州立大学) ; Lincoln Institute for Agri-Food Technology, University of Lincoln(林肯农业食品技术研究所,林肯大学)
专题命中 图文多模态 :cross-modal(title);分类 cs.CV、cs.AI
AI总结 该研究针对农业机器人夜间视觉导航中大规模标注图像数据集难获取的问题,提出无监督图像翻译框架,整合CLIP模型并引入可见性掩码,复用白天语义标签训练模型,经实验验证提升了图像质量和下游语义分割性能。
Comments Accepted to IROS2026
多模态图像着色:量化文本条件引导对灰度到彩色转换的影响
机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL
AI总结 本文通过U-Net和Stable Diffusion 1.5两种架构,量化了CLIP文本条件对灰度图像着色质量的影响,发现文本条件显著提升了PSNR、SSIM和色彩度,降低了LPIPS。
Planktonzilla: 用于理解浮游生态系统的多模态数据集与模型
机构 * Inria Chile Research Center(Inria智利研究中心)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 为解决浮游生物分类模型泛化性差的问题,提出统一数据集Planktonzilla-17M(含1740万张图像,涵盖602个分类类群),并对比监督学习与CLIP风格训练,发现基于分类谱系的监督学习优于CLIP,且现有生物基础模型在海洋成像领域表现不佳。
DUEL: 用于多模态推理的对抗性自我对弈
机构 * Meta AI
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL
AI总结 提出DUEL框架,通过对抗性自我对弈从预训练VLM生成监督信号,结合长度归一化对数似然奖励,无需人工标注即可提升视觉推理与判别能力。
通过跨模态信息流解读并增强大视觉-语言模型中的情感电路
机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception(脑启发智能感知与认知MOE实验室) ; Cognition, University of Science(认知,科学大学) ; AIPD, Tencent(AIPD,腾讯)
专题命中 图文多模态 :cross-modal(title);分类 cs.CV、cs.AI
AI总结 本文提出了一种基于转向向量的因果归因框架,用于描述性情感推理,通过构建专用数据集揭示了三阶段'适应-聚合-执行'机制下的情感电路,发现视觉情感线索在中间层通过情感特定的注意力头进行聚合,随后在深层通过情感通用路径转换为叙述生成,并通过调控情感信息路由增强注意力流和语义激活,从而提升性能并缓解情感幻觉。
Comments Accepted by ICML 2026
通过分阶段自奖励缓解多模态幻觉
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Peng Cheng Laboratory(鹏城实验室) ; Shenzhen(深圳) ; China(中国)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL
AI总结 本文提出PSRD框架,通过分阶段自奖励信号在推理时动态抑制幻觉,有效降低LLaVA-1.5-7B的幻觉率50%,在多个基准上优于现有方法。
Comments Self-reward for vision hallucination mitigation
CLIP架构用于腹部CT图像-文本对齐和零样本学习:研究批量组成和数据缩放
机构 * Department of Radiodiagnosis(放射诊断部门)
专题命中 图文多模态 :image-text(title);分类 cs.CV、cs.AI
AI总结 本文研究了CLIP架构在腹部CT图像-文本对齐和零样本学习中的效果,探讨了训练批量组成和数据缩放的影响,发现随机采样和交替批次比人工类平衡更有效。
Edu-MMBias: 一种三级多模态基准,用于在教育背景下审计视觉-语言模型中的社会偏见
机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) ; Shanghai Institute of Artificial Intelligence for Education, East China Normal University(东华师范大学教育人工智能研究所) ; Faculty of Education, East China Normal University(东华师范大学教育学院)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 本文提出Edu-MMBias基准,通过三级维度审计视觉-语言模型中的社会偏见,揭示模型存在补偿性类偏见和深层健康与种族刻板印象,视觉输入可触发偏见回潮。
通过组件导向的多模态知识增强专门化大型模型进行甲骨文解读
机构 * College of Software, Jilin University(吉林大学软件学院) ; School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) ; School of Archaeology, Jilin University(吉林大学考古学院) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MoE, China(教育部知识驱动人机智能工程研究中心)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL
AI总结 本文提出一种基于组件的多模态知识增强框架,利用视觉语言模型和语言模型代理进行组件识别与语义推理,通过专家标注的OB-Radix数据集提升甲骨文解读的精度与细节。
UVLM:一种通用视觉-语言模型加载器,用于可重复的多模态基准测试
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 UVLM提供统一接口加载和基准测试多种视觉-语言模型架构,支持LLaVA-NeXT和Qwen2.5-VL,通过抽象差异实现一致评估,具备多任务提示构建、共识验证和灵活token预算等功能。
Comments 22 pages, 3 figures
WAFFLE:针对自动化前端开发的多模态模型微调
机构 * Purdue University(普渡大学)
专题命中 图文多模态 :multi-modal(title);分类 cs.CV、cs.CL
AI总结 WAFFLE通过结构感知注意力机制和对比微调方法,提升多模态模型在UI到HTML代码生成中的表现。
开源多模态Moxin模型:Moxin-VLM和Moxin-VLA
机构 * Northeastern University(东北大学) ; Harvard University(哈佛大学) ; Cornell University(康奈尔大学) ; Tulane University(路易斯安那州立大学) ; University of Washington(华盛顿大学) ; Futurewei(未来通信) ; AIBAO LLC
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL
AI总结 本文提出开源多模态Moxin模型,通过Moxin-VLM、Moxin-VLA和Moxin-Chinese三种变体,提升视觉-语言、视觉-语言-动作及中文任务的性能。
通过多模态推理实现对视觉语言模型的逃逸攻击
机构 * Novi High School, MI, USA(诺维高中) ; Michigan State University, MI, USA(密歇根州立大学)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 本文提出了一种基于多模态推理的逃逸攻击框架,通过训练后链式推理和自适应噪声机制提高对视觉语言模型的安全过滤器的绕过能力。
AndesVL 技术报告:一种高效的移动端多模态大语言模型
机构 * AndesVL Team(AndesVL团队) ; OPPO AI Center(OPPO人工智能中心)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 AndesVL 是一种高效的移动端多模态大语言模型,通过 1+N LoRA 架构和 QALFT 框架实现高效任务适应和模型压缩,部署在 MediaTek Dimensity 9500 芯片上,达到 6.7 倍解码加速和 30.9% 内存减少。
Comments Tech report of OPPO AndesVL Team
机构 * Seoul National University(首尔国立大学) ; Amazon(亚马逊)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
机构 * Technical University of Munich (TUM)(慕尼黑技术大学) ; TUM University Hospital(慕尼黑技术大学医院) ; German Heart Center TUM University Hospital(慕尼黑技术大学医院德国心脏中心) ; Department of Radiology(放射科) ; Klinikum rechts der Isar TUM University Hospital(慕尼黑技术大学医院右岸诊所) ; Uniklinik RWTH Aachen(亚琛工业大学医院) ; HOPPR IL USA(HOPPR美国) ; University of Oxford(牛津大学) ; Imperial College London(伦敦帝国学院)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL
Comments Accepted to ML4H 2025 Proceedings
机构 * Tredence Inc.(特伦德公司) ; Indian Institute of Technology Kharagpur(印度理工学院克拉格浦尔分校) ; Inria Paris-Rocquencourt(巴黎-罗克琴库特研究所) ; Rajiv Gandhi University(拉吉夫·甘地大学) ; Tsinghua University(清华大学) ; Palmer Research Laboratories(帕勒姆研究实验室)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL
Comments 7 pages, 5 figures, 4 tables
机构 * Department of Computing Science University of Aberdeen(计算科学系阿伯丁大学)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
Comments This paper was accepted to the "CLVL: 5th Workshop on Closing the Loop Between Vision and Language (ICCV 2023 CLVL workshop)."
机构 * Southeast University(东南大学) ; Huawei Singapore Research Center(华为新加坡研究中心)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
Comments 11 pages, 5 figures
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
机构 * Tsinghua University(清华大学) ; Zhipu AI(智谱AI) ; Peking University(北京大学)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL
机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) ; National Institute of Education (NIE), Singapore(新加坡国家教育研究所) ; Institute for Infocomm Research (I 2 R), A*STAR, Singapore(新加坡资讯与通信研究院(I2R))
专题命中 图文多模态 :multimodal(title);分类 cs.CL、cs.AI
Comments ACL 2025 Industry Track