MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.CV
Comments update author
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.CV
Comments update author
专题命中 VLM训练与架构 :vision language model(title,abstract);LLaVA(title,abstract);分类 cs.CV
Comments 11 pages, 4 figures
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(title);vision language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title,abstract);分类 cs.AI
VLM内部伪装视觉上下文的隐藏演化
机构 * Surrey Institute for People-Centred AI, University of Surrey(萨里大学以人为本人工智能研究所) ; Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(萨里大学视觉、语音与信号处理中心)
专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV、cs.AI
AI总结 研究视觉语言模型中视觉令牌如何通过不同集成架构(上下文注入与逐层注入)转化为有意义表示,揭示其内部演化过程及对性能的影响。
MedUP:唤醒医学视觉-语言模型中的统一理解与感知能力
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出MedUP模型,通过UniMedTok分词器在共享token空间统一医学视觉-语言模型的感知与理解,构建相关训练语料库和评估基准,在多医学任务上性能优于现有模型。
Comments 10 pages, 6 figures
基于能量驱动的自适应视觉令牌修剪以提高视觉语言模型的效率
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);LLaVA(abstract_cn);分类 cs.CV、cs.AI
AI总结 E-AdaPrune通过能量驱动的自适应修剪方法,提高视觉语言模型的效率,实现令牌预算的动态分配,减少冗余并提升推理性能。
用于增强大型视觉语言模型鲁棒性的对偶对抗微调
专题命中 VLM训练与架构 :vision language model(title);LLaVA(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract)
AI总结 针对大型视觉语言模型视觉输入易受攻击且现有防御方法缺乏通用性的问题,提出对偶对抗微调框架,通过联合优化视觉和语义监督信号增强模型鲁棒性,实验证明该方法在多任务对抗鲁棒性评估中表现优异。
FineGen:基于VLM的多智能体框架用于细粒度图像-文本数据集构建
机构 * Shenzhen Polytechnic University(深圳职业技术大学) ; Institute of Applied Artificial Intelligence of the Guangdong-Hong Kong Macao Greater Bay Area(粤港澳大湾区应用人工智能研究所) ; Shenzhen University(深圳大学)
专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV、cs.AI
AI总结 提出FineGen框架,通过生成-验证-校正流水线和闭环反馈机制自动构建含硬负样本的细粒度数据集,在ImageNet上构建FineGen-100K,硬样本准确率提升14.4%。
Comments 15 pages, 2 figures, conference
超越对称对齐:医学领域视觉-语言模型中模态不平衡的光谱诊断
机构 * NOVA School of Science and Technology(诺瓦科学与技术学校) ; Nova School of Business and Economics(诺瓦商业与经济学校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.LG
AI总结 提出非对称光谱对齐分数(SAS),通过特征值加权的特征模态相关性量化模态信息不平衡,并在医学图像-文本数据集上评估15个VLM,发现医学图像比临床报告保留更丰富的结构信息,且SAS与检索性能的相关性最强。
Comments 10 pages, 3 figures, 9 tables
超越基于VLM的奖励:扩散原生潜在奖励建模
机构 * The Hong Kong University of Science ; Huawei Hong Kong AI Framework \& Data Technologies Lab ; Tsinghua University ; The Australian National University
专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出扩散原生潜在奖励模型DiNa-LRM,直接在噪声扩散状态上进行偏好学习,通过噪声校准Thurstone似然和推理时噪声集成,实现高效且鲁棒的奖励建模。
Comments Accepted by ICML 2026. Code: https://github.com/HKUST-C4G/diffusion-rm
界定诚实大视觉-语言模型的知识边界
机构 * Shandong University(山东大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文提出系统框架提升VLM在面对未知问题时的拒绝能力,通过构建'视觉-不知'数据集并采用监督微调与偏好优化方法,提升事实准确率至67.3%,并在医疗等领域实现泛化。
Nüwa: 通过VLM令牌剪枝修复空间完整性
机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) ; School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) ; The Hong Kong Polytechnic University(香港理工大学) ; Great Bay University(大鹏大学) ; Shenzhen University(深圳大学) ; Huawei(华为)
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 Nüwa通过两阶段令牌剪枝框架在保持空间完整性的同时实现高效特征聚合,提升VQA和视觉定位任务性能
有意识的注视:用于视觉-语言模型中幻觉抑制的自适应注意力机制
机构 * School of Computer Science and Technology/School of Artificial Intelligence(计算机科学与技术学院/人工智能学院) ; China University of Mining and Technology(中国矿业大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);grounding(abstract)
AI总结 CG-VLM通过认知需求传感器和聚焦共识诱导模块,在推理时精准干预视觉-语言模型的注意力,有效抑制幻觉并提升性能。
Comments 6 pages, 6 figures
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; KU Leuven(根特大学) ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Carleton University(卡尔顿大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);vision-language model(abstract);VLM(abstract);MLLM(abstract)
机构 * University of Electronic Science and Technology of China(电子科技大学) ; University of Technology Sydney(技术学院) ; Tongji University(同济大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);multimodal large language model(abstract);MLLM(abstract)
VL2Spike:面向具身AI低功耗视觉感知的VLM脉冲驱动蒸馏
机构 * School of EEE, Nanyang Technological University (NTU)(南洋理工大学电气与电子工程学院) ; Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Advanced Micro Devices, Inc.(超威半导体公司) ; State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光子学与仪器国家重点实验室) ; Faculty of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术学院)
专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(abstract)
AI总结 提出VL2Spike框架,通过时空视觉脉冲蒸馏和脉冲原型引导语言蒸馏,将VLM多模态知识迁移至Spikformer,在静态数据集上提升6.81%性能且能耗仅15.7%,并显著增强机器人视觉地点识别能力。
Comments 9 pages, 4 figures, 8 tables
两座桥梁,一条路径:从VLM到具有具身轨迹耦合数据的可泛化VLA
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(abstract)
AI总结 提出具身轨迹耦合(ETC)数据作为中间桥梁,通过三阶段训练策略(分布桥接、目标桥接、保留适应)将视觉语言模型(VLM)逐步转化为可泛化的视觉语言动作模型(VLA),解决从VLM到VLA的双重鸿沟。
VLM即刻:通过神经元分块实现高效的I/O压缩
机构 * Seoul National University(首尔国立大学) ; Meta ; Amazon(亚马逊公司)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出Neuron Chunking方法,通过神经元分块实现高效的I/O压缩,提升边缘部署VLMs的性能。
机构 * Purdue University(普渡大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);vision-language model(abstract)
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);分类 cs.CV、cs.AI、cs.LG
Hi-Token:用于生成式视觉定位的分层坐标分词
专题命中 VLM训练与架构 :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 该研究提出Hi-Token分层坐标分词方法,结合基于几何的Hi-GAR奖励,在生成式视觉定位任务中提升了多模型多基准的定位性能,优于强专用基线。
Comments 15 pages, 7 figures, 15 tables
利用视觉语言模型推进Web规模搜索的相关性测量
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title);分类 cs.LG
AI总结 本研究提出基于VLM的自动化相关性评估流水线,部署于Pinterest搜索A/B实验,验证其与人工标注一致性,提升评估效率,降低MDEs,助力优化搜索体验。
Comments RecSys'26 Industry track
TPCD:音调-压力对比解码与视觉语言模型中的无标签门控瓶颈
机构 * Beihang University(北京航空航天大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);grounding(abstract);分类 cs.CV
AI总结 本文提出TPCD方法,利用压力诱导分布作为对比解码负分支,结合门控缓解视觉语言模型受高压提示时的不合理承诺问题,在多个基准测试中显著降低攻击成功率。
GOTS:用于高分辨率视觉语言模型的贪婪正交令牌选择
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);InternVL(abstract);分类 cs.AI
AI总结 研究高分辨率视觉语言模型中令牌减少问题。提出GOTS方法,通过所选跨度互补性,无训练且与查询无关,每步选正交最大剩余能量令牌。在多主干和基准测试中性能优,还减少模型端首次令牌时间。
所有个体层都有帮助吗?视觉-语言模型中任务干扰层的实证研究
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Harbin Institute of Technology(哈尔滨工业大学) ; Southeast University(东南大学) ; Central South University(中南大学) ; National University of Singapore(新加坡国立大学) ; The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州))
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title);分类 cs.AI
AI总结 研究通过层干预发现部分层阻碍下游任务,提出任务自适应层剔除方法提升性能,揭示预训练VLM的意外模块化特性。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 9597-9607
基于注意力的MLLM选择器在测试时对长视频进行高效帧选择
机构 * ZJU(浙江大学) ; NJU(南京大学) ; CSU(中南大学) ; Microsoft(微软公司) ; NJUST(南京理工大学)
专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 研究利用MLLMs中验证选择提取层的跨模态注意力构建无训练的DAFS帧选择器,通过查询条件聚合提取帧级证据,将候选池大小和每帧令牌预算联合分配问题用动态规划解决,在Video-MME上表现出色,且无需重新训练即可跨多种模型和任务泛化。
MonoIR-RS:基于CLIP和VLM适配的红外遥感视觉语言学习
机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) ; Guizhou University(贵州大学) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV
AI总结 研究针对红外视觉语言理解未充分探索的问题,提出MonoIR-RS数据集及基准,结合多种方法构建并微调模型,提升红外遥感视觉语言学习性能,为红外与语言对齐提供可控测试平台。
fARfetch: 利用VLM驱动的AR内容适配实现大型视觉多样环境中的协同人机协作
机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)
专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV
AI总结 提出fARfetch系统,通过共享语义环境映射、上下文微缩世界表示和VLM驱动的AR视图管理,在大型室外环境中保持AR内容可读性,实验表明任务完成时间减少66%,工作负荷显著降低。
Comments Accepted to the 2026 IEEE International Conference on Robot and Human Interactive Communication (RO-MAN). Author accepted manuscript
零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; Magna International(麦格纳国际)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract_cn);分类 cs.CV
AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。
Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026