Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
专题命中 VLM训练与架构 :vision-language model(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.LG
Comments 33 pages, 9 figures
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.LG
Comments 8 pages, 13 tables, 2 figures
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision language model(title,abstract);visual language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
Comments 23 pages, 15 figures
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.AI、cs.LG
LLaVA-LE:用于月球探索的大型语言和视觉助手
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV
AI总结 本文提出LLaVA-LE,一个专为月球表面和地下特征分析设计的多模态模型,通过构建大规模月球数据集LLUCID和两阶段训练方法,提升了行星科学领域的视觉语言模型性能。
Comments Accepted in AI4Space Workshop CVPR2026. Website: https://osupcvlab.github.io/LLaVA-LE/, Dataset: https://huggingface.co/datasets/pcvlab/lucid
InternVL-U: 使统一多模态模型在理解、推理、生成和编辑方面更加普及
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; South China University of Technology(华南理工大学) ; Nanjing University(南京大学) ; Xiamen University(厦门大学) ; CUHK MMLab(香港中文大学MMLab)
专题命中 VLM训练与架构 :InternVL(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 InternVL-U通过轻量级统一多模态模型,在保持强大生成能力的同时,实现了在理解、推理、生成和编辑方面的高效平衡。
Comments technical report, 61 pages, https://github.com/OpenGVLab/InternVL-U
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments 17 pages; Website: https://aka.ms/llava-med
MOCHA: 多模态对象感知的跨架构对齐
机构 * University of Padova(帕多瓦大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出MOCHA蒸馏框架,将冻结VLM教师的多模态区域知识迁移至轻量视觉检测器,通过双重损失实现局部对齐与全局关系一致性,在少样本个性化检测中平均提升10.1%。
Comments 18 pages main paper, 10 pages supplementary material
Journal ref Proceedings of ECCV 2026
公共医学视觉语言基准中预训练污染的受控审计
机构 * Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; Mayo Clinic(梅奥诊所)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 审计发现公共医学VLM基准存在图像源重叠和文本规范顺序交换性信号,但确认的像素级重复罕见,且现有成员推理检测器在小规模医学VLM队列中不可靠。
Comments 30 pages, 7 figures, 9 tables. Preprint
CARES: 面向视觉语言模型的上下文感知分辨率选择器
机构 * Technion(技术ion大学) ; IBM Research(IBM研究院) ; Tel-Aviv University(特拉维夫大学) ; Ben-Gurion University(本· Gurion大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出CARES轻量级预处理模块,通过紧凑型VLM预测图像-查询对的最小足够分辨率,在保持任务性能的同时最多减少80%计算量。
Comments Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) Accepted to ACL 2026 (Oral presentation). Code available at https://github.com/mkimhi/CARES
一种用于工业检测中自动缺陷推理与报告生成的混合视觉-语言架构
机构 * School of Computing, Telkom University(Telkom大学计算机学院) ; Faculty of Engineering and Technology, School of Computing and Artificial Intelligence(工程与技术学院,计算与人工智能学院)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出一种解耦的边缘可部署管道,结合YOLO26-x-obb检测器、确定性编码模块和QLoRA微调的Qwen-2.5-1.5B模型,实现风电叶片缺陷定位与结构化报告生成,在BLEU-4、幻觉率和专家评分上显著优于零样本VLM基线。
Comments 23 pages, 6 figures, 9 equations, and 6 tables
AutoRubric-T2I: 一种用于文本到图像对齐的鲁棒基于规则的奖励模型
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出AutoRubric-T2I,一种首个用于文本到图像生成的规则学习框架,通过自动合成和选择显式规则来指导视觉语言模型(VLM)法官。该方法通过合成偏好对的推理轨迹生成候选规则,并利用VLM法官在每种规则下对配对图像进行评分,产生配对规则评分差异用于偏好学习。通过ℓ1正则化逻辑回归精简器去除噪声和冗余规则,从而在少量标注偏好数据下生成高质量、可解释的奖励信号,并在多个图像奖励基准测试中优于现有奖励模型基线。
Comments 27 pages
JoyAI-Image: 激活统一多模态理解和生成中的空间智能
机构 * Joy Future Academy, JD(京东探索研究院)
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出JoyAI-Image,一种统一的多模态基础模型,用于视觉理解、文本到图像生成和指令引导的图像编辑。该模型结合了空间增强的多模态大语言模型(MLLM)和多模态扩散Transformer(MMDiT),通过共享的多模态接口实现感知与生成的交互。构建可扩展的训练配方,结合统一指令微调、长文本渲染监督、空间 grounded 数据和通用及空间编辑信号,使模型具备广泛的多模态能力,同时增强几何感知推理和可控视觉合成。实验表明,JoyAI-Image在理解、生成、长文本渲染和编辑基准上达到最先进的性能。更重要的是,增强的理解、可控的空间编辑和新视角辅助推理之间的双向循环使模型超越一般视觉能力,向更强的空间智能发展。
Comments Code: https://github.com/jd-opensource/JoyAI-Image
CropVLM: 为细粒度视觉语言感知学习动态聚焦
机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 CropVLM通过强化学习提升VLM在细粒度图像理解任务中的性能,无需人工标注或合成数据,有效增强模型对细节的捕捉能力。
Comments Accepted to the GRAIL-V Workshop at CVPR 2026
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Tsinghua University(清华大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(title)
Comments Preprint
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title)
Comments Accepted at Findings of EMNLP2024
中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.AI
AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。
Comments 41 pages, 31 figures, 9 tables. Preprint
VLM2Rec: 解决视觉语言模型嵌入器在多模态序列推荐中的模态崩溃问题
机构 * Pohang University of Science
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出VLM2Rec框架,通过弱模态惩罚对比学习和跨模态关系拓扑正则化,解决多模态序列推荐中模态崩溃问题,提升推荐准确性和鲁棒性。
在视觉语言模型中保留局部化补丁语义
机构 * Department of Computer and Information Sciences, Temple University, Philadelphia, USA(计算机与信息科学系,特兰普大学,费城,美国)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV
AI总结 为解决视觉语言模型中图像与文本 tokens 信息扩散问题,提出 Logit Lens Loss(LLL)以保留图像 tokens 的局部化语义,提升模型可解释性和分割任务性能。
DiffPrune:用于视觉-语言模型中 token 剪枝的可微信息节流方法
机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) ; CUHK MMLab, CPII under InnoHK(香港中文大学MMLab,InnoHK下属CPII)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 DiffPrune 是一种用于视觉-语言模型的可微 token 剪枝方法,通过信息节流器避免松弛选择的不稳定性,在保留 96.5% 准确率的同时实现 2.85 倍 LLM 预填充加速,推理开销仅 0.69 毫秒。
跨架构视觉语言模型中基于方向的推理时防御措施审计
专题命中 VLM训练与架构 :vision-language model(title);LLaVA(abstract,abstract_cn);vision language model(abstract);分类 cs.AI
AI总结 该研究审计了视觉语言模型中5种基于方向的推理时防御,发现其性能具架构特异性,部分防御间几何重叠,需按解码器家族单独校准。
RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断
机构 * University of Liverpool(利物浦大学) ; Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) ; Department of Eye and Vision Sciences(眼科与视觉科学系) ; Computer Science Department(计算机科学系) ; Cardiovascular & Metabolic Medicine(心血管与代谢医学) ; Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。
Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)
MedARC:面向3D医学视觉-语言模型的无训练视觉令牌自适应冗余压缩
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对3D医学VLMs的视觉令牌冗余压缩问题,本文提出无训练框架MedARC,整合三类线索估计令牌重要性,通过显著性感知合并策略压缩令牌,在CT-RATE和MR-RATE上实现性能保持的同时降低开销。
Comments 9 pages
DICA:多模态大语言模型中的双指标引导对比对齐
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。
零努力图像到音乐生成:一种可解释的基于RAG的视觉语言模型方法
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The University of Hong Kong(香港大学) ; The Hong Kong University of Science(香港科学大学) ; The Hong Kong Polytechnic University Hong Kong China(香港理工大学香港中国) ; The University of Hong Kong Hong Kong China(香港大学香港中国)
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.AI
AI总结 本文提出一种基于RAG的视觉语言模型方法,实现图像到音乐生成,通过ABC记谱法连接文本与音乐模态,并利用多模态检索增强生成和自反思技术,提供高可解释性且低计算成本的音乐生成方案。
FADE: 通过减少大型视觉语言模型中的语言先验主导性来缓解幻觉
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.AI
AI总结 本文通过分析信息流,发现FFN模块在关键层引入语言先验,主导视觉证据,导致幻觉;提出无需训练的FADE方法衰减FFN输出,有效缓解幻觉并保持推理效率。
Comments 18 pages, 5 figures, 27 tables
增强视觉语言模型以理解多样传感器:成本高效的优化与基准测试
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出传感器感知属性微调(SAFT)与多样负属性(DNA)优化,利用少量传感器数据克服RGB中心偏见,无需修改模型架构,显著提升非RGB传感器图像理解,并发布首个综合基准VS-TDX。
Comments The manuscript was posted before all internal disclosure and documentation checks were completed. We are withdrawing this version to avoid confusion while the authors complete the necessary review process