CLIP-SCGI: Synthesized Caption-Guided Inversion for Person Re-Identification
专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);LLaVA(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);LLaVA(abstract);分类 cs.CV
专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);LLaVA(abstract);分类 cs.CV
Comments ACL Findings 2024
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV
Comments Project page: https://snap-research.github.io/MyVLM/
专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by CVPR 2024
专题命中 VLM训练与架构 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
专题命中 VLM训练与架构 :MLLM(abstract,comments);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project code, model and data: https://github.com/findalexli/mllm-dpo
Journal ref Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 14188-14200, 2024
SynopticBench:在生成未来天气预报讨论上评估视觉-语言模型
机构 * Department of Environmental Sciences(环境科学系) ; School of Data Science(数据科学学院)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.LG
AI总结 本文提出SynopticBench数据集和SPACE评估框架,用于评估视觉-语言模型在生成天气现象描述中的性能,揭示现有评估指标的局限性。
Comments Accepted for presentation at Climate Informatics 2026
迷失在视觉翻译中:用于脑电到图像重建的基于视觉语言模型的感知语义连贯框架
机构 * Mahindra University(马欣德拉大学) ; MU-VT Interdisciplinary Advanced Research Centre for Transformative Technologies, Mahindra University(马欣德拉大学MU-VT变革性技术跨学科高级研究中心)
专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.AI
AI总结 研究脑电到图像重建中视觉保真度与语义可恢复性评估问题,引入基于四个视觉语言模型的框架,通过结构化问题评估图像对,产生宽容感知和语义对齐分数,提炼出脑机接口连贯分数,有效评估感知语义可恢复性。
Comments 27 pages, 3 figures, 13 tables. Accepted at the 5th International Workshop on Human Brain and Artificial Intelligence (HBAI 2026)
DAPE:动态非均匀对齐与渐进细节增强技术以提升高效视觉语言模型的性能
机构 * The Wang Yanan Institute for Studies in Economics, Xiamen University, Xiamen 361005, China(厦门大学王文安经济研究所) ; Fujian Key Laboratory of Pattern Recognition and Image Understanding, School of Computer and Information Engineering, Xiamen University of Technology, Xiamen 361024, China(福建pattern识别与图像理解重点实验室,厦门理工大学计算机与信息工程学院)
专题命中 VLM训练与架构 :visual language model(title);分类 cs.CV、cs.AI
AI总结 本文提出DAPE框架,通过动态跨模态对齐和连续细节引入技术,提升高效视觉语言模型的性能,减少计算开销并提升下游任务准确性。
Comments Accepted in ICIC 2026 Oral
大视觉-语言模型在注意力中迷失
机构 * School of Cyberspace Security, Beijing University of Posts(信息安全学院,北京邮电大学) ; State Key Laboratory of Networking and Switching Technology, Beijing University of Posts(网络与交换技术国家重点实验室,北京邮电大学) ; School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts(计算机科学学院(国家试点软件工程学院),北京邮电大学) ; Nanyang Technological University, Singapore(新加坡南洋理工大学) ; Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(信息工程研究所,中国科学院北京研究院)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
AI总结 研究揭示大视觉-语言模型中注意力与前馈网络的作用差异,提出基于信息论和几何的统一框架,发现注意力模块存在冗余问题。
Comments 25 pages, 10 figures. Accepted by ICML 2026
基于可验证逻辑的生成规划器:一种可信具身AI的混合架构
机构 * School of Cyber Engineering, Xidian University(电子科技大学信息工程学院)
专题命中 VLM训练与架构 :grounding(title);分类 cs.AI、cs.LG
AI总结 本文提出VIRF框架,通过逻辑导师与LLM的对话机制实现主动协作,提升具身AI的安全性与可靠性,实验显示其在家庭安全任务中表现优异。
Comments Accepted to ICLR 2026. Project page. https://openreview.net/forum?id=wb05ver1k8¬eId=v1Ax8CwI71
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
UHR-BAT:面向超高清遥感的预算感知视觉-语言模型
机构 * School of Artificial Intelligence Science and Technology, Nanjing University(南京大学人工智能科学与技术学院) ; School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) ; School of Physics, Nanjing University(南京大学物理学院)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
AI总结 本文提出UHR-BAT模型,通过文本引导的多尺度重要性估计和区域保留合并策略,实现高效视觉token压缩,在严格预算下提升超高清遥感图像信息提取效率。
表征几何形状任务性能在CT结肠镜视觉-语言建模中的作用
机构 * Gilbert S. Omenn Department of Computational Medicine and Bioinformatics(Gilbert S. Omenn 计算医学与生物信息学部门) ; Department of Gastroenterology(消化内科部门) ; Department of Emergency Medicine(急诊医学部门) ; Department of Electrical Engineering and Computer Science(电气工程与计算机科学部门)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
AI总结 本文研究了CT结肠镜视觉-语言迁移学习,发现均值池化在疾病分类中表现更优,而注意力池化在跨模态检索中更有效,同时指出单片组织对比度比空间覆盖范围更重要,为构建体积医学影像视觉-语言系统提供了基础。
轻量级多模态适应:为无人机热成像中的物种识别和栖息地上下文解释优化视觉语言模型
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Florida(佛罗里达大学) ; Auburn University(奥本大学)
专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV、cs.AI
AI总结 本研究提出轻量级多模态适应框架,用于提升视觉语言模型在无人机热成像中的物种识别与栖息地上下文解释能力,通过热数据集优化模型性能,实现从RGB到热辐射的高效迁移。
即兴、适应、克服——用于医疗影像中视觉语言模型高效微调的望远镜适配器
机构 * Centre for Artificial Intelligence and Robotics, Indian Institute of Technology Mandi(印度理工学院曼迪分校人工智能与机器人中心)
专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV、cs.AI
AI总结 本文提出望远镜适配器,通过深度感知缩放提升视觉语言分割模型在医疗影像中的微调效率,仅用613k参数在五个数据集上取得优异性能。
Comments Accepted at the IEEE/CVF winter conference on applications of computer vision (WACV 2026)
差分反馈:为视觉语言模型强化学习生成多模态过程级监督
机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)
专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.AI
AI总结 本文提出差分反馈方法,通过修复错误推理轨迹自动构建token/步骤级监督掩码,实现多模态推理中的过程级视觉对齐,实验显示在MMMStar和MathVista基准上平均提升3%。
StructXLIP: 通过多模态结构线索增强视觉-语言模型
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
AI总结 StructXLIP通过引入多模态结构线索提升视觉-语言模型的跨模态检索性能。
Comments Accepted by CVPR 2026
通过模态解耦梯度下降缓解MLLM指令微调中的视觉知识遗忘
机构 * UC San Diego(加州大学圣迭戈分校) ; University of New South Wales(新南威尔士大学) ; Adobe Research(Adobe研究)
专题命中 VLM训练与架构 :MLLM(title);分类 cs.CV、cs.LG
AI总结 本文提出模态解耦梯度下降方法,通过有效秩量化视觉退化并缓解过度压缩,保留预训练视觉知识并提升任务适应能力。
Comments 9 pages
HarmoCLIP:在对比视觉语言模型中协调全局和区域表示
机构 * Tongji University(同济大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
AI总结 HarmoCLIP通过引入细粒度语义监督和区域-语言对齐策略,协调CLIP中全局与区域表示,提升检索和边界框分类性能,实现平衡高效的全局-局部权衡解决方案。
Comments 13 pages, 7 figures, 6 tables
专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.AI
Comments This paper has been accepted to IEIE( The Institute Of Electronics and Information Engineering, South Korea) Fall,2025 Conference
机构 * organization= Medical \& Imaging Informatics, Department of Radiological Sciences, David Geffen School of Medicine at UCLA , city= Los Angeles , postcode= 90095 , state= CA , country= USA ; organization= Department of Medicine, Division of Pulmonology ; Critical Care, David Geffen School of Medicine at UCLA , city= Los Angeles , postcode= 90095 , state= CA , country= USA
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
Journal ref Journal of Biomedical Informatics 172 (2025) 104947
机构 * State Key Laboratory of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室) ; Microsoft AI(微软人工智能)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
机构 * Google DeepMind(谷歌DeepMind) ; University of Central Florida(中央佛罗里达大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
机构 * Sports Vision, Inc.(体育视觉公司) ; Vizworld, Inc.(Vizworld公司)
专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.AI
Comments 13 pages, 7 Figures
机构 * Eluvio AI Labs(Eluvio AI实验室)
专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.LG
机构 * Shanghai University(上海大学) ; Beijing University of Chemical Technology(北京化工大学) ; University of Minnesota(明尼苏达大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
Comments Accepted by ICCV 2025
机构 * Indian Institute of Science(印度科学研究院)
专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV、cs.LG
Comments Published in TMLR (2025)