Visual Modality Prompt for Adapting Vision-Language Object Detectors
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at ICLR 2025
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at ICLR 2025. We release the model weights at: https://huggingface.co/nvidia/MM-Embed
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICLR 2025
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments This article has been accepted for publication in HEALTHINF25 at the 18th International Joint Conference on Biomedical Engineering Systems and Technologies (BIOSTEC 2025)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by CVPR 2024. Code: https://github.com/csuhan/OneLLM
专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published at NeurIPS 2024
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project Page: https://choiszt.github.io/Octopus/, Codebase: https://github.com/dongyh20/Octopus
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ECCV Camera Ready. Code & Data: https://jmiemirza.github.io/Meta-Prompting/
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at MICCAI 2024, the 27th International Conference on Medical Image Computing and Computer Assisted Intervention
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 8 pages, 4 figures
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Project leader(项目负责人)
专题命中 VLM训练与架构 :MLLM(abstract,comments);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Accepted by AAAI Conference on Artificial Intelligence (AAAI) 2026. Code available at https://github.com/bcmi/D3ToM-Diffusion-MLLM
机构 * USTC(中国科学技术大学) ; NJU(南京大学) ; THU(清华大学) ; XMU(厦门大学)
专题命中 VLM训练与架构 :MLLM(abstract,comments);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Project page: https://github.com/VITA-MLLM/Sparrow
专题命中 VLM训练与架构 :VLM(abstract,comments);vision-language model(abstract);分类 cs.AI、cs.LG
Comments Project page at https://astrazeneca.github.io/vlm/
词中结构:用于人类大脑显微镜的弱监督视觉-语言建模
机构 * Institute of Neuroscience and Medicine (INM-1), Research Centre Jülich(神经科学与医学研究所(INM-1),焦耳研究中心) ; Helmholtz AI, Research Centre Jülich(海德堡人工智能研究所,焦耳研究中心) ; Institute for Brain Research, University Hospital Düsseldorf(脑研究所在杜塞尔多夫大学医院) ; Computer Vision, Institute for Computational Visualistics, University of Koblenz(计算机视觉,计算视觉研究所,科布伦茨大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 本研究提出了一种弱监督视觉-语言建模方法,通过标签介导生成人类大脑显微镜的区域描述,实现了在缺乏配对标注情况下的自然语言生成。
Comments 13 pages, 5 figures, accepted for inclusion at GCPR 2026
SA-GEM:面向高效遥感大视觉语言模型的尺度自适应与地理空间证据调制型令牌剪枝
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 本文针对遥感大视觉语言模型高分辨率处理效率低的问题,提出SA-GEM即插即用剪枝框架,通过尺度自适应与地理空间证据调制实现效率与精度提升,在XLRS-Bench上超GeoLLaVA-8K 2.3%且推理提速2.4倍。
门总是关闭:关于向冻结的视觉语言模型注入辅助信号
机构 * University of Doha for Science and Technology(多哈科技大学) ; Pluralis Research(普卢拉利斯研究公司) ; North South University(南北大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 研究视觉语言模型中辅助信号注入问题,发现优化器常使门控路径关闭。利用抑制现象,通过双曲视觉关系图的几何辅助损失正则化LoRA微调,实验表明该方法能保持关系准确率,还指出嵌入范数对齐及固定注入的必要性。
微调多模态大语言模型用于从短视频中对自闭症行为进行临床级评分
机构 * Stanford University(斯坦福大学) ; University of Hawaii at Manoa(夏威夷大学马诺阿分校) ; University of California San Francisco(加利福尼亚大学旧金山分校)
专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV
AI总结 微调Gemini 2.5 Pro模型,从400个临床评分的家庭视频中提取30个行为特征,在99名儿童上实现与临床医生评分的一致性提升40%,并零样本达到53%的自闭症诊断F1提升。
ProactiveBench: 多模态大语言模型主动性的基准测试
机构 * University of Trento(特伦托大学) ; University of Bergamo(贝拉米奥大学) ; Inria Grenoble(格勒诺布尔研究所) ; Bruno Kessler Foundation(布鲁诺·凯斯勒基金会)
专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV
AI总结 提出ProactiveBench基准,评估多模态大语言模型在遮挡识别等任务中请求用户干预的主动性,发现模型普遍缺乏主动性且与能力无关,但可通过强化学习微调习得。
Comments Accepted at ECCV 2026
超越当前观测:评估多模态大语言模型在可控非马尔可夫博弈中的表现
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV
AI总结 提出RNG-Bench基准套件,通过配对记忆和3D迷宫两个博弈,评估多模态大模型在非马尔可夫环境中重建历史观测并据此行动的能力,发现主要错误源于遗忘而非决策,微调可提升性能。
通过正则化微调实现可域泛化的3D视觉-语言模型适应
机构 * Concordia University(康考迪亚大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 提出ReFine3D框架,通过选择性层调优、多视图一致性、同义词提示及点渲染视觉监督等正则化策略,提升3D大语言模型在域泛化中的性能。
Comments Accepted at Transactions on Machine Learning Research (TMLR)
在开源视觉语言模型中,什么因素影响杂货产品检索
机构 * AI Graduate Program, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院人工智能研究生项目) ; EEEI, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院电子工程系)
专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV
AI总结 本文研究了开源视觉语言模型在杂货产品检索任务中的表现,发现数据质量比规模更重要,高效模型可以胜出,并且存在召回率差距的问题。
Comments Accepted in the 28th International Conference on Pattern Recognition (ICPR 2026)
基于视觉语言模型的指令视频多模态抽象摘要
机构 * Beihang University, Beijing, China(北航大学,北京,中国) ; University of Verona, Italy(威尼斯大学,意大利)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 本文提出ClipSum框架,利用冻结的CLIP视觉语言特征进行指令视频摘要,通过显式时间建模和维度自适应融合,实现视觉与语言的语义对齐,实验显示其在YouCook2数据集上表现优于传统方法。
Comments Accepted to ICPR 2026
当否定是在视觉-语言模型中一个几何问题
机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO系) ; imec ; Independent Researcher(独立研究员)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 本文探讨了视觉-语言模型中否定理解的几何问题,提出基于多模态大语言模型的评估框架,并通过表示工程操控CLIP模型实现否定意识。
Comments Accepted to CVPR (Multimodal Algorithmic Reasoning Workshop) 2026
AutoTraces:通过多模态大语言模型实现自回归轨迹预测
机构 * Southeast University(东南大学)
专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV
AI总结 AutoTraces通过多模态大语言模型实现自回归轨迹预测,采用创新的轨迹标记方案和自动链式推理机制,提升长周期预测精度与跨场景泛化能力。
基于扩散模型的人体网格恢复中的群体偏好对齐
机构 * Nanyang Technological University(南洋理工大学) ; HKUST(GZ)(香港科技大学(广州)) ; SenseTime Research(商汤科技研究院) ; A*STAR(新加坡科技研究局)
专题命中 VLM训练与架构 :VLM(title);分类 cs.CV
AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。
Comments Accepted to CVPR 2026