Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
专题命中 VLM训练与架构 :LLaVA(title,abstract);grounding(title);vision-language model(abstract);VLM(abstract)
Comments Code available at: https://github.com/AlaaLab/Dr-LLaVA
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :LLaVA(title,abstract);grounding(title);vision-language model(abstract);VLM(abstract)
Comments Code available at: https://github.com/AlaaLab/Dr-LLaVA
MLLM-DataEngine:闭合多模态指令微调数据生成的循环
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 VLM训练与架构 :MLLM(title,title_cn);分类 cs.CV、cs.LG
AI总结 本文提出MLLM-DataEngine闭环系统,通过自适应坏例采样模块分析模型弱点,为GPT-4提供信息以生成高质量增量数据集,能有针对性且自动地提升MLLMs能力,有望成为MLLMs数据管理通用方案。
Comments 6 pages, 4 figures, 7 tables; accepted by ICME 2026
Journal ref 2025 IEEE International Conference on Multimedia and Expo (ICME), Nantes, France, 30 June 2025 - 04 July 2025
OpenGlass:用于本地MLLM驱动的实时视觉辅助的传感-计算分离架构
机构 * Shanghai Qizhi Institute(上海期智研究院) ; College of AI, Tsinghua University(清华大学人工智能学院)
专题命中 VLM训练与架构 :MLLM(title,title_cn);分类 cs.CV、cs.AI
AI总结 针对视障和低视力用户,OpenGlass以传感-计算分离解决云MLLM辅助需上传数据、有网络延迟,以及可穿戴眼镜计算和电量受限问题,在本地设备实现低延迟多模态视觉辅助,并给出评估结果。
Comments Accepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026
用联合稀疏自编码器引导视觉-语言模型
机构 * yunshanai(云山AI) ; HKUST(Guangzhou)(香港科技大学(广州)) ; Zidongtaichu(紫东太初) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出联合稀疏自编码器(JSAE),通过显式对齐约束联合分解视觉和语言激活,得到可解释的跨模态特征,并在LLaVA等模型上验证了层依赖的干预效果。
Comments 19pages,10 figures
脚手架效应:提示框架如何驱动临床VLM评估中的表面多模态增益
机构 * Technical University of Darmstadt(达姆施塔特技术大学)
专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 研究发现,在临床VLM评估中,提示中提及MRI可用性即可解释70-80%的性能提升,与图像数据是否存在无关,这种“脚手架效应”揭示了表面评估无法反映真实多模态推理能力。
安全幻象:虚假相关性如何破坏VLM安全微调及通过机器遗忘缓解
机构 * Michigan State University(密歇根州立大学) ; National University of Singapore(新加坡国立大学) ; Cisco Research(思科研究)
专题命中 VLM训练与架构 :VLM(title,title_cn);vision language model(abstract);分类 cs.AI、cs.LG
AI总结 本文发现视觉语言模型(VLM)的安全微调存在“安全幻象”,即虚假相关性导致脆弱性,并提出机器遗忘作为替代方案,显著降低攻击成功率和不必要拒绝。
Comments Accepted to ICLR 2026
OccamToken: 无需训练且预算自适应的令牌剪枝实现高效VLM推理
机构 * Nanyang Technological University (NTU)(南洋理工大学)
专题命中 VLM训练与架构 :VLM(title,title_cn);LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出OccamToken框架,通过寄存器锚定的相对证据测试替代绝对排名范式,实现无需训练、自适应预算的视觉令牌剪枝,在保持高精度的同时大幅压缩令牌数量。
Comments 26 pages,8 figures
专题命中 VLM训练与架构 :LLaVA(title,abstract);VLM(abstract);visual language model(abstract);visual question answering(abstract)
FailSafe: 视觉-语言-动作模型中的失败推理与恢复
机构 * Nanyang Technological University(南洋理工大学) ; Centre for Frontier AI Research, A*STAR(A*STAR前沿人工智能研究中心) ; Allen Institute for AI(艾伦人工智能研究所) ; University of Washington(华盛顿大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);LLaVA(summary_cn,abstract);vision-language model(abstract)
AI总结 提出FailSafe系统,自动生成多样化失败案例及可执行恢复动作,微调LLaVA-OV-7B构建FailSafe-VLM,使机器人检测并恢复失败,在ManiSkill任务上平均提升三个VLA模型性能达22.6%。
Comments IROS 2026. Project Page: https://jimntu.github.io/FailSafe
超越文本条件:面向视频生成的MLLM-DiT融合系统研究
机构 * Chinese Academy of Sciences(中国科学院) ; Microsoft Research(微软研究院) ; Sun Yat-sen University(中山大学) ; Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Xi’an Jiaotong University(西安交通大学)
专题命中 VLM训练与架构 :MLLM(title,title_cn);分类 cs.CV
AI总结 该研究针对视频生成中MLLM与DiT融合问题,提出BiVidGen框架,通过MLLM生成语义视觉标记辅助DiT渲染,提升了视频的语义对齐度与时间一致性。
VOLA:通过基于VLM的语义属性预测改进开放世界驾驶
机构 * Technical University of Munich(慕尼黑工业大学)
专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV
AI总结 VOLA模型基于VLM图像token预测驾驶相关属性,在开放世界驾驶场景中,对训练外新障碍物的易损性等级召回率优于纯视觉分割器和提示式VLM分割器。
Comments 16 pages, 8 figures
VISA: VLM引导的实例语义审计用于3D占据世界模型
机构 * University of Maryland College Park(马里兰大学帕克分校) ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; Stanford University(斯坦福大学) ; Motional AD Inc.(Motional AD公司)
专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV
AI总结 提出VISA方法,利用离线VLM对每个物理对象实例进行结构化语义审计,并通过可靠性加权损失蒸馏到3D占据模型中,无需VLM推理即可提升封闭集占据mIoU。
Hy-Embodied-VLM-1.0:高效的物理世界智能体
机构 * Tencent Robotics X(腾讯Robotics X团队) ; Hy Vision Team(腾讯混元视觉团队) ; Futian Laboratory(福田实验室)
专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV
AI总结 研究旨在构建物理世界具身智能体,介绍Hy-Embodied-VLM-1.0模型。定义以行动为中心的能力分类法,开发数据管道。基于特定主干和编码器构建模型,用专家混合架构提升效率。在多基准测试中性能出色,较上一代有显著提升,在具身智能任务中也表现强大。
Comments Tech Report. Code and models are open-sourced at https://github.com/Tencent-Hunyuan/HY-Embodied
Robust-LLaVA:大规模鲁棒图像编码器对多模态大语言模型的有效性
机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) ; Khalifa University(卡利法大学) ; Michigan State University(密歇根州立大学) ; Australian National University(澳大利亚国立大学)
专题命中 VLM训练与架构 :LLaVA(title,title_cn);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出利用大规模对抗预训练的图像分类模型替代CLIP编码器,以增强多模态大语言模型对视觉对抗扰动的鲁棒性,在无需额外对抗训练的情况下,在视觉问答、图像描述和越狱攻击任务中取得显著鲁棒性提升。
Comments Accepted at Trustworthy FMs Workshop Trust Before Use: Building Foundation Models that You Can Trust (ICCVW) 2025
合成刺激,真实收益:通过完全受控的数据生成重新思考VLM微调
机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)
专题命中 VLM训练与架构 :VLM(title,title_cn);vision language model(abstract);分类 cs.CV
AI总结 本文提出一种完全受控的数据生成与标注流程,用于微调视觉语言模型(VLM),通过平衡分布和干净标注消除偏差,在空间推理任务上仅用130个样本即可实现均匀性能,并在真实世界数据上提升13%的性能。
CG-MLLM:通过多模态大语言模型实现图像描述与3D内容生成
机构 * Zhejiang University, China(浙江大学)
专题命中 VLM训练与架构 :MLLM(title,title_cn);分类 cs.CV
AI总结 本文提出CG-MLLM,一种能实现3D描述和高分辨率3D生成的多模态大语言模型,通过混合Transformer架构分离不同建模需求,结合预训练视觉语言模型与专用3D VAE潜在空间,提升3D生成质量与感知能力。
Comments ICML 2026
通过查询驱动专家桥梁适应基础视觉-语言模型用于医学诊断
机构 * Lab for AI in Medical Imaging, Technical University of Munich (TUM)(医学影像人工智能实验室,慕尼黑技术大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title);LLaVA(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出MedBridge框架,通过结合领域对齐、分辨率保持和多标签推理的互补VLM专家,解决医学影像诊断中的领域差距问题,实现跨领域泛化和领域内特化,提升多标签胸腔疾病诊断性能。
20/20 Vision Language Models: 通过数据整理单独提升VLMs的方案
机构 * DatologyAI
专题命中 VLM训练与架构 :vision language model(title,title_cn);VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract)
AI总结 本文通过数据整理提升VLMs性能,展示在20个公开基准和DatBench九个能力轴上均取得显著提升,同时提升可靠性、OOD泛化和推理效率。
Comments 33 pages, 15 figures. DatalogyAI website for more details: https://www.datologyai.com/
在视觉-语言模型中可靠性在哪里存在:注意力、隐藏状态和因果回路的机制研究
机构 * UC Santa Barbara(加州大学圣巴巴拉分校) ; UC Berkeley(加州大学伯克利分校) ; NVIDIA(英伟达) ; Algoverse AI Research(Algoverse人工智能研究) ; Brown University(布朗大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 本文通过机制性研究发现,视觉-语言模型的可靠性主要体现在隐藏状态几何、分层边际形成和稀疏晚层回路,而非注意力图的锐度。
Comments 15 pages, 4 figures, 10 tables. Accepted at the ICLR 2026 Workshop on Multimodal Reasoning. Code and probe-training pipelines: https://github.com/itsloganmann/VLM-Reliability-Probe
构造性失真:通过注意力引导的图像扭曲改进MLLMs
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Skan AI ; Texas A&M University(德克萨斯大学阿姆斯特朗分校) ; University of California, Irvine(加州大学 Irvine 分校)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);InternVL(abstract,abstract_cn);MLLM(abstract,abstract_cn);grounding(abstract)
AI总结 本文提出AttWarp方法,通过注意力引导的图像扭曲增强MLLMs对细节和空间关系的感知能力,提升准确性和推理能力。
Comments Accepted at ICLR 2026
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI
渐进式语义通信用于高效边缘-云视觉-语言模型
机构 * Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学院) ; Open-EP Community(开放EP社区)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出渐进式语义通信框架,通过Meta AutoEncoder压缩视觉token,实现灵活的边缘-云VLM部署,减少网络延迟并保持语义一致性。
Comments Accepted for publication in the 2026 IEEE Global Communications Conference (GLOBECOM). Extended version with additional figures and appendices
多模态大语言模型推理时防御方法的比较分析
专题命中 VLM训练与架构 :InternVL(summary_cn,abstract);multimodal large language model(title,abstract);MLLM(abstract)
AI总结 本文比较评估了三种推理时防御方法及其组合在InternVL和Qwen-VL系列共8个模型上的效果,发现无单一防御在所有设置中占优,组合防御导致良性查询过度拒绝率达97-100%,而简单安全提示在保持实用性的同时带来适度安全提升。
Comments 15 pages, 3 figures. Conditionally accepted at DAMDID/RCDL 2026; revised after peer review
临床视觉-语言模型中的跨模态链接风险
机构 * Lab for AI in Medicine(医学人工智能实验室) ; RWTH Aachen University(亚琛工业大学) ; Department of Diagnostic and Interventional Radiology(诊断与介入放射学部门)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究临床视觉-语言模型(VLM)在图像与报告分离场景下通过余弦相似度实现跨模态重链接的风险,并采用仅对投影头进行差分隐私微调的方法在保持图像效用同时显著降低重链接率。
空间思维链:面向视觉语言模型的模态无关空间定位
专题命中 VLM训练与架构 :vision language model(title);grounding(title);VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 该研究提出轻量架构无关框架Space Tokens,将空间信息蒸馏为连续token融入VLMs的思维链,在VSI-Bench上提升两款模型性能,在尺寸估计任务达SOTA,实现高效空间推理。
机构 * Stony Brook University(斯通布罗克大学) ; Amazon(亚马逊)
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments Published in the First Workshop of Evaluation of Multi-Modal Generation 2025
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :InternVL(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
机构 * Huazhong University of Science and Technology(华中科技大学) ; Zhejiang University(浙江大学) ; Youtu Lab, Tencent(腾讯优图实验室) ; Huazhong Agricultural University(华中农业大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments ICCV'25
机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS先进交叉科学学院) ; MAIS, CASIA(CASIA人工智能研究所) ; School of Artificial Intelligence, UCAS(UCAS人工智能学院) ; Centre for Artificial Intelligence and Robotics, HKISI-CAS(HKISI-CAS人工智能与机器人中心) ; FKLPRIU, School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院)
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.LG
Comments ACL 2025 (Main)