arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5003 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5003 篇

2409.06067 2026-07-08 cs.AI cs.CL cs.LG 版本更新 95%

MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning

MLLM-LLaVA-FL:多模态大语言模型辅助联邦学习

Jianyi Zhang, Hao Frank Yang, Ang Li, Xin Guo, Pu Wang, Haiming Wang, Yiran Chen, Hai Li

机构 * Duke University(杜克大学) Johns Hopkins University(约翰霍普金斯大学) University of Maryland College Park(马里兰大学学院市分校) Lenovo Research(联想研究院)

专题命中 VLM训练与架构 :LLaVA(title,title_cn);MLLM(title,title_cn);multimodal large language model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对联邦学习中数据异质性问题,提出MLLM-LLaVA-FL框架,利用多模态大语言模型,通过全球视觉文本预训练、客户端本地训练和服务器端全局对齐三个阶段,提升联邦学习性能。

Comments Accepted to WACV 2025

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00909 2026-06-02 cs.CL cs.AI 94%

MLLM-Microscope: Unlocking Hidden Structure Within Multimodal Large Language Models

MLLM-Microscope:解锁多模态大语言模型中的隐藏结构

Ravil Mussabayev, Rustam Mussabayev

机构 * Satbayev University(萨特拜耶夫大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);LLaVA(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.AI

AI总结 提出MLLM-Microscope系统,通过分析线性度、内在维度和各向异性,揭示多模态大语言模型中隐藏的表示结构,并基于ScienceQA数据集评估LLaVA-NeXT和OmniFusion,发现模态融合方式显著影响模型内部工作机理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02124 2026-08-04 cs.CV cs.CL 新提交 93%

HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models

HAFI-VLM:用于诊断和增强视觉语言模型中视觉感知的频率视角

Jin Cui, Chuanchang Su, Jiayi Lu, Xinyue Long, Boran Zhao, Pengju Ren

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对VLMs视觉预测不可靠的频谱响应刚性问题,提出HAFI-VLM,通过任务条件频率通路与相关组件优化,在多个VLMs基准上提升了视觉感知性能。

Comments 11 pages, 8 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10641 2026-05-12 cs.CV cs.AI 93%

LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models

LLaVA-CKD: 从下至上级联知识蒸馏用于视觉-语言模型

Nikolaos Gkalelis, Vasileios Mezaris

机构 * CERTH-ITI

专题命中 VLM训练与架构 :LLaVA(title,title_cn);vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LLaVA-CKD框架,通过级联知识蒸馏提升视觉-语言模型效率,通过中间容量教师模型逐步提升学生模型性能,并在七个VQA基准上验证了其最优性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05859 2026-07-08 cs.CV 新提交 93%

AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring

AVA-VLM:用于野外建筑工地监测的自适应视觉注意力视觉语言模型

Younggun Kim, Taeheon Kim, Youngseo Kim, Seunghee Park

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) AI+KCIR Global Resilience Research Center(人工智能与韩国气候变化影响韧性研究中心) SmartInside AI Co., Ltd.(思玛特因赛德人工智能有限公司) Sungkyunkwan University(成均馆大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision language model(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对野外建筑工地监测,提出AVA-VLM自适应视觉注意力视觉语言模型,遵循粗到细推理策略,先对低分辨率全局图像推理,按需请求高分辨率局部裁剪,并引入区域感知思维链数据集,提升了低分辨率下的可靠性并减少视觉令牌使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26004 2026-05-26 cs.CV cs.CL 93%

MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models

MAGIC: 面向视觉语言模型的多模态对齐与接地感知指令核心集

Shristi Das Biswas, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(title,abstract);LLaVA(abstract,abstract_cn)

AI总结 提出MAGIC方法,利用预训练VLM中的多模态增益、桥接相关性和技能神经元签名三种内在信号,通过无训练、前向传播的核心集选择,构建紧凑且行为保真的子集用于多模态指令微调,在20%预算下达到甚至超越全微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06478 2026-07-08 cs.CV 新提交 93%

A VLM-Enhanced Framework for Comprehensive Traffic Sign Condition Assessment Integrating Daytime Visual Performance and Nighttime Retroreflectivity Evaluation

一种用于综合交通标志状况评估的VLM增强框架,集成白天视觉性能和夜间逆反射率评估

Linlin Zhang, Neema Jakisa Owor, Xiang Yu, Abby Watts, Yaw Adu-Gyamfi

机构 * Department of Civil and Environmental Engineering University of Missouri- Columbia(土木与环境工程系密苏里大学哥伦比亚分校)

专题命中 VLM训练与架构 :VLM(title,title_cn);LLaVA(summary_cn,abstract);InternVL(abstract,abstract_cn);vision language model(abstract)

AI总结 研究开发用于综合评估交通标志状况的新框架,利用微调视觉语言模型评估白天视觉性能,结合激光雷达校准的逆反射率评估夜间性能,集成到标志状况指数,提供经济有效的评估方法,LLaVA和Qwen表现优,还标记出需更换的标志。

Comments 21 pages, 7 figures, 5 tables. Preprint. An earlier version of this work was presented at the 105th Annual Meeting of the Transportation Research Board (TRB), January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28551 2026-08-11 cs.CV cs.CL cs.LG 版本更新 93%

DataComp-VLM: Improved Open Datasets for Vision-Language Models

DataComp-VLM:改进的视觉语言模型开放数据集

Matteo Farina, Vishaal Udandarao, Thao Nguyen, Selim Kuzucu, Maximilian Böther, Andreas Hochlehnert, Adhiraj Ghosh, Marianna Nezhurina, Karsten Roth, Joschka Struber, Yuhui Zhang, Sebastian Dziadzio, Elaine Sui, Soumya Jahagirdar, Dhruba Ghosh, Hasan Hammoud, Thomas De Min, Simone Caldarella, Jehanzeb Mirza, Sedrick Keh, Mehdi Cherti, Hilde Kuehne, Bernt Schiele, Serena Yeung-Levy, Muhammad Ferjad Naeem, Federico Tombari, Ana Klimovic, Elisa Ricci, Matthias Bethge, Sewoong Oh, Ameya Prabhu, Alessio Tonioni, Jenia Jitsev, Massimiliano Mancini, Ludwig Schmidt, Nikhil Parthasarathy

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 提出DataComp-VLM基准,通过数据混合(而非过滤)策略提升视觉语言模型训练效果,在8B模型上达到63.6%准确率,比现有最优数据集提升5.4个百分点。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16713 2026-06-12 cs.CV cs.AI 版本更新 93%

GeoWorld-VLM: Geometry from World Models for Vision-Language Models

GeoWorld-VLM:从世界模型中获取几何结构用于视觉-语言模型

Renjie Gu, Kaichen Zhou, Yan Luo, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Kempner Institute for the Study of Natural and Artificial Intelligence(凯普纳自然与人工智能研究 institute) Harvard University(哈佛大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 GeoWorld-VLM通过将冻结的摄像机条件视频世界模型的几何结构转移到视觉-语言模型中,提升空间关系推理能力,实验显示在两个不同架构上均提升了约4%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13375 2026-05-14 cs.CV cs.AI 93%

GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models

GRIP-VLM:基于组相对重要性的高效视觉-语言模型压缩

Mingzhe Huang, Weijun Wang, Xin Ding, Liang Mi, Hao Wen, Yuanchun Li, Lichen Pang, Shansong Yang, Yunxin Liu, Ting Cao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Juhaokan Technology Co.,Ltd(极皓科技有限公司) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 GRIP-VLM通过强化学习框架解决视觉语言模型中大规模视觉token处理的计算瓶颈,通过组相对重要性策略优化实现高效压缩,达到15%的推理加速。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20279 2026-04-22 cs.CV cs.CL 93%

VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

VLM-3R:融合指令对齐3D重建的视觉-语言模型

Zhiwen Fan, Jian Zhang, Renjie Li, Junge Zhang, Runjin Chen, Hezhen Hu, Kevin Wang, Huaizhi Qu, Shijie Zhou, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Tianlong Chen, Jiachen Li, Zhengzhong Tu, Zhangyang Wang, Rakesh Ranjan

机构 * UT Austin(德克萨斯大学奥斯汀分校) XMU(厦门大学) TAMU(德克萨斯大学阿灵顿分校) UCR(加州大学河滨分校) UNC(北卡罗来纳大学教堂山分校) Meta UCLA(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出VLM-3R,通过融合3D重建指令微调,实现单目视频的3D空间辅助与具身推理,提升了视觉-空间推理和时间3D上下文理解的准确性和可扩展性。

Comments Project Page: https://vlm-3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00561 2026-08-04 cs.AI cs.CL cs.CV 新提交 92%

Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations

通过LENS:视觉语言模型表示的局部几何分解

Shalom Kachko, Raz Lapid, Margarita Vald, Almog Dubin, Moshe Sipper

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);LLaVA(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出LENS方法,将VLM激活分解为局部低秩高斯邻域,揭示LLaVA与Qwen3-VL的不同模态融合轨迹,该方法可实现因果生成干预并提升多模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12515 2026-08-14 cs.CV cs.RO 新提交 92%

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

视觉-语言模型能否从机器人的第一人称视角图像评估人际距离风险?

Vladyslava Rudas, Dmytro Kuzmenko

机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) University of Turin(都灵大学)

专题命中 VLM训练与架构 :InternVL(summary_cn,abstract);vision-language model(title,abstract);VLM(summary_cn,abstract_cn);grounding(abstract)

AI总结 该研究评估了InternVL、Qwen-VL、SmolVLM三种VLM在机器人第一人称视角图像人际距离危险分类中的表现,发现Qwen-VL经特定优化后高危险召回率更高,当前VLM在相关推理定位上仍有局限。

Comments Accepted at the EMR 2026 workshop at ECCV 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19792 2026-05-20 cs.CV 92%

Mechanisms of Object Localization in Vision-Language Models

视觉-语言模型中物体定位的机制

Timothy Schaumlöffel, Martina G. Vilas, Gemma Roig

机构 * Goethe University Frankfurt, Germany(法兰克福歌德大学,德国) The Hessian Center for AI, Germany(黑森人工智能中心,德国)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);InternVL(summary_cn,abstract);vision-language model(title);grounding(abstract)

AI总结 本文研究了视觉-语言模型中物体定位的核心机制,通过分析LLaVA-1.5和InternVL-3.5等模型,揭示了定位依赖于容器化机制,并发现只有少量注意力头参与分类和定位任务,为未来模型设计提供了指导。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17389 2026-06-17 cs.CV cs.AI cs.CL cs.LG 新提交 92%

Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models

视觉会撒谎,一致性说话:在视觉-语言模型中解耦空间注意力与可靠性

Logan Mann, Yi Xia, Ajit Saravanan, Ishan Dave, Saadullah Ismail, Shikhar Shiromani, Emily Huang, Ruizhe Li, Kevin Zhu

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Algoverse AI Research(Algoverse AI研究) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);LLaVA(abstract,abstract_cn);grounding(abstract)

AI总结 本文提出VLM可靠性探针(VRP),通过结构注意力指标和生成动态分析,发现空间注意力与准确性几乎无关(R≈0.001),而自一致性是可靠性的主要预测因子(R=0.429),揭示了视觉特征与最终生成之间的符号脱离现象。

Comments 16 pages. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence. Code: https://github.com/itsloganmann/VLM-Reliability-Probe

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10489 2026-08-12 cs.CV 新提交 92%

When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

当视觉变为文本:视觉语言模型(VLM)中基于跨模态残差引导的视觉令牌剪枝

Congyang Ou, Ruike Song, Yang Zhou, Libo Sun, Haokui Zhang, Zhenbo Luo

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);LLaVA(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对视觉语言模型(VLM)海量视觉令牌导致推理成本高的问题,提出基于跨模态残差(CMR)的无训练压缩方法SIEVE,在LLaVA-NeXT-7B上仅保留11.1%视觉令牌,实现显著加速与缓存缩减且性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07531 2026-06-09 cs.CL cs.AI 新提交 92%

mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models

mllm-shap:面向文本-音频多模态大语言模型的Shapley值可解释性平台

Jakub Muszyński, Paweł Pozorski, Maria Ganzha

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(title);分类 cs.AI

AI总结 提出mllm-shap框架,通过模态感知掩码、多轮对话追踪和音素对齐分组技术,将Shapley值可解释性扩展到文本-音频多模态大语言模型,并实现10-50倍的计算加速。

Comments Submitted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27952 2026-07-31 cs.CV cs.AI 新提交 92%

LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference

LAST:最后一个查询令牌指导视觉令牌剪枝用于边缘-云协作多模态大语言模型(MLLM)推理

Feng Yang, Xinrui Ju, Keyang Zhang, Xiandong Meng, Rongqun Lin, Howard Leung, Shiqi Wang, Haoliang Li, Chris Xing Tian

专题命中 VLM训练与架构 :MLLM(title,title_cn);VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 该研究提出无训练框架LAST,利用边缘侧VLM的最后查询令牌注意力实现查询感知视觉令牌剪枝,在11个多模态基准上以12.5%视觉令牌保留率维持95.4%全令牌准确率,降低边缘和云侧开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24963 2026-06-25 cs.CV cs.LG 新提交 92%

Curvature-Guided Mixing for MLLM Adaptation

曲率引导混合用于MLLM适配

Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang

机构 * Research Institute of Trustworthy Autonomous Systems and Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学可信自主系统研究院与计算机科学与工程系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 VLM训练与架构 :MLLM(title,title_cn);LLaVA(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 提出曲率引导混合(CGM)框架,通过二阶Hessian近似推导最优软混合比,以及硬混合变体CGM†,在LLaVA-1.5和Qwen2.5VL上改善任务专化与通用知识保持的权衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07537 2026-08-11 cs.NE cs.AI cs.CL cs.HC cs.MA 新提交 92%

An evolutionary model of animats with VLM-based subjective evaluation

基于视觉语言模型(VLM)主观评估的动物机器人进化模型

Shota Miyazaki, Takaya Arita, Reiji Suzuki

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出将VLM主观评估融入遗传算法的框架,使虚拟软体机器人同步进化形态与运动,实验显示该方法可加快种群收敛,且VLM主观选择的结果与人类评估倾向相似。

Comments 18 pages, 12 figures, 2 tables. This manuscript has been accepted for publication in Artificial Life and Robotics following peer review

Journal ref Shota Miyazaki, Takaya Arita and Reiji Suzuki: An evolutionary model of animats with VLM-based subjective evaluation, Artificial Life and Robotics (2026). https://link.springer.com/article/10.1007/s10015-026-01135-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25979 2026-05-26 cs.CV 92%

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

LLaVA-OneVision-2:迈向下一代感知智能

Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

机构 * Glint Lab(Glint实验室) AIM for Health Lab(健康AI实验室) MVP Lab(MVP实验室)

专题命中 VLM训练与架构 :LLaVA(title,title_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出LLaVA-OV-2模型,通过编解码流令牌化、窗口注意力和3D RoPE实现统一视频理解与时空定位,在多项基准上超越Qwen3-VL-8B。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11706 2026-02-19 cs.CV cs.AI 91%

MC-LLaVA: Multi-Concept Personalized Vision-Language Model

MC-LLaVA:多概念个性化视觉-语言模型

Ruichuan An, Sihan Yang, Renrui Zhang, Ming Lu, Tianyi Jiang, Kai Zeng, Yulin Luo, Jiajun Cao, Hao Liang, Ying Chen, Qi She, Shanghang Zhang, Wentao Zhang

机构 * Peking University(北京大学) Intel Labs, China(英特尔实验室,中国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);VLM(abstract);visual question answering(abstract)

AI总结 MC-LLaVA通过多概念指令微调和个性化提示提升视觉-语言模型的多概念个性化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18854 2025-03-26 cs.CV cs.AI 91%

MC-LLaVA: Multi-Concept Personalized Vision-Language Model

Ruichuan An, Sihan Yang, Ming Lu, Renrui Zhang, Kai Zeng, Yulin Luo, Jiajun Cao, Hao Liang, Ying Chen, Qi She, Shanghang Zhang, Wentao Zhang

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);VLM(abstract);visual question answering(abstract)

Comments I sincerely apologize for any inconvenience caused. We actually uploaded this paper to arXiv in November 2024, as arXiv:2411.11706. During this update, we did not consider the replacement operation of arXiv, which led to duplicate submissions. We have made modifications at the original address arXiv:2411.11706

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12466 2026-07-16 cs.CV cs.AI cs.LG 版本更新 91%

Inverse-LLaVA: Rethinking Multimodal Alignment via Text-to-Vision Mapping

Inverse-LLaVA:通过文本到视觉映射重新思考多模态对齐

Xuhui Zhan, Tyler Derr

专题命中 VLM训练与架构 :LLaVA(title,title_cn);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究重新审视多模态学习中传统映射方向,提出Inverse-LLaVA架构,通过文本到视觉映射反转方向。该架构无需对齐预训练,在多模态基准测试中展现强大学习效率,为多模态架构设计开辟新方向,解耦表示结构与监督方式。

Comments 19pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23747 2026-05-20 cs.CV cs.AI cs.LG 91%

Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence

Spatial-MLLM: 提升基于视觉的空域智能的MLLM能力

Diankun Wu, Fangfu Liu, Yi-Hsin Hung, Yueqi Duan

机构 * Tsinghua University(清华大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Spatial-MLLM,一种基于纯2D观测的视觉空域推理框架,通过双编码器架构和空间感知帧采样策略提升空域理解能力,实验表明其在多种视觉空域任务中达到SOTA性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08240 2026-08-12 cs.CV cs.AI 版本更新 91%

Hybrid Token Compression for Vision-Language Models

HybridToken-VLM:用于视觉-语言模型的混合令牌压缩

Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Princeton University(普林斯顿大学) Snap Inc(Snap公司)

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 HybridToken-VLM通过混合令牌压缩技术,在保持性能的同时显著提升视觉-语言模型的效率

Comments Accepted at CVPR 2026. Code available at https://github.com/jushengzhang/HybridToken-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12412 2026-06-11 cs.CV cs.AI 新提交 91%

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models

重新路由,而非移除:面向视觉语言模型的可恢复视觉令牌路由

Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Taiwan University(国立台湾大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);MLLM(abstract,comments)

AI总结 针对视觉语言模型中视觉令牌重要性随解码器深度变化的问题,提出无需训练的可恢复路由方法Reroute,将不可逆移除改为可恢复路由,在激进令牌缩减下提升定位能力并保持通用VQA性能。

Comments Code: https://github.com/elmma/mllm-reroute/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11424 2026-08-13 cs.LG cs.CV 新提交 91%

Click2Poly: A VLM for vector mapping buildings and walls

Click2Poly:用于建筑物和墙壁矢量绘制的VLM

Nicolas Girard, Jawher Ben Abdallah, Arno Gobbin, Liuyun Duan, Sacha Lepretre

机构 * LuxCarta

专题命中 VLM训练与架构 :VLM(title,title_cn);vision language model(abstract);分类 cs.CV、cs.LG

AI总结 该研究提出基于Florence-2 VLM的人在环AI助手Click2Poly,以QGIS插件形式实现,可响应用户点击编辑矢量层,加快建筑物和墙壁矢量绘制的手动编辑流程。

Journal ref IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04548 2026-08-06 cs.LG cs.AI 新提交 91%

A Model Merging Approach for Continual MLLM Unlearning

面向持续多模态大语言模型(MLLM)遗忘的模型合并方法

Yuhang Wang, Linlin Zhang, Haoxuan Ji, Xianmin Ye, Zhenxing Niu, Haichang Gao

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有MLLM遗忘方法无法应对持续场景的问题,本文提出MCU方法,通过动态合并遗忘适配器缓解跨任务依赖的干扰,在多个基准测试中实现了更优的遗忘效果与知识保留。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27332 2026-05-27 cs.SE cs.AI cs.CV 91%

EdgeFlow: Edge-Map Augmented VLM-Based Flowchart Processing for Industrial Requirements Engineering

EdgeFlow: 基于边缘图增强的VLM流程图处理用于工业需求工程

Zhifei Dou, Shabnam Hassani, Ou Wei

机构 * Huawei Research Canada(华为加拿大研究)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 提出EdgeFlow方法,通过向视觉语言模型(VLM)输入添加Canny边缘图作为结构先验,无需训练数据或微调即可提升流程图到Mermaid代码的转换精度,在工业数据集上节点F1提升17.39%,边F1提升16.94%。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏