arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-15 至 2026-04-15 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 12 篇

2604.12119 2026-04-15 cs.CV cs.LG 89%

Beyond Perception Errors: Semantic Fixation in Large Vision-Language Models

超越感知误差:大型视觉-语言模型中的语义固定

Md Tanvirul Alam

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 研究发现大型视觉-语言模型在面对提示指定的替代映射时,倾向于保留默认解释,通过VLM-Fix基准测试揭示了语义固定现象,且通过训练和激活调整可部分修复误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12767 2026-04-15 cs.CV cs.AI 86%

CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models

CLASP:面向多模态大语言模型的类适应层融合与双阶段剪枝

Yunkai Dang, Yizhu Jiang, Yifan Jiang, Qi Fan, Yinghuan Shi, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence Science and Technology(人工智能科学与技术学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 CLASP通过类适应层融合和双阶段剪枝,实现多模态大语言模型中视觉token的高效减少,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19820 2026-04-15 cs.CV cs.AI cs.CL cs.LG 86%

CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception

CropVLM: 为细粒度视觉语言感知学习动态聚焦

Miguel Carvalho, Helder Dias, Bruno Martins

机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 CropVLM通过强化学习提升VLM在细粒度图像理解任务中的性能,无需人工标注或合成数据,有效增强模型对细节的捕捉能力。

Comments Accepted to the GRAIL-V Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12537 2026-04-15 cs.CV cs.AI 81%

MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models

MODIX:一种无需训练的多模态信息驱动的位置索引缩放

Ruoxiang Huang, Zhen Yuan

机构 * Peking University(北京大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 MODIX通过动态调整位置步长,基于模态特定贡献优化多模态模型的位置编码,提升多模态推理能力。

Comments Accepted by CVPR 2026 (Highlight). 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05546 2026-04-15 cs.CL 78%

Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects

大型视觉-语言模型高效推理:瓶颈、技术与前景

Jun Zhang, Yicheng Ji, Feiyang Ren, Yihang Li, Bowen Zeng, Zonghao Chen, Ke Chen, Lidan Shou, Gang Chen, Huan Li

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract)

AI总结 本文系统分析了大型视觉-语言模型推理中的效率瓶颈,提出基于推理生命周期的分类技术,探讨了信息密度、长上下文注意力管理和内存限制的平衡,并展望了未来四个前沿方向。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11868 2026-04-15 cs.CV 77%

MedConcept: Unsupervised Concept Discovery for Interpretability in Medical VLMs

MedConcept: 医学视觉语言模型中的无监督概念发现以实现可解释性

Md Rakibul Haque, KM Arefeen Sultan, Tushar Kataria, Shireen Elhabian

机构 * Kahlert School of Computing, University of Utah Scientific Computing(犹他大学计算学校科学计算) Imaging Institute, University of Utah(犹他大学影像研究所)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 MedConcept通过无监督方法发现医学VLMs中的潜在概念,并利用临床可验证的文本语义进行解释,提供定量评估协议和三个概念评分以评估模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13021 2026-04-15 cs.CV cs.AI 76%

Representation geometry shapes task performance in vision-language modeling for CT enterography

表征几何形状任务性能在CT结肠镜视觉-语言建模中的作用

Cristian Minoccheri, Emily Wittrup, Kayvan Najarian, Ryan Stidham

机构 * Gilbert S. Omenn Department of Computational Medicine and Bioinformatics(Gilbert S. Omenn 计算医学与生物信息学部门) Department of Gastroenterology(消化内科部门) Department of Emergency Medicine(急诊医学部门) Department of Electrical Engineering and Computer Science(电气工程与计算机科学部门)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 本文研究了CT结肠镜视觉-语言迁移学习,发现均值池化在疾病分类中表现更优,而注意力池化在跨模态检索中更有效,同时指出单片组织对比度比空间覆盖范围更重要,为构建体积医学影像视觉-语言系统提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11964 2026-04-15 cs.HC cs.MM 75%

When Drawing Is Not Enough: Exploring Spontaneous Speech with Sketch for Intent Alignment in Multimodal LLMs

当绘画不够时:探索通过草图进行意图对齐的自发性言语在多模态大语言模型中的应用

Weiyan Shi, Dorien Herremans, Kenny Tsu Wei Choo

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 本文探讨了在多模态大语言模型中,通过草图与自发性言语的结合来提升设计初期意图对齐的效果,通过实验表明加入自发性言语能显著提高生成图像的意图匹配度。

Comments Accepted at DIS 2026 PWiP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00655 2026-04-15 cs.CV 57%

Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding

Mema:增强视觉-语言理解的内存增强适配器

Ying Liu, Yudong Han, Kean Shi, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Yangtze Delta Region Academy of Beijing Institude of Technology(北京理工大学长江三角洲地区研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Mema适配器,通过维护状态记忆积累层次视觉表示,提升多模态理解性能,实验验证其在复杂任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12403 2026-04-15 cs.CV 57%

Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning

双模锚引导过滤用于测试时提示微调

Jungwon Choi, Eunwoo Kim

机构 * School of Computer Science and Engineering, Chung-Ang University(Chung-Ang大学计算机科学与工程学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出双模锚引导框架,通过语义证据指导视图选择,结合文本和图像锚点进行过滤和集成,提升测试时提示微调的鲁棒性。

Comments Accepted by CVPR 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12012 2026-04-15 cs.CV 57%

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

TIPSv2:通过增强的补丁-文本对齐推进视觉-语言预训练

Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, André Araujo

机构 * Google(谷歌) DeepMind(深度Mind)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出TIPSv2,通过改进的预训练方法提升视觉-语言模型的补丁-文本对齐能力,实验表明其在多种任务和数据集上表现优异。

Comments CVPR2026 camera-ready + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12179 2026-04-15 cs.CL cs.IR 50%

AgenticAI-DialogGen: Topic-Guided Conversation Generation for Fine-Tuning and Evaluating Short- and Long-Term Memories of LLMs

AgenticAI-DialogGen:基于主题引导的对话生成用于微调和评估LLM的短期和长期记忆

Manoj Madushanka Perera, Adnan Mahmood, Kasun Eranda Wijethilake, Quan Z. Sheng

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出AgenticAI-DialogGen框架,通过生成基于角色和主题的对话来微调和评估LLM的短期和长期记忆,引入了TopicGuidedChat数据集以提升对话质量和模型性能。

Comments 13 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏