arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-14 至 2026-05-14 共收录 22 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 22 篇

2605.13375 2026-05-14 cs.CV cs.AI 93%

GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models

GRIP-VLM:基于组相对重要性的高效视觉-语言模型压缩

Mingzhe Huang, Weijun Wang, Xin Ding, Liang Mi, Hao Wen, Yuanchun Li, Lichen Pang, Shansong Yang, Yunxin Liu, Ting Cao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Juhaokan Technology Co.,Ltd(极皓科技有限公司) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 GRIP-VLM通过强化学习框架解决视觉语言模型中大规模视觉token处理的计算瓶颈,通过组相对重要性策略优化实现高效压缩,达到15%的推理加速。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11405 2026-05-14 cs.LG 90%

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone

20/20 Vision Language Models: 通过数据整理单独提升VLMs的方案

DatologyAI, :, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Ties Robroek, Tony Jiang, Vidhi Jain, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

机构 * DatologyAI

专题命中 VLM训练与架构 :vision language model(title,title_cn);VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract)

AI总结 本文通过数据整理提升VLMs性能,展示在20个公开基准和DatBench九个能力轴上均取得显著提升,同时提升可靠性、OOD泛化和推理效率。

Comments 33 pages, 15 figures. DatalogyAI website for more details: https://www.datologyai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13047 2026-05-14 cs.CV cs.AI 89%

Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency

通过反事实语义显著性揭示人类与VLM场景感知之间的差距

Ziqi Wen, Parsa Madinei, Miguel P. Eckstein

机构 * Department of Computer Science, University of California, Santa Barbara(加州大学圣巴巴拉分校计算机科学系) Department of Psychological and Brain Sciences, University of California, Santa Barbara(加州大学圣巴巴拉分校心理学与脑科学系)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过反事实语义显著性方法揭示VLM在高阶语义场景理解中与人类感知之间的差距,发现模型过度依赖大物体、图像中心物体和高显著性物体,而对人物依赖程度较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08461 2026-05-14 cs.LG cs.AI cs.CV hep-ex 88%

Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics

为高能物理中的中微子事件分类适应视觉-语言模型

Dikshant Sagar, Kaiwen Yu, Alejandro Yankelevich, Jianming Bian, Pierre Baldi

机构 * Department of Computer Science, University of California, Irvine, CA, USA(计算机科学系,加州大学欧文分校,加州,美国) Department of Physics, University of California, Irvine, CA, USA(物理系,加州大学欧文分校,加州,美国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文探讨了将微调后的LLaMA 3.2应用于中微子事件分类,对比了Transformer架构与CNN在准确性和鲁棒性上的表现,展示了视觉-语言模型在物理事件分类中的潜力。

Comments Accepted for publication in Communications Physics (Nature Portfolio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12574 2026-05-14 cs.CV cs.AI 86%

DistractMIA: Black-Box Membership Inference on Vision-Language Models via Semantic Distraction

DistractMIA: 通过语义干扰在视觉语言模型上进行黑盒成员推断

Hongyi Tang, Zhihao Zhu, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对部署的视觉语言模型成员推断难题,提出DistractMIA框架,通过语义干扰技术在仅观察生成文本响应的情况下,有效区分成员与非成员样本,优于现有基线方法。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11444 2026-05-14 cs.CV 83%

Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts

通过混合频率专家利用多模态大语言模型实现一站式图像修复

Eunho Lee, Rei Kawakami, Youngbae Hwang

机构 * Chungbuk National University(Chungbuk国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种利用多模态大语言模型指导的图像修复框架,通过混合频率专家模块提升对复合退化特征的建模能力,在多个数据集上取得优异效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14129 2026-05-14 cs.CV 83%

PVLM: Parsing-Aware Vision Language Model with Dynamic Contrastive Learning for Zero-Shot Deepfake Attribution

PVLM:面向零样本深度伪造属性识别的解析感知视觉语言模型

Yaning Zhang, Jiahe Zhang, Chunjie Ma, Weili Guan, Tian Gan, Zan Gao

机构 * Faculty of Computer Science and Technology, Qilu University of Technology (Shandong Academy of Sciences)(计算机科学与技术学院,齐鲁工业大学(山东省科学院)) Shandong University of Science and Technology(山东科技大学) Shandong Artificial Intelligence Institute, Qilu University of Technology (Shandong Academy of Sciences)(山东省人工智能研究院,齐鲁工业大学(山东省科学院)) School of Electronics and Information Engineering, Harbin Institute of Technology(电子与信息工程学院,哈尔滨工业大学(深圳)) School of Computer Science and Technology, Shandong University(计算机科学与技术学院,山东大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出PVLM模型,通过动态对比学习实现对未知高级生成器的细粒度追踪,利用面部解析特征捕捉伪造表示,提升深度伪造属性识别性能。

Comments Accepted to IEEE Transactions on Dependable and Secure Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27389 2026-05-14 cs.CV cs.AI 82%

COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

COHERENCE:在交错多模态上下文中细粒度图像-文本对齐的基准测试

Bingli Wang, Huanze Tang, Haijun Lv, Zhishan Lin, Lixin Gu, Lei Feng, Qipeng Guo, Kai Chen

机构 * Southeast University Shanghai AI Laboratory(上海大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 COHERENCE旨在评估MLLM在交错多模态上下文中恢复细粒度图像-文本对应关系的能力,涵盖四个领域,包含6161个高质量问题,并进行六类错误分析以识别当前MLLM的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00990 2026-05-14 cs.RO cs.AI cs.CV 79%

Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations

通过模仿生成视频实现机器人操作

Shivansh Patel, Shraddhaa Mohan, Hanlin Mai, Unnat Jain, Svetlana Lazebnik, Yunzhu Li

机构 * UIUC(伊利诺伊大学香槟分校) UC Irvine(加州大学尔湾分校) Columbia University(哥伦比亚大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RIGVid系统,通过模仿AI生成视频使机器人完成复杂操作任务,无需物理示范或特定机器人训练。系统利用视频扩散模型生成潜在示范视频,并通过视觉语言模型筛选符合指令的视频,再通过6D姿态跟踪器提取轨迹并映射到机器人。实验表明生成视频效果与真实示范相当,且性能随生成质量提升。

Comments In ICLR 2026. Website: https://rigvid-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22123 2026-05-14 cs.CL 78%

Multilingual Vision-Language Models, A Survey

多语言视觉-语言模型:综述

Andrei-Alexandru Manea, Jindřich Libovický

机构 * Faculty of Mathematics and Physics, Charles University, V Holešovičkách 747/2, Prague, Czech Republic(数学与物理系,查尔斯大学,V Holešovičkách 747/2,布拉格,捷克共和国)

专题命中 VLM训练与架构 :vision-language model(title,abstract)

AI总结 本文综述了处理多语言文本和图像的视觉-语言模型,分析了语言中立性与文化意识之间的矛盾,指出对比学习在训练中的主导地位及文化适应性的数据依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13775 2026-05-14 cs.RO cs.CV 77%

RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data

RoboEvolve:用于有限数据的机器人操作共进化规划-模拟器

Harold Haodong Chen, Sirui Chen, Yingjie Xu, Wenhang Ge, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 RoboEvolve通过共进化循环提升机器人操作性能,利用无标签种子图像实现高效数据生成,显著提升规划和模拟效果,同时表现出极高的数据效率和持续学习能力。

Comments On-going work

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13858 2026-05-14 cs.CV 77%

EDITS: Enhancing Dataset Distillation with Implicit Textual Semantics

EDITS: 通过隐式文本语义增强数据集蒸馏

Qianxin Xia, Jiawei Du, Guoming Lu, Zhiyong Shu, Jielei Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Centre for Frontier AI Research, Agency for Science, Technology and Research(前沿人工智能研究中心,科技研究局)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV

AI总结 本文提出EDITS框架,利用图像数据中的隐式文本语义提升数据集蒸馏效果,通过全局语义查询模块融合外部文本与图像特征,结合局部语义意识选择代表性样本构建图像和文本原型,最终通过双原型引导策略生成合成数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09522 2026-05-14 cs.CV cs.AI cs.CL 73%

Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding

重新审视你所见:揭示视觉语义以引导LVLM解码

Beomsik Cho, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 VLM训练与架构 :vision language model(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文通过分析发现视觉token在幻觉中仍提供有效信息,提出ReVisiT方法通过参考视觉token引导LVLM解码,减少计算成本并提升性能。

Comments ACL 2026 Main Conference (Oral). 30 pages, 10 figures. Code: https://github.com/bscho333/ReVisiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12088 2026-05-14 cs.CV 70%

UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation

UniCustom: 多参考图像生成的统一视觉条件化

Yiyan Xu, Qiulin Wang, Wenjie Wang, Yunyao Mao, Xintao Wang, Pengfei Wan, Kun Gai, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 UniCustom通过融合ViT和VAE特征提升多参考图像生成中主体一致性和指令遵循能力,采用两阶段训练策略和槽绑定正则化减少跨参考混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00616 2026-05-14 cs.AI 70%

SPOT: Selective Prompt Projection via Total Variation for Inference-Only Safe Text-to-Image Generation

SPOT:基于总变分的选性提示投影用于仅推理的文本到图像生成

Minhyuk Lee, Hyekyung Yoon, Myungjoo Kang

机构 * Seoul National University(首尔国立大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SPOT框架,通过总变分约束生成器参考分布,实现对文本到图像生成中不安全内容的抑制,同时保持良性提示的行为,实验显示其在多个数据集上显著降低不适当评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02977 2026-05-14 cs.CV cs.AI cs.LG 67%

Aligning Forest and Trees in Images & Long Captions for Visually Grounded Understanding

对图像与长描述中的森林和树木进行对齐以实现视觉基础理解

Byeongju Woo, Zilin Wang, Byeonghyun Pak, Sangwoo Mo, Stella X. Yu

机构 * Agency for Defense Development(国防发展局) University of Michigan(密歇根大学) POSTECH

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出CAFT模型,通过分层视觉语言学习原理,解决长描述中细节丰富的场景理解问题,实现图像与文本的细粒度对齐,取得六个长文本检索基准的最优性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12954 2026-05-14 cs.CV cs.AI 62%

AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding

AdaFocus: 一种基于零缓存回溯的自适应相关性-多样性采样方法以实现高效的长视频理解

Xiao Yang, Yingzhe Ma, Haoxuan Yu, Zixin Li, Ning Qin

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AdaFocus框架,通过自适应相关性-多样性采样和零缓存回溯机制,有效平衡长视频理解中的时间覆盖、视觉细节和计算效率,实验表明其在效率-精度权衡上优于现有方法。

Comments 9 pages, 4 figures. Authors Xiao Yang and Yingzhe Ma contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12684 2026-05-14 cs.CV cs.AI cs.HC 62%

Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty?

视觉审美基准:前沿模型能评判美吗?

Yichen Feng, Yuetai Li, Chunjiang Liu, Yuanyuan Chen, Fengqing Jiang, Yue Huang, Hang Hua, Zhengqing Yuan, Kaiyuan Zheng, Luyao Niu, Bhaskar Ramasubramanian, Basel Alomair, Xiangliang Zhang, Misha Sra, Zichen Chen, Radha Poovendran, Zhangchen Xu

机构 * Bake AI University of Washington(华盛顿大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Stanford University(斯坦福大学) University of Notre Dame(诺丁汉大学) Carnegie Mellon University(卡内基梅隆大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Western Washington University(西雅图华盛顿大学) King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉审美基准(VAB),通过比较选择评估审美,发现前沿模型在判断最佳和最差图像时表现逊于人类专家,表明需进一步改进。

Comments Project page: https://vab.bakelab.ai. Code: https://github.com/BakeLab/Visual-Aesthetic-Benchmark. Dataset: https://huggingface.co/datasets/BakeLab/Visual-Aesthetic-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13835 2026-05-14 cs.CV 57%

Unlocking Patch-Level Features for CLIP-Based Class-Incremental Learning

解锁基于CLIP的类增量学习中的补丁级特征

Hao Sun, Zi-Jun Ding, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SPA方法,通过利用CLIP的补丁级语义信息提升类增量学习性能,通过生成类级语义描述引导补丁特征选择,并利用最优传输对齐语义特征,有效缓解灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13501 2026-05-14 cs.AR cs.LG 57%

Reward-Weighted On-Policy Distillation with an Open Property-Equivalence Verifier for NL-to-SVA Generation

基于开放属性等价验证器的奖励加权在线策略蒸馏用于自然语言到SVA生成

Qingyun Zou, Yingze Li, Tianen Liu, Bingsheng He, Weng-Fai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出RWOPD方法,通过开放属性等价检查器提升SVA生成性能,使模型在多个评估指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10755 2026-05-14 cs.CV 57%

MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark

MMRareBench: 一种罕见疾病多模态和多图像医学基准

Junzhi Ning, Jiashi Lin, Yingying Fang, Wei Li, Jiyao Liu, Cheng Tang, Chenglong Ma, Wenhao Tang, Tianbin Li, Ziyan Huang, Guang Yang, Junjun He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Imperial College London(帝国理工学院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MMRareBench,首个评估多模态和多图像临床能力的罕见疾病基准,包含1756个问题-答案对和7958张医学图像,揭示23个MLLMs在多图像任务中表现低下,存在能力稀释效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12516 2026-05-14 cs.CL cs.AI 57%

Domain Adaptation of Large Language Models for Polymer-Composite Additive Manufacturing Using Retrieval-Augmented Generation and Fine-Tuning

为聚合物-复合材料增材制造领域进行大型语言模型的领域适应:使用检索增强生成与微调

Saiful Islam Sagor, Tania Haghighi, Minhaj Nur Alam, Erina Baynojir Joyee

机构 * Department of Mechanical Engineering and Engineering Science, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校机械工程与工程科学系) Department of Electrical and Computer Engineering, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校电气与计算机工程系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文研究了通过检索增强生成和微调来适应大型语言模型至增材制造领域的方法,发现检索增强生成在准确性和相关性上优于单纯微调。

详情

展开后加载摘要…

URL PDF HTML 收藏