arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5009 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5009 篇

2605.19218 2026-05-20 cs.CV cs.AI 86%

Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference

旋转对齐的关键通道剪枝用于高效的视觉-语言模型推理

Beomseok Kang, Dongwon Jo, Jiwon Song, Donghwee Son, Jae-Joon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出旋转对齐的关键通道剪枝方法,通过压缩通道维度在固定KV缓存预算下保留更多视觉token,解决传统token剪枝在细粒度感知任务中的性能下降问题,同时提升解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06038 2026-05-19 cs.CV cs.AI 86%

Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models

Fourier Compressor: 频域视觉令牌压缩用于视觉-语言模型

Huanyu Wang, Jushi Kai, Haoli Bai, Lu Hou, Bo Jiang, Ziwei He, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Noah’s Ark Lab(诺亚实验室) Huawei Technologies Ltd.(华为技术有限公司) School of Computer Science(计算机科学学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于频域的视觉令牌压缩策略,通过傅里叶变换减少计算开销并提升效率,同时保持语义准确性,实验表明其在图像和视频任务中均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17341 2026-05-19 cs.CV cs.AI 86%

Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment

通过跨模态语义对齐实现面向视觉-语言模型的单样本黑盒成员推断攻击

Jiaqing Li, Yajuan Lu, Xiaochuan Shi, Gang Wu, ZhongYuan Wang, Chao Liang

机构 * Wuhan University(武汉大学) Tarim University(塔里木大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于跨模态语义对齐的新型成员推断攻击框架,针对视觉-语言模型在单样本和黑盒场景下的数据安全风险进行评估,通过量化联合嵌入空间中的对齐程度,显著提升了攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16439 2026-05-19 cs.CV cs.AI 86%

KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy

KVCapsule: 用于视觉-语言模型的高效序列KV缓存压缩方法:不对称冗余

Yingbing Huang, Tharun Adithya Srikrishnan, Steven K. Reinhardt, Deming Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出KVCapsule,一种针对视觉语言模型的KV缓存压缩框架,通过轻量压缩和重建组件实现内存节省,提升吞吐量并减少内存占用,同时保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12574 2026-05-14 cs.CV cs.AI 86%

DistractMIA: Black-Box Membership Inference on Vision-Language Models via Semantic Distraction

DistractMIA: 通过语义干扰在视觉语言模型上进行黑盒成员推断

Hongyi Tang, Zhihao Zhu, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对部署的视觉语言模型成员推断难题,提出DistractMIA框架,通过语义干扰技术在仅观察生成文本响应的情况下,有效区分成员与非成员样本,优于现有基线方法。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08800 2026-05-12 cs.CV cs.AI 86%

PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models

PPU-Bench: 用于视觉语言模型个性化部分遗忘的现实世界基准

Jiahui Guang, Zexun Zhan, Zhenlin Xu, Cuiyun Gao, Haiyan Wang, Jing Li, Zhaoquan Gu, Yanchun Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) Zhejiang Normal University(浙江师范大学)

专题命中 VLM训练与架构 :vision language model(title);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PPU-Bench,一个无需微调的现实世界基准,用于评估视觉语言模型中个性化部分遗忘的效果,通过24K多模态和单模态样本测试遗忘与保留的平衡及跨模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27953 2026-05-01 cs.AI cs.CV 86%

The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models

视觉提示对视觉语言模型合作行为的影响

Kenneth J. K. Ong

机构 * ST Engineering, Singapore(1 ST工程,新加坡)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文研究了视觉提示如何影响视觉语言模型在囚徒困境中的合作行为,通过图像内容和颜色奖励矩阵实验,发现图像内容和颜色提示对模型决策模式有影响,不同模型的敏感性和缓解效果各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23407 2026-04-28 cs.CV cs.AI 86%

PushupBench: Your VLM is not good at counting pushups

PushupBench: 你的VLM在计数俯卧撑时并不出色

Shengzhi Li, Jiarun Chen, Karun Sharma, Jiaqi Su, Shichao Pei

机构 * Shengzhi Li(李盛之) Jiarun Chen(陈佳润) Karun Sharma(Sharma 卡鲁恩) Jiaqi Su(苏佳琦) Shichao Pei(裴世超)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 PushupBench通过446个长视频片段评估重复计数任务,发现最佳模型准确率仅42.1%,开源模型表现更差,表明计数能力反映更广泛的时序推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23079 2026-04-28 cs.CV cs.AI 86%

From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models

从像素到解释:结合CNN-Transformer集成、视觉可解释性和视觉语言模型的可解释性糖尿病视网膜病变分级

Pir Bakhsh Khokhar, Carmine Gravino, Fabio Palomba, Sule Yildirim Yayilgan, Sarang Shaikh

机构 * Department of Informatics, University of Salerno(萨勒诺大学信息学院) Department of Information Security and Communication Technology (IIK), Norwegian University of Science and Technology(挪威科技大学信息安全部)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出结合强判别模型与多模态解释的方法,利用APTOS 2019基准评估六种CNN和Transformer模型,通过集成策略提升分级一致性,并利用视觉语言模型生成可解释的视网膜病变分级结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19839 2026-04-23 cs.CV cs.AI 86%

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17087 2026-04-21 cs.CV cs.LG 86%

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling

EvoComp: 通过语义引导的进化标注学习多模态大语言模型的视觉令牌压缩

Jiafei Song, Fengwei Zhou, Jin Qu, Wenjin Jason Li, Tong Wu, Gengjian Xue, Zhikang Zhao, Daomin Wei, Yichao Lu, Bailin Na

机构 * OPPO CTG

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出EvoComp框架,通过语义引导的进化标注策略,有效压缩视觉令牌数量,同时保持任务精度,实验显示在3倍压缩下保持99.3%的准确率,并在移动设备上提升1.6倍速度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12767 2026-04-15 cs.CV cs.AI 86%

CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models

CLASP:面向多模态大语言模型的类适应层融合与双阶段剪枝

Yunkai Dang, Yizhu Jiang, Yifan Jiang, Qi Fan, Yinghuan Shi, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence Science and Technology(人工智能科学与技术学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 CLASP通过类适应层融合和双阶段剪枝,实现多模态大语言模型中视觉token的高效减少,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09841 2026-04-14 cs.CV cs.AI 86%

Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models

还有可以提取的知识吗?医学微调视觉语言模型中的脆弱性证据

Oliver McLaughlin, Daniel Shubin, Carsten Eickhoff, Ritambhara Singh, William Rudman, Michal Golovanevsky

机构 * Brown University(布朗大学) University of Washington(华盛顿大学) University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 研究评估了四个医学微调的视觉语言模型在四个医学影像任务中的表现,发现任务难度增加时性能下降至接近随机水平,表明临床推理有限,医学微调无明显优势,模型对提示词敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02816 2026-04-06 cs.CV cs.AI 86%

QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models

QAPruner: 量化感知的多模态大语言模型视觉标记剪枝

Xinhao Wang, Zhonyu Xia, Zhiwei Lin, Zhe Li, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出QAPruner框架,通过结合量化误差模拟与异常强度指标,实现多模态大语言模型的视觉标记剪枝与后训练量化联合优化,提升低比特下的推理精度。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18795 2026-03-20 cs.CV cs.AI 86%

Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation

Perceptio:通过空间标记生成增强视觉语言模型

Yuchen Li, Amanmeet Garg, Shalini Chaudhuri, Rui Zhao, Garin Kessler

机构 * Amazon(亚马逊)

专题命中 VLM训练与架构 :vision language model(title,abstract);InternVL(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 Perceptio通过生成2D和3D空间标记提升视觉语言模型的空间推理能力,结合语义分割和深度标记实现更精确的空间理解,提升多个基准测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22469 2026-03-05 cs.CV cs.AI 86%

Beyond Dominant Patches: Spatial Credit Redistribution For Grounded Vision-Language Models

超越主导块:面向 grounded 视觉-语言模型的空间信用再分配

Niamul Hassan Samin, Md Arifur Rahman, Abdullah Ibne Hanif Arean, Juena Ahmed Noshin, Md Ashikur Rahman

机构 * The KOW Company(KOW公司) American International University Bangladesh (AIUB)(美国国际大学(Bangladesh)) University of Dhaka(达卡大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SCR方法,通过空间信用再分配减少视觉-语言模型的幻觉问题,提升生成质量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04217 2026-02-03 cs.LG cs.AI 86%

MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering

MLLMEraser: 通过激活引导在多模态大语言模型中实现测试时遗忘

Chenlu Ding, Jiancan Wu, Leheng Sheng, Fan Zhang, Yancheng Yuan, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学) Huawei(华为)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 MLLMEraser通过激活引导实现多模态大语言模型的测试时遗忘,无需训练且有效降低计算成本,同时保持保留知识的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03229 2026-01-30 cs.CV cs.AI 86%

Bridging Weakly-Supervised Learning and VLM Distillation: Noisy Partial Label Learning for Efficient Downstream Adaptation

弥合弱监督学习与VLM知识蒸馏:面向高效下游适应的噪声部分标签学习

Qian-Wei Wang, Yaguang Song, Shu-Tao Xia

机构 * Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出协同一致性正则化框架,通过协同伪标签机制和抗过拟合策略,提升预训练VLMs在噪声部分标签下的下游适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17793 2025-11-25 cs.CV cs.LG 86%

Attention Guided Alignment in Efficient Vision-Language Models

注意力引导的高效视觉-语言模型

Shweta Mahajan, Hoang Le, Hyojin Park, Farzad Farhadzadeh, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出AGE-VLM,通过交错交叉注意力层和空间知识提取,减少高效视觉-语言模型中的幻觉问题。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01588 2025-11-24 cs.LG cs.CV 86%

Explore More, Learn Better: Parallel MLLM Embeddings under Mutual Information Minimization

探索更多,学习更好:基于互信息最小化的并行 MLLM 嵌入

Zhicheng Wang, Chen Ju, Xu Chen, Shuai Xiao, Jinsong Lan, Xiaoyong Zhu, Ying Chen, Zhiguo Cao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出基于互信息最小化的并行解耦框架,通过多条并行路径提升多模态嵌入质量,实现高效且鲁棒的嵌入空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21794 2025-10-28 cs.CV cs.AI 86%

Token-Level Inference-Time Alignment for Vision-Language Models

Kejia Chen, Jiawen Zhang, Jiacong Hu, Kewei Gao, Jian Lou, Zunlei Feng, Mingli Song

机构 * Zhejiang University(浙江大学) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06073 2025-10-21 cs.CL cs.AI cs.CV 86%

GEM: Empowering MLLM for Grounded ECG Understanding with Time Series and Images

Xiang Lan, Feng Wu, Kai He, Qinghao Zhao, Shenda Hong, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Peking University People’s Hospital(北京大学人民医院) Peking University(北京大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2025 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17391 2025-10-01 cs.CV cs.AI cs.CL 86%

LFTR: Learning-Free Token Reduction for Multimodal Large Language Models

Zihui Zhao, Yingxin Li, Yang Li

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11815 2025-09-23 cs.CV cs.AI 86%

SpecVLM: Fast Speculative Decoding in Vision-Language Models

Haiduo Huang, Fuwei Yang, Zhenhua Liu, Xuanwu Yin, Dong Li, Pengju Ren, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00676 2025-09-03 cs.CV cs.LG 86%

LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model

Xiyao Wang, Chunyuan Li, Jianwei Yang, Kai Zhang, Bo Liu, Tianyi Xiong, Furong Huang

机构 * University of Maryland College Park(马里兰大学 College Park 分校) The Ohio State University(俄亥俄州立大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21732 2025-09-01 cs.CV cs.AI 86%

CAD2DMD-SET: Synthetic Generation Tool of Digital Measurement Device CAD Model Datasets for fine-tuning Large Vision-Language Models

João Valente, Atabak Dehban, Rodrigo Ventura

机构 * Institute for Systems and Robotics(系统与机器人研究所) University of Lisbon(里斯本大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);InternVL(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08525 2025-07-14 cs.CV cs.AI 86%

GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training

Tong Wei, Yijun Yang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye

机构 * Tsinghua University(清华大学) Tencent(腾讯) Peking University(北京大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14260 2025-05-21 cs.CV cs.AI 86%

Speculative Decoding Reimagined for Multimodal Large Language Models

Luxi Lin, Zhihang Lin, Zhanpeng Zeng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室、中华人民共和国教育部、厦门大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07149 2025-04-29 cs.CV cs.LG 86%

Towards Interpreting Visual Information Processing in Vision-Language Models

Clement Neo, Luke Ong, Philip Torr, Mor Geva, David Krueger, Fazl Barez

机构 * Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Tel Aviv University(特拉维夫大学) MILA(蒙特利尔人工智能研究院) ERA-Krueger AI Safety Lab(ERA-Krueger人工智能安全实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21307 2025-03-28 cs.CV cs.AI 86%

InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression

Dongchen Lu, Yuyao Sun, Zilu Zhang, Leping Huang, Jianliang Zeng, Mao Shu, Huo Cao

专题命中 VLM训练与架构 :InternVL(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏