arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5039 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5039 篇

2412.11475 2026-07-21 cs.CV 版本更新 79%

OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference

OmniVLM:一种用于高效设备端推理的令牌压缩、参数少于十亿的视觉语言模型

Wei Chen, Zhiyuan Li, Shuo Xin

机构 * Nexa AI

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究提出OmniVLM视觉语言模型,通过令牌压缩机制减少计算开销,经多阶段训练匹配更大模型性能。在多基准测试中优于现有基线,在笔记本电脑上实证显示速度提升,能在边缘设备高效部署,模型权重可在huggingface获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14966 2026-07-17 cs.CV 新提交 79%

U-shaped Multi-granularity Learning for Vision-Language Models

用于视觉语言模型的U形多粒度学习

Biao Chen, Yunqian Yu, Xiangxu Zhao, Zhongshu Chen, Mengmeng Jing, Lin Zuo

机构 * University of Electronic Science and Technology of China(电子科技大学) Hithink Research(恒生电子股份有限公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究视觉语言模型提示学习的粒度困境,提出U形多粒度提示学习框架UPrompt,通过构建并行多粒度表示及粗细粒度交互增强与监督,在多个基准实验中验证了其有效性和优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24566 2026-07-17 cs.CV 版本更新 79%

TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models

TokenSwap:对大型视觉语言模型组合理解的后门攻击

Zhifang Zhang, Qiqi Tao, Jiaqi Lv, Na Zhao, Lei Feng, Joey Tianyi Zhou

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) School of Electrical Engineering and Computer Science, University of Queensland, Australia(昆士兰大学电气工程与计算机科学学院) Design Pillar, Singapore University of Technology and Design(新加坡科技设计大学设计学院) Centre for Frontier AI Research (CFAR), Agency for Science, Technology and Research (A*STAR), Singapore(前沿人工智能研究中心(CFAR)) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC))

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对大型视觉语言模型的后门攻击,提出TokenSwap方法,通过注入视觉触发器和交换文本答案中关键令牌语法角色,并采用自适应加权损失,在多基准和不同架构上实现高成功率且隐蔽性强的后门攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13500 2026-07-16 cs.CV 新提交 79%

Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models

用于高效视觉语言模型的无注意力轻量级令牌约简

Xuanyi Hao, Zuoyuan Zhang, Zhibo Wang, Xiaoyi Pang, Jiahui Hu, Jiacheng Du, Shuguo Zhuo

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉语言模型在边缘设备部署难的问题,提出无注意力轻量级令牌约简框架,通过基于熵的准则估计令牌重要性,引入一致性信号确保视觉覆盖,经实验验证该框架在精度和效率权衡上表现出色。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08029 2026-07-10 cs.LG 新提交 79%

Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment

重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署

Hyeju Shin, Chorwon Kim, Ryangsoo Kim, Hark Yoo, Jaein Kim

专题命中 VLM训练与架构 :VLM(title);vision language model(abstract);分类 cs.LG

AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。

Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06185 2026-07-08 cs.CV 新提交 79%

Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition

用于细粒度图像识别的视觉语言模型中的结构化压缩提示调优

Xinda Liu, Qinyu Zhang, Weiqing Min, Guohua Geng, Shuqiang Jiang

机构 * School of Information Science and Technology, Northwest University(西北大学信息科学与技术学院) Laboratory of Intelligent Information Processing, Institute of Computing Technology(中国科学院计算技术研究所智能信息处理重点实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对细粒度图像识别中视觉语言模型捕捉细微差别能力有限的问题,提出结构化压缩提示调优(SCPT),通过语义关系编码和语义压缩损失增强语义结构建模,在多基准实验中有效减轻语义模糊性,取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01908 2026-07-03 cs.CV 新提交 79%

Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports

迈向真实世界超声理解:基于多图像检查与长文本报告的大规模视觉语言模型

Bingcong Yan, Chunlei Li, Jingliang Hu, Yilei Shi, Xiao Xiang Zhu, Lichao Mou

机构 * MedAI Technology (Wuxi) Co. Ltd.(MedAI科技(无锡)有限公司) Technical University of Munich(慕尼黑工业大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 通过构建150万次真实超声检查的大规模数据集(含1770万图像和多器官覆盖),采用标准视觉语言模型结合低秩适配微调,无需复杂架构即实现多任务超声理解性能领先。

Comments Project Page: https://medai-t.github.io/LUMI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28266 2026-06-29 cs.CV 新提交 79%

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

RSICCLLM:用于遥感图像变化描述的多模态大语言模型

Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) Great Bay University, Dongguan, China(东莞Great Bay大学,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国) Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)

专题命中 VLM训练与架构 :multimodal large language model(title);vision-language model(abstract);分类 cs.CV

AI总结 提出首个针对遥感图像变化描述任务的大视觉语言模型后训练框架RSICCLLM,通过数据生成范式、差异感知微调和双负偏好优化,仅7B参数即超越更大规模模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20196 2026-06-29 cs.AI 版本更新 79%

Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning

面向选择性多模态大语言模型遗忘的良性记忆遗忘

Zhen Zeng, Leijiang Gu, Zhangling Duan, Feng Li, Cees G. M. Snoek, Meng Wang, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型隐私泄露问题,提出S-MLLMUn Bench基准和SMFA框架,实现精确删除敏感知识同时保持模型基础能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24156 2026-06-24 cs.CV 新提交 79%

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

利用先验校正的令牌缩减加速多模态大语言模型

Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 提出PriorTR方法,通过分离任务条件注意力与模型先验注意力,在单次前向传播中估计先验并校正令牌重要性,实现无训练令牌缩减,提升多模态大语言模型效率与准确性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15098 2026-06-23 cs.CV 版本更新 79%

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models

基于离散扩散的多模态大语言模型中视觉标记冗余的综合研究

Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * CCDS, NTU, Singapore(南洋理工大学新加坡分校) CCST, ZJUT, China(浙江工业大学中国分校) Terminus AI Lab, UCAS, China(中国科学院大学人工智能实验室)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本研究系统分析了离散扩散多模态大语言模型中视觉标记冗余的演化规律,发现其仅出现在从头训练的模型处理长答案任务时,并验证了视觉标记剪枝会导致信息损失,而层跳过和渐进剪枝分别适用于不同架构的加速。

Comments Accepted by CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 2823-2833

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19944 2026-06-19 cs.CV 新提交 79%

Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models

Timage: 一种用于微调视觉语言模型的文本嵌入图像生成范式

Yifeng Wu, Huimin Huang, Ruiluo Wu, Chunyi Lin, Guanhua Chen, Xian Wu, Wang Song, Ruize Han

机构 * Fudan University(复旦大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Tencent Jarvis Lab(腾讯贾维斯实验室) Southern University of Science and Technology(南方科技大学)

专题命中 VLM训练与架构 :vision-language model(title);multimodal large language model(abstract);分类 cs.CV

AI总结 提出Timage范式,通过约束薛定谔桥将查询文本作为排版覆盖层嵌入图像,以显式空间锚点引导模型关注,在不侵蚀骨干能力前提下提升细粒度空间推理性能。

Comments ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19062 2026-06-18 cs.CV 新提交 79%

DREAM: Extending Vision-Language Models with Dual-Objective Encoding for Cross-Modal Retrieval

DREAM: 通过双目标编码扩展视觉-语言模型用于跨模态检索

Kaleem Ullah, Altaf Hussain, Muhammad Munsif, Sung Wook Baik

机构 * Sejong University(世宗大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) Ulsan National Institute of Science and Technology(乌山国立科学研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出DREAM模型,通过双路径表示增强与对齐,结合层级视觉编码器和混合语言建模,在视频检索任务中实现新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17410 2026-06-17 cs.CV 新提交 79%

Attention Alignment Between Humans and Vision-Language Models

人类与视觉语言模型之间的注意力对齐

Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano

机构 * Princeton Neuroscience Institute, Princeton University(普林斯顿大学普林斯顿神经科学研究所) Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Department of Psychology and Center for Computational Language Sciences, University of Southern California(南加州大学心理学系与计算语言科学中心) Department of Psychology, Université de Montréal(蒙特利尔大学心理学系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究比较了六种视觉语言模型的空间注意力图与人类注视热图,发现解码器架构(LSTM vs Transformer)主导对齐程度,LSTM解码器对齐度更高但空间分散且任务区分度低,而Transformer解码器注意力更集中且任务区分度强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04911 2026-06-04 cs.CV cs.CL 79%

BreastGPT: A Multimodal Large Language Model for the Full Spectrum of Breast Cancer Clinical Routine

BreastGPT: 面向乳腺癌临床全流程的多模态大语言模型

Yang Liu, Jiajin Zhang, Danyang Tu, Yaojun Hu, Jiao Qu, Jiuyu Zhang, Yu Shi, Wei Fang, Shi Gu, Ling Zhang, Yingda Xia

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Zhejiang University(浙江大学) Hupan Lab(华潘实验室) West China Hospital(西京医院) China Medical University(中国医科大学)

专题命中 VLM训练与架构 :multimodal large language model(title);MLLM(abstract);分类 cs.CV

AI总结 提出BreastGPT多模态大语言模型,通过构建工作流对齐的指令语料库BreastStage和双分支视觉编码器,实现乳腺癌筛查、诊断和治疗规划全流程的多模态推理,在BreastStage-Bench上取得75.66%封闭式准确率和89.92%开放式得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26292 2026-06-02 cs.CV cs.CL 79%

Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning

Evi-Steer:通过高效且可泛化的证据调优学习引导生物医学视觉-语言模型

Taha Koleilat, Hassan Rivaz, Yiming Xiao

机构 * Concordia University(康科迪亚大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出Evi-Steer框架,通过证据跨模态低维引导实现BiomedCLIP的不确定性感知参数高效微调,仅更新0.11%参数,在15个生物医学数据集上少样本学习和域泛化设置中优于现有方法。

Comments MICCAI 2026 Early Accept; Project Page: https://tahakoleilat.github.io/Evi-Steer. This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution will be published as part of the MICCAI 2026 proceedings in October

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22276 2026-06-02 cs.CV cs.CL 79%

WAON: A Large-Scale Japanese Image-Text Dataset for Cultural Adaptation in Contrastive Vision-Language Models

WAON:用于对比视觉语言模型文化适应的大规模日语图像-文本数据集

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Yasuo Okabe, Naoaki Okazaki

机构 * Kyoto University(京都大学) NII LLMC(日本国家研究所语言模型中心) NII(日本国家研究所) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出WAON,一个从Common Crawl构建的包含约1.55亿样本的最大公开原生日语图像-文本数据集,并通过微调实验证明其在日语文化基准上优于翻译数据。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06033 2026-06-02 cs.LG 79%

Can Vision Language Models Learn Intuitive Physics from Interaction?

视觉语言模型能否从交互中学习直观物理?

Luca M. Schulze Buschoff, Konstantinos Voudouris, Can Demircan, Eric Schulz

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.LG

AI总结 研究通过强化学习与环境交互训练视觉语言模型,发现交互学习能提升任务内性能,但无法产生可泛化的物理直觉。

Comments Updated accepted version for ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07617 2026-06-02 cs.CV 79%

Scaling Pre-training to One Hundred Billion Data for Vision Language Models

将视觉语言模型的预训练扩展到一千亿数据

Xiao Wang, Ibrahim Alabdulmohsin, Daniel Salz, Zhe Li, Keran Rong, Xiaohua Zhai

机构 * Google DeepMind(谷歌DeepMind)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文通过实验探究将视觉语言模型预训练数据扩展到一千亿规模的效果,发现传统基准性能饱和,但文化多样性任务和低资源语言受益显著,并指出质量过滤可能减少文化多样性。

Comments v2: CVPR Findings'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07135 2026-06-01 cs.CV 79%

Few-Shot Adaptation Benchmark for Remote Sensing Vision-Language Models

遥感视觉语言模型的少样本适应基准

Karim El Khoury, Maxime Zanella, Christophe De Vleeschouwer, Benoit Macq

机构 * UCLouvain(乌尔特-洛文大学) UMons(蒙斯大学) Fonds de la Recherche Scientifique(科学基金组织)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出首个遥感视觉语言模型少样本适应基准,通过十个数据集和五种策略评估三个模型,发现零样本性能相似的模型在少样本适应下表现差异显著,需开发更鲁棒的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27678 2026-05-28 cs.LG cs.DC 79%

Heterogeneous Parallelism for Multimodal Large Language Model Training

多模态大语言模型训练的异构并行

Yashaswi Karnati, Kamran Jafari, Akash Mehra, Li Ding, Pranav Prashant Thombre, Ali Roshan Ghias, Shifang Xu, Parth Mannan, Yu Yao, Hao Wu, Eric Harper, Ashwath Aithal, Nima Tajbakhsh

机构 * NVIDIA

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.LG

AI总结 针对多模态大语言模型训练中单一LLM中心并行布局导致的吞吐量瓶颈,提出异构并行抽象,允许各模块独立布局和放置,并通过边界通信器实现张量语义保持,实验表明可提升TFLOPS/GPU最高49.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26601 2026-05-27 cs.CV 79%

FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

FTibSuite:面向藏语视觉语言建模的综合资源套件

Guixian Xu, Yide Liang, Zeli Su, Xuexian Song, Ziyin Zhang, Yushuang Dong, Ting Zhang, Xu Han

机构 * Hainan International College, Minzu University of China(民族大学海南国际学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对藏语视觉语言建模缺乏可复现训练和评估基础设施的问题,提出FTibSuite资源套件,包含数据集FTibData、基准FTibBench和基线模型FTibVLM,在多项任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21924 2026-05-22 cs.CV 79%

Visual-Advantage On-Policy Distillation for Vision-Language Models

基于视觉优势的在线策略蒸馏用于视觉-语言模型

Ruiqi Liu, Xiaolei Lv, Gengsheng Li, Ximo Zhu, Zhiheng Wang, Zhengbo Zhang, Junkai Chen, Zhiheng Li, Bo Li, Jun Gao, Shu Wu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学(UCAS)先进交叉学科学院) Hello Group Inc.(Hello集团有限公司) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于视觉优势的在线策略蒸馏方法,用于提升视觉-语言模型对视觉输入的依赖性,通过引入视觉优势指标来区分关键视觉token与语言token,从而提高蒸馏效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19301 2026-05-20 cs.CV 79%

iGSP:Implicit Gradient Subspace Projection for Efficient Continual Learning of Vision-Language Models

iGSP:隐式梯度子空间投影用于高效视觉-语言模型的持续学习

Xuezhi Cui, Dongbo Zhou, Wang Guo, Zeyuan Wang, Ziyu Li, Gaozhi Zhou, Xian Li, Ling Zhao, Wentao Yang, Chao Tao, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(地球科学与空间信息工程学院,湖南科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出iGSP框架,通过隐式梯度子空间投影实现视觉-语言模型的高效持续学习,解决了传统方法在参数效率和任务间对齐一致性上的不足,显著提升了训练效率和知识重用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11716 2026-05-13 cs.AI 79%

SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models

SafeSteer: 多模态大语言模型中的解码级防御机制

Xinyi Zeng, Xue Yang, Jingyuan Zhang, Huanqian Yan, Xiang Chen, Kaiwen Wei, Hankun Kang, Yu Tian

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Chongqing University(重庆大学) Wuhan University(武汉大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27715 2026-05-01 cs.CV 79%

Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining

通过数据无关的平坦性感知提示预训练提升视觉语言模型测试时提示调优的校准

Hyeonseo Jang, Jaebyeong Jeon, Joong-Won Hwang, Kibok Lee

机构 * Yonsei University(延世大学) ETRI(韩国电子技术研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出FPP框架,通过在提示初始化时选择平坦区域,提升测试时提示调优的校准和性能,无需额外标注数据和计算成本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06033 2026-05-01 cs.CV 79%

Analysis of Blood Report Images Using General Purpose Vision-Language Models

使用通用视觉-语言模型分析血检报告图像

Nadia Bakhsheshi, Hamid Beigy

机构 * Sharif University of Technology(谢里夫理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文探讨了通用视觉-语言模型在自动分析血检报告图像中的应用,通过比较三种模型在100张不同血检图像上的表现,验证了其在初步分析中的潜力。

Comments 4 pages , 3 figures , This paper has been submitted to the IEEE-affiliated ICBME Conference (Iran), 2025, and is currently under review. DOR number: [20.1001.2.0425023682.1404.10.1.440.7]

Journal ref Proc. 2025 32nd ICBME, IEEE, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23950 2026-04-28 cs.CV 79%

LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models

LearnPruner: 重新思考基于注意力的视觉语言模型中令牌修剪

Rinyoichi Takezoe, Yaqian Li, Zihao Bo, Anzhou Hou, Mo Guang, Kaiwen Long

机构 * Li Auto Inc.(利自动公司)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出LearnPruner,通过两阶段令牌修剪框架在视觉语言模型中实现高效修剪,保留95%性能的同时减少5.5%视觉令牌使用,提升3.2倍推理速度。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23733 2026-04-23 cs.CL cs.CV 79%

AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization

AdaMMS: 为异构多模态大语言模型设计的模型融合方法

Yiyang Du, Xiaochen Wang, Chi Chen, Jiabo Ye, Yiru Wang, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Zhifang Sui, Maosong Sun, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学) School of Software Microelectronics, Peking University(软件微电子学院,北京大学) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国) ModelTC Open Source Organization, Beijing, China(ModelTC开源组织,北京,中国)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出AdaMMS,一种针对异构多模态大语言模型的模型融合方法,通过映射、融合和搜索三个步骤解决异构模型融合难题,无需标注数据即可在视觉语言基准测试中超越现有方法。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18075 2026-04-21 cs.CV 79%

Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weighting

通过动态前缀加权增强视觉-语言模型的持续学习

Hyeonseo Jang, Hyuk Kwon, Kibok Lee

机构 * Yonsei University(延世大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出动态前缀加权框架,通过动态调整前缀权重和适配器机制,提升视觉-语言模型在领域-类别增量学习中的性能。

Comments CVPR 2026; revised text and figures for improved readability

详情

展开后加载摘要…

URL PDF HTML 收藏