arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5030 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5030 篇

2602.09411 2026-02-11 cs.CV 83%

K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge

K-Sort Eval: 通过校正VLM作为评判者实现视觉生成的高效偏好评估

Zhikai Li, Jiatong Li, Xuewen Liu, Wangbo Zhao, Pan Du, Kaicheng Zhou, Qingyi Gu, Yang You, Zhen Dong, Kurt Keutzer

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 K-Sort Eval通过后验校正和动态匹配策略,实现高效可靠的视觉生成模型偏好评估。

Comments ICLR 2026. Code is available at: https://github.com/zkkli/K-Sort-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15831 2026-02-11 cs.CV 83%

UniFit: Towards Universal Virtual Try-on with MLLM-Guided Semantic Alignment

UniFit: 向基于多模态大语言模型引导的语义对齐的通用虚拟试衣迈进

Wei Zhang, Yeying Jin, Xin Li, Yan Zhang, Xiaofeng Cong, Cong Wang, Fengcai Qiao, zhichao Lian

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 UniFit通过多模态大语言模型引导的语义对齐模块,解决虚拟试衣中语义差距和数据稀缺问题,实现通用且高性能的试衣框架。

Comments accepted to AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04864 2026-02-10 cs.CV 83%

When LLaVA Meets Objects: Token Composition for Vision-Language-Models

当LLaVA遇见物体:用于视觉-语言模型的标记组成

Soumya Jahagirdar, Walid Bousselham, Anna Kukleva, Hilde Kuehne

机构 * Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学院,SIC) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 VLM训练与架构 :LLaVA(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出Mask-LLaVA框架,通过结合多级视觉特征,实现更高效的视觉语言模型,减少标记数量的同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07790 2026-02-10 cs.LG 83%

MaD-Mix: Multi-Modal Data Mixtures via Latent Space Coupling for Vision-Language Model Training

MaD-Mix: 通过潜在空间耦合实现多模态数据混合用于视觉-语言模型训练

Wanyun Xie, Francesco Tonin, Volkan Cevher

机构 * LIONS, EPFL(EPFL 雷奥尼实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.LG

AI总结 MaD-Mix通过潜在空间耦合实现多模态数据混合,提升视觉-语言模型训练效率,减少训练步骤并增强复杂场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22936 2026-02-06 cs.CV 83%

PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models

PPE:用于多模态大语言模型中token压缩的位置保持嵌入

Mouxiao Huang, Borui Jiang, Dehua Zheng, Hailin Hu, Kai Han, Xinghao Chen

机构 * Huawei Technologies(华为技术有限公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 PPE通过保持位置信息提升多模态大语言模型的token压缩效率和性能

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04565 2026-02-05 cs.CV 83%

Understanding Degradation with Vision Language Model

理解视觉退化

Guanzhou Lan, Chenyi Liao, Yuqi Yang, Qianli Ma, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学与电子学(iOPEN)、西北工业大学) Honors College, Northwestern Polytechnical University(荣誉学院、西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Shanghai Jiaotong University(人工智能学院、上海交通大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出DU-VLM模型,通过结构化奖励强化学习解决视觉退化理解问题,引入大规模数据集并实现高保真图像恢复。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04256 2026-02-05 cs.RO cs.AI 83%

AppleVLM: End-to-end Autonomous Driving with Advanced Perception and Planning-Enhanced Vision-Language Models

AppleVLM: 端到端自主驾驶与高级感知和规划增强的视觉语言模型

Yuxuan Han, Kunyuan Wu, Qianyi Shao, Renxiang Xiao, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu, Yunjiang Lou

机构 * Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments(深圳先进运动控制系统与现代自动化装备重点实验室) Guangdong Provincial Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics(广东省智能变形机制与适应机器人省重点实验室) School of Intelligence Science and Engineering(智能科学与工程学院) Harbin Institute of Technology(哈尔滨工业大学) National Key Laboratory of Smart Farm Technologies and Systems(国家智能农业技术与系统重点实验室) Autonomous Driving Center(自动驾驶中心) Shanghai Utopilot Technology Co.Ltd.(上海驭目科技有限公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

AI总结 AppleVLM通过引入先进的视觉和规划编码器,提升端到端自动驾驶的感知和决策能力,实现复杂环境下的稳健驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23592 2026-02-05 cs.CV 83%

Same or Not? Enhancing Visual Perception in Vision-Language Models

相同还是不同?提升视觉语言模型的视觉感知能力

Damiano Marsili, Aditya Mehta, Ryan Y. Lin, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 TWIN通过引入大规模图像对数据集提升视觉语言模型的细粒度视觉感知能力,显著提高在艺术、动物等未见领域识别性能。

Comments Project webpage: https://glab-caltech.github.io/twin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17440 2026-02-05 cs.CV 83%

VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models

VEAttack: 面向大视觉语言模型的下游任务无关视觉编码器攻击

Hefei Mei, Zirui Wang, Shen You, Minjing Dong, Chang Xu

机构 * City University of Hong Kong(香港城市大学) University of Sydney(悉尼大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 VEAttack是一种针对大视觉语言模型视觉编码器的简单有效攻击方法,通过优化图像令牌降低计算开销,实现对多种下游任务的泛化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02961 2026-02-04 cs.AI 83%

Generative Engine Optimization: A VLM and Agent Framework for Pinterest Acquisition Growth

生成引擎优化:一个面向Pinterest获取增长的VLM和代理框架

Faye Zhang, Qianyu Cheng, Jasmine Wan, Vishwakarma Singh, Jinfeng Rao, Kofi Boakye

机构 * Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 Pinterest提出GEO框架,通过微调VLM和AI代理预测用户搜索需求,构建语义连贯的集合页面,提升生成搜索时代的视觉平台流量增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01574 2026-02-03 cs.CV 83%

SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models

SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击

Haobo Wang, Weiqi Luo, Xiaojun Jia, Xiaochun Cao

机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) Nanyang Technological University(南洋理工大学) School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00946 2026-02-03 cs.CV 83%

ConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language Models

ConsensusDrop:融合视觉与跨模态显著性以提高视觉语言模型的效率

Dhruv Parikh, Haoyang Fan, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM Army Research Office(陆军研究办公室)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 ConsensusDrop通过融合视觉与跨模态显著性,提高视觉语言模型的效率和准确性,优于现有token修剪方法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20198 2026-02-03 cs.CV 83%

A Survey of Token Compression for Efficient Multimodal Large Language Models

多模态大语言模型高效性中的标记压缩综述

Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) National University of Singapore(新加坡国立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Central Florida(佛罗里达大学) Salesforce AI Research(Salesforce AI研究) Rice University(德克萨斯大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文综述了多模态大语言模型中标记压缩技术,分类讨论了图像、视频和音频三种模态的压缩方法及其机制,旨在推动该领域的发展。

Comments For ongoing updates and to track the latest advances in this promising area, we maintain a public repository: https://github.com/cokeshao/Awesome-Multimodal-Token-Compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14957 2026-02-02 cs.CV 83%

DF-LLaVA: Unlocking MLLMs for Synthetic Image Detection via Knowledge Injection and Conflict-Driven Self-Reflection

DF-LLaVA: 通过知识注入和冲突驱动的自我反思解锁MLLMs用于合成图像检测

Zhuokang Shen, Kaisen Zhang, Bohan Jia, Heming Jia, Yuan Fang, Zhou Yu, Shaohui Lin

机构 * East China Normal University(东华师范大学) Sanming University(三明大学) The 27th Research Institute of CETC(中国电子科技集团第27研究所)

专题命中 VLM训练与架构 :LLaVA(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 DF-LLaVA通过知识注入和冲突驱动的自我反思,提升MLLMs在合成图像检测中的准确性和可解释性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09071 2026-02-02 cs.CV 83%

BlindSight: Harnessing Sparsity for Efficient Vision-Language Models

BlindSight: 利用稀疏性提升视觉-语言模型的效率

Tharun Adithya Srikrishnan, Deval Shah, Timothy Hein, Ahmed Hasssan, Stephen Youn, Steven K. Reinhardt

机构 * Advanced Micro Devices, Inc. (AMD)(先进微器件公司(AMD))

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 BlindSight通过引入输入模板感知的注意力稀疏性掩码,显著提升了视觉-语言模型的推理效率,同时保持较高的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22654 2026-02-02 cs.CV cs.CL 83%

VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models

VScan:重新思考视觉标记减少以提高高效的大视觉-语言模型

Ce Zhang, Kaixin Ma, Tianqing Fang, Wenhao Yu, Hongming Zhang, Zhisong Zhang, Haitao Mi, Dong Yu

机构 * Carnegie Mellon University(卡内基梅隆大学) Tencent AI Lab(腾讯AI实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 VScan通过两阶段视觉标记减少框架提升大视觉-语言模型的推理效率,实现2.91倍预填充加速和10倍FLOPs减少,性能损失仅0.6%

Comments Accepted at TMLR 2026. Project page: https://zhangce01.github.io/VScan/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19228 2026-01-28 cs.CV 83%

Towards Pixel-Level VLM Perception via Simple Points Prediction

通过简单的点预测实现像素级VLM感知

Tianhui Song, Haoyu Lu, Hao Yang, Lin Sui, Haoning Wu, Zaida Zhou, Zhiqi Huang, Yiping Bao, Y. Charles, Xinyu Zhou, Limin Wang

专题命中 VLM训练与架构 :VLM(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 SimpleSeg通过简单点预测实现多模态大语言模型的像素级感知,无需复杂架构即可获得高精度分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05344 2026-01-27 cs.CV 83%

Coding the Visual World: From Image to Simulation Using Vision Language Models

将视觉世界编码:通过视觉语言模型从图像到模拟

Sagi Eppel

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文研究了视觉语言模型通过Im2Sim方法从图像生成模拟的能力,发现其在复杂系统建模上表现优异,但对细节复制能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12744 2026-01-21 cs.AI cs.NI cs.SE 83%

Vision Language Models for Optimization-Driven Intent Processing in Autonomous Networks

面向自主网络的基于视觉语言模型的优化驱动意图处理

Tasnim Ahmed, Yifan Zhu, Salimur Choudhury

机构 * School of Computing, Queen's University, Ontario, Canada(计算学院,女王大学,安大略,加拿大)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出IntentOpt基准测试,评估不同视觉语言模型在生成网络优化代码中的性能,发现视觉参数提取和程序化思维提示显著降低执行成功率,开源模型表现低于闭源模型。

Comments Accepted for presentation at The IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17807 2026-01-19 cs.CV 83%

Attention Debiasing for Token Pruning in Vision Language Models

视觉语言模型中用于标记剪枝的注意力去偏

Kai Zhao, Wubang Yuan, Yuchen Lin, Liting Ruan, Xiaofeng Lu, Deng-Ping Fan, Ming-Ming Cheng, Dan Zeng

机构 * School of Communication and Information Engineering, Shanghai University(通信与信息工程学院,上海大学) School of Computer Science and Engineering, Shanghai University(计算机科学与工程学院,上海大学) School of Computer Science and Engineering, Nankai University(计算机科学与工程学院,南开大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出两种轻量有效的注意力去偏技术,用于改进视觉语言模型中基于注意力的标记剪枝,以提升计算效率和模型性能。

Comments https://github.com/intcomp/attention-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16148 2026-01-15 cs.CV 83%

Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training

频率才是关键:在文本遮蔽时考虑词频有助于视觉-语言模型预训练

Mingliang Liang, Martha Larson

机构 * Institute for Computing and Information Sciences(计算与信息科学研究所) Radboud University(拉德堡德大学)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出CLIPF方法,通过考虑词频提升视觉-语言模型预训练效果,实验显示其在减少输入token时表现更优。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01741 2026-01-15 cs.CV 83%

Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models

模拟集成攻击:在微调视觉-语言模型之间转移劫持

Ruofan Wang, Xin Wang, Yang Yao, Juncheng Li, Xuan Tong, Xingjun Ma

机构 * Fudan University, Shanghai, China(复旦大学) The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出SEA框架,通过模拟微调过程中的参数变化,实现跨不同微调变体的高效劫持攻击,揭示了微调导致的局部参数位移对攻击有效性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03915 2026-01-08 cs.CV 83%

HemBLIP: A Vision-Language Model for Interpretable Leukemia Cell Morphology Analysis

HemBLIP:一种用于可解释性白血病细胞形态分析的视觉-语言模型

Julie van Logtestijn, Petru Manescu

机构 * Department of Computer Science, University College London, United Kingdom(计算机科学系,伦敦大学学院,英国)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 HemBLIP是一种基于视觉-语言模型的白血病细胞形态分析工具,通过可解释的描述提升诊断透明度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06472 2026-01-07 cs.CV cs.MM 83%

CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model

CalliReader:通过嵌入对齐的视觉-语言模型 contextualizing 中文书法

Yuxuan Luo, Jiaqi Tang, Chenyi Huang, Feiyang Hao, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 CalliReader通过字符级切片、视觉-文本对齐和嵌入指令微调,解决中文书法的上下文识别问题,实现比现有方法和专业书法家更高的准确性与更低的幻觉率。

Comments 11 pages

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24013 2026-01-01 cs.CV 83%

Bridging the Perception-Cognition Gap:Re-engineering SAM2 with Hilbert-Mamba for Robust VLM-based Medical Diagnosis

弥合感知-认知鸿沟:通过希尔伯特-马amba重新工程SAM2以实现鲁棒的基于VLM的医学诊断

Hao Wu, Hui Li, Yiyun Su

机构 * Southern University of Science and Technology(南方科技大学) School of Informatics, Xiamen University(厦门大学信息学院) Rutgers University(罗格斯大学)

专题命中 VLM训练与架构 :VLM(title,abstract);visual language model(abstract);分类 cs.CV

AI总结 通过重新设计SAM2架构,引入希尔伯特空间填充曲线和希尔伯特-马amba交叉注意力机制,提升基于VLM的医学图像分割与诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06970 2026-01-01 cs.CV 83%

Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment

通过偏好对齐引导跨模态表示

Pengfei Zhao, Rongbo Luan, Wei Zhang, Peng Wu, Sifeng He

机构 * Apple(苹果公司)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MAPLE通过利用多模态大语言模型的细粒度对齐先验,引导跨模态表示学习,提升细粒度检索性能。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21616 2025-12-29 cs.CV 83%

TAMEing Long Contexts in Personalization: Towards Training-Free and State-Aware MLLM Personalized Assistant

在个性化中延长上下文:迈向无训练和状态感知的MLLM个性化助手

Rongpei Hong, Jian Lang, Ting Zhong, Yong Wang, Fan Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) Aiwen Technology Co., Ltd.(Aiwen科技有限公司) Intelligent Digital Media Technology Key Laboratory of Sichuan Province(四川省智能数字媒体技术重点实验室)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TAME框架,通过双记忆和RA2G范式实现无训练、状态感知的MLLM个性化,提升长上下文对话能力。

Comments Accepted by KDD 2026 research track. Code and data are available at https://github.com/ronpay/TAME

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17574 2025-12-22 cs.DC cs.LG 83%

Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing

通过GPU内部调度和资源共享实现解耦的多阶段MLLM推理

Lingxiao Zhao, Haoran Zhou, Yuezhi Che, Dazhao Cheng

机构 * Wuhan University(武汉大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.LG

AI总结 通过GPU内部调度和资源共享实现解耦的多阶段MLLM推理,提升吞吐量和延迟性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17313 2025-12-22 cs.CV 83%

Auxiliary Descriptive Knowledge for Few-Shot Adaptation of Vision-Language Model

辅助描述性知识用于视觉-语言模型的少样本适应

SuBeen Lee, GilHan Park, WonJun Moon, Hyun Seok Seong, Jae-Pil Heo

机构 * Sungkyunkwan University(顺天妇女大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ADK框架,通过生成丰富的描述性提示提升视觉-语言模型在少样本适应中的性能,提供两种知识类型以增强类别区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17292 2025-12-22 cs.CV 83%

Vision-Language Model Guided Image Restoration

基于视觉语言模型的图像修复

Cuixin Yang, Rongkang Dong, Kin-Man Lam

机构 * Department of Electrical and Electronic Engineering(电子与电气工程系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出VLMIR框架,利用视觉语言模型的先验知识提升图像修复性能,通过两阶段方法结合特征提取与扩散模型实现更高质量的图像恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏