arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-11 至 2026-08-11 共收录 28 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 28 篇

2606.28551 2026-08-11 cs.CV cs.CL cs.LG 版本更新 93%

DataComp-VLM: Improved Open Datasets for Vision-Language Models

DataComp-VLM:改进的视觉语言模型开放数据集

Matteo Farina, Vishaal Udandarao, Thao Nguyen, Selim Kuzucu, Maximilian Böther, Andreas Hochlehnert, Adhiraj Ghosh, Marianna Nezhurina, Karsten Roth, Joschka Struber, Yuhui Zhang, Sebastian Dziadzio, Elaine Sui, Soumya Jahagirdar, Dhruba Ghosh, Hasan Hammoud, Thomas De Min, Simone Caldarella, Jehanzeb Mirza, Sedrick Keh, Mehdi Cherti, Hilde Kuehne, Bernt Schiele, Serena Yeung-Levy, Muhammad Ferjad Naeem, Federico Tombari, Ana Klimovic, Elisa Ricci, Matthias Bethge, Sewoong Oh, Ameya Prabhu, Alessio Tonioni, Jenia Jitsev, Massimiliano Mancini, Ludwig Schmidt, Nikhil Parthasarathy

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 提出DataComp-VLM基准,通过数据混合(而非过滤)策略提升视觉语言模型训练效果,在8B模型上达到63.6%准确率,比现有最优数据集提升5.4个百分点。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07537 2026-08-11 cs.NE cs.AI cs.CL cs.HC cs.MA 新提交 92%

An evolutionary model of animats with VLM-based subjective evaluation

基于视觉语言模型(VLM)主观评估的动物机器人进化模型

Shota Miyazaki, Takaya Arita, Reiji Suzuki

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出将VLM主观评估融入遗传算法的框架,使虚拟软体机器人同步进化形态与运动,实验显示该方法可加快种群收敛,且VLM主观选择的结果与人类评估倾向相似。

Comments 18 pages, 12 figures, 2 tables. This manuscript has been accepted for publication in Artificial Life and Robotics following peer review

Journal ref Shota Miyazaki, Takaya Arita and Reiji Suzuki: An evolutionary model of animats with VLM-based subjective evaluation, Artificial Life and Robotics (2026). https://link.springer.com/article/10.1007/s10015-026-01135-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10904 2026-08-11 cs.CR 版本更新 89%

When the Defense Writes the Refusal: Auditing Keyword-Scored Evaluation of Inference-Time Defenses for Multimodal Large Language Models

多模态大语言模型推理时防御方法的比较分析

Bulat Nutfullin, Vladimir Evgrafov, Dmitry Namiot

专题命中 VLM训练与架构 :InternVL(summary_cn,abstract);multimodal large language model(title,abstract);MLLM(abstract)

AI总结 本文比较评估了三种推理时防御方法及其组合在InternVL和Qwen-VL系列共8个模型上的效果,发现无单一防御在所有设置中占优,组合防御导致良性查询过度拒绝率达97-100%,而简单安全提示在保持实用性的同时带来适度安全提升。

Comments 15 pages, 3 figures. Conditionally accepted at DAMDID/RCDL 2026; revised after peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08622 2026-08-11 cs.CV 新提交 86%

VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

VADER:用于视频大语言模型幻觉缓解的自适应去偏方法

Dong Xing, Jiaxin Chen, Hang Yang, Peixun Liu, Qiushi Yang, Yuqing Wang

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本研究针对视频大语言模型的幻觉问题,提出无训练自适应去偏框架VADER,通过视觉焦点重分配与选择性证据擦除模块结合对比解码,在LLaVA-Video-7B等模型的EventHallusion任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26798 2026-08-11 cs.LG cs.AI 版本更新 86%

Explaining, Verifying, and Aligning Semantic Hierarchies in Vision-Language Model Embeddings

解释、验证和对齐视觉语言模型嵌入中的语义层次结构

Gesina Schwalbe, Mert Keser, Moritz Bayerkuhnlein, Edgar Heinert, Annika Mütze, Marvin Keller, Sparsh Tiwari, Georgii Mikriukov, Diedrich Wolter, Jae Hee Lee, Matthias Rottmann

机构 * University of Lübeck(吕贝克大学) Technical University of Munich(慕尼黑工业大学) AUMOVIO SE Osnabrück University(奥斯纳布吕克大学) Leibniz Institute for Agricultural Engineering and Bioeconomy(莱布尼茨农业工程与生物经济研究所) University of Hamburg(汉堡大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种框架,用于解释、验证和对齐视觉语言模型嵌入中的语义层次结构,通过聚类和概念库匹配提取层次结构,并利用人类本体评估其合理性,最终提出基于本体的对齐方法以提升共享嵌入空间的语义对齐。

Comments camera-ready version of accepted IJCAI-ECAI 2026 paper including supplementary material; code: https://github.com/gesina/ontological-commitment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07596 2026-08-11 cs.RO cs.CV 新提交 84%

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

LIRA:面向视觉-语言-动作解码的局部跨层信息路由

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 LIRA是面向VLA模型的局部跨层信息路由机制,通过深度感知路由VLM特征,在多机器人操作基准及真实场景中提升了动作预测性能与分布偏移下的鲁棒性。

Comments 9 pages, 4 figures. Code and model checkpoints will be released upon acceptance of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30716 2026-08-11 cs.CV cs.AI 版本更新 84%

Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation

用于病例级病理学概要报告生成的简单令牌高效视觉语言模型

Zhiyuan Yang, Jiahao Cheng, Vincent Quoc-Huy Trinh, Mahdi S. Hosseini

机构 * Department of Computer Science and Software Engineering (CSSE), Concordia University, Montreal, Canada(计算机科学与软件工程系(CSSE),康科迪亚大学,蒙特利尔,加拿大) Axe Cancer, Centre de recherche du CHUM, Université de Montréal, Montreal, Canada(Axe癌症,CHUM研究中心,蒙特利尔大学,蒙特利尔,加拿大) Institut de recherche en immunologie et cancérologie (IRIC), Université de Montréal(免疫学与癌症研究所(IRIC),蒙特利尔大学) Mila - Quebec AI Institute, Montreal, Canada(魁北克AI研究所(Mila),蒙特利尔,加拿大)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出一种简单令牌高效的视觉语言模型,通过5倍放大率的512×512补丁和两阶段监督训练,在有限GPU内存下实现病例级多WSI病理报告生成,显著降低序列长度并提升效率。

Comments DeLTA 2026 Conference Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09778 2026-08-11 cs.RO 新提交 83%

RoboSeg: Online Part-Level Semantic Reconstruction for Robotic Manipulation via a Single Eye-in-Hand Camera

RoboSeg:基于单眼在手相机的机器人操作的在线部件级语义重建

Zhaochen Lan, Mengxiang Lin

机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 RoboSeg是无需CAD模型的部件级语义重建系统,结合VLM、TSDF融合与SAM3,实现机器人操作的部件语义索引,在24次物理试验中21次完成综合任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08815 2026-08-11 cs.LG 新提交 83%

Distilling Vision-Language Models for Robust Traffic Sign Perception in Autonomous Vehicles

用于自动驾驶汽车鲁棒交通标志感知的视觉-语言模型蒸馏

Pedram MohajerAnsari, Amir Salarpour, Mert D. Pesé

机构 * Clemson University(克莱姆森大学)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出LAMDA框架,通过冻结OpenCLIP文本编码器构建原型库监督视觉特征,在GTSRB和LISA数据集上,可同时提升TSR模型对三类物理攻击的鲁棒性且不降低干净准确率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16598 2026-08-11 cs.CV 版本更新 81%

VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs

VisionSelector:用于高效多模态大语言模型的端到端可学习视觉令牌压缩

Jiaying Zhu, Yurui Zhu, Xin Lu, Wenrui Yan, Dong Li, Kunlin Liu, Xueyang Fu, Zheng-Jun Zha

专题命中 VLM训练与架构 :multimodal large language model(abstract,abstract_cn);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对多模态大语言模型的视觉令牌压缩瓶颈,提出端到端可学习的VisionSelector框架,通过可微Top-K与课程退火策略实现高效自适应令牌选择,在压缩时保持优异性能并提升预填充速度。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07562 2026-08-11 cs.CV cs.LG 新提交 81%

Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation

面向厘米级洪水深度估计的、由机械可解释性引导的视觉-语言模型选择性微调

Nafis Fuad, Xiaodong Qian, Dongxiao Zhu

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 该研究针对城市洪水缺乏厘米级实时深度估计的问题,提出三种视觉-语言模型,通过机械可解释性分析确定关键交叉注意力层进行选择性微调,在合成与真实基准测试中均实现高精度洪水深度估计,大幅减少可训练参数。

Comments This Paper is accepted in International Conference on Machine Learning and Application (ICMLA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16305 2026-08-11 cs.CV cs.AI 版本更新 81%

LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models

LookME:用于视觉语言模型层注入的基于查找的多模态嵌入

Zeyu Xu, Xingzhong Hou, Pengkai Guo, Siling Lin, Xiao Xu, Menghua Zhai, Haoyu Chen, Yunke Zhang, Fei Huang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文针对视觉语言模型在资源受限环境中部署的问题,提出LookME框架。通过分层两级查找方法和稀疏注入策略,实现基于查找的多模态嵌入增强,实验表明该方法优于仅文本的PLE风格方法,有效提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08060 2026-08-11 cs.CV 新提交 79%

ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models

ZOMP:面向视觉-语言模型的零阶多模态提示调优

Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ZOMP方法,通过跨模态低秩重参数化等技术,在仅前向传递的条件下高效调优CLIP模型,在13个基准上优于现有无反向传播的提示调优方法,泛化能力更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08805 2026-08-11 cs.CV 新提交 77%

LASA: Language-and-Source-Anchored Alignment for Domain Generalized Semantic Segmentation

LASA:面向域泛化语义分割的语言与源锚定对齐

Jinhong Zhu, Weiqi Yan, Shengchuan Zhang, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对域泛化语义分割中传统方法损害特征完整性的问题,提出LASA框架,含三个协同组件,实验显示其性能优于现有最优方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07920 2026-08-11 cs.CV 新提交 77%

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09176 2026-08-11 cs.CV cs.AI 新提交 73%

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩

Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) University of Surrey(萨里大学) Nankai University(南开大学) Cornell University(康奈尔大学) City University of Hong Kong(香港城市大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09931 2026-08-11 cs.CV 新提交 70%

Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

监督之前的感知:来自反事实盲区的自包含视觉蒸馏

Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar, Abdelrahman Shaker, Rao Muhammad Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Aalto University(阿尔托大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09907 2026-08-11 cs.CV 新提交 70%

DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning

DistMoE:用于分布式指令调优的混合专家模型中无需私有数据排练的路由机制

Mainak Singha, Niccolò Biondi, Elisa Ricci, Subhankar Roy

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Bergamo(贝加莫大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract,abstract_cn);分类 cs.CV

AI总结 针对多模态大语言模型分布式私有数据场景,提出DistMoE混合专家方法,通过公共锚定专家组合阶段实现无需排练的路由,在视觉-语言基准上取得灵活复用与适配的竞争力性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08418 2026-08-11 cs.CV 新提交 70%

Learning Deep Modality-Shared Self-Expressiveness for Image Clustering with Textual Information

用于结合文本信息的图像聚类的深度模态共享自表达学习

Xianghan Meng, Wei He, Zhiyuan Huang, Chun-Guang Li

专题命中 VLM训练与架构 :vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 提出DeepMORSE方法,通过模态共享自表达模型学习结合文本信息的图像聚类,在6个基准数据集上聚类性能提升超3%,且所学表示可迁移至下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08713 2026-08-11 cs.CV cs.AI 新提交 62%

Resolution Meets Reduction: Efficient Visual Context for 3D Radiology Report Generation

分辨率与压缩结合:面向3D放射报告生成的高效视觉上下文

Jonathan Suprijadi, Raphael Stock, Moritz Langenberg, David Zimmerer, Kim-Celine Kahl, Stefan Denner, Yannick Kirchhoff, Karol Gotkowski, Maximilian Rokuss, Jeremias Traub, Tassilo Wald, Constantin Ulrich, Klaus Maier-Hein

机构 * German Cancer Research Center (DKFZ)(德国癌症研究中心)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对3D放射报告生成中视觉序列的计算瓶颈,通过实验评估不同视觉编码器、投影器和LLM,提出解剖学引导的ROI裁剪等策略,在两个数据集上取得最先进的临床macro F1结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07570 2026-08-11 cs.CV cs.AI 新提交 62%

COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping

COMEX:用于可解释美学图像裁剪的基于构图的基准测试与学习框架

Rui Yang, Wei Zhou, Dingyong Gou, Xiaohui Cui, Cong Li, Yinyin Gong, Yipo Huang, Jiliang Zhao

机构 * ZTE Corporation(中兴通讯)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出基于构图的COMEX基准与SFT+GRPO两阶段框架,用于可解释美学图像裁剪,通过多组实验验证了框架的有效性与可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09493 2026-08-11 cs.CV 新提交 57%

GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction

GeoRoute:面向交通未来帧预测的几何感知混合推理方法

Khang Minh Le, Hieu Dinh Trung Pham, Luu Thanh Danh, Nam-Tien Le, Hieu Anh Ngo, Phuong Huu Vu Tran, Son Nguyen Minh Le, Nguyen Trong Nghia, Tu Tran Thi Cam, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) University of Science, Ho Chi Minh City(胡志明市科学大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09097 2026-08-11 cs.CV 新提交 57%

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

SI-Edit:面向草图-指令引导的像素级精度局部图像编辑

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) City University of Macau(澳门城市大学) Meitu Inc(美图公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08961 2026-08-11 cs.LG 新提交 57%

Gradient Under Microscope: Benchmarking Resource Utilization of Memory-Efficient Gradient Computation Methods

显微镜下的梯度:对内存高效梯度计算方法的资源利用基准测试

Sarthak Mahapatra, Zihan Zhou, Khatoon Khedri, Mehdi Hosseinzadeh, Reza Rawassizadeh

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 该研究针对四种Transformer架构,测试五种梯度优化器在三种内存策略下的资源利用,发现梯度累积效果最优,Adam并非普遍最优,梯度检查点效果依赖架构,为模型训练部署提供实用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08630 2026-08-11 cs.CV 新提交 57%

VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

VLZip:用于交错长上下文建模的统一视觉与文本压缩方法

Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 VLZip 是统一视觉与文本压缩的框架,通过提炼软前缀缩短注意力序列,在长上下文多模态推理上性能领先,支持超大规模 token 处理,为长上下文多模态 AI 建立新高效标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08336 2026-08-11 cs.CV 新提交 57%

Circuit Fine-Tuning for Compute-Efficient Transformer Adaptation

面向计算高效的Transformer适配的电路微调

Uri Z. Kialy, Gil Ben-Artzi

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出电路微调(CFT)框架,通过电路发现选择ViT待微调子图,仅微调该子图,可大幅降低训练FLOPs与时间,在多类视觉任务上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06939 2026-08-11 cs.CV 版本更新 57%

Degradation-Aware Prompt Learning with Cross-Modal Compensation for Adverse Weather Removal

面向恶劣天气去除的退化感知跨模态补偿提示学习

Wanshu Fan, Yunzhe Zhang, Yue Shen, Liyan Wang, Jing Qin, Kin-Man Lam, Cong Wang, Jinshan Pan

机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) School of Mathematical Sciences, Dalian University of Technology(大连理工大学数学科学学院) The Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加利福尼亚大学旧金山分校) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 该研究针对恶劣天气导致图像退化影响视觉系统可靠性的问题,提出 DCMPC-Net 模型,通过跨模态提示补偿实现鲁棒的恶劣天气图像修复,性能优于现有最先进方法。

Comments Accepted for publication in IEEE Transactions on Image Processing. The code is available at: https://github.com/fanamber831/DCMPC-Net

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16609 2026-08-11 cs.CV 版本更新 57%

Describe-to-Score: A text-guided framework for image complexity assessment

描述到评分:一种用于图像复杂度评估的文本引导框架

Shipeng Liu, Liang Zhao, Dengfeng Chen, Zhonglin Zhang

机构 * Xi’an University of Architecture and Technology(西安建筑科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 该研究针对现有图像复杂度评估方法无法捕捉高级语义的问题,提出文本引导框架D2S,仅训练阶段引入描述语义正则化,在IC9600基准达SOTA,跨任务也具竞争力。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏