arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-26 至 2026-05-26 共收录 136 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 27 篇

2604.08213 2026-05-26 cs.CV cs.AI 79%

EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis

EditCaption: 用于图像编辑指令合成的人工精炼SFT与HAE-DPO

Xiangyuan Wang, Honghao Cai, Yunhao Bai, Chao Hui, Tianze Zhou, Haohua Chen, Hao Shi, Yuling Wu, Yao Hu, Xu Tang, Yibo Chen, Wei Zhu

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Xiaohongshu Inc.(小红书公司)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出EditCaption两阶段后训练流程,通过人工精炼SFT和基于难度自适应错误感知DPO(HAE-DPO)提升图像编辑指令合成质量,显著降低关键错误率并超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22827 2026-05-26 cs.CV cs.LG 79%

FairJudge: Abstention-Aware Multimodal Judges for Fairness and Alignment Evaluation in Text-to-Image Models

FairJudge: 文本到图像模型中公平性与对齐评估的弃权感知多模态裁判

Zahraa Al Sahili, Maimuna Nowaz, Maryam Fetanat, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institut Jožef Stefan(乔泽夫·斯蒂芬研究所) Imperial College London(伦敦帝国学院)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.LG

AI总结 提出FairJudge协议,利用多模态大语言模型作为结构化裁判,通过封闭标签、弃权机制和证据报告,在文本到图像模型中实现社会属性预测、职业定位和提示-图像对齐的公平性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24946 2026-05-26 cs.CV 77%

Interpretability Transfer from Language to Vision via Sparse Autoencoders

通过稀疏自编码器实现从语言到视觉的可解释性迁移

Alexey Kravets, Da Li, Chuan Li, Da Chen, Vinay P. Namboodiri

机构 * University of Bath, UK(巴斯大学) Lambda, Inc.(Lambda公司) Samsung AI Centre Cambridge(三星AI研究中心)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出VISTA框架,通过约束视觉投影器将视觉token映射到LLM的文本SAE空间,实现无需专用视觉SAE的视觉可解释性,并在对象移除和替换任务上分别提升35%和47%。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29897 2026-05-26 cs.IR cs.AI 77%

UniRank: End-to-End Domain-Specific Reranking of Hybrid Text-Image Candidates

UniRank: 混合文本-图像候选的端到端领域特定重排序

Yupei Yang, Lin Yang, Wanxi Deng, Lin Qu, Shikui Tu, Lei Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 提出UniRank,一种基于视觉语言模型的重排序框架,通过无需模态转换的统一评分和端到端领域适应(包括指令微调和基于强化学习的偏好对齐),在科学文献检索和设计专利搜索中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19027 2026-05-26 cs.CV 77%

MedFM-Robust: Benchmarking Robustness of Medical Foundation Models

MedFM-Robust:医学基础模型的鲁棒性基准测试

Xiangxiang Cui, Tianjin Huang, Yifang Wang, Lijie Hu, Lu Yin

机构 * Beijing Normal University, China(北京师范大学) University of Exeter, United Kingdom(埃克塞特大学) University College London, United Kingdom(伦敦大学学院) Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(穆罕默德·本·扎耶德人工智能大学) University of Surrey, United Kingdom(萨里大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 本文提出了一个包含40种扰动类型(12种基础、28种医学特定)的鲁棒性基准,评估了多种医学基础模型在VQA、视觉定位、图像描述和分割任务上的表现,发现微调策略主导鲁棒性、医学特定扰动对分割影响大、零样本VQA鲁棒性依赖模型等关键结论。

Comments MICCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11296 2026-05-26 cs.CV cs.LG 73%

$Δ\mathrm{Energy}$: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization

$Δ\mathrm{Energy}$: 优化视觉-语言对齐过程中的能量变化提升OOD检测与OOD泛化

Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出ΔEnergy分数,通过重新对齐视觉-语言模态时的能量变化来同时提升分布外检测和分布外泛化性能,并基于此开发了统一微调框架EBM。

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25423 2026-05-26 cs.RO 67%

OPAL: Omnidirectional Path-efficient Aerial 3D expLoration

OPAL: 全方位路径高效空中三维探索

Yoga Satwik Chappidi, Avideh Zakhor

机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出OPAL框架,通过在歧义分支点进行360度偏航旋转替代计算密集的全局路径规划,实现计算简单、路径短且覆盖率高的自主探索。

Comments Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10921 2026-05-26 cs.CV cs.AI cs.LG 67%

FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model

FG-CLIP 2: 一种双语细粒度视觉-语言对齐模型

Chunyu Xie, Bin Wang, Fanjing Kong, Jincheng Li, Dawei Liang, Ji Ao, Dawei Leng, Yuhui Yin

机构 * AI Research(360人工智能研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出FG-CLIP 2双语视觉语言模型,通过区域-文本匹配、长描述建模和文本内模态对比损失等细粒度监督,在英中双语上实现细粒度对齐,在29个数据集上取得最优结果。

Comments Accepted in ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25427 2026-05-26 cs.CV cs.AI 62%

Binding Visual Features Point by Point

逐点绑定视觉特征

Udith Haputhanthri, Declan Campbell, Rim Assouel, Jonathan D. Cohen, Taylor W. Webb

机构 * Princeton University(普林斯顿大学) Mila – Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 研究通过文本引导的“指向”机制解决视觉语言模型在多目标场景中的绑定问题,发现该机制诱导内部视觉搜索程序,消除绑定错误并实现组合泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11758 2026-05-26 cs.CV cs.AI cs.GR cs.RO 62%

Generalizable Vision-Language Few-Shot Adaptation with Predictive Prompts and Negative Learning

具有预测性提示和负学习的可泛化视觉语言少样本适应

Sriram Mandalika

机构 * Hasso Plattner Institute, University of Potsdam(霍普夫纳研究所,波茨坦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出SCAN框架,通过查询自适应负路由、LLM引导对比提示和自适应融合权重,解决视觉语言模型少样本适应中负类信号处理问题,在11个基准上平均提升4.61%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24675 2026-05-26 cs.CV cs.AI 62%

VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

VaaWIT: 面向多语言网页图像翻译的大语言模型视觉感知适配

Bo Li, Ronghao Chen, Ningyuan Deng, Huacan Wang, Shaolin Zhu, Lijie Wen

机构 * The Hong Kong University of Science(香港科技大学) Tianjin University(天津大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对网页图像翻译中视觉表示差距问题,提出VaaWIT框架,通过双流注意力模块和视觉感知适配器,实现大语言模型对细粒度视觉特征的动态融合,在多个基准上超越开源模型并接近闭源模型性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25821 2026-05-26 cs.CV 57%

[CLS] is Not Enough: Multi-Label Recognition via Patch-Level Inference and Adaptive Aggregation

[CLS] 还不够:基于补丁级推理与自适应聚合的多标签识别

Akang Wang, Xili Deng, Zhanxuan Hu, Yi Zhao, Yonghang Tai, Huafeng Li

机构 * Yunnan Normal University, Kunming, China(云南师范大学,昆明,中国) Kunming University of Science and Technology, Kunming, China(昆明理工大学,昆明,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对CLIP等视觉语言模型在多标签识别中因[CLS]全局表征不足的问题,提出PIAA框架,通过补丁级推理和自适应聚合实现无训练的多标签识别,在NUS-WIDE上mAP提升超6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25799 2026-05-26 cs.CV 57%

Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning

应对源自由跨域小样本学习中加剧的注意力汇聚问题

Shuai Yi, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对跨域小样本学习中标准微调加剧注意力汇聚导致判别性下降的问题,提出基于令牌动态重加权的方法抑制简单令牌依赖并增强困难令牌学习,实现新最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25708 2026-05-26 cs.CV cs.CL cs.ET 57%

CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning

CMAP: 面向多域任务增量学习的跨模态自适应提示

Sriram Mandalika

机构 * Hasso Plattner Institute(霍普斯·普拉特纳研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对多域任务增量学习,提出跨模态自适应提示方法,利用CLIP文本嵌入空间进行任务路由、置信度估计和编码器适应,在MTIL基准上超越现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10548 2026-05-26 cs.CV 57%

Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding

Blink: 动态视觉令牌分辨率增强多模态理解

Yuchen Feng, Zhenyu Zhang, Naibin Gu, Yilong Chen, Peng Fu, Zheng Lin, Shuohuan Wang, Yu Sun, Hua Wu, Weiping Wang, Haifeng Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc(百度公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出Blink框架,通过注意力引导的令牌超分辨率和动态丢弃机制,在单次前向传播中模拟人类眨眼式扫描,提升多模态大语言模型的视觉感知能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24172 2026-05-26 cs.AI 57%

EPPC-OASIS: Ontology-Aware Adaptation and Structured Inference Refinement for Electronic Patient-Provider Communication Mining in Secure Messages

EPPC-OASIS:面向安全消息中电子患者-提供者通信挖掘的本体感知适应与结构化推理精炼

Samah Fodeh, Sreeraj Ramachandran, Elyas Irankhah, Muhammad Arif, Afshan Khan, Ganesh Puthiaraju, Linhai Ma, Srivani Talakokkul, Jordan Alpert, Sarah Schellhorn

机构 * Yale University(耶鲁大学) Cleveland Clinic Lerner College of Medicine of Case Western Reserve University, Cleveland Clinic(克利夫兰医学中心勒纳医学院,克利夫兰医学中心) Medical Oncology, Yale School of Medicine(耶鲁医学院医学肿瘤学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 提出EPPC-OASIS框架,通过本体感知的Wasserstein对齐目标增强微调,并结合推理精炼步骤,从安全消息中自动提取结构化EPPC编码,在多个语言模型上取得一致改进。

详情

展开后加载摘要…

URL PDF HTML 收藏