arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-27 至 2026-05-27 共收录 21 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 21 篇

2605.27332 2026-05-27 cs.SE cs.AI cs.CV 91%

EdgeFlow: Edge-Map Augmented VLM-Based Flowchart Processing for Industrial Requirements Engineering

EdgeFlow: 基于边缘图增强的VLM流程图处理用于工业需求工程

Zhifei Dou, Shabnam Hassani, Ou Wei

机构 * Huawei Research Canada(华为加拿大研究)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 提出EdgeFlow方法,通过向视觉语言模型(VLM)输入添加Canny边缘图作为结构先验,无需训练数据或微调即可提升流程图到Mermaid代码的转换精度,在工业数据集上节点F1提升17.39%,边F1提升16.94%。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26533 2026-05-27 cs.CV cs.AI cs.CL cs.LG 86%

A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection

一种用于工业检测中自动缺陷推理与报告生成的混合视觉-语言架构

Malikussaid, Imad Gohar

机构 * School of Computing, Telkom University(Telkom大学计算机学院) Faculty of Engineering and Technology, School of Computing and Artificial Intelligence(工程与技术学院,计算与人工智能学院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出一种解耦的边缘可部署管道,结合YOLO26-x-obb检测器、确定性编码模块和QLoRA微调的Qwen-2.5-1.5B模型,实现风电叶片缺陷定位与结构化报告生成,在BLEU-4、幻觉率和专家评分上显著优于零样本VLM基线。

Comments 23 pages, 6 figures, 9 equations, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27315 2026-05-27 cs.CL 82%

Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery

真实图像,更差判断:评估视觉-语言模型在具体性和意象性上的表现

Yifan Jiang, Ruoxi Ning, Sheng Yao, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn)

AI总结 本文通过具体性和意象性评分任务,发现真实图像上下文不仅未提升视觉-语言模型与人类判断的一致性,反而在视觉证据相关性低时加剧偏差,并表明推理时聚焦文本指令可缓解退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14664 2026-05-27 cs.CV 81%

MiVE: Multiscale Vision-language features for reference-guided video Editing

MiVE:用于参考引导视频编辑的多尺度视觉语言特征

Tong Wang, Meng Zou, Chengjing Wu, Xiaochao Qu, Luoqi Liu, Xiaolin Hu, Ting Liu

机构 * MT Lab, Meitu Inc., Beijing 100083, China(美图实验室,美图公司,北京100083,中国) Department of Computer Science and Technology, BNRist, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing 100084, China(计算机科学与技术系,BNRist,IDG/麦戈文脑研究学院,清华大学,北京100084,中国) Beijing University of Posts(北京邮电大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 提出MiVE框架,利用VLM的多尺度层次特征(早期层保留空间细节,深层编码全局语义)统一到自注意力扩散Transformer中,解决模态间隙和细粒度信息丢失问题,在参考引导视频编辑中达到SOTA性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26601 2026-05-27 cs.CV 79%

FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

FTibSuite:面向藏语视觉语言建模的综合资源套件

Guixian Xu, Yide Liang, Zeli Su, Xuexian Song, Ziyin Zhang, Yushuang Dong, Ting Zhang, Xu Han

机构 * Hainan International College, Minzu University of China(民族大学海南国际学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对藏语视觉语言建模缺乏可复现训练和评估基础设施的问题,提出FTibSuite资源套件,包含数据集FTibData、基准FTibBench和基线模型FTibVLM,在多项任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16449 2026-05-27 cs.CV cs.AI 79%

Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference

弥合视觉令牌剪枝中的语义-动作鸿沟以实现高效VLA推理

Ziyan Liu, Yeqiu Chen, Hongyi Cai, Tao Lin, Shuo Yang, Zheng Liu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) BAAI(北京人工智能研究院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出VLA-Pruner方法,通过结合语义预填充和时序平滑的动作相关性估计视觉令牌重要性,并采用Combine-then-Filter策略,在保持操作质量的同时实现高达1.99倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12271 2026-05-27 cs.CV 77%

Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm

超越文本提示:视觉到视觉生成作为统一范式

Yaofang Liu, Kangning Cui, Meng Chu, Zhaoqing Li, Suiyun Zhang, Jean-Michel Morel, Xiaodong Cun, Haoxuan Che, Rui Liu, Raymond H. Chan

机构 * City University of Hong Kong(香港城市大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Celia Research HK(Celia研究香港) Great Bay University(大湾大学) Lingnan University(岭南大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出视觉到视觉(V2V)生成范式及无需训练的V2V-Zero框架,通过利用视觉页面隐藏状态替代文本条件,在多个任务上达到或接近优化后的文本到图像性能。

Comments Project Page: https://yaofang-liu.github.io/V2V_Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27195 2026-05-27 cs.CL 75%

EpiCurveBench: Evaluating VLMs on Epidemic Curve Digitization

EpiCurveBench: 评估视觉语言模型在流行病曲线数字化中的表现

Thomas Berkane, Maimuna S. Majumder

机构 * Computational Health Informatics Program(计算健康信息学项目) Boston Children’s Hospital & Harvard Medical School(波士顿儿童医院及哈佛医学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 针对现有图表数据提取基准中忽略时间序列结构的问题,提出包含1000张真实流行病曲线图像的EpiCurveBench基准和基于动态规划的EpiCurveSimilarity评估指标,实验表明最强模型仅达52.3% ECS,且ECS能更好区分模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26376 2026-05-27 cs.CV cs.AI cs.LG 75%

BioFact-MoE: Biologically Factorized Mixture of Experts for Vision-Language Prognostic Modeling in Hepatocellular Carcinoma

BioFact-MoE:基于生物学因子分解的混合专家模型用于肝细胞癌的视觉-语言预后建模

Junlin Yang, Tian Yu, Nicha C. Dvornek, Yuexi Du, Peiyu Duan, Annabella Shewarega, Lawrence H. Staib, James S. Duncan, Julius Chapiro

机构 * Department of Radiology \& Biomedical Imaging, Department of Biomedical Engineering, Department of Electrical Engineering, Department of Statistics \& Data Science Yale University, New Haven, CT, 06510, USA

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出BioFact-MoE框架,通过生物学监督的混合专家模型显式分解肝脏和肿瘤因子,在肝细胞癌预后预测中提升准确性和生物学可解释性。

Comments Early accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27194 2026-05-27 cs.CL cs.CV cs.LG 73%

Not All Tokens Matter Equally: Dynamic In-context Vector Distillation with Decisive-Token Supervision for Long-form Medical Report Generation

并非所有标记都同等重要:基于关键标记监督的动态上下文向量蒸馏用于长医学报告生成

Ning Wu, Rui Liu, Xinkun Lin, Weixing Chen, Jinxi Xiang, Tao Wei, Lina Yao, Mingjie Li

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Technology Sydney(技术大学悉尼分校) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 提出DIVE框架,通过关键标记监督和状态条件动态引导,解决长文本生成中标记级蒸馏忽略关键标记的问题,在医学报告生成任务上取得最佳性能。

Comments Preprint. 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26807 2026-05-27 cs.SE cs.AI 70%

HTMLCure: Turning Browser Experience into State Guided Repair for Interactive HTML

HTMLCure:将浏览器体验转化为面向交互式HTML的状态引导修复

Jiajun Wu, Jian Yang, Tuney Zheng, Wei Zhang, Haowen Wang, Yihang Lou, Xianglong Liu

机构 * Beihang University(北京航空航天大学) IQuest Research(IQuest研究院) Peking University(北京大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出HTMLCure框架,通过浏览器交互执行、状态感知诊断和闭环修复引擎,从大规模HTML页面中筛选并修复可修复页面,显著提升SFT数据质量和模型性能。

Comments 27 pages, 11 figures. Code: https://github.com/wuyuVerse/HTMLCure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26244 2026-05-27 cs.CV cs.MM cs.SD 70%

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

LongAV-Compass:面向分钟级音视频生成在T2AV、I2AV和V2AV上的统一评估

Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran Zhang, Yuqi Tang, Fengxiang Wang, Yuhao Dong, Xinlong Chen, Bozhou Li, Bohan Zeng, Yue Ding, Xiaohan Zhang, Jialu Chen, Haotian Wang, Yuanxing Zhang, Pengfei Wan, Leye Wang

机构 * Peking University(北京大学) Kling Team(Kling团队) Nanjing University(南京大学) SJTU(上海交通大学) HKUST(GZ)(香港科技大学(广州)) Shanghai AI Lab(上海人工智能实验室) Nanyang Technological University(南洋理工大学) CASIA(中国科学院自动化所) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有评估协议局限于短片段的问题,提出LongAV-Compass基准,通过284个测试用例和统一评估框架,系统评估分钟级音视频生成在文本、图像、视频条件下的质量、一致性和对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05204 2026-05-27 cs.CV 70%

D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models

D-OPSD:用于连续调优步蒸馏扩散模型的在线自蒸馏方法

Dengyang Jiang, Xin Jin, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Ruoyi Du, Xiangpeng Yang, Qilong Wu, Zhen Li, Peng Gao, Harry Yang, Steven Hoi

机构 * The Hong Kong University of Science and Technology(香港科技大学) Z-Image Team, Alibaba Group(阿里集团Z-Image团队) University of California, San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出D-OPSD,一种在线自蒸馏训练范式,使步蒸馏扩散模型在监督微调中保持少步推理能力,通过让模型同时作为教师和学生,利用不同上下文条件(学生仅文本特征,教师多模态特征)最小化预测分布,学习新概念和风格而不牺牲原有少步能力。

Comments Project Page: https://vvvvvjdy.github.io/d-opsd/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26941 2026-05-27 cs.IR cs.MM 67%

The 2nd EReL@MIR Workshop on Efficient Representation Learning for Multimodal Information Retrieval

第二届EReL@MIR研讨会:面向多模态信息检索的高效表示学习

Junchen Fu, Xuri Ge, Xin Xin, Alexandros Karatzoglou, Ioannis Arapakis, Xi Wang, Qijiong Liu, Qian Li, Joemon M. Jose

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn)

AI总结 本研讨会旨在探讨多模态基础模型在信息检索中的效率瓶颈,并提出通过组织学术与工业界交流,推动高效表示学习的新方法、度量标准和基准。

Comments Accepted as a workshop proposal at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26680 2026-05-27 cs.CV cs.AI 62%

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding

DynFrame: 自适应推理驱动的多模态框架与动态帧增强用于复杂视频理解

Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Haobing Tang, Le Zhang, Hao Jiang, Pipei Huang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出DynFrame框架,通过将时间窗口和采样密度作为原生token进行单步检索,并引入分段解耦GRPO优化,解决了视频多模态大模型中采样密度不可学习及检索与回答优化耦合的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26415 2026-05-27 cs.CV cs.AI 62%

The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP

拯救效应:时空语义早期退出绕过CLIP中的量化崩溃

Kahyeon Nam, Hyesong Choi

机构 * Soongsil University(顺斯大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对CLIP模型INT8量化导致的表示崩溃问题,提出LRA-EE方法,通过时空语义聚合、多特征门控和层自适应阈值实现早期退出,在ImageNet-1K零样本分类中降低13.4% FLOPs并提升2.44%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26380 2026-05-27 cs.CV cs.AI 62%

VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

VisualNeedle: 信息密集场景中的主动视觉搜索基准

Jingru Chen, Yiming Liu, Mingtao Chen, Sijie Chen, Richeng Xuan, Liang Yang, Zhichao Hu, Fanyang Lu

机构 * Hunyuan, Tencent(腾讯 Hunyuan) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在细粒度感知基准中依赖捷径而非真实视觉证据的问题,提出VisualNeedle基准,通过反事实裁剪-黑化设置评估模型在信息密集场景中的主动视觉搜索能力,实验表明最佳模型准确率仅56.01%,落后人类63.00%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26615 2026-05-27 cs.AI 57%

FAST-GOAL: Fast and Efficient Global-local Object Alignment Learning

FAST-GOAL: 快速高效的全局-局部对象对齐学习

Hyungyu Choi, Young Kyun Jang, Chanho Eom

机构 * Department of Virtual Convergence, Graduate School of Advanced Imaging Science, Multimedia & Films (GSAIM), Chung-Ang University(虚拟融合系,高级影像科学研究生院,多媒体与电影系(GSAIM), Chung-Ang 大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 提出FAST-GOAL微调方法,通过全局-局部语义对齐增强CLIP处理长文本的能力,包括快速局部图像-句子匹配和基于token相似性的学习,并在GLIT100k数据集上训练,在长/短描述数据集上均取得显著提升。

Comments 21 pages, 8 figures, IEEE/TIP 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24764 2026-05-27 cs.CV 57%

World-R1: Reinforcing 3D Constraints for Text-to-Video Generation

World-R1:通过强化学习为文本到视频生成注入3D约束

Weijie Wang, Xiaoxuan He, Youping Gu, Yifan Yang, Zeyu Zhang, Yefei He, Yanbo Ding, Xirui Hu, Donny Y. Chen, Zhiyuan He, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Independent Researcher(独立研究者)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出World-R1框架,利用强化学习(Flow-GRPO)结合3D基础模型和视觉语言模型的反馈,在不修改架构的情况下增强视频生成的3D一致性,并采用周期解耦训练策略平衡刚体几何与动态场景。

Comments ICML 2026, Project Page: https://aka.ms/world-r1, Code: https://github.com/microsoft/World-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20796 2026-05-27 cs.CL cs.LG 57%

Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers

解析多模态上下文学习:现代Transformer中的模态不对称性与电路动力学

Yiran Huang, Karsten Roth, Quentin Bouniot, Wenjia Xu, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) DeepMind(深Mind) Beijing University of Posts(北京邮电大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

AI总结 通过可控实验,研究现代Transformer中多模态上下文学习的基本机制,发现模态间学习不对称性,并揭示其背后的归纳式电路机制。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02360 2026-05-27 cs.CV cs.CL 57%

LaRe: Latent Refocusing for Multimodal Reasoning

LaRe: 用于多模态推理的潜在重聚焦

Jizheng Ma, Xiaofei Zhou, Geyuan Zhang, Yanlong Song, Han Yan

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出LaRe范式,在潜在空间内进行视觉重聚焦,结合语义增强训练,在提升推理准确率的同时大幅减少推理所需token数。

详情

展开后加载摘要…

URL PDF HTML 收藏