arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-10 至 2026-04-10 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 13 篇

2604.08120 2026-04-10 cs.CV cs.AI cs.CL cs.LG 85%

Small Vision-Language Models are Smart Compressors for Long Video Understanding

小视觉-语言模型是长视频理解的智能压缩器

Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin Han, Mingchen Zhuge, Saksham Suri, Qi Qian, Shuming Liu, Lemeng Wu, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhoseiny, Chenchen Zhu

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Tempo框架,利用小视觉-语言模型压缩长视频,通过自适应令牌分配实现高效压缩,实验显示其在极端长视频任务中表现优异。

Comments Project page and demo are available at https://FeiElysia.github.io/tempo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07965 2026-04-10 cs.CV cs.AI cs.LG 85%

DSCA: Dynamic Subspace Concept Alignment for Lifelong VLM Editing

DSCA: 动态子空间概念对齐用于终身视觉语言模型编辑

Gyanendra Das, Sai Satyam Jena

机构 * Zynix AI, FL, USA(Zynix AI(美国佛罗里达州))

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 DSCA通过动态子空间对齐技术,在视觉语言模型中实现精准非干扰编辑,提升终身学习的稳定性与知识保留能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18787 2026-04-10 cs.CV cs.LG 84%

Understanding Task Transfer in Vision-Language Models

理解视觉-语言模型中的任务迁移

Bhuvan Sachdeva, Karan Uppal, Abhinav Java, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软研究院印度)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07912 2026-04-10 cs.CV cs.RO 83%

ParkSense: Where Should a Delivery Driver Park? Leveraging Idle AV Compute and Vision-Language Models

ParkSense: 送货司机应该在哪里停车?利用空闲自动驾驶计算和视觉-语言模型

Die Hu, Henan Li

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Independent Researcher(独立研究员)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ParkSense框架,利用自动驾驶低风险状态下的空闲计算资源运行视觉-语言模型,解决精准停车问题,并提出Delivery-Aware Precision Parking问题,展示量化7B VLM在硬件上的推理速度及对司机收入的提升。

Comments 7 pages, 3 tables. No university resources were used for this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08410 2026-04-10 cs.CV 83%

Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval

通过一次剪辑检索增强多模态大语言模型的长视频理解

Tao Chen, Shaobo Ju, Qiong Wu, Chenxin Fang, Kun Zhang, Jun Peng, Hui Li, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算教育部重点实验室) Xiamen University(厦门大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出OneClip-RAG方法,通过一次剪辑检索提升多模态大语言模型对长视频的理解能力,改进知识完整性和语义连贯性,并设计新数据集和训练方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06036 2026-04-10 cs.DC cs.CV cs.LG 81%

CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference

CodecSight: 利用视频编码信号实现高效的流式视频语言模型推理

Yulin Zou, Yan Chen, Wenyan Chen, JooYoung Park, Shivaraman Nitin, Luo Tao, Francisco Romero, Dmitrii Ustiugov

机构 * Beihang University(北京航空航天大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 CodecSight通过利用视频编码器内嵌的时空结构信息,实现流式视频分析的高效推理,提升吞吐量并减少GPU计算量,同时保持高精度。

Comments 18 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07419 2026-04-10 cs.IR 75%

ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment

ReAlign:通过推理引导的细粒度对齐优化视觉文档检索

Hao Yang, Yifan Ji, Zhipeng Xu, Zhenghao Liu, Yukun Yan, Zulong Chen, Shuo Wang, Yu Gu, Ge Yu

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract)

AI总结 本文提出ReAlign方法,利用VLM推理能力生成细粒度视觉描述作为监督信号,提升视觉文档检索性能,实验表明在不同领域数据集上均取得2%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08167 2026-04-10 cs.CV 70%

T-Gated Adapter: A Lightweight Temporal Adapter for Vision-Language Medical Segmentation

T-Gated Adapter:一种轻量级时间适配器用于视觉-语言医学分割

Pranjal Khadka

机构 * Independent Researcher(独立研究员)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出T-Gated Adapter,通过注入相邻切片上下文提升医学图像分割的连续性,实验表明在FLARE22、BTCV和AMOS22数据集上均取得显著提升,且在跨模态任务中表现优于传统3D模型。

Comments Accepted at the PHAROS-AIF-MIH Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07812 2026-04-10 cs.CV 70%

HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models

HAWK:多模态模型中的头部重要性感知视觉标记修剪

Qihui Zhu, Tao Zhang, Yuchen Wang, Zijian Wen, Mengjie Zhang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Zhenhua Dong, Xianzhi Yu, Yinfei Pan

机构 * University of Science and Technology of China(中国科学技术大学) ChangXin Memory Technologies, Inc(长鑫存储技术有限公司) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 HAWK通过识别不同注意力头在视觉任务中的重要性,有效保留关键视觉标记,提升多模态模型的推理效率与性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08513 2026-04-10 cs.CV 57%

When Fine-Tuning Changes the Evidence: Architecture-Dependent Semantic Drift in Chest X-Ray Explanations

当微调改变证据:在胸部X光解释中的架构依赖性语义漂移

Kabilan Elangovan, Daniel Ting

专题命中 VLM训练与架构 :visual reasoning(abstract);分类 cs.CV

AI总结 研究探讨了在多类设置中,微调导致的视觉证据变化,通过评估不同架构在两阶段训练中的表现,揭示了架构依赖性的证据结构重组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08494 2026-04-10 cs.CV cs.CL cs.HC 57%

What They Saw, Not Just Where They Looked: Semantic Scanpath Similarity via VLMs and NLP metric

他们所见,而不仅仅是他们看的地方:通过VLMs和NLP度量的语义扫视路径相似性

Mohamed Amine Kerkouri, Marouane Tliba, Bin Wang, Aladine Chetouani, Ulas Bagci, Alessandro Bruno

机构 * Northwestern University(西北大学) Radiology, Northwestern University(西北大学放射学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种整合视觉语言模型的语义扫视路径相似性框架,通过控制视觉上下文生成文本描述,利用NLP度量计算语义相似性,揭示空间差异下的内容一致性。

Comments Accepted at ETRA 2026 GenAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05650 2026-04-10 cs.CL 50%

See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs

见林木而非树木:通过视觉-语义引导实现松散推测解码以提高视频大语言模型的推理效率

Yicheng Ji, Jun Zhang, Jinpeng Chen, Cong Wang, Lidan Shou, Gang Chen, Huan Li

机构 * ZJU(浙江大学) BUPT(北京邮电大学)

专题命中 VLM训练与架构 :LLaVA(abstract)

AI总结 本文提出LVSpec,一种无需训练的松散推测解码框架,通过视觉相关锚点识别和位置移位容忍机制,提升视频大语言模型的推理速度和精度。

Comments ACL'2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12710 2026-04-10 cs.RO 50%

Reflection-Based Task Adaptation for Self-Improving VLA

基于反射的任务适应用于自我改进的VLA

Baicheng Li, Dong Wu, Zike Yan, Xinchen Liu, Lusong Li, Zecui Zeng, Hongbin Zha

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) JD Explore Academy(京东探索研究院) AIR, Tsinghua University(清华大学智能产业研究院)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 本文提出反射式自我适应框架,通过双路径架构实现快速自主任务适应,结合失败驱动的强化学习与成功驱动的质量引导微调,提升机器人在复杂任务中的适应效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏