arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-23 至 2026-07-23 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 10 篇

2607.19515 2026-07-23 eess.IV cs.CV 新提交 84%

BLUE: Semantics-Preserving Video Compression for Efficient Vision-Language Surveillance Analytics

BLUE:用于高效视觉语言监控分析的语义保留视频压缩

Shubham Baid, Akash James, Sahil Chachra, Nishant Sinha, Kunal Kislay

机构 * KGraph AI Solutions Pvt. Ltd.(KGraph AI解决方案私人有限公司)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 研究持续监控视频给企业视频分析系统带来的负担问题,提出BLUE固定摄像头监控压缩方法,在VIRAT和CHAD数据集上实验,结果表明该方法能在保留VLM语义性能时降低带宽和推理成本。

Comments 17 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20092 2026-07-23 cs.CV cs.AI cs.CL 新提交 84%

ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

ENTRAP-VL:视觉语言模型中双上下文夹带的分类探测器

Karan Goyal, Afreen Hossain, Debojyoti Das, Vishal Bhutani

机构 * IIIT Delhi(德里信息技术学院) Dr. Ambedkar Institute of Technology(阿姆贝德卡尔技术学院) Heritage Institute of Technology(遗产技术学院) PwC(普华永道)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型中上下文夹带现象,提出需构建分类结构化双模态工具。引入ENTRAP-VL数据集,含1500个项目,跨八类,分文本和视觉夹带流,提供工具、分类法及评估协议,助力社区严格研究该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20207 2026-07-23 cs.RO 新提交 83%

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGrasp:复杂场景中多实体语言引导抓取

Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of British Columbia(英属哥伦比亚大学) Google Deepmind(谷歌DeepMind)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 针对复杂场景中机器人抓取问题,提出 SeededGrasp 框架,通过 VLM 预测种子点,结合轻量级抓取生成模型,解耦语义与几何执行,无需端到端训练,发布多实体数据集,实验证明该方法优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00462 2026-07-23 cs.CV cs.AI 版本更新 79%

LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs

LatentLens: 揭示大语言模型中高度可解释的视觉标记

Benno Krojer, Shravan Nayak, Oscar Mañas, Vaibhav Adlakha, Desmond Elliott, Siva Reddy, Marius Mosbach

机构 * University of Cambridge(剑桥大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。

Comments ICML 2026 (Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19889 2026-07-23 cs.CV 新提交 77%

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

LAVIFT:用于手术交互识别的潜在动作引导视觉微调

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) University of California, Merced(加州大学默塞德分校) Intel Corporation(英特尔公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20357 2026-07-23 cs.CV 新提交 70%

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

少看,快思考:多模态大语言模型的联合令牌-计算适配

Pengcheng Wang, Zhiquan Wang, Jayoung Lee, Zhuoyan Xu, Ran Xu, Saurabh Bagchi, Yin Li, Somali Chaterji

机构 * Purdue University(普渡大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(英伟达)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 针对多模态大语言模型推理成本高的问题,提出SmartVL框架,通过视觉侧令牌控制器和LLM侧计算控制器联合控制视觉令牌数量和模型计算能力,实验证明该框架优于先前方法,实现更好的精度-效率平衡。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09080 2026-07-23 cs.CV 版本更新 70%

GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models

GeoTrace:用于视频大语言模型的几何感知轨迹令牌压缩

Guohuan Xie, Mengqi Lei, Chuan Shi, Wei Bao, Yue Gao, Siqi Li

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对Video LLMs视觉令牌多致效率受限问题,提出GeoTrace框架,通过CFPA和TCRC分别处理骨架与残差令牌,经实验评估证明该框架在多模型架构和场景下有效,能在大幅减少计算量时保留高比例性能。

Comments Withdrawn by the authors due to an incomplete internal approval process

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02402 2026-07-23 cs.CV 版本更新 70%

Show Me Examples: Inferring Visual Concepts from Image Sets

展示示例:从图像集合中推断视觉概念

Nick Stracke, Kolja Bauer, Stefan Andreas Baumann, Miguel Angel Bautista, Josh Susskind, Björn Ommer

机构 * Munich Center for Machine Learning(慕尼黑机器学习中心) Apple(苹果公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出VICIS任务评估视觉语言模型从图像集合中推断共享概念的能力,并设计训练框架与架构,使模型能提取概念嵌入并生成与查询一致的新图像。

Comments for code, view https://github.com/CompVis/set-learner

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17820 2026-07-23 cs.CV 版本更新 57%

PRiSM: Prototype Regularization for Few-Shot VLMs

PRiSM:少样本视觉语言模型的原型正则化

Ghassen Baklouti, Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed

机构 * ÉTS Montreal(蒙特利尔高等商学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型少样本适应方法,质疑现有基准假设,引入新基准。提出PRiSM类原型正则化方法,优化多术语损失,结合有效优化器,提升性能,尤其在处理类不平衡和大量类时效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19836 2026-07-23 cs.IR cs.DL 新提交 50%

Using Hierarchical Controlled Vocabularies to Understand CLIP Retrieval Failures in Historical Photo Collections

使用分层控制词汇表理解历史照片集中CLIP检索失败的原因

Ratan Sebastian, Anett Hoppe, Christoph Rippe, Ralph Ewerth

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 研究探讨用AAT词汇表的根面类型和层次深度解释CLIP在历史照片集检索的成败及微调作用,通过三个标注集研究视觉连贯性等指标,发现两指标可区分失败模式,根面类型有区分作用,微调对层次浅的术语更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏