arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-25 至 2026-02-25 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 6 篇

2602.20500 2026-02-25 cs.RO cs.CV 70%

Strategy-Supervised Autonomous Laparoscopic Camera Control via Event-Driven Graph Mining

基于事件驱动图挖掘的策略监督自主腹腔镜摄像机控制

Keyu Zhou, Peisen Xu, Yahao Wu, Jiming Chen, Gaofeng Li, Shunlei Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本研究提出基于事件驱动图挖掘的策略监督自主腹腔镜摄像机控制方法,通过结合视觉-语言推理与闭环控制,提升手术视野稳定性与可解释性,实验表明其在减少视野偏移和图像抖动方面表现优异。

Comments Submitted to IEEE Transactions on Robotics (T-RO). 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20731 2026-02-25 cs.CV cs.AI cs.LG 67%

Communication-Inspired Tokenization for Structured Image Representations

受通信启发的结构化图像表示分词

Aram Davtyan, Yusuf Sahin, Yasaman Haghighi, Sebastian Stapf, Pablo Acuaviva, Alexandre Alahi, Paolo Favaro

机构 * Computer Vision Group, University of Bern, Switzerland(伯恩大学计算机视觉组) VITA Lab, EPFL, Switzerland(苏黎世联邦理工学院VITA实验室)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 COMiT通过受通信启发的分词框架,学习结构化离散视觉分词序列,提升图像重建和语义理解能力。

Comments Project website: https://araachie.github.io/comit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21035 2026-02-25 cs.CV cs.MM 57%

Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning

不只是存在与否:无需微调即可使CLIP理解否定性视觉描述

Junhao Xiao, Zhiyu Wu, Hao Lin, Yi Chen, Yahui Liu, Xiaoran Zhao, Zixu Wang, Zejiang He

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CLIPGlasses通过双阶段设计提升CLIP对否定性视觉描述的理解能力,无需微调,增强跨领域泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00795 2026-02-25 cs.CV 57%

DVLA-RL: Dual-Level Vision-Language Alignment with Reinforcement Learning Gating for Few-Shot Learning

DVLA-RL:基于强化学习门控的双层视觉-语言对齐用于少样本学习

Wenhao Li, Xianjing Meng, Qiangchang Wang, Zhongyi Han, Zhibin Wu, Yilong Yin

机构 * Software School, Shandong University(山东大学软件学院) Shenzhen Loop Area Institute(深圳河套学院) School of Computing and Artificial Intelligence, Shandong University of Finance and Economics(山东财经大学计算机与人工智能学院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 DVLA-RL通过双层语义构建和强化学习门控注意力,实现少样本学习中视觉与语言的双层次对齐,提升泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05662 2026-02-25 cs.RO cs.CV 57%

DeLTa: Demonstration and Language-Guided Novel Transparent Object Manipulation

DeLTa: 人机交互与语言引导的新透明物体操控演示

Taeyeop Lee, Gyuree Kang, Bowen Wen, Youngho Kim, Seunghyeok Back, In So Kweon, David Hyunchul Shim, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达) KIMM(韩国智能媒体实验室)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 DeLTa通过整合深度估计、6D姿态估计和视觉-语言规划,实现基于自然语言指令的精确长周期透明物体操控,无需额外训练或类别先验。

Comments Project page: https://sites.google.com/view/DeLTa25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06063 2026-02-25 cs.DC 50%

Mapping Gemma3 onto an Edge Dataflow Architecture

将Gemma3映射到边缘数据流架构上

Shouyu Du, Miaoxiang Yu, Zhenyu Xu, Zhiheng Ni, Jillian Cai, Qing Yang, Tao Wei

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 本文提出将Gemma3模型高效部署到边缘数据流架构上,通过硬件感知技术提升推理速度和能效,实现低功耗的LLM和VLM边缘推理。

Comments Original Version, data shall be updated

详情

展开后加载摘要…

URL PDF HTML 收藏