arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-16 至 2026-03-16 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 5 篇

2603.12823 2026-03-16 cs.CL cs.CV 85%

Adaptive Vision-Language Model Routing for Computer Use Agents

自适应视觉-语言模型路由用于计算机使用代理

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

机构 * vLLM Semantic Router Project(vLLM语义路由项目) MBZUAI McGill University(麦吉尔大学) AMD Red Hat(红帽公司)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出自适应VLM路由框架,通过动态选择模型降低推理成本,同时保持可靠性。在ScreenSpot-Pro数据集和OpenClaw基准测试中,AVR实现了高达78%的推理成本降低,并结合视觉困惑代理机制提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01550 2026-03-16 cs.RO cs.CV 70%

NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction

NavForesee: 一种统一的视觉-语言世界模型用于分层规划和双时间尺度导航预测

Fei Liu, Shichao Xie, Minghua Luo, Zedong Chu, Junjun Hu, Xiaolong Wu, Mu Xu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 NavForesee通过统一的视觉-语言模型实现分层规划和双时间尺度导航预测,结合任务分解与环境预测,提升复杂场景下的导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12772 2026-03-16 cs.CV cs.LG cs.RO 62%

PVI: Plug-in Visual Injection for Vision-Language-Action Models

PVI:插件式视觉注入用于视觉-语言-动作模型

Zezhou Zhang, Songxin Zhang, Xiao Xiong, Junjie Zhang, Zejian Xie, Jingyi Xi, Zunyao Mao, Zan Mao, Zhixin Mai, Zhuoyang Song, Jiaxing Zhang

机构 * Lionrock AI Lab(Lionrock人工智能实验室) China Merchants Group(中国商人集团)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出PVI模块,通过零初始化残差路径注入辅助视觉特征,提升视觉-语言-动作模型的时间信息处理能力,实验证明其在多阶段任务中优于静态图像特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12787 2026-03-16 cs.CV 57%

Generalized Recognition of Basic Surgical Actions Enables Skill Assessment and Vision-Language-Model-based Surgical Planning

基本手术动作的通用识别促进技能评估和基于视觉-语言模型的手术规划

Mengya Xu, Daiyun Shen, Jie Zhang, Hon Chi Yip, Yujia Gao, Cheng Chen, Dillan Imans, Yonghao Long, Yiru Ye, Yixiao Liu, Rongyun Mai, Kai Chen, Hongliang Ren, Yutong Ban, Guangsuo Wang, Francis Wong, Chi-Fai Ng, Kee Yuan Ngiam, Russell H. Taylor, Daguang Xu, Yueming Jin, Qi Dou

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出包含10种基本手术动作的大型数据集,开发了新的基础模型以实现基本动作的通用识别,并展示了其在手术技能评估和手术规划中的应用。

Comments 34 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12574 2026-03-16 cs.RO 50%

From Woofs to Words: Towards Intelligent Robotic Guide Dogs with Verbal Communication

从Woofs到Words:迈向具备言语交流的智能机器人导盲犬

Yohei Hayamizu, David DeFazio, Hrudayangam Mehta, Zainab Altaweel, Jacqueline Choe, Chao Lin, Jake Juettner, Furui Xiao, Jeremy Blackburn, Shiqi Zhang

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本文提出了一种新型对话系统,通过LLM实现导航计划和场景的言语化,以提升导盲犬在动态环境中的空间感知与人类操作者的协作决策能力。

Comments 10 pages, 6 figures, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏