arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-12 至 2026-03-12 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 5 篇

2603.10682 2026-03-12 cs.RO 67%

OnFly: Onboard Zero-Shot Aerial Vision-Language Navigation toward Safety and Efficiency

OnFly:面向安全与效率的机载零样本空中视觉语言导航

Guiyong Zheng, Yueting Ban, Mingjie Zhang, Juepeng Zheng, Boyu Zhou

机构 * School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 OnFly通过共享感知双智能体架构和混合记忆机制,实现高效稳定的零样本空中视觉语言导航,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10616 2026-03-12 cs.RO 67%

AdaClearGrasp: Learning Adaptive Clearing for Zero-Shot Robust Dexterous Grasping in Densely Cluttered Environments

AdaClearGrasp: 学习自适应清除以实现零样本鲁棒灵巧抓取在密集障碍环境中

Zixuan Chen, Wenquan Zhang, Jing Fang, Ruiming Zeng, Zhixuan Xu, Yiwen Hou, Xinke Wang, Jieqi Shi, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学) Nanjing University of Posts and Telecommunications(南京邮电大学) National University of Singapore(新加坡国立大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 AdaClearGrasp通过自适应清除与零样本灵巧抓取技术,提升机器人在密集障碍环境中的抓取成功率。

Comments 12 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18810 2026-03-12 cs.RO 67%

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

MergeVLA: 朝着通用视觉-语言-动作代理的跨技能模型合并

Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 MergeVLA通过设计保留模型合并性,利用稀疏激活的LoRA适配器和跨注意力机制,实现多技能任务的高效泛化。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10340 2026-03-12 cs.CV cs.AI cs.RO cs.SY eess.SY 62%

Overcoming Visual Clutter in Vision Language Action Models via Concept-Gated Visual Distillation

通过概念门控视觉蒸馏克服视觉杂乱

Sangmim Song, Sarath Kodagoda, Marc Carmichael, Karthick Thiyagarajan

机构 * University of Technology Sydney(技术大学悉尼大学) Western Sydney University(西悉尼大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出概念门控视觉蒸馏方法,通过视觉蒸馏技术解决杂乱环境中视觉语言动作模型的精度-推理间隙问题,显著提升机器人操作的成功率。

Comments 7 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10291 2026-03-12 cs.AI cs.LG 62%

Hybrid Self-evolving Structured Memory for GUI Agents

混合自进化结构记忆用于GUI代理

Sibo Zhu, Wenyi Wu, Kun Zhou, Stephen Wang, Biwei Huang

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 HyMEM通过结合离散符号节点与连续轨迹嵌入,提升GUI代理的结构化记忆与自进化能力,使开源模型性能超越闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏