arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-20 至 2026-03-20 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2603.12696 2026-03-20 cs.RO cs.CV 70%

HaltNav: Reactive Visual Halting over Lightweight Topological Priors for Robust Vision-Language Navigation

HaltNav: 基于轻量拓扑先验的反应式视觉停止用于鲁棒视觉-语言导航

Zihui Yu, Pingcong Li, Bichi Zhang, Sören Schwertfeger

机构 * SIST, ShanghaiTech University(上海科技大学信息与通信科学核心平台,上海科技大学) Key Laboratory of Intelligent Perception and Human-Machine Collaboration(智能感知与人机协同重点实验室)

专题命中 GUI与屏幕智能体 :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出HaltNav框架,结合轻量拓扑先验与局部探索能力,通过反应式视觉停止机制提升视觉-语言导航的鲁棒性,实验表明其在复杂环境下的表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18091 2026-03-20 cs.CV cs.RO 57%

Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model

动作草稿与验证:一种用于视觉-语言-动作模型的自验证框架

Chen Zhao, Zhuoran Wang, Haoyang Li, Shifeng Bao, Guanlin Li, Youhe Feng, Yang Li, Jie Tang, Jing Zhang

机构 * Key Laboratory of Data Engineering(数据工程与知识工程重点实验室) Tsinghua University(清华大学) Beijing University of Posts(北京邮电大学) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

AI总结 本文提出Action-Draft-and-Verify框架,结合扩散动作专家和VLM,通过单次前向传递选择最优动作片段,提升模拟和现实场景中的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19233 2026-03-20 cs.RO 50%

Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models

并非所有特征都具有同等价值:一种视觉-语言-动作模型的机制研究

Bryce Grant, Xijia Zhao, Peng Wang

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 研究通过激活注入、稀疏自编码器和线性探针分析视觉-语言-动作模型,发现视觉路径主导动作生成,语言敏感性取决于任务结构而非模型设计,且专家路径编码运动程序,VLM路径编码目标语义,释放Action Atlas供探索。

Comments Accepted to Multimodal Intelligence Workshop @ ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏