arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-05 至 2026-08-05 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 9 篇

2608.03270 2026-08-05 cs.CV cs.AI 新提交 92%

GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs

GUI-Lens:面向通用视觉语言模型(VLM)的GUI定位粗到精裁剪框架

Zichuan Fu, Shirong Wang, Wenlin Zhang, Guojing Li, Yimin Deng, Jingtong Gao, Junjia Qi, Hanyu Yan, Yefeng Zheng, Xiaopeng Li, Wanyu Wang, Xian Wu, Xiangyu Zhao

专题命中 GUI与屏幕智能体 :VLM(title_cn,summary_cn);grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 GUI-Lens是面向通用VLM的GUI定位粗到精裁剪框架,通过主动视觉观察逐步聚焦确定目标,在四个基准和三个VLM后端上使定位准确率最高提升24.9个百分点,在GPT-5.5上达SOTA性能。

Comments Preprint. Code: https://github.com/Fzkuji/GUI-Agent-Harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27180 2026-08-05 cs.CV cs.RO 版本更新 89%

HumanCLAW: Can Vision-Language Models Act Through a Body?

HumanCLAW:视觉-语言模型能否通过实体身体执行动作

Li Siyao, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo

机构 * Meta Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学) Brown University(布朗大学) Northwestern University(西北大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出HumanCLAW框架与HumanCLAW-Bench基准,测试9个先进VLM发现其均未解决具身动作任务,最优仅16.8%成功率,核心缺失具身自我意识。

Comments Project page: https://human-claw.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03740 2026-08-05 cs.AI 新提交 79%

MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models

MissClick:利用序列化数字坐标攻击GUI定位模型

Yu Ran, Wentao Zhao, Xin Zhang, Yi Pan

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI

AI总结 本研究提出MissClick攻击方法,针对GUI定位模型设计两种目标的白盒对抗攻击,在OS-Atlas和UGround数据集上大幅提升无目标与有目标攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03474 2026-08-05 cs.CV 新提交 77%

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试

Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03143 2026-08-05 cs.CV cs.RO 新提交 70%

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

从路线到步骤:在视觉语言导航中分离语义进展与局部执行

Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对视觉语言导航中进展与执行错误难区分的问题,提出Route2Step框架,通过步骤级接口分离语义进展跟踪与动作生成,在R2R-CE数据集上显著提升了导航性能,且在真实环境中具备实用性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03052 2026-08-05 cs.RO 新提交 67%

How Should Vision-Language-Action Models Use Proprioceptive State?

视觉-语言-动作(VLA)模型应如何使用本体感受状态?

Yiren Zhao, Ziyang Chen, Ziyang Rao, Pengteng Li, He Zhang, Weiyu Guo, Yandong Guo, Rushi Dai

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 本研究针对视觉-语言-动作(VLA)模型的本体感受状态接入方式开展受控实验,探究状态接入位置、历史长度等问题,得出系统性答案并提炼为可验证的VLA模型设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03148 2026-08-05 cs.LG cs.AI 新提交 62%

Lightweight Chunk Selection for Mobile Retrieval-Augmented Generation

面向移动端检索增强生成的轻量级分块选择

Sicong Chang, Yidan Shen, Wen Yu, Jiefu Chen, Xin Fu, Renjie Hu

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文针对移动端RAG部署的成本问题,提出结合LLM侧查询意图、MoE路由信号与检索分块嵌入的轻量级分块选择方法,提升了排名1的证据选择性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03244 2026-08-05 cs.AI 新提交 57%

UniNav: A Unified World-Action Diffusion Model for Visual Navigation

UniNav:用于视觉导航的统一世界-动作扩散模型

Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02643 2026-08-05 cs.SE cs.AI 新提交 57%

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

CUADebug:计算机使用智能体故障的诊断与修复

Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。

Comments 23 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏