arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-01 至 2026-06-01 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 6 篇

2605.30884 2026-06-01 cs.CV 79%

GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning

GUI-C$^2$:基于难度感知强化学习的由粗到细GUI定位

Junlong Li, Chao Hao, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV

AI总结 提出GUI-C$^2$框架,通过难度感知数据筛选和由粗到细的强化学习机制,解决GUI定位中训练样本难度不均和视觉区域裁剪权衡问题,实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28646 2026-06-01 cs.CR cs.CL 67%

MaskClaw: Edge-Side Personalized Privacy Arbitration for GUI Agents with Behavior-Driven Skill Evolution

MaskClaw: GUI代理的边端个性化隐私仲裁与行为驱动技能进化

Yanqiu Zhao, Dongying Zheng, Kaibo Huang, Yukun Wei, Zhongliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 提出MaskClaw,一种在边端进行隐私仲裁的GUI代理框架,通过本地视觉证据提取、策略记忆检索和沙箱门控的技能进化,在截图离开信任环境前决定允许、遮蔽或询问,解决了静态PII检测和云端推理的隐私边界问题。

Comments Preprint. Submitted to EMNLP 2026. 21 pages, including appendices; 5 figures Under review. Yanqiu Zhao and Dongying Zheng contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31041 2026-06-01 cs.CV cs.AI 62%

Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?

视觉信息在视觉-语言-动作模型驾驶行为中是否起决定性作用?

Jingtao He, Hongliang Lu, Xiaoyun Qiu, Yixuan Wang, Xinhu Zheng

机构 * Intelligent Transportation Thrust, The Hong Kong University of Science and Technology (Guangzhou)(科技与交通智能 thrust,香港科学与技术大学(广州))

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结构化多级视觉扰动框架,系统分析VLA驾驶模型对视觉信息的依赖程度,揭示依赖模式随评估方式变化且在不同抽象层次上不均匀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31365 2026-06-01 cs.AI 57%

Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration

学习适应:通过认知感知探索实现自我改进的网络智能体

Weile Chen, Bingchen Miao, Qifan Yu, Wendong Bu, Guoming Wang, Wenqiao Zhang, Shengyu Zhang, Juncheng Li, Siliang Tang

机构 * Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 提出SCALE框架,利用选择器、预测器和评判器三个对抗角色,通过环境探索自主发现智能体局限性并扩展认知边界,结合SCALE-Hop图探索策略和SCALE-20k数据集,显著提升多模态大语言模型在多种网络环境中的性能和泛化能力。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17111 2026-06-01 cs.RO cs.LG 57%

Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey

面向具身操作的高效视觉-语言-动作模型:系统综述

Weifan Guan, Qinghao Hu, Aosheng Li, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) AiRiA Nanjing University of Information Science and Technology(南京信息科学技术大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 本文系统综述了通过模型架构、感知特征、动作生成和训练/推理策略四个维度降低视觉-语言-动作模型延迟、内存占用及计算成本的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10432 2026-06-01 cs.RO 50%

AnySlot: Goal-Conditioned Vision-Language-Action Policies for Zero-Shot Slot-Level Placement

AnySlot: 用于零样本槽级放置的目标条件视觉-语言-动作策略

Zhaofeng Hu, Sifan Zhou, Qinbo Zhang, Rongtao Xu, Qi Su, Jorge Mendez-Mendz, Ci-Jyun Liang

机构 * Stony Brook University(石溪大学) Carnegie Mellon University(卡内基梅隆大学) MBZUAI Peking University(北京大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 提出AnySlot框架,通过将语言指令转化为空间视觉目标,解耦高层槽选择与低层执行,实现零样本槽级精确放置。

详情

展开后加载摘要…

URL PDF HTML 收藏