arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-04 至 2026-05-04 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 4 篇

2602.14276 2026-05-04 cs.CV 85%

ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision

ScreenParse:超越稀疏标注的完整屏幕解析监督

A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar

机构 * IBM Research Zurich, Zurich, Switzerland(IBM苏黎世研究实验室,瑞士苏黎世) ETH Zurich, Computer Vision(苏黎世联邦理工学院,计算机视觉) ETH AI Center, Switzerland(苏黎世联邦理工学院人工智能中心,瑞士) ETH Zurich, Photogrammetry(苏黎世联邦理工学院,摄影测量学) Microsoft, Switzerland(微软公司,瑞士)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ScreenParse通过大规模完整屏幕解析标注,训练出性能优异的ScreenVLM模型,显著提升了密集解析能力和迁移表现。

Comments Accepted at ICML 2026. 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07669 2026-05-04 cs.LG cs.AI cs.CE 62%

Reinforcement Learning with LLM-Guided Action Spaces for Synthesizable Lead Optimization

基于LLM引导的动作空间的强化学习用于可合成先导优化

Tao Li, Kaiyuan Hou, Tuan Vinh, Monika Raj, Zhichun Guo, Carl Yang

机构 * Emory University(埃默里大学) University of Oxford(牛津大学) Independent Researcher(独立研究者)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolReAct框架,通过合成约束的动作空间和GRPO算法优化先导分子,提升性质同时保证合成可行性,实现高效分子生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00551 2026-05-04 cs.CL cs.AI 57%

A11y-Compressor: A Framework for Enhancing the Efficiency of GUI Agent Observations through Visual Context Reconstruction and Redundancy Reduction

A11y-Compressor:通过视觉上下文重建和冗余减少提升GUI代理观察效率的框架

Michito Takeshita, Takuro Kawada, Takumi Ohashi, Shunsuke Kitada, Hitoshi Iyatomi

机构 * Hosei University(Hosei大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本文提出A11y-Compressor框架,通过视觉上下文重建和冗余减少技术,将线性化可访问性树转换为紧凑结构化表示,实验表明其在OSWorld基准测试中将输入token减少至原22%,任务成功率提升5.1个百分点。

Comments 18 pages, 5 figures, 5 tables. Accepted to ACL SRW 2026. Project page: https://iyatomilab.github.io/a11y-compressor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14093 2026-05-04 cs.RO cs.CL cs.CV 57%

A Survey on Vision-Language-Action Models for Embodied AI

具身人工智能中视觉-语言-动作模型的综述

Yueen Ma, Zixing Song, Yuzheng Zhuang, Jianye Hao, Irwin King

机构 * Chinese University of Hong Kong(香港中文大学) University of Bristol(布里斯托大学) Huawei Noah’s Ark Laboratory(华为诺亚实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文综述了具身人工智能中视觉-语言-动作模型的发展,探讨了其在机器人任务中的应用,分类了三种主要研究方向,并讨论了面临的挑战与未来方向。

Comments Project page: https://github.com/yueen-ma/Awesome-VLA

Journal ref IEEE Transactions on Neural Networks and Learning Systems (Early Access), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏