arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-10 至 2026-04-10 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 10 篇

2604.08294 2026-04-10 cs.CV cs.AI cs.CL 86%

Can Vision Language Models Judge Action Quality? An Empirical Evaluation

视觉语言模型能否评判动作质量?一项实证评估

Miguel Monte e Freitas, Rui Henriques, Ricardo Rei, Pedro Henrique Martins

机构 * Sword Health Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) INESC-ID(INESC-ID研究所)

专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文评估了视觉语言模型在动作质量评估中的表现,发现现有模型在多个领域仅略高于随机水平,且存在预测偏差,提示细粒度动作质量评估存在根本性困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07705 2026-04-10 cs.RO 75%

Vision-Language Navigation for Aerial Robots: Towards the Era of Large Language Models

面向大语言模型时代的空中机器人视觉-语言导航

Xingyu Xia, Lekai Zhou, Yujie Tang, Xiaozhou Zhu, Hai Zhu, Wen Yao

机构 * Defense Innovation Institute, Chinese Academy of Military Sciences(军事科学院国防创新研究院) Intelligent Game and Decision Laboratory(智能博弈与决策实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract)

AI总结 本文综述了空中机器人视觉-语言导航领域,分析了大语言模型与视觉-语言模型的整合,归纳了五类架构方法,指出了评估体系的不足,并提出了七个开放性问题。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07957 2026-04-10 cs.AI cs.CV cs.RO 73%

WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models

WorldMAP: 通过生成世界模型提升视觉-语言导航轨迹预测

Hongjin Chen, Shangyun Jiang, Tonghua Su, Chen Gao, Xinlei Chen, Yong Li, Zhibo Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong University(山东大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 WorldMAP通过生成世界模型与教师-学生框架,将生成的未来场景转化为语义空间结构和规划监督,提升导航轨迹预测的稳定性与准确性,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07429 2026-04-10 cs.CV cs.AI cs.HC 73%

GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents

GameWorld: 向标准化和可验证的多模态游戏代理评估迈进

Mingyu Ouyang, Siyuan Hu, Kevin Qinghong Lin, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 GameWorld提出一个标准化且可验证的多模态游戏代理评估基准,包含34种游戏和170个任务,通过可验证的指标评估代理能力,揭示了当前代理在视频游戏中与人类能力的差距。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25044 2026-04-10 cs.RO 67%

ThermoAct:Thermal-Aware Vision-Language-Action Models for Robotic Perception and Decision-Making

ThermoAct:面向机器人感知与决策的热感知视觉-语言-动作模型

Young-Chae Son, Dae-Kwan Ko, Yoon-Ji Choi, Soo-Chul Lim

机构 * Dongguk University(东国大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出一种融合热信息的视觉-语言-动作框架,通过高阶规划器解析自然语言指令并分解为子任务,提升机器人复杂操作的执行效率与安全性。

Comments 2026 RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11724 2026-04-10 cs.SE 67%

WebTestPilot: Agentic End-to-End Web Testing against Natural Language Specification by Inferring Oracles with Symbolized GUI Elements

WebTestPilot: 通过符号化GUI元素推断或acles实现基于自然语言规范的端到端Web测试

Xiwen Teoh, Yun Lin, Duc-Minh Nguyen, Ruofei Ren, Wenjie Zhang, Jin Song Dong

专题命中 GUI与屏幕智能体 :VLM(abstract);visual language model(abstract)

AI总结 WebTestPilot通过符号化GUI元素推断隐式或acles,解决自然语言规范下的端到端Web测试中的隐式或acles推断和概率推理挑战,实现99%的任务完成率和高精度召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08516 2026-04-10 cs.CV 57%

MolmoWeb: Open Visual Web Agent and Open Data for the Open Web

MolmoWeb:开放视觉网络代理和开放数据用于开放网络

Tanmay Gupta, Piper Wolters, Zixian Ma, Peter Sushko, Rock Yuren Pang, Diego Llanes, Yue Yang, Taira Anderson, Boyuan Zheng, Zhongzheng Ren, Harsh Trivedi, Taylor Blanton, Caleb Ouellette, Winson Han, Ali Farhadi, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出MolmoWeb,一个开放的多模态网络代理,通过公开的浏览器任务演示和网页GUI感知数据,实现状态-of-the-art的网络代理性能,促进开放研究。

Comments https://allenai.org/blog/molmoweb

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07809 2026-04-10 cs.CR cs.AI 57%

Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents

对人类不可见,由智能体触发:针对移动视觉-语言智能体的隐秘劫持攻击

Renhua Ding, Xiao Yang, Zhengwei Fang, Jun Luo, Kun He, Jun Zhu

机构 * School of Computer Science, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、清华-博世机器学习联合中心、清华脑与智能实验室、北京国家信息科学与技术研究中心)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种隐秘的劫持攻击方法,通过智能体交互时的感知注入,避免被人类察觉,同时在移动设备上有效绕过安全过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09928 2026-04-10 cs.RO 50%

HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models

HiF-VLA:通过运动表示实现视觉-语言-动作模型的回顾、洞察与前瞻性

Minghui Lin, Pengxiang Ding, Shu Wang, Zifeng Zhuang, Yang Liu, Xinyang Tong, Wenxuan Song, Shangke Lyu, Siteng Huang, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学) Westlake Robotics(西湖机器人)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 HiF-VLA通过运动表示提升视觉-语言-动作模型的时序推理能力,采用回顾、洞察和前瞻性机制,在长时域任务中表现优异,且推理延迟低。

Comments CVPR 2026, Project page: https://hifvla.github.io, Github: https://github.com/OpenHelix-Team/HiF-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07767 2026-04-10 cs.DC 50%

Administrative Decentralization in Edge-Cloud Multi-Agent for Mobile Automation

边缘-云多智能体中的行政去中心化

Senyao Li, Zhigang Zuo, Haozhao Wang, Junyu Chen, Zhanbo Jin, Ruixuan LI

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本文提出AdecPilot,通过将行政去中心化原则应用于边缘-云多智能体框架,实现边缘代理的重新定义,提升任务成功率并降低云资源消耗与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏