arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-06 至 2026-03-06 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 2 篇

2508.02338 2026-03-06 cs.SE cs.RO 82%

Vision Language Model-based Testing of Industrial Autonomous Mobile Robots

基于视觉语言模型的工业自主移动机器人测试

Jiahui Wu, Chengjie Lu, Aitor Arrieta, Shaukat Ali, Thomas Peyrucain

机构 * Simula Research Laboratory and University of Oslo(Simula研究实验室和奥斯陆大学) Mondragon University(蒙dragon大学) Simula Research Laboratory(Simula研究实验室) PAL Robotics(PAL机器人技术)

专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(abstract)

AI总结 本文提出基于视觉语言模型的测试方法,用于生成违反功能和安全要求的机器人交互场景,以提高自主移动机器人在复杂环境中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20333 2026-03-06 cs.CR cs.AI 57%

GhostEI-Bench: Do Mobile Agents Resilience to Environmental Injection in Dynamic On-Device Environments?

GhostEI-Bench: 移动代理在动态设备环境中的环境注入鲁棒性研究

Chiyu Chen, Xinhao Song, Yunkai Chai, Yang Yao, Haodong Zhao, Lijun Li, Jie Li, Yan Teng, Gongshen Liu, Yingchun Wang

机构 * Shanghai Jiao Tong University, School of Computer Science(上海交通大学计算机科学学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 GhostEI-Bench通过动态环境注入攻击评估移动代理的鲁棒性,揭示现有模型对欺骗性UI的脆弱性,并提供量化和缓解该威胁的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏