arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-15 至 2026-04-15 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 6 篇

2602.11236 2026-04-15 cs.CV cs.CL cs.RO 70%

ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning

ABot-M0:基于动作流形学习的机器人操控VLA基础模型

Yandan Yang, Shuang Zeng, Tong Lin, Xinyuan Chang, Dekang Qi, Junjin Xiao, Haoyun Liu, Ronghan Chen, Yuzhi Chen, Dongjie Huo, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

机构 * AMAP CV Lab(AMAP视觉实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 ABot-M0通过统一预训练和动作流形学习,提升机器人操控的泛化能力与效率,构建了大规模数据集并支持模块化感知。

Comments Project website: https://amap-cvlab.github.io/ABot-Manipulation/ . Code: https://github.com/amap-cvlab/ABot-Manipulation . 22 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05295 2026-04-15 cs.AI cs.CV 62%

WebChain: A Large-Scale Human-Annotated Dataset of Real-World Web Interaction Traces

WebChain:一个大规模的人工标注的真实世界网页交互轨迹数据集

Sicheng Fan, Rui Wan, Yifei Leng, Gaoning Liang, Li Ling, Yanyi Shang, Dehan Kong

机构 * Fudan University(复旦大学) IMean AI WebAgentLab

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出WebChain数据集,包含31,725条轨迹和318k步,通过视觉、结构和动作数据的三元对齐提供多模态监督,提出双中层训练方法,实现了WebChainBench等公开GUI基准的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24168 2026-04-15 cs.AI 57%

MGA: Memory-Driven GUI Agent for Observation-Centric Interaction

MGA:基于记忆的GUI代理用于以观察为中心的交互

Weihua Cheng, Junming Liu, Yifei Sun, Botian Shi, Yirong Chen, Ding Wang

机构 * Shanghai Tech University(上海科技大学) Tongji University(同济大学) East China University of Science and Technology(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 MGA通过解耦长周期轨迹和结构化状态记忆机制,减少认知负担和系统复杂度,实现高效的GUI自动化。

Comments Submitted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10073 2026-04-15 cs.CR cs.CV 57%

SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web Agents

SecureWebArena: 一个针对基于大视觉-语言模型的Web代理的综合安全评估基准

Zonghao Ying, Yangguang Shao, Jianle Gan, Gan Xu, Wenxin Zhang, Quanchen Zou, Junzheng Shi, Zhenfei Yin, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * SKLCCSE, Beihang University(北京航空航天大学安全实验室) Institute of Information Engineering, CAS(中国科学院信息工程研究所) China University of Petroleum (East China)(中国石油大学(华东)) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Science(中国科学院大学) AI Security Lab(360人工智能安全实验室) The University of Sydney(悉尼大学) Henan University of Science and Technology(河南理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SecureWebArena,首个针对基于大视觉-语言模型的Web代理安全性的综合评估基准,通过六个真实模拟的Web环境和2970条高质量轨迹,分析代理在内部推理、行为轨迹和任务结果三个维度上的安全风险。

Comments ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12831 2026-04-15 cs.RO 50%

VULCAN: Vision-Language-Model Enhanced Multi-Agent Cooperative Navigation for Indoor Fire-Disaster Response

VULCAN:基于视觉-语言模型的多智能体协作导航用于室内火灾应急响应

Shengding Liu, Qiben Yan

机构 * Computer Science \& Engineering Michigan State University East Lansing, MI, USA

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出VULCAN框架,结合多模态感知与视觉语言模型,解决火灾环境下多智能体协作导航的挑战,通过模拟真实火灾场景评估现有方法的失效模式,强调鲁棒感知与危险意识规划的重要性。

Comments INFOCOM EIN Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12284 2026-04-15 cs.CR 50%

WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents

WebAgentGuard: 一种基于推理的守护模型,用于检测Web代理中的提示注入攻击

Yulin Chen, Tri Cao, Haoran Li, Yue Liu, Yibo Li, Yufei He, Le Minh Khoi, Yangqiu Song, Shuicheng Yan, Bryan Hooi

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出WebAgentGuard,一种基于推理的多模态守护模型,用于检测Web代理中的提示注入攻击。通过构建合成多模态数据集并采用推理密集型监督微调和强化学习,模型在多个基准测试中优于现有方法,同时保持代理的实用性,不引入额外延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏