arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-12 至 2026-05-12 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 7 篇

2605.00642 2026-05-12 cs.AI cs.CV 81%

Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding

从自身学习点击位置:面向GUI定位的在线自蒸馏

Yan Zhang, Daiqing Wu, Huawen Shen, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GUI-SD框架,通过视觉增强上下文和熵引导蒸馏提升GUI定位性能,实验显示其在准确性和训练效率上优于现有方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09497 2026-05-12 cs.AI cs.CR 77%

Don't Click That: Teaching Web Agents to Resist Deceptive Interfaces

别点那个:教网络代理抵抗欺骗界面

Yilin Zhang, Yingkai Hua, Chunyu Wei, Xin Wang, Yueguo Chen

机构 * Renmin University of China(中国人民大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出DUDE框架,通过混合奖励学习和不对称惩罚,结合经验总结,提升网络代理对欺骗界面的抵抗力,实验显示欺骗敏感度降低53.8%。

Comments Accepted to ACL 2026 Main Conference. 23 pages, 8 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10925 2026-05-12 cs.RO 67%

PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models

PriorVLA: 为视觉-语言-动作模型保留先验进行适应

Xinyu Guo, Bin Xie, Wei Chai, Xianchi Deng, Tiancai Wang, Zhengxing Wu, Xingyu Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dexmal University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 PriorVLA通过保留预训练先验和学习有效适应方法,在机器人操作任务中实现了比全微调和现有基线更好的性能,特别是在分布外和少样本情况下表现更优。

Comments 32 pages. Project page: https://priorvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13451 2026-05-12 cs.RO 67%

MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation

MapNav: 一种通过标注语义地图的新型记忆表示方法用于视觉-语言导航

Lingfeng Zhang, Xiaoshuai Hao, Qinwen Xu, Qiang Zhang, Xinyao Zhang, Pengwei Wang, Jing Zhang, Zhongyuan Wang, Shanghang Zhang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Beijing Innovation Center of Humanoid Robotics Co., Ltd.(北京人形机器人创新中心有限公司) School of Computer Science, Wuhan University(武汉大学计算机学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机学院)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 本文提出MapNav,通过标注语义地图替代传统历史帧,提升视觉-语言导航任务的性能,实验表明其在模拟和现实环境中均达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09528 2026-05-12 cs.AI 57%

Cplus2ASP: Computing Action Language C+ in Answer Set Programming

Cplus2ASP:在答案集编程中计算动作语言C+

Joseph Babb, Joohyung Lee

机构 * School of Computing, Informatics, and Decision Systems Engineering(计算、信息与决策系统工程学院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 Cplus2ASP 2.0实现了动作语言C+的确定性片段,通过现代答案集求解技术提升效率,结合多种理论成果,利用工具链实现C+到ICLingo的翻译,并支持扩展多模态翻译。

Journal ref In Proceedings of the 12th International Conference on Logic Programming and Nonmonotonic Reasoning (LPNMR 2013), 122-134, 2013

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00884 2026-05-12 cs.CV 57%

LiteVLA-H: Dual-Rate Vision-Language-Action Inference for Onboard Aerial Guidance and Semantic Perception

LiteVLA-H: 双速率视觉-语言-动作推断用于机载空中引导与语义感知

Justin williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

机构 * Department of Cyber Physical Systems, Clark Atlanta University(克劳克阿特拉大学网络物理系统系)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 LiteVLA-H通过双速率操作在边缘设备上实现高效视觉-语言-动作推断,兼顾快速动作输出与语义理解,提升空中引导与场景感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10118 2026-05-12 cs.RO 50%

Plan in Sandbox, Navigate in Open Worlds: Learning Physics-Grounded Abstracted Experience for Embodied Navigation

沙盒计划,开放世界导航:学习物理基础的抽象经验以实现具身导航

Zhixuan Shen, Jiawei Du, Ziyu Guo, Han Luo, Lilan Peng, Joey Tianyi Zhou, Haonan Luo, Tianrui Li

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University, China(计算机与人工智能学院,西南交通大学,中国) Centre for Frontier AI Research A*STAR, Singapore(前沿人工智能研究A*STAR中心,新加坡) School of Computer Science, University of Leeds, UK(计算机科学学院,利兹大学,英国)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出SAGE框架,通过物理基础的语义抽象学习,提升具身导航性能,在A-EQA任务中取得53.21%的成功率,且在物理室内机器人部署中表现良好。

Comments 28 pages, 15 figures, Extended Version of accepted ICML 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏