arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-10 至 2026-03-10 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 13 篇

2510.26909 2026-03-10 cs.RO 85%

NaviTrace: Evaluating Embodied Navigation of Vision-Language Models

NaviTrace: 评估视觉-语言模型的具身导航

Tim Windecker, Manthan Patel, Moritz Reuss, Richard Schwarzkopf, Cesar Cadena, Rudolf Lioutikov, Marco Hutter, Jonas Frey

机构 * Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室) Intuitive Robots Lab, KIT(卡尔斯鲁厄理工学院直观机器人实验室) FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract)

AI总结 NaviTrace通过语义感知轨迹评分评估视觉-语言模型的具身导航能力,揭示了模型在空间定位和目标定位方面的不足。

Comments 11 pages, 6 figures, with appendix, accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08383 2026-03-10 cs.RO 75%

MoMaStage: Skill-State Graph Guided Planning and Closed-Loop Execution for Long-Horizon Indoor Mobile Manipulation

MoMaStage:基于技能-状态图的规划与闭环执行的长时域室内移动操作

Chenxu Li, Zixuan Chen, Yetao Li, Jiapeng Xu, Hongyu Ding, Jieqi Shi, Jing Huo, Yang Gao

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract)

AI总结 MoMaStage通过结构化视觉-语言框架和闭环执行机制,实现长时域室内移动操作的高效规划与执行。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02951 2026-03-10 cs.LG cs.CV 73%

CGL: Advancing Continual GUI Learning via Reinforcement Fine-Tuning

CGL: 通过强化微调推进连续GUI学习

Zhenquan Yao, Zitong Huang, Yihan Zeng, Jianhua Han, Hang Xu, Chun-Mei Feng, Jianwei Ma, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College Dublin(都柏林大学) Peking University(北京大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 CGL通过强化微调与监督微调的协同优化,解决GUI连续学习中遗忘旧任务的问题,提出AndroidControl-CL基准验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08475 2026-03-10 cs.RO cs.AI 70%

R2F: Repurposing Ray Frontiers for LLM-free Object Navigation

R2F:利用射线前沿进行无需大语言模型的对象导航

Francesco Argenziano, John Mark Alexis Marcelo, Michele Brienza, Abdel Hakim Drid, Emanuele Musumeci, Daniele Nardi, Domenico D. Bloisi, Vincenzo Suriani

机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、自动化与管理工程系) Department of Electronics and Automation, Mohamed Khider University of Biskra(比斯克拉Mohamed Khider大学电子与自动化系) International University of Rome UNINT, Rome(罗马国际大学UNINT)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 R2F通过重新利用射线前沿技术,开发无需大语言模型的室内开放词汇对象导航框架,实现实时高效导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09820 2026-03-10 cs.RO cs.AI 70%

ViLAM: Distilling Vision-Language Reasoning into Attention Maps for Social Robot Navigation

ViLAM:将视觉-语言推理转化为注意力图用于社交机器人导航

Mohamed Elnoor, Kasun Weerakoon, Gershom Seneviratne, Jing Liang, Vignesh Rajagopal, Dinesh Manocha

机构 * Dept. of Electrical and Computer Engineering, University of Maryland, College Park, MD, USA(电气与计算机工程系,马里兰大学,College Park, MD, USA) Dept. of Computer Science, University of Maryland, College Park, MD, USA(计算机科学系,马里兰大学,College Park, MD, USA) James Clark School of Engineering, University of Maryland, College Park, MD, USA(James Clark工程学院,马里兰大学,College Park, MD, USA)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 ViLAM通过蒸馏视觉-语言模型的注意力图,提升社交机器人导航的社会适应性与导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06914 2026-03-10 cs.RO 67%

SysNav: Multi-Level Systematic Cooperation Enables Real-World, Cross-Embodiment Object Navigation

SysNav:多级系统性合作实现现实世界跨载体物体导航

Haokun Zhu, Zongtai Li, Zihan Liu, Kevin Guo, Zhengzhi Lin, Yuxin Cai, Guofei Chen, Chen Lv, Wenshan Wang, Jean Oh, Ji Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 SysNav通过多级系统性合作实现现实世界跨载体物体导航,提升复杂环境下的导航效率与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07432 2026-03-10 cs.CV cs.CL cs.HC cs.LG 62%

Generalization in Online Reinforcement Learning for Mobile Agents

移动端智能体在线强化学习中的泛化能力

Li Gu, Zihuan Jiang, Zhixiang Chi, Huan Liu, Ziqiang Wang, Yuanhao Yu, Glen Berseth, Yang Wang

机构 * Mila – Québec AI Institute(魁北克AI研究所) Concordia University(康科迪亚大学) Université de Montréal(蒙特利尔大学) CIFAR AI Chair(CIFAR人工智能主席) University of Toronto(多伦多大学) McMaster University(麦马斯特大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出AndroidWorld-Generalization基准,通过整合GRPO与可扩展回放系统,评估移动端智能体在未见任务实例、模板和应用上的泛化能力,并展示RL在提升性能上的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08289 2026-03-10 cs.CV 57%

Novel Semantic Prompting for Zero-Shot Action Recognition

新颖的语义提示用于零样本动作识别

Salman Iqbal, Waheed Rehman

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SP-CLIP框架,通过结构化语义提示提升零样本动作识别性能,尤其在细粒度和组合动作上表现优异,同时保持模型效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13965 2026-03-10 cs.RO cs.CV 57%

MetricNet: Recovering Metric Scale in Generative Navigation Policies

MetricNet: 恢复生成导航策略中的度量尺度

Abhijeet Nayak, Débora Oliveira Makowski, Samiran Gode, Cordelia Schmid, Wolfram Burgard

机构 * Artificial Intelligence and Robotics Lab, Department of Computer Science and Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系人工智能与机器人实验室) Inria, Ecole Normale Supérieure, CNRS, PSL Research University(法国国家信息与自动化技术研究院、巴黎高等师范学校、国家科学研究中心、巴黎-萨克勒研究大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 MetricNet通过预测航点之间的度量距离,解决生成导航策略中轨迹抽象和控制策略短视的问题,提升导航与探索性能。

Comments Accepted to ICRA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08013 2026-03-10 cs.AI 57%

PIRA-Bench: A Transition from Reactive GUI Agents to GUI-based Proactive Intent Recommendation Agents

PIRA-Bench: 从反应式 GUI 代理到基于 GUI 的主动意图推荐代理的转变

Yuxiang Chai, Shunye Tang, Han Xiao, Rui Liu, Hongsheng Li

机构 * Nankai University(南开大学) Huawei Research(华为研究)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 PIRA-Bench通过引入主动意图推荐代理基准,推动GUI代理从反应式向主动式转变,评估多模态大语言模型在连续弱监督视觉输入中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01763 2026-03-10 cs.CV 57%

HiconAgent: History Context-aware Policy Optimization for GUI Agents

HiconAgent: 历史上下文感知的GUI代理策略优化

Xurui Zhou, Gongwei Chen, Yuquan Xie, Zaijing Li, Kaiwen Zhou, Shuai Wang, Shuo Yang, Zhuotao Tian, Rui Shao

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 HiconAgent通过历史上下文感知策略优化,高效利用历史信息,在GUI导航任务中实现更高的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14117 2026-03-10 cs.RO 50%

GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model

GeoAware-VLA: 基于隐式几何的视觉-语言-动作模型

Ali Abouzeid, Malak Mansour, Qinbo Sun, Zezhou Sun, Dezhen Song

机构 * Department of Robotics, Mohamed bin Zayed University of Artificial Intelligence(机器人系,Mohamed bin Zayed人工智能大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 GeoAware-VLA通过整合几何先验提升视觉-语言-动作模型的视角不变性,显著提高零样本泛化能力,并在现实机器人平台中取得显著效果。

Comments Under Review, Project Page https://alisharey.github.io/GeoAware-VLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00919 2026-03-10 cs.RO 50%

Green-VLA: Staged Vision-Language-Action Model for Generalist Robots

Green-VLA: 通用机器人中的分阶段视觉-语言-动作模型

I. Apanasevich, M. Artemyev, R. Babakyan, P. Fedotova, D. Grankin, E. Kupryashin, A. Misailidi, D. Nerus, A. Nutalapati, G. Sidorov, I. Efremov, M. Gerasyov, D. Pikurov, Y. Senchenko, S. Davidenko, D. Kulikov, M. Sultankin, K. Askarbek, O. Shamanin, D. Statovoy, E. Zalyaev, I. Zorin, A. Letkin, E. Rusakov, A. Silchenko, V. Vorobyov, S. Sobolnikov, A. Postnikov

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 Green-VLA是一种面向真实环境的分阶段视觉-语言-动作模型,通过多阶段训练和强化学习对齐,提升机器人在多样化形态上的泛化能力和性能。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏