arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-19 至 2026-08-19 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 5 篇

2608.17512 2026-08-19 cs.RO 新提交 75%

Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation

具身导航器:指向、思考、记忆与对齐以实现高效导航

Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie, Yuxiang Cui, Zhongxiang Zhou, Rong Xiong, Wenqi Zhang, Jianwei Yin, Yueting Zhuang, Xuhong Zhang

机构 * ZJU(浙江大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本研究提出具身导航框架TAMP-Nav,通过像素转3D动作、选择性推理记忆与GRPO两级对齐,在R2R-CE数据集上实现66.2% SR,仅需90k训练轨迹,达成高效具身导航的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17318 2026-08-19 cs.CV cs.RO 新提交 70%

If, Then, Otherwise: Diagnosing Conditional Branching in Vision-Language Navigation

如果、那么、否则:诊断视觉-语言导航中的条件分支

Seoyoung Lee, Neel P. Bhatt, Pranay Samineni, Cong Liu, S P Sharan, Timothy Barclay, Gregory M. Wagner, Daniel Milan, Sandeep Chinchali, Ufuk Topcu, Atlas Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Collins Aerospace(柯林斯航空航天公司)

专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 针对视觉-语言导航智能体的条件分支诊断需求,提出基于场景图的基准CondVLN及轻量级神经符号分支选择模型,可暴露智能体的逻辑决策失败并提升性能2倍。

Comments 11 pages, 1 figure, 3 tables. Project page: this https URL (https://condvln.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17453 2026-08-19 cs.RO 新提交 67%

EATR-Stereo: Embodiment-Aware Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control

EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知配对立体证据路由

Songwei Wu, Rui Zhao, Fan Yang, Zhongqiang Nie, Zhiduo Jiang, Wandong Sun, Yuwei Li, Yang Liu, Hong Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn)

AI总结 EATR-Stereo是具身感知的令牌路由框架,在冻结预训练VLA模型的前提下,通过选择性路由配对立体证据,提升了人形机器人长时程视觉-语言-动作控制的任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18046 2026-08-19 cs.LG 版本更新 57%

SEE: Structure-aware Exploring & Exploiting for Long-horizon GUI Agent Trajectory Synthesis

SEE:用于长视野GUI代理轨迹合成的结构感知探索与利用

Zhuohang Fan, Beichen Zhang, Yuanfa Li, Changqiao Wu, Wei Liu, Jian Luan, Weigang Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 针对GUI代理轨迹合成中缺乏高覆盖率长视野轨迹的问题,提出SEE两阶段数据合成框架,通过高效探索和基于图的合成,产生可重复可解释数据,避免虚假循环,提升代理任务成功率和泛化能力,还将发布代码和数据集。

Comments Accepted (Oral) by ACM International Conference on Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17774 2026-08-19 eess.SY eess.SP 新提交 50%

Edge-Native Embodied Intelligence for Action-Aware Wireless Edge Networks

面向动作感知无线边缘网络的边缘原生具身智能

Yiru Wang, Chuanao Jiang, Jiahui Cui, Zide Fan, Lei Wang, Zehui Xiong, Dong In Kim

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 该研究提出边缘原生具身智能(ENEI)框架,整合6G技术与具身智能,通过双向循环解决具身智能部署的资源与延迟问题,经案例验证可支撑自适应具身无线系统。

详情

展开后加载摘要…

URL PDF HTML 收藏