arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-09 至 2026-04-09 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2507.22025 2026-04-09 cs.AI cs.CL cs.CV 84%

UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding

UI-AGILE: 通过有效的强化学习和精确的推理时间接地提升GUI代理

Shuquan Lian, Yuhang Wu, Jia Ma, Yifan Ding, Zihan Song, Bingqi Chen, Xiawu Zheng, Hui Li, Rongrong Ji

机构 * Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 UI-AGILE通过改进监督微调过程和推理中的分解接地,提升了GUI代理的接地性能和通用能力,在ScreenSpot-Pro和ScreenSpot-v2基准上实现了最佳表现,地面准确率提升23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05477 2026-04-09 cs.RO 78%

Trust Through Transparency: Explainable Social Navigation for Autonomous Mobile Robots via Vision-Language Models

通过透明实现信任:通过视觉语言模型实现自主移动机器人的可解释社交导航

Oluwadamilola Sotomi, Devika Kodi, Aliasghar Arab

机构 * New York University, Tandon School of Engineering(纽约大学坦登工程学院) General Autonomy Inc.(通用自主公司)

专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract)

AI总结 本文提出一种多模态可解释模块,结合视觉语言模型和热图提升自主导航的透明度,通过自然语言总结使机器人感知、分析并表达观察结果,实验表明实时解释能提升用户信任和理解。

Comments Submitted to IEEE Conferences

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13200 2026-04-09 cs.HC 67%

Navig-AI-tion: Navigation by Contextual AI and Spatial Audio

导航-AI:通过上下文AI和空间音频进行导航

Mathias N. Lystbæk, Haley Adams, Ranjith Kagathi Ananda, Eric J Gonzalez, Luca Ballan, Qiuxuan Wu, Andrea Colaço, Peter Tan, Mar Gonzalez-Franco

专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract)

AI总结 本文提出结合视觉语言模型与空间音频的导航系统,通过环境地标锚定指令并提供方向性空间音频信号,提升导航准确性与用户体验。

Comments 5 pages, 2 figures, to be published in Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26), 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏