arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1561 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1561 篇

2502.06631 2026-06-30 cs.CV cs.AI 84%

Conformal Predictions for Human Action Recognition with Vision-Language Models

基于视觉-语言模型的人类动作识别中的置信域预测

Bary Tim, Fuchs Clément, Macq Benoît

机构 * ICTEAM, UCLouvain(鲁汶大学(法语区)ICTEAM研究所)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了如何利用置信域预测技术提升基于视觉-语言模型的人类动作识别系统可靠性,通过调整softmax温度参数减少候选类别数量,缓解长尾分布影响。

Comments 6 pages, 7 figures, Accepted to ICIP 2025 Workshops

Journal ref 2025 IEEE International Conference on Image Processing Workshops (ICIPW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22025 2026-04-09 cs.AI cs.CL cs.CV 84%

UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding

UI-AGILE: 通过有效的强化学习和精确的推理时间接地提升GUI代理

Shuquan Lian, Yuhang Wu, Jia Ma, Yifan Ding, Zihan Song, Bingqi Chen, Xiawu Zheng, Hui Li, Rongrong Ji

机构 * Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 UI-AGILE通过改进监督微调过程和推理中的分解接地,提升了GUI代理的接地性能和通用能力,在ScreenSpot-Pro和ScreenSpot-v2基准上实现了最佳表现,地面准确率提升23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26211 2026-03-30 cs.CV cs.AI 84%

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10835 2026-01-19 cs.CV cs.AI 84%

Can Vision-Language Models Understand Construction Workers? An Exploratory Study

视觉-语言模型能理解建筑工人吗?一项探索性研究

Hieu Bui, Nathaniel E. Chodosh, Arash Tavakoli

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Villanova University(维拉诺瓦大学) Department of Computing Sciences(计算科学系) Department of Civil and Environmental Engineering(土木与环境工程系)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本研究评估了三种视觉-语言模型在识别建筑工人行为和情绪方面的性能,发现GPT-4o表现最佳,但需进一步改进以提高实际应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03928 2026-01-08 cs.CV cs.AI cs.CL cs.HC 84%

FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection

FocusUI: 通过位置保持的视觉标记选择实现高效的UI接地

Mingyu Ouyang, Kevin Qinghong Lin, Mike Zheng Shou, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 FocusUI通过位置保持的视觉标记选择实现高效UI接地,有效减少冗余标记并保持位置连续性,提升推理效率和性能。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20737 2025-12-01 cs.CV cs.AI cs.CL 84%

CANVAS: A Benchmark for Vision-Language Models on Tool-Based User Interface Design

CANVAS:基于工具的用户界面设计的视觉-语言模型基准

Daeheon Jeong, Seoyeon Byun, Kihoon Son, Dae Hyun Kim, Juho Kim

专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 CANVAS是一个用于评估视觉-语言模型在基于工具的用户界面设计任务中性能的基准,通过复制和修改UI设计任务来测试模型的工具调用能力和设计质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12937 2025-11-26 cs.AI cs.CV 84%

Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models

Yanyun-3: 通过视觉-语言模型实现跨平台战略游戏操作

Guoyan Wang, Yanyan Huang, Chunlin Chen, Lifeng Wang, Yuxiang Sun

专题命中 GUI与屏幕智能体 :vision-language model(title);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 Yanyun-3通过整合视觉-语言模型和结构化多模态数据组织,实现了跨平台战略游戏操作的自动化,提升了任务执行效率和泛化能力。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13087 2025-11-18 cs.AI cs.CV 84%

MEGA-GUI: Multi-stage Enhanced Grounding Agents for GUI Elements

SeokJoo Kwak, Jihoon Kim, Boyoun Kim, Jung Jae Yoon, Wooseok Jang, Jeonghoon Hong, Jaeho Yang, Yeong-Dae Kwon

机构 * Samsung SDS(三星SDS)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 26 pages, 7 figures. Code available at https://github.com/samsungsds-research-papers/mega-gui

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02787 2025-10-29 cs.CV cs.AI cs.CL 84%

Navigation with VLM framework: Towards Going to Any Language

Zecheng Yin, Chonghao Cheng, and Yao Guo, Zhen Li

机构 * Future Network of Intelligence Institute(Shenzhen)(智能未来网络研究所(深圳)) University of Technology Sydney(悉尼技术大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hongkong(Shenzhen)(香港中文大学(深圳))

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24361 2025-10-01 cs.CV cs.AI cs.HC 84%

UI-UG: A Unified MLLM for UI Understanding and Generation

Hao Yang, Weijie Qiu, Ru Zhang, Zhou Fang, Ruichao Mao, Xiaoyu Lin, Maji Huang, Zhaosong Huang, Teng Guo, Shuoyang Liu, Hai Rao

专题命中 GUI与屏幕智能体 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16452 2025-09-23 cs.CV cs.AI 84%

KRAST: Knowledge-Augmented Robotic Action Recognition with Structured Text for Vision-Language Models

Son Hai Nguyen, Diwei Wang, Jinhyeok Jang, Hyewon Seo

机构 * ETRI(韩国科学技术院)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01062 2025-09-16 cs.LG cs.AI 84%

Offline RLAIF: Piloting VLM Feedback for RL via SFO

Jacob Beck

机构 * Jacob Beck 1

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

Comments Code is provided at https://github.com/jacooba/OfflineRLAIF

Journal ref Published at The RLC 2025 Workshop on Reinforcement Learning Beyond Rewards: Ingredients for Developing Generalist Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04280 2025-08-07 cs.LG cs.AI 84%

Enhancing Vision-Language Model Training with Reinforcement Learning in Synthetic Worlds for Real-World Success

George Bredis, Stanislav Dereka, Viacheslav Sinii, Ruslan Rakhimov, Daniil Gavrilov

机构 * George Bredis(无) Stanislav Dereka(无) Viacheslav Sinii(无) Ruslan Rakhimov(无) Daniil Gavrilov(无)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02917 2025-08-06 cs.CV cs.AI cs.CL cs.RO 84%

Following Route Instructions using Large Vision-Language Models: A Comparison between Low-level and Panoramic Action Spaces

Vebjørn Haug Kåsene, Pierre Lison

机构 * University of Oslo(奥斯陆大学) Norwegian Computing Center(挪威计算中心)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments This paper has been accepted to ICNSLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01540 2025-08-05 cs.CV cs.AI 84%

MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning

Yi Liu, Xiao Xu, Zeyu Xu, Meng Zhang, Yibo Li, Haoyu Chen, Junkang Zhang, Qiang Wang, Jifa Sun, Siling Lin, Shengxun Cheng, Lingshu Zhang, Kang Wang

机构 * Project Leader(项目负责人) Corresponding Author(通讯作者)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16652 2025-06-23 cs.RO cs.CV cs.LG cs.SE 84%

CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity

Guang Yin, Yitong Li, Yixuan Wang, Dale McConachie, Paarth Shah, Kunimatsu Hashimoto, Huan Zhang, Katherine Liu, Yunzhu Li

机构 * Columbia University(哥伦比亚大学) Toyota Research Institute(丰田研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted to Robotics: Science and Systems (RSS) 2025. The first three authors contributed equally. Project Page: https://robopil.github.io/code-diffuser/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11317 2025-06-02 cs.AI cs.CL cs.CV cs.HC 84%

GUICourse: From General Vision Language Models to Versatile GUI Agents

Wentong Chen, Junbo Cui, Jinyi Hu, Yujia Qin, Junjie Fang, Yue Zhao, Chongyi Wang, Jun Liu, Guirong Chen, Yupeng Huo, Yuan Yao, Yankai Lin, Zhiyuan Liu, Maosong Sun

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Xiamen University(厦门大学) BUPT(北邮) ModelBest Chinese Academy of Sciences(中国科学院) National University of Singapore(新加坡国立大学) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 GUI与屏幕智能体 :vision language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23266 2025-05-30 cs.CR cs.AI cs.CV 84%

Disrupting Vision-Language Model-Driven Navigation Services via Adversarial Object Fusion

Chunlong Xie, Jialing He, Shangwei Guo, Jiacheng Wang, Shudong Zhang, Tianwei Zhang, Tao Xiang

机构 * College of Computer Science, Chongqing University(重庆大学计算机学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07945 2025-05-27 cs.HC cs.AI cs.CV 84%

ScreenAgent: A Vision Language Model-driven Computer Control Agent

Runliang Niu, Jindong Li, Shiqi Wang, Yali Fu, Xiyu Hu, Xueyuan Leng, He Kong, Yi Chang, Qi Wang

专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Journal ref Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence (IJCAI 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07949 2025-05-22 cs.LG cs.AI 84%

Advancing Autonomous VLM Agents via Variational Subgoal-Conditioned Reinforcement Learning

Qingyuan Wu, Jianheng Liu, Jianye Hao, Jun Wang, Kun Shao

机构 * University of Liverpool(利物浦大学) University of Southampton(南安普顿大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01966 2025-05-12 cs.CV cs.AI 84%

Enhancing Screen Time Identification in Children with a Multi-View Vision Language Model and Screen Time Tracker

Xinlong Hou, Sen Shen, Xueshen Li, Xinran Gao, Ziyi Huang, Steven J. Holiday, Matthew R. Cribbet, Susan W. White, Edward Sazonov, Yu Gan

机构 * Department of Biomedical Engineering, Stevens Institute of Technology(生物医学工程系,史蒂文斯理工学院) Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Electrical Engineering, Columbia University in the City of New York(电气工程系,哥伦比亚大学(纽约市)) Nokia Bell Labs(诺基亚贝尔实验室) Department of Communication & Information Science, University of Alabama(传播与信息科学系,阿拉巴马大学) Department of Psychology, University of Alabama(心理学系,阿拉巴马大学) Department of Electrical and Computer Engineering, University of Alabama(电气与计算机工程系,阿拉巴马大学)

专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Prepare for submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10721 2024-06-18 cs.RO cs.AI cs.CV 84%

RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics

Wentao Yuan, Jiafei Duan, Valts Blukis, Wilbert Pumacay, Ranjay Krishna, Adithyavairavan Murali, Arsalan Mousavian, Dieter Fox

专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15527 2024-02-27 cs.CL cs.AI cs.CV 84%

PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain

Liang Chen, Yichi Zhang, Shuhuai Ren, Haozhe Zhao, Zefan Cai, Yuchi Wang, Peiyi Wang, Xiangdi Meng, Tianyu Liu, Baobao Chang

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Code and Data released at https://github.com/pkunlp-icler/PCA-EVAL. Leaderboard at: https://docs.qq.com/sheet/DVUd4WUpGRHRqUnNV. This article supersedes its workshop version arxiv: 2310.02071. arXiv admin note: text overlap with arXiv:2310.02071

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03766 2024-02-07 cs.CV cs.AI 84%

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Xiangxiang Chu, Limeng Qiao, Xinyu Zhang, Shuang Xu, Fei Wei, Yang Yang, Xiaofei Sun, Yiming Hu, Xinyang Lin, Bo Zhang, Chunhua Shen

专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13073 2025-09-04 cs.RO cs.CV 84%

Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey

Rui Shao, Wei Li, Lingsen Zhang, Renshan Zhang, Zhiyang Liu, Ran Chen, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Project Page: https://github.com/JiuTian-VL/Large-VLM-based-VLA-for-Robotic-Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09816 2026-08-12 cs.RO 版本更新 83%

Hierarchical Fast-Slow ReAct Agent for Zero-Shot Object-Goal Navigation

用于零样本物体目标导航的分层快慢ReAct智能体

Zhaochen Lan, Zhi Yang, Yuxiang Fu, Mengxiang Lin

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 该研究针对零样本物体目标导航,提出分层快慢ReAct智能体,结合价值图控制器与坐标锚定记忆及VLM,在HM3D、MP3D验证集上取得零样本方法最高成功率,远前沿审议可提升性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10577 2026-07-28 cs.RO 版本更新 83%

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

AgenticNav:零样本视觉与语言导航作为工具调用框架

Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 提出AgenticNav,通过将动作、深度和记忆作为可调用工具暴露给VLM,实现零样本连续环境导航,在R2R-CE基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17767 2026-07-21 cs.RO 新提交 83%

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

VLN-AVP:用于自动代客泊车的基于混合长短时记忆的零样本视觉语言导航

Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 研究针对自主代客泊车依赖预建地图限制可扩展性问题,提出VLN-AVP零样本导航框架,结合BEV模型与VLM,引入混合记忆系统,构建数据集和基准,实验证明该方法在模拟和实际车辆实验中均有良好效果,提升了成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16956 2026-07-21 cs.RO 新提交 83%

G2-Nav: Grounded and Guarded Vision-Language Costmaps for Robot Social Navigation

G2-Nav:用于机器人社交导航的基于视觉语言的地面与防护代价地图

Yuwen Liao, Yihang Lan, Yizhuo Yang, Ruimeng Liu, Xinhang Xu, Shenghai Yuan, Lihua Xie

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 研究针对机器人社交导航问题,提出G2-Nav框架,将VLM语义推理转化为视觉语言代价地图,经开放集感知评估区域和代理,结合语义验证与高频安全检查,实现非结构化环境下安全、高效且符合社会规范的自主导航。

Comments submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15758 2026-07-20 cs.RO 新提交 83%

SkillNav: Score-Level Skill Intervention for Zero-Shot Object Goal Navigation

SkillNav:用于零样本对象目标导航的分数级技能干预

Ruijie Sang, Yiqun Duan, Pinhan Fu, Ruilin Wang, Wei Sui, Xianda Guo

机构 * D-Robotics(D-机器人公司) HAI Center, University of Technology Sydney(悉尼科技大学HAI中心) School of Computer Science, Wuhan University(武汉大学计算机科学学院)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 研究针对VLM智能体零样本对象目标导航存在的问题,提出SkillNav框架,通过分层技能设计及双表示设计,无需训练,在多个数据集上提升成功率,建立新最优成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏