arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1561 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1561 篇

2605.17254 2026-06-10 cs.AI 版本更新 79%

CatalyticMLLM: A Graph-Text Multimodal Large Language Model for Catalytic Materials

CatalyticMLLM: 一种用于催化材料的图-文本多模态大语言模型

Yanjie Li, Jian Xu, Xu-Yao Zhang, Shiming Xiang, Nian Ran, Weijun Li, Cheng-Lin Liu

机构 * AnnLab(安实验室) Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所) Zhongguancun Academy(中关村学院) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) State Key Laboratory of High Performance Ceramics(高性能陶瓷国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院) University of ChineseAcademy of Sciences(中国科学院大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种统一的图-文本多模态大语言模型QE-Catalytic-V2,用于催化材料的性质预测和逆向设计,通过共享的表示空间实现两者的联合建模,从而形成闭环优化流程。

Comments 71 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30884 2026-06-01 cs.CV 79%

GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning

GUI-C$^2$:基于难度感知强化学习的由粗到细GUI定位

Junlong Li, Chao Hao, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV

AI总结 提出GUI-C$^2$框架,通过难度感知数据筛选和由粗到细的强化学习机制,解决GUI定位中训练样本难度不均和视觉区域裁剪权衡问题,实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27266 2026-05-28 cs.CV 79%

Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning

通过自我批评强化学习增强可信的GUI定位

Shaojie Zhang, Pei Fu, Ruoceng Zhang, Jiahui Yang, Anan Du, Xiuwen Xi, Shaokang Wang, Ying Huang, Bin Qin, Zhenbo Luo, Jian Luan

机构 * Xiaomi Inc(小米公司)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV

AI总结 提出HyperClick框架,通过自我批评强化学习联合优化定位准确性和置信度可靠性,实现可信的GUI定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20332 2026-04-28 cs.AI 79%

Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training

Mobile-R1: 通过系统性训练提升基于视觉语言模型的移动代理的交互能力

Jihao Gu, Qihang Ai, Yingyao Wang, Pi Bu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Ziming Wang, Yingxiu Zhao, Ming-Liang Zhang, Jun Song, Yuning Jiang, Bo Zheng

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract);分类 cs.AI

AI总结 本文提出Mobile-R1系统性训练方法,通过分层课程学习提升移动代理的探索与自我纠正能力,并构建中文移动数据集和基准测试。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09581 2026-04-16 cs.AI cs.CY cs.HC 79%

Avenir-UX: Automated UX Evaluation via Simulated Human Web Interaction with GUI Grounding

Avenir-UX:通过模拟人类网络交互进行自动用户体验评估

Wee Joe Tan, Zi Rui Lucas Lim, Shashank Durgad, Karim Obegi, Aiden Yiliu Li

机构 * University College London(伦敦大学学院)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI

AI总结 Avenir-UX通过模拟人类交互行为,提供标准化的可用性评估,结合GUI接地技术,提升用户体验评估的效率和准确性,支持持续、可扩展的数据驱动测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06999 2026-03-17 cs.CV 79%

TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models

TrajPred: 基于轨迹的联合嵌入预测用于视觉-语言模型中手术器械-组织交互识别

Jiajun Cheng, Xiaofan Yu, Subarna Tripathi, Sainan Liu, Shan Lin

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出TrajPred框架,通过编码器械轨迹融入时间运动线索,并基于轨迹引入预测模块生成更精确的视觉语义嵌入,提升手术器械-组织交互识别的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03973 2026-02-05 cs.RO cs.CV 79%

VLS: Steering Pretrained Robot Policies via Vision-Language Models

VLS:通过视觉-语言模型引导预训练的机器人策略

Shuo Liu, Ishneet Sukhvinder Singh, Yiqing Xu, Jiafei Duan, Ranjay Krishna

机构 * University of Washington(华盛顿大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV

AI总结 VLS通过视觉-语言模型在推理时引导预训练机器人策略,实现无需训练的适应,提升在不同环境下的表现。

Comments 11 Pages, Project page: https://vision-language-steering.github.io/webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11891 2026-02-03 cs.CL cs.AI 79%

Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents

Mobile-Bench-v2: 一种更现实和全面的基于VLM的移动代理基准测试

Weikai Xu, Zhizheng Jiang, Yuxuan Liu, Pengzhi Gao, Wei Liu, Jian Luan, Yuanchun Li, Yunxin Liu, Bin Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) MiLM Plus, Xiaomi Inc.(小米公司 MiLM Plus) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究所)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);分类 cs.AI

AI总结 Mobile-Bench-v2通过引入基于槽位的指令生成方法,构建了一个更现实和全面的基准测试,以评估基于VLM的移动代理在处理噪声、多路径任务和主动交互方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17461 2026-01-29 cs.CV cs.CL 79%

Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies

通过利用人类方法诊断视觉语言模型的感知能力:针对色觉缺陷的色觉研究

Kazuki Hayashi, Shintaro Ozaki, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所)

专题命中 GUI与屏幕智能体 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本研究通过Ishihara测试评估视觉语言模型对色觉差异的感知能力,发现模型无法再现色觉缺陷个体的感知结果,揭示了多模态AI在包容性部署中的不足。

Comments Accepted to appear in the main conference of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06031 2026-01-13 cs.HC cs.AI 79%

Beyond Clicking:A Step Towards Generalist GUI Grounding via Text Dragging

超越点击:通过文本拖动实现通用GUI定位的一步

Zeyi Liao, Yadong Lu, Boyu Gou, Huan Sun, Ahmed Awadallah

机构 * The Ohio State University(俄亥俄州立大学) Microsoft Research, Redmond(微软研究院(红mond))

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI

AI总结 本文提出GUI-Drag数据集和ScreenDrag基准,通过文本拖动提升GUI定位能力,实现更通用的GUI交互模型。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16501 2025-12-19 cs.CV 79%

VenusBench-GD: A Comprehensive Multi-Platform GUI Benchmark for Diverse Grounding Tasks

VenusBench-GD: 一个全面的多平台GUI基准测试用于多样化的接地任务

Beitong Zhou, Zhexiao Huang, Yuan Guo, Zhangxuan Gu, Tianyu Xia, Zichen Luo, Fei Tang, Dehan Kong, Yanyi Shang, Suling Ou, Zhenlin Guo, Changhua Meng, Shuheng Shen

机构 * Venus Team, AntGroup(蚂蚁集团 Venus 团队)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV

AI总结 VenusBench-GD提出一个跨平台的GUI接地基准测试,通过分层任务分类和高质量数据构建,评估模型在基本和高级任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08529 2025-12-10 cs.CV 79%

MVP: Multiple View Prediction Improves GUI Grounding

MVP: 多视角预测改进 GUI 定位

Yunzhu Zhang, Zeyu Pan, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Linchao Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) Venus Team, Ant Group(蚂蚁集团 Venus 团队)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV

AI总结 MVP 通过多视角预测方法提升 GUI 定位的稳定性与准确性,显著提高多个模型的性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18823 2025-11-25 cs.CV 79%

VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models

VideoPerceiver: 提升视频多模态大语言模型的细粒度时序感知能力

Fufangchen Zhao, Liao Zhang, Daiqi Shi, Yuanjun Gao, Chen Ye, Yang Cai, Jian Gao, Danfeng Yan

机构 * State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 VideoPerceiver通过两阶段训练框架提升视频多模态大语言模型对细粒度动作和短暂事件的感知能力,显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08978 2025-11-13 cs.MM cs.CV 79%

Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding

Jingtian Ma, Jingyuan Wang, Wayne Xin Zhao, Guoping Liu, Xiang Wen

机构 * School of Computer Science and Engineering, and the MOE Engineering Research Center of Advanced Computer Application Technology, Beihang University(计算机科学与工程学院,以及教育部先进计算机应用技术工程研究中心,北京航空航天大学) School of Computer Science and Engineering, the School of Economics and Management, and the MIIT Key Laboratory of Data Intelligence and Management, Beihang University(计算机科学与工程学院,经济管理学院,以及工信部数据智能与管理重点实验室,北京航空航天大学) Gaoling School of Artificial Intelligence, Renmin University of China(中关村人工智能学院,中国人民大学) DiDi Global Inc.(滴滴出行公司)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11509 2025-10-14 cs.CV 79%

Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model

Ruiping Liu, Junwei Zheng, Yufan Chen, Zirui Wang, Kunyu Peng, Kailun Yang, Jiaming Zhang, Marc Pollefeys, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 GUI与屏幕智能体 :multimodal large language model(title);MLLM(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track. Dataset and Code: https://github.com/RuipingL/Situat3DChange

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08783 2025-10-13 cs.HC cs.AI 79%

MLLM as a UI Judge: Benchmarking Multimodal LLMs for Predicting Human Perception of User Interfaces

Reuben A. Luera, Ryan Rossi, Franck Dernoncourt, Samyadeep Basu, Sungchul Kim, Subhojyoti Mukherjee, Puneet Mathur, Ruiyi Zhang, Jihyung Kil, Nedim Lipka, Seunghyun Yoon, Jiuxiang Gu, Zichao Wang, Cindy Xiong Bearfield, Branislav Kveton

机构 * University of California, Berkeley(加州大学伯克利分校) Adobe Research(Adobe研究) Georgia Institute of Technology(佐治亚理工学院)

专题命中 GUI与屏幕智能体 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01795 2025-10-13 cs.RO cs.AI 79%

Nav-EE: Navigation-Guided Early Exiting for Efficient Vision-Language Models in Autonomous Driving

Haibo Hu, Lianming Huang, Xinyu Wang, Yufei Cui, Shangyu Wu, Nan Guan, Chun Jason Xue

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Computer Science, McGill University(麦吉尔大学计算机科学系) Department of Computer Science, Mohamed bin Zayed University of Artificial Intelligence(马尔代夫穆罕默德· bin·扎耶德人工智能大学计算机科学系)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16942 2025-08-26 cs.CV 79%

HieroAction: Hierarchically Guided VLM for Fine-Grained Action Analysis

Junhao Wu, Xiuer Gu, Zhiying Li, Yeying Jin, Yunfeng Diao, Zhiyu Li, Zhenbo Song, Xiaomei Zhang, Zhaoxin Fan

专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16465 2025-07-15 cs.HC cs.AI 79%

OS-Kairos: Adaptive Interaction for MLLM-Powered GUI Agents

Pengzhou Cheng, Zheng Wu, Zongru Wu, Aston Zhang, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 GUI与屏幕智能体 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

Comments 25 pages, 24 figures, 11 tables (ACL 2025, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16256 2025-07-09 cs.HC cs.AI 79%

Aria-UI: Visual Grounding for GUI Instructions

Yuhao Yang, Yue Wang, Dongxu Li, Ziyang Luo, Bei Chen, Chao Huang, Junnan Li

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15757 2025-06-23 cs.CV 79%

Weakly-supervised VLM-guided Partial Contrastive Learning for Visual Language Navigation

Ruoyu Wang, Tong Yu, Junda Wu, Yao Liu, Julian McAuley, Lina Yao

机构 * University of New South Wales(新南威尔士大学) Adobe Research(Adobe研究) University of California San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学) CSIRO’s Data61 and University of New South Wales(CSIRO Data61和新南威尔士大学)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01031 2025-06-03 cs.CV 79%

NavBench: Probing Multimodal Large Language Models for Embodied Navigation

Yanyuan Qiao, Haodong Hong, Wenqi Lyu, Dong An, Siqi Zhang, Yutong Xie, Xinyu Wang, Qi Wu

机构 * The University of Adelaide(阿德莱德大学) The University of Queensland(昆士兰大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61研究中心) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Tongji University(同济大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12835 2025-05-20 cs.CL cs.CV 79%

FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models

Hengxing Cai, Jinhan Dong, Jingjun Tan, Jingcheng Deng, Sihang Li, Zhifeng Gao, Haidong Wang, Zicheng Su, Agachai Sumalee, Renxin Zhong

机构 * School of Intelligent Systems Engineering, Sun Yat-Sen University(中山大学智能系统工程学院) DP Technology(DP技术公司) Beijing University Of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) School of Integrated Innovation, Chulalongkorn University(朱拉隆功大学创新学院)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11383 2025-05-19 cs.CV cs.RO 79%

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation

Zihan Wang, Seungjun Lee, Gim Hee Lee

机构 * School of Computing, National University of Singapore(计算学院,新加坡国立大学)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00114 2025-04-30 cs.RO cs.CV 79%

Mobile Robot Navigation Using Hand-Drawn Maps: A Vision Language Model Approach

Aaron Hao Tan, Angus Fung, Haitong Wang, Goldie Nejat

专题命中 GUI与屏幕智能体 :vision language model(title,abstract);分类 cs.CV

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07981 2025-04-14 cs.CV cs.HC cs.MM 79%

ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use

Kaixin Li, Ziyang Meng, Hongzhan Lin, Ziyang Luo, Yuchen Tian, Jing Ma, Zhiyong Huang, Tat-Seng Chua

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV

Comments 13pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04716 2025-04-08 cs.CV 79%

On the Robustness of GUI Grounding Models Against Image Attacks

Haoren Zhao, Tianyi Chen, Zhen Wang

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19670 2025-03-30 cs.CV 79%

fine-CLIP: Enhancing Zero-Shot Fine-Grained Surgical Action Recognition with Vision-Language Models

Saurav Sharma, Didier Mutter, Nicolas Padoy

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV

Comments 6 pages, 3 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15871 2025-03-21 cs.CV 79%

MASH-VLM: Mitigating Action-Scene Hallucination in Video-LLMs through Disentangled Spatial-Temporal Representations

Kyungho Bae, Jinhyung Kim, Sihaeng Lee, Soonyoung Lee, Gunhee Lee, Jinwoo Choi

专题命中 GUI与屏幕智能体 :VLM(title,abstract);分类 cs.CV

Comments Accepted for CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10640 2024-11-19 cs.CV cs.CL 79%

BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices

Xudong Lu, Yinghao Chen, Cheng Chen, Hui Tan, Boheng Chen, Yina Xie, Rui Hu, Guanxin Tan, Renshou Wu, Yan Hu, Yi Zeng, Lei Wu, Liuyang Bian, Zhaoxiong Wang, Long Liu, Yanzhou Yang, Han Xiao, Aojun Zhou, Yafei Wen, Xiaoxin Chen, Shuai Ren, Hongsheng Li

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);分类 cs.CV

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏