arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1559 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1559 篇

2606.25760 2026-06-25 cs.LG cs.AI cs.CL cs.CV 新提交 92%

Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets

计算机使用代理的不确定性量化:跨视觉语言模型和GUI基础数据集的基准测试

Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Intel Labs(英特尔实验室) Capital One AI Labs(Capital One AI实验室)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出跨机制基准Argus,评估27种后验不确定性量化方法在4个VLM代理和4个数据集上的表现,发现UQ排名在固定模型内跨数据集稳定,但跨模型类别和接口时下降,隐藏状态和密度方法最稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03270 2026-08-05 cs.CV cs.AI 新提交 92%

GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs

GUI-Lens:面向通用视觉语言模型(VLM)的GUI定位粗到精裁剪框架

Zichuan Fu, Shirong Wang, Wenlin Zhang, Guojing Li, Yimin Deng, Jingtong Gao, Junjia Qi, Hanyu Yan, Yefeng Zheng, Xiaopeng Li, Wanyu Wang, Xian Wu, Xiangyu Zhao

专题命中 GUI与屏幕智能体 :VLM(title_cn,summary_cn);grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 GUI-Lens是面向通用VLM的GUI定位粗到精裁剪框架,通过主动视觉观察逐步聚焦确定目标,在四个基准和三个VLM后端上使定位准确率最高提升24.9个百分点,在GPT-5.5上达SOTA性能。

Comments Preprint. Code: https://github.com/Fzkuji/GUI-Agent-Harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03896 2026-06-12 cs.CV cs.RO 版本更新 92%

GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert

GAE: 利用可泛化动作专家释放VLM的物理潜力

Mingyu Liu, Zheng Huang, Xiaoyi Lin, Muzhi Zhu, Canyu Zhao, Yating Wang, Haoyi Zhu, Hao Chen, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出通用动作专家(GAE),通过稀疏几何接口将VLM的高层意图转化为连续动作轨迹,采用动作预训练-点云微调(APPF)方案解耦动作动力学与几何基础,实现跨视觉域、视角和指令的强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19522 2026-08-04 cs.RO 版本更新 91%

GenerativeMPC: VLM-RAG-guided Whole-Body MPC with Virtual Impedance for Bimanual Mobile Manipulation

GenerativeMPC:基于VLM-RAG的全身体姿MPC与虚拟阻抗的双臂移动 manipulation

Marcelino Julio Fernando, Miguel Altamirano Cabrera, Jeffrin Sam, Yara Mahmoud, Konstantin Gubernatorov, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory(智能空间机器人实验室) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract)

AI总结 本文提出GenerativeMPC框架,通过VLM-RAG将语义理解与物理控制参数结合,实现双臂移动 manipulation的高效安全控制,实验表明在近人区域速度降低60%并实现安全社交导航。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10991 2026-07-14 cs.RO cs.AI cs.CV 新提交 91%

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

在重要时刻思考:用于社交导航的基于RL策略的条件VLM推理

Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides, Marie Samson, Mahdi Khoramshahi, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究社交机器人导航中强化学习策略缺乏语义推理能力的问题,提出HUMA混合架构,动态平衡RL策略与VLM的优势。在基准测试中任务成功率提高,减少碰撞,消融研究验证组件,实际部署证明方法可行。

Comments CoRL 2026 submission. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09826 2026-06-09 cs.CV cs.AI 新提交 91%

OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics

OmniGameArena: 一个统一的UE5基准测试,用于具有改进动态的VLM游戏智能体

Mingxian Lin, Shengju Qian, Yuqi Liu, Yi-Hua Huang, Yiyu Wang, Wei Huang, Yitang Li, Fan Zhang, Zeyu Hu, Lingting Zhu, Xin Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) LIGHTSPEED The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出OmniGameArena,一个包含12个UE5游戏的统一基准,以及改进动态曲线(IDC),通过反思机制评估VLM智能体的冷启动分数、改进动态和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09630 2026-06-09 cs.RO cs.AI cs.LG 新提交 91%

ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies

ReCoVLA: VLM引导的奖励编译用于视觉-语言-动作策略的故障恢复

Haodi Hu, Chung-Ta Huang, Jing Liu, Ye Wang, Kei Suzuki, Matthew Brand, Toshiaki Koike-Akino

机构 * University of Southern California(南加州大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室) Harvard University(哈佛大学)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ReCoVLA框架,通过冻结预训练VLA策略,利用外部VLM推断故障模式并编译结构化奖励,训练残差恢复策略,实现零样本仿真到真实部署,在多种操作任务中提升成功率。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06394 2026-05-01 cs.CV cs.AI 91%

Context Matters: Peer-Aware Student Behavioral Engagement Measurement via VLM Action Parsing and LLM Sequence Classification

语境至关重要:通过VLM动作解析和LLM序列分类进行同伴感知的学生行为参与度测量

Ahmed Abdelkawy, Ahmed Elsayed, Asem Ali, Aly Farag, Thomas Tretter, Michael McIntyre

机构 * University of Louisville(路易斯维尔大学)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种三阶段框架,通过VLM动作识别和LLM序列分类,结合课堂语境中的同伴行为,有效测量学生参与度。

Comments accepted to the Computer Vision for Education (CV4Edu) workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10719 2026-08-04 cs.RO cs.CV 版本更新 91%

From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving

从表征互补性到双系统:协同VLM和纯视觉骨干网络用于端到端驾驶

Sining Ang, Yuguang Yang, Chenxu Dang, Canyu Chen, Cheng Chi, Haiyan Liu, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) National Superior College for Engineers, Beihang University(北京航空航天大学国家级工程师学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Lenovo Group Limited(联想集团有限公司) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文通过协同VLM和纯视觉骨干网络,提出HybridDriveVLA和DualDriveVLA,提升端到端驾驶的PDMS性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13207 2026-06-11 cs.RO cs.CV 版本更新 91%

PIGEON: VLM-Driven Object Navigation via Points of Interest Selection

PIGEON: 通过兴趣点选择的VLM驱动物体导航

Cheng Peng, Zhenzhe Zhang, Xiaobao Wei, Yanhao Zhang, Heng Wang, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Shanghang Zhang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) Peking University(北京大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出PIGEON框架,将物体导航建模为基于原始观测的稀疏决策问题,通过兴趣点(PoI)作为视觉决策单元,结合VLM选择关键点,实现零样本SOTA性能并迁移至主动具身问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11548 2026-06-11 cs.CV 版本更新 91%

How Auxiliary Reasoning Unleashes GUI Grounding in VLMs

辅助推理如何释放VLM中的GUI定位能力

Weiming Li, Yan Shao, Jing Yang, Yujing Lu, Ling Zhong, Yuhan Wang, Min Yu, Tongxiao Ruan, Manni Duan

机构 * Zhejiang Lab(浙江实验室) Hangzhou Research and Development Center(杭州研发中心) China Mobile(中国移动) Innovation Center of Yangtze River Delta(长江三角洲创新中心) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :VLM(title_cn,summary_cn);grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对VLM在GUI定位任务中隐式空间理解强但显式坐标输出弱的问题,提出三种零样本辅助推理方法(如标记网格),通过输入图像添加空间线索,显著提升定位性能,在多个基准上达到接近最优微调方法的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31382 2026-07-01 cs.RO 新提交 90%

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

重新审视视觉-语言-动作模型中的参数冗余:从VLM到VLA适配的见解

Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract)

AI总结 通过分析VLM到VLA适配中参数差异的空间分布,设计多模块联合剪枝方案,在无需微调恢复的情况下减少12%-30%参数并保持约90%性能。

Comments 22 pages, 3 figures, ECCV 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03497 2026-07-03 cs.RO cs.AI cs.CV 版本更新 90%

Sim2Real-AD: A Modular Sim-to-Real Framework for Deploying VLM-Guided Reinforcement Learning in Real-World Autonomous Driving

Sim2Real-AD:一种模块化的仿真到现实框架,用于在现实世界自动驾驶中部署基于VLM的强化学习

Zilin Huang, Zhengyang Wan, Zihao Sheng, Boyue Wang, Junwei You, Sikai Chen

机构 * Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Google(谷歌)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);分类 cs.CV、cs.AI

AI总结 本文提出Sim2Real-AD框架,实现无需真实世界强化学习数据将CARLA训练的VLM引导强化学习策略零样本迁移到全尺寸车辆。框架包含几何观察桥、物理感知动作映射、两阶段渐进训练和实时部署流水线。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08316 2026-07-02 cs.CR cs.CL cs.CV 版本更新 90%

SlowBA: An efficiency backdoor attack towards VLM-based GUI agents

SlowBA:针对基于VLM的GUI代理的高效后门攻击

Junxian Li, Tu Lan, Haozhen Tan, Yan Meng, Haojin Zhu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);分类 cs.CV

AI总结 提出SlowBA后门攻击,通过强化学习注入触发模式,诱导VLM-based GUI代理产生冗长推理链,显著增加响应延迟,同时保持任务准确性。

Comments Accepted by ECCV 2026. Codes and supplementary materials are in https://github.com/tu-tuing/SlowBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18101 2026-06-18 cs.AI 新提交 90%

Trust the Right Teacher: Quality-Aware Self-Distillation for GUI Grounding

信任正确的教师:面向GUI定位的质量感知自蒸馏

Jingyuan Huang, Zuming Huang, Yucheng Shi, Tianze Yang, Xiaoming Zhai, Wei Chu, Ninghao Liu

机构 * University of Georgia(佐治亚大学) INFLY Tech Tencent AI Lab(腾讯AI实验室) The Hong Kong Polytechnic University(香港理工大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);grounding(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 提出质量感知自蒸馏方法,通过软正确性感知门控和教师概率缩放改善坐标令牌教师信号质量,提升VLM在GUI定位任务中的性能。

Comments corrected some claims

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01621 2026-06-12 cs.CV cs.RO 版本更新 90%

Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation

Goal2Pixel: 将目标锚定到像素以实现视觉语言导航

Muyi Bao, Yuxin Cai, Hang Xu, Zongtai Li, Jinxi He, Jingfan Tang, Chen Lv, Ji Zhang, Yaqi Xie, Wenshan Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 提出Goal2Pixel范式,通过将连续环境中的视觉语言导航(VLN-CE)重新定义为可导航像素锚定,利用图像平面作为统一空间接口,预测可见导航像素并反投影为3D航点,结合可见性感知关键帧记忆和坐标感知辅助损失,在减少VLM调用次数的同时实现竞争性性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23491 2025-07-21 cs.CV cs.AI 90%

ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding

ZongHan Hsieh, Tzer-Jen Wei, ShengJing Yang

机构 * DeepCAT Lab, National Yang Ming Chiao Tung University(深猫实验室,国家阳明交通大学)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08904 2026-08-11 cs.CV cs.AI cs.LG 新提交 89%

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力

Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou

机构 * New York University(纽约大学) Reflex Université de Montréal(蒙特利尔大学) Maastricht University(马斯特里赫特大学)

专题命中 GUI与屏幕智能体 :VLM(title,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。

Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28760 2026-06-30 cs.RO 89%

Vision-Language Models for Deployable Social Robot Navigation: Bridging Semantic Reasoning and Low-Level Control

面向可部署社交机器人导航的视觉-语言模型:弥合语义推理与低级控制

Runji Cai, Toshihiko Yamasaki, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract)

AI总结 本文综述了将视觉-语言模型(VLM)集成到社交机器人导航中的方法,提出包含高层推理、低层控制及中间机制的统一框架,并讨论了关键挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20458 2026-06-19 cs.RO 新提交 89%

Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation

慢速大脑,快速规划器:延迟鲁棒的VLM增强城市导航

Zhenghao "Mark'' Peng, Honglin He, Quanyi Li, Yukai Ma, Bolei Zhou

机构 * Amazon FAR(亚马逊 FAR) UCLA(加州大学洛杉矶分校) Independent(独立) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn)

AI总结 针对移动机器人在人行道导航中轨迹评分差距问题,提出一种无需训练的延迟鲁棒轨迹级融合层,利用VLM选择候选轨迹并与规划器输出融合,在挑战场景下降低ADE 30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11191 2026-08-12 cs.CV cs.AI cs.CL 新提交 89%

Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation

基于反思引导的在线策略自蒸馏的测试时自演进GUI视觉定位

Shiyu Xuan, Zechao Li

专题命中 GUI与屏幕智能体 :MLLM(summary_cn,abstract);grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 针对现有GUI视觉定位模型部署后难适配未见界面且无法反思失败探索的问题,提出测试时自演进框架,结合MLLM反思器、反思引导的在线策略自蒸馏等方法,在六个基准上平均提升7.4%准确率,完善了GUI智能体自演进能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20246 2026-05-22 cs.LG cs.AI 89%

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

GROW: 将GRPO与状态-动作建模对齐以适用于开放世界VLM智能体

Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Zhejiang Normal University(浙江师范大学) Shandong Normal University(山东省师范大学)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GROW框架,通过将收集的轨迹分解为状态-动作样本,并在样本间计算优势,解决了标准GRPO在多轮RL中因需要完整轨迹导致上下文过长和噪声的问题,实验表明其在超过800个Minecraft任务中取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20012 2026-04-23 cs.CV cs.AI cs.CL 89%

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

EmbodiedMidtrain: 通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距

Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究部及博世人工智能中心(BCAI))

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出EmbodiedMidtrain方法,通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距,实验表明中训练能提升不同VLM骨干网络的性能,且在初始化阶段对VLA微调有显著帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08792 2025-09-25 cs.RO cs.AI cs.CV cs.LG 89%

VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model

Beichen Wang, Juexiao Zhang, Shuwen Dong, Irving Fang, Chen Feng

机构 * New York University(纽约大学)

专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04824 2026-08-07 cs.CV 89%

SOVABench: A Vehicle Surveillance Action Retrieval Benchmark for Multimodal Large Language Models

SOVABench:多模态大语言模型的车辆监控动作检索基准

Oriol Rabasseda, Zenjie Li, Kamal Nasrollahi, Sergio Escalera

机构 * Milestone Systems A/S(Milestone Systems公司) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) Aalborg Universitet(奥胡斯大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract)

AI总结 SOVABench为多模态大语言模型提供车辆监控动作检索基准,通过定义两种评估协议评估跨动作区分和时间方向理解,展示了模型在复杂监控任务中的性能。

Comments This work has been accepted at Real World Surveillance: Applications and Challenges, 6th (in WACV Workshops)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27180 2026-08-05 cs.CV cs.RO 版本更新 89%

HumanCLAW: Can Vision-Language Models Act Through a Body?

HumanCLAW:视觉-语言模型能否通过实体身体执行动作

Li Siyao, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo

机构 * Meta Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学) Brown University(布朗大学) Northwestern University(西北大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出HumanCLAW框架与HumanCLAW-Bench基准,测试9个先进VLM发现其均未解决具身动作任务,最优仅16.8%成功率,核心缺失具身自我意识。

Comments Project page: https://human-claw.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12817 2026-06-15 cs.AI 新提交 89%

GUITrans2Act: Understanding User Operational Behaviors from Mobile GUI Interactions with Vision-Language Models

Teach-and-Repeat: 从移动屏幕演示中准确提取操作知识以赋能GUI智能体

Yudong Zhang, Lei Hu, Daoyang Liu, Jiawei Liu, Yangfan Luo, Zhilin Gao, Zuojian Wang

机构 * Honor Device Co., Ltd(荣耀终端有限公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI

AI总结 提出Teach VLM模型,通过从演示视频中提取关键帧生成操作知识,并构建数据飞轮解决训练数据稀缺问题;在基准测试中达到最优性能,并提升下游智能体的任务成功率。

Comments 20 pages, 9 figures. Yudong Zhang and Lei Hu contributed equally to this work. Zuojian Wang, and Zhilin Gao are corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17933 2026-05-19 cs.CV 89%

AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents

AtlasVA: 无教师视觉技能记忆用于无需教师的VLM代理

Pan Wang, Yihao Hu, Xiujin Liu, Jingchu Yang, Hang Wang, Zhihao Wen

机构 * Ant Group(蚂蚁集团) University of Science and Technology of China(中国科学技术大学) Westlake University(西湖大学) University of Michigan - Ann Arbor(密歇根大学-安娜堡分校) Sun Yat-sen University(中山大学)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出AtlasVA,一种无需教师的视觉技能记忆框架,通过空间热图、视觉示例和符号文本技能三层结构,统一感知、记忆和优化,实现在无需外部LLM监督下的强化学习性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19679 2026-04-28 cs.AI 89%

InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning

InquireMobile: 教授基于VLM的移动代理通过强化微调请求人类帮助

Qihang Ai, Pi Bu, Yue Cao, Yingyao Wang, Jihao Gu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Zhicheng Zheng, Jun Song, Yuning Jiang

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出InquireMobile,通过强化学习方法提升移动代理在关键决策点主动请求人类帮助的能力,实现46.8%的询问成功率提升,成为InquireBench上表现最佳的基线模型。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00103 2024-12-03 cs.RO cs.AI cs.LG 88%

MLLM-Search: A Zero-Shot Approach to Finding People using Multimodal Large Language Models

Angus Fung, Aaron Hao Tan, Haitong Wang, Beno Benhabib, Goldie Nejat

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏