arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1561 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1561 篇

2602.22514 2026-02-27 cs.RO cs.AI cs.SY eess.SY 57%

SignVLA: A Gloss-Free Vision-Language-Action Framework for Real-Time Sign Language-Guided Robotic Manipulation

SignVLA:一种无 gloss 的视觉-语言-动作框架,用于实时 sign language 引导的机器人操作

Xinyu Tan, Ningwei Bai, Harry Gardener, Zhengyang Zhong, Luoyu Zhang, Liuhaichen Yang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * Department of Computer Science, University College London (UCL)(计算机科学系,伦敦大学学院(UCL))

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 SignVLA 提出了一种无 gloss 的视觉-语言-动作框架,用于实时手语引导的机器人操作,通过几何归一化、时间平滑和词汇精炼提升多模态交互的稳定性和可扩展性。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20566 2026-02-25 cs.RO cs.CV 57%

BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model

BFA++: 多视角视觉语言动作模型的分层最佳特征感知令牌剪枝

Haosheng Li, Weixin Mao, Zihan Lan, Hongwei Xiong, Hongan Wang, Chenyang Si, Ziwei Liu, Xiaoming Deng, Hua Chen

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) LimX Dynamic(LimX动态) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV

AI总结 BFA++通过分层最佳特征感知令牌剪枝提升多视角视觉语言动作模型的效率和成功率

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18941 2026-02-24 cs.CV 57%

Global Commander and Local Operative: A Dual-Agent Framework for Scene Navigation

全局指挥官与局部执行者:一种双智能体框架用于场景导航

Kaiming Jin, Yuefan Wu, Shengqiong Wu, Bobo Li, Shuicheng Yan, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Simon Fraser University(西蒙弗雷泽大学) University of Oxford(牛津大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 DACo提出双智能体框架,通过解耦全局推理与局部执行,提升复杂环境中长时序导航的稳定性和性能。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18884 2026-02-24 cs.AI 57%

TPRU: Advancing Temporal and Procedural Understanding in Large Multimodal Models

TPRU: 推动大型多模态模型中的时序与过程理解

Zhenkun Gao, Xuhong Wang, Xin Tan, Yuan Xie

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 TPRU通过引入大规模多模态数据集和强化学习微调方法,显著提升大型模型在时序和过程理解上的表现,达到当前最先进的准确率。

Comments Accepted to ICLR 2026. 17 pages. Code, data, and models are available at: https://github.com/Stephen-gzk/TPRU

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16855 2026-02-20 cs.AI cs.CL 57%

Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents

Mobile-Agent-v3.5: 多平台基础图形用户界面代理

Haiyang Xu, Xi Zhang, Haowei Liu, Junyang Wang, Zhaozai Zhu, Shengjie Zhou, Xuhao Hu, Feiyu Gao, Junjie Cao, Zihua Wang, Zhiyuan Chen, Jitong Liao, Qi Zheng, Jiahui Zeng, Ze Xu, Shuai Bai, Junyang Lin, Jingren Zhou, Ming Yan

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 GUI-Owl-1.5通过多平台支持和创新算法在GUI任务中取得突破性成绩。

Comments 25 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15862 2026-02-19 cs.CL cs.AI 57%

Enhancing Action and Ingredient Modeling for Semantically Grounded Recipe Generation

增强语义 grounded 的动作和成分建模以实现语义 grounded 的食谱生成

Guoshan Liu, Bin Zhu, Yian Li, Jingjing Chen, Chong-Wah Ngo, Yu-Gang Jiang

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出语义 grounded 的框架,通过两阶段流程结合监督微调和强化微调,提升食谱生成的语义准确性与成分预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15397 2026-02-18 cs.RO cs.AI 57%

ActionCodec: What Makes for Good Action Tokenizers

ActionCodec:什么使好的动作分词器成为可能

Zibin Dong, Yicheng Liu, Shiduo Zhang, Baijun Ye, Yifu Yuan, Fei Ni, Jingjing Gong, Xipeng Qiu, Hang Zhao, Yinchuan Li, Jianye Hao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出ActionCodec,通过信息论原则提升动作分词性能,实现无需机器人预训练的VLA模型新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14083 2026-02-17 cs.AI 57%

Plan-MCTS: Plan Exploration for Action Exploitation in Web Navigation

Plan-MCTS:网页导航中的计划探索用于动作利用

Weiming Zhang, Jihong Wang, Jiamu Zhou, Qingyao Li, Xinbei Ma, Congmin Zheng, Xingyu Lou, Weiwen Liu, Zhuosheng Zhang, Jun Wang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 Plan-MCTS通过将网页导航探索转移到语义计划空间,提升动作利用效率,实现更高效的导航任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10556 2026-02-17 cs.RO cs.AI 57%

LAP: Language-Action Pre-Training Enables Zero-shot Cross-Embodiment Transfer

LAP:语言-动作预训练实现零样本跨躯体迁移

Lihan Zha, Asher J. Hancock, Mingtong Zhang, Tenny Yin, Yixuan Huang, Dhruv Shah, Allen Z. Ren, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 LAP通过语言-动作预训练实现零样本跨躯体迁移,首次在无需特定躯体微调的情况下达到显著的迁移效果,提升性能达两倍。

Comments Project website: https://lap-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11832 2026-02-13 cs.CV cs.RO 57%

JEPA-VLA: Video Predictive Embedding is Needed for VLA Models

视频预测嵌入对于VLA模型是必要的

Shangchen Miao, Ningya Feng, Jialong Wu, Ye Lin, Xu He, Dong Li, Mingsheng Long

机构 * Tsinghua University(清华大学) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 JEPA-VLA通过引入视频预训练的预测嵌入,提升VLA模型在机器人任务中的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11750 2026-02-13 cs.SE cs.AI cs.HC 57%

AmbiBench: Benchmarking Mobile GUI Agents Beyond One-Shot Instructions in the Wild

AmbiBench:在真实场景中超越单次指令的移动GUI代理基准测试

Jiazheng Sun, Mingxuan Li, Yingying Zhang, Jiayang Niu, Yachen Wu, Ruihan Jin, Shuyu Lei, Pengrongrui Tan, Zongyu Zhang, Ruoyi Wang, Jiachen Yang, Boyu Yang, Jiacheng Liu, Xin Peng

机构 * Fudan University(复旦大学) Jilin University(吉林大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI

AI总结 AmbiBench是首个针对移动GUI代理在真实场景中超越单次指令的双向意图对齐的基准测试,通过引入清晰度分类和MUSE框架评估代理在不同清晰度下的表现。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09940 2026-02-11 cs.RO cs.AI 57%

Instruct2Act: From Human Instruction to Actions Sequencing and Execution via Robot Action Network for Robotic Manipulation

Instruct2Act: 从人类指令到动作序列和执行的机器人操作网络

Archit Sharma, Dharmendra Sharma, John Rebeiro, Peeyush Thakur, Narendra Dhar, Laxmidhar Behera

机构 * Indian Institute of Technology Mandi(印度理工学院曼迪分校)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 Instruct2Act通过机器人操作网络实现从人类指令到动作序列的解析与执行,达到91.5%的子动作预测准确率和90%的任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09662 2026-02-11 cs.CV 57%

TreeCUA: Efficiently Scaling GUI Automation with Tree-Structured Verifiable Evolution

TreeCUA: 通过树结构可验证进化高效扩展GUI自动化

Deyang Jiang, Jing Huang, Xuanle Zhao, Lei Chen, Liming Zheng, Fanfan Liu, Haibo Qiu, Peng Shi, Zhixiong Zeng

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 TreeCUA通过树结构可验证进化高效扩展GUI自动化,提升GUI规划能力。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05787 2026-02-11 cs.AI 57%

From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation

从离线到在线:通过双层专家到策略融合提升GUI代理

Zezhou Wang, Ziyun Zhang, Xiaoyi Zhang, Zhuzhong Qian, Yan Lu

机构 * Nanjing University(南京大学) Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 BEPA通过双层专家到策略融合方法,提升GUI代理在OSWorld-Verified等基准测试中的性能。

Comments Work In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26098 2026-02-10 cs.AI 57%

GUI Knowledge Bench: Revealing the Knowledge Gap of VLMs in GUI Tasks

GUI知识基准:揭示VLMs在GUI任务中的知识差距

Chenrui Shi, Zedong Yu, Zhi Gao, Ruining Feng, Enqi Liu, Yuwei Wu, Yunde Jia, Liuyu Xiang, Zhaofeng He, Qing Li

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(国家一般人工智能重点实验室) Beijing University of Posts(北京邮电大学) Tsinghua University, Beijing, China(清华大学) Shenzhen MSU-BIT University, Shenzhen, China(深圳MSU-BIT大学)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

AI总结 GUI知识基准揭示VLMs在GUI任务中的知识差距,通过提炼三个维度的GUI知识,评估现有模型的不足并指导更高效的任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22009 2026-02-10 cs.AI 57%

OpenPhone: Mobile Agentic Foundation Models

OpenPhone: 移动代理基础模型

Yangqin Jiang, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 OpenPhone通过设备-云协作提升移动GUI代理性能,结合设备端高效模型与云端强大能力,实现成本降低与性能提升的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14388 2026-02-09 cs.AI 57%

Hi-Agent: Hierarchical Vision-Language Agents for Mobile Device Control

Hi-Agent:用于移动设备控制的分层视觉语言代理

Zhe Wu, Hongjin Lu, Junliang Xing, Changhao Zhang, Yuxuan Li, Yin Zhu, Yuhao Yang, Yuheng Jing, Kai Li, Kun Shao, Jianye Hao, Jun Wang, Yuanchun Shi

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University College London(伦敦大学学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 Hi-Agent通过分层结构和前瞻性优势函数,实现移动设备控制的高效训练和高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05998 2026-02-06 cs.CV 57%

VisRefiner: Learning from Visual Differences for Screenshot-to-Code Generation

VisRefiner: 从视觉差异中学习以实现截图到代码生成

Jie Deng, Kaichun Yao, Libo Zhang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 VisRefiner通过学习视觉差异提升截图到代码生成的准确性和自我完善能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00743 2026-02-03 cs.RO cs.AI 57%

SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning

SA-VLA:面向视觉-语言-动作强化学习的空间感知流匹配

Xu Pan, Zhenglin Wan, Xingrui Yu, Xianwei Zheng, Youkai Ke, Ming Sun, Rui Wang, Ziwei Wang, Ivor Tsang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 SA-VLA通过空间感知的RL适应框架,在强化学习微调中保持空间定位,提升视觉-语言-动作任务的鲁棒性和泛化能力。

Comments Version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19199 2026-02-03 cs.AI 57%

MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution

MAGNET:迈向基于记忆驱动的知识演化的自适应GUI代理

Libo Sun, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) University of Southern California(南加州大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 MAGNET通过双层记忆机制和动态演化机制,提升GUI代理在界面变化中的适应性和任务执行性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22948 2026-02-02 cs.AI 57%

Alignment among Language, Vision and Action Representations

语言、视觉和动作表征的一致性

Nicola Milano, Stefano Nolfi

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 研究通过训练Transformer智能体执行自然语言指令,发现语言、视觉和动作表征在跨模态中呈现部分共享的语义结构,支持模态无关的语义组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19236 2026-02-02 cs.RO cs.CV 57%

MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation

MemoryVLA: 视觉-语言-动作模型中用于机器人操作的感知-认知记忆

Hao Shi, Bin Xie, Yingfei Liu, Lin Sun, Fengrong Liu, Tiancai Wang, Erjin Zhou, Haoqiang Fan, Xiangyu Zhang, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University(自动化系、BNRist、清华大学) Dexmal MEGVII Technology(MEGVII技术) Tianjin University(天津大学) Harbin Institute of Technology(哈尔滨工业大学) StepFun

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

AI总结 MemoryVLA通过结合感知与认知记忆机制,提升机器人操作中长时间跨度任务的性能,实现对时间依赖任务的高效处理。

Comments ICLR 2026 | The project is available at https://shihao1895.github.io/MemoryVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22575 2026-02-02 cs.CV cs.CL 57%

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

PhoStream:面向移动场景的多模态助手实时流基准测试

Xudong Lu, Huankang Guan, Yang Bo, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Peiwen Sun, Xueying Li, Wei Zhang, Xue Yang, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(CUHK 多模态实验室) Huawei Research(华为研究) City University of Hong Kong(城市大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 PhoStream是首个面向移动场景的多模态助手实时流基准测试,通过统一屏幕内外场景评估视频、音频和时间推理能力,揭示了大语言模型在决定何时发言上的局限性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21751 2026-01-30 cs.CV 57%

Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation

动态拓扑感知:突破视觉语言导航中的粒度刚性

Jiankun Peng, Jianyuan Guo, Ying Xu, Yue Liu, Jiashuang Yan, Xuanwei Ye, Houhua Li, Xiaoming Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 DGNav通过动态拓扑导航框架,解决视觉语言导航中的粒度刚性问题,提升导航效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20380 2026-01-29 cs.AI 57%

OmegaUse: Building a General-Purpose GUI Agent for Autonomous Task Execution

OmegaUse:构建一个通用的 GUI 代理以实现自主任务执行

Le Zhang, Yixiong Xiao, Xinjiang Lu, Jingjia Cao, Yusai Zhao, Jingbo Zhou, Lang An, Zikan Feng, Wanxiang Sha, Yu Shi, Congxi Xiao, Jian Xiong, Yankai Zhang, Hua Wu, Haifeng Wang

机构 * Baidu Frontier Research Department(百度前沿研究部)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 OmegaUse 是一种通用 GUI 代理模型,通过高质量数据和解耦训练方法实现跨平台自主任务执行,展现卓越的 GUI 任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19258 2026-01-28 cs.HC cs.AI 57%

GhostUI: Unveiling Hidden Interactions in Mobile UI

GhostUI: 解蔽移动UI中的隐藏交互

Minkyu Kweon, Seokhyeon Park, Soohyun Lee, You Been Lee, Jeongmin Rhee, Jinwook Seo

机构 * Seoul National University(首尔国立大学)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

AI总结 GhostUI通过提供隐藏交互数据集,提升移动应用中VLMs对隐含手势的识别和任务自动化能力。

Comments Accepted at ACM CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10809 2026-01-28 cs.CR cs.LG 57%

MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents

针对代理的恶意图像补丁:多模态操作系统代理劫持

Lukas Aichberger, Alasdair Paren, Guohao Li, Philip Torr, Yarin Gal, Adel Bibi

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) University of Oxford(牛津大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 本文提出恶意图像补丁(MIPs)攻击,通过篡改屏幕区域使多模态OS代理执行有害操作,揭示了OS代理的安全漏洞。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18305 2026-01-27 cs.CV 57%

SwipeGen: Bridging the Execution Gap in GUI Agents via Human-like Swipe Synthesis

SwipeGen: 通过类人滑动合成弥合GUI代理的执行差距

Xuan Wang, Siyuan Su, Quantong Fu, Yongxiang Hu, Yangfan Zhou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

AI总结 SwipeGen通过合成类人滑动交互提升GUI代理的执行能力,实验显示其滑动执行准确率较基线提升214%。

Comments 15 pages, 3 figures. Under review. Code and dataset will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17722 2026-01-27 cs.AI 57%

EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents

EntWorld: 一个综合环境和基准,用于可验证的企业GUI代理

Ying Mo, Yu Bai, Dapeng Sun, Yuqian Shi, Yukai Miao, Li Chen, Dan Li

机构 * Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 EntWorld是一个综合的企业GUI代理基准,通过基于模式的任务生成和SQL验证机制,评估代理在企业环境中的表现,揭示当前代理能力的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16973 2026-01-26 cs.CV 57%

VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents

VisGym: 多模态代理的多样化、可定制化、可扩展环境

Zirui Wang, Junyi Zhang, Jiaxin Ge, Long Lian, Letian Fu, Lisa Dunlap, Ken Goldberg, XuDong Wang, Ion Stoica, David M. Chan, Sewon Min, Joseph E. Gonzalez

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 VisGym通过多样化环境评估多模态代理在多步视觉决策中的表现,揭示模型在长上下文处理和视觉化任务中的局限性。

Comments Project page: https://visgym.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏