OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract);分类 cs.AI
Comments 51 pages, 21 figures
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract);分类 cs.AI
Comments 51 pages, 21 figures
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments 12 pages, 0 figures
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by ICLR 2024 Workshop in Large Language Model (LLM) Agents
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments 8 pages, 6 figures, to be published in IEEE IRC 2023
专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.CV
Comments Tech Report
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Tech Report
UI-MOPD:用于持续GUI智能体学习的多平台策略蒸馏
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Xiaomi(小米) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Zhejiang University(浙江大学) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对构建多平台GUI智能体的挑战,构建高质量数据集Uni-GUI,提出UI-MOPD方法,通过多教师策略蒸馏实现持续学习,动态选教师并转移行为先验,实验证明其能平衡跨平台能力保留与新平台适应。
Comments Technical report. 27 pages, 7 figures, 7 tables
MobileForge:基于分层反馈引导策略优化的移动GUI智能体免标注适配
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn)
AI总结 提出MobileForge系统,通过MobileGym环境实现任务生成与评估,结合分层反馈引导策略优化(HiFPO)将轨迹结果、步骤反馈和修正提示转化为步骤级GRPO更新,实现移动GUI智能体免标注适配,在AndroidWorld上达到67.2% Pass@3。
Comments Project page: https://mobile-forge.github.io/
视觉-语言-动作(VLA)模型应如何使用本体感受状态?
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)
AI总结 本研究针对视觉-语言-动作(VLA)模型的本体感受状态接入方式开展受控实验,探究状态接入位置、历史长度等问题,得出系统性答案并提炼为可验证的VLA模型设计原则。
FreqNav:面向面向对象空中视觉语言导航的分阶段频率路由
专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn)
AI总结 针对现有空中VLN方法的感知干扰问题,提出FreqNav框架,通过动态分配视觉令牌实现分阶段频率路由,提升性能并加快推理速度,验证了其实际应用潜力。
CycleVLA: 通过子任务回溯和最小贝叶斯风险解码实现的前瞻性自修正视觉-语言-动作模型
机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Department of Engineering, University of Cambridge(剑桥大学工程系)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)
AI总结 CycleVLA通过子任务回溯和最小贝叶斯风险解码实现前瞻性自修正,提升视觉-语言-动作模型的故障预测与恢复能力
Comments Project Page: https://dannymcy.github.io/cyclevla/
SOPD-SocialNav:用于视觉语言社交导航的选择性在线策略蒸馏
机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术研究生院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
AI总结 针对大规模视觉语言模型难部署、轻量级模型社交推理能力不足的问题,提出SOPD-SocialNav方法,通过基于熵的令牌选择机制及温度控制的散度目标,将社交导航知识从大型教师模型转移到轻量级学生模型,实验证明该方法有效。
Comments This paper has been accepted to 2026 WRC Symposium on Advanced Robotics and Automation (WRC SARA)
EdgeCoInfer:用于设备端多模态大模型的分层协作推理
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)
AI总结 针对边缘环境中多模态大模型面临的挑战,提出EdgeCoInfer框架,通过模型间功能模块共享和模型内细粒度划分实现粒度自适应部署,采用混合进化分层强化学习解决问题,实验表明该框架能提高任务完成率并降低系统成本和内存消耗。
诊断智能体编排的视觉-语言-动作技能组合中的语义切换失败
机构 * SimpleAI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract)
AI总结 研究智能体编排的视觉-语言-动作技能组合中的语义切换失败问题,通过智能体编排执行框架,调用基于π0.5的技能检查点,在两种初始状态分布下评估,发现单技能与长期任务成功率差距大,为未来技能库改进提供诊断依据。
Journal ref RSS SemRob Workshop 2026
让它简单:视觉-语言-动作模型的单步动作生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
专题命中 GUI与屏幕智能体 :VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 针对视觉-语言-动作(VLA)模型,提出通过偏置训练时间分布至高频噪声状态,实现无需教师模型、蒸馏或辅助目标的单步动作生成,性能可匹配十步解码。
Comments 13 pages, 10 figures
通过用密集CLIP泛化语义映射实现开放词汇目标导航
机构 * Shanghai AI Lab(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Zhejiang University(浙江大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
AI总结 研究面向对象的实体导航任务,提出OVExp框架,利用密集CLIP模型展示基于语义地图的目标预测网络泛化能力,设计跨模态转移策略解决训练成本高问题,在ObjectNav基准上对未知目标有强大泛化能力。
Comments Accepted by ICRA 2026
CAC-VLA:用于视觉-语言-动作模型的上下文门控动作条件调节
机构 * University of Science and Technology of China (USTC)(中国科学技术大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)
AI总结 研究视觉-语言-动作模型,提出上下文门控动作条件调节框架CAC-VLA,在视觉语言模型中学习轻量级潜在动作接口,训练模型预测潜在动作并通过上下文门调节动作专家,实验验证其有效性。
Comments 16 pages, 6 figures
文本到图像模型强化学习后训练的有限差分流优化
机构 * UC Berkeley(加州大学伯克利分校) ; NVIDIA(英伟达)
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出一种在线强化学习变体,通过采样配对轨迹并将流速度拉向更优图像方向来降低模型更新方差,将整个采样过程视为单一动作,实现更快的收敛和更高的输出质量与提示对齐。
Comments Code available at https://github.com/NVlabs/finite-difference-flow-optimization
OLiVia-Nav: 一种面向移动机器人社交导航的在线终身视觉语言方法
机构 * University of Toronto(多伦多大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
AI总结 OLiVia-Nav通过融合视觉语言模型与在线终身学习框架,实现机器人社交导航中的社会规范适应与动态轨迹规划,优于现有方法。
通过自主经验探索与事后经验利用赋能GUI智能体任务规划
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 GUI与屏幕智能体 :MLLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出PEEU方法,通过自主探索环境发现经验并利用事后经验合成严格对齐的高层训练数据,提升小型多模态大语言模型在GUI任务中的规划与跨网站泛化能力。
Comments Accepted to ACL 2026 Main
Cosmos 3:面向物理AI的全模态世界模型
机构 * NVIDIA
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出基于统一混合Transformer架构的全模态世界模型Cosmos 3,联合处理语言、图像、视频、音频和动作序列,在理解和生成任务上达到新最优,为具身智能体提供可扩展的通用骨干。
dVLA-RL:基于去噪轨迹的强化学习用于离散扩散视觉-语言-动作模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Baidu AI Cloud D-Robotics Shanghai AI Laboratory(百度AI云D-机器人上海人工智能实验室)
专题命中 GUI与屏幕智能体 :VLM(abstract_cn);grounding(abstract)
AI总结 提出dVLA-RL方法,将离散扩散VLA模型的强化学习目标从边缘动作概率转移到采样生成路径的联合概率,通过将去噪过程建模为马尔可夫决策过程,实现变步长调度,在LIBERO上达到99.7%成功率,在RoboTwin 2.0上相比SFT提升30.6%。
MemGUI-Agent: 一种具有主动上下文管理的端到端长时移动GUI智能体
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn)
AI总结 提出MemGUI-Agent,通过主动上下文管理机制(ConAct)将上下文管理作为一等动作,解决长时任务中提示膨胀和关键信息稀释问题,在8B模型上达到最佳性能。
Comments 33 pages, 6 figures. Project page: https://memgui-agent.github.io/
云边连续体中多模态大模型的生成质量-延迟权衡感知推理卸载
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn)
AI总结 针对云边协同多模态大模型推理,提出QLMIO框架以优化生成质量与响应延迟的权衡,并构建MIOBench基准,实验表明延迟降低58.14%且任务完成率不变。
Comments This manuscript was submitted to IEEE Transactions on Mobile Computing on June 3, 2026
CAST: 反事实标签提升视觉-语言-动作模型中的指令跟随能力
机构 * University of California Berkeley(加州大学伯克利分校) ; Princeton University(普林斯顿大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract)
AI总结 针对VLA模型难以遵循细粒度指令的问题,提出利用视觉语言模型生成反事实标签增强数据集,提升语言基础多样性,实验表明该方法在导航和操作任务中显著提升指令跟随成功率。
IntentNav: 从人类演示中学习空间-视觉物体导航
机构 * Nanyang Technological University(南洋理工大学) ; Carnegie Mellon University(卡内基梅隆大学) ; The Chinese University of Hong Kong(香港中文大学) ; A*STAR Institute for Infocomm Research (I2R)(新加坡科技研究局资讯通信研究院)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)
AI总结 提出IntentNav框架,通过人类演示学习类人物体导航策略,利用前沿标注和意图对齐目标实现最优性能,并零样本迁移到多种机器人平台。
Comments 26 pages, 9 figures
CodeGraphVLP:代码规划器与语义图状态的结合用于非马尔可夫视觉-语言-动作模型
机构 * University of Arkansas(亚拉巴马大学) ; Max Planck Research School for Intelligent Systems and the University of Stuttgart(马克斯·普朗克智能系统研究学校和斯图加特大学) ; Center of AI Research, VinUniversity(Vin大学人工智能研究中心) ; TU Wien(维也纳技术大学) ; University of Liverpool(利物浦大学)
专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract)
AI总结 CodeGraphVLP结合语义图状态与可执行代码规划器,提升非马尔可夫长周期任务的视觉语言动作执行效率,降低规划延迟并提高任务完成率。
OpenWebRL: 揭秘视觉网络代理的在线多轮强化学习
机构 * UIUC(伊利诺伊大学香槟分校) ; Microsoft(微软)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出OpenWebRL框架,通过在线多轮强化学习在真实网站上训练视觉网络代理,以4B参数模型在基准测试中达到开源最优,并与闭源系统竞争。
Comments 36 pages, 11 figures
MaskClaw: GUI代理的边端个性化隐私仲裁与行为驱动技能进化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)
AI总结 提出MaskClaw,一种在边端进行隐私仲裁的GUI代理框架,通过本地视觉证据提取、策略记忆检索和沙箱门控的技能进化,在截图离开信任环境前决定允许、遮蔽或询问,解决了静态PII检测和云端推理的隐私边界问题。
Comments Preprint. Submitted to EMNLP 2026. 21 pages, including appendices; 5 figures Under review. Yanqiu Zhao and Dongying Zheng contributed equally to this work