EXTRACT: Efficient Policy Learning by Extracting Transferable Robot Skills from Offline Data
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI、cs.LG
Comments 25 pages, 16 figures
Journal ref CoRL 2024
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI、cs.LG
Comments 25 pages, 16 figures
Journal ref CoRL 2024
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
Comments Paper accepted by IROS 2024
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI、cs.LG
Comments Published at 3rd Conference on Lifelong Learning Agents (CoLLAs), 2024
专题命中 GUI与屏幕智能体 :visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments V3: Fixed typo in Fig.1; V2: Minor formatting changes and added missing subfigure captions
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI、cs.LG
Comments Project page with code & videos: https://helper-agent-llm.github.io
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.LG
Comments CVPR 2023
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
Journal ref Entropy 2022
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
Comments This paper has been accepted for publication at IEEE RA-L
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
Comments workshop paper at BAICS at ICLR 2020
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
Comments CVPR 2019 Oral
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
Comments ICLR 2019, code is available at https://github.com/chihyaoma/selfmonitoring-agent
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
Comments 21 pages, 7 figures, with supplementary material
专题命中 GUI与屏幕智能体 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments CVPR 2018 Spotlight presentation
专题命中 GUI与屏幕智能体 :grounding(abstract,comments);分类 cs.AI
Comments Accepted at the 1st Workshop on Language Grounding for Robotics at ACL 2017
CoAdapt-GUI:面向未知GUI应用的工作流上下文与策略联合适配
机构 * Li Gu(李谷(音译))
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
AI总结 CoAdapt-GUI框架通过联合适配工作流上下文与策略,在有限交互预算无目标演示的未知GUI应用场景下,将AndroidWorld泛化性能提至45.0%、AndroidWorld Plus提至52.9%,优于仅策略TTA基线。
隐式质心引导:用于指令对齐自动驾驶的单次无分类器引导
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; NVIDIA(英伟达公司)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 针对视觉语言自动驾驶模型的指令跟随差距,提出单次引导机制LCS,降低推理延迟约50%,在Bench2Drive和nuScenes基准上提升指令遵循与驾驶性能。
Comments IROS 2026
HoosierHelp:面向社会服务导航的大语言模型智能体基准测试
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 该研究推出基于印第安纳州3971项公共社会服务资源的交互式基准HoosierHelp,测试发现现有LLM智能体在社会服务导航中对复杂非理想用户交互鲁棒性不足,需更可靠的智能体。
WorldSimProbe:面向具身操控的动作条件世界模型的模拟器保真度诊断
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; EvoPhys AI(EvoPhys人工智能公司) ; Joy Future Academy, JD(京东探索研究院) ; The University of Sydney(悉尼大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 该研究提出WorldSimProbe框架,通过五套受控测试评估动作条件世界模型的模拟器保真度,发现其存在动作实现退化等问题,为具身操控模型提供标准化诊断方法。
Comments 20 pages, 18 figures, and 10 tables, including supplementary material. Code and data: https://evophys.com/WorldSimProbe/
重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角
机构 * Sichuan University(四川大学) ; Sun Yat-sen University(中山大学) ; Australian National University(澳大利亚国立大学) ; Peking University(北京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :MLLM(abstract_cn);分类 cs.CV
AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。
基于OpenArm的实验室移动操作的表示交接
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 本研究提出基于OpenArm的实验室移动操作原型,通过表示交接整合多模块,可暴露部署阻碍并为具身系统整合提供调试接口。
Comments Robotics: Science and Systems (RSS) Workshop 2026
Gated-BEPO:用于大语言模型智能体的置信门控贝尔曼信用分配
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
AI总结 本研究针对大语言模型智能体长视域训练的信用分配问题,提出Gated-BEPO方法,通过经验rollout图推导步骤级信用并结合置信门自适应融合回合与步骤级信用,在多任务基准上取得性能提升。
Robust-WAM:桥接生成式预训练与世界-动作模型中的语义前瞻
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Beihang University(北京航空航天大学) ; Huawei Foundation Model Department(华为基础模型部门)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 Robust-WAM是一种通用后训练方法,在保留VAE生成路径的同时添加语义前瞻对齐,可提升多个WAM基线在分布外条件下的动作预测成功率且不损失分布内性能。
VLA-Arena:一个用于基准测试视觉-语言-动作模型的开源框架
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 提出VLA-Arena基准,通过三正交轴(任务结构、语言命令、视觉观察)量化任务难度,系统评估视觉-语言-动作模型的能力边界与失败模式。
Comments Accepted by ICML 2026
下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。
世界到手腕:面向精细机器人操作的任务条件未来手腕建模
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Wuhan University(武汉大学) ; Sun Yat-sen University(中山大学) ; Xidian University(西安电子科技大学) ; Southeast University(东南大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 本研究提出W2-VLA模型,通过任务条件未来手腕建模结合W2-CoT辅助监督,在LIBERO等数据集及真实任务中提升了机器人精细接触敏感操作能力,动作生成速率超80Hz。
MAC 2026:推动微动作分析迈向细粒度理解
机构 * United Arab Emirates University(阿联酋大学) ; Hefei University of Technology(合肥工业大学) ; University College London(伦敦大学学院) ; Zhejiang University(浙江大学) ; University of Oulu(奥卢大学) ; CMVS, University of Oulu(奥卢大学计算机视觉与媒体研究中心)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文介绍第三届MAC 2026,以从识别到细粒度微动作理解为主题,扩大挑战范围,引入新任务并借助多模态大语言模型评估,总结了相关数据集、设置、结果等,还探讨了微动作分析未来方向及在视频理解中的作用。
Comments Challenge Summary Paper of the 3rd Micro-Action Analysis Grand Challenge (MAC 2026) at ACM Multimedia 2026
隐私保护动作识别:分类、方法与隐私-效用权衡
机构 * Chung-Ang University(中央大学) ; Ulsan National Institute of Science and Technology (UNIST)(蔚山科学技术院) ; College of Art and Technology, Chung-Ang University(中央大学艺术与技术学院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 该研究通过PRISMA指导的综述,梳理32篇PPAR论文,提出分类法、评估协议等,分析各方法权衡,指出评估不足,推动PPAR从原型向部署发展。