Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
机构 * Imperial College London(伦敦帝国理工学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; UC San Diego(加州大学圣地亚哥分校) ; VIVO ; South China University of Technology(华南理工大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Project website: https://robotic-visual-instruction.github.io/
机构 * Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI、cs.LG
Comments ICML 2025
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Oxford(牛津大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments ACL 2025 Camera Ready
机构 * Anhui University(安徽大学) ; Qihoo360(奇虎360)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
Comments Updated results in Table 2 and Table 3; The project is available at https://github.com/OpenBMB/AgentCPM-GUI
机构 * Manifold Research ; MIT(麻省理工学院)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.LG
Comments 16 pages, 26 figures
机构 * Intel(英特尔) ; Thoughtworks
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Mila - Quebec AI Institute(魁北克AI研究所) ; University of Waterloo(滑铁卢大学) ; National University of Singapore(新加坡国立大学) ; CIFAR AI Chair(CIFAR人工智能职位)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
Comments This paper has been accepted to the 41st International Conference on Machine Learning (ICML 2025)
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京耿丽人工智能学院) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR2025
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV、cs.AI
Comments 24 pages, 11 figures
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 8 pages, 8 figures, 1 table, Last updated on April 7th, 2025
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV、cs.AI
Comments Paper accepted to CVPR 2025
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI、cs.LG
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments Paper and Appendix, 26 pages
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI、cs.LG
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted to ICRA 2025
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Preprint
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted at NeurIPS 2023
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.LG
Comments 16 Pages, 10 Figures
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
Comments Technical Report. Github: https://github.com/showlab/ShowUI
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments 18 pages, 3 figures, an abridged version to appear in NeurIPS 2024 AFM Workshop
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
Comments Accepted to EMNLP 2024 main conference
Journal ref https://aclanthology.org/2024.emnlp-main.310/
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments CoRL LangRob Workshop, 2024
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI、cs.LG