Generalist Robot Manipulation beyond Action Labeled Data
机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院,瑞士)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments Accepted at Conference on Robot Learning 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院,瑞士)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments Accepted at Conference on Robot Learning 2025
机构 * Department of Aeronautics and Astronautics, Stanford University(航空与航天系,斯坦福大学) ; Department of Mechanical Engineering, Stanford University(机械工程系,斯坦福大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
机构 * Peking University(北京大学) ; Galbot ; USTC(中国科学技术大学) ; BAAI(百度人工智能研究院) ; University of Adelaide(阿德莱德大学) ; Zhejiang University(浙江大学) ; Differential Robotics Project(差分机器人项目)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments Project Page: https://pku-epic.github.io/NavFoM-Web/
机构 * Smart Systems Institute, National University of Singapore(新加坡国立大学智能系统研究所) ; Northeastern University(东北大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments This work has been submitted to the IEEE for possible publication
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments 27 pages, 12 figures
机构 * Zhixuan Shen, Haonan Luo, Kexun Chen, Fengmao Lv, Tianrui Li(作者)
专题命中 GUI与屏幕智能体 :vision language model(abstract)
Comments 16 pages, 10 figures, Extended Version of accepted AAAI 2025 Paper
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
机构 * South China University of Technology(华南理工大学) ; Pazhou Lab(Pazhou 实验室)
专题命中 GUI与屏幕智能体 :vision language model(abstract)
Comments ACM MM 2025
机构 * Technical University of Leoben(莱博恩技术大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
专题命中 GUI与屏幕智能体 :MLLM(abstract)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments 9 pages, 5 figures
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
机构 * Beijing Institute of Technology, Beijing, P. R. China(北京理工大学) ; The University of Hong Kong, Hong Kong, P. R. China(香港大学)
专题命中 GUI与屏幕智能体 :vision language model(abstract)
Comments accepted to International Journal of Robotics Research(IJRR)
机构 * Shanghai Jiao Tong University(上海交通大学) ; OPPO Research Institute(OPPO研究院)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments A technical report on a GUI agent based on multi-agent systems
机构 * RoboPI Laboratory, Dept. of ECE, University of Florida (UF)(罗波实验室,电子工程系,佛罗里达大学) ; FOCUS Laboratory, Dept. of ECE, University of Florida (UF)(焦点实验室,电子工程系,佛罗里达大学) ; Amazon Robotics(亚马逊机器人技术)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments V2, includes suppl as appendix
机构 * K-Scale Labs(K-Scale实验室) ; McGill University(麦吉尔大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Journal ref IROS-MoMA3 Workshop 2024
机构 * University of Maryland, College Park MD, 20740, USA(马里兰大学) ; Goerge Mason University, Fairfax, VA, 22030, USA(乔治·马歇尔大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学) ; Department of Information Sciences and Technology, George Mason University(信息科学与技术系,乔治·马歇尔大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments 11 pages,6 figures
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Westlake University(西湖大学) ; Monash University(墨尔本大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments 14 pages
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
机构 * Stanford University(斯坦福大学) ; Google DeepMind(谷歌DeepMind)
专题命中 GUI与屏幕智能体 :grounding(abstract)
Comments 16 pages, 13 figures
机构 * National University of Singapore(新加坡国立大学) ; Wuhan University(武汉大学) ; Zhejiang University(浙江大学) ; Nanjing University(南京大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments 8 pages, 7 figures
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments WWW' 2025
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beihang University(北航) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Samsung Research China(三星中国研究院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments 16 pages
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; Department of Engineering Science, Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院工程科学系) ; China Ship Research and Development Academy(中国船舶科研 Academy) ; Obuda University(奥布达大学) ; State Key Laboratory for Management and Control of Complex Systems, Chinese Academy of Sciences(中国科学院复杂系统管理与控制国家重点实验室)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
专题命中 GUI与屏幕智能体 :grounding(abstract)
Comments ICML 2025
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments Accepted to CHI 2025, in press. See the project page at mediacontentatlas.github.io
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
Comments Accepted to MM4SG Workshop at The Web Conference 2025