How Auxiliary Reasoning Unleashes GUI Grounding in VLMs
辅助推理如何释放VLM中的GUI定位能力
Weiming Li, Yan Shao, Jing Yang, Yujing Lu, Ling Zhong, Yuhan Wang, Min Yu, Tongxiao Ruan, Manni Duan
机构
*
Zhejiang Lab(浙江实验室)
;
Hangzhou Research and Development Center(杭州研发中心)
;
China Mobile(中国移动)
;
Innovation Center of Yangtze River Delta(长江三角洲创新中心)
;
Zhejiang University(浙江大学)
CodeGraphVLP: Code-as-Planner Meets Semantic-Graph State for Non-Markovian Vision-Language-Action Models
CodeGraphVLP:代码规划器与语义图状态的结合用于非马尔可夫视觉-语言-动作模型
Khoa Vo, Sieu Tran, Taisei Hanyu, Yuki Ikebe, Duy Nguyen, Nghi D. Q. Bui, Minh Vu, Anthony Gunderman, Chase Rainwater, Anh Nguyen, Ngan Le
机构
*
University of Arkansas(亚拉巴马大学)
;
Max Planck Research School for Intelligent Systems and the University of Stuttgart(马克斯·普朗克智能系统研究学校和斯图加特大学)
;
Center of AI Research, VinUniversity(Vin大学人工智能研究中心)
;
TU Wien(维也纳技术大学)
;
University of Liverpool(利物浦大学)