ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision
ScreenParse:超越稀疏标注的完整屏幕解析监督
A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar
机构
*
IBM Research Zurich, Zurich, Switzerland(IBM苏黎世研究实验室,瑞士苏黎世)
;
ETH Zurich, Computer Vision(苏黎世联邦理工学院,计算机视觉)
;
ETH AI Center, Switzerland(苏黎世联邦理工学院人工智能中心,瑞士)
;
ETH Zurich, Photogrammetry(苏黎世联邦理工学院,摄影测量学)
;
Microsoft, Switzerland(微软公司,瑞士)
专题命中
GUI与屏幕智能体
:grounding(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV
机构
*
School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院)
;
Bosch Corporate Research(博世企业研究)
;
King Abdullah University of Science and Technology(卡布斯大学)
Usability Analysis of Configurator User Interfaces with Multimodal Large Language Models
配置器用户界面的可用性分析:基于多模态大语言模型
Sebastian Lubos, Alexander Felfernig, Damian Garber, Adnan Kraljić, Tarik Kraljić, Viet-Man Le, Thi Ngoc Trang Tran, Gerhard Leitner, Julian Schwazer, Doris Suppan, Reinhard Willfort, Ivan Dukic, Jeremias Fuchs, Manuel Henrich
专题命中
GUI与屏幕智能体
:multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)
NaviTrace: Evaluating Embodied Navigation of Vision-Language Models
NaviTrace: 评估视觉-语言模型的具身导航
Tim Windecker, Manthan Patel, Moritz Reuss, Richard Schwarzkopf, Cesar Cadena, Rudolf Lioutikov, Marco Hutter, Jonas Frey
机构
*
Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室)
;
Intuitive Robots Lab, KIT(卡尔斯鲁厄理工学院直观机器人实验室)
;
FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心)
GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction
GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测
Ruoxuan Yang, Tieyuan Chen, Xiaofeng Huang, Haibing Yin, Jun Wang, Xiping Chen, Jun Yin, Xuesong Gao, Weiyao Lin
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Hangzhou Dianzi University(杭州电子科技大学)
;
The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所)
;
Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司)
;
Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司)
;
School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院)
;
Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)
专题命中
GUI与屏幕智能体
:MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV