机构
*
Tsinghua University(清华大学)
;
Tsinghua University, Tencent(清华大学腾讯)
;
Tencent(腾讯)
;
University of Science and Technology Beijing(北京科技大学)
;
University of Macau(澳门大学)
机构
*
i2CAT Foundation(i2CAT基金会)
;
Hostelworld Group(Hostelworld集团)
;
Technical University of Catalonia (UPC)(技术大学(加泰罗尼亚))
;
Khalifa University of Science and Technology(卡里玛大学)
;
ISI/ATH
;
University of Patras(帕特拉大学)
Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练
Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian
机构
*
National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学)
;
The University of Hong Kong(香港大学)
;
Renmin University of China(中国人民大学)
专题命中
GUI与屏幕智能体
:grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model
Evo-Depth:一种轻量化的深度增强视觉-语言-动作模型
Tao Lin, Yuxin Du, Jiting Liu, Nuobei Zhu, Yunhe Li, Yuqian Fu, Yinxinyu Chen, Hongyi Cai, Zewei Ye, Bing Cheng, Kai Ye, Yiran Mao, Yilei Zhong, MingKang Dong, Junchi Yan, Gen Li, Bo Zhao
机构
*
School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)
;
King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 大学科学与技术大学)
;
Nanyang Technological University(南洋理工大学)
;
SJTU-Quic Robot Joint Lab(上海交通大学-Quick 机器人联合实验室)
机构
*
School of Cyberspace Security, Northwestern Polytechnical University(网络安全学院,西北工业大学)
;
School of Computer Science, Northwestern Polytechnical University(计算机学院,西北工业大学)
;
Intellifusion(智融科技)
To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model
看清并非学习:保护多模态数据免受大视觉语言模型的未经授权微调
Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu
机构
*
School of Computing
;
Augmented Intelligence, Arizona State University, Tempe, AZ, USA
;
Department of Computer Science
;
Engineering, Texas A\&M University, College Station, TX, USA
机构
*
MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室,人工智能研究院,上海交通大学)
;
vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);分类 cs.CV、cs.LG