Zhaokai Wang, Penghao Yin, Xiangyu Zhao, Changyao Tian, Yu Qiao, Wenhai Wang, Jifeng Dai, Gen Luo
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Tsinghua University(清华大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
DeepWisdom
;
Singapore University of Technology and Design(新加坡科技设计大学)
;
Nanyang Technological University(南洋理工大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Tsinghua University(清华大学)
;
Université de Montréal & Mila(蒙特利尔大学及Mila)
机构
*
Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)
;
Juhaokan Technology Co.,Ltd(极皓科技有限公司)
;
Nanjing University(南京大学)
;
University of Science and Technology of China(中国科学技术大学)
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
SpatialReward: 通过显式空间推理弥合在线强化学习中图像编辑的感知差距
Yancheng Long, Yankai Yang, Hongyang Wei, Wei Chen, Tianke Zhang, Haonan fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)
机构
*
Wuhan University of Technology(武汉理工大学)
;
Tsinghua University(清华大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Shanghai AI Lab(上海人工智能实验室)
;
University of Oxford(牛津大学)
;
INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)
HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation
HCSG:以人类为中心的语义-几何推理用于视觉-语言导航
Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Jin Wu, Huashuo Lei, Yunfan Lou, Lujia Wang, Hesheng Wang, Haoang Li
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Tsinghua University(清华大学)
;
University of Science and Technology Beijing(北京科技大学)
;
National University of Singapore(新加坡国立大学)
;
Shanghai Jiao Tong University(上海交通大学)
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)
;
Tsinghua University(清华大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Peking University(北京大学)
机构
*
AZTI Foundation(AZTI基金会)
;
Tsinghua University(清华大学)
;
University of the Basque Country (UPV/EHU)(巴斯克国家大学(UPV/EHU))
;
University of Technology Sydney(悉尼技术大学)
;
IKERBASQUE
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院)
;
Meituan Academy of Robotics(美团机器人研究院)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
ALAM:基于代数一致的潜在动作模型用于视觉-语言-动作模型
Zuojin Tang, Haoyun Liu, Xinyuan Chang, Changjie Wu, Dongjie Huo, Yandan Yang, Bin Liu, Zhejia Cai, Feng Xiong, Mu Xu, jiachen Luo, De Ma, Zhiheng Ma, Gang Pan
机构
*
Zhejiang University(浙江大学)
;
Amap, Alibaba Group(阿里集团阿地图)
;
Nanjing University(南京大学)
;
Shenzhen University of Advanced Technology(深圳先进技术大学)
;
Beijing University of Chemical Technology(北京化工大学)
;
Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室)
;
Tsinghua University(清华大学)
;
Queen Mary University of London(伦敦大学玛丽女王学院)