How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing
模型能多好地遵循视觉指令?VIBE:一个系统性的视觉指令驱动图像编辑基准
Huanyu Zhang, Xuehai Bai, Chengzu Li, Chen Liang, Haochen Tian, Haodong Li, Ruichuan An, Yifan Zhang, Anna Korhonen, Zhang Zhang, Liang Wang, Tieniu Tan
机构
*
School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
;
Peking University(北京大学)
;
South China University of Technology(华南理工大学)
;
Nanjing University(南京大学)
DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning
DeFacto: 通过图像进行反事实推理以强制证据支持和忠实推理
Tianrun Xu, Haoda Jing, Ye Li, Yuquan Wei, Jun Feng, Guanyu Chen, Haichuan Gao, Tianren Zhang, Feng Chen
机构
*
Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系)
;
Zhongguancun Academy, Beijing, China(中关村学院)
;
School of Software, Xinjiang University, Urumqi, China(新疆大学软件学院)
;
College of Materials Science and Engineering, Fuzhou University, Fuzhou, China(福州大学材料科学与工程学院)
;
Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院)
;
Beijing Qianjue Technology Co., Ltd., Beijing, China(北京千 jue 技术有限公司)
Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles
Maestro:通过强化学习协调分层模型-技能集合
Jinyang Wu, Guocheng Zhai, Ruihan Jin, Yuhao Shen, Zhengxi Lu, Fan Zhang, Haoran Luo, Zheng Lian, Zhengqi Wen, Jianhua Tao
机构
*
Tsinghua University(清华大学)
;
Zhejiang University(浙江大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Nanyang Technological University(南洋理工大学)
;
Tongji University(同济大学)
机构
*
AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
Nanyang Technological University(南洋理工大学)
A Camera-Cooperative ISAC Framework for Multimodal Non-Cooperative UAVs Sensing
一种用于多模非合作无人机感知的相机协作ISAC框架
Wenfeng Wu, Luping Xiang, Kun Yang
机构
*
State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)
;
Institute of Intelligent Networks and Communications (NINE)(智能网络与通信研究院)
;
School of Intelligent Software and Engineering, Nanjing University (Suzhou Campus)(南京大学智能软件与工程学院(苏州校区))
机构
*
State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Robbyant
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
;
The Hong Kong University of Science and Technology(香港科技大学)
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Pengcheng Laboratory(鹏城实验室)
;
Pazhou Lab (Huangpu)(琶洲实验室(黄埔))
;
Hainan University(海南大学)
;
University of California at Merced(加州大学默塞德分校)
机构
*
JIUTIAN Research(JIUTIAN研究)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
MIIT Key Laboratory of Data and Decision Intelligence(信息与决策智能重点实验室)
;
Beihang University(北航)
MagicFuse: Single Image Fusion for Visual and Semantic Reinforcement
MagicFuse: 单图像融合用于视觉与语义增强
Hao Zhang, Yanping Zha, Zizhuo Li, Meiqi Gong, Jiayi Ma
机构
*
Electronic Information School, Wuhan University, China(武汉大学电子信息学院)
;
Suzhou Institute of Wuhan University, China(武汉大学苏州研究院)
;
School of Automation, Wuhan University, China(武汉大学自动化学院)
Learning to Evolve: Multi-modal Interactive Fields for Robust Humanoid Navigation in Dynamic Environments
学习进化:多模态交互场用于动态环境中的稳健双足机器人导航
Peifeng Jiang, Hong Liu, Jin Jin, Wenshuai Wang, Xia Li
机构
*
State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(一般人工智能国家重点实验室,北京大学深圳研究生院)
;
Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所)
;
Institute for Machine Learning, Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系机器学习研究所)