机构
*
The University of Hong Kong(香港大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of California Irvine(加州大学尔湾分校)
;
Stanford University(斯坦福大学)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
Ziming Wei, Bingqian Lin, Yunshuang Nie, Jiaqi Chen, Shikui Ma, Hang Xu, Xiaodan Liang
机构
*
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
;
Shanghai Jiao Tong University(上海交通大学)
;
The University of Hong Kong(香港大学)
;
Hunan Artificial Intelligence and Robotics Institute Company Ltd.(湖南人工智能与机器人研究院有限公司)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
Peng Cheng Laboratory(鹏城实验室)
DINO-CVA: A Multimodal Goal-Conditioned Vision-to-Action Model for Autonomous Catheter Navigation
Pedram Fekri, Majid Roshanfar, Samuel Barbeau, Seyedfarzad Famouri, Thomas Looi, Dale Podolsky, Mehrdad Zadeh, Javad Dargahi
机构
*
Gina Cody School of Engineering and Computer Science, Concordia University(甘娜·柯迪工程与计算机科学学院,康科迪亚大学)
;
The Wilfred and Joyce Posluns Centre for Image Guided Innovation & Therapeutic Intervention (PCIGITI) at the Hospital for Sick Children (SickKids)(威廉与乔伊斯·波斯卢斯影像引导创新与治疗干预中心(PCIGITI)(SickKids医院))
;
Electrical and Computer Engineering Department, Kettering University(电气与计算机工程系,凯特林大学)
机构
*
Field Robotics Engineering and Science Hub (FRESH), Illinois Autonomous Farm, University of Illinois at Urbana-Champaign (UIUC), IL(伊利诺伊大学厄巴纳-香槟分校)
;
Mobile Robotics Group, São Carlos School of Engineering, University of São Paulo (EESC-USP), São Carlos, SP, Brazil(圣保罗大学)
Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System
Lixuan He, Haoyu Dong, Zhenxing Chen, Yangcheng Yu, Jie Feng, Yong Li
专题命中
GUI与屏幕智能体
:MLLM(abstract);分类 cs.CV、cs.AI
CommentsThe paper is currently under investigation regarding concerns of potential academic misconduct. While the investigation is ongoing, the authors have voluntarily requested to withdraw the manuscript
Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance
Songsheng Wang, Rucheng Yu, Zhihang Yuan, Chao Yu, Feng Gao, Yu Wang, Derek F. Wong
机构
*
NICS-EFC Lab, Department of Electronic Engineering, Tsinghua University(清华大学电子工程系NICS-EFC实验室)
;
Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)
;
Infinigence AI
;
Tsinghua University(清华大学)
;
Zhongguancun Academy(中关村学院)
专题命中
GUI与屏幕智能体
:visual language model(abstract);分类 cs.AI、cs.LG
Comments13 pages, 5 figures, Accepted by EMNLP 2025 (main conference)
TGPO: Tree-Guided Preference Optimization for Robust Web Agent Reinforcement Learning
Ziyuan Chen, Zhenghui Zhao, Zhangye Han, Miancan Liu, Xianhang Ye, Yiqing Li, Hongbo Min, Jinkui Ren, Xiantao Zhang, Guitao Cao
机构
*
East China Normal University(东华大学)
;
Alibaba Group(阿里巴巴集团)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Wuhan University(武汉大学)
;
Sun Yat-sen University(中山大学)
机构
*
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
;
Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港科学与创新研究院人工智能与机器人中心)
;
School of Computer and Information Engineering, Xiamen University of Technology(厦门理工大学计算机与信息工程学院)
专题命中
GUI与屏幕智能体
:multimodal large language model(abstract);分类 cs.CV、cs.LG