BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation
BridgeVLA++:一种面向三维操作的数据高效、可泛化且内存增强的视觉-语言-动作框架
Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan
机构
*
New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR))
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
FiveAges
;
ByteDance Seed(字节跳动种子实验室)
CommentsThis work has been submitted to the IEEE TPAMI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding
SurgNarrator:面向手术视频理解的生成式检索框架
Yuqing Feng, Jiawei Ma, Kevin Qinghong Lin, Kun Yuan, Nicolas Padoy, Daniel S. Elson, Anh Nguyen, Stamatia Giannarou, Baoru Huang
机构
*
University of Liverpool(利物浦大学)
;
City University of Hong Kong(香港城市大学)
;
University of Oxford(牛津大学)
;
University of Strasbourg(斯特拉斯堡大学)
;
IHU Strasbourg(斯特拉斯堡大学医院研究所)
;
Imperial College London(帝国理工学院)
CommentsThis work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation
DF³:自主导航中基于无解码器特征预测的世界建模
Jiaming Chen, Guoan Xu, Aoshen Huang, Haozhuo Zhang, Yang Li, Wei Pan
机构
*
The University of Manchester(曼彻斯特大学)
;
University of Technology Sydney(悉尼科技大学)
;
Shandong University(山东大学)
;
Shanghai Jiao Tong University(上海交通大学)
Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression
消息而非令牌:用于忠实VLM压缩的基础核心集
Long Qian, Jiaqi Wei, Bingke Zhu, Yingying Chen, Jinqiao Wang
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Wuhan AI Research(武汉人工智能研究院)
;
Cardiff University(卡迪夫大学)