GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation
GEM-4D:用于机器人操作的几何增强视频世界模型
Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang
机构
*
Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室)
;
Harvard University(哈佛大学)
;
Media Lab and EECS(媒体实验室和电子工程与计算机科学系)
;
MIT(麻省理工学院)
;
Princeton University(普林斯顿大学)
;
MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
AISPO: Enhancing Depth Reliability for Robotic Manipulation of Non-Lambertian Objects via Affine-Invariant Shape Prior
AISPO: 通过仿射不变形状先验增强非朗伯体物体机器人操作的深度可靠性
Zhiming Chen, Linfang Zheng, Kun Zhang, Hyung Jin Chang, Wei Zhang, Hongyu Yu, Hua Chen
机构
*
The Hong Kong University of Science & Technology(香港科技大学)
;
The University of Hong Kong(香港大学)
;
Southern University of Science & Technology(南方科技大学)
;
Zhejiang University(浙江大学)
;
LimX Dynamics
From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation
从被动观察者到主动批评者:强化学习激发机器人操作的过程推理
Yibin Liu, Yaxing Lyu, Daqi Gao, Zhixuan Liang, Weiliang Tang, Shilong Mu, Xiaokang Yang, Yao Mu
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Northeastern University(东北大学)
;
Xiamen University Malaysia(厦门大学马来西亚分校)
;
The University of Hong Kong(香港大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Xspark AI
Differential Amplifier-Inspired AmpAttention for Multi-View Robotic Manipulation
受差分放大器启发的AmpAttention用于多视图机器人操作
Jin Yang, Ping Wei, Nanning Zheng
机构
*
National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能技术国家级重点实验室、人工智能与机器人研究所)
CLAR: Learning 3D Representations for Robotic Manipulation by Fusing Masked Reconstruction with Multi-Level Contrastive Alignment
CLAR: 通过融合掩码重建与多层级对比对齐学习用于机器人操作的3D表示
Wenbo Cui, Chengyang Zhao, Yuhui Chen, Haoran Li, Zhizheng Zhang, Dongbin Zhao, He Wang
机构
*
SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Galbot
;
CFCS, School of Computer Science, Peking University(北京大学计算机科学与技术学院CFCS)
机构
*
TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院TAMS(多模态系统技术))
;
Technical University of Munich(慕尼黑技术大学)
;
Agile Robots SE(敏捷机器人有限公司)
机构
*
School of Intelligent Science and Technology, Nanjing University, China(南京大学智能科学与技术学院)
;
National Key Laboratory for Novel Software Technology, School of Artificial Intelligence, Nanjing University, China(南京大学新型软件技术国家实验室,人工智能学院)
;
School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)
;
MACS Lab, University of Washington(华盛顿大学MACS实验室)
机构
*
University of Chinese Academy of Sciences (UCAS)(中国科学院大学)
;
Tsinghua University(清华大学)
;
JD Explore Academy(京东探索学院)
;
ShanghaiTech University(上海科技大学)
;
Nanjing University(南京大学)
Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation
Compressor-VLA:基于指令的视觉标记压缩用于高效的机器人操作
Juntao Gao, Feiyang Ye, Jing Zhang, Wenjing Qian
机构
*
School of Information Science and Technology, Beijing University of Technology(信息科学与技术学院,北京理工大学)
;
LiAuto Inc.(LiAuto公司)
;
Beijing Key Laboratory of Computational Intelligence and Intelligent System, Beijing University of Technology(计算智能与智能系统北京市重点实验室,北京理工大学)
VO-DP: Semantic-Geometric Adaptive Diffusion Policy for Vision-Only Robotic Manipulation
Zehao Ni, Yonghao He, Lingfeng Qian, Jilei Mao, Fa Fu, Wei Sui, Hu Su, Junran Peng, Zhipeng Wang, Bin He
机构
*
D-Robotics(D机器人)
;
National Key Laboratory of Autonomous Intelligent Unmanned Systems(国家级自主智能无人机系统实验室)
;
University of Science and Technology Beijing(北京科技大学)
;
State Key Laboratory of Multimodal Artificial Intelligence System (MAIS) Institute of Automation of Chinese Academy of Sciences(多模态人工智能系统(MAIS)实验室,中国科学院自动化研究所)
;
Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心)
;
Shanghai Institute of Intelligent Science and Technology, Tongji University(上海智能科学技术研究院,同济大学)
DynaRend: Learning 3D Dynamics via Masked Future Rendering for Robotic Manipulation
Jingyi Tian, Le Wang, Sanping Zhou, Sen Wang, Jiayi Li, Gang Hua
机构
*
National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室)
;
National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心)
;
Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院)
;
Xi’an Jiaotong University(西安交通大学)