arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-09 至 2026-06-09 共收录 52 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 52 篇

2606.08775 2026-06-09 cs.RO cs.AI 新提交 91%

Unifying Object-Centric World Models and Diffusion Policy: A Hierarchical Framework for Multi-Stage Robotic Tasks

统一对象中心世界模型与扩散策略:多阶段机器人任务的分层框架

Raktim Gautam Goswami, Prashanth Krishnamurthy, Yann LeCun, Farshad Khorrami

机构 * Tandon School of Engineering, New York University(纽约大学坦登工程学院) Courant Institute of Mathematical Sciences, New York University(纽约大学库朗数学科学研究所) AMI Labs(AMI实验室)

专题命中 机器人操作 :world model(title,abstract);robotic(title,abstract);robotics(abstract);manipulation(abstract)

AI总结 提出WorldDP分层框架,结合高层世界模型进行运行时子目标优化和低层扩散策略执行,利用对象中心表示解耦环境实体,实现多阶段机器人操作任务的有效规划与执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06033 2026-06-09 cs.RO 版本更新 86%

RealDexUMI: A Wearable Universal Manipulation Interface for Dexterous Robot Learning

RealDexUMI:用于灵巧机器人学习的可穿戴通用操作接口

Chaoyi Xu, Yixuan Jiang, Jiahui Huan, Yuhui Fu, Haoyu Zhou, Weitian Yuan, Jiayi Yu, Wanpeng Zhang, Haoqi Yuan, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond Beihang University(北航) LinkerBot Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(title,abstract);robot learning(title);分类 cs.RO

AI总结 提出RealDexUMI,一种基于共享灵巧末端执行器模块的可穿戴通用操作接口,通过掌侧同构遥操作手套实现无重定向、直观精确的手部控制,在八项真实机器人任务中平均成功率达88.75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08657 2026-06-09 cs.RO cs.AI 新提交 85%

Latent Diffusion Policy: Shaping Latent Spaces for Diffusion-Based Robotic Manipulation

潜在扩散策略:为基于扩散的机器人操作塑造潜在空间

Zhexuan Zhou, Yichen Lai, Jinhao Zhang, Huizhe Li, Youmin Gong, Jie Mei

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 机器人操作 :manipulation(title);robotic(title);分类 cs.RO、cs.AI

AI总结 提出两阶段框架LDP,通过CVAE编码器吸收场景理解,在预浓缩的潜在空间中进行流匹配,简化学习并提升多臂协调任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08533 2026-06-09 cs.LG cs.RO 新提交 84%

Autonomous Aerial Manipulation via Contextual Contrastive Meta Reinforcement Learning

通过上下文对比元强化学习的自主空中操控

Lixuan Jin, Bingxuan Lan, Xinyi Bao, Xiangyuan Xie, Chunjie Zhang, Zheng Chen, Tianshuo Liu, Ruijie Tian, Jinyu Ru, Gang Wang, Lei Yuan, Yang Yu

机构 * National Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Faculty of Robot Science and Engineering, Northeastern University(东北大学机器人科学与工程学院) National Key Lab of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(北京理工大学自主智能无人系统国家重点实验室)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);分类 cs.RO、cs.LG

AI总结 提出Aco2方法,通过上下文对比元强化学习,使四旋翼无人机在无需人工干预下自主完成不同载荷的抓取、运输和投递,并直接迁移到真实世界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08440 2026-06-09 cs.RO cs.CV 新提交 84%

GraspFoM: Towards Reconstruction-Driven Robotic Grasping with 3D Foundation Priors

GraspFoM:基于3D基础先验的重建驱动机器人抓取

Dongli Wu, Xiaobao Wei, Hao Wang, Qiaochu Dong, Ying Li, Qingpo Wuwu, Ming Lu, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出GraspFoM框架,利用3D基础先验(SAM3D)构建共享3D物体潜变量,联合优化重建与抓取姿态预测,通过锚点初始化的截断姿态推理扩散器生成连续多模态抓取,实现高保真重建与最优抓取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08414 2026-06-09 cs.RO cs.AI 新提交 84%

PACT: Self-Evolving Physical Safety Alignment for Diffusion Policies in Embodied Manipulation

PACT: 具身操作中扩散策略的自我演化物理安全对齐

Lingxuan Wu, Zijian Zhu, Lizhong Wang, Chengyang Ying, Huayu Chen, Xiao Yang, Fangming Liu, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, 100084, China(计算机科学与技术系,人工智能研究院,清华-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,100084,中国) Peng Cheng Laboratory, 518108, China(鹏城实验室,518108,中国)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出PACT框架,通过自演化后训练将预训练扩散策略投影到约束可行区域,无需演示数据或任务奖励,在降低31.0%安全违规的同时提升30.7%任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08103 2026-06-09 cs.RO cs.CV 新提交 84%

Revisiting Articulated Parts Perception in Robot Manipulation

重新审视机器人操作中的关节部件感知

Xiaoqian Wu, Yejie Guo, Xiaoyang Chen, Lixin Yang, Cewu Lu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出几何主结构(GPS)作为关节部件的新表示,结合VR设备实现高效标注,训练通用模型,在零样本下达到73%操作成功率。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08057 2026-06-09 cs.RO cs.AI 新提交 84%

EgoAERO: Learning Dexterous Manipulation from a Single Egocentric Video without Object Assets

EgoAERO:无需物体资产,从单个第一人称视频学习灵巧操作

Yichen Niu, Haoran Lv, Xinrui Zhang, Xueyao Wan, Shiyu Gao, Ying Ai, Hui Xu, Yongqi Hu, Hengyi Zhang, Yang Xie, Zhaxizhuoma, Yue Zhao, Zhenshan Bing, Yan Ding, Jianxing Liu

机构 * School of Astronautics, Harbin Institute of Technology(哈尔滨工业大学航天学院) Lumos Robotic Suzhou Research Institute, Harbin Institute of Technology(哈尔滨工业大学苏州研究院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Nanjing University(南京大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学) Fudan University(复旦大学)

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);分类 cs.RO、cs.AI

AI总结 提出EgoAERO框架,无需物体资产,从单个第一人称RGB-D视频中通过无资产物体跟踪与重建、自我运动补偿和自适应接触优化重建接触一致的手-物轨迹,并利用两阶段残差学习转化为机器人策略,实现单次演示的灵巧操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05153 2026-06-09 cs.RO cs.AI 84%

FCBV-Net: Category-Level Robotic Garment Smoothing via Feature-Conditioned Bimanual Value Prediction

FCBV-Net:通过特征条件双臂价值预测实现类别级机器人服装平滑

Mohammed Daba, Jing Qiu

机构 * University of Waterloo(多伦多大学)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出FCBV-Net,通过预训练的密集几何特征条件预测双臂动作价值,提升机器人服装平滑任务的类别级泛化能力,实验显示其在未见过的服装上效率下降仅为11.5%。

Comments 9 pages, 7 figures, 1 table

Journal ref Electronics 2026, 15(11), 2468

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09215 2026-06-09 cs.RO 新提交 83%

MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation

MotionWAM:迈向实时人形机器人全身操作的基础世界动作模型

Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang

机构 * Mondo Robotics HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 机器人操作 :manipulation(title,abstract);world model(abstract);分类 cs.RO

AI总结 提出MotionWAM,一种实时世界动作模型,通过统一运动潜变量和全身动作令牌,实现单目相机驱动的自主人形机器人全身操作,在真实任务上成功率比VLA基线高30%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08737 2026-06-09 cs.RO 新提交 83%

Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation

Dream-Tac: 用于接触丰富机器人操作任务的统一触觉世界动作模型

Yunfan Lou, Yifan Ye, Yankai Fu, Jun Cen, Xiaowei Chi, Yaoxu Lyu, Peidong Jia, Sirui Han, Zhihe Lu, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Nanjing University(南京大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 机器人操作 :manipulation(title,abstract);world model(abstract);分类 cs.RO

AI总结 提出Dream-Tac统一触觉世界动作模型,通过接触门控视觉-触觉融合和接触感知注意力偏置,联合建模动作、未来视觉观察和触觉动态,在六项接触丰富操作任务中平均动作准确率提升31.7%。

Comments 16 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08564 2026-06-09 cs.RO 新提交 83%

Real-IKEA: Physical Fidelity is the Prerequisite for Robust Manipulation

Real-IKEA:物理保真度是鲁棒操作的前提

Kunqi Xu, Zhenhao Huang, Siyuan Luo, Ziqiu Zeng, Fan Shi

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 针对仿真与现实物理差异导致操作鲁棒性不足的问题,提出Real-IKEA数据集与仿真框架,通过高保真资产和阻力校准配置,使强化学习策略发现优先利用机械优势的鲁棒策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20689 2026-06-09 cs.RO 版本更新 83%

FingerEye: Learning Dexterous Manipulation with Continuous Vision-Tactile Sensing

FingerEye:通过连续视觉-触觉感知学习灵巧操作

Zhixuan Xu, Yichen Li, Xuanye Wu, Tianyu Qiu, Lin Shao

机构 * National University of Singapore(新加坡国立大学) RoboScience(机器人科学) Huazhong University of Science and Technology(华中科技大学) South China University of Technology(华南理工大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 FingerEye通过连续视觉-触觉感知提升机器人灵巧操作,结合视觉和触觉反馈,在模拟和现实环境中使腕部策略的成功率提升超30个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08542 2026-06-09 cs.RO cs.AI cs.CV 新提交 82%

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA

当视频误读:面向探索性操作痕迹问答的阅读启发式闭环蒸馏

Haizhou Ge, Yufei Jia, Yue Li, Zhixing Chen, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

机构 * Tsinghua University(清华大学) DISCOVER Robotics

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对探索性操作中机器人误读视频痕迹的问题,提出闭环痕迹蒸馏方法,通过任务编码代理提取单行自然语言启发式提示,使冻结VLM准确预测最小成功动作链,在模拟和真实机器人任务上提升准确率0.38-0.47。

Comments 16 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08152 2026-06-09 cs.RO 新提交 79%

Vision-Guided Dual-Arm Humanoid Robotic Disassembly of End-of-Life 18650 Lithium-ion Battery Packs

视觉引导的双臂人形机器人拆解报废18650锂离子电池组

Yile Chen, Zhihao Liu, Xi Vincent Wang, Lihui Wang

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO

AI总结 提出一种视觉引导的双臂拆解流水线,利用通用平行爪夹持器、RGB-D感知和预训练抓取检测器,在无夹具条件下从任意初始姿态拆解21节18650电池组,实现80%端到端成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08121 2026-06-09 cs.CV 新提交 79%

Trustworthy Visual Predicates for Robust Manipulation Understanding under Degradation

可信视觉谓词用于退化条件下的鲁棒操作理解

Fatemeh Ziaeetabar

机构 * University of Tehran(德黑兰大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV

AI总结 提出谓词级可靠性框架,通过结构化谓词词汇表、置信度感知估计和可靠性度量,分析模糊、遮挡等退化对操作理解中视觉谓词的影响,实验表明接触敏感和动态谓词更脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01661 2026-06-09 cs.RO 版本更新 79%

Symskill: Symbol and Skill Co-Invention for Data-Efficient and Reactive Long-Horizon Manipulation

Symskill:符号与技能共发明用于数据高效且反应性强的长周期操作

Yifei Simon Shao, Yuchen Zheng, Sunan Sun, Pratik Chaudhari, Vijay Kumar, Nadia Figueroa

机构 * GRASP Laboratory, University of Pennsylvania(GRASP实验室,宾夕法尼亚大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 Symskill通过联合学习谓词、运算符和技能,实现了数据高效且反应性强的长周期操作,结合了组合泛化与实时恢复能力。

Comments ICRA 2026 Best Conference Paper Award; ICRA 2026 Best Paper Award on Planning and Control; CoRL 2025 Best Paper Award on Learning Effective Abstractions for Planning (LEAP) Workshop (https://symskill.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11934 2026-06-09 cs.RO 版本更新 79%

Robot-DIFT: Correspondence-Sensitive Diffusion Features for Contact-Rich Robot Manipulation

Robot-DIFT: 用于接触丰富机器人操作的对应敏感扩散特征

Yu Deng, Yufeng Jin, Xiaogang Jia, Jiahong Xue, Gerhard Neumann, Georgia Chalvatzaki

机构 * TU Darmstadt(图宾根大学) KIT(卡尔斯鲁厄理工学院) FZI(弗劳恩霍夫研究所) Hessian.AI(黑森人工智能公司) Robotics Institute Germany(德国机器人研究所) Honda Research Institute Europe GmbH(本田欧洲研究院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出Robot-DIFT,通过流形蒸馏将扩散模型转化为确定性学生网络,结合空间-语义特征金字塔网络,为接触敏感任务提供实时对应敏感特征,在多个基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09827 2026-06-09 cs.RO cs.CV 新提交 79%

MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models

MemoryVLA++:通过记忆与想象在视觉-语言-动作模型中进行时间建模

Hao Shi, Weiye Li, Bin Xie, Yulin Wang, Renping Zhou, Tiancai Wang, Xiangyu Zhang, Ping Luo, Gao Huang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) Dexmal StepFun

专题命中 机器人操作 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出MemoryVLA++框架,通过工作记忆、感知-认知记忆库和想象未来状态的世界模型,实现完整时间建模,在模拟和真实机器人任务上显著提升长时域和依赖记忆与想象的任务性能。

Comments The project is available at https://shihao1895.github.io/MemoryVLA-PP-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09754 2026-06-09 cs.CY cs.CR cs.SI 新提交 78%

Human-Centred Risk Mitigation for AI-Mediated Information Manipulation: A SOCMINT Framework Based on Information Manipulation Sets

以人为中心的AI中介信息操纵风险缓解:基于信息操纵集的SOCMINT框架

Antonio Scala

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 提出基于信息操纵集(IMS)的SOCMINT框架,作为事件级分析与归因优先分析之间的中间操作单元,实现结构化推理与风险缓解。

Comments 15 pages; supplementary material available as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12263 2026-06-09 cs.CL cs.AI cs.LG 版本更新 76%

Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers

多模态生成式引擎优化:针对视觉-语言模型排序器的排名操纵

Yixuan Du, Chenxiao Yu, Haoyan Xu, Ziyi Wang, Yue Zhao, Xiyang Hu

机构 * Georgetown University(乔治城大学) University of Southern California(南加州大学) University of Maryland, College Park(马里兰大学学院公园分校) Arizona State University(亚利桑那州立大学)

专题命中 机器人操作 :manipulation(title);分类 cs.AI、cs.LG

AI总结 提出多模态生成式引擎优化(MGEO)方法,通过联合优化图像扰动和文本后缀,利用视觉-语言模型内部跨模态知识耦合,实现对产品排名的有效操纵,揭示了多模态基础模型知识基础的脆弱性。

Comments Proceedings of the 4th Workshop on Towards Knowledgeable Foundation Models (KnowFM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09451 2026-06-09 cs.RO cs.CV cs.LG 新提交 75%

Dense Force Estimation with an Event-based Optical Tactile Sensor

基于事件的光学触觉传感器的稠密力估计

Agis Politis, René Zurbrügg, Valentina Cavinato

机构 * Sony Advanced Visual Sensing, Zurich, Switzerland(索尼高级视觉传感公司,苏黎世,瑞士) ETH Zürich(苏黎世联邦理工学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出首个利用事件相机重建稠密3D力场的方法,通过事件数据估计表面位移并映射为力,平均误差(0.14N,0.10N,0.93N),工作频率100Hz。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08719 2026-06-09 cs.CV 新提交 74%

Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation

无图像思考:通过在线自我蒸馏内化视觉操作

Yishuo Cai, Jiahui Liu, Yuanxin Liu, Haobo Deng, Linli Yao, Yuhao Zheng, Kun Ouyang, Zhimo Li, Ziyue Wang, Xu Sun, Haoli Bai, Xiaohui Li

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Central South University(中南大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Huawei Technologies(华为技术有限公司)

专题命中 机器人操作 :manipulation(title);分类 cs.CV

AI总结 提出Imagine-OPD框架,通过在线自我蒸馏将“用图像思考”的视觉推理能力内化为“用想象思考”,在不调用外部工具的情况下生成内部视觉线索,在保持性能的同时显著降低推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09243 2026-06-09 cs.CV cs.AI 新提交 73%

EgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric Video

EgoTactile: 从自我中心视频学习日常物体的抓取压力

Yuan Zeng, Yujia Shi, Tiao Tan, Xingting Li, Yaqi Qin, Zongqing Lu, Wenming Yang, Jing-Hao Xue, Qingmin Liao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 提出EgoTactile基准和条件扩散框架EgoPressureDiff,从自我中心视频估计全手抓取压力,解决视觉-物理歧义,实现鲁棒迁移。

Comments Accepted to ICML2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09798 2026-06-09 cs.RO 新提交 70%

SynManDex: Synthesizing Human-like Dexterous Grasps from Synthetic Human Pre-Grasps

SynManDex: 从合成人类预抓取中合成类人灵巧抓取

Yanming Shao, Zanxin Chen, Wenwei Lin, Mingjie Zhou, Tianxing Chen, Xiaokang Yang, Yichen Chi, Yao Mu

机构 * Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Shenzhen University(深圳大学) Fudan University(复旦大学) University of Hong Kong(香港大学) ZTE Corporation(中兴通讯股份有限公司)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出SynManDex流水线,利用生成的人类预抓取作为启发,通过机器人原生优化实现力闭合接触,生成类人灵巧抓取,在仿真和真实机器人上取得高成功率和类人性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08980 2026-06-09 cs.CV 新提交 70%

EPS3D: End-to-End Feed-Forward 3D Panoptic Segmentation

EPS3D: 端到端前馈式3D全景分割

Runsong Zhu, Jiaxin Guo, Xiaoyang Guo, Zhengzhe Liu, Ka-Hei Hui, Wei Yin, Kai Chen, Wei Chen, Weiqiang Ren, Yunhui Liu, Pheng-Ann Heng, Chi-Wing Fu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出端到端前馈框架EPS3D,通过蒸馏训练和多视图图像预测3D感知特征,结合互增强模块实现语义-实例一致性,在Replica上语义mIoU提升13%,每场景仅需1秒。

Comments ICML 2026. The code is publicly available at \href{https://github.com/Runsong123/EPS3D}{https://github.com/Runsong123/EPS3D}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08828 2026-06-09 cs.RO 新提交 70%

Video2Sim2Real: Full-Stack Autonomous Dexterous Skill Acquisition from a Single Human Video

Video2Sim2Real:从单个人类视频实现全栈自主灵巧技能获取

Yunhai Han, Jianuo Qiu, Linhao Bai, Ziyu Xiao, Zihang Zeng, Yangcen Liu, Zhaodong Yang, Shalin Jain, Wenrui Ma, Jiaqi Fu, Yuqian Zheng, Manisha Natarajan, Muhammad Zubair Irshad, Kenneth Shaw, Matthew Gombolay, Zsolt Kira, Harish Ravichandar

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Pennsylvania(宾夕法尼亚大学) Toyota Research Institute(丰田研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出Video2Sim2Real框架,从单个人类操作视频中重建数字孪生并提取运动先验,通过物体关键帧优化机器人配置,结合残差强化学习与碰撞感知规划,实现从仿真到真实世界的灵巧技能迁移。

Comments Website: https://video2sim2real.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08743 2026-06-09 cs.RO 新提交 70%

Guided Discovery of New Behaviors using Diffusion Policies

使用扩散策略引导发现新行为

Dian Yu, Sebastian Sanokowski, Majid Khadiv

机构 * Munich Institute of Robotics and Machine Intelligence, Technical University of Munich(慕尼黑工业大学慕尼黑机器人与机器智能研究所)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出结合Feynman-Kac校正器与引导势能的框架,从扩散策略中挖掘并优化罕见但可行的轨迹,再训练策略以系统发现多样化可执行行为。

Comments Preprint. Supplementary video: https://youtu.be/T7MUvMA67VM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02274 2026-06-09 cs.RO 版本更新 70%

Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning

Dexterity-BEV: 对齐3D世界与动作以实现通用机器人策略学习

Huayi Zhou, Wei Gao, Dekun Lu, Ruiji Liu, Zhanqi Zhang, Ziyang Zhang, Jian Chen, Wenlve Zhou, Sheng Xu, Shumin Li, Kangyi Guo, Shichen Xu, Zixin Huang, Yongyi Su, Kui Jia

机构 * DexForce Technology(德克斯技术公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出Dexterity-BEV框架,通过对齐顶点图和顶点谱的3D表示以及鸟瞰图对齐,解决2D基础模型在3D操作中的局限性,提升机器人策略的泛化能力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23592 2026-06-09 cs.RO cs.HC cs.SY eess.SY 70%

Human-Exoskeleton Kinematic Calibration to Improve Hand Tracking for Dexterous Teleoperation

人-外骨骼运动学校准以提高手部跟踪用于灵巧遥操作

Haiyun Zhang, Stefano Dalla Gasperina, Saad N. Yousaf, Toshimitsu Tsuboi, Tetsuya Narita, Ashish D. Deshpande

机构 * Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学机械工程系) Sony Group Corporation, Tokyo, Japan(索尼集团公司,日本东京) Meta Reality Labs Research, Redmond, WA, USA(Meta现实实验室研究)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出一种针对手部外骨骼的个性化校准框架,通过残差加权优化估计虚拟链接参数,减少关节和指尖跟踪误差,提升遥操作精度。

Comments 8 pages, 10 figures, 1 supplementary video, submitted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏