arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 2927 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 928 篇

2606.13279 2026-06-12 cs.RO 新提交 83%

See Selectively, Act Adaptively: Dual-Level Structural Decomposition for Bimanual Robot Manipulation

选择性观察,适应性行动:双水平结构分解用于双臂机器人操作

Yoon-Ji Choi, Young-Chae Son, Soo-Chul Lim

机构 * Dongguk University(东国大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出基于双水平结构分解的双臂操作VLA框架,通过视觉选择路由和动作专家混合机制分别处理视觉相关性和双臂交互模式,在模拟和真实任务中成功率分别提升27.7%和43.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11818 2026-06-11 cs.RO 新提交 83%

Human-Guided Co-Manipulation of Carbon Fiber Plies

碳纤维铺层的人机协同操作

Rami Ojanen, James Fant-Male, Roel Pieters

机构 * Automation Technology and Mechanical Engineering, Tampere University(坦佩雷大学自动化技术与机械工程系)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 针对柔性材料自动化处理困难的问题,本文提出结合语音指令、视觉腕部跟踪和力/柔顺控制的多模态方法,实现碳纤维铺层的高效人机协同操作。

Comments Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10899 2026-06-10 cs.RO 新提交 83%

MV-Actor: Aligning Multi-View Semantics and Spatial Awareness for Bimanual Manipulation

MV-Actor:对齐多视角语义与空间感知以实现双臂操作

Yinchen Tian, Huan Li, Muyao Peng, Xi Wang, Yan Wang, You Yang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院) AIR Wuxi Innovation Center, Tsinghua University(清华大学智能产业研究院无锡创新中心)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出MV-Actor框架,通过多视角语义交互和语义-空间令牌交互统一语义与空间表示,并利用引导度量深度修复模块处理深度噪声,在PerAct2基准上达到87.8%平均成功率。

Comments 14 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09215 2026-06-09 cs.RO 新提交 83%

MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation

MotionWAM:迈向实时人形机器人全身操作的基础世界动作模型

Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang

机构 * Mondo Robotics HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 机器人操作 :manipulation(title,abstract);world model(abstract);分类 cs.RO

AI总结 提出MotionWAM,一种实时世界动作模型,通过统一运动潜变量和全身动作令牌,实现单目相机驱动的自主人形机器人全身操作,在真实任务上成功率比VLA基线高30%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08737 2026-06-09 cs.RO 新提交 83%

Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation

Dream-Tac: 用于接触丰富机器人操作任务的统一触觉世界动作模型

Yunfan Lou, Yifan Ye, Yankai Fu, Jun Cen, Xiaowei Chi, Yaoxu Lyu, Peidong Jia, Sirui Han, Zhihe Lu, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Nanjing University(南京大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 机器人操作 :manipulation(title,abstract);world model(abstract);分类 cs.RO

AI总结 提出Dream-Tac统一触觉世界动作模型,通过接触门控视觉-触觉融合和接触感知注意力偏置,联合建模动作、未来视觉观察和触觉动态,在六项接触丰富操作任务中平均动作准确率提升31.7%。

Comments 16 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08564 2026-06-09 cs.RO 新提交 83%

Real-IKEA: Physical Fidelity is the Prerequisite for Robust Manipulation

Real-IKEA:物理保真度是鲁棒操作的前提

Kunqi Xu, Zhenhao Huang, Siyuan Luo, Ziqiu Zeng, Fan Shi

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 针对仿真与现实物理差异导致操作鲁棒性不足的问题,提出Real-IKEA数据集与仿真框架,通过高保真资产和阻力校准配置,使强化学习策略发现优先利用机械优势的鲁棒策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06627 2026-06-08 cs.RO cs.AI cs.CV cs.LG 新提交 83%

What Matters When Cotraining Robot Manipulation Policies on Everyday Human Videos?

在日常生活人类视频上协同训练机器人操作策略时什么因素重要?

Richard Li, Aditya Prakash, Andrew Wen, Saurabh Gupta, Yilun Du, Pulkit Agrawal

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究利用日常互联网视频协同训练机器人操作策略时,手部姿态质量和运动差距对迁移的影响,提出一种协同训练方法,在低机器人数据场景下六个操作任务中绝对成功率提升29.7%。

Comments The project website is here: https://richardrl.github.io/what-matters-cotraining-human-videos/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12122 2026-08-13 cs.RO cs.CV 新提交 82%

HandEdit: A Unified Benchmark for Egocentric Human-to-Robot Dexterous Hand Image Editing

HandEdit:用于自我中心视角下人类到机器人灵巧手图像编辑的统一基准

Zhenjie Yang, Xingyu Jiao, Guopeng Zhong, Shuzhe Yang, Shi Che, Chao Wu, Chenyu Jiang, Dongjie Zhang, Yideng Zhang, Zheng Zhang, Muyun Jiang, Haisheng Su, Shuang Jin, Donghang Zhang, Chao Yang, Li Chen, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan

专题命中 机器人操作 :robotics(abstract);embodied AI(abstract);manipulation(abstract);robotic(abstract)

AI总结 HandEdit是含2亿+实例、覆盖26种URDF的统一具身感知图像编辑基准,用于弥合人类与机器人数据差异,可评估11种图像编辑基线,助力具身人工智能发展。

Comments Technical Report. Project Page: https://handedit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04196 2026-08-06 cs.RO cs.CV cs.LG 新提交 82%

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation

SiMDex:挖掘相似的自我中心视频以实现跨 embodiment 的灵巧操作

Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato

机构 * The University of Tokyo(东京大学) ByteDance Seed(字节跳动 Seed) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 该研究提出SiMDex框架,通过三层流程从海量自我中心人类视频中挖掘与任务相关的子集,用于VLA后训练,仅用少量样本便显著提升了机器人灵巧操作的成功率,证明选择性数据整理更有效。

Comments 12 pages, 4 figures. Project page: https://lin-nie.github.io/SiMDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01452 2026-08-04 cs.RO cs.CV cs.LG 新提交 82%

DynamicManip: Enabling Dynamic Manipulation from a Single Static Demonstration

DynamicManip:基于单个静态演示实现动态操作

Haoran Liao, Pengyue Wang, Shuoyu Chen, Kehan Cheng, Xuhang Chen, Yuhao Lin, Mu Lin, Zhizhao Liang, Xiaoyi Fan, Chengyi Xing, Dan Niu, Yi-Lin Wei, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Stanford University(斯坦福大学) Southeast University(东南大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出DynamicManip,通过静态转动态数据增强流水线、动态感知自适应策略及动态操作基准,解决机器人动态操作的数据效率与实时性问题,实验显示其性能显著优于现有方法。

Comments Project page: https://liaohr9.github.io/DynamicManip/ Code: https://github.com/liaohr9/DynamicManip

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28251 2026-07-31 eess.SY cs.SY 新提交 82%

Self-Evolving Learning for Embodied AI with Criticality Model

基于临界模型的具身智能自进化学习

Linxuan He, Yuying Tian, Lingxiang Fan, Jiaqi Pi, Yinqiao Lu, Shang Su, Mengkai Shi, Shuo Feng

专题命中 机器人操作 :embodied AI(title,abstract);manipulation(abstract)

AI总结 本文提出基于临界模型的具身智能自进化学习方法,通过状态级临界模型引导采样易失败场景,在多类具身任务中显著降低失败率,性能优于基线及同类先进模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25895 2026-07-29 cs.RO cs.CV cs.LG 新提交 82%

HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

HiFi-UMI:仅从高保真UMI数据中学习可部署的操作策略

Simple AI, :, Yuteng Wei, Jinming Ma, Jiawei Wang, Weitao Zhou, Yushen Zuo, Ke Rui, Minglei Li, Jinhao Zhang, Zhikang Pan, Xiang Wang, Haoran Jia, Huan Du, Zicheng Zeng, Jun Ma, Guiyu Qin, Di Zhang, Xiaofei Li

机构 * Simple AI(简单人工智能公司)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究如何从高保真UMI数据学习可部署操作策略,提出HiFi-UMI系统,其无需外部跟踪达3毫米精度。利用该系统数据实现零机器人训练后策略,预训练还能降误差提成功率,且开源了相关高保真资源。

Comments 33 pages, 15 figures, 4 tables. Project page: https://cloud.simpleai.tech/simple-world-lab/hifi-umi/ Dataset: https://huggingface.co/datasets/simple-world-lab/HiFi-UMI-2K

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22119 2026-07-27 cs.RO cs.AI cs.LG 新提交 82%

One Hand Watches The Other: Dynamic Multi-Agent Cooperation for Sample-Efficient Bimanual Manipulation in Dynamic Environments

一只手注视着另一只手:动态环境中用于高效样本双机器人操作的动态多智能体协作

Jan Ole von Hartz, Abhinav Valada, Joschka Boedecker

机构 * University of Freiburg(弗莱堡大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究动态环境中双机器人操作问题,提出轻量级DynaMAC框架,将相对手臂视为动态任务参数,解决因果限制,保留多流策略优势。通过DynaBench基准测试,性能远超基线,能零样本泛化,简化数据收集,为人机协作助力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11874 2026-07-14 cs.RO cs.AI cs.LG 新提交 82%

A Minimalist Retargeting-Guided Reinforcement Learning Recipe for Dexterous Manipulation

一种用于灵巧操作的极简重定向引导强化学习方法

Yunhai Feng, Natalie Leung, Jiaxuan Wang, Lujie Yang, Haozhi Qi, Preston Culbertson

机构 * Cornell University(康奈尔大学) Amazon FAR(亚马逊FAR)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究如何将重定向引导强化学习用于灵巧操作,提出REGRIND方法,从单人演示学习策略,经重定向、模拟训练、零样本转移到硬件,在丰富接触任务中产生类人行为,还分析了模拟到现实转移的关键因素。

Comments Website: https://yunhaifeng.com/REGRIND

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11167 2026-07-14 cs.RO cs.AI cs.LG 新提交 82%

Pix2Act: Image-Space Manipulation Policies with Equivariant Augmentation

Pix2Act:具有等变增强的图像空间操纵策略

Haojie Huang, Linfeng Zhao, Haotian Liu, Zhang Ye, Si-Yuan Huang, Mingxi Jia, Boce Hu, Fangzhou Lin, Yu Qi, Dian Wang, Robin Walters, Robert Platt

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学) Brown University(布朗大学) Texas A&M University(德州农工大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究针对将操纵动作表示为相机平面二维轨迹带来的挑战,提出Pix2Act模仿学习方法,通过生成图像空间关键点轨迹及三角测量恢复末端执行器姿态,将三维控制转为二维预测问题,提升泛化能力与性能,优于现有基线且抗相机扰动。

Comments Project Website: https://haojhuang.github.io/pix2act_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26183 2026-06-26 cs.RO cs.AI cs.LG 新提交 82%

LiMoDE: Rethinking Lifelong Robot Manipulation from a Mixture-of-Dynamic-Experts Perspective

LiMoDE: 从动态专家混合视角重新思考终身机器人操作

Zhihao Gu, Lin Wang

机构 * School of EEE, Nanyang Technological University(南洋理工大学电气与电子工程学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出一种两阶段终身学习方案LiMoDE,通过动态专家混合结构实现多任务预训练和任务自适应,有效缓解灾难性遗忘并促进知识迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23680 2026-06-23 cs.RO cs.AI cs.LG 新提交 82%

CoorDex: Coordinating Body and Hand Priors for Continuous Dexterous Humanoid Loco-Manipulation

CoorDex: 协调身体与手部先验以实现连续灵巧类人运动操作

Sikai Li, Shuning Li, Zhenyu Wei, Yunchao Yao, Chenran Li, Mingyu Ding

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出CoorDex学习框架,通过将高维身体和灵巧手控制转化为协调的潜在残差控制,实现类人机器人在运动中执行灵巧操作,如不停顿抓取瓶子、移动中开冰箱门等。

Comments Project page: https://skevinci.github.io/coordex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20679 2026-06-23 cs.RO cs.AI cs.CV 新提交 82%

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation

MemoryVAM:将记忆融入视频动作模型以实现机器人操作

Yuxin Jiang, Chang Yu, Yunuo Chen, Xiang Feng, Yin Yang, Nishank Gite, Chenfanfu Jiang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Nirvana Robotics(涅槃机器人) University of California, San Diego(加州大学圣迭戈分校) University of Utah(犹他大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出MemoryVAM,通过Recap-Cue模块将情景记忆注入视频世界模型策略,解决长时域操作中的非马尔可夫性问题,在LIBERO-Mem和真实机器人任务上显著提升成功率。

Comments Project page: https://MemoryVAM.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18144 2026-06-17 cs.AI cs.CY cs.LG cs.RO 新提交 82%

Memory as a Wasting Asset: Pricing Flash Endurance for Embodied Agents, and the Limits of Doing So

记忆作为消耗性资产:为具身智能体定价闪存耐久性及其局限性

Josef Liyanjun Chen

机构 * KAIKAKU

专题命中 机器人操作 :embodied agent(title);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出将机器人闪存耐久性视为折旧资本,通过单一影子价格η进行定价,实现成本最优的存储层级分配,并基于真实机器人日志测量价值-写入关联χ的符号,发现其取决于部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16690 2026-06-16 cs.RO cs.AI cs.CV 新提交 82%

PATCH: Action-Chunk-Conditioned Latent Patch Innovation Monitoring for Robot Manipulation

PATCH: 基于动作块条件潜在补丁创新的机器人操作监控

Yanan Zhou, Ranpeng Qiu, Yincong Chen, Jiajie Cui, Weiming Zhi

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Australian Centre For Robotics, The University of Sydney(悉尼大学澳大利亚机器人中心)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出PATCH监控器,通过动作块条件潜在补丁创新检测局部场景动态,实现扰动感知的机器人操作干预与恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14218 2026-06-15 cs.RO cs.AI cs.LG 新提交 82%

Universal Manipulation Exoskeleton: Learning Compliant Whole-body Policies with Real-time Torque Feedback

通用操控外骨骼:利用实时扭矩反馈学习全身柔顺策略

Litian Liang, Jingxi Xu, Xinda Qi, Yujun Cai, Houzhu Ding, Luqi Wang, Zhixin Sun, Jyh-Herng Chow, Ming Yang, Mark Cutkosky

机构 * Ant Group(蚂蚁集团) Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出通用操控外骨骼(UME),通过实时触觉扭矩反馈和全身数据采集,使机器人学习主动柔顺策略,在受限空间中完成移动操作、力控翻转等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14188 2026-06-15 cs.RO cs.AI cs.LG cs.SY eess.SY math.OC 新提交 82%

Robustness without Wrinkles: Parallel Simulation and Robust MPC for Certified Deformable Manipulation

无皱鲁棒性:并行仿真与鲁棒MPC实现可认证的变形体操作

Wei-Chen Li, Jeffrey Fang, Sasanka Polisetti, Yuexi Song, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出CORD-SLS实时控制方法,通过GPU并行可微仿真与接触平滑实现高效梯度规划,结合鲁棒模型预测控制与共形预测校准,在绳索和布料操作中达到毫秒级规划与高安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10025 2026-06-10 cs.RO cs.CV cs.LG 新提交 82%

GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation

GHOST: 用于泛化机器人操作的层次化子目标策略

Sriram Krishna, Ben Eisner, Haotian Zhan, Ying Yuan, Haoyu Zhen, Chuang Gan, Shubham Tulsiani, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出GHOST框架,通过将控制分解为高层子目标预测和低层目标条件控制器,实现视觉运动操作策略的泛化,并利用人类演示适应新物体和任务变化。

Comments Accepted at RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08542 2026-06-09 cs.RO cs.AI cs.CV 新提交 82%

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA

当视频误读:面向探索性操作痕迹问答的阅读启发式闭环蒸馏

Haizhou Ge, Yufei Jia, Yue Li, Zhixing Chen, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

机构 * Tsinghua University(清华大学) DISCOVER Robotics

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对探索性操作中机器人误读视频痕迹的问题,提出闭环痕迹蒸馏方法,通过任务编码代理提取单行自然语言启发式提示,使冻结VLM准确预测最小成功动作链,在模拟和真实机器人任务上提升准确率0.38-0.47。

Comments 16 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07045 2026-08-10 cs.RO cs.CV 新提交 82%

C2Dex: Contact-Consistent Reconstruction and Retargeting for Dexterous Manipulation from Monocular Video

C2Dex:基于单目视频的接触一致性重建与灵巧操作重定向

Jie Ren, Zhehao Jiang, Yinhong Yang, Haorui Jia, Han Jiang, Ben Li, Yao Yao, Cheng Lin, Qiu Shen, Zhenshan Bing, Xiao-Xiao Long, Xun Cao

机构 * Nanjing University(南京大学) China Mobile Research Institute(中国移动研究院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV;robotics(comments)

AI总结 C2Dex是基于单目视频的灵巧操作框架,通过聚合物体侧稳定接触实现HOI重建与手物几何保留,在DexYCB、TACO上的轨迹成功率显著优于基线,且真实机器人复现可行。

Comments 9 pages, 5 figures. Submitted to IEEE Robotics and Automation Letters (RA-L). Project page: https://k-jie.github.io/C2Dex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06761 2026-06-08 cs.RO cs.AI 新提交 82%

AxisGuide: Grounding Robot Action Coordinate System in RGB Observations for Robust Visuomotor Manipulation

AxisGuide: 在RGB观测中接地机器人动作坐标系以实现鲁棒的视觉运动操控

Jiyun Jang, Yujin Sung, Woosung Joung, Daewon Chae, Sangwon Lee, Sohwi Kim, Jinkyu Kim, Jungbeom Lee

机构 * Korea University(韩国大学) University of Michigan(密歇根大学) KT R&D Center(KT研发中心) Kakao Mobility(Kakao移动)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 针对视觉运动策略在分布偏移下动作执行失败的问题,提出AxisGuide方法,通过渲染机器人基座坐标系轴并叠加提示通道,增强动作坐标理解,显著提升泛化性能。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07880 2026-07-10 cs.CV 新提交 81%

GIRAF: Towards Generalizable Human Interactions with Articulated Objects

GIRAF:迈向与关节物体的可泛化人类交互

Xiaohan Zhang, Sebastian Starke, Alexander Winkler, Federica Bogo, Samir Aroudj, Yuting Ye

机构 * Meta

专题命中 机器人操作 :robotics(abstract);embodied AI(abstract);manipulation(abstract);navigation(abstract)

AI总结 针对合成与关节物体的逼真全身人类交互难题,现有模型有局限。本文提出文本条件扩散模型,通过以物体为中心的表示、混合域训练策略和基于接触的增强方案应对挑战,实验证明其对未见物体配置泛化能力强,超越现有方法。

Comments 12 pages, 6 figures, 3 tables. Accepted at the Third Workshop on Human Motion Generation (HuMoGen), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14028 2026-08-17 cs.RO cs.AI 新提交 81%

AdvDex: Learning Dexterous Manipulation from Human Demonstrations via Joint-Aligned Actions and Adversarial Learning

AdvDex:通过关节对齐动作与对抗学习从人类演示中学习灵巧操作

Zhiyue Zhao, Jingyi Wu, Hairuo Liu, Mingyu Liu, Liyang Li, Hengdi Zhang, Tong He, Zhengxue Cheng

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Paxini Tech(帕西尼科技)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 AdvDex是一种统一视觉-语言-动作框架,通过OmniShare数据集、JAAS动作空间与领域对抗学习,实现从人类和机器人演示中学习灵巧操作,提升跨实体泛化与技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10756 2026-08-12 cs.RO cs.CV 新提交 81%

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

基于语义三维高斯溅射的开放词汇移动操作具身多模态定位

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Midea Group(美的集团) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文针对家庭场景开放词汇移动操作的目标定位问题,提出整合Semantic-3DGS的具身多模态框架,经50次真实机器人试验,在长 horizon、杂乱场景等任务中优于PointVLA等基线方法,提升了操作鲁棒性。

Comments 9 pages, 11 figures. Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08009 2026-08-11 cs.CV cs.AI 新提交 81%

Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation

基于证据的取证推理:检测与定位多模态媒体篡改

Yichun Yeh, Yiheng Li, Xiaobo Hu, Zhen Lei, Yang Yang

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文针对多模态媒体篡改检测与定位问题,提出基于证据的取证推理框架,结合锚定-验证推理链、可验证奖励系统与模态解耦优势路由机制,实现最优性能与可解释性的统一。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏