arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 21984 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 21984 篇

2303.04016 2023-03-10 cs.RO cs.CV cs.LG 89%

Decoupling Skill Learning from Robotic Control for Generalizable Object Manipulation

Kai Lu, Bo Yang, Bing Wang, Andrew Markham

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV、cs.LG;robotics(comments)

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.07779 2022-01-21 cs.RO cs.CV cs.LG 89%

Look Closer: Bridging Egocentric and Third-Person Views with Transformers for Robotic Manipulation

Rishabh Jangir, Nicklas Hansen, Sambaran Ghosal, Mohit Jain, Xiaolong Wang

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV、cs.LG;robotics(comments)

Comments Accepted in Robotics and Automation Letters Journal (RA-L 2022). Website at https://jangirrishabh.github.io/lookcloser .8 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.03043 2018-10-09 cs.RO cs.AI cs.CV 89%

Robustness via Retrying: Closed-Loop Robotic Manipulation with Self-Supervised Learning

Frederik Ebert, Sudeep Dasari, Alex X. Lee, Sergey Levine, Chelsea Finn

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV;robot learning(comments)

Comments accepted at the Conference on Robot Learning (CoRL) 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22882 2026-08-05 cs.CV cs.RO 版本更新 89%

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation

GEM-4D:用于机器人操作的几何增强视频世界模型

Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) Media Lab and EECS(媒体实验室和电子工程与计算机科学系) MIT(麻省理工学院) Princeton University(普林斯顿大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 机器人操作 :world model(title,abstract);manipulation(title,abstract);分类 cs.RO、cs.CV;robotic(comments)

AI总结 提出GEM-4D,通过注入从预训练几何基础模型蒸馏的密集4D对应监督,增强视频世界模型的几何一致性,并引入逆动力学模块将视频滚动转换为可执行机器人轨迹,提升操作成功率。

Comments Robotic World Model, Video Generative Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25503 2026-06-25 cs.RO cs.CV 新提交 89%

AISPO: Enhancing Depth Reliability for Robotic Manipulation of Non-Lambertian Objects via Affine-Invariant Shape Prior

AISPO: 通过仿射不变形状先验增强非朗伯体物体机器人操作的深度可靠性

Zhiming Chen, Linfang Zheng, Kun Zhang, Hyung Jin Chang, Wei Zhang, Hongyu Yu, Hua Chen

机构 * The Hong Kong University of Science & Technology(香港科技大学) The University of Hong Kong(香港大学) Southern University of Science & Technology(南方科技大学) Zhejiang University(浙江大学) LimX Dynamics

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);robotics(comments,journal_ref);分类 cs.RO、cs.CV

AI总结 提出AISPO深度补全框架,结合多尺度RGB-D特征融合与仿射不变形状先验,提升非朗伯体物体(如透明、高反光表面)的深度可靠性,显著提高机器人抓取成功率。

Comments Published in IEEE Robotics and Automation Letters. 8 pages. Accepted April 2026

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 7996-8003, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00554 2025-07-16 cs.RO cs.AI cs.CE 89%

Differentiable Physics-based System Identification for Robotic Manipulation of Elastoplastic Materials

Xintong Yang, Ze Ji, Yu-Kun Lai

机构 * School of Engineering, Cardiff University(工程学院) School of Computer Science and Informatics, Cardiff University(计算机科学与信息学学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);robotics(comments,journal_ref);分类 cs.RO、cs.AI

Comments Accepted by the Internation Journal of Robotics Research

Journal ref The International Journal of Robotics Research. 2025;0(0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05652 2025-08-26 cs.RO cs.AI cs.CV cs.LG 89%

BEHAVIOR Robot Suite: Streamlining Real-World Whole-Body Manipulation for Everyday Household Activities

Yunfan Jiang, Ruohan Zhang, Josiah Wong, Chen Wang, Yanjie Ze, Hang Yin, Cem Gokmen, Shuran Song, Jiajun Wu, Li Fei-Fei

机构 * Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);navigation(abstract);robotic(abstract)

Comments 9th Conference on Robot Learning (CoRL 2025), Seoul, Korea. Project website: https://behavior-robot-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32027 2026-08-04 cs.RO cs.AI cs.LG 版本更新 89%

Freeform Preference Learning for Robotic Manipulation

自由形式偏好学习用于机器人操作

Marcel Torne, Anubha Mahajan, Abhijnya Bhat, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);robot policy(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出自由形式偏好学习(FPL),通过自然语言定义偏好轴并学习语言条件奖励模型,在长时域操作任务中比稀疏奖励和二元偏好方法提升38个百分点,支持行为组合与测试时策略引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24035 2026-07-29 cs.RO cs.AI cs.LG 版本更新 89%

A context-adaptive policy framework for robust and reactive robotic manipulation via uncertainty-aware imitation learning

一种通过不确定性感知模仿学习实现鲁棒且反应式机器人操作的上下文自适应策略框架

Tim R. Winter, Leonard Klüpfel, Ashok M. Sundaram, Werner Friedl, Maximo A. Roa, Freek Stulp, João Silvério

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究如何生成适应变化的机器人操作策略,基于策略融合与不确定性量化提出上下文自适应框架,用LfD获取策略并结合MoE提升鲁棒性,在多种场景下评估该方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15600 2026-07-08 cs.RO cs.AI cs.CL cs.CV 版本更新 89%

From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation

从被动观察者到主动批评者:强化学习激发机器人操作的过程推理

Yibin Liu, Yaxing Lyu, Daqi Gao, Zhixuan Liang, Weiliang Tang, Shilong Mu, Xiaokang Yang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Xiamen University Malaysia(厦门大学马来西亚分校) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xspark AI

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出PRIMO R1框架,通过强化学习使视频MLLMs成为主动批评者,提升机器人操作中长期任务的监督准确性,实验表明其在过程推理和零样本泛化方面表现优异。

Comments Accepted to ECCV 2026. 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05377 2026-07-07 cs.RO cs.AI cs.CV 新提交 89%

Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation

Cortex:一种用于长视距操作的双向对齐具身智能体框架

Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) USTC(中国科学技术大学)

专题命中 机器人操作 :embodied agent(title,abstract);manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对现有VLA模型长视距任务短板及分层方法语义-运动鸿沟问题,提出双向对齐框架Cortex,标准化技能原语、优化数据与采样策略,提升长视距操作性能与零样本泛化能力。

Comments Project website: https://steinate.github.io/cortex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02845 2026-07-07 cs.RO cs.AI cs.CV 新提交 89%

Differential Amplifier-Inspired AmpAttention for Multi-View Robotic Manipulation

受差分放大器启发的AmpAttention用于多视图机器人操作

Jin Yang, Ping Wei, Nanning Zheng

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能技术国家级重点实验室、人工智能与机器人研究所)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对机器人视图图像问题,提出受模拟电路差分放大器启发的AmpAttention机制,抑制注意力噪声。基于此引入RVAF模型,提升训练效率与任务性能,还扩展为RVAF++,在高精度任务上成果显著。

Comments Accepted by IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20857 2026-06-23 cs.AI cs.LG cs.RO 新提交 89%

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

SignVLA: 通过注意力LSTM和视觉-语言-动作模型实现实时手语引导的机器人操作

Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * University College London(伦敦大学学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出SignVLA框架,通过注意力LSTM网络将手语手势实时转换为语义指令,驱动VLA模型执行机器人操作任务,为听障用户提供无障碍交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08262 2026-06-23 cs.RO cs.AI cs.CV 版本更新 89%

CLAR: Learning 3D Representations for Robotic Manipulation by Fusing Masked Reconstruction with Multi-Level Contrastive Alignment

CLAR: 通过融合掩码重建与多层级对比对齐学习用于机器人操作的3D表示

Wenbo Cui, Chengyang Zhao, Yuhui Chen, Haoran Li, Zhizheng Zhang, Dongbin Zhao, He Wang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carnegie Mellon University(卡内基梅隆大学) Galbot CFCS, School of Computer Science, Peking University(北京大学计算机科学与技术学院CFCS)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出CLAR框架,融合掩码自编码与全局跨模态对比学习,并引入基于可变形注意力的局部自适应对齐机制,解决3D预训练中空间几何与语义细节的权衡问题,在视觉运动策略学习中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17846 2026-06-18 cs.RO cs.CV cs.LG 新提交 89%

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip 技术报告:对齐解锁机器人操作基础模型的规模

Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen

机构 * Qwen Team(Qwen团队)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出 Qwen-RobotManip,通过统一的对齐框架(表示、运动和行为维度)实现多源异构操作数据的大规模协同训练,构建约38,100小时预训练语料,在零样本指令跟随、跨本体迁移等泛化能力上超越先前模型。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18617 2026-05-19 cs.RO cs.AI cs.CV 89%

ManiSoft: Towards Vision-Language Manipulation for Soft Continuum Robotics

ManiSoft: 向视觉-语言操控的柔软连续机器人迈进

Ziyu Wei, Luting Wang, Chen Gao, Li Wen, Si Liu

机构 * Beihang University(北京航空航天大学) National University of Singapore(新加坡国立大学) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

专题命中 机器人操作 :manipulation(title,abstract);robotics(title);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出ManiSoft基准,用于研究柔软连续机器人的视觉-语言操控,通过定制模拟器结合真实柔软体动力学和丰富的接触交互,定义了四个任务以展示变形控制的不同方面,并通过自动化流程生成6300个多样场景和专家轨迹,评估了三种代表性策略模型的性能。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20200 2026-05-19 cs.RO cs.AI cs.CV 89%

Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation

全局先验与局部一致性:双内存增强的视觉-语言-动作模型用于高效机器人操作

Zaijing Li, Bing Hu, Rui Shao, Gongwei Chen, Dongmei Jiang, Pengwei Xie, Jianye Hao, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) PengCheng Laboratory(鹏城实验室) Shenzhen Loop Area Institute(深圳河套学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出OptimusVLA模型,通过引入全局先验内存和局部一致性内存,解决机器人操作中动作生成效率低和鲁棒性差的问题,从而在多个基准测试中实现了更高的成功率和更快的推理速度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19102 2026-05-19 cs.RO cs.AI cs.CV 89%

FUNCanon: Learning Pose-Aware Action Primitives via Functional Object Canonicalization for Generalizable Robotic Manipulation

FUNCanon: 通过功能对象规范化学习姿态感知的动作原语以实现通用的机器人操作

Hongli Xu, Lei Zhang, Xiaoyue Hu, Boyang Zhong, Kaixin Bai, Zoltán-Csaba Márton, Zhenshan Bing, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院TAMS(多模态系统技术)) Technical University of Munich(慕尼黑技术大学) Agile Robots SE(敏捷机器人有限公司)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出FUNCanon框架,通过功能对象规范化学习姿态感知的动作原语,以实现通用的机器人操作,该方法将长周期操作任务分解为由主体、动词和对象定义的动作片段,从而提升策略的可组合性和可重用性。

Comments project website: https://sites.google.com/view/funcanon, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00990 2026-05-14 cs.RO cs.AI cs.CV 89%

Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations

通过模仿生成视频实现机器人操作

Shivansh Patel, Shraddhaa Mohan, Hanlin Mai, Unnat Jain, Svetlana Lazebnik, Yunzhu Li

机构 * UIUC(伊利诺伊大学香槟分校) UC Irvine(加州大学尔湾分校) Columbia University(哥伦比亚大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出RIGVid系统,通过模仿AI生成视频使机器人完成复杂操作任务,无需物理示范或特定机器人训练。系统利用视频扩散模型生成潜在示范视频,并通过视觉语言模型筛选符合指令的视频,再通过6D姿态跟踪器提取轨迹并映射到机器人。实验表明生成视频效果与真实示范相当,且性能随生成质量提升。

Comments In ICLR 2026. Website: https://rigvid-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15872 2026-05-08 cs.RO cs.CV cs.LG 89%

MARVL: Multi-Stage Guidance for Robotic Manipulation via Vision-Language Models

MARVL:通过视觉-语言模型实现机器人操作的多阶段引导

Xunlan Zhou, Xuanlin Chen, Shaowei Zhang, ShengHua Wan, Xiaohai Hu, Lei Yuan, De-chuan Zhan

机构 * School of Intelligent Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, School of Artificial Intelligence, Nanjing University, China(南京大学新型软件技术国家实验室,人工智能学院) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) MACS Lab, University of Washington(华盛顿大学MACS实验室)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出MARVL,通过视觉-语言模型实现机器人操作的多阶段引导,解决传统密集奖励函数设计中的问题,提升样本效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08548 2026-04-07 cs.RO cs.AI cs.LG 89%

From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation

从感知到行动:弥合推理与决策以实现机器人操作

Yifu Yuan, Haiqin Cui, Yibin Chen, Zibin Dong, Fei Ni, Longxin Kou, Jinyi Liu, Pengyi Li, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出FSD模型,通过空间关系推理生成中间表示,提升机器人操作的泛化能力,在8个基准测试中表现优异,且在零样本任务中实现显著性能提升。

Comments Published as a conference paper at ICLR 2026. Our project homepage: https://embodied-fsd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00726 2026-03-10 cs.RO cs.AI cs.LG 89%

CroSTAta: Cross-State Transition Attention Transformer for Robotic Manipulation

CroSTAta: 用于机器人操作的跨状态转换注意力变换器

Giovanni Minelli, Giulio Turrisi, Victor Barasuol, Claudio Semini

机构 * Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 CroSTAta通过引入状态转换注意力机制提升机器人操作策略的鲁棒性和时间推理能力。

Comments Code and data available at https://github.com/iit-DLSLab/croSTAta

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08188 2025-12-10 cs.RO cs.AI cs.CV 89%

Embodied Tree of Thoughts: Deliberate Manipulation Planning with Embodied World Model

具身思维树:基于具身世界模型的 deliberative 操控规划

Wenjiang Xu, Cindy Wang, Rui Fang, Mingkang Zhang, Lusong Li, Jing Xu, Jiayuan Gu, Zecui Zeng, Rui Chen

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tsinghua University(清华大学) JD Explore Academy(京东探索学院) ShanghaiTech University(上海科技大学) Nanjing University(南京大学)

专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 EToT通过基于物理的交互数字双胞胎实现具身世界模型,结合先验分支和反思分支机制,提升机器人操控规划的物理一致性和鲁棒性。

Comments Website at https://embodied-tree-of-thoughts.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22780 2025-12-01 cs.RO cs.AI cs.CV 89%

Distracted Robot: How Visual Clutter Undermine Robotic Manipulation

分心的机器人:视觉杂乱如何损害机器人操作

Amir Rasouli, Montgomery Alban, Sajjad Pakdamansavoji, Zhiyuan Li, Zhanguang Zhang, Aaron Wu, Xuan Zhao

机构 * Huawei Technologies Canada(华为技术加拿大)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本研究提出了一种评估协议,从心理学物理角度评估机器人操作在杂乱环境中的性能,发现杂乱度对性能影响显著,且不同策略对杂乱的敏感性不同。

Comments 12 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18950 2025-11-25 cs.RO cs.CV cs.LG 89%

Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation

Compressor-VLA:基于指令的视觉标记压缩用于高效的机器人操作

Juntao Gao, Feiyang Ye, Jing Zhang, Wenjing Qian

机构 * School of Information Science and Technology, Beijing University of Technology(信息科学与技术学院,北京理工大学) LiAuto Inc.(LiAuto公司) Beijing Key Laboratory of Computational Intelligence and Intelligent System, Beijing University of Technology(计算智能与智能系统北京市重点实验室,北京理工大学)

专题命中 机器人操作 :robotic(title,abstract);manipulation(title);embodied AI(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 Compressor-VLA通过指令引导的视觉标记压缩,提升机器人操作的效率与精度。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15874 2025-11-19 cs.RO cs.AI cs.CV 89%

Spatial Policy: Guiding Visuomotor Robotic Manipulation with Spatial-Aware Modeling and Reasoning

Yijun Liu, Yuwei Liu, Yuan Meng, Jieheng Zhang, Yuwei Zhou, Ye Li, Jiacheng Jiang, Kangye Ji, Shijia Ge, Zhi Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京理工大学) Guangzhou University(广州大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05314 2025-11-14 cs.RO cs.AI cs.CV 89%

ManipDreamer3D : Synthesizing Plausible Robotic Manipulation Video with Occupancy-aware 3D Trajectory

Ying Li, Xiaobao Wei, Xiaowei Chi, Yuming Li, Zhongyu Zhao, Hao Wang, Ningning Ma, Ming Lu, Sirui Han, Shanghang Zhang

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV

Comments 7pages; 7figures; 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15530 2025-11-04 cs.RO cs.CV cs.LG 89%

VO-DP: Semantic-Geometric Adaptive Diffusion Policy for Vision-Only Robotic Manipulation

Zehao Ni, Yonghao He, Lingfeng Qian, Jilei Mao, Fa Fu, Wei Sui, Hu Su, Junran Peng, Zhipeng Wang, Bin He

机构 * D-Robotics(D机器人) National Key Laboratory of Autonomous Intelligent Unmanned Systems(国家级自主智能无人机系统实验室) University of Science and Technology Beijing(北京科技大学) State Key Laboratory of Multimodal Artificial Intelligence System (MAIS) Institute of Automation of Chinese Academy of Sciences(多模态人工智能系统(MAIS)实验室,中国科学院自动化研究所) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心) Shanghai Institute of Intelligent Science and Technology, Tongji University(上海智能科学技术研究院,同济大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27558 2025-11-03 cs.RO cs.AI cs.LG 89%

Toward Accurate Long-Horizon Robotic Manipulation: Language-to-Action with Foundation Models via Scene Graphs

Sushil Samuel Dinesh, Shinkyu Park

机构 * Department of Electrical and Computer Engineering, King Abdullah University of Science and Technology (KAUST)(电气与计算机工程系,国王 Abdullah 科学与技术大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24261 2025-10-29 cs.RO cs.AI cs.CV 89%

DynaRend: Learning 3D Dynamics via Masked Future Rendering for Robotic Manipulation

Jingyi Tian, Le Wang, Sanping Zhou, Sen Wang, Jiayi Li, Gang Hua

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏