arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 21984 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 21984 篇

2210.07442 2022-10-17 cs.RO cs.CV 87%

Frame Mining: a Free Lunch for Learning Robotic Manipulation from 3D Point Clouds

Minghua Liu, Xuanlin Li, Zhan Ling, Yangyan Li, Hao Su

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.CV;robot learning(comments)

Comments Conference on Robot Learning (CoRL) 2022; Project Website: https://colin97.github.io/FrameMining/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17030 2026-06-18 cs.CV 新提交 87%

Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation

Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界模型

Jie Zhang, Xiaoyue Chen, Anzhe Chen, Dayiheng Liu, Deqing Li, Gengze Zhou, Hale Yin, Haoqi Yuan, Haoyang Li, Jiahao Li, Jiazhao Zhang, Jingren Zhou, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Pei Lin, Qihang Peng, Shengming Yin, Tianhe Wu, Tianyi Yan, Xiao Xu, Yan Shu, Yanran Zhang, Ye Wang, Yi Wang, Yilei Chen, Yixian Xu, Yiyang Huang, Yuxiang Chen, Zekai Zhang, Zhendong Wang, Zixing Lei, Zhixuan Liang, Zihao Liu, Zikai Zhou, Chenxu Lv, Xiong-Hui Chen, Chenfei Wu

机构 * Qwen Team(Qwen团队)

专题命中 机器人操作 :world model(title,abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 提出Qwen-RobotWorld,一种以自然语言为统一动作接口的语言条件视频世界模型,通过双流MMDiT、大规模具身世界知识语料和渐进式课程训练,在机器人操作、自动驾驶等任务中实现物理一致的未来视觉轨迹预测,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22088 2026-05-12 cs.RO 87%

Force Policy: Learning Hybrid Force-Position Control Policy under Interaction Frame for Contact-Rich Manipulation

力政策:在交互框架下学习混合力-位置控制策略以进行密集接触 manipulation

Hongjie Fang, Shirun Tang, Mingyu Mei, Haoxiang Qin, Zihao He, Jingjing Chen, Ying Feng, Chenxi Wang, Wanxi Liu, Zaixing He, Cewu Lu, Shiquan Wang

机构 * Noematrix Flexiv Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人操作 :manipulation(title,title_cn);分类 cs.RO

AI总结 本文提出力政策,通过视觉和力反馈实现全局-局部控制,提升接触稳定性和执行质量,适用于复杂接触任务。

Comments accepted by RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15023 2026-04-17 cs.RO 87%

DockAnywhere: Data-Efficient Visuomotor Policy Learning for Mobile Manipulation via Novel Demonstration Generation

DockAnywhere: 通过新颖的示范生成实现移动操作的数据高效视觉-运动策略学习

Ziyu Shan, Yuheng Zhou, Gaoyuan Wu, Ziheng Ji, Zhenyu Wu, Ziwei Wang

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学)

专题命中 机器人操作 :manipulation(title,summary_cn);分类 cs.RO

AI总结 本文提出DockAnywhere方法,通过解耦基座运动与不变的 manipulation 技能,提升移动操作在不同 docking 点下的视角泛化能力,实验表明其显著提高了策略成功率和泛化能力。

Comments Accepted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11423 2026-04-14 cs.RO 87%

Dyadic Partnership(DP): A Missing Link Towards Full Autonomy in Medical Robotics

双人合作(DP):迈向医疗机器人完全自主的缺失链接

Nassir Navab, Zhongliang Jiang

专题命中 机器人操作 :robotics(title,abstract);manipulation(abstract);world model(abstract);robotic(abstract)

AI总结 本文提出双人合作(DP)概念,旨在通过智能协作提升医疗机器人自主性,探讨基础模型、意图识别和可视化等关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09051 2026-03-24 cs.RO 87%

Cutting the Cord: System Architecture for Low-Cost, GPU-Accelerated Bimanual Mobile Manipulation

断缆:低成本、GPU加速的双臂移动机械臂系统架构

Artemis Shaw, Chen Liu, Justin Costa, Rane Gray, Alina Skowronek, Kevin Diaz, Nam Bui, Nikolaus Correll

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);robot learning(abstract);navigation(abstract)

AI总结 本文提出基于开源XLeRobot的双臂移动机械臂,成本低于1300美元,采用优化机械设计、Tri-Bus电源拓扑和NVIDIA Jetson Orin Nano实现自主操作,提供低成本的机器人研究与教育平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20085 2025-09-03 cs.RO 87%

HERMES: Human-to-Robot Embodied Learning from Multi-Source Motion Data for Mobile Dexterous Manipulation

Zhecheng Yuan, Tianming Wei, Langzhe Gu, Pu Hua, Tianhai Liang, Yuanpei Chen, Huazhe Xu

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院) Peking University(北京大学)

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);navigation(abstract);robotic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10220 2025-03-10 cs.RO cs.AI cs.CV cs.LG 87%

Closed-Loop Open-Vocabulary Mobile Manipulation with GPT-4V

Peiyuan Zhi, Zhiyuan Zhang, Yu Zhao, Muzhi Han, Zeyu Zhang, Zhitian Li, Ziyuan Jiao, Baoxiong Jia, Siyuan Huang

专题命中 机器人操作 :manipulation(title,abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments 6 pages, Accepted at 2025 IEEE ICRA, website: https://come-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07864 2025-03-04 cs.RO cs.AI cs.CV cs.LG 87%

RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation

Songming Liu, Lingxuan Wu, Bangguo Li, Hengkai Tan, Huayu Chen, Zhengyi Wang, Ke Xu, Hang Su, Jun Zhu

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments 10 pages, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06639 2024-12-09 cs.RO cs.AI cs.CV cs.LG 87%

Harmonic Mobile Manipulation

Ruihan Yang, Yejin Kim, Rose Hendrix, Aniruddha Kembhavi, Xiaolong Wang, Kiana Ehsani

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV

Comments More results are on our project site: https://rchalyang.github.io/HarmonicMM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20220 2024-10-29 cs.RO cs.AI cs.CV cs.LG 87%

Neural Fields in Robotics: A Survey

Muhammad Zubair Irshad, Mauro Comi, Yen-Chen Lin, Nick Heppert, Abhinav Valada, Rares Ambrus, Zsolt Kira, Jonathan Tremblay

专题命中 机器人操作 :robotics(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV

Comments 20 pages, 20 figures. Project Page: https://robonerf.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11699 2024-04-19 cs.RO 87%

Retrieval-Augmented Embodied Agents

Yichen Zhu, Zhicai Ou, Xiaofeng Mou, Jian Tang

专题命中 机器人操作 :embodied agent(title,abstract);robotics(abstract);manipulation(abstract);robotic(abstract)

Comments CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04861 2023-04-12 cs.CV cs.AI cs.LG cs.RO 87%

ShapeShift: Superquadric-based Object Pose Estimation for Robotic Grasping

E. Zhixuan Zeng, Yuhao Chen, Alexander Wong

专题命中 机器人操作 :robotic(title,abstract);robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.13251 2022-03-25 cs.RO cs.AI cs.CV cs.LG 87%

Dexterous Imitation Made Easy: A Learning-Based Framework for Efficient Dexterous Manipulation

Sridhar Pandian Arunachalam, Sneha Silwal, Ben Evans, Lerrel Pinto

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18733 2026-01-27 cs.RO cs.AI cs.CV 87%

Advances and Innovations in the Multi-Agent Robotic System (MARS) Challenge

多智能体机器人系统(MARS)挑战的进展与创新

Li Kang, Heng Zhou, Xiufeng Song, Rui Li, Bruno N. Y. Chen, Ziye Wang, Ximeng Meng, Stone Tao, Yiran Qin, Xiaohong Liu, Ruimao Zhang, Lei Bai, Yilun Du, Hao Su, Philip Torr, Zhenfei Yin, Ruihao Gong, Yejun Zeng, Fengjun Zhong, Shenghao Jin, Jinyang Guo, Xianglong Liu, Xiaojun Jia, Tianqi Shan, Wenqi Ren, Simeng Qin, Jialing Yang, Xiaoyu Ma, Tianxing Chen, Zixuan Li, Zijian Cai, Yan Qin, Yusen Qin, Qiangyu Chen, Kaixuan Wang, Zhaoming Han, Yao Mu, Ping Luo, Yuanqi Yao, Haoming Song, Jan-Nico Zaech, Fabien Despinoy, Danda Pani Paudel, Luc Van Gool

机构 * SJTU(上海交通大学) Oxford(牛津大学) USTC(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) CMU(卡内基梅隆大学) HKU(香港大学) Tongji(同济大学) UC San Diego(南加州大学) CUHK-SZ(香港中文大学(深圳)) SYSU(华南理工大学) Harvard(哈佛大学)

专题命中 机器人操作 :robotic(title,abstract);embodied AI(abstract,comments);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 MARS挑战通过多智能体具身规划与控制任务,推动多智能体协作AI系统的发展。

Comments MARS Challenge @ NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI. Challenge page: https://mars-eai.github.io/MARS-Challenge-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18115 2024-06-27 cs.RO cs.AI cs.CV 87%

Open-vocabulary Mobile Manipulation in Unseen Dynamic Environments with 3D Semantic Maps

Dicong Qiu, Wenzong Ma, Zhenfu Pan, Hui Xiong, Junwei Liang

专题命中 机器人操作 :manipulation(title,abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments Open-vocabulary, Mobile Manipulation, Dynamic Environments, 3D Semantic Maps, Zero-shot, LLMs, VLMs, 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10272 2023-06-28 cs.RO cs.AI cs.LG 87%

Demonstrating Large-Scale Package Manipulation via Learned Metrics of Pick Success

Shuai Li, Azarakhsh Keipour, Kevin Jamieson, Nicolas Hudson, Charles Swan, Kostas Bekris

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract,comments);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

Comments Robotics: Science and Systems (RSS 2023) conference, July 10 - 14, 2023, Daegu, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.09044 2021-02-19 cs.RO cs.AI cs.CV 87%

VisuoSpatial Foresight for Multi-Step, Multi-Task Fabric Manipulation

Ryan Hoque, Daniel Seita, Ashwin Balakrishna, Aditya Ganapathi, Ajay Kumar Tanwani, Nawid Jamali, Katsu Yamane, Soshi Iba, Ken Goldberg

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract,comments);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments Robotics: Science and Systems (RSS) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03701 2026-08-05 cs.RO cs.AI 新提交 87%

LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation

LiLa-WAM:用于机器人操控的轻量级隐式推理世界-动作模型

Fan Yang, Yuting Su, Xiaobo Wang, Yuncheng You, Fugui Fan, Yuting Wu, Minghui Wu, Chenxu Zhao, JiaHong Ning, Peiguang Jing

专题命中 机器人操作 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.AI

AI总结 本研究提出轻量级世界-动作模型LiLa-WAM,通过联合未来状态预测与动作生成的紧凑隐式空间设计实现端到端单GPU训练,结合视觉转换令牌完成任务指定,在RoboTwin等任务上取得90.48%的成功率,提升了机器人操控的效率与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15641 2026-07-20 cs.RO cs.AI 新提交 87%

IMBench: A Benchmark for Intuitive Robotic Manipulation

IMBench:直观机器人操作的基准测试

Anurag Maurya, Sukhvansh Jain, Prajwal Avhad, Gautham Balachandran, Ziyi Zhou, Atharva Kshirsagar, Satyam Singh, Bowen Li. Rishabh Mukund, Ritul Singh, Jatin Vira, Suvonil Chatterjee, Devesh K. Jha

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.AI

AI总结 IMBench旨在评估直观机器人操作这一综合能力,其任务含物理结构推断与动作序列生成。通过35个任务等进行实验,发现视觉语言模型和视觉 - 语言 - 动作模型的不足,为评估和发展物理智能提供基准。

Comments Accepted to SemRob Workshop, RSS 2026. Project Website: https://imbench.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10172 2026-07-14 cs.RO cs.LG 新提交 87%

On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation

工业机器人操作中视觉语言动作模型的LoRA微调效率研究

Finn Ferchau, Daniel Pommer, Cristian Axenie

机构 * Technische Hochschule Nürnberg Georg Simon Ohm(纽伦堡乔治·西蒙·欧姆应用技术大学) Siemens AG(西门子股份公司) Fraunhofer Institute for Integrated Circuits (IIS)(弗劳恩霍夫集成电路研究所)

专题命中 机器人操作 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.LG

AI总结 研究工业机器人操作中VLA模型的LoRA微调效率,通过在四个精密装配任务上评估,发现特定LoRA配置不比FFT差,r = 32时性能饱和,均匀分配即可,冻结VLM等会降性能,该方法可减少VRAM且无性能损失。

Comments 12 pages, 5 figures, 3 tables. Accepted at the International Conference on Artificial Neural Networks (ICANN 2026); to appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15620 2026-07-01 cs.CV cs.RO 版本更新 87%

Towards Generalizable Robotic Manipulation in Dynamic Environments

面向动态环境的通用机器人操作

Heng Fang, Shangru Li, Shuhan Wang, Xuanyang Xi, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.CV

AI总结 本文提出DOMINO数据集与基准,通过实验评估现有VLA模型,提出PUMA架构提升动态感知能力,实现动态任务中的高成功率。

Comments Accepted to ECCV 2026. Project Page: https://h-embodvis.github.io/DOMINO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16470 2026-06-16 cs.CV cs.RO 新提交 87%

Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands

解耦的以对象为中心的视频理解用于生成机器人操作指令

Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang, Ziyan Gao, Xiem HoangVan, Nak Young Chong

机构 * School of Information Science, Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学信息科学学院) University of Engineering and Technology, Vietnam National University(越南国立大学工程与技术大学) Department of Robotics, Hanyang University(汉阳大学机器人学系)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.CV

AI总结 提出解耦动作识别与对象选择的框架,通过TSM分类动作和对象选择算法识别任务相关对象,结合VLM生成精确指令,在Something-Something V2上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06041 2026-06-05 cs.RO cs.AI cs.NE 87%

Sample-efficient Low-level Motion Planning for Robotic Manipulation Tasks via Zero-shot Transfer Learning

通过零样本迁移学习实现机器人操作任务的样本高效低级运动规划

Yuanzhi He, Victor Romero-Cano, José J. Patiño, Juan David Hernández, William Sawtell, Gualtiero Colombo

机构 * School of Computer Science & Informatics, Cardiff University, Cardiff, UK(计算机科学与信息学系,卡迪夫大学,卡迪夫,英国)

专题命中 机器人操作 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.AI

AI总结 提出iCEM+TL框架,通过迁移学习和奖励重塑提高复杂操作任务的成功率,仿真中提升高达23%,并在真实机器人上验证。

Comments 12 pages, 5 figures, International Conference on Artificial Neural Networks (ICANN) 2026 conference accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25547 2026-05-26 cs.RO cs.CV 87%

TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation

TapSampling:基于任务进度理解验证器的推理时采样方法用于机器人操作

Sizhe Zhao, Shengping Zhang, Shuo Yang, Weiyu Zhao, Shuigen Wang, Xiangyang Ji

机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) Harbin Institute of Technology (Weihai) Qingdao Research Institute, China(哈尔滨工业大学(威海)青岛研究院,中国) Iray Technology co., Ltd., Shandong, China(Iray科技有限公司,山东,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 机器人操作 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.CV

AI总结 提出TapSampling框架,通过Action-VAE在低维潜空间采样候选动作,并利用任务进度预测验证器选择最优动作,无需微调即可提升多种通用策略的性能。

Comments ICML 2026. Project Page: https://aipixel.github.io/TapSampling/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11383 2026-05-13 cs.RO cs.AI 87%

Vision-Based Hand Shadowing for Robotic Manipulation via Inverse Kinematics

基于视觉的手影法用于机器人操作的逆运动学

Hendrik Chiche, Antoine Jamme, Trevor Rigoberto Martinez, Gabriel Gomes

机构 * OMGrab Inc.(OMGrab公司) University of California, Berkeley(加州大学伯克利分校) Fung Institute for Engineering Leadership(工程领导力基金会)

专题命中 机器人操作 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于单目RGB-D相机的逆运动学映射方法,用于将人类手部动作转化为机器人关节指令,通过实验验证了其在结构化和非结构化环境中的有效性。

Comments v2: accepted at IEEE Access (2026); minor revisions per peer review, added WiLoR occlusion-mitigation experiment, error analysis, EMA ablation, and author photos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11674 2026-05-12 cs.RO cs.AI 87%

AffordSim: A Scalable Data Generator and Benchmark for Affordance-Aware Robotic Manipulation

AffordSim:一种可扩展的数据生成器和基准,用于面向 affordance 的机器人操作

Mingyang Li, Haofan Xu, Haowen Sun, Xinzhe Chen, Sihua Ren, Liqi Huang, Xinyang Sui, Chenyang Miao, Jiawei Ye, Qiongjie Cui, Zeyang Liu, Xingyu Chen, Xuguang Lan

机构 * School of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.AI

AI总结 AffordSim 通过整合开放词汇 3D affordance 预测,解决了机器人操作中接触信息获取的挑战,实现了高成功率的轨迹生成和跨仿真到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05186 2026-03-19 cs.RO cs.CV 87%

Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation

学习感知与行动:面向机器人操作的任务感知虚拟视角探索

Yongjie Bai, Zhouxia Wang, Yang Liu, Kaijun Luo, Yifan Wen, Mingtong Dai, Weixing Chen, Ziliang Chen, Lingbo Liu, Guanbin Li, Liang Lin

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Nanyang Technological University(南洋理工大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) X-Era AI Lab(X-Era AI实验室)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.CV

AI总结 本文提出TVVE框架,通过动态选择任务相关虚拟视角和重构场景表示,提升机器人操作在遮挡和跨任务迁移中的性能,实验验证其鲁棒性。

Comments 24 pages, 15 figures, Project page: https://hcplab-sysu.github.io/TAVP, Code: https://github.com/HCPLab-SYSU/TAVP.git, Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22514 2026-02-27 cs.RO cs.AI cs.SY eess.SY 87%

SignVLA: A Gloss-Free Vision-Language-Action Framework for Real-Time Sign Language-Guided Robotic Manipulation

SignVLA:一种无 gloss 的视觉-语言-动作框架,用于实时 sign language 引导的机器人操作

Xinyu Tan, Ningwei Bai, Harry Gardener, Zhengyang Zhong, Luoyu Zhang, Liuhaichen Yang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * Department of Computer Science, University College London (UCL)(计算机科学系,伦敦大学学院(UCL))

专题命中 机器人操作 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.AI

AI总结 SignVLA 提出了一种无 gloss 的视觉-语言-动作框架,用于实时手语引导的机器人操作,通过几何归一化、时间平滑和词汇精炼提升多模态交互的稳定性和可扩展性。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01115 2026-02-16 cs.RO cs.CV 87%

KAN We Flow? Advancing Robotic Manipulation with 3D Flow Matching via KAN & RWKV

KAN We Flow? 通过KAN与RWKV实现3D操作的机器人操控进步

Zhihao Chen, Yiyuan Ge, Ziyang Wang

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学智能工程与自动化学院) Beijing Hydrogen Intelligence Technology Co. Ltd.(北京氢能智能科技有限公司) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.CV

AI总结 KAN-We-Flow通过结合RWKV和KAN技术,实现轻量高效的3D机器人操作策略,显著提升性能与效率。

Comments Accepted By ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏