arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-27 至 2026-04-27 共收录 38 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2503.05231 2026-04-27 cs.RO cs.AI 89%

Kaiwu: A Multimodal Manipulation Dataset and Framework for Robot Learning and Human-Robot Interaction

Kaiwu:一种用于机器人学习和人机交互的多模态操控数据集和框架

Shuo Jiang, Haonan Li, Ruochen Ren, Yanmin Zhou, Zhipeng Wang, Bin He

专题命中 机器人学习 :robot learning(title,abstract);manipulation(title,abstract);robotics(comments,journal_ref);分类 cs.RO、cs.AI

AI总结 本文提出Kaiwu多模态数据集,解决复杂装配场景中缺失的真实同步多模态数据问题,通过20名受试者和30个交互对象,记录11,664个整合动作实例,支持机器人学习、精细操作、人类意图研究和人机协作。

Comments 8 pages, 5 figures, Submitted to IEEE Robotics and Automation Letters (RAL)

Journal ref IEEE Robotics and Automation Letters, vol. 10, no. 11, pp. 11482-11489, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 11 篇

2604.22363 2026-04-27 cs.RO cs.AI 86%

LeHome: A Simulation Environment for Deformable Object Manipulation in Household Scenarios

LeHome:一种用于家庭场景中可变形物体操控的仿真环境

Zeyi Li, Yushi Yang, Shawn Xie, Kyle Xu, Tianxing Chen, Yuran Wang, Zhenhao Shen, Yan Shen, Yue Chen, Wenjun Li, Yukun Zheng, Chaorui Zhang, Siyi Lin, Fei Teng, Hongjun Yang, Ming Chen, Steve Xie, Ruihai Wu

机构 * Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Lightwheel The University of Hong Kong(香港大学)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 LeHome旨在解决家庭场景中可变形物体操控的挑战,提供高保真动态和真实交互,支持多种机器人形态,聚焦低成本机器人,实现家庭任务的端到端评估。

Comments ICRA2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22102 2026-04-27 cs.RO cs.AI cs.LG 85%

Wiggle and Go! System Identification for Zero-Shot Dynamic Rope Manipulation

Wiggle and Go! 系统识别用于零样本动态绳索操作

Arthur Jakobsson, Abhinav Mahajan, Karthik Pullalarevu, Krishna Suresh, Yunchao Yao, Yuemin Mao, Bardienus Duisterhof, Shahram Najam Syed, Jeffrey Ichnowski

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出Wiggle and Go!系统,通过学习模拟先验知识实现零样本动态绳索操作,提升任务执行精度与效率,实验显示其在绳索任务中的表现优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08027 2026-04-27 cs.LG cs.AI cs.CV cs.RO 81%

LLMPhy: Parameter-Identifiable Physical Reasoning Combining Large Language Models and Physics Engines

LLMPhy: 结合大语言模型和物理引擎的参数可识别物理推理

Anoop Cherian, Radu Corcodel, Siddarth Jain, Diego Romeres

机构 * Mitsubishi Electric Research Labs (MERL)(三菱电机研究实验室)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 LLMPhy通过整合大语言模型与物理引擎,解决复杂物理推理中参数识别问题,提出数字孪生构建方法,引入新数据集验证性能,实现更准确的参数恢复与稳定收敛。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22283 2026-04-27 cs.RO 79%

A Kinematic Analysis of Palm Degrees of Freedom for Enhancing Thumb Opposability in Robotic Hands

手掌自由度的运动学分析:增强机器人手部拇指对握能力

HyoJae Kang, Yeong Jae Park, Hyunmok Jung, Joonho Lee, Dong Il Park

机构 * Advanced Robotics Research Center, Korea Institute of Machinery & Materials (KIMM)(韩国机械材料研究院先进机器人研究中心)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO

AI总结 本文通过分析手掌自由度对拇指对握能力的影响,提出了一种量化评估方法,证明手掌自由度能有效提升环指和小指的对握能力,但受限情况下需权衡冗余度与工作空间扩展。

Comments This manuscript has been submitted for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21898 2026-04-27 cs.RO cs.AI 73%

Flexible Multitask Learning with Factorized Diffusion Policy

灵活的多任务学习与因子化扩散策略

Chaoqi Liu, Haonan Chen, Sigmund H. Høeg, Shaoxiong Yao, Yunzhu Li, Kris Hauser, Yilun Du

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Norwegian University of Science and Technology(挪威科学与技术大学) Columbia University(哥伦比亚大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种因子化扩散策略框架,通过将复杂动作分布分解为多个专用扩散模型,提升多任务学习的灵活性和适应性,实验证明其在仿真和现实机器人任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14831 2026-04-27 cs.CV cs.LG cs.RO 67%

Recent Advances in Multi-Agent Human Trajectory Prediction: A Comprehensive Review

多智能体人类轨迹预测的最新进展:综合性综述

Céline Finet, Stephane Da Silva Martins, Jean-Bernard Hayet, Ioannis Karamouzas, Javad Amirian, Sylvie Le Hégarat-Mascle, Julien Pettré, Emanuel Aldea

机构 * INRIA Rennes(INRIA里昂) SATIE - CNRS Université Paris-Saclay(SATIE-CNRS巴黎-萨克莱大学) Centro de Investigación en Matemáticas Guanajuato, México(瓜尼亚托数学研究所,墨西哥) University of California, Riverside(加州大学河滨分校) Sorbonne Université, Paris(索邦大学,巴黎) Department of Computer Science(计算机科学系)

专题命中 机器人操作 :navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 综述近期深度学习在多智能体轨迹预测中的进展,聚焦2020-2025年研究,分类讨论架构设计、输入表示及预测策略,并强调ETH/UCY基准测试中的模型评估及未来研究方向。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22562 2026-04-27 cs.LG cs.AI cs.CV cs.DC 67%

Data-Free Contribution Estimation in Federated Learning using Gradient von Neumann Entropy

在联邦学习中使用梯度von Neumann熵进行无数据贡献估计

Asim Ukaye, Mubarak Abdu-Aguye, Nurbek Tastan, Karthik Nandakumar

机构 * MBZUAI, UAE(马布里克大学人工智能研究所,阿联酋) Michigan State University, USA(密歇根州立大学,美国)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出无数据的联邦学习贡献估计方法,通过最终层更新的矩阵von Neumann熵衡量信息多样性,提出SpectralFed和SpectralFuse两种方案,验证熵值与客户端准确性的高相关性。

Comments 10 pages, 4 figures, 4 pages Appendix, 6 figures in Appendix. To appear in CVPR 2026 FedVision Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20834 2026-04-27 cs.RO 57%

PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance

PokeVLA:通过全面的世界知识指导赋能便携式视觉-语言-动作模型

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Senyu Fei, Pengfei Li, Yinfeng Gao, Zebin Xing, Yilun Chen, Qichao Zhang, Haoran Li, Wenchao Ding

机构 * CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人实验室) Tsinghua University(清华大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出PokeVLA,一种轻量但强大的具身体验模型,通过预训练视觉语言模型和多视角目标感知学习提升机器人操作效率与空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22166 2026-04-27 cs.CL 50%

Fine-Grained Analysis of Shared Syntactic Mechanisms in Language Models

语言模型中共享句法机制的细粒度分析

Ryoma Kumon, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) RIKEN(日本理化学研究所) Tohoku University(东北大学)

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究通过细粒度分析探讨语言模型在不同句法结构中是否共享神经机制,发现填词-缺口依赖在早期至中期层有高度局部化的共享机制,而否定极性项目许可则无统一机制。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20687 2026-04-27 physics.optics cond-mat.mes-hall nucl-ex physics.atom-ph quant-ph 50%

Toward nanophotonic platforms for solid-state $^{229}$Th nuclear clocks

迈向固态$^{229}$Th核钟的纳米光子平台

Sandro Kraemer, Karen Mamian, Toby Bi, Shun Fujii, Jan de Haan, Harshith Babu, Arno Claessens, Rafael Ferrer Garcia, Fedor Ivandikov, Piet Van Duppen, Andreas Dragoun, Christoph E. Düllmann, Christoph Marquardt, Ulrich Wahl, Bart Kuyken, Thorsten Schumm, Pascal Del'Haye, Lino M. C. Pereira, Georgy A. Kazakov, Kasper Van Gasse, Charles Roques-Carmes

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出一种纳米光子平台,利用$^{229}$Th低能异构跃迁实现固态核钟,通过耦合钍核与受限光学模式增强核激发率,展示了一种实现芯片级固态频率标准的可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08733 2026-04-27 physics.optics 50%

Topological Control of Chirality and Spin with Structured Light

拓扑控制手性和自旋

Light Mkhumbuza, Pedro Ornelas, Angela Dudley, Isaac Nape, Kayn A. Forbes

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文通过结构光的拓扑特性实现对自旋角动量和光学手性的精确控制,揭示了自由空间中的光学霍尔效应,并提出两种拓扑机制。

Journal ref Light Sci Appl 15, 214 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 6 篇

2602.06974 2026-04-27 cs.RO cs.CV 84%

FeudalNav: A Simple Framework for Visual Navigation

FeudalNav: 一种用于视觉导航的简单框架

Faith Johnson, Bryan Bo Cao, Shubham Jain, Ashwin Ashok, Kristin Dana

机构 * Rutgers University(罗格斯大学) Stony Brook University(石溪大学) Georgia State University(佐治亚州立大学)

专题命中 具身导航 :navigation(title,abstract);robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出FeudalNav框架,通过分层结构实现导航决策,利用视觉相似性构建隐空间记忆模块,无需地图即可在新环境中导航,并通过人机交互提升导航性能。

Comments 8 Pages, 6 figures and 4 tables. arXiv admin note: substantial text overlap with arXiv:2411.09893, arXiv:2402.12498

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22093 2026-04-27 cs.CV eess.IV 83%

FLARE-BO: Fused Luminance and Adaptive Retinex Enhancement via Bayesian Optimisation for Low-Light Robotic Vision

FLARE-BO:通过贝叶斯优化融合亮度和自适应Retinex增强的低光照机器人视觉

Nathan Shankar, Pawel Ladosz, Hujun Yin

机构 * University of Manchester(曼彻斯特大学)

专题命中 具身导航 :robotic(title,abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出FLARE-BO框架,通过贝叶斯优化联合优化八个参数,提升低光照条件下机器人视觉的图像质量与鲁棒性。

Comments 7 pages, 2 tables and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09520 2026-04-27 q-bio.NC cs.AI cs.RO 62%

How attention simplifies mental representations for planning

注意力如何简化心理表征以促进规划

Jason da Silva Castanheira, Nicholas Shea, Stephen M. Fleming

机构 * Department of Experimental Psychology, University College London(伦敦大学实验心理学系) Institute of Philosophy, School of Advanced Study, University of London(伦敦大学哲学研究所) Max Planck UCL Centre for Computational Psychiatry and Ageing Research, University College London(伦敦大学Max Planck UCL计算精神病学与衰老研究中心) Canadian Institute for Advanced Research (CIFAR), Brain, Mind and Consciousness Program(加拿大高级研究研究院(CIFAR)脑、心智与意识项目)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 研究探讨了空间注意力如何影响心理表征的简化过程,发现注意力的自然轮廓能提升规划效率,且个体差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22350 2026-04-27 cs.CV 57%

PoseFM: Relative Camera Pose Estimation Through Flow Matching

PoseFM: 通过流匹配进行相对相机姿态估计

Dominik Kuczkowski, Laura Ruotsalainen

机构 * Department of Computer Science University of Helsinki(计算机科学系 哈尔滨大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出PoseFM框架,将单目帧间视觉里程计转化为生成任务,利用流匹配建模相机运动分布,提升不确定性估计和鲁棒性,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21933 2026-04-27 cs.HC 50%

Not Another EHR: Reimagining Physician Information Needs with Generative AI Technology

不再另一个电子病历:用生成式AI技术重新想象医生信息需求

Ruican Zhong, Jiachen Li, Gary Hsieh, David W. McDonald, Selin S. Everett, Alyssa Unell, Jonathan Carlson, Katie Claveau, Noel Codella, Khalil Malik, Scott Mackie, Eduardo Olvera, Scott Saponas, Eric Horvitz, David Rhew, Jim Weinstein, Jacob Gross, Amanda K. Hall

专题命中 具身导航 :navigation(abstract)

AI总结 本文探讨生成式AI如何通过动态交互支持医生信息需求,通过访谈识别数据导航与合成挑战,讨论面向医生的工作流设计考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19579 2026-04-27 physics.bio-ph physics.chem-ph 50%

Distinct Structural Dynamics of the Semiquinone State Define a Signalling Pathway in Avian Cryptochrome

鸟类隐色素中不同结构动力学定义了一种信号通路

Monika Kish, Suchitra Pradhan, Jessica L. Ramsay, Paloma Munguía Salazar, Jonathan Phillips, Daniel R. Kattnig

专题命中 具身导航 :navigation(abstract)

AI总结 研究通过HDX-MS揭示隐色素在光合作用中的构象变化,发现半醌具有独特的非单调构象特征,为动物导航提供结构信号机制。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 3 篇

2604.22152 2026-04-27 cs.RO 89%

dWorldEval: Scalable Robotic Policy Evaluation via Discrete Diffusion World Model

dWorldEval: 通过离散扩散世界模型实现可扩展的机器人策略评估

Yaxuan Li, Zhongyi Zhou, Yefei Chen, Yaokai Xue, Yichen Zhu

机构 * University of Toronto(多伦多大学)

专题命中 具身推理 :world model(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 本文提出dWorldEval,利用离散扩散世界模型统一处理多模态信息,通过单个Transformer网络实现去噪,并引入稀疏关键帧记忆和进度令牌,提升机器人策略评估的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01907 2026-04-27 cs.CV cs.AI 62%

Lifting Unlabeled Internet-level Data for 3D Scene Understanding

提升互联网级未标记数据用于3D场景理解

Yixin Chen, Yaowei Zhang, Huangyue Yu, Junchao He, Yan Wang, Jiangyong Huang, Hongyu Shen, Junfeng Ni, Shaofei Wang, Baoxiong Jia, Song-Chun Zhu, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

专题命中 具身推理 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文通过设计数据引擎利用互联网未标记视频生成训练数据,提升3D场景理解模型性能,验证了在不同感知粒度任务中的有效性。

Comments CVPR 2026. Project page: https://sv-pp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22618 2026-04-27 cs.LG 57%

Beyond Patient Invariance: Learning Cardiac Dynamics via Action-Conditioned JEPAs

超越患者不变性:通过动作条件化JEPAs学习心脏动力学

Jose Geraldo Fernandes, Luiz Facury, Pedro Robles Dutenhefner, Wagner Meira

机构 * Department of Computer Science(计算机科学系) Universidade Federal de Minas Gerais(巴西联邦大学矿务格里斯矿大学) Belo Horizonte, Brazil(巴西伯洛霍内)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文提出动作条件化世界模型,通过学习疾病进展动力学,区分稳定解剖特征与动态病理力量,提升心电图关键分诊任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 3 篇

2505.13255 2026-04-27 cs.RO 83%

Policy Contrastive Decoding for Robotic Foundation Models

基于机器人基础模型的策略对比解码

Shihan Wu, Xu Luo, Ji Zhang, Junlin Xie, Jingkuan Song, Heng Tao Shen, Lianli Gao

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Southwest Jiaotong University(西南交通大学) Tongji University(同济大学)

专题命中 机器人基础模型 :robotic(title,abstract);robot policy(abstract);分类 cs.RO

AI总结 本文提出Policy Contrastive Decoding方法,通过对比原始与物体遮挡的视觉输入,提升机器人策略的泛化能力,实验表明其在仿真和现实环境中均有效。

Comments ICLR 2026. Project website: https://koorye.github.io/PCD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22519 2026-04-27 cs.RO 70%

Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding

通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型

Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le

机构 * University of Arkansas(阿拉巴马大学) National University of Singapore(新加坡国立大学) TU Wien(维也纳技术大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) University of Stuttgart(斯图加特大学) University of Liverpool(利物浦大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。

Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10698 2026-04-27 cs.CV cs.AI 62%

AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models

AugVLA-3D:基于深度的特征增强用于视觉-语言-动作模型

Zhifeng Rao, Wenlong Chen, Lei Xie, Xia Hua, Dongfu Yin, Zhen Tian, F. Richard Yu

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) School of Information Technology, Carleton University(卡尔顿大学信息技术学院)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出AugVLA-3D框架,通过整合深度估计提升视觉-语言-动作模型的3D特征表示,增强模型在复杂3D环境中的感知与动作预测能力。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 模仿学习与强化学习 3 篇

2604.22558 2026-04-27 cs.LG cs.AI 62%

SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

SOLAR-RL:半在线长 horizon 分配强化学习

Jichao Wang, Liuyang Bian, Yufeng Zhou, Han Xiao, Yue Pan, Guozhi Wang, Hao Wang, Zhaoxiong Wang, Yafei Wen, Xiaoxin Chen, Shuai Ren, Lingfang Zeng

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang Lab(浙江实验室) CUHK MMLab(香港大学多模态实验室) Hubei University(湖北省大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 SOLAR-RL通过整合全局轨迹信息到离线学习中,提升GUI任务的长horizon完成率和鲁棒性,提供高效样本利用的自主导航方案。

Comments 14 pages, 11 figures. Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22081 2026-04-27 cs.LG physics.comp-ph 57%

Insect-inspired modular architectures as inductive biases for reinforcement learning

受昆虫启发的模块化架构作为强化学习的归纳偏差

Anne E. Staples

机构 * Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工大学机械工程系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出了一种模块化强化学习架构,通过分布式电路实现感知编码、方向表示、稀疏联想记忆等功能,以应对动态竞争的行为目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17706 2026-04-27 cs.RO 57%

OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL

OmniVLA-RL:具备空间理解与在线强化学习的视觉-语言-动作模型

Haoxiang Jie, Yaoyuan Yan, Xiangyu Wei, Kailin Wang, Hongjie Yan, Zhiyou Heng, Daocheng Chen

机构 * AI Lab, Country Garden Services(国家花园服务人工智能实验室) Omni AI(奥米尼人工智能) VBot East China Normal University(东华大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.RO

AI总结 本文提出OmniVLA-RL模型,通过混合Transformer架构整合推理、空间和动作专家,结合Flow-GSPO提升动作精度与训练稳定性,在LIBERO和LIBERO-Plus基准上表现优异,克服了现有VLA模型的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 机器人数据与评测 7 篇

2604.22551 2026-04-27 cs.RO cs.AI 88%

QDTraj: Exploration of Diverse Trajectory Primitives for Articulated Objects Robotic Manipulation

QDTraj:探索多样化轨迹原语用于机械臂物体操控

Mathilde Kappel, Mahdi Khoramshahi, Louis Annabi, Faiz Ben Amar, Stéphane Doncieux

机构 * Institute of Intelligent Systems and Robotics, CNRS, Sorbonne University(智能系统与机器人研究所,国家科学研究中心,索邦大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(title);robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出QDTraj方法,通过生成多样化的低级轨迹原语,提升机器人在开放环境中操控多样化机械臂物体的能力,实验表明其在模拟和现实部署中均表现优异。

Comments 8 pages, 7 figures, webpage: https://kappel.web.isir.upmc.fr/trajectory_primitive_website

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22235 2026-04-27 cs.RO cs.AI cs.LG 87%

Learning-augmented robotic automation for real-world manufacturing

基于学习的机器人自动化用于现实世界制造

Yunho Kim, Quan Nguyen, Taewhan Kim, Youngjin Heo, Joonho Lee

机构 * Neuromeka Co., Ltd(Neuromeka公司)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种结合学习任务控制器和神经3D安全监控器的混合系统,用于现实制造环境中的机器人自动化,实现了连续作业和高质量产品输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22499 2026-04-27 cs.LG cs.RO 62%

Decoding High-Dimensional Finger Motion from EMG Using Riemannian Features and RNNs

通过Riemannian特征和RNNs解码高维手指运动

Martin Colot, Cédric Simar, Guy Cheron, Ana Maria Cebolla Alvarez, Gianluca Bontempi

机构 * Neuromove, ULB Neuroscience Institute, ULB, Brussels, Belgium(Neuromove,ULB神经科学研究所,ULB,布鲁塞尔,比利时) WEL Research Institute, Wavre, Belgium(WEL研究机构,瓦尔特,比利时)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出TRR模型,利用多带Riemannian协方差特征序列解码手指运动,实现高维手指运动的连续EMG到运动学回归,提升了跨受试者和内受试者评估的精度。

Comments 13 pages, 10 figures, 3 tables, links to a GitHub, a dataset on Zenodo, and two videos on YouTube

详情

展开后加载摘要…

URL PDF HTML 收藏